岗位职责
你将参与下一代音视频生成MOE大模型的研发,包括 text-to-audio+video、image-to-audio+video、multi-reference generation、video-to-video、long video generation等多模态多任务的统一生成模型研发。你会和数据、评测、平台、内容团队一起,以模型全面能力提升为核心目标。
职位要求
- 2027届本科及以上学历,熟悉 PyTorch以及分布式训练框架,理解并有实际经验Diffusion model、MOE、VAE、SFT、RLHF、Distillation 中至少两部分;
- 有多条件参考/图像/视频/音频生成、编辑、超分、插帧、人物一致性、多镜头、音画同步等相关经验;能主动设计实验、分析失败案例,并优化实验结果;
- 能独立负责一个子方向,如数据配比、训练 recipe、编辑能力、多模态控制、训练和推理优化。 加分项: 大规模生成模型训练经验; 熟悉 CUDA/Triton、DeepSpeed、FSDP、Megatron、Ray、Slurm; 有高质量开源项目、论文、demo 或工业落地经验。