岗位职责
- 负责基于DiT/Diffusion的视频生成模型研发与后训练优化,提升画质、美感、运动、一致性和指令响应等效果;
- 负责生成模型RL后训练框架及多模态Reward Model/Verifier的设计与迭代,推动RLHF、ReFL、GRPO、DPO等方法在图像/视频生成中的应用;
- 负责后训练全链路建设与业务落地,包括数据构建、模型评测、训练加速、推理优化、蒸馏压缩,并探索视频生成、交互编辑、音视频联合生成、Agent RL等方向。
职位要求
- 1-5年计算机视觉/多模态方向研究或实践经验,熟悉以下一个或多个方向: 1)生成模型后训练(如RLHF、DPO、GRPO、Reward-based Optimization等) 2)Reward Model/Verifier构建 3)Agentic RL以及大规模训练优化;
- 具备扎实的工程实现能力,熟练使用Python/PyTorch,有分布式训练、性能优化、问题定位与实际落地经验者优先;
- 对生成式AI技术前沿与业务落地有热情,自驱力强,具备良好的学习能力、分析解决问题能力和跨团队协作能力;
- 在CVPR/ICCV/ECCV/NeurIPS/ICLR/ICML等顶会发表论文者优先,有ACM/ICPC、数学建模、编程竞赛等经历者加分。