岗位职责
- 针对多模态模型开展强化学习算法研究,包括面向图像、视频生成的扩散模型,面向多模态理解的自回归模型,以及前沿统一多模态框架;
- 设计并开发强化学习训练框架与奖励建模策略,实现高效的大规模训练,提升训练稳定性,并解决奖励作弊等相关问题;
- 探索下一代强化学习范式,使其能更直接、更高效地从环境反馈中学习。
职位要求
- 本科及以上学历,计算机科学或相关专业;
- 具备出色的科研能力,在ICML、NeurIPS、ICLR、CVPR、ICCV、ECCV、SIGGRAPH等顶级会议发表过论文;
- 扎实的工程与编程能力,具备深度学习系统实现、模型训练与推理优化、CPU/GPU 加速、分布式训练与推理经验;
- 有扩散模型、自回归模型、文生图 / 文生视频生成相关经验者优先;
- 有 ACM/NOIP(信息学竞赛)参赛经历者优先。