岗位职责
- 负责千卡以上大规模混合模态大模型强化学习训练框架建设,调研和实现业界先进的强化学习方法,并探索算法工程结合的训练方法创新设计,实现模型性能和训练效率的双提升;
- 打通复杂工具调用场景的高性能推理与Agent训练系统,攻克长程数据训练中的训练效率、训推一致性等难点,显著提升千问模型基于多种阿里生态工具(如闪购、飞猪等)的用户真实任务解决率;
- 参与奖励系统、工具系统交互的设计与研发,打造高效率的可持续扩展架构;并通过线上链路的联合设计保障模型训练效果的对齐,保障模型在事实性、复杂任务规划解决等方面的能力提点可以落地千问App。
职位要求
- 1年及以上大模型训练工程经验,有扎实的深度学习算法基础,精通各类大模型常用训练框架,熟练掌握各种编译、调试、性能分析工具;
- 熟悉强化学习算法PPO、DPO、GRPO、DAPO等以及相应的高效工程实现,有大模型强化学习工程支持经验和效果优化经验;
- 精通ray分布式计算框架开发实现,掌握一种或多种分布式训练框架(verl、slime、areal、openRLHF、roll)详细系统实现,并具备二次开发能力;
- 熟练掌握开源大模型训练框架(megatron、fsdp)、推理框架(vllm、sglang),具备大模型训练、推理性能分析和优化能力;
- 有大规模强化学习算法和工程结合的训练效率优化经验(尤其是agentic训练),或大规模分布式强化学习系统开发应用经验者优先。 加分项:
- 有强化学习算法调优经验者优先;
- 有强化学习方向顶会论文经验者优先;
- 如果有训练引擎、推理引擎开发经验优先。