岗位职责
- 负责大模型后训练框架和RL训练的设计,开发和优化。支撑LLM的高效、稳定训练;
- 持续追踪并引入业界最新开源生态技术(如 Verl, Slime, ROLL, AReal 等);
- 与搜索算法团队紧密合作,设计实现高性能的AI搜索大模型,加速最新的大模型技术在搜索场景的落地。
职位要求
- 具备较强的动手能力;熟悉 Python ,具备扎实的系统编程功底和优秀的复杂系统 Debug 能力;
- 深入理解大模型分布式训练原理,具备 Megatron-LM、DeepSpeed 或 PyTorch FSDP 等主流框架的开发和优化经验;
- 熟悉大模型后训练与对齐技术(PPO、GRPO、DPO等),熟悉 Verl、ROLL,AReal 等强化学习/分布式计算框架,有实际开发部署并解决相关问题的经验;
- 熟悉最新的大模型结构,熟悉各种软硬件架构,能够结合具体的模型结构和软硬件架构做训练过程的深度优化。