岗位职责
- 统一训练架构建设与演进:负责大模型后训练(Post-training)框架的代码抽象与底层重构,兼容不同模态、不同训练方式的、正确的、高效的训练框架的建设;
- 超大规模分布式训练优化:面向100B~1T参数级别的超大模型,探索并落地极致的分布式训练策略(DP、TP、PP、EP等组合),通过算子融合、显存优化、分布式策略调整等手段大幅提升集群训练的MFU;
- Agent RL框架与评估底座建设:攻坚Reasoning RL/Agent RL的训练框架,构建适用于复杂业务环境的标准化评测基准与标准的、稳定的Harness,解决千亿模型在RL阶段的稳定收敛与Rollout效率问题,解决在Agent RL下的长尾问题;
- 多模态与新架构支持:为MoE、Linear Attention等新型模型结构,以及多模态(图、文文、音、视)复杂模态的模型训练提供高效支持与正确性(Convergence)验证。
职位要求
- 具备2年以上机器学习系统设计、开发与性能调优经验,熟练掌握Python与C++;
- 深入理解并具备PyTorch、DeepSpeed、Megatron或FSDP等主流分布式训练框架的二次开发经验;
- 有100B以上超大模型分布式训练实战经验,能够独立排查并解决收敛性问题与分布式训练瓶颈;
- 在强化学习训练框架(PPO/GRPO/Agent RL)或大模型评测底座、Agentic Harness有深度实践者优先;
- 具备工程素养,对提升AI Infra的研发效率、代码整洁度与系统稳定性有追求。