部门介绍
在万卡规模上,重新定义大模型训练基础设施。我们正在建设面向大模型时代的 AI Infra,支撑超大规模算力集群稳定运行,覆盖预训练、持续预训练、SFT、RL、MoE、多模态等多种训练场景。深入训练系统的核心:从分布式并行、通信优化、算子融合,到容错恢复、精度保障和资源调度,让百亿、千亿、万亿参数模型在大规模异构集群上真正做到——跑得起来、稳定收敛、极致高效。目前平台已支撑上万次大模型训练任务,训练任务规模持续增长。你将参与建设的每一项能力,都将在真实的万卡集群和核心业务模型上接受检验。 为什么加入我们:你面对的不是实验室级的小规模 Demo,而是:万卡级算力规模、真实的大模型训练负载、复杂的生产级硬件环境,以及仍有大量空白等待突破的训练系统。你可以在这里同时获得训练框架的技术深度、万卡集群的系统复杂度,以及与顶尖团队共同探索新模型、新架构的机会。成为下一代大模型训练基础设施的建设者。
岗位职责
- 研发大模型训练引擎与训练框架,支持 CPT、SFT、RL、MoE、长上下文及多模态训练;
- 深入 PyTorch、Megatron、FSDP、verl等训练体系,设计张量并行、流水并行、数据并行、专家并行等分布式方案;
- 面向万卡级集群优化计算、通信、显存和存储效率,解决训练中的性能长尾、通信瓶颈和规模化稳定性问题;
- 建设 Checkpoint、断点续训、故障自愈、弹性训练、精度比对和可观测能力,提高大规模训练成功率;
- 适配多种 AI 芯片及异构算力平台,推动训练框架、通信库、算子与硬件之间的深度协同;
- 深入 Algorithm-System Co-design,让新的模型结构和训练方法能够更快、更高效地落地。
职位要求
- 熟悉 Python、C++ 中至少一种语言,具备良好的系统设计和工程实现能力;
- 熟悉 PyTorch 训练机制,对分布式训练、并行策略、显存优化或高性能计算有实践经验;
- 对 Megatron-LM、FSDP、verl 等框架中的一种或多种有深入理解;
- 熟悉 NCCL/HCCL、RDMA、集合通信、GPU/NPU 算子优化者优先;
- 有大模型预训练、MoE、长序列、强化学习训练或千卡级集群实践经验者优先;
- 喜欢解决真正困难的问题,愿意从模型、框架、系统一直深入到芯片和网络。