岗位职责
- 设计与优化大模型的分布式训练架构,包括FSDP/ZeRO、TP、PP、EP、SP等策略;
- 提升GPU/NPU平台的训练性能与资源利用率,优化通信、调度与内存使用;
- 构建高可靠的训练管线(Checkpoint、混合精度、容错、Profiling等);
- 参与模型在不同硬件平台的适配与性能对齐;
- 为模型团队提供训练支持、调优方案和工具链建设。
职位要求
- 计算机或相关专业背景,本科及以上学历;
- 2年以上深度学习或分布式训练相关经验;熟悉PyTorch/DeepSpeed/Megatron/MindSpore等训练框架原理与实现;
- 深入理解多机多卡通信机制与并行策略(NCCL、HCCL、FSDP、TP、PP等);
- 具备GPU/NPU平台的性能调优经验,能识别并解决性能瓶颈;
- 有较大尺寸模型(如32B+Dense或100B+MoE)训练经验者优先;
- 具备良好的代码能力、系统分析能力与协作沟通能力。 加分项:
- 实战经验:完成过百卡级以上大模型训练任务;
- 框架贡献:参与过Megatron-LM、DeepSpeed、ColossalAI、MindSpore等开源项目;
- 系统优化:具备CUDA/C++/通信调度/算子优化能力。