岗位职责
- 参与FlashMoE等分布式训练框架的优化,重点攻关MoE模型的Expert并行通信优化、负载动态均衡和稀疏激活下的高效训练;
- 负责显存优化技术创新(激活重计算、梯度检查点、ZeRO变体),支持万亿参数MoE模型在有限显存下的稳定训练;
- 探索多种异构硬件设备(A100/H100/H800/PPU)上的训练性能优化,通过算子融合、通信重叠、显存管理等手段提升MFU;
- 支撑集团内部或云上客户万卡级MoE模型训练场景,将技术成果沉淀为PAI-DLC训练平台核心特性;
- 推动超大规模训练优化方向的学术影响力产出。
职位要求
- 熟悉深度学习基本原理、主流深度学习算法及应用、以及至少一种主流框架(PyTorch、TensorFlow等);
- 熟悉Megatron、TrasformerEngine、DualPipe等框架技术,并在研究或实习项目中有相应的实践经历;
- 具备扎实的计算机基础知识、C++/Python编程能力,熟悉常见数据结构和设计模式;
- 具有很强的学习能力、复杂问题归纳梳理能力、沟通和团队协作能力,具备能够深度钻研技术的耐心。 加分项:
- 有很强的学术研究能力和优秀的学术成果(AI领域顶会/顶刊论文);
- 熟悉体系结构,并有扎实的高性能计算/AI编译器/推理框架/模型优化经验;
- 作为核心贡献者参与开发或者负责维护AI领域的流行开源项目。