岗位职责
- 负责百灵模型训练与推理加速,涵盖并行架构、低精度计算、算子与显存优化、跨机通信、数据预处理等关键模块的性能优化;
- 面向万卡规模训练与推理场景,研究效率 scaling 理论,持续挖掘硬件与系统的理论性能上限;
- 与算法团队深度协同开展 co-design,共同设计和优化领先的模型架构。
职位要求
- 深入理解分布式训练体系(TP / PP / SP / EP / CP 等);
- 熟练使用Pytorch深度学习框架,对自动微分有理解;
- 熟悉主流大模型训练框架底层实现(Megatron / DeepSpeed / FSDP 等);
- 熟悉 CUDA / Cutlass / 通信优化原理;
- 具备从第一性原理推导系统设计的能力;
- 对分布式系统性能分析有深入的了解;
- 对 scaling law 与系统瓶颈具备分析能力;
- 数学建模能力,能对工程问题进行理论建模。 加分项:
- 有 100B 以上 MoE 模型预训练系统经验;
- 有 FP8 / FP4 混合精度工程落地经验;
- 有长上下文(100K+)训练与推理优化经验;
- 有超大规模集群稳定性与容错系统设计经验;
- 对算子融合与 kernel 级优化有实践经验;
- 有深度学习框架开发经验;
- 在顶会 / 顶刊发表过系统或架构相关论文;
- 各类高水平竞赛金牌选手。