岗位职责
岗位职责 1)构建与优化分布式训练系统(DP / TP / PP / MoE 等并行策略); 2)优化训练调度与执行:pipeline、micro-batch 调度与执行效率; 3)优化通信系统:AllReduce / AllGather / ReduceScatter 等通信性能; 4)开发与优化 GPU Kernel(Triton / CUDA),提升算子效率; 5)显存与计算优化:重计算、offload、低精度训练(FP8/FP4); 6)训练稳定性分析:loss、梯度、数值稳定性问题; 7)端到端性能分析:定位 GPU 利用率、通信与数据 pipeline 瓶颈。
职位要求
1)扎实的编程能力(Python / C++),良好的数据结构与算法基础; 2)理解分布式系统基本概念(通信、调度、容错); 3)理解并行计算模型(数据并行 / 模型并行); 4)具备性能分析能力(GPU 利用率 / 通信瓶颈); 5)理解大模型训练基本流程; 6)了解 Transformer 结构与训练特性; 7)理解训练指标(收敛速度 / 稳定性 / 吞吐)。 加分项 加分项(满足部分即可) 1)Megatron / DeepSpeed / FSDP 使用经验; 2)GPU 编程经验(CUDA / Triton / CUTLASS); 3)通信优化经验(NCCL / 拓扑感知); 4)低精度训练经验(FP8 / FP4); 5)MoE / 长上下文 / 并行策略优化经验; 6)大规模训练或开源项目经验。