岗位职责
】
- 负责大模型训练框架与训练平台的研发与演进,支撑万亿级参数模型训练落地;
- 负责分布式训练方案设计与优化(DP/TP/PP/ZeRO/FSDP/MoE 等),提升吞吐与资源利用率;
- 负责训练性能调优,包括算子优化、混合精度(BF16/FP16/FP8)、显存优化、通信优化与 pipeline overlap;
- 负责训练稳定性建设,包括容错恢复、监控告警、性能回归、训练诊断与自动化运维能力;
- 参与强化学习训练框架与对齐训练流程建设,支持 RLHF/PPO/DPO/GRPO 等训练任务的工程优化与平台化落地;
- 跟进前沿训练系统技术,推动在业务场景规模化落地。
职位要求
- 本科及以上学历,计算机/软件/电子相关专业;
- 熟练掌握 Python/C++,具备扎实的工程能力与系统调试能力;
- 熟悉 PyTorch 训练机制,理解反向传播、梯度同步、显存管理等原理;
- 熟悉分布式训练框架(Megatron-LM/DeepSpeed/FSDP 等)并具备实战经验;
- 熟悉 GPU/NPU 性能优化方法,能独立完成 profiling 与瓶颈定位(Nsight/perf 等);
- 熟悉训练侧算力优化技术,包括算子融合、图优化、Triton/CUDA Kernel 开发、编译器优化等;
- 了解强化学习训练基本流程与常见框架,熟悉 rollout、reward model、policy update 等机制者优先;
- 具备良好的问题分析能力与跨团队协作能力。 加分项:
- 有 MoE/长序列/多机多卡大规模训练经验;
- 熟悉 NCCL/HCCL/RDMA/IB 通信优化;
- 有量化训练、低比特训练或 QAT(Quantization-Aware Training)相关实践经验;
- 有国产卡适配与性能优化经验(昇腾/寒武纪/沐曦等);
- 有开源贡献或高性能系统相关论文/专利。