岗位职责
支撑5T模型与10万+卡规模集群及持续数小时、数天甚至更长周期的 Agentic RL,研究超长上下文 Rollout 下的 KV Cache 管理、动态批处理、异步调度、多维负载均衡、长程状态保存和细粒度容错;协同优化模型并行、专家并行、计算通信 Overlap、低精度训练与关键算子,突破大规模智能训练的效率和稳定性瓶颈。
职位要求
- 编程与工程素养:精通 Python/C++,代码风格优秀;对底层系统有深入钻研的兴趣与技术好奇心;
- 分布式训练体系:深入理解分布式系统与并行计算;熟练掌握 TP/PP/SP/EP/CP/FSDP 等并行机制,具备千卡级以上实战经验;
- 大模型框架:熟练使用 PyTorch,理解自动微分底层;熟悉 Megatron-LM/DeepSpeed/vLLM/SGLang 等至少两种框架的底层实现;
- 底层硬件与通信优化:熟悉 CUDA/CUTLASS 算子开发;深入理解 NCCL 通信优化与集群拓扑;
- 系统分析与建模:能从第一性原理推导系统设计;对 Scaling Law、分布式性能瓶颈有深入理解,具备数学建模能力。 加分项:
- 有 100B 以上 MoE 模型预训练系统经验;
- 有 FP8 / FP4 混合精度工程落地经验;
- 有长上下文(100K+)训练与推理优化经验;
- 有超大规模集群稳定性与容错系统设计经验;
- 对算子融合与 kernel 级优化有实践经验;
- 熟悉至少一种主流的RLHF框架,如OpenRLHF/veRL/AReal/ChatLearn等,熟悉Ray框架或其他强化学习相关计算框架;
- 在计算机系统网络顶会OSDI/SOSP/NSDI/ATC/EuroSys上有文章发表经验;
- 各类高水平竞赛金牌选手。