岗位职责
1)设计并维护支持千亿参数模型的分布式训练系统及作业调度、资源管控平台; 2)优化分布式训练资源调度管理能力,优化大规模GPU集群资源使用率; 3) 与基础团队合作,推进作业调度(如 Kubernetes / Slurm)、存储( CFS / PFS / OSS)、网络互联的联调优化; 4) 建设自动化的训练监控、Checkpoint 保存与容错恢复机制,降低大规模训练任务的中断损失; 5) 负责预训练数据的高效加载与预处理流程,确保 I/O 不成为训练瓶颈,支持 TB 级数据集的高效迭代; 6) 搭建实验管理、超参数追踪、可视化监控等工具链,支持研究团队快速迭代。
职位要求
1)扎实的编程能力(Golang / Python),良好的数据结构与算法基础; 2)理解分布式系统基本概念(通信、调度、容错); 3)熟悉 PyTorch 训练机制与源码结构; 4)具备性能分析能力(GPU 利用率 / 通信瓶颈); 5)理解大模型训练基本流程; 6)熟悉 Linux 系统、容器(Docker/K8s)及常见集群调度工具; 7)理解训练指标(收敛速度 / 稳定性 / 吞吐)。 加分项 加分项(满足部分即可) 1)Megatron / DeepSpeed / FSDP 分布式训练框架开发经验; 2)熟悉 InfiniBand / RoCE 高速互联网络及 NCCL 调优; 3)熟悉Agent系统关键组件;有Sandbox或执行环境经验(Docker / VM); 4)对分布式数据处理系统有开发经验(Hadoop / Spark / Dask / Ray); 5)对存储硬件及各个系统性能有深入理解(HDFS / CFS / OSS )。