岗位职责
- 负责大模型训练链路的稳定性治理和模型生产保障;
- 协同包括框架、算力、网络、存储等基础设施,系统建设大模型训练的诊断、可视化、自愈能力;
- 负责大模型训练生产的oncall、排障和流程优化建设。
职位要求
- 熟悉大模型预训练、后训练流程,熟悉Megatron/PyTorch等框架原理;
- 熟悉GPU、NCCL集合通信和k8s/docker容器技术原理,有GPU硬件、驱动、Cuda、RDMA等调优经验;
- 有大规模任务系统故障排查、分析解决经验者优先;
- 具有强烈的工作责任心和自驱力,有良好的学习沟通能力。