岗位职责
- 负责海量高性能GPU/XPU卡的资源交付与一致性保障,涵盖万卡大模型训练、在线推理、在线搜索、推荐训练等不同业务场景的集群管理;
- 学习并深入了解GPU业务方的使用姿势和训练框架,掌握前沿AI大模型技术,解决超大规模场景下的稳定性挑战,涉及NVIDIA H100、A100、昇腾、以及自研XPU等高性能卡型的使用;
- 构建自动化工程,确保生产环境的稳定性和资源在线率,及时发现并隔离故障GPU资源,提高资源流转效率;
- 通过优秀的工程架构设计,参与生产集群和服务的整个生命周期,满足可持续发展的需求并提高系统稳定性,包括架构规划、评审、设计、部署和上线等环节。
职位要求
- 本科及以上学历,计算机相关专业或具备同等实践经验,拥有五年以上SRE工作经验;
- 熟悉GPU/XPU资源管理和调度,具备大规模高性能计算集群的管理经验;
- 具备深厚的计算机系统基础知识,了解操作系统、存储和网络IO等相关原理;
- 具备以下一项或多项软件开发经验:Go/Python/Java/C++等,能够编写高效、稳定的系统工具和自动化脚本;
- 有丰富的生产环境故障排查和性能调优经验,能够快速定位和解决问题;熟悉AI大模型训练框架(如TensorFlow、PyTorch等),了解大规模分布式训练的实现细节和优化方法;
- 具备优秀的沟通和协作能力,能够与业务方、开发团队紧密合作,推动项目顺利进行;具有高度的责任感和主动性,能够在快节奏下保持高效工作。 优先条件:
- 具备超大规模计算集群管理经验,尤其是在大数据和AI大模型训练场景下的经验;
- 熟悉NVIDIA H100、A100等高性能计算卡的使用和优化;
- 具备系统化思维和工程化研发能力,能够设计和实现复杂系统的自动化解决方案;
- 英语口语流利,能够用英语进行流畅的沟通和表达,完成全球协作任务;
- 具有产品和工程思维,具备良好的项目管理能力、数据结构和系统设计能力者优先。