岗位职责
- 负责公有云场景下GPU云服务器的稳定性架构设计与优化,主导从底层硬件适配到上层软件栈的全链路稳定性保障方案落地,构建GPU云服务器稳定性监控与预警体系,实现潜在风险的提前识别与自动化处置;
- 深入分析GPU云服务器在运行过程中的稳定性瓶颈,包括但不限于GPU硬件故障、驱动兼容性问题、虚拟化层性能损耗等,解决GPU云服务器在集成、测试、上线及运维过程中的复杂稳定性问题;
- 跟踪GPU技术及公有云领域的稳定性技术前沿,将业界先进实践引入团队,持续提升GPU云服务器的稳定性水平与核心竞争力。
职位要求
- 5年以上公有云基础设施开发或GPU相关技术领域工作经验,其中至少2年以上稳定性架构设计或技术攻坚经验;
- 精通GPU硬件原理(如CUDA、显存管理、算力调度等)及主流GPU驱动的工作机制,能够独立分析并解决GPU相关的底层技术问题;
- 熟练运用至少一种编程语言(如C/C++、Go、Python)进行技术方案实现与问题定位,具备较强的代码读写能力与技术攻关能力;
- 具备良好的系统性思维与问题分析能力,能够从硬件、驱动、虚拟化、业务等多维度拆解GPU云服务器稳定性问题,并制定可实施的解决方案。 具备以下条件者优先:
- 有公有云厂商GPU云服务器产品稳定性架构设计或核心开发经验;具备GPU相关故障排查工具(如NVIDIA-smi、NVIDIA-debugdump、Nsight等)的深度使用经验或自定义GPU监控/诊断工具开发经验;
- 具备优秀的沟通协调能力与团队协作精神,能高效推动跨部门项目进展,有较强责任心,可应对复杂业务场景下的紧急稳定性故障;有AI训练/推理场景下GPU云服务器稳定性保障经验。