岗位职责
- 负责腾讯云大模型训推平台客户2线技术支持,解决客户在训练、推理等环节遇到的技术问题,保障客户业高效、稳定运行;
- 定期复盘线上故障与客户问题,深入分析根因,优化技术支持流程与诊断工具,输出改进建议并驱动产品迭代升级;
- 深入分析平台可用性风险、瓶颈与容量热点,通过数据驱动方式识别风险与性能短板,持续推动架构优化与平台演进;
- 参与运维管理体系建设,负责可观测诊断平台、自动化运维工具的规划与开发,以及GPU资源、分布式训练、推理服务等组件的容量规划与性能调优;
- 探索AI Native、AIOps、Agentic 运维诊断等前沿方向,推动运维体系向智能化、自愈化与自治化演进。
职位要求
- 本科及以上学历,计算机相关专业,具备3年以上云原生运维、AI Infra运维或技术支持经验;
- 熟悉Linux 操作系统原理,具备扎实的网络、存储、系统调优与分布式系统基础;
- 精通Kubernetes(K8s)容器编排与 Docker 容器化技术,熟悉主流云平台及Linux系统运维;
- 熟悉LLM大模型训练/推理流程、AI Infra、LLMOps / MLOps 相关技术栈,理解模型服务链路与推理架构;
- 具备较强的性能分析与故障排查能力,能够在复杂场景下快速定位并解决系统问题;
- 有良好的客户服务意识与沟通能力,能耐心响应客户诉求,具备较强的抗压能力与责任心;
- 学习能力强,对前沿技术保持持续关注,做事沉稳细致,具备良好的文档编写和文字表达能力。