岗位职责
- 负责机器学习平台的整体 SLA/SLO 定义、监控告警体系建设与故障应急响应,持续提升系统可用性,保障平台各个链路的稳定通畅;
- 负责机器学习平台的架构治理,容灾设计,性能调优。对接AI训练链路、资源调度与存储能力,参与业务和系统的问题排查工作;
- 负责运维运营工作自动化,借助AI能力来解决日常工作问题,包括资源管理、变更管理、故障恢复、用户工具诊断接口/mcp等。
职位要求
- 计算机相关专业本科及以上学历,2年以上运维开发项目经验;
- 熟练掌握Python/Go/Java/Shell等1至2种以上语言;
- 有大型分布式系统,在离线任务调度与资源管理系统的运维经验,有高并发、高可用、可扩展等相关实践,熟悉Kubernetes生态和架构;
- 具备系统性能调优实战经验,能定位并解决复杂的性能瓶颈问题;
- 熟悉数据库原理,有Mysql、PostgreSQL等DB性能调优、索引优化、慢查询治理经验;
- 具有强烈的工作责任心和自驱力,出色的学习沟通能力与逻辑分析能力,良好的团队合作精神;
- 加分项:;
- 有 LLM / 多模态大模型训练或推理场景的稳定性与性能优化经验;
- 熟悉 Agent / Harness 应用架构与设计理念,有相关系统的研发、部署或运维实践经验;
- 了解机器学习技术原理,了解分布式训练框架(PyTorch、DeepSpeed、Megatron 等)及推理引擎(vLLM、SGLang 等)的调优与使用;
- 参与过 GPU 集群运维,有 NVIDIA GPU、NCCL、RDMA / InfiniBand 高速网络运维调优经验。