招聘中 社招

阿里云智能-AI Infra SRE 专家-杭州

阿里云

  • 杭州

收录时间

岗位职责

  1. 负责大规模 GPU/异构计算集群稳定性架构和运维体系设计,对集群可用性、交付效率、资源利用率和运维成本负责。
  2. 主导 AI 基础设施运维平台的架构设计与建设,形成覆盖交付、监控、诊断、变更、容量、容灾和故障自愈的工程体系。
  3. 建立面向 AI 训练与推理场景的 SLI、SLO、SLA 及稳定性度量体系,推动重大故障治理和系统性风险消除。
  4. 主导集群交付标准、运维规范和质量准入机制建设,推动跨地域、跨团队场景下的标准化复制。
  5. 牵引复杂项目和重大稳定性专项,协调研发、产品、硬件厂商及合作伙伴解决跨层技术问题。
  6. 持续识别架构瓶颈和业务风险,通过技术创新、自动化和平台化手段实现规模化效率提升。
  7. 指导团队技术建设和人才成长,沉淀最佳实践并提升团队整体工程能力。

职位要求

  1. 5年以上互联网、云计算或大规模基础设施相关经验,具有大型 GPU 集群、AI 训练平台或高性能计算平台建设经验。
  2. 深入理解 Linux、分布式系统、计算、网络和存储体系,具备复杂故障的跨层分析及性能优化能力;深入掌握 Kubernetes、Slurm、LSF 等调度系统,理解 GPU 资源调度、拓扑感知、任务容错和大规模集群治理。
  3. 熟悉 GPU、RDMA/RoCE/InfiniBand、NCCL、高性能存储等技术,能够分析训练任务稳定性、通信性能及软硬件协同问题。
  4. 具备较强的软件工程和平台架构能力,能够主导自动化运维、自愈系统或稳定性平台建设。有成熟的 SRE 体系建设经验,熟悉容量管理、变更管理、应急响应、故障复盘和风险治理。
  5. 具备技术热情和好奇心,自驱力和学习力强;具备良好的分析与解决问题的能力;具备良好的沟通协作和项目推进能力,能够独立承担中等复杂度项目及跨团队保障任务;积极乐观,坚韧抗压,结果导向,能够持续推动问题的解决和突破。
  6. 掌握AI基础知识,掌握基础提示词工程,会使用Al专业工具,集成AI到个人工作流;有AI相关开发工具应用研发经验者优先,持有阿里云ACA/ACP/ACE认证证书者优先。

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

阿里云阿里云智能-AI Infra SRE 专家-杭州

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看阿里云智能-AI Infra SRE 专家-杭州正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位阿里云智能-AI Infra SRE 专家-杭州阿里云 · 杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏阿里云智能-AI Infra SRE 专家-杭州正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

阿里云阿里云智能-AI Infra SRE 专家-杭州社招 · 杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入阿里云智能-AI Infra SRE 专家-杭州内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。