岗位职责
负责司内AI平台和AI算力的日常运维、故障处理、资源管理和稳定性保障工作。 负责AI相关配套资源的运维和管理支持工作,与供应商对接问题,保证资源服务可用性。 建设算力/存储/网络/CPU 的 SLO 追踪与告警监控,推动利用率提升与低效治理。 参与SRE运维平台建设,集成多集群的服务监控、资源管理、可观测等能力和定制化需求开发。 保障 Dots 大模型推理服务高可用,覆盖部署、升级、发布准出、容灾演练全流程。
职位要求
本科及以上,计算机相关专业,5 年左右 SRE / 运维 / 基础设施研发经验; 精通 Linux / Kubernetes/网络等基本知识,熟悉主流云厂商云服务与控制台操作 熟悉至少一种以上开发语言(Python/Shell/Go),具备独立开发运维平台或自动化工具的能力; 熟悉 GPU 基础知识(型号、算力、显存、GPU 网络),有故障发现和排障能力; 对大模型推理服务的调用全链路有清晰认知和运维经验; 具备 SLO / 容量规划 / 变更管理 / 故障复盘等 SRE 方法论意识,沟通推动能力强。