岗位职责
● 架构演进规划:主导业务在公有云(阿里云 / AWS 等)架构下的 稳定性、效能、成本演进规划,覆盖服务拓扑、数据架构、可观测体系与 SLI/SLO 治理,支撑核心业务 SLA 达标,兼顾交付效率与单位成本。 ● 风险识别与稳定性治理:识别公有云架构下的稳定性、效能、成本风险,主导落地解决方案并对业务结果负责。通过 IaC、自愈、AIOps等手段,提升发现与定位效率,用数据驱动稳定性与成本决策。 ● 工程体系建设:推动稳定性、容量、成本、发布等领域的标准化、流程化、产品化建设,落地 SRE 工程文化,与研发团队建立稳定性共建机制。
职位要求
● 5 年以上 SRE / 基础架构经验,有公有云大规模生产环境实战经验 ● 精通 Kubernetes 及云原生技术栈,熟悉核心中间件稳定性治理; ● 具备 AI SRE 实践经验,熟悉 LLM / Agent 在故障定位、智能告警、变更风险评估、知识沉淀等运维场景的落地,有相关工具或平台建设经验者优先;