岗位职责
- 负责云基础设施的质量治理、稳定性保障与效能提升;
- 面向云基础设施中后台服务,构建全链路质量风险模型,识别单点故障、依赖风险和容量瓶颈,主导制定并落地风险降级与应急预案,保障核心链路
- 99%+可用性;
- 负责性能容量治理(容量规划、压测体系、容量水位监控)与稳定性蓝军(混沌工程、故障演练、根因复盘),推动从“被动救火”到“主动预防”的稳定性体系升级;
- 深入分析业务交付与运维效能瓶颈(如发布流程、工具链效率、故障恢复时长等),将业务痛点转化为技术方案,主导效能工具与平台的设计与落地,提升团队交付效率与系统韧性;
- 设计并落地多维度质量与效能指标体系(SLO/SLA、MTTR、MTBF、容量利用率等),建立数据驱动的持续优化闭环,确保方案适配业务高速迭代与规模增长。
职位要求
- 本科及以上学历,计算机科学、软件工程、自动化等相关专业;5年以上质量工程、测试开发或SRE相关经验,有云原生/基础设施领域经验者优先;
- 精通至少一门编程语言(Go/Python/Java等),具备扎实的软件工程能力;熟悉云原生技术栈(K8s、容器、微服务),有大规模分布式系统质量保障或稳定性建设经验者优先;
- 对业务和AI技术敏感,具备优秀的技术与业务结合能力;有较强的抽象建模和架构设计能力,能独立主导复杂质量体系或效能平台的设计与落地;
- 逻辑思维清晰,具备优秀的问题分析与根因定位能力;良好的跨团队沟通与协作能力,能推动多方达成共识;具备强烈的自驱力和创新突破精神,能在复杂环境中主动发现并解决问题。 加分项
- 有混沌工程、故障注入、容量规划等实战经验;
- 主导过质量平台、效能工具或自动化测试框架的设计与落地;
- 熟悉云厂商产品与服务质量保障体系;
- 有开源项目贡献或技术博客输出者优先。