岗位职责
- 建立高效的监控体系,确保为用户提供可靠稳定的服务。
- 建立高效故障定位分析注入能力,领导团队建立一套完整有效的风险控制能力, 确保故障恢复能力。
- 通过和基础架构团队共建稳定性体系, 从质量视角提供架构改进和优化方案并落实。
- 负责组建相关团队,通过合理有效的手段优化和提升团队战斗力。
- 参与团队合作和共建。
职位要求
- 具备较强的分布式服务系统稳定性改善的经验, 有容器化、分布式存储架构、服务治理、SRE等方面经验优先。
- 掌握1-2门主要后端开发语言(Golang、Python、Java等)。