岗位职责
- 作为可用性架构师,你将负责设计、构建、演进和治理腾讯云平台及核心服务的可用性技术体系:;
- 架构设计与治理:负责关键云服务(计算、存储、网络、中间件等)的高可用与容灾架构设计与评审,制定并推行可用性设计规范与最佳实践;
- 容量体系构建:建立并主导精细化、自动化的容量管理体系。包括容量规划模型、性能压测、容量水位监控、弹性伸缩策略与成本效能优化;
- 容灾与故障管理:设计并落地同城双活、异地多活等容灾解决方案;主导重大故障的复盘与改进,通过机制与工具建设,将故障经验转化为平台防御能力;
- 变更与稳定性保障:构建风险可控的智能变更体系,包括灰度发布、预案演练、变更防护等,通过可观测性数据驱动变更成功率与效率提升;
- 可观测性与应急响应:主导并优化面向可用性的立体监控、全链路追踪、智能告警与应急响应平台。建设故障预测、快速定位与自动恢复能力;
- 技术赋能与布道:在内部推动可用性文化,通过混沌工程、攻防演练、技术分享等方式,提升整体研发团队的稳定性意识与实战能力。
职位要求
- 计算机相关专业本科及以上学历,5年以上大规模分布式系统架构设计或SRE相关经验;
- 精通中间件:深入理解消息队列(如CKafka/TDMQ)、微服务框架、缓存(如Redis)、配置中心等至少一种中间件的高可用原理与运维实践;
- 精通容量与性能:具备大规模系统的容量规划、性能调优、全链路压测实战经验,能对系统瓶颈进行量化分析与治理;
- 精通容灾架构:具备跨地域、多AZ的容灾方案(如双活、多活)设计与落地经验,熟悉相关数据同步与流量调度技术;
- 精通稳定性体系:对变更管理、监控告警、应急预案、故障复盘有系统性方法论和成功改进案例;
- 熟练掌握Linux系统、网络(TCP/IP, HTTP)及至少一门编程语言(Go/Java/Python);
- 熟悉云原生技术栈(Kubernetes, Service Mesh)及相关可观测性工具(Prometheus, Grafana, ELK等);
- 具备优秀的系统化思维和复杂问题解构能力,能进行端到端的架构风险识别与控制;
- 对技术有激情,追求卓越,具备强大的责任心和抗压能力。优秀的沟通协作能力,能推动跨团队、跨部门的复杂技术项目落地。具备前瞻性视野,能主动洞察业界趋势,并引入到实际工作中。