岗位职责
- 负责整体抖音系业务的事故防控,围绕变更事件中心与发布质检,提升变更拦截的准确率与召回率,覆盖核心链路和关键基础设施与依赖,在多种业务与流量场景中沉淀可复用的防控策略与实践;
- 推进根因分析能力与事件中心深度融合,构建统一的变更与故障关联分析视图,提升核心场景的根因识别准确率与召回能力,支撑复杂问题的快速定位与复盘;
- 完善抖音App预案管理与快速止损工具体系,支持一键回滚与切流,沉淀标准化应急流程并提升跨团队协同效率,显著缩短MTTD/MTTR;
- 负责并建立常态化微服务高可用治理,推广新一代过载保护策略,系统化优化接入层与服务间调用的重试与限流配置,推进端到端流量治理覆盖核心链路与关键依赖,持续提升架构韧性与承载能力。
职位要求
- 计算机或相关专业本科及以上学历;
- 精通Go/Python/Java等至少一门编程语言,具备扎实的平台工程能力和架构设计能力;
- 深刻理解CI/CD流程与DevOps理念,对变更管理、发布工程、质量门禁等有深入的思考和实践;
- 具备优秀的数据敏感度和分析能力,能够从复杂的事件流中提炼有价值的信息;
- 擅长跨团队沟通和项目推动,能驱动不同业务方共同落地稳定性规范。 具备以下条件者优先:
- 有大规模变更管理平台、研发效能平台或AIOps平台的设计与开发经验者优先;
- 有将机器学习应用于变更风险评估、异常检测或根因分析等场景的经验者优;
- 对微服务流量治理(如蓝绿部署、金丝雀发布、动态过载保护等)有深入理解和实践者优先。