岗位职责
- 稳定性体系构建:主导IT基础设施稳定性管理体系设计与落地,制定覆盖网络、系统、存储、数据中心、中间件、容器平台等全技术栈的稳定性标准和SLO指标体系,制定各工厂稳定性基线并建立稳定性度量与报告机制,推动稳定性治理从被动救火向主动预防转变,建立容量规划、变更管控、风险巡检等常态化机制;
- 监控与告警优化:主导工厂统一监控指标体系的设计与建设,覆盖数据中心基础设施、网络设备、服务器、存储、中间件、容器平台等,基于Zabbix等监控平台优化监控采集策略、告警阈值与分级,构建智能告警模型以提升告警精准度并降低噪声,建立基础设施事件到业务影响的关联分析能力,实现事件闭环;
- 故障应急与快速恢复:设计并迭代故障应急响应流程、故障分级标准与复盘机制,建立7×24小时OnCall保障体系,主导重大故障的快速恢复与根因分析,协调跨工厂、跨技术领域资源联合排障,推动运维自动化与自愈能力落地,编写核心系统应急处置预案,定期组织故障演练与技术复盘,沉淀技术知识库;
- 跨工厂协同与赋能:通过虚拟项目组协调各工厂运维团队,统一稳定性标准与运维规范,推动各工厂稳定性能力对齐,组织故障案例复盘分享、实战演练与技术培训以提升团队故障处置水平,与研发、架构、业务、安全团队建立常态化沟通机制,提前识别系统潜在风险并推动整改;
- 架构评审与性能优化:参与核心IT基础设施架构评审,从稳定性角度提出高可用改进建议,分析系统瓶颈并对关键系统进行性能调优,跟踪行业技术趋势,主导IT基础设施运维工具链的中长期规划与落地。
职位要求
- 教育背景与专业知识:本科及以上学历,计算机、通信或电子信息等相关专业;
- 专业技能与资格:能使用Shell/Python/Ansible编写自动化运维脚本以提升故障自愈或效率,能基于Zabbix设计监控指标体系与告警模型以完成监控平台优化,能完成Docker/Kubernetes环境运维任务,能应用TCP/IP协议知识独立排查网络与系统联合故障,能应用SRE方法论建立SLO指标体系并组织故障复盘;
- 行业与专业经验:7年以上IT基础设施运维或稳定性相关工作经验,优先考虑具有半导体制造业IT运维或跨多数据中心稳定性治理经验者;
- 其他要求:具有将复杂系统问题拆解为具体改进方案的结构化思维能力,具有在高压环境下保持结果导向并主动推进工作的能力,具有对系统稳定性的持续优化意识以保障生产连续性,具有ITIL、PMP或云厂商高级认证者优先。