岗位职责
- 生产系统的正常运行,及时发现故障;
- 对网站故障分析定位,评估故障影响,协调各部门技术团队解决各类故障,跟进问题的修复情况;
- 优化服务管理流程,包括故障管理、问题管理流程和质量指标;
- 推动完善各类监控和告警工具,不断提升定位和发现问题的效率;
- 日常技术运营和巡检报告的编写;
- 参与24*7岗位值班,需要倒班。
职位要求
- 1年以上工作经验,数据中心noc相关工作经验者优先;
- 熟悉互联网应用常见技术栈(如linux、bind、nginx、tomcat、docker、redis、mysql、rabbitmq等)的原理和应用场景,有相关运维经验者优先;
- 熟悉常用noc工具的使用,如zabbix、open-falcon等;
- 熟悉公有云平台产品、CDN者优先;
- 擅长问题定位和故障处理,强烈的责任心,较强的问题跟进能力;
- 熟悉ITIL体系,拥有有ITIL相关流程实践经验;
- 良好的危机管理和事件管理技能,以及跨职能团队的沟通协调能力。 加分项 无