岗位职责
- 中大型生产系统运维(核心): - 负责中大型生产应用系统的日常运维,保障系统高可用与稳定性; - 建立并完善生产运维管理体系,包括变更管理、故障分级响应、容量规划、灾备切换等; - 主导重大故障的应急响应与复盘,推动问题根因分析与长期改进; - 负责监控体系建设与告警治理,确保问题早发现、早定位、早处理。
- 中间件及平台运维: - 负责消息队列(MQ/Kafka)、缓存(Redis)、负载均衡(Nginx/HAProxy)、ZooKeeper、配置中心(Nacos)等中间件的管理、优化及排障; - 负责Docker/Kubernetes容器平台的运维,支撑有状态与无状态服务。
- 运维自动化与智能化: - 设计与实施自动化运维方案,减少人工干预,提升运维效率; - 开发定制化运维脚本与工具,解决特定运维挑战; - 将AI能力融入运维日常工作:智能告警分析、根因定位辅助、故障自愈、智能巡检等; - 利用AI工具(大模型、Copilot等)提升脚本开发、故障排查、文档编写的效率; - 参与构建或对接AIOps平台,推动运维从自动化向智能化演进。
职位要求
- 核心硬性要求: - 3年以上中大型生产应用系统运维经验,对生产运维有敬畏心,具备变更管控、故障应急、容量管理等经验; - 熟悉消息队列、缓存、负载均衡、ZooKeeper、配置中心等至少两种中间件的深度运维经验; - 熟悉Docker与Kubernetes,有容器化生产环境运维经验者优先。
- AI能力与技术敏锐度(核心加分项): - 拥抱新技术,有AI实际应用经验,能够将AI工具应用于日常运维工作中; - 具备Prompt Engineering能力,能有效利用大模型解决运维问题; - 有AI应用开发或对接经验(如调用LLM API、搭建RAG知识库、AIOps实践)者强烈优先。
- 开发能力: - 能够使用Python、Java或Shell中的一种或多种进行编程; - 能借助AI工具高效完成编码与脚本开发。
- 软技能: - 良好的团队协作与沟通能力,积极参与知识分享; - 强烈的责任心和服务意识,对生产环境有敬畏心; - 学习能力强,主动拥抱新技术、新工具。