岗位职责
- 负责公司业务系统运维工作,提升业务稳定性和工程效率,与业务方保持高效沟通,建立良好合作关系;
- 负责应用上线评审、上线交付、配置变更、状态监控、容量管理、故障应急响应工作;
- 参与业务服务端架构的高可用设计和性能优化,保证高效、可靠的业务迭代;
- 负责线上重大问题排查,紧急事故处理,后续事故分析与优化;
- 负责应用故障演练、应急预案、SOP手册编写工作,确保故障时业务能快速恢复;
- 负责应用高可用建议及管理,包括限流、降级,容错、容灾,同城多活,确保应用质量;
- 建立SLA评估标准,计算故障对SLA影响,并对SLA后续改进措施进行跟进;
- 负责运维规范、流程文档编制,并将其工具化、平台化,确保运维安全,提升运维效率;
- 探索 AI 在稳定性领域的应用,包括辅助故障根因分析、告警降噪运维工作智能化。
职位要求
- 2027届毕业生,本科以上学历,计算机类、软件类、通信类等相关专业优先;
- 扎实的编程基础,至少掌握一门开发语言,熟悉Golang, python优先;
- 对主流操作系统熟悉比如Linux,Debian等;
- 熟悉容器技术、云原生;
- 具备使用 AI 编程工具(如 Claude Code、Cursor)辅助开发和调试的实践经验;
- 了解大模型/Agent 基本原理,对 AIOps、混沌工程自动化等方向有一定了解或探索优先。