岗位职责
- 负责核心业务系统的稳定性,通过指标建设、制度建设、预案设计、容量治理、监控预警等手段提升业务稳定性;
- 负责公司核心基础设施服务的建设、维护、管理,建立和完善SOP,保障基础架构的稳定性;
- 通过AI工具,优化和改进CICD流程、提高自动化水平、提升研发效率;
- 负责设计、开发稳定性和运维自动化相关工具和产品;
- 参与重大架构方案的设计与评审;
- 参与OnCall值班,第一时间响应突发事件,保障核心业务稳定运行。
职位要求
- 大学本科及以上学历,计算机或者相关专业;
- 有3年以上的应用运维、系统运维、运维开发经验,有大型互联网公司运维经验者优先;
- 熟悉主流公有云,至少有一种公有云的运维管理经验, 包括: 阿里云、腾讯云、AWS、火山云;
- 深入理解Linux系统,运维体系结构,精通容量规划、架构设计、性能优化;
- 掌握Python/Shell/Golang 中至少两种语言,熟悉主流Web开发框架,有运维系统/工具的开发经验;
- 精通Docker、K8S架构和技术原理,并有大规模使用、排错和优化经验;
- 熟练使用各种AI模型和相关工具;
- 强烈的安全意识、对线上环境有极强的责任心和敬畏心;
- 有丰富的应急处理、应用稳定性建设经验,对高可用架构有深入理解;
- 具备优秀的逻辑思维能力、沟通能力、高效的执行力,良好的团队合作精神。