岗位职责
- 服务器集群运维: 主导Linux服务器集群的日常运维与性能调优,执行故障排查与高可用保障,确保线上服务7x24小时稳定运行;
- 容器平台管理: 搭建并运维Kubernetes容器平台,完成部署、升级、扩容与问题排查,支撑业务容器化落地;
- 云平台资源治理: 管理腾讯云TCS资源,优化配置与权限策略,实施成本治理;
- 中间件部署与维护: 部署、调优并维护Redis、Kafka、Zookeeper、Nginx、MQ、ES等核心中间件,建设监控与备份体系,维护高可用架构;
- 监控体系建设: 建设Zabbix、Grafana等监控体系,完成指标采集与告警配置。
职位要求
- 教育背景与专业知识: 计算机或相关专业,全日制本科及以上学历;
- 专业技能与资格: 能使用Shell、Python、Go中至少一种语言编写自动化运维脚本,能使用Python数据分析处理工具及API框架;能使用Prometheus、Loki、Jaeger等云原生可观测性工具;能使用Jenkins或GitLab CI等工具完成DevOps流程;持有RHCE/RHCA、腾讯云认证、CKA/CKAD/CKS认证者优先;
- 行业与专业经验: 5年及以上运维相关工作经验,有大规模集群运维、高并发业务运维、重大故障应急处理经验者优先;
- 其他要求: 具有故障排查能力,能独立定位并解决系统故障;具有抗压能力,能在高压环境下保障业务稳定运行;具有责任心与团队协作精神,能协同推进任务闭环;具有学习能力,能主动跟进云原生、AIOPS技术趋势并应用于优化与提效;具有保障业务稳定运行的意识,能遵循工作流程与运维红线,以用户为中心、以结果为导向。