岗位职责
- 平台稳定保障:主导基于Kubernetes的企业级容器云平台建设与日常运维,制定高可用策略,确保平台可用性不低于
- 99%,支撑业务7×24小时稳定运行;
- 集群全生命周期管理:实施K8s集群的部署、扩容、高可用架构优化、性能调优与安全加固,建设故障自愈体系,降低人为干预频次;
- 故障应急与根因分析:主导容器编排、资源调度、网络通信、存储挂载等核心故障的快速排查与闭环处理,缩短故障恢复时长并输出根因分析报告;
- 版本迭代与插件管理:规划K8s版本升级、组件补丁更新及CRI/CNI/CSI插件迭代,通过灰度验证与回滚方案确保升级过程业务无中断;
- 资源规划与成本治理:基于业务负载趋势进行计算、存储、网络资源的容量评估与动态调配,持续优化资源利用率并降低运营成本;
- 运维体系标准化:梳理运维流程,设计并落地监控、告警、日志分析的全链路自动化工具链,持续沉淀运维手册与故障案例库。
职位要求
- 教育背景与专业知识:本科及以上学历,计算机、软件工程、通信工程等相关专业;
- 专业技能与资格:具备Shell、Python或Go语言脚本开发能力,能独立编写集群巡检、资源管理及故障处理自动化脚本,并能熟练使用kubectl、Helm、Kustomize等工具;
- 行业与专业经验:具有5年以上云平台运维经验,其中至少3年大规模Kubernetes集群(50+节点)运维经验,熟悉Docker/containerd运行时原理,并掌握Istio、Prometheus、Grafana、EFK等云原生组件配置;
- 项目/任务成果:主导过至少一个大型K8s集群的高可用架构设计或性能优化项目,能提供量化改进结果(如故障恢复时间缩短比例、资源利用率提升幅度);
- 其他要求:具备云平台网络架构知识,能配置VPC、负载均衡、Service、Ingress及Flannel/Calico等CNI插件,并能独立排查Linux内核、网络、I/O等底层问题。