岗位职责
- 负责基础设施日常运维,包括 NAS 存储、AD 域控、OpenStack/VM/K8s 虚拟化与容器编排平台的集群管理、扩容、故障排查与性能调优,保障服务链路不中断;
- 定义并跟踪系统 SLO/SLI(设备可用性、服务响应延迟等),控制错误预算,通过混沌工程(ChaosBlade/LitmusChaos 等)、灾备演练提升系统韧性;
- 使用 Terraform/Ansible 实现基础设施即代码(IaC),开发 Python/Go 自动化工具覆盖部署、配置、巡检、故障自愈全流程,减少人工操作;
- 建设并维护全链路可观测性体系,整合 Prometheus/Grafana + ELK(或 OpenSearch/Loki)栈,覆盖指标、日志、链路追踪,实现从基础设施到业务层的全链路监控,确保故障及时发现、快速响应;
- 参与虚拟化与容器编排平台优化,主导容量规划与资源调度优化,在保障性能前提下降低硬件与资源成本;
- 负责核心数据库及中间件(MySQL、PostgreSQL、Redis、ES、O2)的日常运维支撑,熟悉 OWL2 运维管控平台,能独立完成配置管理、版本升级、备份恢复、性能分析等日常操作;
- 响应用户及项目需求,与游戏/网络/IT 团队紧密协作,输出系统层技术支持与运维解决方案,推动跨部门协作事项落地;
- 探索并实践 AI 辅助运维,利用大模型提升故障诊断、脚本开发、日志分析等场景效率;
- 持续优化运维流程,建立技术文档与团队知识库,关注业界前沿动态。
职位要求
- 计算机相关专业本科及以上学历,5 年以上 SRE / 系统运维经验,游戏行业 SRE 运维经验、熟悉游戏研发生产流程者优先;
- 熟练运维 NAS 存储、AD 域控、OpenStack/VM 虚拟化平台,有 K8s 容器编排平台管理经验者优先;
- 熟练使用 Terraform/Ansible,具备 IaC 落地经验,了解 GitOps(ArgoCD/Flux)等云原生交付流程者优先;
- 熟练使用 Prometheus/Grafana 体系,熟悉 Zabbix 等传统监控平台,能独立设计监控指标与告警策略,有全链路可观测性(指标 + 日志 + 链路追踪)建设经验者优先;
- 精通 Python/Go 任一编程语言,能独立开发复杂自动化脚本与工具;
- 具备 MySQL/PostgreSQL/Redis/ES/O2 等数据库及中间件的基本运维能力,熟悉 OWL2 平台;
- 自驱力强,具备良好的跨团队沟通与项目推动能力,较强的学习能力与简报输出能力,可接受必要的线上应急响应;
- 有 AI Coding / AI 辅助运维实践经验优先。