岗位职责
- 负责参与Kubernetes云原生部署、优化及日常运维,参与架构评审;
- 从可运维性、可靠性、可观测性、基建成本等角度提出专业建议,保障系统与业务的稳定运行;
- 具备Oncall意识,参与线上Oncall流程;深入理解和执行业运营维规范、变更流程、故障处理流程;
- 对日常案例具备负责人意识,主动提出优化建议并能够推进落地,提升团队协作效率。
职位要求
- Linux平台3-5年运维SRE工作经验,有强烈的责任心和负责人意识,能够独立思考和解决问题;
- 深入理解Kubernetes架构原理,有Kubernetes集群的运维经验;熟悉Docker容器技术,理解网络、存储、安全等相关原理;有云原生项目架构规划及落地经验;具备多云厂商的生产产品运营运维经验,对常见云产品(SaaS、PaaS、FaaS等)有较深入理解;
- 理解并具备主流“AI-Runtime”的实际使用经验;熟练掌握常见AI Agent工程化工具与范式,包括但不限于Skills(技能封装)、Prompt Engineering(提示词工程)、Hermes(模型指令编排)、OpenClaw(工具调用/函数沙箱)等;能够基于Harness设计哲学,围绕稳定循环与工具外挂原则,构建可控、可观测的智能体执行环境;
- 熟练使用Shell/Python/Golang中的至少两种语言,能够独立完成自动化工具、Operator或运维平台的开发;以自动化运维为导向,具备CI/CD流水线(GitLab CI/Jenkins/ArGoCD)实践能力,通过工具驱动运维效率持续提升;
- 有Prometheus、Grafana、Loki、ELK、Jaeger等开源监控、日志、链路追踪组件的在生产环境的使用经验;熟悉TCP/IP、HTTP/HTTPS协议,对负载均衡、DNS、安全组、WAF等有实际配置经验;对运维安全有一定理解,能够在运维层面落实安全基线;
- 对新技术有热情、具备良好的自主学习能力,关注云原生生态发展,能够独立思考和技术选型、逻辑思维严谨,技术理解力强,能够从原理层面分析问题做出合理判断、良好的文档编写能力和团队协作精神。 加分项
- 独立负责过项目运维SRE经验优先;
- 有AIOps、FinOps、ChatOps中一个或多个落地实践经验优先。