岗位职责
- 云原生架构设计与保障:深入参与云原生基础设施及业务系统的架构设计、容量规划和上线评审,主导服务全生命周期管理,确保系统具备极致的高可用性、弹性和可持续演进能力;
- SRE AI Agent体系建设(核心亮点):探索并落地垂直于SRE场景的智能Agent;基于大模型(LLM)与RAG技术,架构并研发具备“感知-决策-执行”闭环能力的AI智能体(如:智能辅助排障、日志异常根因分析、容量智能预估、基于自然语言交互的自愈系统),推动传统运维向AIOps升级;
- 构建高可用与自动化工程:负责大规模计算、存储及大数据等核心系统的稳定性;通过研发平台化工具,将变更、限流、容灾降级等应急手段高度代码化,消除无差别的重复劳动(Toil);
- 可观测性与数据驱动治理:围绕SLO/SLI构建完善的可观测性体系;主导复杂、高并发链路的性能瓶颈分析;基于海量监控数据与AI模型结合,实现故障的提前预测与精准告警;
- FinOps与成本极限优化:基于业务潮汐与使用场景,通过精细调度、弹性扩缩容、离在线混合部署等技术,持续优化超大规模集群的计算及存储成本。
职位要求
- 经验与学历:计算机、软件工程或相关专业本科及以上学历,具有5年以上分布式系统研发或SRE/基础架构工作经验;
- 扎实的底层功底:深入理解Linux操作系统内核原理(进程、内存、文件系统)、网络及TCP/IP协议栈,具备硬核的系统级排障与性能调优能力;
- 强大的工程与编码研发能力:精通Go/Python/Java/C++中的至少一门语言(Go优先),具备优秀的后端架构设计能力,能高质量交付平台级软件系统;
- 云原生技术栈:深入理解Kubernetes面向容器的生态体系,熟悉微服务架构、Service Mesh及开源监控生态(如Prometheus、OpenTelemetry)及其底层原理;
- AI工程化与系统性思维:具备敏锐的高质量工程感知力,能够以“系统化思维”解决复杂技术难题;保持对AI前沿领域的学习热情,对数据和技术始终充满敬畏感。