岗位职责
- 负责阿里公有云体系各场景和形态的建站交付架构顶层方案设计,探索 AI 原生的交付架构范式;负责交付项目执行落地及风险管控,引入大模型辅助的方案评审与风险预判机制。
- 基于平台和数据的持续建设,推动交付平台工具优化,提升云产品自动化交付能力;结合 Agent、RAG 等技术升级平台智能化水平,设计和输出交付平台的独立部署、版本管理及智能运维能力。
- 负责阿里云新 Region/AZ 交付项目全链路管理和风险管控,利用大模型与数据挖掘完成交付过程的现象归因与瓶颈识别,为云智能业务持续扩张发展提供资源支持和智能决策支撑。
- 结合业务和基础架构的持续演进,推进运维平台全链路的架构和系统优化、创新;参与交付侧 Agent 系统核心模块(记忆管理、推理策略、工具编排)的规划与落地,在交付过程沉淀方案、工具方法论及可复用的 AI 组件。
- 深入建站交付业务场景,负责将大模型能力融入交付全链路:通过 Prompt 工程、RAG 知识库构建、Multi-Agent 编排与流程自动化,实现交付方案生成、风险识别、故障归因等场景的智能化;建立自动化评测与回测机制,推动 AI 能力从单点验证走向规模化落地。
职位要求
- 精通至少一种高级脚本语言(如 Shell、Perl、Python 或 Go),具备利用这些语言进行复杂自动化任务和运维平台开发的丰富经验;能够结合 AI 编程工具(Cursor、Claude Code 等)高效产出生产级代码。
- 深入理解网络架构、服务器管理和操作系统原理,拥有对主流云计算(如 AWS、Azure、Google Cloud 等)业务模式、系统架构和解决方案的深刻见解;系统化运维超过 1000 台集群或大型分布式系统(计算/存储)的开发/运维背景优先;对 AI Infra(vLLM、Ollama、KV cache 优化、流式输出等)有基本理解者加分。
- 对数据运营有清晰的分析逻辑和全局思维,能提出具有创造性的解决思路和方案;能够利用大模型与数据挖掘手段完成业务现象归因,将模糊的业务痛点转化为明确的 AI 解决目标。
- 有 5~6 年云计算交付运维相关经验,对云计算产品部署和交付经验者优先;有 AI 应用或 Agent 实际落地经验(RAG 系统、多智能体编排、结合 MCP/Skill 的 Agent 项目等)者优先,可接受外派出差。
- 具备较强的表达能力,良好的团队协作能力,能够联动多团队完成业务优化的目标;具备强烈的自驱力和好奇心,能够主动探索 AI 与业务结合的边界。
- 通过英语六级(CET-6)考试,具备良好的英语读写和听说能力,能够在国际化的工作环境中高效沟通,并具备阅读前沿论文(Paper)与开源社区技术资料的能力。
- AI 编程工具重度玩家,具备较强的 Prompt 编写与调优能力;理解主流 LLM 的能力边界,熟悉 Context Engineering、Function Calling、RAG、Agent 等应用范式及主流 Agent 框架(如 LangChain、ADK 等),对大模型幻觉、Prompt 注入等风险有工程化应对思路。