岗位职责
- 负责公司研发基础设施相关系统的架构设计、研发与持续演进,覆盖编译构建、制品管理、数据分发和软件供应链等方向,建设稳定、高效、易用的平台能力,支撑多语言、多架构及全球化研发交付场景;
- 建设面向大规模AI训练与推理业务的基础设施,围绕镜像构建、镜像与制品分发、缓存、存储和跨区域传输等关键链路进行极致优化,解决高并发、大吞吐、快速扩缩容场景下的性能、稳定性与资源效率问题;
- 建设和演进公司级AI扩展能力生态及Skill Market,面向公司公共市场与团队私有空间,支持Skill、Plugin等多种扩展形态的开发、版本管理、发布分发、质量评测和生态治理,降低AI能力的生产与使用门槛;
- 深度使用AI研发面向特定领域的Agent,将领域知识、业务数据和系统工具沉淀为可理解、可调用、可执行的能力,解决编译排障、Oncall、SDK依赖升级、风险治理、故障诊断与自愈等传统方案难以高质量解决的问题,推动AI从辅助分析走向闭环解决;
- 负责大规模分布式系统的架构与性能优化,持续提升系统吞吐、可靠性、可观测性和研发体验;深入理解业务需求,与研发、安全、基础架构及AI业务团队协作,推动复杂项目落地和规模化应用。
职位要求
- 计算机相关专业,本科及以上学历,具备后端系统设计、研发与持续演进经验;
- 熟练掌握Go、Java、C++、Python、Rust等编程语言中的一种或多种,具备扎实的计算机基础、良好的编码习惯和工程能力;
- 熟悉分布式系统相关技术,在存储、计算、任务调度、缓存、消息队列、可观测性或稳定性治理中的一个或多个方向有实践经验;
- 具备较强的问题分析、系统设计和工程落地能力,能够在复杂链路中定位问题,并推动长期、体系化的解决方案;
- 有好奇心和技术热情,关注AI技术在软件工程中的应用,具备良好的学习能力、自我驱动力、沟通协作和项目推动能力。 加分项
- 有DevOps、CI/CD、构建系统、制品仓库、云原生或软件供应链安全等相关领域经验;
- 有AI Agent、RAG、工具调用、MCP/Skills、AI评测或AI可观测性等实践经验;
- 有分布式系统、全球化多区域系统或AI训练与推理基础设施经验,或有相关开源社区贡献。