岗位职责
- 负责机器学习平台MaaS后端架构设计与核心研发,构建在离线推理公共基础组件,支撑大模型与通用机器学习的全场景服务;深度参与大规模异构算力调度建设,为司内海量业务提供高并发、高可用、高性能的模型服务部署与 API 接入能力,支撑基座模型研发生产中的在离线部署、数据生成与评测场景,持续提升平台稳定性、效率与用户体验;
- 负责 MaaS 平台后端核心系统设计、研发与迭代,覆盖模型服务部署、编排、升级、调用全链路,打造可复用、可扩展、可观测的统一平台能力;
- 参与海量异构算力资源调度系统建设,实现弹性调度、负载均衡与资源效率优化;
- 构建高并发、高可用、低延迟的模型服务接入层与API网关,支撑司内海量业务调用与流量调度,通过限流、熔断、降级、容灾、全链路监控与问题归因等手段持续优化系统稳定性;
- 持续迭代平台易用性与运维效率,实现模型模板化一键部署,拓展多场景、多卡型、多推理框架部署能力;支撑模型快速集成发布、评测部署推理效率提升,保障内部基模研发与业务迭代需求;
- 参与技术方案评审、架构演进与代码质量管控,推动平台标准化、自动化建设。
职位要求
;
- 本科及以上学历,计算机、软件工程、人工智能等相关专业,3 年及以上大规模分布式后端研发经验;
- 精通 Java/Golang/Python 至少一门主流开发语言,具备扎实的数据结构、算法、代码编写、工程开发基础;
- 具备高并发、高可用分布式系统实战经验,熟悉微服务、消息队列、缓存、分布式存储等技术栈;
- 参与过 AI 平台、MaaS、算力调度、API 网关、服务治理中至少一项相关研发工作;且具备大规模模型服务部署、高并发 API 网关、流量调度优化的实际落地经验;
- 熟悉云原生技术栈(如K8s、Docker、ServiceMesh等),具备容器化研发与部署相关经验;
- 了解机器学习 / 大模型在离线推理全流程,熟悉PyTorch、TensorFlow、VLLM、SGLang等至少一个深度学习/推理加速框架;
- 具备优秀的架构思维、问题定位能力与项目推进能力,责任心强、学习能力突出、善于跨团队协作;
- 加分项;
- 参与过大语言 / 多模态模型部署、异构算力调度、推理性能优化相关项目;
- 有模型评测平台、在离线推理统一平台、企业级AI基础设施建设经验;
- 开源社区贡献或技术博客输出。