招聘中 社招

蚂蚁集团-大模型推理与服务框架工程师-杭州/北京

蚂蚁集团

  • 北京、杭州
  • 技术类-开发

收录时间

岗位职责

● 参与大模型推理框架的设计与研发,支持业界开源、蚂蚁内部大模型以及多模态模型的高效推理。 ● 开展端到端性能分析与优化,覆盖推理调度、并行策略、KV Cache、量化、算子优化等,持续改善吞吐、时延和资源利用率。 ● 参与在线推理服务框架的设计与演进,建设模型部署、服务编排、流量治理和多模型、多模态服务能力。 ● 设计并优化在线请求调度、RPC 通信和端到端数据通路,在高并发和强 SLA 场景下平衡吞吐、时延与资源隔离。 ● 建设推理服务的可观测行和容错能力,完善监控、诊断、限流、降级与故障恢复机制,提高系统稳定性和工程质量。 ● 跟进 SGLang、vLLM、TensorRT-LLM、FlashInfer、Triton Inference Server 等推理框架和基础组件,推动先进方案在内部系统及开源社区落地。

职位要求

● 计算机基础扎实,熟悉 Linux 环境下的系统开发、性能分析和问题定位。 ● 熟练使用 Python,并掌握 C++/Rust 等高性能编程语言,能够完成生产级系统的设计、开发和维护。 ● 在大模型推理框架或高性能在线服务至少一个方向具备扎实的实践经验:熟悉 SGLang、vLLM、TensorRT-LLM 等推理框架,或具备高并发服务端、异步编程、RPC、请求调度等系统开发经验;对另一个方向有基本理解,并愿意深入完整的推理系统链路。 ● 理解大模型推理的基本机制,包括 Batching、KV Cache、并行策略、请求调度和分布式通信等,能够从端到端视角分析系统问题。 ● 自驱、结果导向,具备良好的协作和沟通能力,能够将技术方案落地为稳定、可维护的工程产物。 加分项 ● 有大规模在线推理系统的建设或优化经验,熟悉 Triton Inference Server、NVIDIA Dynamo、Ray Serve、Seldon 等推理服务或编排框架。 ● 参与过 SGLang、vLLM、Triton Inference Server 等相关开源项目。 ● 理解 GPU 或其他 AI 加速芯片架构,熟悉 CUDA、Triton、CUTLASS 、NCCL,或具备算子、图编译及代码生成相关经验。 ● 有多机多卡推理、PD 分离、量化、投机采样或多模态推理的落地经验。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

蚂蚁集团蚂蚁集团-大模型推理与服务框架工程师-杭州/北京

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看蚂蚁集团-大模型推理与服务框架工程师-杭州/北京正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位蚂蚁集团-大模型推理与服务框架工程师-杭州/北京蚂蚁集团 · 北京、杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏蚂蚁集团-大模型推理与服务框架工程师-杭州/北京正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

蚂蚁集团蚂蚁集团-大模型推理与服务框架工程师-杭州/北京社招 · 北京、杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入蚂蚁集团-大模型推理与服务框架工程师-杭州/北京内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。