招聘中 社招

【技术保障】模型推理优化专家

得物

  • 杭州、上海
  • 技术类

收录时间

岗位职责

推理性能优化

  1. 对LLM在线推理全链路进行性能分析与瓶颈定位,针对性优化 TTFT、TPOT、吞吐等核心指标。
  2. 深入调优推理引擎(vLLM/SGLang/TensorRT-LLM等),包括 KV Cache 管理、continuous batching、量化、推测解码等关键技术。
  3. 结合业务 SLO 要求,设计推理部署方案(机型选型、并行策略、batch 策略等),在满足延迟约束的前提下最大化 GPU 利用率 平台工程与成本优化
  4. 基于Kubernetes设计和落地 GPU 工作负载的调度策略,包括算力调度、虚拟化资源管理、拓扑感知、亲和性、HPA等。
  5. 识别低利用率、低性价比算力选型等资源低效问题,推动资源整合与优化,降低单位推理成本。
  6. 参与 AI 平台产品设计和研发,从工程角度出发不断优化推理服务管理模式和流程,提升用户体验和效率。 业务协同与降本增效
  7. 与业务团队深度合作,理解其推理场景特征(模型大小、请求分布、延迟要求),提供定制化的优化方案,并推进落地
  8. 推进推理性能与成本的可观测体系建设,在大语言模型推理场景践行FIinops理念。

职位要求

  1. 具备扎实的 LLM 推理优化实战经验,能独立分析并优化TTFT、TPOT、吞吐等核心指标,有可量化的优化案例优先。
  2. 深入理解至少一种主流推理框架(vLLM/SGLang/TensorRT-LLM/Triton等)的原理与调优方法。
  3. 熟悉 Kubernetes 核心机制:调度器、资源模型、DevicePlugin机制、节点亲和性、HPA/KEDA等,有基于 Kubernetes 的 GPU 工作负载研发和运维经验。
  4. 具备系统级性能分析能力,能使用 nsys、nvtop、perf、eBPF 等工具定位 GPU / CPU / 网络等瓶颈问题。

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

得物【技术保障】模型推理优化专家

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看【技术保障】模型推理优化专家正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位【技术保障】模型推理优化专家得物 · 杭州、上海

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏【技术保障】模型推理优化专家正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

得物【技术保障】模型推理优化专家社招 · 杭州、上海

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入【技术保障】模型推理优化专家内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。