招聘中 社招

大模型推理优化工程师

招聘方暂未公开

  • 上海
  • 技术类

收录时间

岗位职责

  1. 负责大语言模型及多模态模型的推理性能优化,包括但不限于首字延迟(TTFT)、吞吐量(Throughput)和显存占用的优化,确保模型在线上生产环境的高效稳定运行。
  2. 深入研究和落地主流推理加速框架(如 vLLM, TensorRT-LLM, TGI, SGLang, LightLLM 等),针对特定业务场景进行定制化开发与适配。
  3. 负责高性能算子开发与优化,熟练使用 CUDA、Triton、FlashAttention 等技术,针对 Transformer 结构进行底层计算加速。
  4. 探索并实现先进的推理优化算法,如 KV Cache 优化(PagedAttention, RadixAttention)、量化(INT8/INT4/FP8)、模型剪枝、投机采样(Speculative Decoding)、连续批处理(Continuous Batching)等
  5. 参与推理服务系统的架构设计与开发,优化分布式推理策略(如张量并行 TP、流水线并行 PP),提升大规模集群下的推理扩展性。
  6. 与算法团队紧密配合,打通从模型训练到推理部署的全链路,推动模型压缩与端侧/边缘侧部署的落地。

职位要求

  1. 计算机科学、电子工程、数学或相关专业本科及以上学历,3年以上高性能计算或AI系统开发经验。
  2. 精通 C++ / Python 编程,具备优秀的代码实现能力和工程素养,熟悉 Linux 开发环境。
  3. 深刻理解 Transformer 模型架构及 LLM 推理原理,对自回归解码过程中的计算瓶颈有清晰的认知。
  4. 熟练掌握至少一种主流深度学习框架(PyTorch, TensorFlow)的底层机制,有 PyTorch 算子开发或模型导出(ONNX/TorchScript)经验者优先。
  5. 具备扎实的 GPU 编程基础,熟悉 CUDA 编程模型

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

招聘方暂未公开大模型推理优化工程师

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看大模型推理优化工程师正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位大模型推理优化工程师招聘方暂未公开 · 上海

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏大模型推理优化工程师正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

招聘方暂未公开大模型推理优化工程师社招 · 上海

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入大模型推理优化工程师内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。