招聘中 社招

多模态大模型推理框架优化工程师-Data AML(北京/上海/杭州/深圳)

字节跳动

  • 北京
  • 基础架构

收录时间

岗位职责

  1. 推理性能优化:负责Seedance、Seedream、Seed3D等SOTA模型推理链路的端到端性能优化,围绕GPU利用率、推理吞吐(tokens/s)、延迟(TTFT/TPOT)、显存效率等核心指标,系统性地定位瓶颈并推动优化落地;
  2. 多卡通信优化:设计与优化多卡推理场景下的通信策略(TP/PP/EP),降低集合通信开销,实现通信与计算的高效Overlap,提升多卡线性扩展效率;
  3. GPU架构理解与适配:深入理解GPU硬件架构特性,针对新硬件能力做推理策略适配与性能调优,充分释放硬件算力;
  4. 多模型推理加速:支持多模态(VLM)/视频生成(DiT/VAE)/MoE等多种模型架构的推理加速,设计通用可扩展的优化方案;
  5. 前沿技术预研:跟踪推理加速前沿方向,推动技术选型与生产落地。

职位要求

  1. 计算机相关专业本科及以上学历,精通C++/Python中的至少一门,有扎实的系统编程与性能优化基础;
  2. 熟悉GPU体系结构:理解SM调度、显存层次(HBM/L2/Shared Memory)、计算与访存瓶颈分析模型(如Roofline Model);
  3. 熟悉Transformer模型推理流程,理解KV Cache、Attention计算模式、Tensor Parallelism通信拓扑等核心概念;
  4. 具备较强的性能分析能力:能熟练使用性能分析工具,系统性定位计算、访存、通信瓶颈;
  5. 对推理加速有浓厚兴趣,善于从硬件原理和系统全局出发思考优化策略,有较强的分析和解决问题的能力。 加分项:
  6. 有大模型推理优化实战经验、有多卡通信优化经验、熟悉多代GPU微架构差异、有跨硬件性能适配经验;
  7. 有视频生成模型(DiT/VAE)或MoE模型的推理加速经验;
  8. 熟悉Kubernetes/Docker,有GPU集群资源调度与推理服务部署经验。

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

字节跳动多模态大模型推理框架优化工程师-Data AML(北京/上海/杭州/深圳)

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看多模态大模型推理框架优化工程师-Data AML(北京/上海/杭州/深圳)正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位多模态大模型推理框架优化工程师-Data AML(北京/上海/杭州/深圳)字节跳动 · 北京

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏多模态大模型推理框架优化工程师-Data AML(北京/上海/杭州/深圳)正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

字节跳动多模态大模型推理框架优化工程师-Data AML(北京/上海/杭州/深圳)社招 · 北京

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入多模态大模型推理框架优化工程师-Data AML(北京/上海/杭州/深圳)内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。