招聘中 社招

推理性能优化专家-计算

字节跳动

  • 西安
  • 后端

收录时间

岗位职责

  1. 模型优化:主导LLM与多模态模型推理优化,落地INT4/INT8/FP8混合精度量化、稀疏化、Sparse Attention等稀疏注意力机制优化技术,精准平衡推理性能、模型精度与资源开销;构建标准化模型性能基准体系与全流程自动化调优和测试管线,支撑模型规模化高效部署;
  2. 通信优化:聚焦AI框架跨节点/集群通信性能攻坚,深度优化RDMA/TCP协议栈传输机制、低延迟序列化方案与通信拓扑设计;适配国产高速网卡、智能交换机等硬件,通过流量调度、通信分组策略优化,突破分布式场景下的通信瓶颈,保障大规模集群通信稳定性与效率;
  3. 计算优化:深耕Transformer核心算子、卷积、矩阵乘加(GEMM)等AI核心算子优化,基于Triton/MLIR编译框架实现算子融合、向量化执行与编译优化;适配GPU CUDA/ROCm及国产AI芯片(昇腾/寒武纪)专用指令集,最大化硬件算力利用率与算子计算效率;
  4. 全链路协同优化:迭代框架层核心特性,落地投机采样(Speculative Decoding)算法优化,优化专家路由策略与负载均衡机制,设计计算-通信精细化调度与重叠(Overlap)等方案,提升MOE架构模型推理吞吐量,识别模型部署全链路关键瓶颈,实现集群级端到端推理效率跃迁。

职位要求

  1. 具备5年以上AI领域性能优化实战经验,主导或核心参与过工业级分布式推理框架的架构设计与核心模块开发,拥有可验证的量化成果;
  2. 深度掌握C++/Python/Go任一语言的底层机制与高性能编程实践,深入理解TensorFlow/PyTorch等AI框架的内核架构、算子执行流程与分布式通信逻辑,扎实具备神经网络优化、数值计算、并行计算等核心数学基础;
  3. 至少深耕模型层(混合精度量化、稀疏化、注意力机制优化等,具备端到端推理优化落地经验)、通信层(RDMA/TCP协议栈优化、分布式通信拓扑设计与流量调度)、计算层(AI核心算子开发、TVM/Triton等编译框架应用与硬件指令集适配)任一核心方向,具备体系化实战能力;
  4. 深入了解主流AI加速硬件(NVIDIA/AMD GPU、昇腾/寒武纪等国产AI芯片)的架构特性与指令集优化逻辑,熟练运用PyTorch Profiler、NVIDIA Nsight、芯片厂商专属Profiling工具及系统级诊断工具,具备AI全链路性能瓶颈定位与调优实战能力。

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

字节跳动推理性能优化专家-计算

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看推理性能优化专家-计算正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位推理性能优化专家-计算字节跳动 · 西安

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏推理性能优化专家-计算正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

字节跳动推理性能优化专家-计算社招 · 西安

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入推理性能优化专家-计算内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。