招聘中 社招

千问事业部-大模型算子技术专家/高级技术专家-杭州/北京/广州

千问

  • 北京、杭州、广州

收录时间

岗位职责

  1. 参与大模型训练、推理核心算子的设计、开发与性能优化,覆盖Attention、MLP、MoE GEMM、RMSNorm、RoPE、Sampling、KV Cache读写、量化/反量化等关键算子,支撑千亿/万亿参数模型的低延迟、高吞吐推理;
  2. 面向NVIDIA、AMD及其他通用AI加速硬件,研发高性能Kernel实现方案,充分利用Tensor Core、Shared Memory、异步流水、Persistent Kernel等硬件能力,持续提升算子吞吐、延迟和资源利用率;
  3. 参与FP
  4. FP
  5. INT
  6. INT4等低比特推理相关算子研发与优化,推动量化算子、算子融合、图级优化与推理框架协同落地,降低端到端推理成本;
  7. 针对线上真实负载开展系统化性能分析、Benchmark、性能归因与问题定位,解决算子性能瓶颈、稳定性和工程化落地问题,沉淀可复用的优化方法和工程实践。

职位要求

  1. 精通C++/CUDA/Python,具备扎实的计算机体系结构、并行计算和高性能计算基础,能够独立完成复杂GPU Kernel的设计、实现、调优和工程化落地;
  2. 深入理解GPU硬件架构与性能优化方法,熟悉Tensor Core、Memory Hierarchy、Shared Memory、Register、Warp Scheduling、异步流水等机制,具备系统化性能分析和瓶颈定位能力;
  3. 熟悉大模型推理核心算子,包括Attention、MLP、MoE GEMM、RMSNorm、RoPE、Sampling、KV Cache读写、量化/反量化等,有实际优化经验者优先;
  4. 熟练使用Nsight Compute、Nsight Systems、Nsys等性能分析工具,能够针对真实业务负载开展性能归因、Benchmark建设和端到端优化;
  5. 熟悉Triton、CUTLASS/CuTe、FlashAttention、FlashInfer、TensorRT-LLM、vLLM、SGLang等生态中的任一技术栈,有开源贡献或生产级优化经验者优先。

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

千问千问事业部-大模型算子技术专家/高级技术专家-杭州/北京/广州

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看千问事业部-大模型算子技术专家/高级技术专家-杭州/北京/广州正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位千问事业部-大模型算子技术专家/高级技术专家-杭州/北京/广州千问 · 北京、杭州、广州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏千问事业部-大模型算子技术专家/高级技术专家-杭州/北京/广州正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

千问千问事业部-大模型算子技术专家/高级技术专家-杭州/北京/广州社招 · 北京、杭州、广州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入千问事业部-大模型算子技术专家/高级技术专家-杭州/北京/广州内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。