岗位职责
- 负责模型训练场景中高性能计算Pipeline的实现,通过访存算子优化、算子融合、MoE/Attention算子定制,实现精细化显存管理、最大化计算/访存效率。
- 负责结合大语言模型、多模态理解生成模型、Agentic RL等场景的模型训练需求进行算子设计,实现模型-Infra的Co-Design。
- 负责世界模型、实时生成交互等场景的高性能低延迟算子设计和实现,满足模型加速上线的需求。
- 使用专业的Profiling工具和手段,对大模型训练的端到端性能进行分析,精准定位Kernel执行、数据搬运、通信等环节的瓶颈,并提出体系化的优化方案。
- 跟进业界SOTA的高性能计算工作,调研并实施异构硬件在超大规模训练场景的落地方案。
职位要求
- 工程与算法基础:计算机相关专业背景,有极佳的工程实现能力,精通 C/C++ 与 Python;具备扎实的数据结构与算法功底,熟练掌握 GDB / Nsight 等调试与性能分析工具。
- 异构计算与底层技术:熟悉异构计算体系结构,包括但不限于现代 GPU 并行架构;熟练掌握CUDA 编程、Triton 和 Cutlass 等硬件 DSL。
- 算法工程协同设计:对 LLM、多模态等大模型结构及其核心算法流程有深入理解者优先。
- 主流框架内核:精通 PyTorch / JAX / Megatron-LM 等业界主流大模型引擎的内核实现机制。精通 XLA / MLIR 等编译优化技术者优先。
- 加分项:对钻研技术有热情,勤于动手,善于动脑,不惧困难。