岗位职责
- 参与 LLM 推理框架 的研发与性能优化,支持主流开源模型及自研模型的高效推理;
- 负责底层算子优化,包括但不限于访存模式优化、计算流水线编排、低精度量化(如 INT8/FP8)、编译优化等,持续提升硬件资源利用效率与模型推理 MFU(Model FLOPs Utilization);
- 优化推理框架上层调度策略,通过节点内及节点间的计算任务调度与通信优化,提升整体引擎性能;
- 建设与优化 LLM 模型服务相关工具与平台,提升模型部署的易用性及在线服务的稳定性。
职位要求
- 本科及以上学历,电子、自动化、计算机等相关专业优先;
- 了解分布式系统或高性能计算(HPC)相关知识,具备扎实的系统编程、数据结构、算法基础及系统设计能力;
- 熟悉 Linux 开发环境,熟练使用 PyTorch 训练框架,掌握 C++ 与 Python 编程语言;
- 具有良好的团队合作精神与沟通能力,热爱技术钻研,善于分析和解决工程问题,能够在算法与底层系统之间发挥核心桥梁作用。 加分项:
- 熟悉 TensorFlow、PyTorch、TensorRT、FasterTransformer 等主流推理/训练框架,并有相关优化经验;
- 具备大模型推理或 HPC 基础知识,了解集合通信与 CUDA 编程,熟悉 Triton、CUTLASS,有算子开发经验者优先。