岗位职责
- 参与大模型推理引擎(基于SGLang 框架)的设计与核心模块开发,支持 Transformer、MoE、DiffusionLLM 等多种架构及 LLM/VLM 等模型的高性能推理。
- 运用低比特量化、投机采样、稀疏计算、分布式推理等技术,加速大模型推理速度并降低部署成本, 并优化其稳定性、易用性。
- 针对 GPU/AI 芯片架构(含自研硬件),开展针对性性能调优,优化算子、内存管理、KV Cache 管理等核心模块。
- 与算法、产品及业务团队协作,推动不同模型场景下的系统端到端性能优化。
- 关注并引入前沿大模型推理技术,参与 SGLang 及相关开源生态的维护与贡献。
职位要求
- 学历背景:计算机科学、人工智能、电子工程、数学等相关专业硕士,博士优先。
- 编程能力:精通 C++/CUDA,熟练掌握 Python,具备扎实的数据结构与算法基础,能够编写高性能、高质量的工程代码。
- 深度学习框架:熟悉 PyTorch 等主流深度学习框架,了解其底层实现机制及计算图优化原理。
- 专业技能:推理引擎经验:熟悉至少一种主流大模型推理框架(如 SGLang、vLLM、TensorRT-LLM、LMDeploy 等),了解其核心架构与优化原理者优先。
- 模型架构理解:深入理解 Transformer 架构,熟悉 MoE、Diffusion、LLM/VLM 等模型的原理与推理特性。
- 推理优化技术:掌握以下至少一项核心优化技术: - 低比特量化(INT8/INT4/FP8 等); - 投机采样(Speculative Decoding); - 稀疏计算 / 稀疏注意力; - 分布式推理(TP/PP/EP/DP 等并行策略); - KV Cache 管理与优化; - 硬件性能调优:熟悉 GPU(NVIDIA/AMD)或 AI 芯片架构,具备算子开发、内存管理、Kernel 优化等性能调优经验;有自研硬件适配经验者优先。
- 综合素质 - 工程能力:具备良好的系统设计能力和工程实践经验,能够独立完成核心模块的设计与开发; - 协作沟通:具备良好的团队协作精神和跨团队沟通能力,能够与算法、产品及业务团队高效配合; - 学习能力:对大模型推理技术有强烈的兴趣和热情,关注前沿技术动态,具备快速学习与落地能力。 【加分项】
- 有 SGLang、vLLM 等知名开源项目的贡献经验(PR、Issue、Commit 等)。
- 在顶级会议/期刊(如 NeurIPS、ICML、ICLR、MLSys、OSDI 等)发表过相关论文。
- 有大规模模型生产环境部署与性能优化的实战经验。
- 熟悉 CUDA 高级特性(如 Tensor Core、CUTLASS、Triton 等)。
- 参与过推理相关算子库(如 FlashAttention、FlashInfer 等)的开发或优化。
- 有 MoE 大规模分布式推理或多模态模型(VLM)推理优化经验。