岗位职责
- 负责大语言模型及多模态模型的推理性能优化,包括但不限于首字延迟(TTFT)、吞吐量(Throughput)和显存占用的优化,确保模型在线上生产环境的高效稳定运行。
- 深入研究和落地主流推理加速框架(如 vLLM, TensorRT-LLM, TGI, SGLang, LightLLM 等),针对特定业务场景进行定制化开发与适配。
- 负责高性能算子开发与优化,熟练使用 CUDA、Triton、FlashAttention 等技术,针对 Transformer 结构进行底层计算加速。
- 探索并实现先进的推理优化算法,如 KV Cache 优化(PagedAttention, RadixAttention)、量化(INT8/INT4/FP8)、模型剪枝、投机采样(Speculative Decoding)、连续批处理(Continuous Batching)等
- 参与推理服务系统的架构设计与开发,优化分布式推理策略(如张量并行 TP、流水线并行 PP),提升大规模集群下的推理扩展性。
- 与算法团队紧密配合,打通从模型训练到推理部署的全链路,推动模型压缩与端侧/边缘侧部署的落地。
职位要求
- 计算机科学、电子工程、数学或相关专业本科及以上学历,3年以上高性能计算或AI系统开发经验。
- 精通 C++ / Python 编程,具备优秀的代码实现能力和工程素养,熟悉 Linux 开发环境。
- 深刻理解 Transformer 模型架构及 LLM 推理原理,对自回归解码过程中的计算瓶颈有清晰的认知。
- 熟练掌握至少一种主流深度学习框架(PyTorch, TensorFlow)的底层机制,有 PyTorch 算子开发或模型导出(ONNX/TorchScript)经验者优先。
- 具备扎实的 GPU 编程基础,熟悉 CUDA 编程模型