岗位职责
- 端侧部署加速:负责模型在边缘设备的部署,开展量化、剪枝、蒸馏及算子融合等轻量化技术的研发与工程落地;
- 云端推理优化:基于 vLLM、Triton 等框架进行大模型推理服务的架构设计与调优,优化 KV Cache 与动态批处理,提升高并发吞吐量;
- 底层算子开发:参与 CUDA 等高性能算子开发与图编译优化,解决显存溢出及长稳运行等工程难题。
职位要求
- 计算机、AI等相关专业本科及以上学历;
- 精通 C/C++ 与 Python,熟悉 Linux 开发环境;
- 深入理解 Transformer 架构,熟悉 vLLM、TensorRT 等推理框架及模型压缩技术;
- 具备 CUDA Kernel 开发、ACM 竞赛获奖或开源推理框架贡献经验者优先。