岗位职责
- 面向具身智能、多模态 VLA/VLM、机器人策略模型等推理场景,设计并实现高性能 CUDA/C++ 算子。
- 针对 H系列 GPU 与 RTX 4090 等硬件平台,进行端到端推理性能优化,包括延迟、吞吐、显存占用和稳定性优化。
- 打通具身模型推理机部署流程,支持模型导出、量化、TensorRT/TRT-LLM 编译、服务化部署与性能 profiling。
- 有 LLM/VLM/VLA 推理链路中的关键模块的优化经验,包括 attention、KV cache、视觉编码器、动作头、后处理等。
- 针对跨卡、跨机推理通信场景,开发和优化 NCCL/RDMA/NVLink/PCIe 相关通信算子与调度策略。
职位要求
- 计算机及相关专业,本科及以上学历。
- 具备扎实的 C/C++ 编程能力,良好的数据结构和算法基础。
- 理解操作系统、计算机体系结构和 GPU 并行计算基础。
- 熟悉 CUDA 编程,有性能分析和优化经验。
- 熟悉 TensorRT/TRT-LLM,或其他 LLM 推理优化相关算子库。
- 具备良好的团队沟通、协作能力和责任心。 -加分项:
- 有 ICPC、ASC、OI、MO 等竞赛获奖经历。
- 有 CUDA kernel、TensorRT plugin、Triton kernel 或通信算子开发经验。
- 有具身智能、机器人、多模态模型推理部署经验。