岗位职责
- 参与具身智能大模型基础设施建设,支持 VLA/VLM、机器人策略模型的训练、推理与部署;
- 协同算法团队适配 CT、SFT、RL 等训练任务,完善分布式训练、数据 IO、Checkpoint 及任务调度能力;
- 参与训练性能与稳定性优化,包括计算图、计算通信重叠、显存和资源利用率优化;
- 参与模型推理链路建设,包括模型导出、量化、TensorRT/TRT-LLM 编译、服务化部署及性能分析;
- 针对延迟、吞吐、显存占用和训练效率等指标开展端到端性能优化。
职位要求
- 计算机、自动化、电子、软件工程等相关专业,本科及以上在读;
- 具备良好的编程能力,熟悉 Python;掌握 C/C++ 或 CUDA 者优先;
- 熟悉 Linux,具备良好的数据结构、算法、操作系统和计算机体系结构基础;
- 对 LLM、VLM、VLA、Diffusion 或机器人学习有基本了解,并有相关训练或部署实践;
- 了解 PyTorch 及 FSDP、Megatron、VeRL 等至少一种分布式训练框架,或 TensorRT、TRT-LLM、Triton 等推理优化工具;
- 具备较强的问题定位、工程实现和团队协作能力。 加分项:
- 有 CUDA Kernel、TensorRT Plugin、Triton Kernel 或 NCCL 通信优化经验;
- 有模型量化、Attention、KV Cache、视觉编码器或动作头优化经验;
- 有大规模训练稳定性、GPU 性能分析、异构资源调度或内存优化经验;
- 有具身智能、机器人或多模态模型训练与部署经验;
- 有 ICPC、ASC、OI、MO 等竞赛经历或相关开源项目贡献。