岗位职责
- 参与大模型强化学习框架(RL Infra)的研发与优化,面向多模态理解、图像/视频生成及生成理解统一模型,建设高性能、易用、可扩展的 RL 基础设施;
- 参与多模态理解、Agentic RL、Diffusion RL 等场景的框架开发与性能优化,涉及训练、推理、Rollout、训推一致性等核心链路;
- 跟进强化学习领域前沿算法与系统技术,参与 Flow GRPO、ReFL、OPD 等算法和新型 RL 训练范式的工程实现与优化。
职位要求
- 计算机、人工智能等相关专业本科及以上在读,具备良好的编程基础和工程实践能力,熟悉 Python,有 PyTorch 使用经验;
- 具备深度学习基础,了解 Transformer / GPT 等模型架构,对强化学习、RLHF、Agentic RL 或 Diffusion RL 有一定了解和兴趣;
- 对大模型训练、推理或强化学习系统有较强兴趣;使用或研究过 veRL / veRL Omni、Slime、ROLL、vLLM、SGLang、FSDP、Megatron、TorchTitan 等开源项目者优先;
- 有分布式训练、Ray、集合通信、CUDA / GPU 性能优化等相关学习或实践经验者优先;
- 有较强的学习能力和技术热情,乐于钻研和解决复杂工程问题;有大模型、强化学习、多模态或图像视频生成相关项目、论文或开源贡献者优先;
- 能保证较稳定的实习时间,实习 3 个月及以上,能够长期实习者优先。