岗位职责
- 参与强化学习核心算法的设计、实现与优化,探索 RL 在扩散模型去噪过程中的应用,包括但不限于 PPO、DPO、GRPO、DAPO、ReFL等内容;
- 参与强化学习训练框架建设,搭建并且持续优化 Agentic RL 链路;
- 参与奖励模型和偏好数据集的构建与迭代,设计针对多模态生成质量(美学、一致性、指令遵循)的细粒度评价信号;
职位要求
- 本科及以上学历,计算机、人工智能、数学、自动化等相关专业(硕士/博士优先);
- 了解自然语言处理、计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构;
- 熟悉至少 2 种主流强化学习算法原理,熟悉至少一种强化学习训练框架;
- 熟练使用 PyTorch 框架,有从零复现顶会 RL 论文代码的能力;
- 有 Diffusion Model(DDPM/DDIM/Flow Matching)或 LLM/VLM 的后训练(SFT/RLHF/DPO)项目经验者优先;
- 在 NeurIPS/ICML/ICLR/CVPR/ACL 等会议有投稿或发表经历者优先。