岗位职责
- 高保真物理仿真器中搭建VLA模型的强化学习训练pipeline,探索VLA与RL的深度融合
- 深度理解强化学习算法,基于预训练VLA模型设计并实现RL训练方法(包含不限于离线RL、Critic、数据增强、在线RL)
- 解决仿真策略到真机部署的Sim2Real gap:接触物理差异、观测差异、执行器差异
职位要求
- 硕士及以上学历,机器人学、强化学习、计算机科学、控制工程等相关专业
- 3年以上强化学习研发经验,有机器人/具身智能领域落地经验
- 精通主流RL算法,熟悉视觉-语言-动作模型架构,有仿真训练到真机部署的完整项目经验,解决过接触物理、观测差异等实际问题