岗位职责
- 负责视觉 - 语言 - 动作(VLA)大模型的架构设计、预训练及微调
- 主导模仿学习算法的实现与优化,包括但不限于 Behavior Cloning (BC), Diffusion Policy, ACT, RT-1/RT-2/OpenVLA 等主流范式。
- 解决机器人在复杂仓储非结构化环境下的拣选泛化问题(新物体、新指令、新场景)
- 设计与实施高效的数据采集管线,将遥操采集的多模态数据(RGB-D 图像、语言指令、关节状态、末端位姿)转化为标准化的训练数据集(如 RLDS 格式)。
- 开发数据清洗、增强、自动标注工具,提升数据质量与多样性,解决“长尾分布”数据稀缺问题。
- 搭建高保真仿真环境(Isaac Sim / MuJoCo / Habitat),利用域随机化(Domain Randomization)和域自适应技术,将仿真中训练的策略无缝迁移到真机(轮式底盘 + 双臂)。
- 协同系统集成团队,优化模型推理延迟,实现实时的端到端控制(End-to-End Control)
职位要求
- 计算机、机器人、自动化、人工智能等相关专业,硕士及以上学历(博士优先)
- 3 年以上深度学习或机器人控制算法开发经验,至少 1 年具身智能/机器人实操项目经验。
- 精通 PyTorch/JAX 框架,有从头复现或改进过开源 VLA 模型(如 OpenVLA, Octo, RT-X, Diffusion Policy)的成功案例。
- 深刻理解 Transformer 架构及其在时序动作预测中的应用。
- 熟练掌握模仿学习核心算法(BC, GAIL, Diffusion Policy, ACT 等),对如何处理多模态输入对齐有独到见解。
- 熟悉机器人运动学/动力学基础,理解 ROS/ROS2 通信机制。
- 具备极强的代码工程能力,能够编写高效、可维护的 C++/Python 代码。