岗位职责
- 模型多模态能力的提升,包括但不限于:物理世界细粒度视觉感知、空间感知、视频时序行为预测和推理、基于视觉的决策和规划;
- 多模态数据的制作,包括:训练数据的收集、清理和标注,测试Benchmark的构建;
- 多模态RL相关研究,包括通过RL提升模型常规感知能力和推理能力;
- 多模态任务评测,包括:客观的Benchmark接入、OOD评测、以及主观评测。
职位要求
- 计算机视觉、自然语言处理、人工智能等专业优秀在读博士;
- 熟练掌握tensorflow、pytorch等至少一种主流深度学习框架,有复杂模型设计和建模经验;
- 具备出色的学术研究和数据分析能力,有高质量学术论文、高影响力开源项目、高水平竞赛获奖经验者优先;
- 良好的自我学习能力及自驱力,对前沿领域有强探索欲,富有想象力和创造力。