岗位职责
- 探索大规模多模态理解与生成的基础模型,结合眼动等生理信号进行指令微调、偏好对齐、模型优化,提升数据合成、Scalable Oversight、模型推理、规划能力,构建全面客观准确的评测系统,提升大模型能力;
- 探索前沿技术方向包括但不限于多模态RAG、Memory、Visual CoT与Agent等领域多模态模型、VLA模型、世界模型进阶能力,构建GUI/XR等虚拟世界的通用多模态Agent能力;
- 利用预训练、合成仿真等技术对XR虚拟世界/现实世界的各类人机交互动作与环境进行建模,提供多模态交互探索的基本能力,推动应用落地,研发以多模态大模型+XR设备为核心的新技术、新产品。
职位要求
- 硕士学位及以上,计算机、电子、数学等相关专业;
- 熟悉多模态大模型(VLM)、大语言模型(LLM)相关的算法技术,在相关领域有过良好的项目经验或研究经验,熟悉大模型相关的数据构造方法、预训练、Post-training算法;
- 熟悉LLM、VLM或Agent架构,熟悉RL算法(GRPO、PPO、DPO、判别式及生成式RM)、Multi-Agent算法+工程技术,有多模态内容理解应用、AI Agent应用经验的优先。 【加分项】
- 具有扎实的数学、算法和机器学习基础,熟悉CV、RL、VLM、VLA等领域的技术,在CVPR、ECCV、ICCV、NeurIPS、ICLR、SIGGRAPH等会议/期刊上发表论文者优先;
- 具有优秀的代码能力,熟悉VeRL、Trl、EasyR1等训练框架,在ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;
- 从事过人机交互(眼动追踪、手势追踪)相关算法研究、在多模态、大模型、基础模型、强化学习、Agent等领域,主导过项目者优先。