岗位职责
- AI 基础扎实 熟悉机器学习、深度学习、计算机视觉、多模态学习或大模型相关技术;
- 关注世界模型与视觉智能 对世界模型、视觉语言模型、视频模型、空间理解、真实世界建模等方向有持续兴趣;
- 论文阅读与学习能力强 能够快速阅读前沿论文和技术资料,理解核心方法、创新点和局限性;
- 具备技术判断力 能够对新技术的价值、边界和发展方向形成自己的判断,而不只是跟踪热点;
- 具备实验和工程能力 熟悉 Python、PyTorch、Hugging Face 等工具,能够完成模型评测、实验分析和原型开发;
- 表达清晰,逻辑严谨 能够将复杂技术问题讲清楚,并输出结构化、有洞察力的研究文档。 加分项
- 在 NeurIPS、ICML、ICLR、CVPR、ICCV、ECCV、ACL、EMNLP 等顶级会议发表过论文;
- 有视觉大模型、视频模型、多模态模型、世界模型相关项目经验;
- 有开源项目、模型、数据集或 benchmark 构建经验;
- 熟悉 GPT、Gemini、Claude、Qwen、Llama、Sora、Veo、SAM、CLIP 等前沿模型或系统;
- 对真实世界理解、物理世界建模、长期记忆、任务规划等问题有深入思考。
职位要求
- 前沿方向跟踪 跟踪世界模型、视觉大模型、多模态大模型、视频理解、空间智能等方向的最新进展,持续研究论文、技术报告、开源项目和产品实践;
- 视觉与真实世界理解研究 研究模型如何理解真实世界中的物体、场景、空间关系、运动变化、因果关系和任务过程,探索视觉模型从“识别”走向“理解”和“预测”的能力;
- 技术调研与洞察输出 围绕前沿模型、关键论文和重要技术方向,进行系统调研和分析,输出清晰的技术判断、趋势分析和研究报告;
- 模型能力评测 设计和执行视觉 / 多模态 / 世界模型相关评测任务,分析模型在视频理解、空间推理、动态预测、复杂场景理解等方面的能力边界;
- 研究原型验证 基于视觉模型和多模态模型,参与构建实验原型,验证新的技术假设,并推动研究洞察转化为可验证的系统能力。