岗位职责
本岗位聚焦视频理解方向的前沿算法研究与落地,你将参与以下工作:
- 视频精细理解:研究视频主体、运动、场景的细粒度描述方法,攻克长视频的结构化理解(人物关系、情节发展、故事主旨等),支持长视频问答与精准时序定位(temporal grounding)。
- 复杂视频推理:结合 R1 类思维链与强化学习技术,解析复杂视频事件,探索视频的因果推理、逻辑推理与跨片段信息聚合能力。
- 数据与评测体系:探索高质量视频理解数据的构建、清洗、增强与自动/半自动标注方案,搭建覆盖事件定位、过程描述、主题概括等多任务的数据生产与评测 pipeline。
- 视频理解 Agent 与系统:探索多模态大模型(VLM/MLLM)在视频理解 Agent 中的任务编排、模型路由与推理融合,推动前沿算法在真实业务场景的验证与落地。
- 前沿追踪与产出:跟踪国际最新技术动态,产出高水平论文、专利或开源成果,推动学术与工程前沿发展。
职位要求
- 硕士及以上在读,计算机、人工智能、电子、自动化、数学等相关专业。
- 在计算机视觉、多模态、机器学习等一个或多个领域有扎实的研究基础与深入的项目经验。
- 深入理解深度学习、计算机视觉与自然语言处理基础知识,对 VLM/MLLM 模型原理及主流视频理解方法有清晰认识。
- 熟练掌握 Python 及 PyTorch 等主流深度学习框架,具备良好的工程实现与实验分析能力。
- 具备较强的学习能力与钻研精神,对解决富有挑战性的技术问题有浓厚兴趣,良好的团队合作与沟通能力。 加分项
- 在 CVPR、ICCV、ECCV、NeurIPS、ICML、ICLR、ACL 等国际顶级会议或期刊上发表过论文。
- 具备优秀代码能力,有 ACM/ICPC、NOI/IOI 等竞赛获奖经历。
- 在多模态大模型、视频理解、长上下文建模、强化学习等方向主导或深度参与过有影响力的项目或开源工作。
- 在权威数据集 Leaderboard 上排名靠前,或在开源社区有较大影响力。