岗位职责
专注于视频理解与生成应用算法研究,具体研究内容包括:
- 视频理解:通过高质量数据构建方案,实现视频的精细主体/运动/场景描述以及长视频结构化描述(如人物关系、情节发展、故事主旨),支持长视频问答与精准时序定位。同时结合R1等前沿思维链技术解析复杂视频事件,视频逻辑推理等;
- 视频生成:聚焦视频DiT/AR等前沿架构下的垂类微调,包括复杂人体运动/场景动效生成与可控编辑技术,研究多模态指令驱动的视频编辑、人体运动增强及物理约束建模方法,提升生成视频的动态质量与风格迁移能力。
职位要求
- 博士在读,计算机相关专业优先;
- base地可选北京和杭州,杭州优先;
- 具有扎实的计算机视觉或大模型算法基础,对主流大模型的原理和使用有深入的理解,有成果发表在CVPR、ICCV、ECCV、NeurIPS、ICML、ICLR等国际顶级会议期刊者优先;
- 可以持续实习至少6个月.