岗位职责
- 负责流式音视频理解的前沿算法研究、实现与优化,重点攻克音视频联合增强、跨模态交互、流式分析等关键任务。
- 探索音视频数据集的构建与处理,需涵盖事件定位、过程描述、情感分析、主题概括等不同类型任务,探索数据增强策略,并建设高效的数据生产、标注和评估 pipeline。
- 具备技术前瞻性与创新能力,跟踪国际最新技术动态,探索如多模态理解创新架构、音视频理解等新方向,并提出创新算法或方案,推动学术前沿发展。
职位要求
- 硕士及以上学历,计算机、人工智能、电子、机器人等相关专业。
- 在计算机视觉、多模态、机器学习等一个或多个领域有深入的研究者。
- 深入理解深度学习、计算机视觉和自然语言处理基础知识,对VLM/MLLM模型原理有清晰认识。
- 具备良好的团队合作精神和沟通能力,对解决富有挑战性的技术问题有浓厚兴趣。 加分项:
- 拥有在ICLR、CVPR、ICCV、ECCV、NeurIPS、ICML等顶级会议或期刊上发表论文的经历。
- 具备优秀代码能力,有ACM、NOI/IOI等比赛获奖者。
- 在多模态大模型、大语言模型、强化学习等领域主导或参与过重大影响力项目者。