岗位职责
- 负责超长视频内容的前沿算法研究、实现与优化,重点攻克高效的长视频处理机制,如关键帧选择、特征压缩和记忆机制。
- 参与构建和清洗大规模多模态数据集,优化长视频理解在视频问答、内容摘要等任务上的准确率,优化视频场景下模型的推理能力。
- 具备技术前瞻性与创新能力,跟踪国际最新技术动态,探索如多模态理解创新架构、音视频理解等新方向,并提出创新算法或方案,推动学术前沿发展。
职位要求
必备条件:
- 硕士及以上学历,计算机、人工智能、电子、机器人等相关专业。
- 在计算机视觉、多模态、机器学习等一个或多个领域有深入的研究者。
- 深入理解深度学习、计算机视觉和自然语言处理基础知识,对VLM/MLLM模型原理有清晰认识。
- 具备良好的团队合作精神和沟通能力,对解决富有挑战性的技术问题有浓厚兴趣。 加分项:
- 拥有在ICLR、CVPR、ICCV、ECCV、NeurIPS、ICML等顶级会议或期刊上发表论文的经历。
- 具备优秀代码能力,有ACM、NOI/IOI等比赛获奖者。
- 在多模态大模型、大语言模型、强化学习等领域主导或参与过重大影响力项目者。