岗位职责
- 负责多模态理解大模型的前沿算法研究、实现与优化,重点攻克图像/视频理解、视觉问答、跨模态交互等关键任务。
- 参与构建和清洗大规模多模态数据集,探索数据增强策略,并可能建设高效的数据生产、标注和评估 pipeline,涵盖通用数据、视频、OCR等场景。
- 具备技术前瞻性与创新能力,跟踪国际最新技术动态,探索如多模态理解创新架构、音视频理解、Agentic RAG、AI Memory等新方向,并提出创新算法或方案,推动学术前沿发展。
职位要求
- 硕士及以上学历,计算机、人工智能、电子、机器人等相关专业。
- 在计算机视觉、多模态、机器学习等一个或多个领域有深入的研究者。
- 深入理解深度学习、计算机视觉和自然语言处理基础知识,对VLM/MLLM模型原理有清晰认识。
- 具备良好的团队合作精神和沟通能力,对解决富有挑战性的技术问题有浓厚兴趣。 加分项:
- 拥有在ICLR、CVPR、ICCV、ECCV、NeurIPS、ICML等顶级会议或期刊上发表论文的经历。
- 具备优秀代码能力,有ACM、NOI/IOI等比赛获奖者。
- 在多模态大模型、大语言模型、强化学习等领域主导或参与过重大影响力项目者。