岗位职责
多模态生成大模型的训练和推理离不开多模态理解算法,且生成任务对于理解有其独特的需求。该项目希望能够研究最适合多模态生成大模型的理解能力,重点包括但不限于:
- 对多模态音视频进行有重点、准确的文本描述(Caption能力),提升多模态生成的效果;
- 精准理解多模态上下文(比如图像、视频、动作、身份ID、镜头等)的关联关系,构建高质量的参考、编辑等指令;
- 将用户的Prompt和意图通过理解模型准确转化为多模态生成模型的输入,提高多模态生成系统整体的效果和智能。
职位要求
- 熟悉多模态理解技术,有VLM模型的核心经验;
- 具备大模型训练、调参、实验分析和问题排查能力;
- 对数据有感觉、认同数据价值,能够深入分析数据、构建数据方案;
- 好奇心强,思路灵活,做事认真负责,愿意挑战开放问题;
- 熟练使用 AI 工具提升研发效率。 加分项
- 有大规模预训练、VLM模型训练直接经验;
- 有顶会论文、开源项目、产品落地经验等;
- 在ACM、NOI等竞赛中取得优秀成绩。