岗位职责
研究多模态生成大模型,推动视频生成从少模态、短上下文,升级为丰富模态、长上下文的生成。使模型能够理解文本、图像、视频、音频、动作、镜头、ID等,能够理解用户的复杂意图。重点研究包括但不限于:
- 多模态、长上下文的统一建模,研究多模态生成大模型的数据构建、架构与训练方法;
- 提升模型的精确控制、编辑能力和组合泛化能力;提升长视频生成中人物、物体、空间关系和视觉风格的一致性;
- 研究大规模数据和大规模模型扩展下,进一步提高模型上限。研究利用好用户数据和长程轨迹数据等。
职位要求
- 熟悉多模态生成技术,有生成模型核心经验;
- 具备大模型训练、调参、实验分析和问题排查能力;
- 对数据有感觉、认同数据价值,能够深入分析数据、构建数据方案;
- 好奇心强,思路灵活,做事认真负责,愿意挑战开放问题;
- 熟练使用 AI 工具提升研发效率。 加分项
- 有大规模预训练、多模态生成模型训练直接经验;
- 有顶会论文、开源项目、产品落地经验等;
- 在ACM、NOI等竞赛中取得优秀成绩。