岗位职责
- 负责 Agentic 图像生成预训练研究,探索基于 Agent 场景的图像生成能力,包括但不限于:构建 Agentic RL Reward Model、统一建模设计、多模态联合训练等;
- 搭建高可用、可扩展的视频生成能力,优化 Agentic 视频生成效果,实现端到端的长视频生成;
- 探索3D、数字人、音频等能力在 Agent 场景下的应用。
职位要求
- 在扩散模型、自回归模型、多模态生成与理解、计算机视觉、AIGC、计算机图形学等一个或多个方向有深入的研究积累;
- 具备扎实的机器学习理论与基础算法功底;
- 熟悉主流生成模型(Diffusion / DiT / VAR 等)的训练与优化,有大规模多模态训练或视频生成相关经验者优先。