岗位职责
参与下一代世界模型与视频生成基础模型的研究与研发,探索模型对真实世界空间、物理动态与长期演化规律的建模能力。 参与大规模生成模型(Diffusion / Autoregressive Models 等)的预训练与架构探索,研究高效时空表征、模型 Scaling、训练稳定性及推理效率等核心问题。 探索文本、图像、视频、动作、3D / 4D 等多模态信息在世界模型中的统一建模与对齐机制,提升模型在复杂开放场景下的生成质量与可控性。 参与世界模型关键前沿问题研究,包括但不限于长视频生成、超长程时空一致性、长期记忆、物理规律学习、交互式生成与复杂动作控制等。 快速跟进并复现世界模型、视频生成及多模态基础模型领域的前沿工作,在真实大规模数据与算力环境中验证新的算法想法,并推动优秀研究成果形成论文、开源项目或实际模型能力。
职位要求
计算机、人工智能、自动化、数学等相关专业硕士或博士在读,优秀本科生亦可。 具备扎实的深度学习基础,熟悉 Transformer、Diffusion Model、Autoregressive Model 等至少一种主流生成模型架构。 具备良好的 PyTorch 编程能力,能够独立完成论文阅读、算法实现、实验设计与结果分析。 对世界模型、视频生成、多模态大模型、空间智能等方向具有浓厚兴趣,对模型为什么能够学习并预测真实世界抱有强烈好奇心。 具备良好的研究能力与工程能力,能够在开放问题和不确定环境中快速学习、提出假设并通过实验验证。 加分项: 有视频生成、图像生成、世界模型、VLM / LMM、3D / 4D 视觉等相关研究或项目经历; 有大规模模型预训练、后训练、分布式训练或模型加速经验; 在 CVPR、ICCV、ECCV、NeurIPS、ICLR、ICML、AAAI 等会议发表过论文,或有高质量开源项目; 对世界模型 Scaling Laws、长程生成、交互式视频生成、物理世界建模等前沿问题有自己的理解和判断。