岗位职责
参与视频世界模型(Video World Model)与交互式视觉生成的前沿研究,与资深研究员、工程师协作,探索时序因果建模、可控视频生成、音视频联合生成、视觉-语言-动作对齐在大模型与世界模型训练、评测和落地中的核心作用。 研究内容
- 研究并实践面向世界模型创新的视频/音视频合成数据策略(含仿真回放、自博弈、VLM 自动标注、human-in-the-loop 偏好采集),构建高时序一致性、高物理合理性的训练集;
- 迭代 Causal Video Model / Causal Forcing 训练范式,探索自回归与 Diffusion(DiT / AR-Diffusion / Self-forcing)混合架构在长时序、可交互世界模型中的稳定性与一致性优化;
- 基于 Wan、Wan-Streamer、Cosmos、CogVideoX、Open-Sora 等基座,做可控生成(action-/trajectory-/depth-conditioned)、实时流式解码、蒸馏加速(DMD / consistency / step-distillation);
- 搭建音视频联合生成与评测流水线:唇形同步、声画事件对齐、时序一致性、物理合理性、VLM-as-judge 自动打分;
- 研发面向视频生成的 Critic / Reward Model(规则+学习式),支撑 RLHF / DPO / RLVR 后训练,监控世界模型的价值对齐、风格漂移与关键指标;
- 维护贯穿预训练→SFT→RL→部署全链路的持续评估系统,输出 benchmark、dashboard 与失败案例分析。
职位要求
- 计算机 / AI / CV / 数据科学 / 数学 / 自动化 相关方向硕士或博士在读,每周可实习 4 天以上、持续 6 个月及以上;
- 精通 Python;扎实的算法、数据结构、概率与优化基础;熟练 PyTorch,熟悉 HuggingFace Transformers / Diffusers、vLLM、DeepSpeed、Megatron-LM、FSDP 中至少两项;
- 理解大模型 / 视频扩散模型训练链路:Tokenization(VAE / causal patchify)、DiT、AR video、classifier-free guidance、flow matching、distillation;
- 下述方向满足其一或多项: * 做过视频生成 / 世界模型(Wan、Streamer、Genie、GameGAN、Dreamer 系、Causal Forcing、Self-forcing 等); * 做过音视频生成 / talking head / AV sync / TTS-visual alignment; * 做过 VLM / VLA 评测、视频理解、时序定位、video-grounded QA。
- 能快速读 NeurIPS / ICML / ICLR / CVPR / ICCV / ACL 论文并复现;有独立跑通训练—评测—迭代闭环的经验;
- 自驱、能写技术文档、能和研究员对齐抽象目标并拆成实验。 加分项:
- 在 NeurIPS / ICML / ICLR / CVPR / ICCV / ECCV / ACL 等发表视频生成、世界模型、多模态学习相关论文(一作优先);
- 实操过 Wan / Wan-Streamer / Cosmos / CogVideoX / Open-Sora 微调或推理加速;
- 熟悉 Causal Forcing、Self-forcing、AR-Diffusion、DMD
- DC-AE 等时序生成训练技巧;
- 有音视频联合训练、ASR/TTS/唇形驱动、声事件对齐经验;
- 有 Ray / Spark / WebDataset 大规模数据处理,或多机多卡 DeepSpeed / Megatron 训练经验;
- 有视频 Reward Model / VLM-judge / 物理一致性评测建设经验。