岗位职责
多模态生成模型前沿技术研究项目,旨在进行如下课题研究:
- 模型架构与 Scaling Law:探索面向视频生成的高效 DiT/MoE 架构,通过Attention优化、Optimizer优化、VAE 表征极限压缩,研究视频生成的 Scaling Law, 提升长时序与物理一致性生成能力;
- 音视频多模态对齐:解决视频与音频在时序、语义、情绪上的强一致性问题,支持文本/图像/视频/音频等多任务统一建模;
- 多模态生成后训练:基于 WAN基模与 RLHF/Continue Learning 后训练范式,多维度奖励模型探索,缓解长视频中的漂移、形变与物理遵循问题;
- 实时视频生成:探索Streaming、量化、注意力机制优化、CUDA 并行计算及模型蒸馏等技术,建立实时视频生成的 pipeline 级别技术解决方案与算法;
- 多模态交互式世界模型:研究多模态交互式世界模型技术框架,探索多模态生成领域的新范式。
职位要求
- 硕士及以上学历,具备扎实的多模态或者机器学习算法基础,有成果发表在CVPR,NeurIPS,ICML,ICLR,TPAMI,IJCV等顶级会议期刊者优先。
- 熟练掌握C/C++, Python等至少一门语言,ACM/ICPC,topcoder等编程比赛获奖者优先。
- 乐于沟通、分享、交流、有激情、责任心强,具备良好的团队合作、沟通能力。