岗位职责
我们正在构建下一代多模态智能系统,我们围绕以下核心方向开展研究,欢迎对其中任一方向有深度积累或强烈兴趣的候选人加入:
- 视频生成与世界模型 :研究大规模视频生成的高效架构和训练方法,突破长时序、物理一致性等核心瓶颈;
- 多模态理解 :提升多模态表征能力,构建具备强泛化能力的多模态理解模型,实现图像、视频、音频的高质量理解;
- 语音与音频模型 :构建高自然度、强表现力的语音生成系统,探索音频-语言-视觉的多模态融合;
- 大规模预训练与后训练优化 :优化大规模多模态预训练策略,探索面向生成模型的强化学习方法,研究模型蒸馏、推理加速等部署优化技术。
职位要求
- 计算机、人工智能、自动化等相关专业;
- 在国际顶级会议/期刊发表过高质量论文,或拥有具备行业影响力的开源项目/竞赛成果;
- 对生成模型(Diffusion Models、自回归模型等)和多模态大模型(VLM/LMM)有系统性理解和实战经验;
- 具备从第一性原理出发思考问题的能力,有志于定义下一代多模态智能系统;
- 代码功底扎实,熟悉PyTorch等主流框架,具备大规模模型训练经验者优先。