岗位职责
本岗位偏向前沿研究与技术探索,聚焦多模态生成基础模型的底层表征问题,为大规模高质量数据构造与下一代多模态基础模型提供核心表征支撑。
- 全模态统一表征:构建图像、视频、音频等模态统一的融合表征技术,探索不同模态间的高效联合建模范式,突破视频表征、音视频联合表征、物理规律表征等核心难题;
- 统一编码器与生成架构:研究面向多模态的统一编码器 / Tokenizer 设计,探索原生表征与生成模型架构的协同设计方式,为下一代多模态生成模型提供表征支撑;
- 条件可控表征:开展多模态大模型驱动的条件可控表征研究,应用于全流程多模态数据管线,助力打通""表征—数据—模型""的数据飞轮,支撑大规模高质量多模态数据的构造和持续扩展(scaling);
- 推动相关技术在多模态模型研发中的落地闭环,持续跟进前沿,主导算法创新,沉淀高质量的原创工作。
职位要求
- 计算机、人工智能等相关领域博士学历(或有突出研究成果的硕士),在机器学习、计算机视觉、多模态、大模型等领域有扎实的理论基础与研究经验;
- 在多模态表征学习、自监督学习、跨模态对齐、多模态生成、视觉/音频编码建模(Encoder/Tokenizer/VAE)等一个或多个方向有深入研究,对表征与生成模型的协同优化有独到理解者优先;
- 具备出色的科研素养与独立研究能力,能完成从问题定义、方案设计到大规模实验验证的完整研究闭环;在上述方向以第一作者身份发表 NeurIPS/ICML/ICLR/CVPR/ICCV/ECCV等高水平论文,或有知名开源项目贡献、大规模工业界落地产出者优先;
- 有强自驱力与前沿探索热情,善于独立思考与反思总结,具备良好的沟通与团队协作能力。