岗位职责
- 负责研发业界领先的多模态理解与生成统一架构,从事基础模型预训练、监督微调、架构优化等,重点探索感知(理解)与生成能力的协同演进与边界突破;
- 研究高效建模多模态数据(图像、文本、视频等)的新范式,提升模型的信息表征、理解与联合生成能力;
- 探索并研发更高效的视觉编码器,构建更强大的多模态模型基础;
- 发表高水平学术论文和开源项目,提升团队在学术界、工业界的技术影响力。
职位要求
- 硕士及以上学历,计算机、人工智能、数学等相关专业;
- 具备扎实的计算机视觉、深度学习和多模态学习基础,熟悉 Diffusion、Flow matching、DiT、VLM等相关技术;
- 自我驱动力强,具有优秀的分析和解决问题的能力。 加分项:
- 有相关研究或者项目经验;
- 有相关方向高水平期刊或会议论文发表经历;
- 做过有影响力的开源项目或产品。