岗位职责
- 依托可灵生态,构建最具影响力的多模态理解基座模型和开源生态;
- 参与多模态大模型架构探索,包括但不限于万亿级参数多模态MoE模型的训练、多模态信息编码方案设计、探索更高效的图文/视频/音频等编码方式、多模态表征学习和语义对齐策略的探索、超长上下文模型开发等;
- 参与高质量训练数据构建,包括从但不限于大规模混合模态预训练数据构建(探索多模态Scaling)、高质量多模态语义对齐数据合成、探索模型自我迭代提升路径、感知能力专家模型研发(包括OCR、Caption、Grounding等);
- 协助研发理解与生成统一大模型的基础架构,涵盖多模态输入和输出在内的建模,实现模型在理解与生成任务上的协同优化效果。
职位要求
- 计算机科学与技术、人工智能等相关专业的硕士或博士学历,有计算机多模态/NLP/CV相关实习经验,有较强的coding能力优先;
- 热衷于通用大模型及新兴技术领域,具备独立开发尖端模型的能力,且拥有在NLP、CV、ML顶尖会议或期刊上发表研究成果的经历者将获得优先考虑;
- 有良好的数学和编程基础,熟悉至少一种深度学习框架(如 TensorFlow、PyTorch);
- 具备良好的沟通能力和团队合作精神。