岗位职责
近年来,随着人工智能和深度学习技术的迅猛发展,多模态大模型(Multi-modal Large Models)取得了显著的进展。这些模型能够通过处理多种数据类型(如文本、图像、视频、音频等)来完成复杂的任务,与传统单一模态模型相比,展现出更强的理解与推理能力。尤其是在语言、视觉和音频等领域,多模态大模型为诸多实际问题提供了创新的解决方案,并越来越广泛地应用在产业和科研领域,显著提高了自动化和智能化的水平。 本项目将着眼于以下几个层面技术,以推进多模态大模型对于世界的感知和交互:
- 动态视内容的理解:提升多模态大模型可以实现对视频内容的自动理解与分析能力。
- 提升模型对于图像中人类知识的理解的识别水平。
- 多模态大模型推理与理解能力的持续提升。
职位要求
候选人应为:
- 计算机及相关专业的博士或硕士研究生,且对多模态大模型有充分的兴趣;
- 最好有大模型,多模态学习、计算机视觉研究和开发经验,了解或熟悉vLLM、PyTorch、Ray等LLM推理相关系统;
- 需要产出论文和专利等高水平的学术成果。