岗位职责
- 构建多模态视频理解模型的数据飞轮,对语音/图片/视频 等原始语料进行结构化分析理解,参与多模态大模型的数据准备、数据清洗、数据实验等工作,构建高质量的多模态数据集。
- 针对文生视频,图生视频等不同任务,设计提示词工程,构建高质量多模态数据产出的Pipeline,提升模型对主体、动作、场景、运镜等信息的理解能力。
- 配合理解大模型SFT专项进行模型训练、评测结果分析,根据实验结果定位数据中可能存在的问题。
职位要求
- 计算机/软件工程等相关专业本科以上学历;
- 沟通主动、细心、负责、稳定性好,能够耐心处理一定量的数据筛选、质检等工作。
- 熟悉计算机视觉、多模态领域的相关研究工作和算法,有大模型相关数据处理工作经验者优先
- 学习能力强、对于大模型拥有热情;有vllm、多模态数据、算法模块经验者优先
- 可以尽快到岗,稳定实习六个月的同学优先。