岗位职责
你将建设视频和音频理解能力,包括 video caption、tagging、PE 模型训练和推理优化,包括基础模型和框架搭建以及优化,根据不同模型研发周期来持续优化理解模型的精度和效率。你的工作会直接支撑生成大规模数据筛选、自动标注、评测、agent 决策和内容分发。
职位要求
- 2028届本科及以上学历,熟悉 Omni、VLM相关模型的预训练、后训练和推理优化;能处理大规模视频/音频数据;
- 理解高质量 caption、tag 和结构化视频语义对生成模型的重要性。
- 独立负责一个理解能力,如视频 caption、tag、检索、音频理解、多模型蒸馏。 加分项: 大规模 caption pipeline、active learning、多模型 ensemble、视频检索、推荐系统、内容理解系统经验。