岗位职责
- 标准建设:围绕图像模型预训练、后训练需求,制定 Caption 与 Recaption/PE 标准,明确主体、属性、动作、空间关系、画面文字及风格等描述维度;
- 数据生产:协同算法团队评估视觉语言模型,设计提示词与生成策略,建设适配不同图像类型、描述粒度及训练目标的 Caption 数据;推动批量生成、筛选、返修与版本管理流程落地,协同研发、标注及供应商团队,兼顾数据质量、生产效率与成本;
- prompt优化:制定 Recaption 策略,完成信息补全、错误纠正与表达优化,控制幻觉及无依据推断;
- 质量评估:建立准确性、完整性、图文一致性等评价体系,设计评测集、标注规范与质检流程,结合自动评估和人工抽检持续提升质量;
- 效果迭代:联合算法团队验证不同描述长度、信息密度与风格对训练效果的影响,结合模型表现及典型问题优化描述策略。
职位要求
- 学历要求:本科及以上学历,计算机、人工智能、语言学等相关专业优先,硕士及以上优先;
- 年限要求:具备 1 年及以上数据产品、算法策略或 AI 产品经验,有图文数据建设或多模态标注经验者优先;
- 背景偏好:具有多模态大模型、图像生成或视觉语言模型相关背景;有 Caption、Recaption、提示词优化或模型评测经验者优先;
- 能力偏好:具备良好的图像理解与语言表达能力,能够识别描述遗漏、事实错误及模型幻觉;熟悉数据分析、质量评估与实验设计;
- 协作要求:具备需求拆解、规范制定与跨团队推进能力,能够将训练需求转化为可执行的数据方案,并持续跟进效果与交付。