岗位职责
- 多模态基座模型数据建设:参与 Kling-Keye 多模态基座模型的数据迭代工作,覆盖图像、视频、文本、音频及跨模态交互数据,围绕模型预训练、指令微调、偏好对齐与能力增强等阶段,协助构建高质量、多样化、可规模化复用的数据资产;
- 大规模任务体系设计与样本构建:参与建立面向多模态大模型的大规模任务体系,覆盖图像理解、视频理解、文本推理、跨模态问答、OCR、Caption、复杂指令遵循、Agent 工具调用、多轮交互、长上下文理解等方向,基于真实业务场景拆解模型能力需求,设计任务模板、标注规范与样本构造流程,持续产出优质训练样本;
- Agent 数据迭代与复杂任务构建:围绕 Agent 的推理规划、工具调用、任务执行、结果校验、多轮反馈等核心能力,参与构建高质量 Agent 数据集,支持从开放域任务、业务场景、用户反馈和模型 badcase 中沉淀可训练样本,提升模型在复杂任务中的理解、决策与执行能力;
- RL / 偏好数据建设支持:参与强化学习与偏好对齐相关数据建设,包括偏好样本设计、候选回答对比、奖励信号构建、规则校验、模型输出评估及人工反馈数据整理。支持 RLHF、RLAIF、DPO/GRPO 等训练流程中的数据准备与质量分析,帮助模型在真实业务目标上持续优化;
- 数据质量评估与飞轮迭代:参与多模态数据的清洗、筛选、质检、去重、难度分层与质量评估,协助建立数据质量指标与数据看板,基于模型训练效果、评测结果、用户反馈和线上 badcase,分析数据短板,推动“业务反馈-数据构建-模型训练-效果评估”的闭环迭代;
- 前沿数据方法调研与落地:跟踪多模态数据合成、自动标注、模型辅助质检、Agent 轨迹生成、RL 数据构建、数据选择与数据配比等前沿方法,参与实验复现与效果分析,将可行方案应用到 Kling-Keye 数据生产流程中。
职位要求
- 计算机、人工智能、软件工程、数据科学、自动化、电子信息、数学等相关专业在读本科、硕士或博士,熟悉机器学习、深度学习、多模态大模型或自然语言处理方向者优先;
- 对高质量数据如何影响大模型能力有基本理解,具备良好的任务拆解能力和数据敏感度,能够围绕模型能力目标设计任务、构造样本、分析 badcase,并持续优化数据质量;
- 了解图像、视频、文本、OCR、Caption、VQA、多轮对话、Agent、工具调用等多模态任务形态,具备多模态数据标注、清洗、评估、Prompt 设计或指令数据构建经验者优先;
- 熟练使用 Python,具备基础的数据处理、脚本开发、自动化分析和可视化能力,熟悉 Pandas、SQL、Hive、Spark、数据标注平台、评测平台或大规模数据处理流程者优先;
- 了解 RLHF、RLAIF、DPO、偏好数据、奖励模型、自动评测或模型对齐流程者优先,有大模型训练数据、偏好数据、Agent 轨迹数据或合成数据构建经验者优先。 加分项,有以下经验者优先:
- 参与过多模态大模型、Agent、数据合成、模型评测相关项目;
- 熟悉 OpenAI / Claude / Gemini / Qwen / InternVL / LLaVA 等模型能力与调用方式;
- 有高质量开源项目、论文、竞赛、实习或复杂数据项目经验;
- 对 AIGC、视频生成、图像理解、智能 Agent、Data-centric AI 有浓厚兴趣;
- 对大模型数据建设有强烈兴趣,认同高质量数据在模型能力提升和商业化落地中的核心价值;
- 学习能力强,执行力强,能够在开放问题中快速拆解任务、推动落地并复盘效果;
- 具备良好的沟通协作能力,能够与算法、工程、产品、标注和业务团队高效配合。