岗位职责
- 场景任务与数据构造设计:针对千问 C 端多种真实使用场景(对话/问答、办公类任务、安全对齐等)做结构化拆解,明确一级场景 → 二级任务 → instance 模板,产出可复用的数据体系。
- 数据来源组织:组织线上真实需求、合成任务、专家标注、公开语料等多路数据供给;对齐产品侧的需求分布,让数据贴合真实用户使用形态。
- Rubric 共建:与 Rubric 团队一起把主观体验类(回答质量、有用性、安全性)判断拆成可自动化验证的评分规则,识别本方向 rubric 上的领先能力点。
- 外部专家管理:分配任务、答疑、抽检验收,把控专家产能与交付质量;给出清晰的标注规范、边界案例与仲裁依据。
- 数据 → 模型 → 评测 闭环:读得懂千问 C 相关 benchmark 与线上指标,定位模型能力短板并反推所需数据;周期性输出数据质量报告,驱动数据补充与评测修正。
- 跨团队对接:对接产品经理、模型算法、评测团队,把千问 C 端的用户诉求与模型能力短板转化为可执行的数据任务。
职位要求
- 对千问 C 端产品或类似 C 端 AI 助手场景有系统性理解,能对模型输出做准确的对错与体验裁定。
- 有团队管理或专家协作经验,能带 5~10 人规模的数据交付。
- 有 AI/模型背景,能读懂模型 benchmark、定位能力短板并反推数据需求。
- Taxonomy 与 instance 设计能力,能独立完成从场景拆解到 instance 模板的完整链路。
- 有安全对齐或多轮体验类数据的设计经验。
- 轻量工程能力:Python 脚本化处理数据、批量调用 LLM、读得懂 Agent 执行日志。
- 闭环意识,能把用户反馈、线上 bad case 与内部标注拧成一条产线。