岗位职责
- 领域任务体系搭建(Taxonomy 设计) 对陌生专业领域做结构化拆解:一级领域 → 二级场景 → 任务类型 → instance 模板,产出可复用、可扩展的标注体系。
- Instance 与 Reasoning 构造 设计 instance 结构,并针对不同任务选择合适的 reasoning 获取路径。保证 reasoning 是 SFT/RFT 训练可直接使用的高质量推理链。
- 分层验证方案设计 针对不同任务定义分层校验机制。把"评价推理质量"这类模糊问题降维为可自动化、可追溯的子任务。
- Rubric 与评分标准建设 制定各方向 Rubric、评分分级与标注案例库,定义黄金集(golden sets)和奖励信号(reward signals),确保训练数据质量可量化、可迭代。擅长大批量生成高质量 rubric,而不是拍脑袋写几条规则。
- 轨迹标注与 Bad Case 归因 对模型 Rollout 产出的多步执行轨迹进行逐步标注,并对失败步骤做根因分类,输出结构化改进清单驱动训练数据补充与评测体系修正。
- 标注质量管控 建立双标一致性校验、金标抽检、系统性偏差检测与分歧仲裁机制,管理外部数据供应商交付质量、运营内部专家产能,确保标注间一致率 ≥80%,数据可直接用于 Reward Model 训练。
- 数据 → 模型 → 评测 闭环 周期性输出数据质量报告,识别模型能力薄弱区间,指导算法团队调整 Rollout 抽样策略与难度分布;随模型迭代补充更高难度标注数据,保持 Reward Model 区分度。
职位要求
- 在读博士生优先(特别优秀的硕士生可放宽);
- 在数据分析、金融、法律、医疗、电商、网络安全、芯片/半导体、Visual Design 等至少一个领域的专业经验,能基于专业知识对复杂 Agent 输出做对错裁定。
- 熟悉 Python,能独立完成数据抓取、清洗、批量调用 LLM、结果聚合等脚本化工作;能读懂 Agent 执行日志和代码片段,判断工具调用是否冗余或有隐性副作用;具备规模化数据生产经验。
- 有 AI 办公 / Cowork Agent 场景的产品或数据经验。
- 熟悉 LLM-as-judge、self-consistency、rejection sampling 等数据自动化验证方法。熟悉主流 Agent Benchmark 的评测机制。