岗位职责
研究领域: 数据合成与标注 项目简介: 团队正在构建 In-House Data Quality Benchmark——一套面向内部 Cowork(人机协同)工作流的数据质量评估基准,覆盖 SFT 指令数据、RLHF 偏好数据、CoT 思维链数据三大场景,定义了事实准确性、逻辑连贯性、指令遵从度、表达多样性、安全合规、人机一致性等 10 个细粒度评估维度。 当前 Cowork 工作流("AI 预生成 → 人工审核/修订 → 质量校验 → 入库")在生产实践中面临四个核心问题:
- 质量无量化标准:数据质量依赖标注员主观判断,跨标注员、跨批次波动大,缺乏客观可复现的评估基准。
- 协作策略效果未知:工作流中 AI 预生成参数(模型、温度、n-shot)、人工修订深度、审核阈值等变量对最终数据质量的影响未经验证,配置依赖经验直觉。
- 质量瓶颈不可见:工作流是多环节串联,当终版数据质量不达标时,无法定位质量损失发生在预生成、人工修订还是审核环节。
- Benchmark 自身可信度未验证:benchmark 的 LLM-as-Judge 评估方法与人工判断的一致性、各维度的实际区分力、评估得分与下游模型训练效果的相关性均未经验证。 本课题以该 Benchmark 为评估基准,围绕"如何系统性评估和优化 Cowork 工作流的数据产出质量"展开研究。
职位要求
研究领域: -目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位 -具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go -具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用: -对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色 -在国际会议上或核心期刊发表一份或多份出版物或论文 -至少3个月的全职工作