岗位职责
• 参与评测任务设计:基于真实职业场景,为指定领域设计端到端的 Agent 评测题(含任务描述、源文件构造、标准交付物产出),确保任务具备场景 OOD 性与能力组合深度。 • 撰写与维护评分 Rubric:按照国际通用评测规范,将专家判断拆解为可独立证伪的原子化评分标准,设计正向加分项与负向护栏项,保障评分的区分度与评分者间一致性。 • 执行模型评分与数据分析:分析模型在不同领域、不同任务复杂度下的得分分布,定位能力短板,输出结构化分析报告。 • 参与 OOD 保障流程:执行对抗自检(裸跑测试)、变体自检等质量保障环节,确保评测题不落入模型训练分布。 • 协助领域知识梳理:与行业专家对接,整理特定领域的典型工作流、源文件类型、交付物规范与专业能力维度。
职位要求
• 本科大三以上,需具备以下至少一项背景: • 统计学、计算机科学、设计、金融、相关专业、半导体、建筑、工程、市场营销、设计/艺术/美学、传媒/影视、游戏、经济学/管理学、商业分析/数据分析、能源等专业或背景 • 对大模型能力边界有基本认知,了解 prompt engineering、LLM-as-judge 等概念者优先 • 熟悉数据标注、评测、考试命题经验者优先 加分项 • 有 NLP/LLM 评测相关项目经验(如参与过 benchmark 构建、论文复现) • 熟悉 GDPval、APEX 等主流评测体系的设计理念 • 有特定行业实习经验(投行、律所、咨询公司、会计师事务所等) • 英语读写流利,能阅读英文评测论文与技术文档