部门介绍
飞书是字节跳动旗下 AI 工作平台,面向人与agent协作,提供一站式协同办公、组织管理、业务提效工具和深入企业场景的 AI 能力,让 AI 真能用真落地。 从互联网、高科技、消费零售到制造、金融、医疗健康,各行各业先进企业都在飞书落地AI,与飞书共创行业最佳实践。先进团队,AI用飞书。
- 负责AI Agent的评测体系建设,制定覆盖基础能力、业务效果、工具调用、任务执行、稳定性、安全性和用户体验的评测标准;
- 根据业务场景设计评测集、评分规则和验收门槛,建立从离线评测、自动化评测到线上效果监控的完整评测链路;
- 负责评测数据与自动化能力建设,设计并维护高质量评测数据集(负责样本采集、清洗、标注、分层、去重及版本管理,保障数据代表性、覆盖度和区分度),建设自动化评测能力(综合使用规则、代码、模型裁判和人工专家完成多维评分,并持续提升评测结果的准确性与一致性);
- 建立失败案例归因体系,对幻觉、误判、漏答、工具调用失败、执行中断和结果不稳定等问题持续聚类,推动Top问题专项治理;
- 探索用户反馈、线上行为和业务结果与离线评测之间的关联,持续提升评测指标对真实用户体验的解释能力,跟踪业界评测方法和前沿技术,沉淀AI评测规范、最佳实践和方法论,推动评测能力在不同业务场景中复用。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 具备大模型评测、算法评测、数据分析、测试开发或AI产品质量相关经验,有自动化评测平台或评测流水线建设经验、复杂任务E2E评测、工具调用评测或Computer Use Agent评测经验优先;
- 熟悉大语言模型、AI Agent、RAG、工具调用、Prompt Engineering和模型推理的基本原理;
- 熟悉准确率、召回率、Pass@K、成对比较、评分量表、LLM-as-a-Judge和人工评测等常见评测方法;
- 具备数据分析和基础编程能力,能够使用Python、SQL等工具完成数据处理、评测实验和结果分析;
- 具备较强的结构化分析和报告能力,能够从大量失败样本中提炼共性问题并提出。