岗位职责
- 负责AI Agent评测体系的整体架构设计与建设,结合真实业务场景,构建覆盖任务成功率、工具调用准确性、多轮对话、推理链路、安全合规等维度的评测框架,持续提升Agent质量与迭代效率;
- 负责评测集、评测用例与数据的体系化建设,设计评测集的分层结构与覆盖策略(核心场景、长尾案例、对抗样本、边界条件等),建立用例的采集、标注、清洗、版本管理与质量校验机制,保障评测数据的代表性、准确性与可持续更新;
- 设计和建设面向企业级Agent应用的自动化评测平台与工具链,包含但不限于评测集管理、用例编排、自动化打分、人工标注、A/B对比、回归测试、线上负面案例回流与数据闭环等能力,推动评测能力与Agent研发流程深度融合;
- 定义Agent效果评估的量化指标与评测方法论,识别高价值评测场景,推进评测能力从方案设计、试点验证到规模化落地,形成可复用的评测集标准、标注规范与最佳实践;
- 持续跟踪大模型、Agent评测(Evaluation)、LLM-as-a-Judge、Benchmark构建、合成数据等前沿技术趋势,结合团队实际业务场景引入合适的新方法与新方案,持续优化评测的准确性、效率与成本。
职位要求
- 本科及以上学历,计算机相关专业优先,3年及以上AI/ML、模型评测、质量工程、测试平台或后端研发相关工作经验;
- 熟悉大模型与Agent技术原理,对Prompt工程、工具调用(Function Calling)、RAG、多轮对话、推理规划等环节有较好理解;
- 了解主流评测方法与体系,如自动化指标、人工标注、LLM-as-a-Judge、Benchmark构建等,有Agent或模型效果评测的实践经验者优先;
- 具备良好的工程实现能力,熟练掌握一门及以上开发语言(如Golang/Python/Java),能够独立推进评测系统或工具建设;
- 具备较好的沟通协作和问题推动能力,能够与算法、研发、产品、标注等角色协同推进评测项目落地。 具备以下条件者优先:
- 有企业内部Agent评测平台、模型评估平台或质量工程平台建设经验者优先;
- 有评测集/Benchmark从0到1构建、标注体系搭建、合成数据或数据闭环体系建设经验者优先;
- 有LLM-as-a-Judge、自动化评测、线上负面案例回流与数据挖掘等相关实践经验者优先;
- 熟悉大模型训练/推理、RAG、Agent框架或AI Infra相关技术者优先。