岗位职责
随着大模型从对话助手快速演进为能够理解复杂需求、调用工具、记忆、操作真实环境并持续完成任务的智能体,传统基于静态问答和单轮指标的评测方式,已远远无法满足模型的迭代速度和演进,难以真实衡量智能体在长周期任务中的规划执行、记忆、工具调用、代码开发、环境交互及协作能力。 当前行业亟需解决一系列关键问题:真实工作任务难以标准化,复杂执行轨迹缺乏可靠评价,多轮任务中的错误会持续累积,环境与工具变化导致评测结果难以复现,人工验收成本高昂;同时,现有 Benchmark 与用户实际体验之间仍存在明显差距,难以支撑智能体的大规模迭代和业务部署。 本项目将面向Cowork、Coding等Agent的真实体验评估,构建覆盖“理解—规划—执行—验证—交付”完整链路的下一代评测体系。通过真实任务建模、可控交互环境、自动化验证、LLM/Agent-as-a-Judge、轨迹分析与用户反馈建模,使 Agent 的任务完成能力、安全性和协作体验可测、可解释,推动智能体从“能够演示”走向“可靠完成工作”。
- 深入挖掘 Cowork、Coding等Agent 在真实复杂任务中的能力边界和bad behavior失效模式,分析线上回流日志和Dogfooding用户反馈,设计并建设高质量 Agent Benchmark评测数据集,重点评估需求理解、任务规划、长程执行、上下文管理、工具调用、代码修改、调试验证及结果交付等核心能力。
- 设计面向 Agent 的多维评测指标,覆盖单轮和多轮真实场景,不仅衡量最终任务完成度,还评估过程正确性、纠偏能力、规划效率、工具使用质量、交付质量、视觉美观和安全合规等。
- 参与 LLM-as-a-Judge 与 Agent-as-a-Judge 方案的设计和实现,训练高精度的 Reward Model(奖励模型),结合规则验证、单元测试、静态分析、环境状态检测及人工偏好数据,提高开放式任务和主观体验评估的准确性、稳定性与可解释性。
- 设计高效的 Reward Signal(奖励信号),并通过自动化数据合成、偏好学习及强化学习等方法,为 Agent 后训练提供可靠信号,持续提升其长程任务执行、泛化和自我纠错能力。
- 参与开发统一的 Evaluation & Reward 基础设施,支持多模型、多 harness、多任务和多环境的统一评测、版本对比、模型送评及实验追踪,提升大规模模型集成与实验的效率。
- 跟踪全球大模型评测最新进展(如 Agent/Harness评测、多模态、游戏开发、交互式benchmark等),推动研究成果在真实业务场景中的落地。
职位要求
- 本科及以上学历,计算机、人工智能、软件工程、数学、自动化等相关专业优先。
- 理论基础: 深入理解 Transformer、大语言模型及 Agent 基础技术,熟悉工具调用、规划与推理、记忆机制、上下文工程、或Harness Engineering中的至少一个方向。
- 熟悉大模型评测或后训练技术,包括但不限于 LLM/Agent-as-a-Judge、Reward Model、SFT和强化学习。
- 具备卓越的代码工程能力,精通 Python 编程及 PyTorch 深度学习框架,具备较强的问题定位能力,能够从评测结果、用户反馈和失败样本中提炼规律,设计验证实验并推动问题解决。
- 具备系统性研究思维,在国际顶级计算机会议/期刊(如 NeurIPS、ICML、ICLR、ACL、EMNLP 等)发表过一作论文,或在知名开源社区、顶级竞赛(如 ACM/ICPC、Kaggle)中有突出成果。