岗位职责
我们正在围绕 阿里巴巴国际站 + Accio 打造面向真实全球贸易场景的 AI Agent。 这不是传统聊天机器人评测岗位,而是要定义:一个 Agent 在真实商业世界里,是否真的会做事。 你会做什么
- 设计面向跨境贸易场景的 Agent 评测体系,覆盖任务理解、规划、多语言、幻觉控制、工具调用、任务完成率、时延/稳定性/成本等。
- 构建高质量业务 benchmark,覆盖询盘、RFQ、Research、商家经营、海关/征信/物流等真实任务。
- 搭建 Agent / Tool Use / Browser Use 评测环境,支持多步任务复现、链路追踪和结果校验。
- 建设自动化评测能力,包括 LLM-as-Judge、对比评分、多维量表、端到端 success metric。
- 输出 bad case 归因、能力雷达图和优化建议,推动模型训练与产品迭代闭环。
职位要求
- 3年以上大模型评测、Agent评测、算法工程或AI产品体验相关经验。
- 主导过至少一个端到端评测体系。
- 熟悉多轮对话、幻觉、指令遵循、工具调用、多步任务评测方法。
- 熟练 Python;有沙盒/容器化/评测平台经验优先。
- 能从真实业务场景定义模型好坏,而不是只看 benchmark 分数。
- 了解 SFT / RLHF / Eval 链路,有 LLM-as-Judge 或自动化评分经验更佳。