岗位职责
我们正在围绕 阿里巴巴国际站 + Accio Work 打造真实全球贸易场景的 AI Agent,覆盖买家采购、商家经营、Research、商品发布、跨平台运营、物流跟踪等复杂任务。 这个岗位聚焦 Agent rollout 环境搭建 + agentic model 训练,不是传统训练岗,也不是普通应用岗,而是把真实业务流程变成模型可交互、可学习、可优化的 environment,训练一个真正“会做事”的 Agent。 你会做什么:
- 搭建国际站场景下的 Agent rollout / environment,支持多步任务、工具调用、Browser/API 操作
- 构建 trajectory 采样、reward 计算、样本回流、任务重放等训练链路
- 参与 SFT / Preference / RLHF / RLAIF 等 agentic post-training 工作
- 研究 tool use、browser use、computer use、错误恢复、多步规划等问题
- 联动评测/数据/产品,形成“环境-训练-评测-回流”闭环 为什么值得来:
- 做真实业务里的 Agent 训练,而不是 benchmark 实验
- 场景复杂且稀缺:多语言 + 多工具 + 长链路任务
- 同时覆盖 environment、rollout、reward、training,全链路空间大
- 有机会定义真实商业世界中 Agent 如何被训练出来
职位要求
我们希望你具备:
- 3年以上机器学习 / 强化学习 / 大模型训练 / 算法工程经验
- 熟练 Python,有训练 pipeline 或大规模系统经验
- 了解 RL、trajectory、reward、policy optimization、post-training 等基本方法
- 对 Agent、Tool Use、Browser/Computer Use、多步任务有兴趣或经验
- 有 rollout system / simulator / RLHF / agent training 经验优先