招聘中 社招

数据技术及产品部-大模型RL Data工程师-长程 Agent 环境(RL 数据)

阿里集团

  • 杭州

收录时间

岗位职责

主导大模型「长程 Agent 环境」方向的数据体系建设,覆盖数据生产、模型评测与质量管控全链路,定义模型在多步、有状态、需工具调用与长程规划的复杂 agentic 任务上的能力边界,构建高质量、可复现、可自动判分的任务环境与评测数据集。本岗位为横向底座,不绑定单一行业,所搭建的长程任务环境统一服务编程、数据分析、办公、科研、金融等各垂直方向;其核心不是判定单点答案正误,而是把真实任务转化为可复现、难度分级、抗奖励作弊的环境,并按执行过程对整条轨迹打分。具体包括:

  1. 能力体系与标准制定:定义长程 agentic 任务的能力维度(任务分解与规划、跨步状态跟踪、长上下文保持、模糊性与中断处理、错误恢复与反思、长程一致性与终止判断),建立以步数、分支、不可逆性、信息完整度刻画难度的分级与可解性标定方法,制定过程级评分标准(里程碑 checkpoint + 子目标 + 最终态 + rubric 软标准)与金标准轨迹规范,沉淀为各垂直方向复用的统一方法论。
  2. 数据生产与标注:把真实任务构建为可复现的有状态环境(固定初始状态、可重置 / 回放 / 分支的中间态、以录制或 mock 替代真实工具与 API、结果自动校验钩子)并容器化交付;将领域专家提供的任务抽象为可参数化的环境模板族,批量生成难度递增的变体;产出多步专家示范轨迹——尤其是「中途出错并恢复」「应对中断与模糊指令」等高价值样本,供 SFT、偏好学习与可验证奖励强化学习(RLVR)使用。
  3. 模型评测建设:为每个环境配套自动判分机制,兼顾最终结果与过程关键节点、支持按步骤部分给分(credit assignment);用前沿模型跑 pass@k 标定长程难度与可解性;通过大规模 rollout 定位长程特有失败模式(规划漂移、误差累积、状态漂移、上下文丢失、工具误用、过早终止 / 死循环、中断后无法恢复),沉淀轨迹级失败案例库并反哺各垂直方向。
  4. 质量管控与质检:逐条审阅数十步执行轨迹、判断每一步动作与环境状态是否合理;建立环境分层校验(静态检查 → 冒烟 → 可达性 → 领域合理性)、双标注一致性校验、资深专家抽检、难度标定校准与查重去污;重点排查奖励作弊(reward hacking、绕过 checkpoint、伪造完成)与判分器可靠性、结果可复现性;对 bad case 做根因分析(数据 / rubric / verifier / 环境实例 / 具体轨迹步)并回流到模板与标准。
  5. 数据基础设施共建:与工程团队共建长程任务沙箱、状态快照与重置 / 回放 / 分支机制、mock API 与工具 / MCP 编排、rollout 与过程打分管线、环境模板库与数据血缘,把「一次设计、批量生成变体」的能力工程化,供所有垂直方向复用。
  6. 行业跟踪与跨团队协同:持续关注长程 agent、过程监督(process supervision)、可验证奖励与 agent 环境评测方向动态;与各垂直领域岗协作——领域岗负责任务真实性与答案正确性,本岗负责长程环境、过程奖励与轨迹质检——与研究、算法、工程团队形成「数据生产 → 训练 → 评测 → 回流」闭环。

职位要求

  1. 对长程多步 agentic 任务及其失败模式有深入判断,能将真实复杂任务转化为可复现、可自动判分、难度可控且抗作弊的训练与评测环境;有 Agent 产品实测、长程任务或轨迹设计、过程级评测、RL 环境或数据经验者优先。
  2. 具备很强的抽象与系统化能力,能将长任务拆解为子目标与里程碑 checkpoint,设计难度分级与变体生成策略,并把模糊的「做得好不好」落成可自动验证的过程评分,沉淀为可跨垂直复用的方法论。
  3. 工程能力扎实,熟练掌握 Python(能独立编写判分器 verifier、解析长轨迹、处理大规模 rollout 数据),熟悉至少一类 agent 执行环境(终端 / shell、浏览器自动化、桌面自动化、代码沙箱或 MCP 工具编排),掌握以 mock / 录制替代真实依赖、容器化(Docker)与环境状态的重置 / 回放 / 分支。
  4. 了解 Agent 核心机制(ReAct、Tool Use、Planning、多步推理与反思)与后训练范式(SFT / RLHF / 可验证奖励 RL、RLVR),理解过程监督(step-level reward)、跨步 credit assignment、reward hacking 与长上下文下的误差累积,对长程 agentic 任务的能力边界有认知或实践。
  5. 领域呈 T 型即可,熟悉任一垂直(编程、数据分析、办公、科研、金融等)到能判断长任务是否贴近真实,但核心能力在长程环境与过程奖励工程、服务所有方向;有以下经验者优先:agent 评测框架 / RL 环境搭建、benchmark / 任务集构建、过程级 verifier 与自动评分器开发、大规模 rollout 与数据管线、仿真 / 沙箱环境工程、agent 安全(提示注入 / 越狱)评测。
  6. 严谨细致、结果导向、强可复现意识;优秀的技术写作与沟通能力,能向研究、算法、工程与领域专家清晰传达环境与奖励设计,产出高质量的规范、评分标准与分析报告。

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

阿里集团数据技术及产品部-大模型RL Data工程师-长程 Agent 环境(RL 数据)

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看数据技术及产品部-大模型RL Data工程师-长程 Agent 环境(RL 数据)正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位数据技术及产品部-大模型RL Data工程师-长程 Agent 环境(RL 数据)阿里集团 · 杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏数据技术及产品部-大模型RL Data工程师-长程 Agent 环境(RL 数据)正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

阿里集团数据技术及产品部-大模型RL Data工程师-长程 Agent 环境(RL 数据)社招 · 杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入数据技术及产品部-大模型RL Data工程师-长程 Agent 环境(RL 数据)内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。