招聘中 社招

数据基础及产品部-RL Data 工程师-work(数据构造)

阿里集团

  • 杭州

收录时间

岗位职责

  1. 从 0 到 1 生产合成 RL Instance:围绕种子任务构建完整 Instance(任务描述、运行环境、输入资产、评测钩子),通过参数化模板实现批量合成与自动校验,保证 Instance 的正确性、完整性与可复现性,作为 rollout 数据生产的起点。
  2. 搭建 Agent 与 rollout 产线:基于主流 harness/agent 框架搭建 Agent 运行环境,端到端跑通轨迹采样、自动校验、质量过滤的生产 Pipeline,对 rollout 结果做预校验与失败模式分析,保障进入训练的数据可信、可追溯。
  3. 建设 Verifier 与 Rubric:将模糊的质量目标拆解为可量化的 Verifier 和多维度打分 Rubric,与领域专家、标注团队以人机协作方式完成标注与校准,持续迭代以应对 Reward Hacking,确保评估信号与训练目标对齐。
  4. 对接算法侧形成闭环:与算法/训练团队紧密配合,将模型效果反馈转化为数据策略调整(任务难度、Reward 信号、标注规范等),驱动“数据 → 训练 → 评测”持续迭代。

职位要求

  1. 了解 RL 基本原理:理解 Reward Modeling 的基本原理及 Reward 信号设计对 RL 训练(PPO/GRPO 等)的影响,能从训练视角判断什么样的 Instance 是有效数据,并据此设计能力覆盖与难度分布。
  2. 具备从 0 到 1 的合成生产能力:熟练使用 Python,能独立完成任务定义、容器化环境构建与参数化批量合成,有搭建端到端数据产线的工程经验,保障数据生产的规模化与可复现。
  3. 动手能力强:熟悉主流 harness/agent 框架,能独立搭建 Agent 并批量采集 rollout 轨迹,能对多轮工具调用、代码执行等复杂轨迹识别行为模式与失败模式。
  4. 具备 Verifier/Rubric 设计能力:能将模糊的质量目标拆解为可量化的 Verifier 与多维度打分 Rubric,具备识别和应对 Reward Hacking 的判断力。
  5. 加分项:有办公、数据分析、金融、法律、医疗等 Cowork 场景任务的深度经验者优先;对 LLM、AGI 感兴趣,践行 AI Native 工作范式者优先。

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

阿里集团数据基础及产品部-RL Data 工程师-work(数据构造)

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看数据基础及产品部-RL Data 工程师-work(数据构造)正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位数据基础及产品部-RL Data 工程师-work(数据构造)阿里集团 · 杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏数据基础及产品部-RL Data 工程师-work(数据构造)正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

阿里集团数据基础及产品部-RL Data 工程师-work(数据构造)社招 · 杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入数据基础及产品部-RL Data 工程师-work(数据构造)内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。