招聘中 社招

数据技术及产品部-RL Data Rubric 算法设计专家-Work

阿里集团

  • 北京、杭州
  • 技术类-算法

收录时间

岗位职责

  1. Rubric 与 Reward 设计:和领域专家一起,把领域的专业判断(漏洞是否成立、时序是否收敛、回答是否可用等)拆成可自动化验证的评分规则;覆盖硬验证(工具退出码/规则)+ 数值指标 + milestone + LLM judge 的多层组合。
  2. Reward Hacking 规避:识别评分规则里可能被模型钻空子的路径,设计验证规则闭环;对已上线的 rubric 做持续的 hacking 检测与规则加固。
  3. 训练验证与反查:用设计出的 rubric 与数据真实训练模型(SFT/RFT/RL),从训练曲线与 benchmark 结果反查 rubric 与数据的问题,形成"设计→训练→反查"迭代闭环。
  4. RL 数据筛选:对海量候选数据做面向 RL 的精筛,识别"表面合理但实际错误"、难度合适、覆盖度合理的样本;设计筛选阈值与采样策略,平衡数据规模与质量。
  5. 领域标注 → RL 数据的转化:把领域标注的标准与规范转成可用于 RL 训练的评分模板、reward 计算逻辑与训练样本;与领域专家共同定义黄金集与奖励信号。
  6. 效果验收:持续跟踪 rubric 上线后对训练效果的实际提升,输出 rubric 版本管理与效果对比报告,给出下一版迭代方向。

职位要求

  1. 有实际 RL/RFT 训练经验,理解 reward 设计、rubric 与训练效果的关系,能独立跑通训练闭环。
  2. 熟悉主流 rubric 设计范式,能大批量生成高质量 rubric,并把主观评价拆成可校验的子问题。
  3. 具备 reward hacking 识别与规避能力,理解常见 hacking 模式与验证机制。
  4. 熟悉 SFT/RFT/RL 各阶段数据需求差异,能筛选与构建高质量训练数据。
  5. 工程能力:熟练 Python,能独立完成数据处理、批量调用 LLM、结果聚合等工作,读得懂训练框架与训练日志。
  6. 与领域专家的协作能力,能把领域专业判断转成可执行评分规则。
  7. 数据质量意识,对分布、异常、偏见风险有敏锐直觉。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

阿里集团数据技术及产品部-RL Data Rubric 算法设计专家-Work

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看数据技术及产品部-RL Data Rubric 算法设计专家-Work正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位数据技术及产品部-RL Data Rubric 算法设计专家-Work阿里集团 · 北京、杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏数据技术及产品部-RL Data Rubric 算法设计专家-Work正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

阿里集团数据技术及产品部-RL Data Rubric 算法设计专家-Work社招 · 北京、杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入数据技术及产品部-RL Data Rubric 算法设计专家-Work内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。