招聘中 社招

AI算法工程师(Agentic RL方向)-即梦

字节跳动

  • 深圳
  • 算法

收录时间

岗位职责

  1. 负责即梦创作Agent的Agentic RL能力建设,探索Agentic RL、Rubrics-based RL、RLHF/RLAIF、Process Reward、Outcome Reward、Unified Reward System等方法,提升模型在长链路创作任务中的规划、工具调用、多轮交互和任务完成能力,以及Agent在复杂任务中的成功率和稳定性;
  2. 设计面向图片、视频、多模态编辑等创作场景的强化学习任务、环境、奖励信号和训练范式;
  3. 构建多轮Function Call、工具调用轨迹、创作任务偏好、失败恢复样本等训练数据,并与SFT、DPO、GRPO、PPO等后训练方法结合;
  4. 结合Agent Harness、Sandbox、自动评测系统,建设可训练、可评估、可回放的Agent RL实验闭环;
  5. 分析模型在任务规划、工具选择、执行顺序、上下文利用和异常恢复中的失败模式,推动模型、数据和系统协同优化,跟进Agentic RL、Long-horizon RL、Tool Use Training、多模态强化学习等前沿研究,并推动其在即梦真实创作场景中落地。

职位要求

  1. 本科及以上学历,具备扎实的机器学习、深度学习、强化学习和概率统计基础;
  2. 熟悉大模型后训练方法,包括但不限于SFT、RLHF、DPO、PPO、GRPO、RLAIF、Reward Model等;
  3. 熟练掌握PyTorch等主流深度学习框架,具备模型训练、数据处理、实验设计和结果分析能力;
  4. 了解强化学习中的策略优化、奖励建模、轨迹采样、Credit Assignment、探索与稳定性等基本问题;
  5. 对Agentic RL、Tool Use、多轮Function Call、长链路任务规划、多模态模型训练有浓厚兴趣,具备较强的问题抽象能力,能够将创作任务中的业务目标转化为可训练、可评估、可优化的技术目标;
  6. 具备良好的工程实现能力和跨团队协作能力,能够与评测、数据和产品团队共同推进训练闭环落地。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

字节跳动AI算法工程师(Agentic RL方向)-即梦

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看AI算法工程师(Agentic RL方向)-即梦正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位AI算法工程师(Agentic RL方向)-即梦字节跳动 · 深圳

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏AI算法工程师(Agentic RL方向)-即梦正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

字节跳动AI算法工程师(Agentic RL方向)-即梦社招 · 深圳

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入AI算法工程师(Agentic RL方向)-即梦内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。