招聘中 社招

飞猪-大模型算法专家-RL 环境合成

飞猪

  • 杭州

收录时间

岗位职责

  1. 训练任务与环境合成 根据模型能力目标和评测结果,确定训练任务的覆盖范围与难度分布。围绕行程规划、交通住宿选择、多约束决策等旅行场景,设计任务目标、初始状态、可用工具及环境反馈,研究任务与环境的自动合成方法,提升任务的可解性、多样性和训练价值。
  2. 验证算法与奖励设计 将任务完成条件和质量要求转化为可执行的验证器(Verifier)与评分标准(Rubric),覆盖信息准确性、时间与预算约束、方案完整性及可执行性等维度。结合程序测试、环境状态检查、模型评判及智能体主动核验,设计结果与过程奖励,分析验证误判、评分偏差和奖励漏洞。
  3. 交互数据生成与质量优化 研究 Agent 执行轨迹的生成、筛选与质量评估方法,建设任务生成、轨迹采样、自动验证和数据过滤流程;识别题目歧义、环境问题及错误反馈,从失败样本中挖掘新的训练任务。
  4. 训练实验与策略迭代 将任务、环境和奖励机制接入大模型后训练流程,开展对照实验,分析任务分布、环境难度和奖励设计对模型学习的影响;根据训练与独立评测结果调整合成和采样策略,提升模型在未见任务、需求变化和长流程任务中的成功率。

职位要求

  1. 具备大模型后训练或强化学习的研究、项目经验,了解监督微调及 PPO、GRPO 等强化学习方法,理解训练数据、采样策略和奖励信号对模型效果的影响。
  2. 熟悉 Agent 的任务规划、工具调用、多轮交互与状态管理,能够分析复杂执行轨迹,识别模型的行为模式和失败原因。
  3. 在任务或环境合成、Agent 数据构造、自动验证、奖励设计中至少一个方向有实践经验,能够为具体任务设计明确的完成条件和可执行的评价方法。
  4. 熟练使用 Python 和 PyTorch,熟悉 ROLL、verl 等大模型强化学习训练框架,具备环境接入、轨迹采样、奖励计算或训练调试经验。
  5. 能够独立提出研究假设、设计对照与消融实验,判断效果变化来自数据、环境、奖励还是训练方法,并形成可复现的实验结论。 加分项: - 有奖励模型(Reward Model)的数据构建、训练、评估或应用经验,包括过程奖励模型和结果奖励模型。 - 有任务难度自动调节、课程学习、Agent 自我博弈或模型反馈驱动的数据合成经验。 - 有旅行规划、交通住宿、目的地推荐等旅行领域的算法或数据经验,理解真实旅行任务中的约束、信息变化和用户偏好。 - 在大模型训练、强化学习、智能体、环境合成或自动验证等方向发表过相关论文,或对相关开源项目有实质贡献

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

飞猪飞猪-大模型算法专家-RL 环境合成

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看飞猪-大模型算法专家-RL 环境合成正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位飞猪-大模型算法专家-RL 环境合成飞猪 · 杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏飞猪-大模型算法专家-RL 环境合成正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

飞猪飞猪-大模型算法专家-RL 环境合成社招 · 杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入飞猪-大模型算法专家-RL 环境合成内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。