招聘中 校招

面向Auto Research的强化学习算法与数据合成体系研究-阿里星

阿里巴巴

  • 北京、杭州
  • 技术类

收录时间

岗位职责

作为 Auto Research RL 算法研究与数据合成方向的算法研究员,你将参与或负责以下工作:

  1. 研究 Auto Research Agent 的核心训练方法,围绕理工类科研领域(如生物化学材料物理等)自动化科研智能体的自主决策、规划、工具调用、代码执行与实验验证能力,开展系统性算法研究;
  2. 设计并构建 Agentic 数据合成体系,研究大规模 Agent 轨迹数据的高效生成、清洗、筛选、增强与配比策略,构建高质量后训练数据管线;
  3. 探索稳定高效的 Agentic RL 训练方案,应用并改进 PPO、DPO、GRPO 等强化学习算法,优化长程任务中的奖励设计、训练稳定性、探索效率与泛化能力;
  4. 提升模型在代码、真实科研流程、实验场景中的任务成功率,针对代码生成、实验执行、错误修复、结果分析、论文写作等任务,构建训练与评测闭环,持续提升模型鲁棒性;
  5. 推动学术成果产出与开源建设,将研究成果整理为高水平论文,投稿至国际顶级会议;根据项目情况推动算法、数据或模型开源,提升团队技术影响力。

职位要求

  1. 计算机科学、人工智能、信息科学、数学、统计学、自动化或相关STEM专业以及交叉学科背景(如计算生物学、计算神经科学、计算化学)的应届博士毕业生,或即将获得博士学位的优秀候选人;
  2. 在领域内高水平学术期刊会议上发表论文并经过同行评议;或研究内容形成专利成果;
  3. 具备扎实的编程能力,熟练使用 Python,熟悉 PyTorch 或类似深度学习框架,能够独立完成算法实现、实验设计与结果分析;
  4. 深入理解以下至少一个方向:大语言模型 / 多模态大模型、强化学习 / 强化学习后训练、Agent 系统 / 工具调用 / 自主决策、代码智能体 / 自动化科研 / 自动化推理等。熟悉主流强化学习或偏好优化算法,包括但不限于:PPO、DPO、GRPO等;如为自然科学专业,需具备扎实的编程基础,并对AI for Science有强烈兴趣和深入的见解;
  5. 能够独立推进科研项目,具备较强的理论知识背景、问题定义能力、实验设计能力、论文阅读与复现能力,能够针对复杂问题提出创新性解决方案;
  6. 具有强自驱力、学习能力、创新意识和沟通协作能力,能够适应快速变化的 AI 研究方向、适应跨学科合作的工作环境,并具备一定抗压能力。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

阿里巴巴面向Auto Research的强化学习算法与数据合成体系研究-阿里星

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看面向Auto Research的强化学习算法与数据合成体系研究-阿里星正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位面向Auto Research的强化学习算法与数据合成体系研究-阿里星阿里巴巴 · 北京、杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏面向Auto Research的强化学习算法与数据合成体系研究-阿里星正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

阿里巴巴面向Auto Research的强化学习算法与数据合成体系研究-阿里星校招 · 北京、杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入面向Auto Research的强化学习算法与数据合成体系研究-阿里星内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。