招聘中 校招

大模型后训练优化

蚂蚁集团

  • 北京、上海、杭州
  • 技术类

收录时间

岗位职责

面向大模型负责后训练方向的核心研发与持续优化。该岗位分为基础模型后训练优化与应用场景后训练优化两个方向,候选人将根据研究背景、项目经验和团队需求匹配其中一个方向。 围绕数据飞轮、训练范式、评测体系与效果归因,持续提升模型在指令遵循、推理、可控性、工具使用、多模态理解与生成等方面的能力。 具体的职责包括以下相关方向的一项或多项:

  1. 基础模型后训练优化。围绕语言大模型或多模态大模型的通用能力提升,开展 SFT、偏好优化、强化学习等后训练工作,持续增强模型在指令遵循、推理深度、可控性、泛化能力与稳定性等方面的表现;
  2. 应用场景后训练优化。面向搜索问答、智能体、多模态理解、AIGC 等真实业务场景,设计并迭代应用导向的后训练方案,提升模型在复杂任务、多步执行、工具使用和内容生成等场景中的任务完成质量与落地效果;
  3. 数据飞轮与治理。建设高质量后训练数据体系,覆盖指令数据、偏好数据、轨迹数据、评测数据及多模态数据,持续优化数据构建、筛选、配比、标注与质量评估策略,推动数据与模型效果的闭环迭代;
  4. 评测与效果归因。搭建面向模型能力与业务目标的评测体系,结合自动化评测、离线基准、回归测试与实验分析,对训练效果进行量化评估、问题定位与归因,支撑训练策略和数据策略的持续优化;
  5. 工程落地与协同优化。与研究、系统、应用和产品团队协作,推动后训练方案在真实训练与业务环境中的高效落地,综合平衡效果、成本、稳定性与迭代效率。

职位要求

  1. 扎实的深度学习与优化理论基础;
  2. 深入理解 Transformer 与主流大模型架构;
  3. 有SFT、RLVR、Agentic RL、RLHF、reward model、distillation的训练经验;
  4. 能独立定义问题、设计实验并进行严谨验证;
  5. 能从第一性原理进行思考与建模;
  6. 能在复杂工程约束下做出算法决策。 加分项
  7. High contribution & low ego;
  8. 在顶会 / 顶刊发表过相关论文;
  9. 有构建新评测基准经验;
  10. 参与过 100B 以上参数规模的模型后训练;
  11. 精通 Agentic Coding;
  12. 熟悉 Verl、OpenRLHF、Slime 等开源RL框架,熟悉 Megatron、vLLM、SGLang 等训练推理引擎;
  13. 有交叉学科背景(数理化生、文史哲、金融、医疗等);
  14. 各类国际级竞赛(IMO、IPHO、ICHO、IOI、ICPC、Kaggle等)获奖。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

蚂蚁集团大模型后训练优化

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看大模型后训练优化正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位大模型后训练优化蚂蚁集团 · 北京、上海、杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏大模型后训练优化正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

蚂蚁集团大模型后训练优化校招 · 北京、上海、杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入大模型后训练优化内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。