招聘中 校招

【Plan A】大模型Agentic RL算法工程师-百灵-27届

蚂蚁集团

  • 北京、上海、杭州
  • 技术类

收录时间

岗位职责

团队主要负责百灵Agentic 核心能力 的研发与迭代,构建出端到端解决复杂生产任务的智能体技术。团队既要提升模型在复杂任务规划、工具调用上的端到端表现;又要深入底层,解决训练吞吐、推理延迟、以及 Agentic 交互环境(Sandboxing)背后的资源调度与性能瓶颈问题。 Ling Team 聚焦百灵模型家族的核心算法创新。在本岗位下,你将主导百灵大模型在特定 Agent应用场景下的效果优化,构建下一代具备高度Agentic能力的模型,使其从单纯的文本生成器进化为能够解决复杂现实问题的智能体。 主要职责包括:

  1. Agentic能力构建: 负责大模型在 Agent场景下的后训练(SFT/RLHF)算法研发,重点提升模型的复杂指令遵循、多步推理(Reasoning)、工具使用(Tool Use)及任务规划能力;
  2. 训练范式创新: 探索并设计针对 Agent 场景的高效训练范式(如 Process Reward Models, Self-Play,Iterative Refinement),解决长链路任务中的误差累积和鲁棒性问题;
  3. 数据策略与合成: 设计高质量的 Agentic 训练数据合成方案(Data Synthesis),通过构造复杂环境交互数据,驱动模型能力的Scaling;
  4. 模型评估与分析: 建立针对 Agent 能力的系统性评估体系,通过严谨的实验分析(AblationStudy)定位模型短板,指导算法迭代方向;
  5. 前沿技术落地: 紧密跟踪 MoE、Long Context 等前沿技术,并在复杂工程约束下,将算法创新转化为实际的模型性能提升。

职位要求

  1. 理论基础扎实: 拥有深厚的深度学习与非凸优化理论功底,具备从第一性原理(FirstPrinciples)对复杂问题进行数学建模和拆解的能力;
  2. 架构深度理解: 深入掌握 Transformer 及其变体架构,熟悉 MoE(混合专家模型)机制及主流 LLM 的底层实现细节;
  3. 后训练范式: 精通 SFT(监督微调)、RLHF(人类反馈强化学习)、DPO/PPO 等对齐算法,深刻理解Alignment(对齐)背后的数学原理与优化挑战;
  4. Agentic 实战经验: 具备复杂 Agentic 系统(如 Tool-use, Reasoning,Planning)的训练与全链路搭建经验,理解 Agent 在复杂环境下的交互逻辑;
  5. 科学实验素养: 具备独立设计实验、进行严谨消融实验(Ablation Study)及归因分析的能力,能在复杂工程约束下做出最优算法决策。 加分项
  6. 在顶会 / 顶刊发表过相关论文;
  7. 有 MoE 或新型 Attention 设计经验;
  8. 有 Agentic 模型或工具调用训练经验;
  9. 有长上下文(100K+)能力训练经验;
  10. 参与过 100B 以上参数规模的模型训练;
  11. 各类高水平竞赛金牌选手。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

蚂蚁集团【Plan A】大模型Agentic RL算法工程师-百灵-27届

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看【Plan A】大模型Agentic RL算法工程师-百灵-27届正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位【Plan A】大模型Agentic RL算法工程师-百灵-27届蚂蚁集团 · 北京、上海、杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏【Plan A】大模型Agentic RL算法工程师-百灵-27届正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

蚂蚁集团【Plan A】大模型Agentic RL算法工程师-百灵-27届校招 · 北京、上海、杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入【Plan A】大模型Agentic RL算法工程师-百灵-27届内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。