招聘中 校招

混元基座模型-强化学习算法研究&强推理能力优化

TEG

  • 北京
  • 7

收录时间

岗位职责

课题背景: 强化学习已成为大模型后训练阶段持续提升推理能力与智能上限的关键技术。随着数学、代码、科学、逻辑推理等复杂任务成为模型竞争核心,模型优化正从单纯依赖参数和数据规模扩展,转向以长思维链、过程监督、可验证奖励和工具增强为核心的推理优化范式。因此,面向推理场景开展强化学习算法研究,并系统提升模型高阶推理能力,已成为基座模型持续演进的重要方向。 课题挑战:

  1. 长思维链与长轨迹训练中普遍存在奖励稀疏、信用分配困难、训练不稳定等问题,鲁棒训练、样本效率与探索利用平衡难以兼顾。
  2. 数学、科学等高难任务对中间过程正确性要求高,如何构建通用验证器、过程监督与可验证奖励体系,是提升模型泛化能力的关键。
  3. 推理链条常伴随冗余反思与无效解码,如何结合强化学习、数据闭环与工具使用,实现正确率、推理效率与训练成本的协同优化,仍缺乏成熟方案。 具体工作: 你将参与推理场景强化学习算法设计、推理数据构建、奖励与验证体系建设、思维链优化,以及数学、科学等高难任务的能力迭代,持续提升模型推理上限与效率。

职位要求

  1. 学历和专业要求: 计算机、人工智能、机器学习、自然语言处理、自动化、数学、统计学等相关专业硕士及以上学历,博士优先。
  2. 技术技能要求: 具备强化学习、深度学习或大语言模型相关研究基础,熟悉 PPO、GRPO、DPO 等训练或对齐方法,了解大模型推理增强、数据构造或评测方法;熟练掌握 Python,熟悉 PyTorch 等深度学习框架,有较强实验设计与工程实现能力;有高质量论文发表者优先(如ACL、EMNLP、NeurIPS、ICML、ICLR等)。
  3. 软性素质要求: 具备较强的问题分析能力、自驱力和协作意识,对前沿算法研究有持续热情,能够独立推进研究问题分析、实验验证与方案迭代;具备强烈的进取心、自驱力及团队合作精神,热衷于追求技术创新。

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

TEG混元基座模型-强化学习算法研究&强推理能力优化

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看混元基座模型-强化学习算法研究&强推理能力优化正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位混元基座模型-强化学习算法研究&强推理能力优化TEG · 北京

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏混元基座模型-强化学习算法研究&强推理能力优化正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

TEG混元基座模型-强化学习算法研究&强推理能力优化校招 · 北京

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入混元基座模型-强化学习算法研究&强推理能力优化内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。