岗位职责
研究领域: 大模型 项目简介: 如何让大模型"自己教自己"实现持续进化,是后训练研究的核心命题。基于可验证奖励的强化学习(RLVR)已成为大模型推理能力提升的主流范式,但现有方法面临奖励信号稀疏、学习信号难以被模型有效吸收、多专家能力整合效率低等挑战。 本项目围绕"Self-Taught RLVR"这一前沿方向,从三个互补维度展开研究:利用特权信息增强的自身进行自蒸馏(informed self),利用训练过程中近未来的自身提供辅助学习信号(temporal self),以及让多个专家分支边训练边互教实现协同进化(parallel self)。核心目标是让模型为自己生成贴合当前能力、更易吸收的高质量学习信号。项目涉及RLVR、在策略蒸馏(OPD)、多专家融合等后训练核心技术,具有明确的学术前沿性和发表潜力。
职位要求
-在读硕士或博士研究生,计算机科学、人工智能、机器学习等相关专业 -熟悉大语言模型(LLM)的基本原理,了解Transformer架构与主流开源模型(如Qwen、LLaMA等) -具备扎实的Python编程能力和PyTorch深度学习框架使用经验 -对强化学习(尤其是RLHF/RLVR)、知识蒸馏、或大模型后训练方向有了解或研究兴趣 -具有良好的文献阅读能力和数学基础,能理解优化目标推导与理论分析 -逻辑思维清晰,具备独立设计和执行实验的能力 -实习期间每周可投入至少4天,持续5-6个月以上 加分项: -有RLHF/RLVR/DPO等大模型后训练方法的实践经验 -有使用分布式训练框架(如veRL、DeepSpeed、FSDP等)的经验 -有强化学习、知识蒸馏、或LLM推理能力提升方向的论文发表 -熟悉GRPO、PPO等策略优化算法的原理与实现