岗位职责
面向大模型负责后训练方向的核心研发与持续优化。该岗位分为基础模型后训练优化与应用场景后训练优化两个方向,候选人将根据研究背景、项目经验和团队需求匹配其中一个方向。 围绕数据飞轮、训练范式、评测体系与效果归因,持续提升模型在指令遵循、推理、可控性、工具使用、多模态理解与生成等方面的能力。 具体的职责包括以下相关方向的一项或多项:
- 基础模型后训练优化。围绕语言大模型或多模态大模型的通用能力提升,开展 SFT、偏好优化、强化学习等后训练工作,持续增强模型在指令遵循、推理深度、可控性、泛化能力与稳定性等方面的表现;
- 应用场景后训练优化。面向搜索问答、智能体、多模态理解、AIGC 等真实业务场景,设计并迭代应用导向的后训练方案,提升模型在复杂任务、多步执行、工具使用和内容生成等场景中的任务完成质量与落地效果;
- 数据飞轮与治理。建设高质量后训练数据体系,覆盖指令数据、偏好数据、轨迹数据、评测数据及多模态数据,持续优化数据构建、筛选、配比、标注与质量评估策略,推动数据与模型效果的闭环迭代;
- 评测与效果归因。搭建面向模型能力与业务目标的评测体系,结合自动化评测、离线基准、回归测试与实验分析,对训练效果进行量化评估、问题定位与归因,支撑训练策略和数据策略的持续优化;
- 工程落地与协同优化。与研究、系统、应用和产品团队协作,推动后训练方案在真实训练与业务环境中的高效落地,综合平衡效果、成本、稳定性与迭代效率。
职位要求
- 扎实的深度学习与优化理论基础;
- 深入理解 Transformer 与主流大模型架构;
- 有SFT、RLVR、Agentic RL、RLHF、reward model、distillation的训练经验;
- 能独立定义问题、设计实验并进行严谨验证;
- 能从第一性原理进行思考与建模;
- 能在复杂工程约束下做出算法决策。 加分项
- High contribution & low ego;
- 在顶会 / 顶刊发表过相关论文;
- 有构建新评测基准经验;
- 参与过 100B 以上参数规模的模型后训练;
- 精通 Agentic Coding;
- 熟悉 Verl、OpenRLHF、Slime 等开源RL框架,熟悉 Megatron、vLLM、SGLang 等训练推理引擎;
- 有交叉学科背景(数理化生、文史哲、金融、医疗等);
- 各类国际级竞赛(IMO、IPHO、ICHO、IOI、ICPC、Kaggle等)获奖。