岗位职责
Ling Team 聚焦百灵模型家族的核心算法创新。 我们不仅关注算法的理论上限,更关注: * 算法在工业界场景的稳定落地与高效实现 * 训练与推理系统的极致性能(吞吐与利用率) * 从数据处理到模型部署的全链路自动化与工程化 * 在万亿参数与百万上下文规模下的系统鲁棒性 在1T参数与1M Context的规模下,即时模型的后训练是一项庞大的系统工程。本岗位将主导大规模训练Pipeline的构建、Agentic 能力的工程实现以及数据流转系统的开发。我们寻找的不仅是理解算法原理的工程师,更是能编写高质量代码、构建高效训练框架、解决实际算力与数据瓶颈的实战派。 主要职责包括:
- 大规模训练管线构建与优化 (Pipeline Engineering) * 训练系统开发:负责万亿参数级模型 SFT / RLHF / RLVR / Agentic RL 等全流程训练的搭建、维护与性能调优; * 效率与稳定性:解决分布式训练中的显存墙、通信瓶颈与稳定性问题,优化 GPU 利用率与训练吞吐量(Throughput); * 算法工程化落地:将前沿的强化学习算法(如复合奖励模型、过程监督)转化为高可用的工程代码,实现训推一体化框架的平滑流转; * 实验管理:构建标准化的实验管理平台,支持算法团队进行高效的超参搜索与模型迭代。
- 模型能力实现与评测体系 (Capability Implementation & Eval) * 能力专项建设:针对逻辑推理、长程规划及工具使用(Tool Use)等能力,实现具体的训练任务与数据配方加载,确保模型能力按预期对齐; * Agentic 工程集成:实现模型与外部环境(如代码解释器、API)的交互接口,开发高并发、高保真的 Agent 仿真训练环境; * 自动化评测:构建覆盖长上下文、多轮对话及复杂指令遵循的自动化评测系统(Eval Pipeline),快速反馈模型迭代效果。
职位要求
- 深入理解大模型训练框架和推理引擎的基本原理,熟悉底层框架基本架构和实现原理;
- 了解业界主流语言大模型相关基础结构和优化方法;
- 熟悉GPU,存储,分布式集群等相关基础知识;
- 熟悉大模型基本后训练流程以及相关算法原理;
- 能从第一性原理建模问题,有较好的动手能力;
- 有较好的团队协同能力,思路敏捷,沟通效率。 加分项:
- 有100B MOE模型以上的后训练时间经验;
- 有强化学习,SFT,OPD相关的顶会论文发表;
- 有训练,推理,评测效率优化以及与算法协同开发经验;
- 有agent Harness相关经验,超长上下文管理等能力的实践与优化经验;
- 有跨学科背景(数理化生 / 医疗 / 金融 / 法律等);
- 各类高水平竞赛金牌选手。