岗位职责
Ling Team 聚焦百灵模型金融能力的核心算法创新。 我们关注的不只是 benchmark 指标,而是: * 金融领域的定级行研能力 * Agentic 执行与真实世界决策 * 在工业规模下可持续扩展的训练范式 在万亿参数(1T)与百万上下文(1M Context)的规模下,即时模型的后训练不仅是算法调优,更是对算力、数据与模型架构的系统性重构。 本岗位将主导大规模后训练范式、Agentic RL 以及数据演化策略的核心设计,打造兼具前沿思考能力与工业级Token效率的旗舰模型。 我们寻找的不是仅仅会跑 SFT/RL 流程的工程师,而是能从第一性原理出发,重构即时智能形态的架构师。 主要职责包括:
- 后训练范式与算法重构 * 主导万亿参数级模型的 SFT / RLHF / RLVR / Agentic RL 全流程算法演进; * 构建“正确性 × 过程冗余”的复合奖励模型(Reward Modeling),探索 Token 效率与推理能力的平衡边界; * 研发训推一体的大规模强化学习框架,提升分布式训练的稳定性与吞吐效率; * 探索多目标优化与过程监督(Process Supervision)的前沿技术,实现模型价值对齐(Alignment)的精细化控制.
- 核心能力与 Agentic 智能演化 * 设计针对逻辑推理、长程规划及工具使用的专项训练策略; * 提升模型在复杂指令遵循与创意写作上的表现; * 构建高保真交互环境下的 Agentic RL 训练范式,适配主流智能体协议(如 Claude Code/OpenCode); * 突破即时模型在长上下文(1M+)与多轮对话中的记忆与推理瓶颈。
- 细粒度数据工程与闭环 * 构建 Rubric-driven 的数据合成与演化策略,实现从数据质量评估到清洗的自动化闭环; * 设计基于 Fine-grained Rubric 的质量引导课程学习(Data Curriculum),提升训练效率与模型能力上限; * 探索数据 Scaling Laws,通过高质量合成数据突破传统语料的边际效应。
- 工业落地与学术影响力 * 紧跟 LLM/RL 领域最前沿学术进展,推动技术在工业场景的规模化落地; * 参与百灵核心开源项目建设,在顶级会议(ICML/NeurIPS/ICLR等)发表具有行业影响力的研究成果。
职位要求
- 计算机科学、人工智能、数学等相关专业硕士及以上学历;
- 深入理解 Transformer 架构及 SFT / RLHF / DPO / PPO / GRPO 等核心算法;熟悉 AI Agent 关键技术(如复杂规划、工具调用、记忆机制、RAG及多智能体系统等);
- 编码与工程能力: * 熟练掌握 Python 和 PyTorch,具备分布式训练(多机多卡调优)经验;有高性能计算开发经验(如CUDA编程、SIMD指令优化)者更佳; * 算法与数据结构功底扎实,能针对 LLM 场景优化核心算法(如Attention计算、KV Cache管理)的时空复杂度; * 熟悉代码调试与性能分析工具(如 gdb/pdb, Nsight Systems, PyTorch Profiler);
- 学术与科研能力: * 以第一作者在 NeurIPS, ICML, ICLR, ACL 等顶会或顶刊(CCF-A类)发表过论文; * 获国际级学术或竞赛奖项者优先(如顶会Best Paper、ACM/ICPC金牌、Kaggle Master等);
- 实践经验(加分项): 有头部科技公司或知名 AI 实验室大模型或 Agent 算法相关实习经验者优先。