岗位职责
我们正在寻找面向下一代基础语言大模型预训练方向的核心成员,参与超大规模语言模型从架构设计、数据构建、训练策略到系统落地的全链路研发。你将面向万卡规模集群、万亿参数模型、百万亿token语料、百万token上下文,探索更高效、更稳定、更具可扩展性的预训练方法,推动模型能力、训练效率与工程可落地性的持续突破。 该岗位将深度参与以下方向:
- 模型架构设计 负责基础语言模型核心架构的设计与演进,包括但不限于注意力机制、MoE 结构、长上下文建模、自进化、记忆机制、推理效率友好的结构设计,以及模型在训练稳定性、扩展性与泛化能力上的联合优化。结合算法与系统约束,推动模型架构在真实大规模训练环境中的落地与迭代。
- Scaling Law 研究 围绕模型参数规模、数据规模、训练算力与效果之间的关系开展系统性研究,建立面向实际生产环境的 scaling law 认知与方法体系。通过实验设计、规律归纳与指标分析,指导模型架构与尺寸选择、数据预算分配、训练阶段规划及资源投入决策,提升预训练研发效率。
- 数据与训练策略 负责大模型预训练数据体系与训练 recipe 的设计与优化,包括数据配比、课程学习、退火策略、长短序列混合、优化器与学习率策略、token 级与阶段性训练方案等。探索预训练与中训练(mid-training)阶段的衔接方法,持续提升模型的知识密度、泛化能力、推理潜力与任务迁移效果。
- 预训练可观测性 建设和完善大模型预训练过程中的可观测性体系,包括训练稳定性监控、loss/梯度/激活统计分析、异常检测、数据分布诊断、阶段性能力评估与问题定位。通过更细粒度的观测与分析手段,提升对训练过程的理解能力,加快问题排查、策略迭代与实验闭环。
- 超大规模训练 参与万卡、万亿参数、百万亿token、百万上下文的超大规模预训练任务的设计、实施与优化,解决训练过程中的稳定性、吞吐、容错、负载均衡与资源利用问题。围绕大规模并行训练、FP8/FP4低精度训练、长周期任务管理与算法-系统协同优化展开工作,推动超大模型训练在效率、成本与可靠性上的持续提升。
职位要求
- 扎实的深度学习与优化理论基础;
- 深入理解 Transformer 与主流大模型架构;
- 有预训练/继续预训练/数据与策略消融实验的实战经验;
- 能独立定义问题、设计实验并进行严谨验证;
- 能从第一性原理进行思考与建模;
- 对 scaling 与模型能力演化有系统性思考;
- 能在复杂工程约束下做出算法决策。 加分项
- High contribution & low ego;
- 在顶会 / 顶刊发表过相关论文;
- 有新型MoE、Attention或其他架构设计经验;
- 有长上下文(100K+)训练经验;
- 有数据分布建模与数据 scaling 经验;
- 参与过 100B 以上参数规模的模型训练;
- 精通 Agentic Coding;
- 熟悉 Megatron、TE,有 Triton、CUDA kernel开发经验;
- 各类国际级竞赛(IMO、IPHO、ICHO、IOI、ICPC、Kaggle等)获奖。