岗位职责
本岗位聚焦 算法 × 工程 co-design,你将深度参与模型架构、预训练与强化学习训练范式的系统级落地与共创。我们寻找的不是“支持算法”的工程师,而是能参与定义下一代训练范式的人。 具体的职责包括以下相关方向的一项或多项:
- 模型架构 × 系统共设计: * 参与 MoE / 混合 Attention / Linear Attention 等架构的并行策略设计; * 设计 EP × TP × CP x PP x DP 等多维并行协同机制; * 构建高效 KV cache、激活重算与内存调度策略; * 在架构设计阶段建模通信复杂度与可扩展性; * 推动 FP8 / FP4 混合精度在全链路落地。
- 超大规模预训练系统建设: * 构建百万亿 token 级数据供给与动态采样编排系统; * 优化 Optimizer × 通信 × 计算协同机制; * 构建长上下文训练(1M+)的系统级支撑能力; * 设计万卡级分布式训练架构与通信调度优化方案。
- 强化学习与 Agentic 训练优化: * 优化超大规模 RL 训推系统性能; * 长轨迹 Agentic RL 训练效率优化; * 大规模 Agent 环境自动化构建和资源管理; * 持续迭代 Reasoning、Agentic、multi-agent RL 的框架。
职位要求
- 深入理解分布式训练体系(TP / PP / SP / EP / CP 等);
- 熟悉主流大模型训练框架/推理引擎底层实现(Megatron / DeepSpeed / FSDP / vLLM / SGLang 等);
- 熟悉 Triton / CUDA / NCCL / 通信优化原理;
- 能从算法目标反推系统架构设计;
- 具备从第一性原理推导系统设计的能力;
- 对 scaling law 与系统瓶颈具有直觉判断;
- 敏捷思维与良好协作能力,能与算法研究员进行深度技术对话。 加分项:
- High contribution & low ego;
- 有 100B 以上 MoE 模型预训练系统经验;
- 有强化学习 / RLHF / Agentic 训练系统经验;
- 有 FP8 / FP4 混合精度工程落地经验;
- 有长上下文(100K+)训练与推理优化经验;
- 有超大规模集群稳定性与容错系统设计经验;
- 对算子融合与 kernel 级优化有实践经验;
- 在顶会 / 顶刊发表过系统或架构相关论文;
- 精通 Agentic Coding;
- 各类国际级竞赛(IMO、IPHO、ICHO、IOI、ICPC、Kaggle等)获奖.