岗位职责
- 设计支持数T参数MoE模型的分布式RL架构,实现计算、通信与采样的极致重叠,数倍提升吞吐量。
- 构建高度解耦的算法支持框架,使On/Off-Policy算法可敏捷迭代与混合部署。
- 实现推理与训练资源的统一弹性调度,让“推理时搜索”“反思”等产生训练信号的环节与大规模训练无缝协同,最小化GPU空转。
- 建立自愈式的训练稳定性体系,突破长周期、超大规模下的数值收敛与故障自恢复难题。
职位要求
- 学术成果:海内外顶尖高校博士,在分布式系统、机器学习系统或强化学习领域有扎实研究背景,以第一作者在OSDI,SOSP,NSDI等顶会发表过高质量论文。
- 技能与系统能力:精通PyTorch及分布式训练技术,对PPO、GRPO等RLHF算法有原理级理解与实现经验;熟悉NCCL、RDMA等通信优化及GPU集群调度,具备万卡规模训练调优实战能力。
- 工程与创新落地:能将算法创新高效转化为工业级系统,有强代码工程能力,善于在计算、通信与采样之间挖掘极致吞吐性能。
- 软实力:自驱力强,有开拓技术无人区的魄力,渴望在超大规模RL基础设施方向做出定义性工作。