岗位职责
- RL 后训练框架研发: 负责 Relax RL 后训练框架的核心研发,支持 SFT、DPO、PPO、GRPO、RLVR 等主流后训练范式,持续追踪并落地前沿算法。
- RL Pipeline 优化: 设计高效的 RL 训练 Pipeline,优化 Rollout、Reward Model、Actor、Reference Model 等模块间的资源调度与动态协同,提升端到端训练吞吐。
- 分布式训练优化: 基于 Megatron、SGLang 等训推框架,针对Agentic RL 场景调优 TP / PP / DP /SP 以及 PD分离、KV 压缩等策略,在性能、显存与稳定性之间取得最优平衡。
- 千卡训练稳定性建设: 攻克大规模训练中的显存管理、跨节点通信、弹性容错、任务调度与数据流转等核心挑战,提升训练成功率与集群资源利用率。
- 异构芯片训练适配: 负责训练框架在国产异构计算芯片(昇腾 / PPU / 昆仑芯 等)上的适配与优化,完成模型迁移、算子支持、框架适配、Profiling 与 Kernel 调优,推动国产算力在训练场景的规模化使用。
- 后训练工具链建设: 构建端到端后训练工具链,打通训练框架与 MLOps 平台,提供训练可视化、自动超参搜索、故障诊断等生产级能力,降低算法团队使用门槛。
- 业务协同与算法探索: 与算法团队紧密协作,支撑 LLM / MLLM / Agent 等业务方向在 SFT 与Agentic RL 领域的算法探索与工程落地。
职位要求
- 精通 PyTorch,具备训练框架源码级阅读与修改能力,有实际性能优化经验。
- 熟练掌握 Megatron、DeepSpeed、veRL、Slime、AReal、OpenRLHF 中至少一种框架的使用与二次开发。
- 理解分布式训练核心技术,包括 TP、PP、DP、ZeRO、序列并行、梯度累积、混合精度训练等。 熟悉 RLHF、DPO、PPO、GRPO、OPD、MOPD 等
- 大模型算法流程,有实际训练调优或框架开发经验优先。
- 具备模型训练性能分析经验,能借助 Nsight Systems / Compute、nvprof、PyTorch Profiler 等工具定位训练性能瓶颈。
- 具备良好的工程实现能力、沟通协作能力和问题闭环意识。 加分项:
- 有千卡级大模型训练或后训练实战经验,成功解决过跨节点通信、容错训练、显存优化、训练稳定性等生产级问题。
- 熟悉 NCCL / RDMA / InfiniBand / RoCE 等高性能网络通信机制,能独立定位跨机通信瓶颈。 有 CUDA Kernel 开发经验,如 Fused Operator、FlashAttention、通信计算重叠(Overlap)等性能优化。
- 有国产异构芯片(昇腾 Ascend、平头哥 PPU、昆仑芯XPU)训练适配或 Kernel 开发经验,熟悉 CANN / ROCm 等基础软件栈;有大模型在国产芯片上规模化落地实战经验者优先。
- 深入理解 GPU / NPU 硬件架构(Tensor Core、内存层级、计算单元、通信拓扑),能结合硬件特性进行差异化训练优化方案设计。
- 参与过 Megatron、DeepSpeed、Slime、AReal、OpenRLHF、TRL 等开源项目的核心模块开发或贡献。
- 在大模型训练、分布式系统或 MLSys 方向有高水平学术论文发表。