岗位职责
岗位职责
- 设计与实现大规模 Agentic RL训练系统;
- 设计Agentic RL数据系统,构建支持百万级trajectory生成与消费的高吞吐数据流水线;
- 建立完善的可观测性与系统调度能力,推动训练稳定性与系统鲁棒性建设;
- 构建下一代Agent及环境执行系统,支持复杂Agent任务的大规模训练与评估;
- 构建Environment Runtime / Sandbox系统,实现高并发、低延迟、安全隔离执行;
- 支持多智能体协同与长时间运行任务,推动Agent系统向持续学习与自我进化系统演进;
- 推理与训练一体化优化:构建高性能推理系统,优化多轮交互与长上下文场景下的吞吐与延迟;优化大模型RL流程中的训练性能。
职位要求
- 扎实的计算机基础(操作系统 / 网络 / 分布式系统),具备系统级工程能力;
- 精通 Python / C++,具备高性能系统开发经验(多线程 / 异步 / CUDA优先);
- 熟悉主流深度学习框架(如 PyTorch / JAX),理解模型训练与推理流程;
- 具备分布式系统或大规模训练经验,理解:通信原语(AllReduce / ReduceScatter / AllGather)、并行策略(DP / TP / PP 等);
- 具备系统性能优化能力,能够分析并解决:GPU利用率瓶颈、通信瓶颈、数据流水线瓶颈;
- 具备复杂系统调试能力,能够定位训练不稳定与性能异常问题;
- 自驱力强,对RL系统、Agent系统及大规模基础设施有强烈兴趣。 加分项 加分项(满足部分即可)
- 深入理解强化学习算法(如 PPO / GRPO / DAPO / RLHF / Agentic RL),并具备工程化经验;
- 熟悉强化学习训练框架(如 veRL / OpenRLHF / AReal / ROLL / Slime);
- 具备大规模训练经验,熟悉 Megatron / DeepSpeed / FSDP / veScale,混合并行与大模型训练优化;
- 熟悉推理系统(如 vLLM / SGLang / TensorRT-LLM);
- 有GPU性能优化经验(CUDA / NCCL / Tensor Core / FP8);
- 熟悉Agent系统关键组件;有Sandbox或执行环境经验(Docker / VM / Browser automation);
- 有RL训练稳定性调优经验(KL / entropy / reward / variance)。