岗位职责
- 负责MAAS平台模型微调体系产品能力建设:RLHF/RLAIF、DPO/GRPO/PPO等方法选型与迭代;
- 负责推理能力强化:可验证奖励(数学/代码)驱动的RL训练、长思维链优化;
- 建设RL基础设施:大规模Rollout、异步训练、奖励模型服务化;
- 探索Agentic RL与平台场景结合(工具调用、多智能体协作);
- 与离线推理、模型评测方向协同,形成"训练—评测—推理"闭环。
职位要求
- 本科及以上学历,3年及以上相关工作经验;
- 2 年以上机器学习算法经验,其中2年以上LLM后训练/强化学习实战;
- 深入理解主流RL算法与训练框架,有大规模分布式训练经验;
- 有完整的、可陈述的RL提升模型能力的实战案例。