岗位职责
- 围绕语言、多模态与 Agent 能力,探索预训练架构、后训练 SFT 数据配比、SFT 策略、SFT 与 RL 协同策略及 RL 训练算法;
- 研究面向 Agentic、Reasoning、Coding、General等高优场景的针对性 Reward System 构建、环境模拟与训练策略;
- 研究强化学习算法与训练稳定性提升方法,包括但不限于重要性采样策略、细粒度 Reward 设计、Credit Assignment 策略、Off-policy Masking 等提升 RL 训推一致性的策略;
- 探索 Model Merge(模型融合)、On-policy KD(在线蒸馏)、Multi-task RL(多任务强化学习)等专项能力融合策略,推动模型综合能力提升;
- 推动后训练与强化学习方案在真实业务和模型迭代中验证落地,形成可复用、可规模化的训练策略与工具链路。
职位要求
- 计算机科学、人工智能、数据科学、软件工程、统计数学等相关专业;
- 具备扎实的软件工程与算法实现能力,深入理解模型架构、深度学习框架和强化学习算法;
- 具备出色的学习力、自驱力、团队协同意识和责任意识;
- 具备语言/语音/多模态/空间智能相关模型预训练、后训练 SFT 或 RL 验证相关方法经验者优先。