岗位职责
- 合版算法研究:探究以 SFT 和 On-Policy Distillation(OPD)为核心的合版策略,持续优化合版训练效果,改善专项冲突问题,提升合版流程的稳定性与合版结果的可预测性。
- 合版反馈链路建设:分析合版训练监控指标,定位冲突专项与原因,为专项模型的数据迭代和 SFT、RL 训练流程提供反馈,帮助专项在改进性能的同时减小合版冲突风险。
- 合版训练框架建设:参与 OPD 等合版训练框架的迭代,与 infra 和工程团队协作,探究、开发面向多专项、超长程任务的合版算法与框架,提升合版训练框架的效率与稳定性。
- 合版前沿技术追踪:持续追踪前沿的合版技术,在内部模型研发中快速测试与验证。
职位要求
- 计算机科学、机器学习、人工智能相关专业背景,硕士及以上学历优先。
- 熟悉 LLM 后训练、合版、OPD/RL 训练流程与算法,有大规模模型交付和迭代流程经验的优先。
- 具备优秀的工程能力,熟悉 Megatron、FSDP 等训练框架和 SGLang、vLLM 等推理框架,熟悉 veRL、slime 等 RL 训练框架,有 100B 以上 MoE 模型及千卡训练经历的优先。
- 在 NeurIPS、ICLR、ACL 等国际顶级会议/期刊上发表过高影响力论文,或具有知名开源项目贡献经历。
- 有基模团队工作/实习经历的优先。