岗位职责
- 大模型后训练(SFT/RL),负责多任务合训中的任务干扰、文本长度偏差等关键问题的研究,探索 DPO/GRPO/GSPO 等强化学习算法在复杂判别场景的应用,提升模型的指令遵循能力与场景泛化性。
- 知识蒸馏,探索大参数量教师模型向小参数量学生模型的推理能力迁移方法,包括 CoT 思维链蒸馏与推理逻辑对齐,在保持判别精度的同时大幅降低部署成本。
- 数据合成与自动标注,研究基于大模型的数据自动标注与质量筛选方法,构建高质量训练数据飞轮,提升训练数据的多样性与标签准确率。
- Agent 模型能力建设,研究智能体的 Tool 调用准确率提升、记忆压缩、多轮交互优化等问题,通过在真实业务场景中的轨迹采集与强化学习,持续优化模型的工具使用与自主决策能力。
职位要求
- 计算机科学/人工智能、数学/统计学、电子信息工程等相关专业硕士或以上学历,有大模型训练或深度学习相关经验。
- 熟练掌握大模型后训练方法,有百亿级参数模型训练经验者优先。
- 熟练掌握 PyTorch 及分布式训练框架(DeepSpeed/Megatron 等),具备良好的工程落地能力。
- 有智能体(Agent)Tool 调用优化、多轮 RL 训练经验者优先。
- 在 ICML、NeurIPS、ICLR、ACL、EMNLP 等顶会发表过论文或有竞赛经验者优先。
- 突出的分析问题和解决问题能力,自我驱动,具备较强的学习能力、创新应用能力及沟通协调能力。