岗位职责
聚焦于LLM后训练中知识蒸馏、模型安全、Agent等相关算法研究,具体职责包括:
- 知识蒸馏、RL算法优化与创新,不断提升LLM的reasoning能力;
- LLM safety相关算法优化与创新,通过Guard模型构建、模型可解释性技术探索、适配模型安全领域特性的SFT/RL算法优化等,不断提升LLM的安全性;
- Agent后训练探索与创新,提升模型在专业领域上端到端解决复杂任务的能力。
职位要求
- 精通Python等语言,熟练掌握PyTorch、verl、vllm等主流训练和推理框架,具备扎实的coding能力;
- 在CCF-A国际会议或期刊(ICLR/NeurIPS/ICML/ACL等)有论文发表;
- 对解决复杂技术问题、探索post-training前沿技术具备强烈的自驱力和技术热情;
- 长期实习,一年以上。 加分项:
- 在ACM-ICPC等国内外知名算法竞赛中取得优异成绩;
- 作为核心贡献者参与过高影响力的开源项目或发表过有高影响力的技术报告。