岗位职责
专注大语言模型强化学习的研究、探索和开发,具体职责包括:
- 针对多轮Agentic任务场景,开展基于大语言模型(LLM)的强化学习(RL)优化及奖励归因机制研究;
- 设计与实现创新型多轮Agentic RL训练与收敛优化方法,提高训练效率与任务泛化能力;
- 深入探索RL算法在提升智能体泛化性和鲁棒性方面的理论与工程实现,推动算法在实际复杂环境下的稳定应用;
- 推动研究成果在阿里云PAI平台的分布式训练、强化学习等核心产品框架中的集成与落地,支持工业级Agentic AI解决方案的研发和部署;
- 跟踪领域前沿动态,撰写高质量学术论文,申请相关发明专利,并在国际顶级学术会议(NeurIPS、ICLR、AAAI等)或期刊进行成果输出。
职位要求
- 计算机科学、人工智能、电子工程等相关专业在读博士;
- 有AI算法方向的顶会/顶刊论文发表;
- 扎实的C++/Python编程能力,具备良好的代码工程素养;
- 优良的沟通能力、团队合作意识和经验;
- 具备快速学习的能力,并能够持续深入钻研技术问题。 加分项
- 有优秀的创新研究能力,在CCF-A类会议上有相关方向论文发表;
- 对LLM的后训练算法有深入的研究及务实的经验;
- 有大规模、分布式LLM训练的项目经验;
- 对强化学习方向的前沿技术有相关贡献。