岗位职责
- 设计和实现下一代具有推理和行动能力的AI智能体,推动其在在线旅行行业中的应用落地;
- 研究、设计并实现基于大模型的智能体训练框架,特别是Agentic Reinforcement Learning (Agentic RL) 相关算法,探索和实验多种智能体范式,如ReAct、CoT、ToT 等,并将其与强化学习相结合,开发和优化智能体的推理、规划、工具使用等核心能力;
- 大规模语言模型的预训练、有监督微调(SFT)和指令微调;
- Multi-agent架构的设计和实现。
职位要求
- 来自全球Top高校计算机科学、人工智能、数学、物理或相关领域应届博士/顶尖硕士毕业生;
- 在国际顶级计算机会议/期刊(如NeurIPS、ICML,AAAI、ICLR、ACL等)以一作身份发表过多篇论文,或在开源社区、竞赛中展示出引领性的研究成果;
- 对大模型技术栈有深入理解,具备CPT, LLM的SFT、RLHF等调优经验;
- 对强化学习有扎实的理论基础,熟悉至少一种主流RL算法(如PPO、DQN、SAC等),理解Agentic RL 的核心思想,即大模型作为智能体的“大脑”进行推理和规划,而RL则用于优化其策略和行动序列,有实现智能体工具使用和函数调用能力的经验;
- 扎实的编程基础,熟练掌握Python,至少熟悉PyTorch或TensorFlow之一的主流深度学习框架;
- 具备强烈的求知欲、优秀的问题解决能力和团队协作精神。