岗位职责
- 参与 Agentic Search 模型的全链路研发:从检索/推理轨迹(Trajectory)数据构建、SFT 冷启,到 GRPO 等强化学习优化,端到端提升搜索智能体的规划、多轮检索与工具调用能力。
- 设计与迭代奖励机制:探索 rubric-based reward、RLVR 等方案,兼顾答案正确性、格式规范与工具使用效率,并主动识别与治理 reward hacking / 奖励过度优化问题。
- 优化智能体的上下文管理与推理效率:研究长轨迹下的上下文压缩、观察折叠、多模态检索等方向,在不降低效果的前提下压缩响应长度与调用开销。
- 参与 Trajectory 质量评估体系建设:从工具调用效率、错误率、指令遵循度、回复相关性等维度分析线上对话日志,反哺数据与奖励设计,形成闭环。
- 跟踪前沿并快速落地:将学术界最新的 Agentic Search / RL / Reward Modeling 工作转化为可验证的实验方案。
职位要求
- 计算机、人工智能、统计等相关专业在读博士。
- 扎实的算法基础,熟练使用 Python 与 PyTorch,具备独立完成实验设计、执行与分析的能力。
- 熟悉 Agent / Tool-Use / RAG / 多轮检索推理范式,了解 ReAct 类框架与 search agent 的典型 pipeline。
- 具备良好的科研品味、独立思考能力与跨团队协作沟通能力,对前沿问题有持续热情,敢于挑战现有范式。
- 在NeurIPS、ICML、ICLR、ACL、EMNLP等大模型领域顶级会议以第一作者发表过论文者优先,研究方向与大语言模型、强化学习、Agent、多模态模型等强相关。