岗位职责
作为 Auto Research RL 算法研究与数据合成方向的算法研究员,你将参与或负责以下工作:
- 研究 Auto Research Agent 的核心训练方法,围绕理工类科研领域(如生物化学材料物理等)自动化科研智能体的自主决策、规划、工具调用、代码执行与实验验证能力,开展系统性算法研究;
- 设计并构建 Agentic 数据合成体系,研究大规模 Agent 轨迹数据的高效生成、清洗、筛选、增强与配比策略,构建高质量后训练数据管线;
- 探索稳定高效的 Agentic RL 训练方案,应用并改进 PPO、DPO、GRPO 等强化学习算法,优化长程任务中的奖励设计、训练稳定性、探索效率与泛化能力;
- 提升模型在代码、真实科研流程、实验场景中的任务成功率,针对代码生成、实验执行、错误修复、结果分析、论文写作等任务,构建训练与评测闭环,持续提升模型鲁棒性;
- 推动学术成果产出与开源建设,将研究成果整理为高水平论文,投稿至国际顶级会议;根据项目情况推动算法、数据或模型开源,提升团队技术影响力。
职位要求
- 计算机科学、人工智能、信息科学、数学、统计学、自动化或相关STEM专业以及交叉学科背景(如计算生物学、计算神经科学、计算化学)的应届博士毕业生,或即将获得博士学位的优秀候选人;
- 在领域内高水平学术期刊会议上发表论文并经过同行评议;或研究内容形成专利成果;
- 具备扎实的编程能力,熟练使用 Python,熟悉 PyTorch 或类似深度学习框架,能够独立完成算法实现、实验设计与结果分析;
- 深入理解以下至少一个方向:大语言模型 / 多模态大模型、强化学习 / 强化学习后训练、Agent 系统 / 工具调用 / 自主决策、代码智能体 / 自动化科研 / 自动化推理等。熟悉主流强化学习或偏好优化算法,包括但不限于:PPO、DPO、GRPO等;如为自然科学专业,需具备扎实的编程基础,并对AI for Science有强烈兴趣和深入的见解;
- 能够独立推进科研项目,具备较强的理论知识背景、问题定义能力、实验设计能力、论文阅读与复现能力,能够针对复杂问题提出创新性解决方案;
- 具有强自驱力、学习能力、创新意识和沟通协作能力,能够适应快速变化的 AI 研究方向、适应跨学科合作的工作环境,并具备一定抗压能力。