岗位职责
- 研究模型能力诊断与弱点驱动的数据生成方法。从模型真实失败行为中刻画能力边界与错误模式,反向决定合成任务的难度分布与领域配比;并通过多智能体协作的「错误定位—归因诊断—修正续写」闭环,把大规模低质量轨迹提纯为高信息密度的训练信号,让失败案例成为最有效的监督来源。
- 研究复杂可执行环境、长程任务与可验证奖励的自动化合成方法。在保证可扩展性的前提下,让合成任务的复杂度与保真度逼近真实工作流(数十至上百的输入文件与执行步骤、跨文件跨工具的深层依赖、多轮交互中的需求变更与目标漂移),并配套设计客观可信的验收体系(Rubric 设计与迭代、真实环境执行校验、评分器区分度与稳定性评估)
- 完成从数据到能力的端到端闭环并推动算法创新。将合成数据用于Agentic 训练,量化不同数据策略与配比对模型能力的实际增益,持续迭代模型在 Agent 场景的表现,并沉淀发表高水平论文或技术报告。
- 目标场景验证通用性与可迁移性。将上述能力应用到具体场景,解决具体的数据合成和Agentic训练问题,包括但不限于:办公领域的超复杂文档处理任务;基于真实用户多轮对话反馈的长程软件工程任务;金融、法律、医疗、CS 等垂直领域的典型办公与研究流程;以及面向生物、化学、材料、物理等理工科研的自动化科研智能体。
职位要求
- 博士在读优先(优秀硕士在读亦可),计算机科学与技术、数学、自动化及相关专业;
- 熟悉常见深度学习框架(PyTorch 等),有 LLM 后训练(SFT / RLHF / RLVR)或 Agent 相关实践经验者优先,有一作顶会论文或高质量开源项目经验者优先;;
- 具备较强的问题定义与拆解能力和扎实的工程实现能力,能独立搭建并调试数据合成管线与沙箱化任务执行环境;
- 有金融、法律、医疗、生物、化学、材料、物理等垂直领域背景,将是显著加分项;
- 能保证每周 4 天以上、连续 6 个月以上实习时间者优先。