岗位职责
- 评测体系驱动 ● 将业务需求转化为可执行、可评测的Agent任务,明确能力边界、风险和验收标准。 ● 建设离线与在线评测体系,包括任务分级、评测数据集、回归测试和真实轨迹分析;设计任务成功率、工具调用准确率、人工接管率、执行步数、延迟及Token成本等指标。 ● 建立失败归因机制,区分模型、规划、工具、上下文和系统问题,驱动Prompt、Skill、模型及Harness持续优化。
- 长程任务规划、决策与强化学习 ● 负责多步骤、多工具、跨系统任务的拆解、规划、执行与验证,设计Planner–Executor–Verifier、任务图及动态Replan机制。 ● 建设状态持久化、检查点、断点续跑、幂等执行和失败恢复能力,解决计划漂移、循环调用、上下文污染及长程任务信用分配问题。 ● 构建Agent RL训练闭环,包括轨迹采集、环境回放、奖励设计和策略评估;熟悉SFT、DPO、GRPO、PPO、DAPO及Rejection Sampling等方法。 ● 通过规则奖励、Reward Model或LLM Judge,优化任务分解、工具选择、Replan时机、错误恢复和停止策略,并防止奖励投机。
- Agent架构能力 ● 负责模型、规划、工具、记忆、执行、评测和安全等核心模块的架构设计。 ● 建设通用Agent Runtime,支持单Agent、多Agent、Workflow及Human-in-the-loop;建设模型路由、Tool Calling、MCP、Skill管理和Agent间任务交接机制。
职位要求
- 熟悉Agent规划决策、强化学习和模型后训练,能够独立完成数据构造、奖励设计、训练及效果评估。
- 熟悉LangGraph、AutoGen、OpenAI Agents SDK或类似框架,理解Tool Calling、MCP、RAG、Memory、Planning和Multi-Agent。
- 具备Agent项目生产落地经验,能够通过成功率、成本、延迟、恢复率和稳定性等数据证明实际效果。
- 加分项:在顶会(NeurIPS/ICML/CVPR/ACL等)发表过论文者优先;熟悉Agentic RL和harness的方法优先。