岗位职责
- 设计并持续演进 Agent Eval Platform,支持大规模并发评测任务的高效执行,提供多维度、多任务类型的 Agent 能力量化评估,打通实验、评测、回归与数据闭环;
- 设计并搭建沙箱化任务执行环境,支持代码执行、工具调用、多模态交互等复杂 Agent 行为的安全隔离与精确测量,保障执行环境的稳定性与可扩展性;
- 设计 Agent 轨迹采集系统,建立完善的日志采集、Trace 追踪与异常处理机制,保障评测全流程可观测性。
职位要求
- 扎实的软件工程能力,熟悉TypeScript/Python/Go/Java 等至少一种语言,并能快速熟悉新语言技术栈;
- 深入理解 LLM Agent 运行机制,能针对 Tool Call、多轮对话、长上下文、并行工具调用等复杂场景设计合理的 Harness 抽象;
- 具备分布式系统或任务调度系统的设计与落地经验;
- 熟练使用 AI Coding 工具,并能将其融入开发全流程以显著提升效率。 加分项:
- 有 Agent 评测框架(如 AgentBench、SWE-bench、GAIA 等)使用或二次开发经验;
- 参与过大规模 ML 基础设施或模型训练评测平台的研发。