岗位职责
- 定义 ToB Harness 产品:把一套底座切成客户能选的能力档位 收敛 runtime 的配置维度(模型、harness、工具、Skill、卡片样式),对外只暴露档位与少量参数,不暴露内部复杂度。 设计能力分档策略:每档要给出延迟、成本、智能度的明确三角,以及哪些请求会被降级、哪些会被直接拒绝。 按客户形态拆接入方案:有屏车机、无屏 AIoT 设备、第三方 App 内嵌助手,各自的接入路径与兜底逻辑要分别定义。 定义对外返回结构与计费口径:卖结论、卡片与引用来源,不卖裸数据;按量阶梯计费而非包月。 每份方案配一份客户视角的接入演练,包含真实 API 调用示例、失败态处理和能力边界声明。
- 建设 Agent 平台产品:让 Agent 的生产与准入变成流水线 负责 Agent 的创建、配置装配,以及外部工具与 Skill 的引入与治理。 工具与 Skill 的准入审计:schema 与实际注册实现是否同步(不同步会产出模型看得见但调不通的幻影工具);工具返回的凭据字段在上下文裁剪后是否还在(丢了会导致同一个目标被重复召回);第三方 Skill 的字段语义是否与本平台一致(同一个 allowed-tools 字段,在有的框架里是权限白名单,在有的框架里是增量召回清单,语义相反)。 上下文工程治理:拆清单请求里 system prompt、tools schema、对话历史各占多少 token,识别哪部分是固定开销,在裁剪率与召回质量之间给出明确取舍,不靠感觉调。
- 构建评测闭环:用任务完成率而不是格式合法率驱动迭代 设计细粒度评测集,多个指标分开看、不做加权合成,红线项单独判定。 核心指标是任务完成率与任务满足率。"格式合法地终结了对话"不算完成。 推动实验有效的策略固化为生产能力,并持续监控线上表现。
- 推进项目落地:每阶段有可验收产物,卡点显性化 按三阶段节奏推进——底座打通、SDK 与控制台上线、规模化复制,每阶段的验收标准提前写死。 维护 Owner 表与卡点表。周会只过两件事:本周动了什么、被谁卡住,不做进度美化。 客户交付走项目制:需求分级、变更控制、上线后监控与迭代排期。并行管理 3 个以上客户与 2 个以上内部团队时,排期不失控、卡点能及时上升。
职位要求
- 懂 Agent 运行时原理 有 ToB 产品交付经验,SDK、开放平台、开发者控制台任一方向,能独立写出客户看得懂的接入文档与能力边界说明。
- 能自己动手验证假设 熟练用 Python 配合 AI 编程助手写评测脚本、解析 trace、跑 prompt 回归、搭 mock 与 record-replay 环境,不靠等别人排期。
- 有数据品味 拿到一个 bad case 能判断根因落在哪一层:prompt 写法、工具 schema、召回数据,还是评测环境本身不可控。
- 双向翻译能力 对工程讲清要改哪个模块,对客户讲清能力边界在哪、这个需求为什么现在做不了。
- 计算机、人工智能或相关专业背景,3 年以上 AI 产品或平台产品经验。 加分项:
- 做过评测平台、harness 层或 Agent 编排框架。
- 熟悉 Skill 与 MCP 工具生态,能判断外部能力的准入风险。
- 有车企或 IoT 设备客户的交付经验。
- 从 0 到 1 建过开放平台或开发者控制台,并在其中承担核心产品决策。
- 熟悉主流开源与闭源模型的能力差异,做过多模型路由策略。