岗位职责
CatPaw 是面向工作与生产场景的 AI Agent 产品矩阵,覆盖通用办公、云端助理、AI 编程、NoCode 应用生成及企业级 Agent 平台。我们正在寻找一位对 AI 产品效果高度敏感、兼具产品判断力和技术理解力的产品经理。你将负责 CatPaw 系列产品的效果评测、同类产品对标和持续调优,建立从“发现差距—定位原因—推动优化—验证结果”到“沉淀标准”的完整闭环。
- 负责 CatPaw 系列产品的效果评测体系建设,覆盖通用办公 Agent、云端助理、Coding Agent、NoCode 及企业级 Agent 等产品方向。
- 根据真实用户场景建立任务分类、评测数据集、评分标准和基准线,持续完善离线评测、人工评测、自动化评测和在线效果观测机制。
- 持续跟踪国内外主流 AI Agent 产品,设计公平、可复现的横向对比方案,评估任务完成质量、成功率、稳定性、交互体验、执行效率、成本及安全性等关键维度。
- 深入分析评测失败案例和用户负反馈,结合会话、Trace、模型输出及工具调用过程,判断问题来自模型、Prompt、上下文、知识库、工具、Skill、执行环境还是产品交互。
- 与算法、研发、设计及业务团队协作,推动模型策略、Agent Harness、Prompt、Context、Memory、RAG、工具调用和交互体验等方向的调优。
- 设计并推动 A/B 实验、回归测试和版本验收,验证优化方案的真实收益,避免局部指标提升但整体用户体验下降。
- 将评测结果转化为清晰的产品判断和优先级建议,为产品路线图、模型选型、能力建设及版本发布提供决策依据。
- 站在 AI Agent 产品演进的一线,持续体验和研究全球优秀产品,定义什么是“真正好用的 Agent”。
- 不只是发现问题和输出报告,还能深入 Agent 核心链路,直接推动模型、Prompt、Context、Memory、工具与交互体验优化。
- 评测结论将直接影响产品路线、模型选型和版本发布,能够把个人的产品判断沉淀为 CatPaw 的产品标准。
- 与优秀的产品、算法和工程团队紧密协作,共同探索企业级 AI Agent 的能力边界。
职位要求
- 3 年以上 AI、开发者工具、企业软件或效率产品相关经验,其中至少 1 年大模型或 AI Agent 产品经验。
- 深度使用过多款国内外大模型及 Agent 产品,能够识别“看起来能完成”和“真实场景下稳定完成”之间的差异。
- 理解大模型及 Agent 的基本工作机制,熟悉 Prompt、Context、RAG、Memory、Tool Calling、MCP、Skills、Sandbox 等概念。
- 具备较强的评测设计能力,能够将模糊的“效果好不好”拆解为可执行的测试任务、评价维度和度量指标。
- 具备良好的数据分析和问题归因能力,能够从大量案例中识别共性问题,并提出可验证的优化假设。
- 有较强的动手能力和好奇心,愿意高频体验产品、复现问题,并持续跟踪快速变化的 AI 产品与技术趋势。