招聘中 社招

Agent稳定性测试工程师

核心本地商业-基础研发平台

  • 北京市、成都市
  • 测试

收录时间

岗位职责

负责 CatPaw Agent 稳定性测试和评测体系建设,设计并实现覆盖 Skill/Plugin、工具调用、端到端任务完成度的评测框架与自动化测试基建,支撑模型与策略选型决策,以及持续量化并提升开发者体验。 面向 CatPaw 多智能体集群构建运行时评测能力,针对路由调度、会话管理、记忆系统等模块设计场景化用例集与回归基线,识别多轮长链路下的能力衰减与稳定性风险。 主导长程任务 harness 效果评估工作,围绕Prompt 工程、tool Calling 、上下文管理、以及memory能力建立指标体系,评测驱动Agent持续优化。 主导CatPaw Agent产品需求交付质量保障、AI自动化测试开发,保障Agent产品的高质量高效上线。 覆盖 IM/社交/办公等多端渠道及浏览器自动化场景的真实链路验收,badcase分析,沉淀可复用的场景数据集与自动化巡检能力,推动线上质量可观测,以及数据飞轮建设。 参与安全与合规评测,针对多租户权限隔离、数据沙箱、越权与提示注入等风险构建红队用例与对抗性评测方案,保障系统安全性与稳定性。 参与构建下一代 AI Agent 开发框架的评测标准与质量体系,结论直接影响框架演进方向,技术影响力广泛。 深度使用 AI 工具进行开发与评测,鼓励高效人机协作。 与前沿 AI 技术团队共同探索多智能体系统、浏览器自动化等创新方向的评估难题。 扁平化工作环境,支持技术自主决策与快速迭代。

职位要求

大学本科及以上学历,3 年以上研发或质量工程经验,精通 TypeScript/Node.js 或 Python,具备较强的工程实现能力。 重度 AI Coding 用户,熟练使用 CatPaw/NoCode/Cursor/CC/CodeX 等 AI 编程工具完成日常开发与评测脚本建设。 深入理解 LLM 应用开发,掌握 Prompt 设计、Tool Use、RAG 等核心技术,理解其常见失效模式与对应的评估手段。 熟悉大模型评测方法论,包括自动化评测、LLM-as-a-Judge、人工标注与抽样、A/B 实验与统计显著性判断,能设计出可复现、低噪声的评测流程。 具备平台或框架级系统设计能力,能独立完成评测平台核心模块的架构与实现,并推动数据驱动的质量改进落地。 具备自驱力,善于与 AI 协作,主动探索技术边界并推动结论转化为产品迭代。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

核心本地商业-基础研发平台Agent稳定性测试工程师

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看Agent稳定性测试工程师正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位Agent稳定性测试工程师核心本地商业-基础研发平台 · 北京市、成都市

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏Agent稳定性测试工程师正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

核心本地商业-基础研发平台Agent稳定性测试工程师社招 · 北京市、成都市

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入Agent稳定性测试工程师内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。