岗位职责
- 深入理解豆包AI大模型To B客户需求,将客户反馈转化为评测任务,确保评测结果真实反映客户使用效果;
- 基于真实业务场景构建端到端评测Pipeline(含Agent工具调用、RAG检索、多轮对话等复合链路);
- 从实际使用视角设计评测案例——模拟客户真实Workflow,评估模型在完整工作流中的表现;
- 设计Agent和Coding场景的过程评测指标(如工具调用准确率、代码通过率、多步规划成功率等),能拆解模型每一步的效果;
- 实现评测自动化,在AI工具的帮助下,实现To B复杂场景的评测自动化。
职位要求
- 获得本科及以上学历,硕士学位优先,计算机科学、软件工程、人工智能等相关专业;
- 对主流Agent和Vibe coding工具非常熟悉,有丰富的使用经验;
- 对主流大模型(GPT系列、Claude系列、开源模型)有深入使用经验,熟悉各模型能力边界;
- 有数据分析能力,能从评测数据中发现Pattern、定位问题根因;
- 较强的自驱力,能主动提出新的思路,并推动落地执行。