岗位职责
- 负责构建数据驱动的智能体评测体系,基于WorkBuddy/Codebuddy使用场景,设计并开发自动化数据流水线,持续挖掘、清洗和生成高度贴合用户实际场景的高质量评测用例;
- 主导研发支持多模型、多版本并行对比的分布式自动化评测平台,负责核心调度与执行引擎的设计与开发,实现对大规模代码任务(如代码生成、代码理解、调研报告等)的高效、精准评估;
- 针对智能体核心能力场景(如长上下文理解、复杂任务拆解、工具调用、制品生成等),设计并实现对应的评测模块与量化评估指标,确保评测深度与业务针对性;
- 建立评测结果分析与产品优化闭环,通过根因分析(覆盖模型效果、提示工程、知识库等维度)输出可落地的优化建议,并将评测指标与产品核心数据关联,驱动智能体效果持续提升。
职位要求
- 计算机相关专业本科及以上学历,3年以上后端研发或测试开发相关工作经验;
- 精通Java或Go至少一门主流后端编程语言,具备扎实的数据结构与算法基础,拥有良好的工程化思维和规范的编码习惯;
- 具备构建高并发、分布式系统的实际项目经验,熟悉微服务架构、容器化技术及CI/CD开发运维全流程;
- 深入理解软件开发生命周期,能够站在开发者视角设计贴合实际需求的评测场景;有大型系统质量保障或自动化测试平台开发经验者优先;
- 具备优秀的问题分析、归因及解决能力,能独立承担技术方案设计并推动落地;
- 对AI技术有浓厚兴趣,了解大模型、RAG、智能体(Agent)等基本原理,有AI产品评测或工程化相关经验者优先。