岗位职责
- Benchmark体系建设:主导构建覆盖搜推、多模态及Agent的全链路评测基准,保障评测体系的科学性与行业领先性。
- 评测方案与指标设计:针对多维业务场景设计科学的评估体系,并根据技术与业务演进持续迭代自动化评测流水线。
- 竞品对标与决策支持:常态化追踪前沿模型进展开展横向对标,为产品优化和算法策略调优提供高价值的判断与建议。
- 技术研究与创新破局:跟踪业界最新评测方法,积极探索并引入自动化评估,以技术创新驱动评测能力的持续进化与业务价值落地。
- 跨团队协同与合作:联动产品、算法及工程团队,将客观的评测结论转化为具体可落地的业务优化方向与策略调整建议。
职位要求
- 学历专业:计算机或人工智能相关专业本科及以上学历,有顶会模型评估或对齐相关论文发表,或拥有相关领域核心专利者优先。
- 评测经验:3年以上AI算法评测经验,深入理解大模型边界,具备搜推、多模态或复杂Agent深度评测实战经验者优先。
- 工程能力:精通主流评测框架,熟练掌握Python,能独立主导大型评测平台与自动化工具链的设计开发;具备丰富的Prompt Engineering调优经验。
- 数据洞察:逻辑思维强,能从复杂数据中定位关键问题,输出高价值诊断报告并推动策略落地。
- 综合素质:对AI技术极度敏感且富有热情,具备出色的跨团队统筹协调能力与构建科学评测体系的工匠精