岗位职责
- 搭建评测体系:设计 AI 应用的评估体系,搭建评测流程和功能,包括评测标准的制定、评测Agent建设、评测的数据集建设、评测结果标注,保证评估结论及时准确产出;
- 业务场景分析:了解主流 AI 应用产品的业务流程和场景,对如何构建一个有效的评测集有深刻的理解和应用;
- 评测结果分析:分析和解读评测结果,提出提升模型能力和应用体验的产品设计建议;
- 研究评测方案:跟进和调研行业最新评测研究和报告,结合实际应用场景,更新内部评测技术方案;
- 行业产品调研:及时了解和分析 AI 业界各类产品和技术发展动态,辅助判断未来发展趋势。
职位要求
- 熟悉产品评测和 benchmark 标准,能基于实验、日志、线上表现快速定位模型问题,并熟练制定合理的验证方案与评测集;
- 较强的分析和沟通能力,擅长从数据中发现有价值的产品改善建议,并能推动落地;
- 对大模型领域感兴趣,愿意投身于大模型/AIGC方向等领域积极探索,与算法和业务良好协同,能迅速理解场景并提炼出评测指标;
- 具备快速学习能力、强执行力,有较强的自驱力和责任心。