岗位职责
- 评测体系构建: 设计并开发全面、客观、可量化的AI模型评测方案,涵盖能力、性能、安全、伦理等多个维度。
- 基准测试与执行: ○ 熟练运用和改造现有的主流评测基准(如 MMLU, GSM8K, HumanEval, BIG-Bench, MT-Bench, HELM 等)。 ○ 针对具体业务场景,设计并构建定制化的评测数据集(包括指令编写、数据清洗、质量评估)。 ○ 执行自动化与人工评测,确保评测过程的高效与准确。
- 深度分析与洞察: ○ 对评测结果进行深度分析,定位模型的能力强项、缺陷与失败模式。 ○ 探究模型在不同任务、领域和提示词下的表现差异。 ○ 撰写详尽的评测报告,清晰地呈现结论,并提出模型改进或应用策略建议。
- 工具与平台建设: 参与或主导内部评测工具、平台和流程的建设,提升评测的自动化水平与规模化能力。
- 前沿追踪: 紧密跟踪业界最新的模型动态、评测方法学与研究进展,并快速应用到实际工作中。
职位要求
- 学历与经验: 计算机科学、人工智能相关专业本科及以上学历.
- 技术理解: 对机器学习、深度学习,特别是大语言模型的基本原理有一定的了解。
- 编程能力: 熟练掌握 Python,进行数据处理和分析。具备良好的脚本编写能力以自动化评测流程。
- 评测方法论: 了解主流的AI评测基准和方法,具备设计评测实验和控制变量的科学思维。
- 数据分析能力: 具备强大的数据分析能力,能够从复杂数据中提炼核心洞察,并熟练使用图表进行可视化呈现。
- 沟通协作: 出色的书面和口头沟通能力,能够清晰地撰写报告并与研发、产品等团队高效协作。 优先考虑:
- 具备构建评测数据集的经验。
- 对模型的安全性、偏见、鲁棒性等领域有深入理解和评测经验。
- 具备Prompt Engineering的丰富经验,能够设计复杂的提示词来激发和检验模型能力。