岗位职责
- 协同团队构建科学高效的AI大模型评测体系 · 协同推进大模型各主要方向(文本、多模态、Coding、智能体等)的评测框架设计,持续优化评测指标、数据集和评测方法; · 识别现有公开评测体系的局限性,探索并建设更真实有效的私有评测指标和数据集;
- 模型能力分析 · 与评测团队紧密协作,根据模型能力和实际需求设计、验证、持续迭代优化评测体系; · 结合评测结果对模型能力进行分析诊断,为管理团队和业务团队提供有价值信息;
- 关注业界前沿发展,持续迭代评测体系 · 持续跟踪全球大模型、Agent领域的技术发展和评测体系变化 · 整合业界和头部厂商先进评测体系经验,转化为内部评测实践,持续迭代评测体系
职位要求
- 计算机、人工智能、统计学、数学或相关专业,本科及以上学历;
- 5年以上工作经验,2年以上AI评测相关工作经验;
- 熟悉业界主流评测工具集和评测集,有独立设计执行评测经验,能独立完成评测数据分析;
- 优秀的跨团队沟通和项目推动能力,对AI前沿技术保持高度敏感,具备快速学习能力。