岗位职责
- 设计与开发评测方案: 围绕大语言模型和多模态大模型的各项能力,设计科学、公正、全面的评测(Benchmark)方案和对应的数据集。
- 搭建评测平台: 参与或负责自动化评测系统的开发、部署和维护,提升模型迭代和评测效率。
- 执行与分析: 对主流的开源及闭源大模型进行系统性评测,并对自研模型进行深度分析,撰写评测报告,为模型的优化方向提供数据支持。
- 追踪前沿动态: 持续关注业界最新的大模型评测方法、基准和技术,并将其应用到实际工作中。
职位要求
- 教育背景: 计算机科学、人工智能、机器学习、数学或相关专业的本科及以上学历。
- 编程能力: 熟练掌握 Python、PyTorch。
- 技术理解: 对大语言模型(LLM)有基本的认识,了解其工作原理和主要应用场景。
- 逻辑分析: 具备优秀的数据分析能力和逻辑思维,能够从评测结果中发现问题并提出见解。
- 加分项(非必需): ꔷ 有大模型使用、微调或评测相关经验者优先。 ꔷ 有数据科学、NLP 项目或相关研究经验者优先。 ꔷ 熟悉常用的模型评测数据集者优先。有良好英文文献阅读能力者优先。