岗位职责
- 参与构建多模态大模型评测体系,覆盖万物识别、智能体(Agent)、图形用户界面(GUI)、STEM、代码、视频等多个方向,建立完整、科学的评测框架与全面的评测集,真实反映模型性能,推动形成行业评测标准;
- 搭建高效、稳定的自动化评测流程与鲁棒的评测方法,确保评测结果准确可靠,并能够快速生成专业评测报告;
- 深入分析模型能力表现,提炼出具体、可执行的优化方向,推动模型持续高效迭代;
- 持续追踪业界最新评测动态与方法,不断拓展与完善评测矩阵。
职位要求
- 本科及以上学历,计算机、数学、人工智能等相关专业优先;
- 在语音、多模态、机器学习等至少一个领域有扎实的研究或项目经验;
- 有评测BMK相关论文经验或者参与过BMK建设者优先;
- 熟练掌握 C/C++、Python 等编程语言,具备较强的工程实现能力;
- 具备优秀的问题分析与解决能力,能主动探索并推动技术方案落地;
- 对模型评测工作有浓厚兴趣,具有良好的团队协作与沟通能力,工作积极主动。