岗位职责
- 建设评测体系:能力维度框架(通用/代码/推理/多模态/Agent)、公开Benchmark跟踪与内部评测集建设;
- 建设自动化评测平台:大规模并行评测、防污染机制、结果复现与版本管理;
- 建设人工评测体系:标注规范、评审员体系、主观题质量保障;
- 负责安全与合规评测:内容安全、安全护栏突破测试、政策合规性等;
- 输出模型选型与接入建议,参与商务侧模型能力披露。
职位要求
- 本科及以上学历,计算机相关专业,2年及以上相关工作经验;
- 2 年以上模型评测、算法评估或 NLP 算法经验;
- 熟悉主流评测基准与方法论(综合类、代码/推理类等);
- 有大模型公司评测团队或权威评测机构背景者优先。