岗位职责
- 评测体系设计与平台化落地:主导设计数据驱动的LLM/多模态/Agent评测体系,建设自动化评测分析能力,支持在平台上完成评测任务的适配、调度与规模化分析;
- 评测洞察与缺陷定位:基于对抗性分析、错误归因、能力边界挖掘等方法,系统定位模型在金融、医疗、小程序/APP等场景的核心短板,推动形成“评测-反馈-优化”的技术闭环;
- Benchmark与数据资产建设:负责评测数据采集、清洗、标注、版本管理与标准制定,构建高质量、多样化的Benchmark资产;
- 前沿评测范式探索:追踪全球前沿Benchmark与评估技术,研究RLHF/DPO等对齐数据驱动的新评估范式,探索仿真环境、Agent链路评测等新方法,保持技术领先。
职位要求
- 核心参与过业界知名的开源评测项目或 Benchmark 建设;
- 在 NeurIPS、ICML、ACL、EMNLP 等相关顶会发表过高质量论文;
- 优秀的数据敏感度与逻辑分析能力,能从复杂数据中定位关键问题并给出可落地方案;
- 深入理解大模型全链路:训练、推理、微调、评估与对齐。