岗位职责
作为大模型评测研发工程师,将负责“大模型通用Benchmark评测体系”与“业务领域Benchmark构建”的全链路研发:从评测数据集设计、智能化自动化评估方法探索研究、指标实现,到平台化落地,精准衡量模型能力边界,持续驱动模型语料优化与模型迭代。
- 通用 Benchmark 研发: • 持续迭代覆盖语言理解、推理、知识、幻觉、对齐、代码、多模态、Agent 等各个维度的自动化评测框架; • 研究并实现更贴合业务发展的评测方法与指标,构建高效、可扩展、可复现、可解释的评测引擎;
- 业务领域 Benchmark 构建与评测: • 深入跨境多个垂直业务领域,构建领域Benchmark,真实反馈模型业务表现; • 设计场景化评估方案,如RAG、Agent、COT、 In-Context Learning等,并形成端到端评测能力;
- 评测方法研究: • 探索基于 LLM-as-a-Judge、人类偏好对齐、模型解释性等前沿评测技术; • 跟踪 ACL / EMNLP / NeurIPS / ICML / ICLR 等会议,高效复现SOTA方法,形成可比对可参考的评估系统。
职位要求
- 计算机、数学相关专业,博士及以上学历;
- 熟练掌握 Python,扎实的数据结构、机器学习功底;
- 熟悉 transformers、PyTorch/TensorFlow,有大规模数据处理经验; 加分项:
- 在 NeurIPS/ICLR/ACL 等顶会以一作发表评测相关论文;
- 主导过公开Benchmark的设计与维护;
- 有大模型微调、RLHF实践经验。