岗位职责
一、评测体系设计与环境构建 ● 面向大模型应用、大模型基座、Agent、多模态和复杂业务场景,设计评测基准、任务集合与能力分层体系,明确评测目标、边界、指标与验收标准; ● 在此基础上,构建可复现的任务环境、工具链路与自动化评测框架,支持离线评测、回归测试、批量实验和版本对比,覆盖代码、工具使用、多步任务、检索增强、多模态理解等场景。 二、自动化评测方法研发与结果分析 ● 研发 LLM-as-a-Judge、VLM-as-a-Judge、Agent-as-a-Judge、规则评测、模型打分与混合评审等方法,建立兼顾效率、稳定性与可信度的自动化评估体系; ● 基于评测结果开展数据分析、误差归因、能力拆解与边界分析,识别模型、系统、提示、数据与工具链路中的关键瓶颈。 三、效果闭环与数据飞轮建设 ● 将评测结果转化为可执行的优化建议,推动训练数据构建、后训练优化、RAG / Memory / Tool Use 策略、Agent 规划与系统架构的持续改进; ● 同时建设高质量评测集、难例集、对抗样本与反馈回流机制,持续完善「评测 → 分析 → 优化 → 再评测」的闭环,提高模型与应用的稳定性与泛化能力。
职位要求
专业能力:
- 代码工程化能力:计算机基础知识,深入理解数据结构、算法、网络和操作系统等相关知识,能至少在一种主流编程语言(如 Java / Python / JS 等)上有较深实践经验,掌握常见工程实践并具备优秀的Coding 能力,能够根据场景灵活选型并快速上手;
- 大模型能力理解与掌握:理解主流LLM的能力与局限,能够清晰拆解任务并通过LLM或确定性逻辑兜底实现;熟悉主流大模型的应用范式及主流Agent框架;
- 大模型评测与数据分析:理解大模型评测流程、熟悉评测集、指标体系、Rubric 设计及自动化评测流程,并能利用数据分析能力对结果归因,提出优化方案;
- 金融科技融合:结合金融背景,能够从金融专业视角产出金融垂类的评估体系和优化标准,在金融业务场景有用户敏感度,并能落地为评测方案,指导模型优化;
- 复杂系统的拆解与抽象能力:具备结构化思维,擅长将长流程、多步骤的复杂任务拆解为可量化、可复现的评测维度。 能力特质:
- 学习能力:在日新月异的技术浪潮中,希望有快速的学习能力,包括对前沿技术的理解、沉淀、与工作结合,在技术迭代浪潮中保持空杯心态,快速迭代学习;
- 审美追求与数据支撑:对金融业务与技术评测方案,有自己的审美需求和想象力,甚至在某些方向上追求极致,并善于利用数据分析支持自己的审美观点;
- 打破传统思维:具备批判性思维,能敏锐识别金融逻辑中的因果倒置、数值计算偏差等。擅长逆向思考,能从“模型会在哪里犯错”的角度设计评测集,而非仅验证标准答案;
- 同理心与协同能力:具备同理心,能站在用户视角体验产品。良好的协同沟通及表达能力,与合作团队清晰共识标准并落地推动。