部门介绍
岗位归属于网商银行智能服务技术部,致力于以大模型与Agent技术重塑小微金融服务范式,助力AI银行实践。我们以"AI驱动、服销一体化"为核心,打造面向亿级信贷与理财客户的下一代全域智能服务体系。我们是一个怀揣AI技术梦想的团队,成员包括多位来自清华、卡内基梅隆、北大、复旦、上交、浙大等知名院校的硕、博同学,AI技术气氛佳、团队热情友好。 岗位描述:
- 评测体系与Benchmark建设:面向AI客户经理、AI风险经理、AI金融管家等核心智能体,抽象信贷、理财、票据等场景的真实任务,把业务专家的分析逻辑、服务规范与合规规则沉淀为可泛化、可规模化的Rubric/Checkpoint;从真实流量、典型任务、长尾与高风险Case构造有代表性的金融智能服务评测集,持续提升智能体专业力与事实准确性。
- 评测标准与多路Judge设计:联合业务专家、产品、算法团队,将专业判断转化为原子、可追溯的评测标准;围绕金融多维度,组合LLM/Agent Judge、金融事实核验、规则/Python Judge、Voice与Trace Judge等多路判分,并结合专家Gold持续校准,提升评测可信度;跟踪SWE Bench、Terminal Bench、GAIA等主流Agent评测Benchmark并完成本地化落地。
- Agentic评测与轨迹归因:设计并执行大模型Agent的全流程评测(功能/性能/效果/稳定性),重点覆盖长程任务、多轮共情、意图澄清与拒答、工具调用、记忆机制等Agentic能力;梳理Agent决策链路与工具调用轨迹,区分模型错误、金融口径差异、检索供给错误、工具故障与Judge误判,形成结构化归因报告并推动闭环。
- 评测工程与工具平台:基于工程能力搭建自动化评测框架与线上case采集录制能力,优化评测流程与工具性能;开发适配算法服务的测试工具(评测数据集构造、模型效果评估、性能压测等),通过同口径A/B、配对实验、置信区间与噪声基线判断版本变化是否真实,支撑Agent版本快速迭代验证。
- 前沿探索:跟踪大模型及Agent评测领域前沿技术(LLM-as-a-Judge、多LLM投票打分、few-shot评测、后训练阶段评测等),引入先进评测方法、工具与指标,持续提升评测体系的专业性与前瞻性。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 计算机、人工智能、数学、统计、数据等相关专业本科及以上学历,硕士/博士优先;3年以上互联网或传统行业开发测试与质量保障经验,具备1年以上AI/算法类产品的算法评测经验(大模型/推荐/搜索/NLP/Agent系统)。
- 扎实的算法与工程能力:熟练掌握Python/Java至少一种编程语言,能独立完成评测框架开发、数据处理与分析;熟悉主流算法框架与测试工具平台开发,精通至少一个测试领域(自动化/性能/安全)。
- 深刻理解LLM/Transformer及后训练范式:熟悉SFT、RLHF/DPO/Reward Modeling等后训练技术路线;理解Agent/RAG的典型失败模式与评测要点;熟悉意图识别、决策规划、工具调用、知识检索等Agent核心模块的评测与分析。
- 评测方法与方法论:熟悉常用评测指标(Accuracy/Recall/F1-score/BLEU/ROUGE等)与AB实验评估、统计推断、置信区间、偏差等概念;了解badcase分析与评测数据集构建方法;熟悉C-Eval、CMMLU、HumanEval、AGIEval或HELM、lm-evaluation-harness等主流评测集与框架者优先。
- 有金融行业AI服务/AI营销项目评测落地经验者优先;有LLM Benchmark、LLM-as-a-Judge、RAG/Agent Evaluation或自动化评测平台建设经验者优先;有语音多模态评测经验者优先。
- 对新质量技术敏锐度高,能快速理解AI产品特性,具备结构化