招聘中 社招

数据技术及产品部-大模型评测研发工程师-杭州/北京

阿里集团

  • 北京、杭州
  • 技术类-开发

收录时间

岗位职责

  1. 评测平台架构与框架建设。设计并研发面向大模型与Agent的通用评测框架,支持多模态输入输出、长程任务执行、工具调用链路、执行反馈等评估维度;推动评测流水线标准化,打通数据集管理、环境隔离、任务调度、指标计算、结果归档与可视化各环节;对评测结果做数据清洗、统计分析与可视化,向算法团队输出分析报告与洞察。
  2. 评测集适配与建设。吃透业界主流评测集(如SWE-bench、Terminal-Bench、JobBench等),完成向平台的精准适配;面向代码生成、工具使用、推理、多轮对话、多模态生成等任务场景,设计可量化的评估方式与指标体系;建立Benchmark版本管理机制,让评测过程与结果可追踪、可对比、可复现,支撑模型迭代决策。
  3. 评测任务Agent化与Harness Engineering。以Harness Engineering思路把评测任务本身Agent化,提升评测集接入效率与执行的智能化水平;开发自动化诊断工具,定位评测适配异常、指标抖动、环境漂移等问题,降低人工排查成本;探索LLM-as-Judge、多智能体评判、人类偏好对齐等前沿评测范式,提升评估的客观性与覆盖度。

职位要求

  1. 计算机相关专业本科及以上学历,3年以上平台研发或AI工程经验。
  2. 工程功底扎实,精通Python或Java至少一门,熟练使用Linux开发环境与Shell脚本自动化。
  3. 理解大模型评测体系,熟悉开源评测集与主流评测框架,具备评测框架、数据Pipeline、分布式任务调度或MLOps平台的设计与落地经验。
  4. 熟悉Docker、Kubernetes、Conda等环境隔离与资源调度技术,能独立处理复杂依赖管理与可复现性问题。
  5. 对AI评测有热情,看重指标设计的科学性与工程实现的严谨性;能阅读英文文献、分析开源项目源码,准确抽象评测集核心逻辑并完成平台化落地。 加分项 ● 主导或深度参与过评测框架、评测流水线或MLOps平台的研发,有从0到1落地的经验。 ● 完成过SWE-bench、Terminal-Bench等主流评测集的平台化适配,熟悉Harbor等评测集规范标准。 ● 有Harness Engineering或将评测任务Agent化的实践,理解Agent评测原理与指标体系设计。 ● 在LLM-as-Judge、多智能体评判、人类偏好对齐等前沿评测范式上有探索或落地成果。 ● 在评测、大模型或AI工程相关的开源项目、论文或竞赛中有可展示的贡献。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

阿里集团数据技术及产品部-大模型评测研发工程师-杭州/北京

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看数据技术及产品部-大模型评测研发工程师-杭州/北京正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位数据技术及产品部-大模型评测研发工程师-杭州/北京阿里集团 · 北京、杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏数据技术及产品部-大模型评测研发工程师-杭州/北京正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

阿里集团数据技术及产品部-大模型评测研发工程师-杭州/北京社招 · 北京、杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入数据技术及产品部-大模型评测研发工程师-杭州/北京内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。