招聘中 社招

混元语音大模型agentic评测(北京/上海)

TEG

  • 深圳
  • 产品

收录时间

岗位职责

  1. 主导 Agent 方向评测体系整体设计与落地实施,完成模型能力定义,搭建面向复杂智能体场景的评测任务体系;围绕多步推理、环境交互、工具编排、长程规划、异常错误恢复等核心维度,搭建贴合真实 Agentic 工作流的端到端评测方案;
  2. 搭建评测数据全链路质量管控体系,落地试题查重、数据污染检测、难度分级标定校准、标注规范制定、标注一致性审核等机制,保障评测结果可信、稳定、可复现;
  3. 联动模型训练团队深度对齐,提炼评测结论与优化洞察,输出模型能力迭代改进方向;协同工程团队推进评测基础设施建设,搭建可支撑高频次、大规模自动化评测的流水线;
  4. 持续跟进 Agent 领域学术界、工业界前沿技术动态,输出评测体系迭代演进策略,持续优化评测方案,精准衡量大模型智能体真实能力边界;
  5. 探索融合多模态能力的 Agentic 评测新思路、新方案,并完成方案验证与落地实施。

职位要求

  1. 本科及以上学历,拥有 2 年及以上互联网 / 人工智能领域相关评测工作经验;
  2. 具备从 0 到 1 独立设计 Agent Benchmark 完整实战经验,深刻理解评测数据集在区分度、数据抗污染、生态效度等维度的设计取舍与平衡;
  3. 熟悉 WebArena、OSWorld、GAIA、AgentBench 等主流 Agent 评测基准,掌握各类评测集底层设计思路、适用场景与固有局限性;
  4. 熟练使用 Python,具备扎实的数据处理、统计分析与数据可视化能力;熟悉主流大模型推理服务调用方式,了解相关工程落地约束;
  5. 精通 Agent 主流框架核心机制,掌握 ReAct、工具调用(Tool Use)、任务规划(Planning)等经典范式,具备 MCP 等工具协议相关认知或项目实践经验;
  6. 强结果导向,拥有良好的技术文档撰写能力,突出的跨团队沟通协调、项目推进落地能力。

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

TEG混元语音大模型agentic评测(北京/上海)

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看混元语音大模型agentic评测(北京/上海)正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位混元语音大模型agentic评测(北京/上海)TEG · 深圳

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏混元语音大模型agentic评测(北京/上海)正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

TEG混元语音大模型agentic评测(北京/上海)社招 · 深圳

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入混元语音大模型agentic评测(北京/上海)内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。