岗位职责
- 负责即梦创作Agent的自动化评测体系建设,覆盖任务规划、工具调用、多轮交互、创作结果质量、长链路任务成功率等核心能力,构建面向图片、视频、多模态编辑与创作场景的Benchmark、评测集、案例集和回归测试体系;
- 设计LLM/VLM-as-Judge、Rubrics-based Evaluation、轨迹评测、工具调用评测、结果偏好评测等方法,提升评测的准确性、稳定性和可解释性;
- 建设Agent运行过程的自动化诊断能力,对失败链路进行归因分析,包括任务理解错误、规划错误、工具选择错误、上下文缺失、执行失败等;
- 与Harness、模型、数据、产品团队协作,打通离线评测、线上反馈、失败案例挖掘和模型/系统迭代闭环;
- 跟进Agent Evaluation、多模态评测、Reward Model、LLM Judge等前沿方向,推动评测方法在真实创作场景中落地。
职位要求
- 本科及以上学历,计算机、人工智能、机器学习、软件工程、数学、统计等相关专业;
- 熟悉大模型评测、Agent Evaluation、Benchmark构建、LLM/VLM-as-Judge、偏好评测中的一种或多种技术;
- 具备良好的数据分析、实验设计和问题归因能力,能够从复杂创作任务中抽象出可量化、可复现、可追踪的评测指标;
- 熟悉Python,具备较强的工程实现能力,能够建设稳定、自动化、可扩展的评测流水线和分析工具;
- 了解LLM/VLM、Tool Use、Function Call、多轮对话、AIGC图片/视频生成或编辑任务者优先,具备良好的系统思维和跨团队协作能力,能够推动评测结果转化为模型、数据和产品迭代方向;
- 对Agentic产品、多模态创作产品和自动化评测体系建设有浓厚兴趣。