HarnessEval – MirroS 团队提出的代理化基准测试范式

HarnessEval 是由 MirroS 团队提出的代理化基准测试范式(Agentic Benchmarking),核心思想是将 LLM 生态中的 “Harness”(束具/框架)概念引入基准测试领域。它不仅仅是一个代码包装器或静态评分表,而是一个可执行的智能评估代理系统——能够像福尔摩斯一样,主动发现隐藏线索、连接分散证据、运用严谨推理得出最终判断。

HarnessEval-W 是该范式的首个落地实现,专门用于评估交互式世界模型(如双向视频扩散模型和自回归视频模型)。传统基准测试只能给出无法解释、无法验证的静态分数;HarnessEval 则通过代理化流水线,为每个评估案例生成可检查的推理链和证据树,让”模型在哪里失败、为什么失败”变得透明可追溯。

HarnessEval - MirroS 团队提出的代理化基准测试范式


HarnessEval 核心特点

表格

特点说明
代理化评估不是静态打分,而是智能代理动态规划评估策略、主动调用子代理和工具、生成可验证的推理序列
可解释性每个分数背后都有完整的证据树,记录测了什么、用了什么工具、逻辑链如何推导
上下文自适应每个测试案例都是独特的环境,HarnessEval 根据具体世界动态选择评估技能和策略
可扩展技能库9 个专业技能代理组成可扩展库,随模型能力演进而动态新增
自动化案例生成通过代理化流水线自动采样场景、生成初始图像、规划动作、验证合理性,实现规模化
递归自改进遇到分布外场景时,系统会主动评估自身能力缺口,通过外部扩展或自我探索获取新技能

HarnessEval 技术原理

1. Harness 概念

Harness 是 LLM 生态中的成熟概念,指为复杂工作流提供健壮脚手架的框架。HarnessEval 将其扩展到基准测试:人类评估生成内容也是一个工作流——定位物体、跟踪持久性、验证因果关系和几何约束——这个工作流可以被形式化为代理化流水线。

2. 三大评估轴

HarnessEval-W 围绕世界模型的核心能力建立三个评估维度:

表格

评估轴说明
Observation Quality(观察质量)渲染输出是否视觉可靠,包括感知一致性、结构合理性和真实感
Transition Correctness(转换正确性)状态转换是否忠实执行了请求的动作。分为:探索性转换(改变观察位置)、意向性转换(改变指定实体/关系/事件)、物理转换(物理控制的可信度)
World Persistence(世界持久性)预测状态序列是否在演化世界中保持连贯。包括:漂移抗性(长序列中布局/风格/外观一致)、重访一致性(离开后返回时地点/物体不变)、离屏演化(暂时不可见时内生过程是否持续)

3. 分层代理化评估工作流

技能库(Skill Libraries) 目前包含 9 个专业技能代理,每个评估世界模型的特定维度:
  • Render Quality Inspector(渲染质量检查器)
  • Physical Plausibility Inspector(物理合理性检查器)
  • Viewpoint Trajectory Verifier(视角轨迹验证器)
  • Intentional Change Verifier(意向性变化验证器)
  • Physical Response Verifier(物理响应验证器)
  • Physical Dynamics Verifier(物理动力学验证器)
  • Drift Degradation Analyzer(漂移退化分析器)
  • Return Consistency Verifier(返回一致性验证器)
  • Offscreen Evolution Verifier(离屏演化验证器)

技能选择(Skill Selection) HarnessEval-W 首先解读评估案例的上下文,然后选择能够合法评估该案例的技能,确保”问对问题”。

技能分解(Skill Decomposition) 高级技能被进一步分解为可测量的子问题,每个子问题委派给合适的子代理或工具。例如评估碰撞时,分解为跟踪边界框、验证时间交集、计算速度,父代理汇总所有子代理证据得出最终结果。

构建证据树(Constructing an Evidence Tree) 最终目标不仅是标量分数,而是一棵透明证据树:记录了测了什么、哪个工具提供了视觉依据、以及支撑最终分数的完整逻辑链。

4. 自动化案例构建

通过代理化流水线实现规模化:
  • 从预定义场景分类学中采样初始世界设置
  • 图像生成代理合成初始帧
  • 图像 grounded 规划代理生成目标动作
  • 验证代理严格评估配对的动作和图像是否上下文连贯
  • 未通过验证的候选自动路由回采样器,确保高质量

HarnessEval项目地址

  • 项目官网:https://mirros.ai/blog/harnesseval
  • GitHub仓库:https://github.com/mirros-lab/harnesseval-w

HarnessEval 核心功能

表格

功能描述
动态评估规划根据每个独特世界的物理动作、时间结构和观察状态,动态制定评估策略
多维度技能调用从 9 个专业技能代理中自动选择并组合,针对性评估观察质量、转换正确性和世界持久性
子代理递归推理高级评估问题可递归分解为子问题,子代理可进一步派生子代理,形成深度推理链
视觉证据收集代理主动在世界模型输出中搜寻时空证据,而非被动接收静态输入
可验证推理追溯生成完整的证据树,包含测试内容、工具来源和逻辑推导,支持人工复核
自动化测试案例生成通过场景分类学采样、图像生成、动作规划和验证代理的闭环流水线,自动构建多样化评估案例
失败模式定位可解释的输出帮助研究者精确定位模型的具体失败模式,指导后续改进方向

HarnessEval 应用场景

表格

场景说明
世界模型评估评估视频生成模型、世界模型在物理因果性、几何一致性和观察真实感方面的表现
视频扩散模型评测对双向视频扩散模型进行 Observation Quality、Transition Correctness 和 World Persistence 三轴评测
自回归视频模型评测同样适用于自回归视频模型的能力边界探测
机器人仿真评估在机器人场景中重点关注物理真实感而非视觉真实感
模型迭代指导通过透明的证据树和失败模式分析,为模型开发者提供可操作的改进方向
基准测试社区共建作为”活的基准”,开源后社区可持续贡献新技能和新评估案例
前沿模型能力探测随着世界模型生成更复杂的环境和更精细的物理,HarnessEval 通过扩展技能库持续跟进评估

未来方向

HarnessEval 提出三个演进方向:
  1. 测试时扩展(Test-Time Scaling):评估过程本身分配更多计算资源,执行更深搜索、多步验证和健壮工具使用,确保评估器始终与被测模型能力匹配
  2. 技能库规模化:随着世界模型模拟更复杂的物理和更多样化的场景,持续扩展综合技能库,动态检索和组合专业技能
  3. 递归自改进:遇到分布外场景时主动评估自身缺口,通过外部扩展或自我探索获取新能力,形成永不淘汰的自改进评估循环

最后想说

通过将人类评估工作流形式化为可执行的智能代理系统,动态规划评估策略、调用专业技能代理、收集视觉证据并生成可验证的推理链,让世界模型的评估从”黑盒分数”进化为”透明、可解释、可改进”的代理化诊断系统。

© 版权声明
为这篇文章评分
10.0/ 10
3 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...