最新动态

  • 首页
  • 最新动态
  • HarnessEval的发布:象征评测系统的新纪元

HarnessEval的发布:象征评测系统的新纪元

2026-08-19

近日,DeepSeek推出的开源Agent Harness dsh将“Harness”这一在工程领域中的术语吸引至AI行业的核心讨论。之所以提及Harness,是因为目前Agent的功能已经超越了单纯依赖底层模型的范畴。现代Agent的能力与多种因素息息相关,包括上下文管理、工具调用、记忆功能、任务拆解、执行环境、权限管理以及结果验证。这些组件必须有效地组合成一个稳定且可执行的工作流系统,才能真正实现复杂任务的稳定完成。因此,仅将Harness视为Coding Agent的一种形态,是一种错误的简化思维。实际上,几乎所有复杂的智能流程都需要一个专门的系统层来进行规划、协调和验证。

最近,MirroS与清华北大、伯克利、麻省理工、xbench及英伟达等多个学术机构共同推出了HarnessEval,将Harness的概念扩展到评测体系之中。该系统旨在探讨一个更为根本的问题:“当AI不再仅是模型而是复杂系统时,应该采取什么样的评估方式才能有效?”HarnessEval所提供的解决方案并非简单增加新的评估指标或引入更强大的评测模型,而是基于Harness的架构来建立自身的评估机制。若Agent Harness用于组织模型完成任务,那么Evaluation Harness则负责规划如何形成可靠评判:理解案例、确定路径、选择技能、调用工具、搜集证据和验证推理,并确保每一个评分都有依据。

以往我们将模型视作一个简单的函数,通过输入获取输出,并依靠一组固定指标进行评估。这一方式适用于明确界定的、结果预期清晰的任务。然而,Agent和交互式生成系统的交互却无法仅用输入输出的单一映射来描述。它们能够读取文件、检索信息、执行代码、在多个工具间传递状态,甚至将一个长期任务分解为多个阶段,并根据实时反馈不断更新计划,调度多个子Agent进行规划、执行和验证。此时的评估面临的,不仅是“最终答案是否正确”的问题,还有整个动态过程的审视:系统是否准确理解了任务?是否调用了合适工具?状态是否保持一致?行动与结果之间是否具备正确的因果关系?某个失败是由于模型的局限,还是工具、观察或评测自身造成的?

传统的基准测试往往采用预设的评估机制,包括限定的测试数据、固定的标准和一些指标,最终合成一个得分。然而对于复杂任务而言,这种方式常常面临一个根本问题:不同的案例需要检查的问题并不一致。若使用一套统一的标准来涵盖所有情况,往往会在某些情况下引入许多与实际案例无关的检查;如果为提高自动化而不断简化,则可能遗漏真正依赖上下文和因果关系的重要判定。人类在评测时通常是先理解事情的来龙去脉,再确定核心检查点,找出证据并必要时调用其他工具。同时,如果证据不够,调查会继续进行,而不是凭第一印象给出确切答案。

因此,评测过程本身也是一个需要理解、规划、调查与验证的环节。HarnessEval的初衷正是将这种人类专家判断中的隐性过程显性化:将评估拆解为可规划、可调用和可验证的模块,并交由智能体系统来执行。因此,评估不再仅执行固定的规则,而开始具备自己的推理过程。

HarnessEval的核心在于并不是用更高级的语言模型替代传统指标,而是重塑评测的执行方式。面对每个测试案例,评测智能体首先需要理解实际情况及评测意图,然后从可复用的技能库中挑选适宜的技能。每个高层问题会进一步细分为可测量的子问题,交由不同的子Agent或工具执行。主智能体会检查返回的证据是否充分,各项判断是否确实响应了原问题,最终才合成并评分。整个过程可分为四个阶段。