对基准的基准测试:工具调用评估的有效性审计

arXiv cs.SE 2026-07-07T09:17:54.752487

论文信息

论文信息

摘要

工具调用基准测试越来越多地用于对语言模型智能体进行排序,然而其得分往往被视为基准真相,而并未对评估者本身进行验证。我们对四个主要的工具调用基准测试系列:BFCL v4、{\tau}2-Bench、LiveMCPBench 和 MCP-Atlas 进行了系统的有效性和可复现性审计。在 496 个经过专家审查的基准任务中,我们发现了 92 处评估者与人类的分歧,对应 18.5% 的不一致率。这些失败并非孤立的标注错误:确定性基准测试暴露出状态匹配脆弱、轨迹锁定、错误基准真相、基于子串的通信失败以及奖励基础不一致等问题;而 LLM(大语言模型)作为评判者的基准测试则暴露出标准漂移、幻觉式完成、仅答案评分以及显著的运行间方差。在 LiveMCPBench 中,对同一设置进行的 23 次重复评估产生了从 57.9% 到 76.8% 的得分,跨度达 18.9 个百分点,足以改变排行榜结论。这些结果表明,当前的工具调用得分可能反映的是评估者的人为假象,而非智能体能力。我们引入了一个统一的工具调用评估失败类型分类体系,发布了追踪级别的审计工件和纠正后的评估组件,并主张采用分解指标,分别衡量工具调用、任务完成和结果验证。我们的发现表明,工具使用智能体的进步需要这样的基准测试:其评估者本身是可复现、可审计,且与人类对任务成功的判断保持一致。我们进一步引入了 Tool-Veritas,一个结合了确定性状态验证与可选的定性评判的可配置基准测试,以及 Harness Lab,一个用于基准执行、追踪检查、重复运行比较和评估者调试的开源系统。

查看原文