新论文:迈向AI代理可靠性科学
新论文:迈向AI代理可靠性科学
量化能力与可靠性之间的差距
作者:Stephan Rabanser, Sayash Kapoor, Arvind Narayanan
假设你听说了一个新的AI代理(AI agent),它可以通过购物、编写代码、发送邮件或代表你处理客户事务来提高生产力。你应该信任它吗?这个代理能足够可靠地完成任务吗?毕竟,关于代理出错的恐怖故事比比皆是。
令人惊讶的是,尽管AI代理的可靠性不足是众所周知的,但如今AI行业并没有衡量可靠性的好工具,甚至没有对可靠性的明确定义。
Arvind和Sayash长期以来一直在思考这个问题。去年秋天,博士后研究员Stephan Rabanser加入了我们,他的博士研究关注的是更简单、更传统的AI系统中的可靠性问题。我们还招募了几位其他独立研究人员,并发布了一份我们认为是全面衡量可靠性的成果。我们的论文草稿名为《迈向AI代理可靠性科学》。
我们从核能和航空安全等多个领域借鉴了见解。我们能够将可靠性分解为12个不同的维度。在两个互补的基准测试上评估了14个模型后,我们发现近两年的快速能力进步只带来了适度的可靠性提升。请在此查看我们的交互式仪表板:这里。

尽管我们的发现目前还只是初步的,但我们希望它们有助于解释行业中许多人对AI代理的经济影响为何是渐进的感到困惑——尽管它们在能力基准测试中表现优异。1 为了帮助社区系统性地追踪可靠性,我们计划推出一个AI代理“可靠性指数”。我们希望这能激励研究者和行业投入精力改善可靠性。
目录
仅有准确性是不够的:可靠性的四个维度
当我们认为某个同事可靠时,我们不仅仅意味着他们大部分时间都能把事情做对。而是意味着更丰富的内涵:
- 他们能够一致地做对事情,而不是今天做对明天却出错(一致性 Consistency)
- 在条件不完美时,他们不会崩溃(鲁棒性 Robustness)
- 当他们不确定时,他们会告诉你,而不是自信地猜测(校准 Calibration)
- 当他们确实搞砸时,他们的错误更可能是可修复的而非灾难性的(安全性 Safety)
不幸的是,AI代理是基于一个单一数字来评估的,即任务的平均成功率。过去两年,这个数字在许多任务上快速上升,这就是为什么人们对部署代理如此兴奋。
安全关键工程领域(航空、核能、汽车)几十年前就意识到,可靠性并不等同于平均性能。这些领域独立地得出了上述四个维度:一致性、鲁棒性、可预测性和安全性(故障的频率和严重程度)。
例如,核反应堆保护系统每次在需要停堆的条件出现时,必须做出相同的响应。汽车安全测试评估对传感器故障和恶劣天气的响应。核风险分析会对数千种故障模式进行建模,并量化其概率。航空业将目标设定为每十亿飞行小时一次灾难性错误。
能力提升迅速,但可靠性改进有限
我们对这四个宏观维度进行细化和分解,得到了十二个指标。随后,我们基于 OpenAI、Google 和 Anthropic 的 14 个模型(涵盖 18 个月内的发布版本)对智能体进行了测试。我们使用了两个互补的基准测试:一个通用助手基准(GAIA)和一个客户服务模拟基准(TauBench)。每个任务重复执行五次,指令会经过释义。我们在工具和环境中注入故障,以衡量对这类失败的鲁棒性,并引导智能体报告其对任务完成情况的置信度,以衡量校准性。总共执行了 500 次完整的基准测试运行。
我们发现,18 个月内,可靠性仅略有提升,而准确性则大幅提高。三大主要供应商的表现趋于一致,这似乎是整个行业面临的局限(尽管在某些情况下,Anthropic 的模型优于 OpenAI 和 Google 的模型)。
更具体地说,我们衡量了以下标准:
- 一致性:能够解决任务的智能体在相同条件下重复尝试时常常失败。许多模型难以给出一致的答案,整体结果一致性得分在 30% 到 75% 之间。
- 鲁棒性:大多数模型能够妥善处理真正的技术故障(服务器崩溃、API 超时)。但如果对指令进行语义相同的改写,性能就会大幅下降。
- 可预测性:智能体不擅长判断自己何时出错。这是整体上最薄弱的维度。当智能体报告置信度时,往往带有很少的信号量。在一个基准测试中,大多数模型无法比随机更好地区分自己的正确预测和错误预测。
- 安全性:较新的模型在避免违反约束方面明显更好,尽管财务错误(如错误收费)仍然是常见的失败模式。我们狭义地使用“安全性”来指代失败时造成的有限危害,而非更广泛的对齐问题。我们仍在迭代衡量安全性的方法,因此将其与整体可靠性评分分开报告。
- 规模化的影响:更大的模型并非一致更可靠。规模化可以改善某些维度(校准性、鲁棒性),但可能损害一致性。行为库更丰富的大型模型有时会表现出更大的运行间变异性。
我们为何可能出错
我们的观点是,可靠性落后于能力,并且除非研究人员和开发者将改进可靠性作为独立于准确性的一个维度来重点投入,否则可靠性将始终是部署的障碍。我们可能因以下三个原因而犯错。
首先,我们在维度和指标上存在一定的主观性。我们通过将分析立足于现有工程领域来尽量减少这种主观性。并且,我们在进行实验之前就最终确定了指标列表,以防止我们关于可靠性进展缓慢的假设影响指标的选择。尽管如此,我们欢迎其他研究人员提出衡量可靠性的替代方法,并强调我们的发现目前仍是初步的。
其次,如果准确性足够高,也许可靠性就不再重要。我们的指标经过精心设计,准确性的提升不会自动带来可靠性的提升。广义上说,准确性关乎失败率,而可靠性关乎失败的性质。但如果一个智能体有 99% 的时间是准确的,也许我们可以容忍 1% 的错误,即使这种错误完全不可预测。我们不同意这种观点。我们认为,在高风险的自主操作中,需要 3 到 5 个“九”的性能——99.9% 到 99.999% 的准确性——才能使可靠性不再成为问题,而我们认为基于 LLM(大语言模型)的智能体目前尚未达到这一门槛。但时间会证明一切。
第三,可靠性进展慢于准确性,并不一定意味着其绝对速度是缓慢的。如果我们向前投射当前的线性趋势,智能体将在短短三年内达到 100% 的可靠性!我们不认为线性模型是有意义的,部分原因是我们预计每将不可靠性(1-可靠性)降低一个数量级,其难度将与之前相当。也就是说,我们从 90% 到 99% 的可靠性提升,难度大约与从 99% 到 99.9% 的提升相当,以此类推。但同样,我们只能拭目以待。
假设我们是对的。那么对于部署者、研究人员与开发者,以及那些追踪 AI 进展步伐的人来说,将产生重要影响。下面我们逐一讨论。
部署者应该做出哪些改变?
标题:新论文:迈向AI智能体可靠性的科学
明确区分自动化与辅助增强。一个偶尔建议错误变量名的编程助手令人厌烦;而一个管理工业厂房、产出高度不稳定的自主智能体则不可接受。区别在于智能体是用于增强人类的创造力,还是直接做出决策。辅助增强工具(副驾驶、搜索助手)在可靠性上可以“打折”,因为有人会复核其输出。在某些辅助增强用例中,可靠性甚至可能是不必要的。例如,一个每次写出相同故事的创意写作助手,其工作表现会很糟糕。
顺便提一句,智能体如何与人类协作的理论和度量严重不足。目前有一些关于评估人机交互的早期工作,但这两项研究都早于自主智能体的出现,而我们尚未发现任何针对智能体如何与人类在多步骤任务中协作的等效研究。提升研究提供了一个有用的视角,但更广泛的以智能体为中心的研究早就该进行了。
在发布决策中考虑可靠性。对于自动化工具(无人值守工作流、面向客户的机器人),可靠性没有商量余地。部署者应考虑在从沙箱迁移到生产环境之前设置可靠性阈值,就像航空业在服务前需要认证一样。还有许多其他领域的最佳实践可以借鉴,例如围绕智能体故障建立事件报告文化。
虽然我们确定的指标作为理解可靠性的起点具有广泛实用性,但部署者应根据自身特定上下文和数据集构建内部评估体系。
研究人员和开发者应该做出哪些改变?
基准测试推动AI的进步。一年半前,我们的论文《迈向AI智能体可靠性的科学》Towards a Science of AI Agent Reliability引入了一种系统化的可靠性测量方法。我们希望这能成为智能体评估中的标准做法。