Google的AI智能体真的花了916美元构建了一个操作系统吗?

AI Snake Oil 2026-06-28T03:23:52.967396

Google的AI智能体真的花了916美元构建了一个操作系统吗?

独立评估的重要性

作者:Stephan Rabanser, Sayash Kapoor, Rishi Bommasani, Andrew Schwartz, Arvind Narayanan

在本周早些时候的Google开发者大会上,公司发布了其最新模型Gemini 3.5 Flash,同时推出了一款新的智能体应用Antigravity 2.0。为了展示这一新智能体设置的能力,Google声称一个智能体团队已经构建了一个完整的操作系统。据报道,这项工作只需要一个提示词,API费用仅约900美元,并由几十个子智能体(subagents)协作完成。

这是否意味着现在可以通过AI廉价地构建复杂的软件?且慢:

另一方面,博文确实报告了构建操作系统的确切金额(916.92美元),以及总的Token预算(总共26亿Token)。这些数字提供了有用的背景,我们应当肯定Google这一点。我们之前调查的许多评估根本没有披露成本,这使得它们标题中的说法难以与其他评估进行比较。

然而,Google的博文本质上是一份新闻稿。我们承认期望它具有科学严谨性是不现实的。像这样的评估——即一个长期的真实世界任务,在一次运行中评估,并由实验者叙述智能体的行为——已经变得很常见。由于其中许多评估是由AI公司完成的,很容易将整个类型斥为吹嘘。

但那就错了。我们将这种新兴范式称为开放世界评估(open-world evaluations),我们在最近的一篇论文(以及伴随的博文)中认识到了这一趋势。关键是,我们认为开放世界评估需要一套新的方法论规范。如果做得好,它们可以提供基于基准的评估无法提供的宝贵视角。

Google的实验确实增加了越来越多的证据,表明智能体或智能体团队可以自主或近乎自主地在某些类型的任务上长时间工作,在过程中不断取得进展,而不陷入停滞或混乱。正如我们在论文中论证的那样,由于包括成本在内的许多原因,对于这类任务进行基准评估实际上是不可能的。因此,这是一个激动人心的时刻,让来自学术界、非营利组织和政府的独立评估者介入,为开放世界评估提供那种在AI供应商自己的声明中不太可能找到的严谨性和可信度。

[^1]: 脚手架(scaffold)是围绕AI模型构建的代码、提示词和工具层,它赋予模型自主行动的能力,处理记忆、工具访问以及与环境的交互。例如,Claude Code就是允许Anthropic的Claude模型充当编码智能体的脚手架。

查看原文