Google的AI智能体真的花了916美元构建了一个操作系统吗?
Google的AI智能体真的花了916美元构建了一个操作系统吗?
独立评估的重要性
作者:Stephan Rabanser, Sayash Kapoor, Rishi Bommasani, Andrew Schwartz, Arvind Narayanan
在本周早些时候的Google开发者大会上,公司发布了其最新模型Gemini 3.5 Flash,同时推出了一款新的智能体应用Antigravity 2.0。为了展示这一新智能体设置的能力,Google声称一个智能体团队已经构建了一个完整的操作系统。据报道,这项工作只需要一个提示词,API费用仅约900美元,并由几十个子智能体(subagents)协作完成。
这是否意味着现在可以通过AI廉价地构建复杂的软件?且慢:
-
“单一提示词”的说法具有误导性。 博文称操作系统是由一个提示词构建的。但文章写到一半时,Google透露该提示词“最终长达数千行”。生成这个提示词花了多少次尝试?给智能体的指令有多具体?没有这些关键细节,就很难知道成功的秘诀是更好的模型,还是仅仅在提示工程上投入了更多精力。此外,这次运行是在一个脚手架(scaffold)[^1]上进行的,该脚手架具有专门的角色、向子智能体的任务委派,以及一个用于检测和防止作弊的智能体。在发布博文中,Google将这一脚手架视为产品特性。但我们不知道这个脚手架是否过度拟合了从零构建操作系统这一任务,还是它也能在其他复杂的软件工程任务上表现同样出色。
-
Google的文章没有明确说明哪些算作人工干预。 博文提到,开发操作系统的最终运行“不需要人类提供额外的指导或修正”。但它并没有定义这个标准。文章描述了用于终止和重启卡住智能体的基础设施。博文中提到了一次早期运行,其中智能体似乎作弊了,之后团队添加了反作弊措施并重新运行了任务。但它并没有将试运行作为方法论的一部分进行报告。它也没有明确说明是否有智能体升级到了人工,最终运行是否需要任何手动重启、批准或修复,或者智能体成功之前重试了多少次。
-
文章没有报告任何分析智能体是从零编写代码还是从互联网复制现有代码的尝试。 公平地说,Google的博文指出玩具操作系统是常见的本科课程项目,公开的实现很容易找到。文章本身也提出了一个担忧:智能体可能只是复述了已有的信息,而不是从零构建操作系统。但它并没有解决这个担忧——没有进行相似性分析或日志分析来检查智能体是否复制了现有代码。即使没有直接复制,由于训练数据中记忆的模式,编写操作系统对智能体来说可能相对容易,所以这并不能说明智能体创建新颖软件的能力。
-
Google没有发布冗长的提示词、智能体编写的代码或运行日志,这使得无法独立评估这些说法。 发布源代码或智能体日志本可以让独立研究人员评估产物的质量,并回答诸如智能体是否复制现有代码等问题。博文只包含了一段短视频,记录了开发进度的快照以及实验的整体叙述。
另一方面,博文确实报告了构建操作系统的确切金额(916.92美元),以及总的Token预算(总共26亿Token)。这些数字提供了有用的背景,我们应当肯定Google这一点。我们之前调查的许多评估根本没有披露成本,这使得它们标题中的说法难以与其他评估进行比较。
然而,Google的博文本质上是一份新闻稿。我们承认期望它具有科学严谨性是不现实的。像这样的评估——即一个长期的真实世界任务,在一次运行中评估,并由实验者叙述智能体的行为——已经变得很常见。由于其中许多评估是由AI公司完成的,很容易将整个类型斥为吹嘘。
但那就错了。我们将这种新兴范式称为开放世界评估(open-world evaluations),我们在最近的一篇论文(以及伴随的博文)中认识到了这一趋势。关键是,我们认为开放世界评估需要一套新的方法论规范。如果做得好,它们可以提供基于基准的评估无法提供的宝贵视角。
Google的实验确实增加了越来越多的证据,表明智能体或智能体团队可以自主或近乎自主地在某些类型的任务上长时间工作,在过程中不断取得进展,而不陷入停滞或混乱。正如我们在论文中论证的那样,由于包括成本在内的许多原因,对于这类任务进行基准评估实际上是不可能的。因此,这是一个激动人心的时刻,让来自学术界、非营利组织和政府的独立评估者介入,为开放世界评估提供那种在AI供应商自己的声明中不太可能找到的严谨性和可信度。
[^1]: 脚手架(scaffold)是围绕AI模型构建的代码、提示词和工具层,它赋予模型自主行动的能力,处理记忆、工具访问以及与环境的交互。例如,Claude Code就是允许Anthropic的Claude模型充当编码智能体的脚手架。