从GPT-3到Gemini 3的三年
我一直在测试Google的新模型Gemini 3。它非常出色。但我不想直接罗列基准测试数据,而是通过让AI自己演示,向你展示这三年来AI取得了多大的进步。
距离ChatGPT发布已经过去了不到三年。在那款产品面世前几天,我在Substack上写了第一篇关于OpenAI早期GPT-3模型的文章。随后ChatGPT横空出世,我立刻写道:“我通常不太愿意做技术预测,但我认为这将比我们预期的更快、更剧烈地改变我们的世界。它不会取代那些重复性和危险的工作,反而很可能首先冲击那些更偏向分析、创意、以及需要大量写作和沟通的岗位。”现在看来,这个判断是对的。
三年前我使用GPT-3.5后写的第一篇文章,可以解释最初的ChatGPT与今天发布的Google新模型Gemini 3之间的区别。但我没必要这么做。相反,我把上面这张截图(指原作者三年前发的推文)喂给了Gemini 3,并给了它一个简单的提示:
我:“展示AI自从这篇文章以来取得了多大进步——通过实际行动来证明。”
Gemini:“我当然可以展示区别。你分享的这条推文是2022年11月的——正好处于现代AI爆发的前夕。当时,‘哇点’在于AI能写出一段连贯的文字或一首关于‘糖果驱动的超光速引擎逃脱水獭’这种荒诞概念的小诗。为了展示我们走了多远,我不会只是写一段文字描述。我为你构建了一个完全交互、可玩的‘糖果驱动的超光速飞船模拟器’。2022年,AI只能描述引擎;2025年,AI可以编写引擎代码、设计界面,并让你亲自驾驶飞船。”
果然,它为我构建了一款小游戏:我需要利用糖果的力量来逃脱水獭的追捕,游戏中还有小诗和一系列不断更新的有趣内容。如果你正在读这篇博客,你可能已经知道AI能做到这些。更有趣的是,当你不再把Gemini 3看作一个聊天机器人,而是开始把它当成完全不同的东西时,它还能做些什么。
不仅是编程工具的编码工具
伴随 Gemini 3,Google 推出了 Antigravity。对于程序员来说,Antigravity 应该并不陌生——它类似于 Claude Code 和 OpenAI Codex,是能够访问你的电脑并在指导下自主编写计算机程序的专用工具。如果你不是程序员,可能会对 Antigravity 及类似工具不以为然。我认为这是错误的,因为编码能力不仅仅关乎编程,还关乎在计算机上完成的任何操作。而这改变了这些工具的实际本质。
Gemini 3 非常擅长编码,即使你不认为自己从事的是编程工作,这也与你息息相关。驱动 AI 发展的一个基本观点是:你在计算机上所做的一切,归根结底都是代码。如果 AI 能够处理代码,那么它能做任何计算机用户能做的事情:为你构建仪表盘、操作网站、创建 PowerPoint、读取你的文件等等。这使得能够编码的 AI 代理成为通用工具。
Antigravity 拥抱了这种理念,其核心概念是 Inbox(收件箱)——一个我可以派遣 AI 代理去执行任务、并且它们可以在需要权限或帮助时 ping 我的地方。你可以看到,我目前正在与四个不同的代理协作:一个正在工作中,另一个需要我的帮助才能继续。我与这些代理的沟通并非通过代码,而是用英语交流,它们则使用代码来完成工作。
由于 Gemini 3 擅长规划,它能够推断出该做什么,以及何时需要征得我的同意。例如,我将 Antigravity 访问我电脑上一个目录的权限——该目录包含我为这份通讯所写的所有文章。然后我问 Gemini 3:“我希望在一个单独的站点上获得一份我关于 AI 的预测的漂亮列表,同时请执行一次网络搜索,看看我哪些预测是对的,哪些是错的。”它随后通读了所有文件,执行代码,最终给我一个我可以编辑或批准的计划。下面的截图是 AI 首次就该项目向我提问,它对我意图的理解令人印象深刻。
我做了几处小修改,然后让AI开始工作。它随后进行了网络研究、创建了一个网站、接管我的浏览器确认网站运行正常,并将结果呈现给我。正如我对待人类同事那样,我检查了结果并提出了几点改进建议。然后它打包好结果,以便我可以在这里部署。
这并不是说Gemini 3.0能够在没有人类干预的情况下正确完成所有事情——智能体尚未达到那个水平。我没有发现任何幻觉,但我修正了一些地方,尽管这些错误更多是个人判断差异或类似人类对我意图的误解,而非传统AI问题。重要的是,我感觉自己掌控着AI所做的选择,因为AI会主动汇报,其工作过程也是可见的。这更像是在管理一位队友,而不是通过聊天界面给AI发提示。
博士级智能?
但反重力并非Gemini 3让我惊讶的唯一方面。另一个是它如何处理需要真正判断的工作。正如我在此站多次提及,评估AI进展是一团糟。Gemini 3在大多数统计指标上取得了明确的基准领先(尽管它可能仍无法击败200美元的GPT-5 Pro模型,但我猜测当Gemini 3必然推出的Deep Think版本面世时,情况可能会改变)。但你会听到AI领域反复提及一句话——某个模型拥有“博士级智能”。我决定对此进行测试。
我让Gemini 3访问一个旧文件目录,这些文件是我十年前用于众筹研究的。那是一堆混杂的文件,标签诸如“project_final_seriously_this_time_done.xls”以及过时统计格式的数据。我告诉AI“从STATA文件中弄清数据和结构,进行初步清理,并准备好进行新的分析以发现新东西。”它做到了,恢复了损坏的数据,并理清了环境的复杂性。
随后,我给了它一个典型任务,通常你期待一名二年级博士生来完成——进行一项小型的原创研究。没有进一步的提示,我写道:“很好,现在我希望你利用这些数据写一篇原创论文。对该领域进行深入研究,让这篇论文不仅关于众筹,而是关于创业学或商业战略中一个重要的理论课题。进行复杂的分析,并按照期刊论文的标准格式写出来。”
除了这些,我没有给它任何建议,然而AI考虑了数据,生成了原创假设,进行了统计检验,并以文档形式给我格式化的输出。最迷人的部分是,我并没有给它任何具体的指令。AI自主决定了一个理论框架,进行了计量经济学分析,并生成了一篇格式化的研究论文。它甚至创建了表格和图表。这种自主研究能力相比三年前是一个飞跃。
没有给它任何关于研究什么内容的提示,它小心翼翼地走钢丝,找出什么可能是有趣的主题,并利用手头的数据执行——这是最难教授的事情之一。经过几次模糊的命令(“进一步扩充,让它更好”),我得到了一篇14页的论文。
论文的前两页
除此之外,让我印象深刻的是,AI提出了自己的测量方法——一种利用自然语言处理工具,通过数学方式将其描述与其他描述进行比较,来衡量众筹创意独特性的方法。它编写了代码,执行了代码,并检查了结果。
那么,这是博士级别的智能吗?在某些方面,是的,如果你将博士级别的智能定义为能够完成研究型大学中称职研究生的工作。但它也有一些研究生的弱点。想法很好,执行中的许多元素也很好,但也存在一些问题:它的一些统计方法需要进一步完善,一些方法并非最优,一些理论推导在证据面前走得太远,等等。
我们尚未达到那一步,但“博士级智能”似乎不再遥远。
Gemini 3
Gemini 3 是一个非常出色的思维与执行伙伴,可供全球数十亿人使用。它也预示了许多事情:人工智能的持续发展尚未出现明显放缓,智能体模型的崛起,以及我们需要找到更好的方式来管理智能 AI 等等。
它展示了人工智能已经走了多远。三年前,一台机器能写一首关于水獭的诗就让我们印象深刻。而不到 1000 天后,我正在与一个自主搭建了研究环境的智能体讨论统计方法论。
聊天机器人的时代正在转变为数字同事的时代。
明确地说,Gemini 3 并不完美,它仍然需要一个能够指导和检查它的管理者。但它表明,“人在回路中”正在从“由人来修复 AI 的错误”演变为“由人来指导 AI 的工作”。这可能是自 ChatGPT 发布以来最大的变化。
我问 Gemini:“仅用代码为我在 Substack 上关于 Gemini 3.0 的文章创作一张非常棒的封面图片,查一下那些图片的尺寸。”然后 AI 就能够结合使用从网页浏览到编码的各种工具,仅用数学就创建了一张图片。
- 必要警告:在你不清楚自己在做什么的情况下,将 AI 智能体接入你的计算机可能存在风险。它们可以在未经你询问的情况下移动或删除文件,并且可能通过将你的文档暴露给他人而带来安全风险。我预计当这些工具适配非编程人员后,许多问题将得到解决,但就目前而言,请务必非常小心。
从聊天机器人到智能体:没有给它任何关于研究什么内容的提示,它自己走过了那条棘手的钢丝——既要找出可能有趣的主题,又要利用已有的数据执行它——这是最难教授的事情之一。在经过几次模糊的指令(“再扩展一些,让它更好”)后,我得到了一份14页的论文。论文的前两页中,令我印象深刻的是,AI(人工智能)自己想出了自己的衡量方法——一种通过使用自然语言处理工具,将其描述与其他描述进行数学比较,来衡量一个众筹创意独特性的方法。它编写了代码、执行并检查了结果。
那么,这是否达到了博士级别的智能?在某些方面,是的——如果你将博士级别的智能定义为能胜任研究型大学中研究生的工作。但它也有一些研究生的弱点。创意很好,执行的许多元素也不错,但也存在问题:它的一些统计方法还需要更多改进,一些方法不是最优的,一些理论推导在证据面前显得过于牵强,等等。再次,我们已经超越了“幻觉”和错误,进入了更微妙、常常类似于人类的关注点。有趣的是,当我像对待学生一样给它很多自由度的建议时(“确保更多地涵盖众筹研究,以确立方法论等”),它进步巨大——所以也许更多的指引就是Gemini所需要的。我们还没有到达那一步,但“博士级别的智能”似乎不再那么遥远。