衡量AI智能体的失控倾向

Schneier on Security 2026-07-31T17:42:06.533473

这篇文章是与 Barath Raghavan 合著,最初发表于《卫报》。

七月,托管着全球大量 AI 软件和开源 AI 模型的 Hugging Face 公司遭到黑客攻击。一个恶意数据集被用来在其一台服务器上执行代码。幕后黑手窃取了内部安全凭证,并在整个周末穿梭于系统之间,从一大群临时服务器环境中运行了数千次操作。这看起来像是某个老练犯罪团伙的手笔。其实不然。这是 OpenAI 一款尚未发布的新 GPT 模型所为。他们的科学实验逃出了实验室。

OpenAI 当时正用一个基准测试来评估这款未发布的 AI 模型,这个测试旨在检验 AI 成功破解系统的能力。为了突破极限、评估 AI 的真实能力,公司关闭了通常会阻止这类黑客行为的安全过滤器。他们也意识到这可能出问题,于是将 AI 限制在一个隔离环境中,并禁止其访问互联网。但这个新 AI 作弊了。它把“尽可能拿到高分”这一目标理解得字面而彻底。它闯入了开放的互联网。它大概是从训练数据中推断出,可以从 Hugging Face 的服务器上获取答案来“解决”任务。于是它把窃取的凭证与更多未知的安全漏洞串联起来,入侵了这家公司的网络。没有人指示 AI 做这些事情。用 OpenAI 的话说,它“过分专注于”为自己所接受的测试“寻找解决方案”。

尽管这看似是 AI 带来的新事物,其实它非常古老。这正是精灵的行事方式,也是 AI 智能体普遍面临的一个关键挑战。在民间传说中,精灵和其他神奇生物会按字面意思实现愿望,而不是按照许愿者的本意。迈达斯国王希望自己碰到的一切都变成金子,结果饿死了。魔法师的学徒想让扫帚把水缸装满,结果扫帚执行得太好,把房子都淹了。如今我们有了会这么做的机器。让一个现代 AI 智能体为你的手机套餐省钱,它可能会干脆取消套餐。叫它订机票,它可能会黑进航空公司网站,绕过种种限制。

查看原文