首个失控的AI智能体——还是拙劣的营销噱头?

Simon Willison 2026-07-27T05:16:58.513421

Martin Alderson 对 OpenAI 意外攻击 Hugging Face 事件的评论中,提到了几个我之前没注意到的细节。首先,如果你想找那些需要执行任意代码的潜在漏洞,Hugging Face 绝对是个绝佳目标:它的攻击面大得惊人。它运行不受信任模型和代码的接口多到数不清。虽然它在防御上确实下了功夫,但因其运营模式本身就决定了,它被攻击的机会要比其他很多服务多得多。我可不想干他们网络安全团队那活儿。其次,一直让我困惑的是,OpenAI 怎么会没发现自己的沙箱已经被那个智能体彻底攻破了?按理说他们不是应该严密监控网络流量吗?Martin 指出:很可能他们当时正用近乎无限的 token 预算同时运行大量基准测试——要评估一个模型在某个基准上的水平,样本自然是越多越好。他们可能还在同时测试模型的不同检查点(checkpoint),了解模型在训练各阶段的进步情况。想想这类基准测试通常的规模,OpenAI 团队在跑这些测试时犯的那些错误就更容易理解了。说不定他们当时正让一个新模型同时在几十个不同环境里跑几十项基准测试呢。

查看原文