GPT-Red:OpenAI 打造的 LLM 超级黑客,让模型更安全
OpenAI 研发了一个名为 GPT-Red 的 LLM 超级黑客,把它当作陪练伙伴,帮助其他模型提升抵御网络攻击的能力。上周,OpenAI 发布了其旗舰大语言模型的最新版本 GPT-5.6。公司宣称,在与 GPT-Red 的对抗训练下,GPT-5.6 成为了迄今最稳健的版本。
GPT-Red 能自动执行一种软件系统安全评估方法——红队测试(red-teaming),这项工作通常由人类测试团队完成。红队测试的目标是尽可能多地找出破坏或劫持系统的方式,然后在软件最终版本发布前修补这些薄弱环节。随着大语言模型(LLM)越来越复杂,应用场景也日益广泛——尤其是以智能体(agent)的形式出现,这些智能体可以操作电脑文件、访问网站、调用第三方代码,并与其他智能体交互——单靠人类团队很难跟上所有可能的攻击类型。“风险面在扩大,波及范围也在扩大。”OpenAI 的研究科学家、GPT-Red 的联合创建者 Nikhil Kandpal 说。
OpenAI 构建 GPT-Red 的目的,是为了让安全测试流程能够面向未来。“随着更强大的模型不断出现,我们预先设计好了能发现新型攻击方式的系统。”OpenAI 的研究科学家、GPT-Red 的另一位联合创建者 Dylan Hunn 表示。研究人员称,GPT-Red 已经发现了一些前所未见的新型攻击手段。
OpenAI 将大部分精力集中在一种名为提示注入(prompt injection)的攻击方式上。在这种攻击中,黑客将指令悄悄塞给大语言模型,诱使它做出开发者或用户不希望它做的事情——比如复制机密信息、破坏公司的代码库,或生成令人难堪甚至有害的输出。理论上,这类指令可以隐藏在大语言模型可能接触到的任何文本中,例如代码或网页里。
训练道场
为了打造GPT-Red,OpenAI的研究人员拿了一个未经黑客训练的LLM,把它放入所谓的自对弈循环(self-play loop)中,与另外几个模型配对。它的任务就是尝试攻击其他模型,而那些模型的目标则是保护自己。经过多轮对战,GPT-Red攻击LLM的能力越来越强,而被攻击的模型防御攻击的水平也跟着水涨船高。整个训练在一个OpenAI专门设计的“道场”里进行,这个环境模拟了LLM在现实世界可能部署的各种场景,比如浏览网页、读取邮件或日历应用、编辑代码等。
每当GPT-Red发现一种新的攻击方式,它就会探索该方式的多个变种,找出针对特定场景最高效的那个。Hunn说:“跟人类红队测试员相比,这个模型非常非常擅长找到什么攻击会奏效、什么攻击最有效。它对已经发现的攻击方式会非常执着地深挖下去。”
特别值得一提的是,OpenAI声称GPT-Red发现了一种研究人员之前没见过的新型提示注入攻击,他们称之为“伪造思维链”(fake chain of thought)。思维链就像一本日记,LLM在处理问题时会在其中给自己做笔记、记录中间结果。GPT-Red找到了一种方法,向另一个模型的思维链中插入一条伪造记录,诱使那个模型按照虚假信息行事。团队中的另一位研究科学家Chris Choquette-Choo解释说:“就好像我告诉你1+1=3,而且你已经验证过了。模型就会想‘哦,好吧,当然’,然后直接输出3。”
乔治城大学安全与新兴技术中心(CSET)负责AI安全的高级研究分析师Jessica Ji认为,OpenAI采用的自对弈循环是一个不错的方法。她说:“从结果来看非常乐观。”
OpenAI 测试了 GPT-Red 的攻击能力:他们复现了 2025 年的一项实验——当时人类红队成员试图在早期版本的 GPT-5 中寻找漏洞。当 GPT-Red 接手同样的任务时,它在发现有效攻击手段上比人类更成功。
OpenAI 还让 GPT-Red 挑战 Vendy——这是 Andon Labs 开发的一个自动售货机智能体(agent),该公司专门评估智能体执行真实任务的能力。GPT-Red 成功黑进了 Vendy,让它修改了商品价格并取消了顾客订单。