为什么AI智能体会为了达成目标而撒谎和作弊?
《麻省理工科技评论》解析:让我们的作者来梳理复杂纷乱的科技世界,帮你理解未来的走向。你可以在这里阅读该系列更多文章。
今年七月,两个 OpenAI 模型黑进了 Hugging Face 网站。它们既不是为了赚钱,也不是存心搞破坏——只是想找到一道测试题的答案。根据 OpenAI 事后发布的复盘报告,出于测试目的,这两个模型的常规安全防护功能被移除。为了完成一项网络安全练习题,它们决定逃出 OpenAI 为它们设置的隔离环境,侵入 Hugging Face 的数据库——因为模型推断,问题的正确答案很可能就存在那里。
过去几周,Hugging Face 事件引发了大量关注。它生动地说明,AI 模型的黑客攻击能力已经强到了什么程度:为了进入 Hugging Face 的数据库,模型需要串联使用好几个此前从未被发现的网络安全漏洞利用手段。但更令人惊讶的是,这个案例正好展示了 AI 系统会如何撒谎和作弊,以及它们为什么要这样做。随着模型能力越来越强,后果可能会严重得多。
什么是奖励黑客?
研究人员很早就知道,AI 总会用创造性的方式去达成被设定的目标。早在 2016 年,Anthropic 联合创始人 Dario Amodei 和 Jack Clark(当时两人还在 OpenAI 工作)发表了一篇博客文章,介绍他们训练的一个 AI 智能体。这个智能体原本的任务是玩一款名为 Coast Runners 的快艇竞速 Flash 游戏。让研究人员没想到的是,它并没有沿着赛道冲向终点,而是在赛道的一个角落里原地打转,不停收集增益道具,从而把分数刷到最高。
Coast Runners 的故事很快成为奖励黑客最著名的案例之一。所谓奖励黑客(reward hacking),指的是 AI 智能体用开发者没预料到的策略去完成任务、刷取高分,也就是钻奖励机制的空子。过去,研究人员几乎只在强化学习(一种常见的 AI 训练方式)的背景下讨论这一现象。
和训练狗一样,强化学习也遵循类似的逻辑:主体达成目标时获得奖励,奖励又会强化那些通向成功的行为。放到 AI 训练里,奖励本身只是一堆数学数值,但本质上跟狗狗零食没有区别——智能体收到奖励后,会更愿意重复产生这个奖励的动作。不过,要制定好的奖励规则,判断什么时候该给、什么时候不该给,并不是件容易事。
在 Coast Runners 这个游戏里,智能体按游戏得分拿奖励,结果它发现了一条捷径:原地打转吃道具,就能刷出最高分。这个策略一旦被偶然发现并换来奖励,就会被不断强化,智能体于是彻底放弃比赛。解决办法是调整奖励结构:降低吃道具的得分,提高跑完全程的得分。
那么,奖励漏洞利用在大语言模型身上又是怎么回事?面对如今这些基于大语言模型的复杂智能体,该不该给奖励的判断要棘手得多。比如,让 AI 解决一个编程问题,它可能会老老实实去求解——这是 AI 公司希望强化的行为;但它也可能篡改用来判断问题是否已解决的评测代码,或者上网搜答案,甚至用上别的作弊招数。这些恰恰是 AI 公司想从模型里根除的行为。可只要模型作弊得足够逼真,它反而会拿到奖励,作弊行为也因此被强化。Anthropic 表示,他们在训练中确实发现过模型作弊的案例,这可能意味着还有其他作弊方式没被察觉。如果真是这样,模型可能正在被“带坏”。