能安全失败的智能体:爆炸半径、紧急开关与危害边界
原文发布于 AI Tech Connect。
以下是你需要知道的内容:
- 故障发生的频率和危害程度相互独立。提升可靠性并不能限制危害,限制危害也不会提高准确率。两者都需要投入资源。
- 把每个操作按两个维度分类:可逆性和影响范围。两个维度对应的应对方法不同,所以单一风险评分会丢失你需要的决策信息。
- 爆炸半径(即故障可能影响的范围)由四个因素决定:身份、凭据、网络可达性和数据范围。这四个因素都是配置项,不是模型行为。
- 你需要三个紧急开关,而不是一个:暂停、撤销、隔离。大多数“停止按钮”只实现了暂停。
- 用延迟和错误率来判断智能体是否该熔断,不是好办法。一个自信地犯错的智能体,动作很快,而且不会抛错。
- 未经测试的控制措施等于没有。做一次故障演练,为每项控制措施计时,然后把数字记录下来。
- 为什么如此……阅读 AI Tech Connect 上的完整文章 →