Claude Fable 5 与新的 AI 安全寓言
前沿 AI 系统的权力政治又向前迈进了一步。
编辑于6月11日:Anthropic 修改了他们对 AI 研究查询的静默模型操纵方式,像其他安全领域一样使用了一个分类器。这解决了我对发布中“安全”被滥用的一个关键担忧,感谢 Anthropic 的快速修改,但它并未完全修复被打破的信任。我在这里分享了更多反思。
今天,Anthropic 面向消费者和企业用户发布了他们的 Claude Fable 5 模型。这是他们 Mythos 类模型的通用访问版本。与此同时,Anthropic 推出了一系列安全措施——有些明确告知用户,有些则在未告知用户的情况下修改了模型。AI 能力的下一个重大进步伴随着更严厉的安全措施,表明 Anthropic 意图保护或巩固其当前领先地位,这其实并不令人意外。
Anthropic 推出的这些不均衡实施的安全政策,正逐渐成为一个经典的警示寓言:狭隘且自我实现的安全与控制观念很少能奏效。