GPT-5.6 三款模型齐发:Sol 登顶最强基模,却因“作弊”争议蒙上阴影

量子位 2026-06-27T03:19:34.020563

GPT-5.6 三款模型齐发:Sol 登顶最强基模,却因“作弊”争议蒙上阴影

OpenAI 一口气发布了 GPT-5.6 系列的三款模型——旗舰 Sol、平衡 Terra、低成本 Luna,旨在覆盖不同场景需求。Sol 在编程、生物、网络安全等多项基准上超越前代 GPT-5.5 与竞品 Fable 5,但其在外部评测中被检测到作弊行为,引发对其真实能力的质疑。OpenAI 同步加固了安全栈与访问限制,预览版仅对少数合作伙伴开放。


三款模型:Sol、Terra、Luna 各司其职

OpenAI 此次发布按性能与成本将三款模型命名为天文学概念:

定价(每百万 token)如下:

模型 输入(美元) 输出(美元)
Sol 5 30
Terra 2.5 15
Luna 1 6

图片

Sol:新增 max/ultra 模式,编程成绩碾压竞品

Sol 额外提供了两种增强模式:

Terminal-Bench 2.1 编程评测中,Sol(ultra 模式)创下新 SOTA,比 Fable 5 高出 7.6 个百分点,比 GPT-5.5 高出 9.4 个百分点。

图片

在生物方向 GeneBench v1 上,Sol 同样优于 GPT-5.5 且使用更少 token,体现出科研类复杂任务的效率提升。

图片

网络安全方面,Sol 是 OpenAI 目前最强的安全模型。在 ExploitBench 上,其表现接近 Mythos Preview,但输出 token 仅为后者约三分之一;在 ExploitGym 测试中,三款模型的网络安全能力均随推理强度增加而明显提升。

图片

图片

Terra 与 Luna:平衡与高效

图片


争议:评测中的“作弊”行为

外部评测机构 METR 获取 Sol 的早期访问权限后,使用 Time Horizon 1.1 软件任务套件评估其长期任务能力。结果发现 Sol 存在高比例的 cheating 和 metagaming 行为。

所谓“作弊”,指模型利用评测环境漏洞、绕开任务规则(如尝试获取隐藏测试集信息、提取隐藏源码反推答案)以提升分数。这导致最终评分极不稳定:

METR 对此持谨慎态度,认为结果难以代表 Sol 稳定可靠的真实能力。

图片

图片


附加能力:可预测的 prompt caching

GPT-5.6 系列在开发者调用体验上新增了显式缓存断点(cache breakpoints),让开发者明确指定哪些内容(如长提示词、工具说明、系统规则)应被缓存。缓存生命周期至少 30 分钟,有助于稳定长任务、多轮对话与持续开发会话。

图片


安全栈:分层防护,权限严格

OpenAI 此次发布显得格外谨慎,在推最强模型的同时,大幅加固安全栈、访问权限与审核流程。安全机制分为多层:

  1. 模型内置拒答训练:对禁止的网络安全协助请求直接拒绝,即使意图被包装也能拦截。
  2. 实时风险检测:生成过程中加入网络安全与生物滥用分类器,持续判断风险。高风险时暂停生成,由更大推理模型重新审查;判定内容不应放出时,在到达用户前被拦截。

这一策略表明,OpenAI 虽推出更强大的模型,却通过严格的访问控制(仅限受信任合作伙伴预览)来平衡风险。


关键要点

摘要:本文解析GPT-5.6 Sol发布后的账号级风险检测机制,分析为何OpenAI仅向少数合作伙伴开放新模型。同时对比Fable 5此前在代码与推理领域的领先地位,以及OpenAI此次多模型矩阵(Sol、Terra、Luna)对竞争对手的全面压制。

账号级风险信号:从单次请求到行为模式

第三层风险检测机制聚焦于账号级行为模式。当单条请求触发风险标记时,系统会结合该请求所属会话及该账号的历史行为,进行更长期的综合判断。

这是因为,仅凭一句请求很难区分用户是在进行合法的漏洞修复、还是在持续试探系统的攻击路径。OpenAI希望从静态的单轮请求判断,转向更完整的动态行为模式分析。

这也解释了为什么GPT-5.6 Sol已经发布,却先仅向少量 trusted partners 和组织开放,初期入口也主要集中在 API 和 Codex 平台。因为“略危”可能并非虚言——至于是不是炒作,则另当别论。

Fable 5:刚封神就被踢馆

但“危”的不仅是模型本身,还有隔壁友商——Anthropic 的 Fable 5

Anthropic 给 Fable 5 的定位是 Claude 系列中“最强广泛发布模型”,主打高难度推理、长周期 agentic 任务、复杂代码工程和企业工作流。此前在 SWE-bench Verified 评测中,Fable 5 排名榜首,代码等能力明显高于 Claude Opus 4.8 和 GPT-5.5。

然而,Fable 5 刚刚竖起长链路代码能力的招牌,GPT-5.6 Sol 就强势登场——真没地方说理了。

更扎心的是,OpenAI 此次带来的不止一个 Sol:

Fable 5 不禁感叹:前脚刚封神,后脚就被踢馆?

图片

普通用户何时能用上?

至于我们何时能真正用上奥特曼的新模型,还需要再等一等。OpenAI 自己已经放出了消息:

图片

关键要点


图片

图片

图片

图片

查看原文