[AINews] OpenAI 发布 GPT 5.6 Sol/Terra/Luna,Codex 成为 ChatGPT 超级应用
放在平常日子,Meta Superintelligence Labs 发布了一款出人意料优秀/有竞争力的 Muse Spark 1.1(首次加入 Meta Model API,表明对广泛使用和第三方测试的高度信心,这在其姊妹模型中已得到验证),这足以成为头条新闻。但不幸的是,它与一次主流前沿模型发布撞车了:正如几周前在政府批准前预告的那样,5.6 推出了三个新尺寸:Sol、Terra 和 Luna,分别对应太阳、地球和月亮的大小,作为 Claude 变体更文学化命名的替代方案;以及一个新的超高努力级别,“我们的最高能力设置,跨多个并行工作流协调多个智能体,以更快完成复杂任务”:max 给予 GPT‑5.6 比 xhigh 更多的时间来推理、探索备选方案、运行检查并修正其方法。ultra 更进一步,默认并行协调四个智能体,以更高的 token 使用换取更强的结果和更快的任务完成时间。在多个基准测试(不仅仅是这里展示的)中,5.6 相比 Fable 或 Opus 以更低的成本实现了更高的性能。“Terra 的性能略高于 Fable 5,而 Luna 超越了 Opus 4.8;每个模型的用时约为三分之一,输出 token 数量约为一半,预估成本约为四分之一。它还在 Terminal‑Bench 2.1 和 DeepSWE 上创造了新的最佳结果,这些基准测试了复杂命令行工作流和真实代码库中的长周期工程能力。”此外,在计算机使用、演示/文档生成和科学研究方面也有难以量化的改进,这些改进同样值得认真对待。正如我们在四月份预测的那样,今天新发布的 ChatGPT Work 和 Codex 桌面应用更新,很可能是 OpenAI 超级应用战略的倒数第二步(最后一个悬而未决的问题是,智能体浏览器将何去何从……)。
OpenAI 推出了全新的三模型 GPT‑5.6 系列,并同时扩展了围绕它的产品体系。OpenAI 通过 @OpenAI 和 @OpenAIDevs 宣布,GPT‑5.6 Sol、Terra 和 Luna 将在 ChatGPT、Codex 和 API 中逐步推出。据 @OpenAI 称,在 ChatGPT 中,Plus、Pro、Business 和 Enterprise 用户可通过中等或更高努力设置访问 GPT‑5.6 Sol,而 Pro 和 Enterprise 用户可在复杂任务中选择 GPT‑5.6 Pro 以获得最高质量的结果。API 定价引入了分层方案:Sol 每百万输入/输出 token 价格为 $5 / $30,Terra 为 $2.5 / $15,Luna 为 $1 / $6。据 @ArtificialAnlys 称,本次还首次加入了缓存写入定价,并保留了 90% 的缓存读取折扣。OpenAI 通过 @OpenAIDevs 将此系列定位为性能-价格阶梯:Sol = 旗舰/最高天花板,Terra = 类似 GPT‑5.5 的能力但成本更低,Luna = 速度最快/最便宜的高容量选项。此次发布还捆绑了重大的应用层变化:ChatGPT Work(一款融合 Codex + ChatGPT 的新桌面应用)、Sites 测试版、程序化工具调用,以及 Responses API 中的多智能体测试版,信息来源为 @OpenAI、@OpenAIDevs 和 @OpenAIDevs。
官方声明与基准测试结果
[AINews] OpenAI 发布 GPT 5.6 Sol/Terra/Luna,Codex 成为 ChatGPT 超级应用
OpenAI 官方消息强调其强大的智能体/编码性能、更好的 Artifact 质量以及更优的经济性。Sam Altman 在发布帖子中称其为“显然是我们迄今为止最好的模型”,并附上了发布博客的链接(via @sama)。Altman 还强调了企业经济性:“5.6 sol 在每任务美元方面向前迈出了一大步”(via @sama)。Greg Brockman 表示,目标是“在任何目标性能水平下实现最佳价格”以及尽可能高的上限(via @gdb)。OpenAI 声称 GPT‑5.6 Sol 在 Agents' Last Exam 上达到了 53.6 的新高,比 Claude Fable 5 adaptive 高出 13.1 分;在中等推理水平下,它比 Fable 高出 11.4 分,而预估成本仅为其约四分之一;同时 Terra 和 Luna 在成本约为其十六分之一的情况下也超越了 Fable(via @OpenAI)。OpenAI 表示,GPT‑5.6 在演示文稿、文档和电子表格中的 Artifact 质量有所提升,输出结果可导出到现有企业工具(via @OpenAI)。OpenAI 将 GPT‑5.6 定位为在 ChatGPT Work 内部进行复杂任务推理以及根据模板、参考文件和首选风格生成材料方面的最先进技术(via @OpenAI)。OpenAI 还表示,GPT‑5.6 是其迄今为止在网络和生物相关任务上能力最强的模型,在双重用途领域,某些 API 调用可能会被阻止或暂停以进行额外的安全审查(via @OpenAIDevs)。OpenAI 强调了更好的计算机使用性能:更快、更节省 Token、支持多步骤任务中的批处理和并行操作,以及画中画监控(via @OpenAIDevs)。