Opus 5 模型发布:性能对标 Fable 5,价格仅一半,开发者实测表现惊艳
摘要:Anthropic 今日正式发布 Opus 5 大模型,多项基准测试成绩追平甚至反超市场主流模型 Fable 5,定价却只有后者的一半。网友在游戏复刻、物理模拟、3D 渲染等场景中进行了测试,结果多超预期,甚至有人称“这不像是代码生成的画面”。此外,Anthropic 还为该模型大幅精简了系统提示词,反映出其自主判断能力的提升。
官方发布与基准测试:半价对标 Fable 5
今天凌晨,Anthropic 正式发布了此前被多次泄露的 Opus 5 模型。

在多项硬核评测中,Opus 5 追平甚至反超了 Fable 5,而价格仅为它的一半。在 Frontier-Bench 上,它领先包括 Fable 5 在内的所有对手,性能是上一代 Opus 4.8 的两倍以上。在 CursorBench 最高努力设置下,Opus 5 的成绩与定价两倍的 Fable 5 峰值仅差 0.5%。

官方演示中展示了一个实时显示气流路径的风洞,空气绕流过程清晰可见。

另一个 Demo 是能 360 度旋转的 3D 细胞结构,连内质网上密密麻麻的核糖体都绘制了出来。

值得注意的是,Anthropic 为了配合 Opus 5 更强的判断力,将 Claude Code 的系统提示词删减了约八成,而模型的表现并未因此下降。
网友实测:从怀疑到“差点从椅子上摔下来”
Opus 5 上线不到半天,网友们的测试结果便纷纷涌现。这些实测展示了模型在代码生成、游戏复刻、物理模拟等场景中的真实能力。
博主 am.will 起初认为 Opus 5 不过是 Fable 的便宜版,测试后直言自己“大错特错”。他只用了 Max 订阅额度(5 倍额度)的 27%,便让 Opus 5 搭建出他见过最好的 Rocket League 克隆版——游戏可玩,代码也已开源。

类似的反差出现在另一段竞技场对决动画演示中。博主 OmedTheVibeCoder 的预期从“以为会接近 Fable 5”变成“根本不是接近,是完全甩开了它”。有网友看完这个结果后评价:“这简直就是 Fable 6。”

后来他又与其他模型进行了对比,并补充说“差点从椅子上摔下来”——Opus 5 Max 直接打破了他原有的测试标准。他表示,这已经不像代码生成的画面,更像是把提示词丢进图像生成器,得到一整张能走进的地图。

物理模拟与游戏复刻:细节令人惊叹
博主 Alex Ermolov 构建了一个滑雪场景,结论是“和 Fable 5 打平,甩开我测过的所有其他模型”。第一次生成就没有明显的穿模,滑雪物理逻辑也准确。

在 Minecraft 复刻测试中,Chetaslua 称这次生成为“迄今为止最好的一次创作”。

将其接入 Unity 后,效果像是给游戏开了挂一样。


Opus 5 对物理规律的把握也很精准。下面这个连环机关场景中,每一步动作都与真实物理规律严丝合缝。

对开发者的意义
对于使用 AI 编程工具的开发者来说,Opus 5 的发布意味着:
- 在同等预算下可以获得更接近顶级模型的代码生成质量
- 在游戏开发、3D 场景构建、物理模拟等创意编程领域,模型的生成效果已接近直观可用
- 动态提示词精简说明模型的自主判断力更强,开发者或许可以节省调试提示词的时间
关键要点
- Opus 5 在 Front-Bench、CursorBench 等评测中追平或反超 Fable 5,价格仅为其一半。
- 网友实测在游戏复刻(Rocket League、Minecraft)、物理模拟(滑雪、机关、风洞)、3D 细胞渲染等场景中表现优异,部分结果超预期。
- Anthropic 大幅精简了系统提示词(删减约八成),模型表现未降,体现了更强的自主判断力。
- 对于 AI 编程和创意工作流,Opus 5 提供了高性价比的强劲选项,可能改变开发者的模型选择策略。
摘要:Opus 5在多个高难度编程任务中展现出惊人的能力,从生成动态街区到重建波音747 3D模型,其自我验证机制尤为突出,成本仅为竞品的一半甚至更低。工程师们用一系列“破坏性”测试证明,Opus 5不仅在任务完成度上领先,更能自己检查自己。
多种场景下的表现
Noema给Opus 5下了一个“狠”任务:只用一个HTML文件,生成一条从1945年变化到2055年的街区。建筑、车辆、店铺、人群、灯光和音效全部随年份动态演变。即便把effort从max降到high,Opus 5的结果依然碾压Fable 5和GPT-5.6 Sol。Noema只给了三个字评价:“是个怪物”。

阿波罗任务的点火升空场景也让人印象深刻——火箭喷焰、实时刷新的遥测数据几乎全靠程序生成,没有调用现成素材库。

在CAD设计领域,网友直接给它封神,认为在很多机械设计任务中,它的表现已经超越了Fable。

教育场景中,开发者Matt Shumer为@AlphaSchool搭建了一个实时AI家教原型:Opus 5负责对话和方向判断,配合一个专门训练的小型世界模型做实时渲染。虽然还很粗糙,但已经能做到一边讲解分数概念,一边在画板上同步画图。

我也亲自试了一下:让Opus 5(Low Effort模式)写了一个三羧酸循环过程的3D网页动画演示。核心思路是:只描述化学过程,把几何计算交给程序完成。
具体来说,Opus 5针对每幕反应只写原子清单与键表,每根键带有反应前后两个键级,由此同时定义底物与产物。三维坐标交给几何优化器现场求解——按元素和键级取标准键长,按配位数推杂化得到键角,再加上非键排斥与平面性约束迭代收敛。产物构型则以底物坐标为起点再优化一次,使动画只保留必要位移,离去的小分子自动被推开飞散。
最后,Opus 5将代码单独抽出,校验键长与键角,确认无误后再用Three.js渲染成球与圆柱。最终交付的成果不仅正确体现反应过程,键长、键角等分子真实结构信息也按照实际数据渲染。

atomic.chat用三个破坏场景的题目做了更细的横向对比,同时比较了成本。同样是“龙卷风卷起整片场地”“重锤砸楼”“卡车压塌桁架桥”三道题,Opus 5花0.508美元全部做对。Fable 5花的钱几乎是Opus 5的两倍——龙卷风卷不起地面上的东西,楼在锤子碰到之前自己就塌了,桥直接炸成一堆木棍。GPT 5.6最便宜,0.14美元,但锤子压根没碰到楼。同期的Kimi K3和GPT 5.6水平相当。

之前Opus 5刚泄露时,有人怀疑它虽然单价低但token烧太多,综合下来并不比Fable便宜。现在看来,可能只是个例。
更硬核的自检流程
博主Victor M做了一次更严苛的自检演示:照着波音747的公开数据,用代码在浏览器里重建出一架能旋转、能查看的3D模型。
Fable 5用了42分钟交活——4个文件、约1000行代码,搭了一套Puppeteer渲染管线,跑了17轮渲染,检查了54张截图。验证方式只靠肉眼看图对不对。
Opus 5花了71分钟,写了20个模块、约4000行代码,改用Playwright渲染管线,预设了25套镜头,还额外写了一个测量脚本。它的验证方式是从渲染画面中提取正射轮廓,算出翼展、轴距、机翼前缘扫掠角等14项具体指标,逐项核对波音747-400的公开数据公差。
它还做了几件Fable 5没做的事:前43分钟只渲染没贴皮的素模,确认轮廓过关后才上涂装;中途加了一个调试参数,能单独渲染某个子部件方便排查问题;最后把6个视角拼成一张联系表一次性看完,不用一张张翻截图。
Victor M的结论是:Fable 5交货快了约40%,尺寸表也更直观,但它用的是和Opus 5一样的747-400真实数据,却从没拿建好的模型反过来量过这些数据对不对。

之所以把这段单独拿出来说,是因为Opus 5这种“自己验证自己”的劲头,在Anthropic官方提供的案例里同样能看到。

比如Frontier-Bench有一道题:给Opus 5一张机械零件的图纸,要求它写代码,用FreeCAD把零件重建成3D模型,却不给任何直接看图的方式。它索性自己写了一套计算机视觉管道,从像素中提取几何数据,把零件重建了出来,而且反复成功。同样的设定下,其他模型试了五次都没做出来。
还有一个开源包管理器的真实bug——社区提交的补丁只处理了表面症状。Opus 5顺藤摸瓜找到了底层原因,把边缘情况一起修了。
一位量化交易工程师用它为新交易所搭建实时行情源——之前的模型全都做不出来。Opus 5发现没有实时数据可供验证,索性自己搭建了一套测试环境,专门检查代码解析交易所数据的准确性。
价格减半,性能反超
看完这些演示,再来看看Opus 5的性价比数据。
价格方面,Opus 5与上一代Opus 4.8相比提质不加价:每百万token输入5美元、输出25美元,只有Fable 5的一半。同时,Opus 5依然提供Fast模式——两倍价格换取2.5倍速度,和前代规则一致。
比价格更令人意外的,是Opus 5的跑分表现。

在Frontier-Bench v0.1这类硬核编程任务上,Opus 5拿到43.3%,将Fable 5的33.7%甩开一截,是自家上一代Opus 4.8(21.1%)的两倍还多。
Opus 5表现最亮眼的一项是ARC-AGI-3——专门测试模型从未见过的新问题。它拿到30.2%,而隔壁GPT-5.6 Sol只有7.8%,差距将近四倍;相比上一代Opus 4.8更是翻了近20倍。

在顶尖模型都头疼的高难度测试Human’s Last Exam上,不开启工具时,Opus 5得分56.3%,与Fable 5的56.5%差距极小;而开启工具后,Opus 5的成绩涨到64.7%,反超Fable 5的63.9%。

网页搜索、编程智能体指数、深度搜索问答这几项,Opus 5也都小幅领先:BrowseComp 90.8%对87.4%,AA Coding Agent Index 66.7%对65.8%,DeepSearchQA 95%对94.7%。
这里有个小插曲:A社先前的一版通告里,在FrontierCode榜单上把得分更低的Opus标成了获胜者,不过这个bug现已修正。

电脑操作和业务流程这两项差距更大:OSWorld 2.0上,Opus 5得分70.6%,Fable 5为66.1%。而且官方表示,Opus 5在这项测试中的成本还不到Fable 5的三分之一。

此前在Opus 5泄露风波中频繁出现的Cursor,其联创评价道:Opus 5用Opus的价格实现了接近Fable的性能。

除了官方公布的跑分,Opus 5还在今年IMO 2026竞赛中取得满分成绩,而且没有借助任何外部工具。

另外,Opus 5不像Fable 5那样“守口如瓶”——其预计触发拦截的频率比后者降低约85%。

之前Fable 5近乎变态的安全护栏让不少开发者头疼,现在有了Opus 5,这个问题或许能得到缓解。
Claude Code系统提示词也改了
Opus 5发布同一天,Anthropic工程师Thariq发表了一篇文章,介绍他们如何为Claude Code这类产品设计上下文。
最引人注目的一条是:Claude Code的系统提示词被删掉了超过80%,而编码评测成绩没有任何下降。这80%的删减,正是针对Opus 5、Fable 5这一代模型做的优化。

能删掉这么多,前提是模型的判断力已经追上来了——过去靠规则硬堵的地方,现在可以放手交给模型自行判断。
最典型的一条规则是“默认不写注释”。早期模型判断力不够,团队担心它写出大量混乱的注释,只能硬性规定不写。但用户有时需要详细注释,这条规则反而帮倒忙。现在,这条规则被替换为“写代码时贴合周围代码的风格,匹配注释密度、命名和习惯”,判断权交还给了模型。

类似的逻辑也用在了工具设计上。过去团队靠给例子来教模型如何使用工具,但例子越多,模型可选路径反而被框得越死。现在,团队反过来专注于优化工具接口本身——比如Todo工具只保留“待处理”“进行中”“已完成”几个状态,模型自己就能判断怎么用,无需额外举例。

判断力提升了,上下文本身也不必一次性堆给模型。系统提示词从“一开始把所有场景说明塞进去”改为“渐进式披露”:把代码审查这类不常用的说明单独拆成一个技能文件,只有当模型判断需要用到时,才自行去调用。
Claude Opus 5 不仅性能碾压前代,还重新定义了上下文工程的规则——模型自己学会了判断哪些信息值得记住,不再需要用户手动搭建“脚手架”。马斯克也来站台,称只有 Grok 4.5 和 Opus 5 处于性价比的“帕累托前沿”。
记忆不再靠手动,模型自己会“记笔记”
过去,想让 Claude 记住关键信息,你得手动把内容写进 CLAUDE.md 文件里,就像给模型贴标签。现在 Opus 5 带来一个根本性变化:它能自主判断哪些信息值得保留,并直接存储为长期记忆。
这个变化背后是一个更深层的逻辑转向:规则、示例、记忆这些“脚手架”,原本都是为了弥补模型判断力不足而搭的;如今模型自己能接得住,脚手架自然被一根根拆掉了。
One More Thing:马斯克也来“蹭热度”
Opus 5 发布后,马斯克立刻放出了一张 FrontieCode 性价比对比图,并指出只有 Grok 4.5 和 Opus 5 处于“帕累托前沿”——说白了,就是在性能和成本之间找到了最优平衡点。

按照他的说法,Grok 4.5 虽然绝对表现比不上 Opus 5,但价格更低,堪称同等性能下最便宜的模型之一。