解读智谱 GLM-5.3 评测结果:别只盯着头条数字

AI News 2026-08-19T00:53:03.514924

原文:

智谱的 GLM-5.3 评测结果已经公布,但数字背后的信息更值得玩味。

智谱发布的 GLM-5.3 技术报告中有一句话,多数新闻报道都没有提到。在描述自家网络安全测试结果时,这家北京公司写道:能力“增长最快的地方,恰恰是我们落后最远的地方”。

智谱(也以 Z.ai 名义运营)是少数几家发布模型与美国前沿竞争的中国实验室之一。8 月 14 日,智谱发布了以编程为重点的 GLM-5.3,并附了一份技术报告,说明该模型与对手的对比表现。本文所有数据均来自这份报告。

传播最广的是关于安全性的说法。在编程成绩之外,智谱称 GLM-5.3 在发现软件漏洞方面表现出乎意料地好:在 CyberGym 基准测试中得分 84.5%,而 Anthropic 的 Mythos 5 为 83.8%,OpenAI 的 GPT-5.6 Sol 为 83.6%。随后出现了一些标题新闻,称中国模型在漏洞挖掘上已经超过了美国模型。

这个结果之所以比一般的基准测试更令人震动,是因为漏洞发现这项技术如今的意义不同了。一个能读代码库、找到可被利用漏洞的模型,对审计自家软件的安全防御者有用,对想对别人软件做同样事情的人也有用。Anthropic 的同类工作因此被限制访问,而智谱打算公开 GLM-5.3 的权重,供任何人下载。

智谱自己的报告比它所引发的报道要克制得多。CyberGym 的成绩是真实的,也写在了论文里。但这也是智谱发布的三项网络安全相关结果中最领先的一个,而智谱明确表示另外两项的结果恰恰相反。三个基准,三幅不同的图景。

CyberGym 从模型可读取的源代码出发,测试它能否找到漏洞并确认该漏洞真实存在。这就是被广泛传播的那项结果,领先幅度是 0.7 个百分点。ExploitBench 的要求更高:模型需要针对一个真实漏洞进行推理,并判断它会被如何利用。GLM-5.3 得分 54.4%,是上一代模型 24.4% 的两倍多;而 Mythos 5 得分 78.0%,GPT-5.6 Sol 得分 76.5%。

ExploitGym 统计的是模型在固定时间内能完成多少个漏洞利用任务。GLM-5.3 在两小时内完成了 105 个,六小时内完成了 130 个;Mythos 5 则分别是 181 个和 247 个。这两项结果在宣传中被轻描淡写,而恰恰是它们最能说明差距——发现一个漏洞,和基于漏洞写出可用的攻击程序,是两件不同的事。智谱自己的理解是:测试越处于这条链路的后端,模型落后得就越多。公司在发布材料里直接写明了这一点,而不是留给外界自己去琢磨。

下图是智谱自己对三个网络安全基准的对比:GLM-5.3 在漏洞发现测试 CyberGym 上领先,但在两项漏洞利用指标上都落后于 Anthropic 的 Mythos 5。
来源:Z.ai

比的是哪个 Anthropic 模型,为什么一直在变

报道中出现混乱,部分原因在于智谱在三处地方对比了三个不同的 Anthropic 模型。主基准表拿 GLM-5.3 对标 Opus 4.8,性能图表用的是 Fable 5,网络安全部分用的又是 Mythos 5。快速浏览的读者很容易得出一个并不存在的单一对比结论。

编程方面的情况则是互有胜负,而不是一边倒。GLM-5.3 在部分测试上领先 Opus 4.8,在其他测试上落后。智谱也坦承,在自家的内部编程基准上,其模型仍落后于 Claude Fable 5。

测试是怎么跑的

方法说明的脚注里有一条摘要略过的信息:智谱是在 Anthropic 的编码智能体 Claude Code 2.1.207 里运行 GLM-5.3 的 CyberGym、ExploitGym、ExploitBench、Terminal Bench 等多项测试的。这样做本身并没有问题——让不同模型跑在同一个测试框架里,对比才公平,智谱也记录了自己使用的配置。但这件事仍然值得注意:一家中国开源权重模型宣称的"前沿水平",要靠美国的智能体软件来检验。工具层在这场竞争中占据什么位置,这一点恰恰是跑分数字看不出来的。

另外,在把 CyberGym 的成绩当作定论之前,还有两个细节值得留意。其一,这项成绩只跑了一次,以 pass@1(首次尝试即通过)的形式在 1,507 个任务上报告,没有给出方差数据。

0.7分的差距只是两次独立运行之间的差异,不足以作为依据。而且,ExploitGym的时间预算是根据Artificial Analysis的吞吐率归一化而来的,其中列出了GLM-5.3、Kimi K3和Qwen3.8 Max的重新缩放系数,但没有Mythos 5的。

漏洞数量,以及缺失的那个数字

除了基准测试,智谱还表示,他们与中国安全团队合作,让模型针对真实代码库进行测试,在269个开源项目中识别出2436个漏洞。按严重程度分,107个为严重,990个为高危,1286个为中危,53个为低危。最早的一个缺陷可追溯到1981年;平均而言,每个漏洞在被发现前已在代码中潜伏了26.6年。

智谱的披露摘要:面板将1097项发现标记为严重和高危,与严重107个、高危990个的细分结果一致;同份新闻稿的正文却把这一数字描述为“中高危”。来源:Z.ai。

有一处不一致值得谨慎对待:智谱的摘要面板将1097项发现标记为严重和高危,这与严重程度表格相符;但同一发布稿的正文却将其中1097项描述为“中高危”。有几家媒体转载了后一种说法。另外,这个数字是在智谱所称的专家审查、筛选和去重之后得出的,所以报道的并不是模型的原始输出。在2436项发现中,53项已公开披露,2383项仍处于保密状态。发布稿没有说明其中有多少是此前未知的,也没有说明有多少被独立复现。而正是这两个数字,才能把“数量上的宣称”变成“能力上的证明”。

比基准测试表更重要的事

发布稿中有两件事比CyberGym的领先幅度影响更深远。第一是效率。智谱报告称,GLM-5.3在内部编码基准测试中达到31.4%,每个任务约消耗50,000个输出token;作为对比,Opus 4.8的成绩是29.5%,消耗120,000个token。用不到一半的token换来略好的结果,这是一个成本上的论据;而成本决定了那些不在最顶级预算内的安全团队是否根本用得起这些工具。第二是分发。

智谱表示,等安全评估和安全加固完成后就会发布模型权重。目前这一步还没走完,所以“开放权重”目前还只是承诺,不是既成事实。如果最终兑现,这款已被证实具备漏洞发现能力的模型,就可以被任何团队下载并在本地运行——包括那些永远拿不到受出口管制美国模型的市场。权重预计 8 月底发布。

另见:Anthropic 走进白宫,Mythos 是华盛顿放它进去的原因。

想向行业领袖了解更多 AI 和大数据内容?可以关注在阿姆斯特丹、加州和伦敦举办的 AI & Big Data Expo。这一综合性活动是 TechEx 的一部分,会与网络安全与云计算博览会等其他前沿技术活动同期举办。点击此处了解更多信息。

AI News 由 TechForge Media 提供技术支持。在这里可以探索更多即将举办的企业技术活动和网络研讨会。

查看原文