智谱发布GLM-5.3:编码能力逼近Claude Fable 5,安全评测挖掘2404个漏洞

量子位 2026-08-15T00:58:38.847868

智谱AI今日发布新一代大模型GLM-5.3,在编码与智能体能力上进一步逼近Claude Fable 5,同时以84.5%的白盒代码审查得分登顶开源安全模型榜首。发布前团队联合多所高校与企业开展了大规模红队测试,累计发现覆盖220个项目的2404个漏洞,其中最早的代码缺陷可追溯到40年前。

在DeepSeek V4 Pro正式版和Grok 4.6相继发布后,智谱AI于今日推出了GLM-5.3,凭借编码能力和安全性的双重提升,迅速重回开源模型和国产模型的第一梯队。

编码能力:更接近Claude Fable 5

在多项主流基准测试中,GLM-5.3是目前排名最高的开源模型,编程与智能体能力已接近Claude Fable 5,实际编码体验优于其他国产模型。

值得关注的是GLM-5.3在不同推理强度下的表现差异。随着Token预算的增加,其编码准确率持续上升;在High推理档位下,GLM-5.3能以明显更低的Token消耗,达到超过Claude Opus 4.8最高档位的准确率。

所谓“Token”,可以理解为模型处理文本时的基本计量单位——预算越高,模型“思考”得越充分,回答质量通常也越好。GLM-5.3的优势在于:用更少的思考成本,拿到更好的结果。

安全能力:开源模型中的新标杆

本次发布中另一个核心关键词是安全。在CyberGym白盒代码审查中,GLM-5.3获得了84.5%的得分,相比上一代GLM-5.2的77.2%有明显提升,同时也略高于Mythos 5和GPT-5.6 Sol,成为当前最强的开源安全模型。

“白盒代码审查”指的是在完全了解代码结构和逻辑的前提下,让模型去发现其中的安全漏洞——相当于把代码“摊开”给模型看,考它能不能挑出毛病。

在正式发布前的两周内,智谱联合清华大学、南开大学以及多家国内企业和实验室,开展了密集的红队测试与安全评估。“红队测试”是一种模拟攻击者视角的测试方式,目的是赶在真实攻击发生之前,提前找出系统的薄弱环节。

据悉,测试累计发现漏洞2404个(经初筛与去重),其中1088个属于中高危级别,覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与互联网协议等220个项目。最令人意外的是,这些代码中最早的问题可以追溯到40年前——一个潜伏在古老代码库深处的历史缺陷。

实测:一个可交付的模拟游戏

为了验证GLM-5.3的真实能力,我们在智谱自家的测试平台ZCode中,使用内测版本进行了深度评测,全程无人工干预。

第一个任务选择了Karpathy最新发布的“指环王基准测试”。这个任务要求模型根据《指环王》第一章的原文文本,自主完成代码编写、3D资产摆放、动画编排,最终产出一个完整可运行的作品。我们在Prompt中额外增加了难度:要求AI将原文改编为约90秒的中文旁白,同时不能改变核心情节。

28分钟后,一个中文版的指环王基准测试作品顺利生成:

从结果来看,GLM-5.3不仅完成了这项测试的基本要求,还能从文学文本中提取关键信息,将文字重新组织为视听语言——这意味着模型具备了从“读懂文字”到“生成内容”的完整链路能力,而不仅仅是机械地执行指令。

GLM-5.3的发布,意味着开源模型在编码能力和安全防护两个维度上又往前迈进了一步。对于AI编程工具的使用者来说,更强的代码审查能力加上更低的推理成本,意味着更可靠、更高效的自动化编码体验。

关键要点

从「会写页面」到「能交付软件」:三轮实测层层加码

如果说前面《指环王》场景只是热身,那后面的测试难度是逐级递增的。先看第二关:一个可以完全交互的 3D 手表解构 Demo。这个任务的难点在于,模型不能只画出一块完整的手表——拆解之后,表盘、机芯、齿轮和表链之间的空间关系还得保持正确,镜头拉近也不能穿帮。输入 Prompt 后,GLM-5.3 依旧是自己动手操作,遇到需要修复的地方会自行检查调整:

十几分钟后,结果出来了。没有扫描、没有任何手表相关的模型文件,手表各处细节被拆解得明明白白,而且经得起近距离查看:

不过说到底,上面两个实测虽然效果不错,但都属于演示级别的 Demo。真正检验「可交付」能力,还需要更硬核的任务:让 GLM-5.3 做一个完整的模拟游戏——不只是有视觉效果,还得有后端、数据库、权限、测试和部署,跑通整套软件工程链路(需要提前在本地装好 Docker)。

这个任务相对复杂,GLM-5.3 总共花了 40 分钟。但验收不能只看最终效果,得一步步验证。先看注册和登录:

进入游戏后操作,点击保存到数据库再退出;重新进入时要能恢复到刚才的存档进度:

权限测试方面,退出刚才的账号,重新注册一个新账号。进入游戏后可以看到,两个账号的数据互相不可见——权限设置已经生效:

最后,为了让验收更严谨,我们让 GLM-5.3 自己运行测试并输出验收报告,Prompt 如下:

现在不要再增加任何新功能。 请进入最终验收阶段,实际运行项目现有的全部自动化测试、权限测试、数据库持久化测试和构建测试。 然后向我输出一份最终验收报告。 必须列出: 1. 实际执行了哪些测试命令 2. 每一项测试的真实结果 3. 总测试数量 4. 通过数量 5. 失败数量 6. Docker构建是否真实成功 7. 哪些内容经过真实验证 8. 哪些内容尚未验证 9. 当前已知Bug 不要修改测试结果,不要将未运行的内容描述为已经通过。

最终输出的报告显示,这个项目的前端、后端、数据库、权限等环节确实全部跑通了:

综合这三轮实测可以看出,GLM-5.3 在编程能力上的提升不只是「更会写质量更高的页面」,它已经能把一个需求完整交付成可运行的软件。

没有 GPU,硬让它编 CUDA 会怎样?

既然已经达到可交付的生产级水平,那「安全」就成了第二个需要实测的关键词。第一个任务依旧是小试牛刀:找 Bug。

我们用一个叫 AegisDesk 的项目来测试。它是一个结构真实的 Node.js 小型 Web 应用,里面提前埋设了一组安全问题。但项目里没有答案、没有漏洞注释,也没有告诉模型一共藏着多少个 Bug。

查看原文