GLM-5.3 对比 GPT-5.6 Sol:DeepSWE 基准下的成本、编码与路由策略
核心结论
别二选一。先用 GLM-5.3 跑,测试不过再升级到 GPT-5.6 Sol。这套级联策略能以每个任务 6.61 美元的成本解决 85.9% 的 DeepSWE 任务。单独用 Sol 则只能解决 72.7%,成本还要 8.37 美元——性价比高出 13 个百分点,成本还便宜 21%。
-
Sol 在单次尝试中险胜。 pass@1 达到 72.7%,GLM-5.3 为 69.0%,3.7 个百分点的差距在几个标准差范围之内。
-
之后的每次重试都是 GLM-5.3 领先。 pass@2 两者打平(81.1 对 81.0),pass@4 则是 GLM-5.3 以 87.6% 胜过 Sol 的 85.8%。
-
价差达到 2.1 倍。 单次运行 GLM-5.3 只要 3.99 美元,Sol 要 8.37 美元。每花 100 美元,GLM-5.3 能解决 17 个任务,Sol 只能解决 9 个。
-
Sol 更快也更稳: 单次运行平均 19 分钟、61 步,GLM-5.3 则是 35 分钟、124 步;61 个任务做到四次全过,GLM-5.3 只有 48 个。
-
GLM-5.3 失败得更“干净”。 它的失败案例中只有 11% 是破坏了原本通过的测试,Sol 则高达 20%。建议对 Sol 的 diff 设置回归检查。
-
两者互补性强(任务级相关度仅 0.43),合起来能覆盖 113 个任务中的 106 个——这正是级联策略能成立的原因。
我们在全部 113 个 DeepSWE 任务上分别跑了 GLM-5.3(max)和 GPT-5.6 Sol(max),各 4 次,数据来自公开的逐次运行记录:总计 904 次运行,每方 452 次。Sol 是主打精度的旗舰模型,GLM-5.3 则是追赶上来、几乎抹平差距的开放权重挑战者。以下所有数据均来自本次测试,因此可能与其他公开的 GLM-5.3 对比 GPT-5.6 Sol 报告有所出入。
DeepSWE · 正面交锋
GLM 5.3 与 GPT 5.6 Sol 速览
GPT-5.6 Sol 在 DeepSWE 上依然保持着单次尝试的冠军地位。DeepSWE 是一个衡量模型软件工程能力的基准测试,覆盖多种任务类型和编程语言。GLM-5.3 以不到 4 个百分点的差距紧随其后,价格却只有一半——而且一旦允许多次尝试,它立刻反超。这是开放权重模型历来最接近前沿水平的一次,值得回答的问题是:Sol 多出来的那份溢价,到底买到了什么。

DeepSWE 记分牌:pass@1 与 pass@k
在 DeepSWE 官方评分下,单次生成时 Sol 略占上风:pass@1 为 72.7%,GLM-5.3 为 69.0%。一旦允许重试,名次就会逆转。两次尝试时,GLM-5.3(81.1%)已与 Sol(81.0%)打平;四次尝试时,GLM-5.3 的 pass@4 为 87.6%,领先 Sol 的 85.8%。开源模型覆盖面更广,因此在任意 best-of-k 设置下都是更准确的选择,而且它的额外尝试成本只有 Sol 的一半。

成本对比:GLM-5.3 与 GPT-5.6 Sol 的定价
GLM-5.3 每次运行 3.99 美元,比 Sol(8.37 美元)便宜约 2.1 倍;换算成价值,每 100 美元能解决 17 个任务,而 Sol 只能解决 9 个。Sol 的溢价靠延迟赚了回来:平均 19 分钟、61 个步骤,而 GLM-5.3 需要 35 分钟、124 个步骤;输出 token 数 Sol 为 6 万,GLM-5.3 为 8 万。这是一个异常清晰的取舍:Sol 是更快、更精炼的工人;GLM-5.3 是成本更低、但走长路的那一个。如果有人等着结果,Sol 光凭延迟就值这个溢价;如果等的是预算,或者有一批任务在队列里排队,GLM-5.3 更值得买。

覆盖率与可靠性:精度与覆盖面
把 pass@1 和 pass@4 拆成覆盖率(四次尝试中至少解决一次的任务)和可靠性(四次全部解决的任务),区别就很明显。Sol 站在精度这一端:可靠性 84.5%,61 个任务四次全对,这是“碰到就能成”的模型特征。GLM-5.3 则换到了另一个轴:覆盖率更高,87.6% 对 85.8%,但可靠性更低,78.8%,稳定的任务也更少,48 对 61。这个覆盖率优势,其实就是它 pass@4 领先的原因。GLM-5.3 比 Sol 触及了基准测试中更多的任务,但每一次触碰的单次命中率略低一些。
失败模式:两种模型各自错在哪里
两者的失败特征差异明显,而且这个差距偏向开源模型。Sol 在 20% 的失败案例中会弄坏仓库里已有的测试套件——这是 GPT 家族典型的回归式失误。GLM-5.3 只有 11% 的失败会这样;它出错时通常是「向前偏」——基线代码完好,只是结果差一点,接近命中的比例达到 61%,而 Sol 只有 54%。也就是说,成本更低的模型反而更安全,不需要厚重的回归测试闸门来把关。接受 Sol 的 diff 之前,最好先跑一遍完整的回归测试;GLM-5.3 对这个护栏的需求要小得多。

按任务类型看各自的强项
任务版图正好对半开,两边各赢四个领域。Sol 拿下数据建模与序列化(92%)、构建与运维工具链(73%)、并发与持久性(72%)、协议一致性(59%)——这些是讲究精确契约、系统底层偏重的活儿。GLM-5.3 则赢得查询与配置语言(88%,全表最高单项)、语言与运行时内部实现(83%)、有状态响应式(73%),程序分析则是 64 比 64 打平,靠总体量胜出。这些是结构化、解释器风格的工作。GLM-5.3 唯一的明显短板是协议一致性,只有 44%,比 Sol 落后 15 个百分点。Sol 则没有任何明显的弱项,各方面都很稳健。这里的任务类型是由大语言模型(LLM)根据每个基准测试的提示词自动分类的。

按编程语言对比 GLM-5.3 与 GPT-5.6 Sol
GLM-5.3 最亮眼的是 JavaScript,通过率 90%,比 Sol 的 75% 高出 15 个百分点,也是整个榜单上所有模型在 JS 上的最好成绩。Rust 也是 GLM-5.3 赢,70 比 60。Sol 则拿回 Python(74 比 66)、Go(79 比 76)和 TypeScript(66 比 61)。路由规则很简单:JavaScript 和 Rust 交给 GLM-5.3,其余交给 Sol——而且几乎在所有语言上,GLM-5.3 都是那个成本更低、成绩紧咬的次选。

GLM-5.3 和 GPT-5.6 Sol 到底有多大差别?
差别大到足够做路由决策。两个模型的任务级相关性只有 0.43,总体水平虽然接近,但真实分歧不小。它们都能解决 90 个任务;GLM-5.3 独揽 9 个,Sol 独揽 7 个,还有 7 个两者都解不出来。两者并集覆盖了 113 个任务中的 106 个(93.8%),而且困难分歧呈现一边倒:GLM-5.3 在两个任务上四发全中,而 Sol 从未命中(koota-pair-relation-tracking、participle-grammar-conflict-analysis);反过来,Sol 没有在任何一个 GLM-5.3 挂零的任务上拿到全中。开源模型去了旗舰模型去不了的地方。

在两者之间做路由:组合打法
这种分歧叠加价格因素,让级联方案成了对比表上最亮眼的一行。先跑 GLM-5.3,只有测试套件拒收答案时才升级到 Sol:结果能解决 85.9% 的任务,每个任务成本 6.61 美元。这比单独用 Sol(72.7%)高出 13 个百分点,而且仍然比单独跑一次 Sol(8.37 美元)便宜,因为开源模型以 Sol 一半的价格清掉了大部分任务,剩下的硬骨头则获得第二次独立尝试的机会。级联方案甚至击败了完美的单次理想路由器(83.8%),因为两次独立尝试胜过一次完美挑选。无论哪个模型打头,预期准确率都相同,但 GLM-5.3 打头更便宜(6.61 美元对 9.47 美元),所以应该先上成本更低的那个。

这意味着什么
GPT-5.6 Sol保住了单次尝试的桂冠,以及随之而来的一切:最高的首次通过率、最高的可靠性,以及目前最快、最简洁的运行。但你要为此付出大约两倍的代价,还必须为其20%的回退率设置防护栏。GLM-5.3则是性价比之选,也是多次采样最优的优选:在首次尝试上仅差4个百分点,在pass@2、pass@4和覆盖度上领先,价格却只有一半,失败模式更干净,JavaScript表现全场最佳。它相对Sol真正的短板在于协议合规性和原始速度。正因为两者确实各有优劣,最锋利的部署方案不是二选一。而是用GLM-5.3做低成本前端,Sol作为验证器把关的升级通道——这样能以低于旗舰自身单任务价格拿到超越旗舰的覆盖率。
DeepSWE · 完整结果
GLM 5.3 vs GPT 5.6 Sol,逐指标对比
113个DeepSWE任务 · 每配置4次试验 · 均为最大努力 · 共904次 rollout
常见问题
GLM-5.3比GPT-5.6 Sol更强吗?
取决于你看哪个指标。GPT-5.6 Sol在DeepSWE上的单次尝试质量更高(pass@1为72.7%,对比69.0%),四个任务全部解决的次数更多(61次对48次),而且每次rollout的耗时才一半左右。GLM-5.3在pass@2上与Sol打平,在pass@4上反超(87.6%对85.8%),单次rollout成本只有一半,因此在大规模或可容忍重试的智能体工作中是更有价值的选择。
GLM-5.3比GPT-5.6 Sol便宜多少?
在我们的测试中,最大努力模式下GLM-5.3每次rollout花费3.99美元,GPT-5.6 Sol为8.37美元,约低了2.1倍。按每个已解决任务计算,GLM-5.3每100美元完成17个任务,Sol只能完成9个——每美元完成的工程量约为两倍。
写代码选GLM-5.3还是GPT-5.6 Sol?
两者各占半壁江山。GLM-5.3在JavaScript(90对75)和Rust(70对60)上胜出;Sol在Python(74对66)、Go(79对76)和TypeScript(66对61)上领先。按任务领域分则是4胜4负:Sol在严格契约类和系统类任务上领先,GLM-5.3在查询和配置文件语言、运行时内部机制和有状态响应式任务上领先。
该在 GLM-5.3 和 GPT-5.6 Sol 之间做路由吗?
可以,前提是你能验证结果。两个模型的分歧不小(相关性只有 0.43),出错的方式也不一样。所以可以先跑 GLM-5.3,当测试套件拒绝输出时再升级到 Sol——这样任务通过率能到 85.9%,每个任务花费 6.61 美元,不仅优于只用 Sol(72.7%,每个任务 8.37 美元),也超过单次调用就能选对模型的完美 oracle 路由(83.8%)。两个模型合起来能覆盖 113 个任务中的 106 个。
DeepSWE 上的 pass@k 是什么?
pass@k 衡量的是:对一个任务尝试 k 次,至少有一次能通过隐藏测试集。pass@1 看重第一次就做对的能力;k 越大,越体现模型在多次尝试中最终找到解的能力。随着 k 增大,GLM-5.3 的优势也在扩大。
方法与注意事项
-
数据:来自 DeepSWE v1.1 导出,按已公布的逐次试验记录整理,113 个任务、每个配置各跑 4 次,两个模型都开到最大努力(max effort)模式,每侧共 452 次试验。
-
评分:正文中的通过率采用 DeepSWE 官方评分口径(included_in_score,不含基础设施错误)。GLM-5.3 有 1 次基础设施错误,Sol 有 2 次,所以官方口径和严格口径的结果基本一致。pass@2、pass@4、覆盖率、并集和相关度则按各任务的通过次数计算。
-
成本:直接采用索引中公布的每次试验 cost_usd。分析期间,GLM-5.3 批次的分轮轨迹 JSON 还没放到公共 CDN 上,所以这次分析只到索引层面。
-
失败分析:基于已公布的各测试项通过比例。差一点成功(near miss)指新增测试至少通过 80% 且原有基线测试没被破坏;回归(regression)指有基线测试失败。任务领域划分采用基于产物(artifact)的任务分类法。