DeepSeek V4 Pro 0813 对比 GPT-5.6 Sol:DeepSWE 上的成本、编码与路由

Together.ai 2026-08-19T00:48:18.197778

核心要点

在 DeepSWE 基准上,我们对比了 DeepSeek V4 Pro 0813 和 GPT-5.6 Sol。DeepSWE 是一个横跨多种任务类型和

DeepSWE 排行榜:pass@1 与 pass@k

单次尝试(pass@1)下,Sol 优势明显:72.7% 对 Pro 的 62.8%(官方计分口径)。但每多一次重试,差距就缩小一点,直到反转——两次尝试时 Pro 已经追到 78.5% vs 81.0%;四次尝试时,Pro 的 pass@4 达到 88.5%,反超 Sol 的 85.8%。更便宜的模型覆盖面反而更广:它需要不止一次尝试,而它的尝试几乎不花钱。如果你的工作负载允许跑 best-of-k(多次采样取最优),Sol 在准确率上的优势基本就消失了。

成本对比:DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 的定价

DeepSeek V4 Pro 0813 跑一次任务只要 0.24 美元,比 Sol 的 8.37 美元便宜 35 倍。按价值算,每 100 美元 Pro 能完成 260 次解题,Sol 只有 9 次。但低价买不来速度和简洁:Pro 中位数要跑 146 步、耗时 35 分钟,输出 101k 个 token;Sol 只要 53 步、17 分钟,输出 59k 个 token。Sol 是又快又简洁的专精选手,Pro 则是绕远路达到相近的覆盖率。如果有人在等结果,光延迟这一项 Sol 就值回溢价;如果等的是预算或队列,那目前没有任何选项能与 Pro 相提并论。

覆盖 vs 可靠:精度与触达的权衡

把 pass@1 拆成覆盖率和可靠性,分界很清楚。Sol 站在精度这一端:可靠性 84.5%,61 个任务四次全对,是典型的「碰一个成一个」的模型。DeepSeek V4 Pro 0813 则换到另一头:覆盖率更广(88.5% vs 85.8%),但可靠性低得多(71.0%),能稳定四次全对的任务也更少(35 vs 61)。这正是从侧面看 pass@4 交叉点的图景:Pro 触及的基准任务比 Sol 多,但每次尝试的成功转化率更低。

失败模式:两个模型各错在哪里

两种模型的失败特征差异很明显。Sol 在 20% 的失败案例中破坏了仓库原有的测试套件,这是 GPT 家族典型的回归特征;而 DeepSeek V4 Pro 0813 要保守得多,只有 11%,它失败时通常只是接近答案但没做对、基线代码仍然完好。所以更便宜的模型反而更适合不审查就直接采纳:如果你想直接用 Sol 的改动,先给它加一道完整的回归测试门禁;而 Pro 则没那么需要这道防线。

按任务类型看各自的优势

Sol 在质量上的领先是全面的:8 个领域中赢了 6 个,最突出的是数据建模与序列化,得分 92%(比 Pro 高出 28 个百分点),此外还有查询/配置(80)、并发(72)、构建/运维(73)、程序分析(64)和协议一致性(59)。Sol 没有赢下的只有两个窄领域:语言与运行时内部实现打成 75:75 平手,DeepSeek V4 Pro 0813 则在有状态响应性上以 66 比 64 小幅胜出,这也是它唯一赢下的领域。凡是任务要求精确落地某个序列化协议的地方,Sol 都会大幅拉开差距。

按编程语言看 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 的表现

Sol 横扫了五种语言中的四种(Python 74、Go 79、TypeScript 66、JavaScript 75),而且在 Python 和 Go 上领先幅度很大。唯一例外是 Rust,DeepSeek V4 Pro 0813 以 65 比 60 反超:这是唯一一种 Sol 表现低于自身平均水平、而 Pro 完胜的语言。如果你的技术栈是 Python 或 Go,这场比较基本是 Sol 的天下;如果是 Rust,Pro 只稍微好一点点,但价格便宜得多。

DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 的差异有多大?

差异中等。两者在单个任务上的相关系数为 0.54,是 DeepSeek-Pro 各配对中相关性最高的一对。它们都能解决 90 个任务;Pro 独有 10 个,Sol 独有 7 个,还有 6 个把两者都难住了。两者并集覆盖 113 个任务中的 107 个(94.7%)。有一个不对称性对组合策略很重要:DeepSeek V4 Pro 0813 没有解决任何一个 Sol 完全搞不定的任务,而 Sol 在两个 Pro 从未解决的任务上(pebble-durability-wait-apis、textual-kitty-key-phases)做到了全对。所以 Pro 在 Sol 之上并没有增加多少新的覆盖面;它增加的是以最低成本清掉共同任务的能力。

在两者之间路由:组合玩法

这正是级联方案胜出的原因。先跑 DeepSeek V4 Pro 0813,只有当测试套件拒绝其答案时才升级到 Sol:83.0% 的解决率,每任务成本 3.35 美元。这比单独用 Sol(72.7%)高出十个百分点,而成本不到 Sol 每任务价格(8.37 美元)的一半。近乎免费的第一阶段清掉了大部分任务,所以 Sol 的高价只适用于剩下的难题,而且到达 Sol 的任务还能在此基础上获得第二次独立尝试。级联甚至击败了完美的单次预言机路由器(80.8%),因为两次独立尝试胜过一次完美选择。无论哪个模型先行,准确率都一样,但 Pro 先行要便宜得多(3.35 美元 vs 8.44 美元),所以始终用成本更低的模型先行。

这意味着什么

GPT-5.6 Sol 是单模型场景下的首选——当「第一次就答对」和延迟同样重要时:它的 pass@1 最高、可靠性最高、回答最快也最简洁,8 个任务领域里赢下 6 个。为此你得多花 DeepSeek V4 Pro 0813 约 35 倍的成本,还得应付它 20% 的回归率。DeepSeek V4 Pro 0813 则是性价比和多次采样(best-of-k)场景的优选:覆盖面接近旗舰、四次尝试的天花板更高、失败表现也更干净,每次运行只要 0.24 美元。不过这两个模型最有价值的用法,不是单独用哪一个,而是把 Pro 放在 Sol 前面打头阵。先用低成本的第一阶段清掉大部分任务,Sol 的成本就只花在真正需要它的任务——不到 Sol 一半的价格,就能获得超越旗舰的覆盖率。

数据表:DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 完整结果

DeepSWE · 完整结果

常见问题

DeepSeek V4 Pro 0813 比 GPT-5.6 Sol 更强吗?

这取决于你看哪个指标。在 DeepSWE 上,GPT-5.6 Sol 的单次尝试质量更高(pass@1 为 72.7% 对 62.8%),四轮全对解决的任务更多(61 对 35),而且每次运行都快得多。DeepSeek V4 Pro 0813 则在 pass@4 上胜出(88.5% 对 85.8%),每次运行成本低 35 倍,因此对于大批量或可容忍重试的智能体任务,它是性价比更强的选择。

DeepSeek V4 Pro 0813 比 GPT-5.6 Sol 便宜多少?

在我们的测试中,DeepSeek V4 Pro 0813 每次运行花费 0.24 美元,而 GPT-5.6 Sol 在最大努力模式下为 8.37 美元,便宜约 35 倍。按每个解决的任务来算,Pro 每 100 美元解决 260 个任务,Sol 每 100 美元解决 9 个,即每美元完成的工作量约为前者的 30 倍。

对于编程任务,DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 哪个更好?

GPT-5.6 Sol 在 Python(74)、Go(79)、TypeScript(66)和 JavaScript(75)上领先,并赢下 8 个任务领域中的 6 个,其中数据建模与序列化以 92% 位居榜首。DeepSeek V4 Pro 0813 则在 Rust(65 对 60)上胜出,并在有状态响应(66 对 64)上略胜一筹。Sol 每次运行也更快;Pro 则在多次尝试中覆盖范围更广。

要不要在 DeepSeek V4 Pro 0813 和 GPT-5.6 Sol 之间做路由?

需要,前提是你能验证结果。先用 DeepSeek V4 Pro 0813 跑一遍,当你的测试套件判定输出不通过时,再升级到 GPT-5.6 Sol。这种方式在 DeepSWE 上能达到 83.0% 的通过率,每个任务成本 3.35 美元。相比之下,单独用 Sol 只有 72.7% 通过率、每个任务成本 8.37 美元;即便是完美的 one-shot 理想路由(每次都能选对模型)也只有 80.8%。两者合在一起,113 个任务里能覆盖 107 个。

DeepSWE 上的 pass@k 是什么?

查看原文