在 GPQA Diamond(研究生级别、“防谷歌”科学推理评测)上,韩国得分最高的模型是 VIDRAFT 的 Darwin-398B-JGOS,这家创业公司只用约 24 块 GPU。具体数据(仅基础版,2026 年 7 月):

Dev.to ML 2026-07-31T11:55:02.273188

排名 模型 分数
1 Kimi-K3(中国) 93.5
2 GLM-5.2(中国) 91.2
3 Darwin-398B-JGOS(VIDRAFT,韩国) 90.9
6 DeepSeek-V4-Pro(中国) 90.1
7 Inkling-Small(美国) 89.5
9 Qwen3.5-397B-A17B(中国) 88.4
14 Nemotron-3-Ultra-550B(美国) 87.9

只有两家中国前沿模型排在它前面;它超过了 DeepSeek-V4-Pro、Qwen3.5-397B 和英伟达的 Nemotron-3-Ultra-550B。

韩国本土模型的差距:主权 AI 模型落后不少:Solar-Open2-250B(86.3)、A.X-K2(85.6)、K-EXAONE-2.0-750B-A37B(82.2,排第 43)。Darwin 比下一个韩国模型高出约 4.6 分。

为什么重要:GPQA Diamond 无法靠联网搜索直接找到答案,所以分数反映的是推理能力,而不是记忆力。Darwin-398B 是在一个小集群上通过对开源模型做进化式融合构建而成——靠方法而非规模——却进入了全球顶尖之列。

查看原文