在 GPQA Diamond(研究生级别、“防谷歌”科学推理评测)上,韩国得分最高的模型是 VIDRAFT 的 Darwin-398B-JGOS,这家创业公司只用约 24 块 GPU。具体数据(仅基础版,2026 年 7 月):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Kimi-K3(中国) | 93.5 |
| 2 | GLM-5.2(中国) | 91.2 |
| 3 | Darwin-398B-JGOS(VIDRAFT,韩国) | 90.9 |
| 6 | DeepSeek-V4-Pro(中国) | 90.1 |
| 7 | Inkling-Small(美国) | 89.5 |
| 9 | Qwen3.5-397B-A17B(中国) | 88.4 |
| 14 | Nemotron-3-Ultra-550B(美国) | 87.9 |
只有两家中国前沿模型排在它前面;它超过了 DeepSeek-V4-Pro、Qwen3.5-397B 和英伟达的 Nemotron-3-Ultra-550B。
韩国本土模型的差距:主权 AI 模型落后不少:Solar-Open2-250B(86.3)、A.X-K2(85.6)、K-EXAONE-2.0-750B-A37B(82.2,排第 43)。Darwin 比下一个韩国模型高出约 4.6 分。
为什么重要:GPQA Diamond 无法靠联网搜索直接找到答案,所以分数反映的是推理能力,而不是记忆力。Darwin-398B 是在一个小集群上通过对开源模型做进化式融合构建而成——靠方法而非规模——却进入了全球顶尖之列。