最新开放成果(第21期):开放模型大丰收!Gemma 4、DeepSeek V4、Kimi K2.6、MiMo 2.5、GLM-5.1等。关于CAISI的V4评估。

Interconnects 2026-07-13T06:07:07.474164

标题:最新开放成果(#21):开放模型大丰收!Gemma 4、DeepSeek V4、Kimi K2.6、MiMo 2.5、GLM-5.1 及其他。附 CAISI 对 V4 的评估。

原文:

本月异常繁忙,包括 DeepSeek 在内的所有开放前沿实验室都发布了新模型。后者促使人工智能标准与创新中心(CAISI)进行了一次评估,该中心过去曾评估过开放模型及其风险。他们的结论是:开放模型落后于美国前沿水平,且差距随时间不断扩大:在报告中,他们基于项目反应理论(IRT)计算了一个 Elo 评分,该评分常用于比较不同模型,即使这些模型在测试时使用了不同的基准集。对于 V4,CAISI 使用了九项不同的基准:巨大的 Elo 差异源于 DeepSeek V4 在 CTF-Archive-Diamond(仅运行了基准的一个子集,并利用 IRT 对 V4 进行了外推)、PortBench(CAISI 私有基准)和 ARC-AGI-2(评分方法与公开排行榜不同)这三项基准上的糟糕表现。这些基准的差异对整体 Elo 产生了巨大影响,从而可能放大模型能力上的差距。当使用 Epoch AI 的 ECI(同样基于一组不同基准采用 IRT)时,我们看到自 R1 以来,差距大致维持在 3 到 7 个月之间:ECI 中的开放/封闭差距(来自 https://mcnair.center/china/)然而,CAISI 和 ECI 都描绘了不完整的图景,因为两者都使用标准化(且简单)的设置来比较模型能力。更具体地说:编程任务是通过对 bash 的访问以及具有固定 token 预算的 for 循环来评估的,而非使用模型训练时所使用的 Claude Code 或 OpenCode 这样的工具!这些设置导致基准声称当前无法将应用程序移植到另一种语言,而事实上 Bun 已从 Zig 移植到 Rust,涉及 100 万行代码的更改。因此,我们认为,对开放与封闭模型进行前沿比较时,还需要更好地激发所有模型的能力,这意味着要使用偏好的工具以及针对特定模型的提示。本节主要由 Florian 撰写。Interconnects 内部的一个有趣动态是,Florian 更相信开放前沿模型在实际表现上与封闭替代品差距较小。

原文:
Nathan 认为这些基准测试同样不完美,但他认为闭源模型领先更多。我们将在后续内容中继续深入探讨这一问题。

分享我们的精选

这是一个成果丰硕的月份,旗舰版本接连发布。

查看原文