最新开放成果(第21期):开放模型大丰收!Gemma 4、DeepSeek V4、Kimi K2.6、MiMo 2.5、GLM-5.1等。关于CAISI的V4评估。
标题:最新开放成果(#21):开放模型大丰收!Gemma 4、DeepSeek V4、Kimi K2.6、MiMo 2.5、GLM-5.1 及其他。附 CAISI 对 V4 的评估。
原文:
本月异常繁忙,包括 DeepSeek 在内的所有开放前沿实验室都发布了新模型。后者促使人工智能标准与创新中心(CAISI)进行了一次评估,该中心过去曾评估过开放模型及其风险。他们的结论是:开放模型落后于美国前沿水平,且差距随时间不断扩大:在报告中,他们基于项目反应理论(IRT)计算了一个 Elo 评分,该评分常用于比较不同模型,即使这些模型在测试时使用了不同的基准集。对于 V4,CAISI 使用了九项不同的基准:巨大的 Elo 差异源于 DeepSeek V4 在 CTF-Archive-Diamond(仅运行了基准的一个子集,并利用 IRT 对 V4 进行了外推)、PortBench(CAISI 私有基准)和 ARC-AGI-2(评分方法与公开排行榜不同)这三项基准上的糟糕表现。这些基准的差异对整体 Elo 产生了巨大影响,从而可能放大模型能力上的差距。当使用 Epoch AI 的 ECI(同样基于一组不同基准采用 IRT)时,我们看到自 R1 以来,差距大致维持在 3 到 7 个月之间:ECI 中的开放/封闭差距(来自 https://mcnair.center/china/)然而,CAISI 和 ECI 都描绘了不完整的图景,因为两者都使用标准化(且简单)的设置来比较模型能力。更具体地说:编程任务是通过对 bash 的访问以及具有固定 token 预算的 for 循环来评估的,而非使用模型训练时所使用的 Claude Code 或 OpenCode 这样的工具!这些设置导致基准声称当前无法将应用程序移植到另一种语言,而事实上 Bun 已从 Zig 移植到 Rust,涉及 100 万行代码的更改。因此,我们认为,对开放与封闭模型进行前沿比较时,还需要更好地激发所有模型的能力,这意味着要使用偏好的工具以及针对特定模型的提示。本节主要由 Florian 撰写。Interconnects 内部的一个有趣动态是,Florian 更相信开放前沿模型在实际表现上与封闭替代品差距较小。
原文:
Nathan 认为这些基准测试同样不完美,但他认为闭源模型领先更多。我们将在后续内容中继续深入探讨这一问题。
分享我们的精选
- 小米 MiMo 推出 MiMo-V2.5-Pro:热衷跟踪开放模型的读者都知道,小米研发开放模型已有一段时间;其首秀恰好是一年前。其版本的进步令人瞩目,V2.5 Pro(基于 Apache 2.0 许可发布)在基准测试和实际使用中均与 Kimi K2.6、GLM-5.1 等其他旗舰模型并驾齐驱。
- Google 推出 gemma-4-26B-A4B-it(完整分析见 Interconnects 博客):期待已久的 Gemma 系列更新,提供多种规格:4B、9B 和 31B 密集模型,以及 26B-A4B 的 MoE(混合专家模型)。更重要的是,Gemma 4 中 Google 决定采用 Apache 2.0 作为许可,消除了围绕解读自定义许可的不确定性和法律挑战。
- 月之暗面推出 Kimi-K2.6:Kimi 系列的更新,全面提升了性能,使其再次成为最好的开放模型之一。他们还专注于长程性能,展示了开放模型能够运行数小时以完成任务或优化性能。考虑到大家都在构建类似自动研究(autoresearch)的系统,看到开放模型迎头赶上具有重大意义。
- Poolside 推出 Laguna-XS.2:Poolside AI 发布了其首批公开的编程专注模型,包括开放权重的 XS.2。其规模(33B-A3B)使其在本地使用中颇具吸引力,性能与同尺寸范围内的其他模型相当。随附的博客文章值得一读,对编码评估中奖励篡改(reward hacking)的深入分析也同样精彩。
-
DeepSeek 推出 DeepSeek-V4-Flash:DeepSeek 终于发布了 V3 系列的后续版本,该系列数月来持续更新。它提供两种规格:Pro(1.6T-A49B MoE)和 Flash(284B-13B 模型)。根据他人经验,后者似乎是真正的亮点,其性能相对强劲,而 Pro 相对于其规模似乎表现欠佳。技术报告非常详尽,包括为获得更优更便宜的长上下文性能所做的架构改动。
-
Qwen3.6-35B-A3B by Qwen:Qwen 3.5 系列的一次更新,针对最广泛使用的模型尺寸之一。
- LFM2.5-350M by LiquidAI:在 350M 参数上使用 28T token 进行训练,该模型可能是目前最过度训练的模型。
- Trinity-Large-Thinking by arcee-ai:Trinity 的推理版本,是西方最优秀的开放模型之一。它曾一度登顶 OpenRouter 排行榜,并能驱动如 OpenClaw 等智能体应用。
- GLM-5.1 by zai-org:GLM-5 的更新版本,全面提升了各项得分。本次更新的重点在于长周期任务。
这是一个成果丰硕的月份,旗舰版本接连发布。