本周亮点:Laguna S 2.1、FLUX 3、Kimi K3 权重、Grok Build、Strix

Dev.to ML 2026-07-26T17:22:59.896665

标题:本周关注:Laguna S 2.1、FLUX 3、Kimi K3 权重、Grok Build、Strix

本周的发布可谓五花八门:有尺寸适合自部署的编程模型,有基于真实生产环境的多模态模型发布,有两个开源 CLI 工具但各有局限,还有一个安全工具在 GitHub 上增长速度快过几乎所有项目。以下是详细解读。

Poolside Laguna S 2.1 —— 开源权重的编程模型,单台 DGX Spark 就能跑

7 月 21 日,Poolside 发布了 Laguna S 2.1。它总参数量 118B,但采用稀疏 MoE(混合专家)架构,每次前向传播只激活 8B 参数,所以实际计算量远小于总参数数暗示的资源需求。权重已在 Hugging Face 上开源,协议为 OpenMDW-1.1,模型可运行于一台 NVIDIA DGX Spark 上。

真正亮眼的是基准成绩:Terminal-Bench 2.1 得分 70.2%,SWE-Bench 多语言版 78.5%,与那些激活参数规模大 5 到 10 倍的模型不相上下。它发布当天就得到了 OpenCode 的支持,意味着你不用自己搭建推理栈就能直接评测。有一个点我特别关注:它宣称支持 100 万 token 的上下文窗口。但多数模型在实际使用中,超过 64k 后性能就会明显下降,而编程智能体这类任务正是受长上下文退化影响最严重的。

FLUX 3 —— Black Forest Labs 同时进入视频、音频和机器人领域

7 月 23 日,Black Forest Labs 发布了 FLUX 3。与只做图像的 FLUX 1 和 2 不同,FLUX 3 使用同一个共享骨干模型来生成视频(自带原生音频)、静态图像以及机器人动作预测——而不是靠多个后处理阶段拼凑出来的。目前视频生成已开放受限的早期访问;图像生成和开源权重的 FLUX 3 Dev 骨干模型虽已公布,但尚未正式发布。

最实在的落地证据来自奥迪:证实一个基于 FLUX 的衍生模型已在真实工厂中用于软体操控任务。这是有名有姓的生产案例,不是跑分演示——在我看来,这种信号比任何排行榜位置都更有价值。

Kimi K3 开源权重 —— 7 月 27 日发布,先看一个关键数字

Moonshot AI 计划于 7 月 27 日开放 Kimi K3 的权重,距离我写这篇文章还有两天。

Notable this week: Laguna S 2.1, FLUX 3, Kimi K3 weights, Grok Build, Strix

该 API 上线已约一周:总参数量 2.8 万亿(稀疏 MoE 架构),采用 MXFP4 量化,支持 1M 上下文窗口。性能宣传足够激进,甚至影响了芯片厂商的股价。但在你动用自己的 vLLM 预算之前,有一组数据值得了解:独立评测发现,该模型在部分任务上的幻觉率高达 51%,而 Moonshot 在其官方基准总结中并未提及这一点。在权重公开前我无法独立验证,但如果你打算用这个模型跑 CI 推理或做面向客户的产品,那么在依赖早期用户的基准图表之前,最好先排查一下这个数字。

Grok Build — Apache 2.0 开源,正式采用前出现过一次信任问题

xAI 于 7 月 15 日以 Apache 2.0 协议发布了 Grok Build。这是一款全屏 Rust 终端工具:可以读写文件、执行 Shell 命令、搜索网页,并通过 MCP 和 Agent Client Protocol 进行扩展。其中 ACP 集成在架构上最有看点——它把相同的 Agent 运行框架嵌入到了编辑器中,而不需要单独 fork 运行时。需要留意的是:7 月 14 日,安全研究人员发现 Grok Build 会把仓库内容上传到 Google Cloud。xAI 承认了这一问题,发布了补丁,并承诺删除已上传的数据。响应速度很快,但如果你打算在私有代码库或涉及知识产权的场景中使用它,这类事件就值得重视。Apache 2.0 意味着你可以在部署前自行审计上传路径。

Strix — 人工智能原生渗透测试工具,39k GitHub Stars

Strix(github.com/usestrix/strix)是一个自动化的 AI 渗透测试工具,运行多 Agent 工作流来完成信息收集、漏洞利用和后渗透阶段,生成概念验证(PoC)漏洞利用代码,而不仅仅是标记问题。本周它新增了约 1 万颗 GitHub Star,总数接近 3.9 万——这是我见过的安全类工具中增长最快的之一。如果你打算把它集成到 CI/CD 流水线中而不是做一次性扫描,那么它的 CI/CD 集成和本地仪表盘功能值得关注——运行时读取磁盘上的文件,默认情况下数据不会离开本机。在用于生产环境之前,我最想问的问题:在实际应用中的误报率是多少?

在专门构建的演示环境中测出的基准结果,通常无法直接套用到带着真实状态的生产代码库上。这是一项正在进行中的为期6个月的实验的一部分,实验同时运行了三个由AI策划的目录网站。本文中的技术论述均为真实可信,文章本身由AI辅助撰写。

查看原文