Meta Muse Glimmer:让本地 AI 智能体跑在消费级 GPU 上
Meta 以 Apache 2.0 协议开源了 300 亿参数的 Muse Glimmer 模型,主打本地 AI 智能体场景。它在多个智能体基准上领先于同级别的 Gemma 和 Qwen 模型,但在编码和多模态任务上各有胜负。对开发者而言,这意味着无需依赖云端 API,就能在自有 GPU 上运行私人数据相关的智能体应用。
Meta 近日宣布以 Apache 2.0 许可证发布 Muse Glimmer,这是一款专为消费级 GPU 设计的本地 AI 智能体模型。其 Superintelligence Labs 团队已在 Hugging Face 上开放了 300 亿参数版本的权重。Meta 表示,开发者可以拿它来做本地编码、函数调用、本地智能体应用,以及用大语言模型当裁判的自动化评估。
这次发布的背景是 AI 团队普遍遇到的一个现实问题:云托管模型必须依赖网络连接和集中式基础设施。Meta 想把 Muse Glimmer 定位成需要设备端处理的场景,比如那些要读日程、看消息、翻文件、接触其他私人数据的个人智能体——这类敏感数据放在本地方案处理,显然更让人放心。
智能体基准:五胜三负
Meta 公布的测试数据显示,在八个通用智能体基准中,Muse Glimmer 有五个领先于 Gemma4-31B 和 Qwen3.6-27B。
具体来看,在 MCP Atlas 上,Muse Glimmer 得 75.5 分,Gemma4-31B 是 54.2,Qwen3.6-27B 是 62.5。DeepSearch QA 的成绩分布也类似:Muse Glimmer 拿 74.6,Gemma4-31B 是 61.7,Qwen3.6-27B 为 71.1。这两个基准主要是测试智能体能否在脚手架框架中工作、完成多轮请求。此外,Muse Glimmer 在 τ²-Banking 上得 23.5,对手分别为 15.1 和 16.7;WildClawBench 上拿 47.6,领先于后两者的 37.6 和 43.2;GAIA2 成绩为 43.3,后两者为 36.4 和 40.0。
剩下的三项基准则更偏向 Qwen3.6-27B。在 GDPval-AA 上,Qwen3.6-27B 拿到 1,141,Muse Glimmer 为 953,Gemma4-31B 只有 811。Qwen3.6-27B 还在 SkillsBench 的 Skills 项以 46.6 领跑,Muse Glimmer 为 44.3。差距最大的是 OSWorld-Verified:Qwen3.6-27B 得 75.6,Muse Glimmer 为 65.9,Gemma4-31B 为 58.5。
不过话说回来,这些测评都是在限定任务下做的。真正的生产环境——比如团队把模型接入自己的文件、日历、消息系统或内部工具——表现如何,还不完全清楚。
编码能力:与 Qwen 互有胜负
在代码生成和软件工程任务上,Muse Glimmer 和 Qwen3.6-27B 的对比更加胶着。
Muse Glimmer 在 SWE-Bench Pro 上拿到 51.2 分,领先于 Gemma4-31B 的 36.9 和 Qwen3.6-27B 的 50.2。SciCode 上三者的成绩几乎贴在一起:Muse Glimmer 得 43.6,Gemma4-31B 为 43.4,Qwen3.6-27B 为 39.8。
另外两项编程评测则反过来由 Qwen3.6-27B 领跑。它在 SWE-Bench Verified 上拿到 77.2,Muse Glimmer 为 76.0;在 TerminalBench 2.1 上,Qwen3.6-27B 得 60.7,Muse Glimmer 为 51.7,Gemma4-31B 为 43.4。
需要提醒的是,本地编程代理要干的活儿远不止生成代码,还要有配套的脚手架(scaffold)——也就是一套框架,用来限定模型可以访问哪些代码仓库、终端、测试环境和命令行工具。Meta 表示 Muse Glimmer 支持 OpenClaw 等代理编排模式,自定义脚手架的具体写法在开发者文档里有说明。想评估这个模型在真实软件工程任务上表现的团队,最好先限定代理可用的命令和仓库范围,再来看任务成功率。
官方材料还提到了针对失败工具调用的重试训练。这意味着模型在工具出错时可能自动重试,但这种行为需要设好重试次数上限,尤其是当工具会修改源代码或触发外部系统时,不加控容易出事。
多模态:Qwen 更占上风
在多模态理解方面,Muse Glimmer 通过专用的感知编码器接收交错的文本和图像输入。Meta 解释说,这样的设计让智能体可以把截图、图表、文档当作对话内容来理解,而不是只能处理纯文本。
从基准数据来看,Muse Glimmer 只在 Charxiv Reasoning 上领先:得 78.8 分,Gemma4-31B 为 77.7,Qwen3.6-27B 为 78.4。其他几项则是 Qwen3.6-27B 稍占优势:ScreenSpot Pro 上 Qwen3.6-27B 以 76.1 居首,Muse Glimmer 为 75.4,Gemma4-31B 为 75.9;OmniDocBench v1.5 上 Qwen3.6-27B 拿 77.8,Muse Glimmer 为 75.8,Gemma4-31B 为 72.5;MMMU Pro 的差距最小——Muse Glimmer 得 74 分,Qwen3.6-27B 为 75 分,Gemma4-31B 为 73 分。
关键要点
- Meta 开源了 300 亿参数的 Muse Glimmer 模型,Apache 2.0 协议,可在消费级 GPU 上本地运行,适合处理私人数据相关的智能体应用。
- 智能体基准上六成领先:八个通用智能体基准中,Muse Glimmer 在五个超过 Gemma4-31B 和 Qwen3.6-27B,尤其是在 MCP Atlas 和 DeepSearch QA 这类多轮任务上优势明显。
- 编码能力与 Qwen 接近:SWE-Bench Pro 领先但优势不大,TerminalBench 和 SWE-Bench Verified 则落后于 Qwen3.6-27B;实际部署效果取决于脚手架设计和工具权限控制。
- 多模态整体落后于 Qwen:仅 Charxiv Reasoning 一项领先,其余多项测试都是 Qwen3.6-27B 更强。
对于做 AI 编程工具或本地 Agent 的开发者来说,Muse Glimmer 是一个值得关注的新选项——它把「带私人数据的智能体」这件事从云端搬到自己的显卡上,降低了数据出境和 API 成本的双重顾虑。下一段落将继续介绍它的上下文长度、硬件需求和技术架构细节。
评测结果:实用场景中各有所长
对于打算让智能体直接操作视觉界面的团队来说,Meta 公布的测试数据颇有参考价值。能读懂截图的模型,意味着它理解屏幕上发生了什么,但本地化部署依然绕不开权限控制、界面布局、文档格式以及外部工具报错等现实问题。
在安全数据方面,Muse Glimmer 报告的攻击成功率低于 Qwen 系列。Meta 还同步公开了两项专门针对智能体的安全评测:CI Memories 与 Siren AgentDojo。
不过需要留意的是,这两个测试各自使用的衡量指标并不相同:
- CI Memories(考察智能体在记忆场景下的安全违规情况):Muse Glimmer 的违规率为 26.4,覆盖率为 64.8;Gemma4-31B 违规率 12.1,覆盖率 53.0;Qwen3.6-27B 违规率 53.4,覆盖率 66.9。
- Siren AgentDojo(考察攻击成功率和整体效用):Muse Glimmer 攻击成功率 28.4,效用分 94.2;Gemma4-31B 为 25.6 和 90.8;Qwen3.6-27B 为 40.3 和 92.7。
通用推理成绩同样能反映智能体的基础能力。在 Meta 的横向对比中,Muse Glimmer 在六项通用能力与推理测试里领跑其中四项:
- IFBench(指令跟随):Muse Glimmer 得分 77.0,Gemma4-31B 为 76.0,Qwen3.6-27B 为 70.8
- AIME 2026(数学推理):Muse Glimmer 得分 94.7,Gemma4-31B 为 89.2,Qwen3.6-27B 为 94.1
- AA-LCR:Muse Glimmer 得分 80.0,领先于 Gemma4-31B 的 68.3 和 Qwen3.6-27B 的 73.3
- Beam 128K(长上下文处理):Muse Glimmer 以 65.1 居首,Qwen3.6-27B 为 63.0,Gemma4-31B 为 58.2
另外两项则由 Gemma4-31B 拔得头筹:GPQA Diamond(科学问答)中 Gemma4-31B 拿到 85.7,Muse Glimmer 为 83.5,Qwen3.6-27B 为 84.2;在 Humanity's Last Exam(Text, No Tools)上,Gemma4-31B 以 23.6 领先,Muse Glimmer 为 22.0。
没有任何一个模型在所有测试中都占据绝对优势。 Meta 的结果更像是在表明:在智能体、编码、视觉、安全和推理这一整套混合评测中,Muse Glimmer 与同量级模型相比咬得很紧,各有千秋。
内存规划:量化与空间精打细算
本地部署的设计很大程度上受制于内存。Meta 表示,全精度(即未做压缩的原始精度)下的 300 亿参数模型需要占用超过 55 GB 内存。
Muse Glimmer 通过改用约 4 比特权重量化(一种减少模型体积、同时尽量保留精度的压缩手段),把语言模型的体积压缩到 20 GB 以下,省下的空间留给 KV 缓存(即模型推理时保存中间状态、避免重复计算的缓存区域)。此外,模型还需要为感知编码器和投机解码草稿模型预留内存——所谓投机解码,是指用一个轻量草稿模型先快速生成候选内容,再由主模型做并行验证。
Meta 的目标是把这些组件整体控制在 24 GB 或 32 GB 的内存范围内。该公司称,基于 DFlash 的草稿模型会成块地产出 token(即文本生成的最小单元),交给主模型一次性并行验证。相比传统逐 token 生成的方式,这能明显加快生成速度,同时保证输出质量与标准流程完全一致。
实测与发布:等待生态工具就位
Meta 并未公布每秒生成的 token 数、提示词大小、功耗数据或并发测试结果。它在 MacBook M4 Max、MacBook M5 Max 和 RTX 5090 上测试了 K-Quant-17GB 版本,并搭配量化后的 DFlash 草稿模型。Meta 表示,实际体验足以支撑流畅的对话和实时的智能体交互。
目前,公开权重已经上架 Hugging Face,Meta 同时表示,llama.cpp、MLX 和 ExecuTorch 的集成支持会在未来几天内陆续落地。
另见:阿里测试 Qwen 开源 AI 新商业模式。