Colibri:在笔记本上跑744B参数的AI模型

Dev.to ML 2026-07-17T21:19:00.400471

Colibri:在笔记本上运行一个744B参数的AI模型。

标题:Colibri:笔记本上运行 744B 参数的大模型

GLM-5.2 是一个拥有 7440 亿参数的前沿 AI 模型。通常需要 H100 GPU、几百 GB 显存,以及比养车还贵的云计算账单。而 Colibri 却能在只有 25GB 内存的笔记本上运行它。秘密就在于:它从不加载整个模型。

什么是 Colibri?

Colibri 是 Z.ai 为 GLM-5.2 模型(一种混合专家模型,MoE)开发的纯 C 语言推理引擎。它从磁盘流式加载模型的专家模块,而不是将它们常驻内存,用磁盘 I/O 换取内存占用。Colibri 的 README 里写道:

“这并不快。但一个 744B 参数的前沿模型,能在比一块 H100 散热片还便宜的机器上正确回答问题。”

工作原理:MoE 架构

GLM-5.2 采用混合专家(Mixture-of-Experts)结构。对于每个 token,只有一小部分「专家」被激活。模型参数分布如下:

核心洞察:每次 token 切换时,实际上只有约 11 GB 的参数发生变化,这 11 GB 就是路由专家;剩下的 34 GB 密集层始终加载着。Colibri 将密集部分放在内存中,按需从 NVMe SSD 流式加载专家。它采用逐层 LRU 缓存,可选的固定热存储(hot-store)存放常用专家,并借助操作系统页缓存作为免费的第二级缓存。

技术规格

指标 数值
模型磁盘占用(int4) ~370 GB
常驻 RAM 9.9 GB
最低 RAM 25 GB
加载时间 ~30 秒
对话期间峰值 RSS ~20 GB(自动上限)
冷启动解码开销 ~11 GB 磁盘读取 / token
MTP 推测(int8 head) 2.2–2.8 tok/次前向

关键特性

32,768 上下文(缩小 57 倍)—— 采用 DeepSeek-V3 风格的 sigmoid 路由器 + 共享专家
原生 MTP 投机解码 —— GLM-5.2 的多令牌预测头可以批量生成候选令牌,再统一验证
语法约束的投机生成 —— 用于强制输出 JSON/NDJSON 格式
整数点积内核 —— Q8_0 风格的 int8 激活,支持 AVX2 maddubs
MLA 权重吸收 —— 解码阶段优化
异步专家预读
量化内核:int8 / 压缩 int4 / 压缩 int2
DSA 稀疏注意力 —— GLM-5.2 的闪电索引器
KV 缓存持久化 —— 对话在引擎重启后仍能保持热状态
路由器前瞻预取(实验性)—— 71.6% 可预测路由

平台 状态 备注
Linux 完整支持,主要平台
macOS 完整支持,可使用 Metal 后端
Windows 11 原生 MinGW-w64,带 _WIN32 兼容层

环境要求:gcc 支持 OpenMP、AVX2,内存 ≥ 16 GB,本地 NVMe 上需约 370 GB 模型空间。

如何使用
快速开始:

cd c

Colibri:在笔记本电脑上运行 744B 参数的 AI 模型

./setup.sh  # 构建并运行自检
COLI_MODEL=/path/to/glm52_i4 ./coli chat

支持 OpenAI 兼容 API:

COLI_MODEL=/nvme/glm52_i4 ./coli serve \
  --host 127.0.0.1 --port 8000 --model-id glm-5.2-colibri

质量评测:

./coli bench  # hellaswag、arc_challenge、mmlu

性能:慢,但正确

这就是取舍之处。Colibri 并不快。性能高度依赖硬盘速度、内存容量和专家缓存(expert caching):

硬件配置 每秒生成 token 数
Apple M5 Max(128 GB 内存,Metal) 1.06–1.83 tok/s
Ryzen AI 9 HX 370(128 GB 内存) 0.37 tok/s
Ryzen 9 9950X(PCIe 5.0 NVMe) 0.28 tok/s

作为对比,云端 H100 推理速度通常在 30–50 tok/s。Colibri 比它慢 10–100 倍。但设置好之后无需任何额外成本,并且完全在本地运行。

为何重要

前沿 AI 模型正变得越来越难以获取。GPT-4、Claude 3.5、GLM-5.2 这些模型都需要调用付费 API、订阅会员以及联网才能使用。你的数据会离开你的机器,对话记录会被记录。Colibri 证明了:借助巧妙工程手段,即使消费级硬件也能运行前沿模型。

你需要:
- 一台内存 ≥25 GB 的笔记本电脑
- 一块读写速度快、约 370 GB 空闲空间的 NVMe 固态硬盘
- 耐心(0.3–2 tok/s 的生成速度)

模型的回答是正确的,质量有保障,代价只是速度。

实际应用场景

实现原理

Colibri 是一个单人项目,由作者(JustVugg)在一台 12 核、25 GB 内存的笔记本电脑上完成。核心思路是利用混合专家模型(Mixture-of-Experts,MoE)的架构特性:

量化(int4)将模型从约 1.5 TB 缩小到磁盘上的约 370 GB。MLA(多头潜在注意力,Multi-head Latent Attention)架构将 KV-cache 压缩了 57 倍。

Colibri:在笔记本电脑上运行 744B 参数的大模型

通过 MTP 头(Multi-Token Prediction,多令牌预测)进行的推测解码,每次前向传递可以生成 2-3 个 token。这些技术本身并不新鲜,但 Colibri 将它们整合到了一个为流式专家(streaming experts)优化的引擎中。

缺失了什么?

Colibri 的目标并不是追求速度。它不支持 LoRA 微调、RLHF 对齐加载,也没有自定义量化方案。它是为了一件事而生的:在最低配置的硬件上,忠实地运行 GLM-5.2。

对于只有廉价 VPS 或老旧笔记本的 B 端开发者来说,这更多是一种理论上的可能性,而非实用工具。你需要 370 GB 的 NVMe 存储空间,以及一颗支持 AVX2 的现代 CPU。但它指明了一个方向:如果不再把整个模型都加载到内存里,前沿模型是可以本地跑的。

本地 AI 的未来

Colibri 是一个概念验证(proof of concept)。它证明了:
- 从磁盘流式加载专家是可行的;
- int4 量化能保留模型质量;
- MLA 注意力压缩(MLA attention compression)是可用的。

下一步就是让它跑得更快:更好的缓存、更智能的预取、针对矩阵乘法的 GPU 加速、多线程加载专家。每一项改进都在让速度逐渐靠近“够用”的门槛,从而真正干活。

不过,即便是 0.3 tok/s 的速度,Colibri 也已经很有意义了——它把 744B 参数的模型跑在一台比单个 H100 GPU 风扇还便宜的机器上。这很了不起。

如何尝试

如果你有对应的硬件,按下面的步骤来:

git clone https://github.com/JustVugg/colibri

获取 GLM-5.2 权重:从 Z.ai 下载(MIT 许可证发布)。

量化为 int4:使用 tools/ 目录下的工具。

运行设置:

cd c && ./setup.sh

聊天:

COLI_MODEL=/path/to/glm52_i4 ./coli chat

你需要有点耐心。第一个 token 会花 30–60 秒,后面的会快一些。但回答是正确的,质量没打折扣。

结论

Colibri 并不适合所有人。它需要 370 GB 的 NVMe 存储、一颗现代 CPU,以及耐心。但它证明了:前沿 AI 模型并不一定需要云基础设施。

一个人写的项目、一台 12 核的笔记本电脑、加上巧妙的工程优化——就能跑起本来要花几万美元 GPU 费才能运行的 744B 模型。这就是本地 AI 的故事。

一只蜂鸟只有几克重,能悬停在空中,每天拜访一千朵花。

Colibri 能让一个 7440 亿参数的巨无霸模型,在蜂鸟式的小资源下存活:只需 25GB 内存、12 个 CPU 核心,以及足够耐心的磁盘空间。源码见 GitHub:JustVugg/colibri。GLM-5.2 权重由 Z.ai 以 MIT 许可证发布,Colibri 引擎则采用 Apache 2.0 许可证。

Colibri:在笔记本上运行 744B 参数的 AI 模型

GLM-5.2 是一个拥有 7440 亿参数的先进 AI 模型。在正常情况下,它需要H100 GPU、数百GB的显存,以及一笔比一辆车还贵的云服务账单。但 Colibri 只需 25GB 内存就能在笔记本上运行它。秘诀是什么?它从不加载整个模型。

Colibri 是什么?

Colibri 是一个纯 C 语言编写的推理引擎,专门为 Z.ai 发布的 MoE(混合专家)模型 GLM-5.2 设计。它的做法是把模型专家(expert)从磁盘流式加载到内存,而不是常驻内存——用磁盘 I/O 换内存占用。

"这并不快。它只有 7 …"

查看原文