谷歌LiteRT-LM通过Gemma 4多Token预测将本地推理速度提升了最高2.2倍
谷歌LiteRT-LM通过Gemma 4多Token预测将本地推理速度提升了最高2.2倍
谷歌LiteRT-LM框架通过原生支持Gemma 4的多Token预测(MTP)草稿器,将端侧推理速度提升最高2.2倍。该框架基于LiteRT(前TensorFlow Lite)构建,现已扩展支持Swift和JavaScript API,并已在GitHub开源。本文深入解析其加速原理、架构优化及关键性能数据。
概述:LiteRT-LM的新能力
LiteRT-LM 原生支持Gemma 4的多Token预测(Multi-Token Prediction,MTP)草稿器,可将推理速度提升最高 2.2 倍。该框架已经不仅仅局限于 Kotlin 与 C++,还新增了对 Swift 和 JavaScript API 的支持。
LiteRT-LM 在 LiteRT(前身为 TensorFlow Lite)之上构建了一层专门的编排逻辑,专为处理大规模语言模型(LLM)而设计。谷歌表示,它是在 Android、iOS 与 Web 等平台上运行 Gemma 4 的运行时,已经过生产环境的验证和高度优化。
架构与优化:内存、计算与硬件碎片化的应对方案
基于 LiteRT 的底层架构使 LiteRT-LM 能够有效应对内存、计算与硬件碎片化等约束。它结合了先进的量化模式,并利用加速的 XNNPACK 和 MLDrift 内核。在编排层面,采用优化流水线以最小化昂贵的 CPU-GPU 数据传输,支持多 Token 预测并具备先进的会话管理功能。谷歌称这种组合使其成为“针对 Gemma 模型性能最高的运行时环境”。
多Token预测加速原理:推测性解码的深度优化
LiteRT-LM 在 MTP 上采用了推测性解码(speculative decoding),并通过“优化主模型与 MTP 草稿器之间的数据交互”来避免简单实现的常见瓶颈。
具体实现方面,LiteRT-LM 通过在相同硬件 IP(例如 GPU)上同时执行轻量级的 MTP 草稿器与主模型来实现内存的局部化。在本地内存中管理共享的 KV 缓存和激活态,完全消除了跨 IP 同步与数据传输带来的延迟惩罚。一旦草稿器预测出未来的 token,主模型便使用优化内核对其进行评估,从而在验证阶段最大化并行处理。
性能数据:基准测试对比
基于谷歌自身的基准测试,MTP 解码在 Gemma 4 E2B 上快了 1.6 倍,在 Gemma 4 E4B 上快了 2.2 倍。此外,相比 llama.cpp、MLX、Cactus 与 ONNX 等竞争框架,无论是预填充(prefill)还是解码(decode)性能,都提升了 1.8 到 3.7 倍。
会话管理:一等特性
LiteRT-LM 将会话管理视为一等特性。它可以保存并恢复 KV 缓存状态,从而在避免昂贵重算的同时无缝续接长时交互,这既改善了用户体验也提高了效率。
另一个重要支柱是内存效率。通过将按层分布的嵌入向量(per-layer embeddings)保持在外部,并按需动态加载图像与音频编码器,运行时可以尽量保持精简。例如,约 2.58 GB 的 Gemma 4 E2B 模型在 Apple 移动 CPU 上仅占用了约 607 MB。
智能体能力:思考模式与函数调用
系统还强调了 agentic 能力,原生支持 Gemma 4 的“思考模式(Thinking Mode)”、用于结构化输出的约束解码,以及函数调用(function-calling)。这些功能允许运行时暂停执行、返回结构化的工具调用请求,并在随后恢复执行。
多Token预测草稿器的工作机制
随 Gemma 4 一同推出的多Token预测草稿器使用推测性解码并行生成多个 token,然后在单次通过的过程中一起进行验证。该方法减少了 VRAM 与计算单元之间的持续数据移动,同时利用了许多预测“显而易见”这一事实,这类预测通常不需要像其他情况那么多的计算。
开源与社区
LiteRT-LM 已经在GitHub 开源,并包括用于桌面试验的CLI,以及用于在设备上运行的移动示例应用。
关键要点
- LiteRT-LM 通过支持 Gemma 4 的多Token预测草稿器,在端侧推理上实现了最高 2.2 倍的加速。
- 框架基于 LiteRT 构建,针对内存、计算与硬件碎片化进行了深度优化,并新增了 Swift 与 JavaScript API。
- 采用推测性解码,并通过在相同硬件 IP 上同时运行草稿器与主模型来消除数据同步延迟。
- 在 Gemma 4 E4B 上 MTP 解码提升了 2.2 倍,在对比竞争对手时整体性能提升 1.8 至 3.7 倍。
- 原生支持会话管理、约束解码、函数调用等高级特性,兼顾内存效率与智能体能力。
- 已完全开源,提供 CLI 与移动示例应用,便于开发者快速上手。