Kimi K3 开放权重模型:中国最大的 AI 押注的不是算力,而是内存
Kimi K3开源模型:中国最大AI赌的是内存,而非算力
自7月16日发布以来,月之暗面的Kimi K3开源模型几乎完全是靠参数规模刷屏的。2.8万亿参数,让它成了目前市面上最大的开源模型。模型大小通常被粗略归为几个档次,2.8万亿刚好能挤进业界所谓的“3T级”——此前没有任何开源模型达到过这个量级。月之暗面从仅过1T的模型直接跳到2.8T,把DeepSeek的1.6T V4 Pro远远甩在身后。参数数量是K3最引人注目的部分——但它最能说明的问题却与模型如何运行几乎无关。
Source: Kimi
人们自然会认为,月之暗面是想方设法绕过了美国的算力限制。但该公司自己的技术博客透露的信息更具体:K3并非回避限制,而是把问题转移了——在设计几乎每一层都用算力换内存。理解这种交换很重要,因为算力和内存并不是可互换的约束条件,而且对中国实验室来说,它们可获取的难易程度完全不同。
Introducing Kimi K3: Open Frontier Intelligence
2.8 Trillion Parameters, 1 Million Context, Native Multimodal
Kimi Delta Attention enables up to 6.3x faster decoding in million-token contexts
Attention Residuals deliver ~25% higher training efficiency at <2% additional…
pic.twitter.com/eFHEbdxn3P — Kimi.ai (@Kimi_Moonshot) July 16, 2026
为什么Kimi K3开源模型是个内存问题
运行一个大模型,成本由两件事决定:一个是机器生成每个词要算多少量,另一个是模型在运行期间有多少内容必须随时准备好、能瞬间调取。前者是算力,后者是内存。芯片出口管制先是在算力上狠狠卡了中国一把,而月之暗面的设计则反映出持续尝试减少算力消耗的努力。核心手法是一种叫做“混合专家模型”(Mixture-of-Experts)的技术。K3不每生成一个词就跑一遍整个模型,而是把自己拆成896个专门化的小块,每次只调用其中16个(约占总量的1.8%)。这样一来,每个词的计算量急剧下降。