开放模型最新进展:Kimi K3实测表现、WAIC讲话、蒸馏争议与生态分化
近期开放模型领域动作频频:Kimi K3在编码任务上接近Claude 3.5 Sonnet,GLM 5.2以极高速度成为开发者新宠;中国领导人在WAIC上公开支持开源,Qwen宣布下一代大模型开放权重。本文梳理了这些动态背后的关键判断——开放与封闭模型的差距并非简单的“落后月份”,实际表现高度依赖具体任务,而中国实验室凭借年轻专注的团队、算力获取渠道拓宽和后训练优化,正在特定领域逼近闭源前沿。
1. 开放模型加速追赶:Kimi K3与GLM 5.2实测
在最新一期播客中,Nathan Lambert与Florian Brand对近期中文开放模型进行了深入测试。Kimi K3的代码质量大约相当于Claude 3.5 Sonnet(54-55级),虽然某些细节不如Codex,但在日常监管运行和实验场景下已经足够可用。不过它有一个明显问题:API因需求超载,实际响应时间远高于GPT系列。
另一款模型GLM 5.2则在速度与可用性上表现突出。在快速清理任务和代理子任务中,它接近Sonnet水平,内部端点速度可达每秒200-300 tokens,这使得它成为许多开发者的首选工作模型。
值得注意的是,开放模型生态正在快速专业化。如今模型发布时,已经有vLLM补丁和合作伙伴提前获取权重,这与一年前形成鲜明对比。但Kimi这类超大规模模型(500B-700B MoE)仍然需要额外时间优化和部署,可能比以往的中型开放模型晚一个月以上才能被广泛使用。
2. WAIC讲话与战略转向:开源成为国家方向
中国国家领导人在世界人工智能大会(WAIC)上发表支持开源的战略讲话,这不仅是政策层面的背书,也标志着开源模式在中国AI发展中的核心地位得到确认。与此同时,阿里巴巴旗下Qwen宣布下一代大模型将开放权重,进一步扩大了开放模型生态。这一系列动作背后,是中美地缘政治下开放与封闭模型的经济学博弈,以及AI前沿安全问题的持续争议。
3. 关键判断:差距并非简单的“落后月份”
3.1 “落后月份数”叙事过于简化
开放模型与封闭前沿模型在基准测试上的所谓“落后月份数”,其实是一种过度简化的说法。实际差距高度依赖具体任务——在编程、计算机使用等场景下,表现与闭源模型的接近程度差异很大。不同的评测方倾向于使用不同指标,有时结论甚至相互矛盾。因此,开发者不应仅看一个笼统的排名,而应关注特定任务上的后训练潜力。
3.2 Kimi K3:潜力大但门槛高
Kimi K3作为一个大规模扩展的模型,其原始后训练可能比较粗糙,存在大量性能挖掘空间。但后训练门槛很高——需要单节点B300级硬件——这让它在短期内难以被广泛微调。这意味着虽然模型本身基础不错,但普通开发者想在自己的需求上进行定制化优化并不容易。
3.3 蒸馏技术在追赶中扮演关键角色
中国实验室(如GLM、Qwen、DeepSeek、MiniMax)通过数据、环境优化及快速迭代,已在特定任务上逼近前沿闭源模型(如Opus、GPT),其中蒸馏技术是关键因素。所谓蒸馏,简单说就是让一个小模型“学习”大模型(甚至闭源模型)的输出,从而在小参数规模下获得接近大模型的能力。这一做法引发了“蒸馏是否等于抄袭”的争议(例如Ben Thompson的辩论),但不可否认,它正成为开放模型快速追赶的重要工具。
4. 中国实验室的独特优势
4.1 年轻专注的团队结构
中国开源模型研发团队(如Kimi、GLM、Qwen)往往只有二三百名20多岁的研究员,高度专注于单一模型,极少开展“支线任务”。这种专注力是其能够持续追赶闭源模型的重要优势。相比之下,西方实验室常因组织庞大、多个项目并行而分散精力。
4.2 算力获取渠道拓宽
尽管存在出口管制,但过去6-9个月,中国团队获取算力的渠道显著增加——通过马来西亚等地流通的英伟达芯片,以及华为昇腾等国产芯片的逐步上线,可用算力较上一代模型训练时已有大幅增长。有人提到“规避出口限制”的渠道也在运作。
4.3 资本效率优势
中国实验室在资本效率上可能具有结构性优势:人才训练方式、较低的薪酬水平,以及“追赶而非前沿”的目标导向,使得模型迭代成本显著低于Anthropic等西方实验室。这是开放模型持续缩小与闭源模型差距的关键原因。
4.4 用户规模较轻,算力集中于研发
中国模型厂商的用户规模远小于OpenAI或Anthropic(没有10亿级用户负荷),算力可以更集中地用于研发。同时,外部数据采购正在成为新趋势,有助于开源模型接近闭源模型水平。
4.5 不同厂商的战略分化
- 阿里巴巴的Qwen:小模型在云生态上成功,但大模型表现不如小模型突出。
- DeepSeek:以其闪存版(flash模型)更为成功,V4预览版预计不会带来重大突破。
- 其他团队(Kimi、GLM等):各自在特定领域建立优势。
5. 对开发者的影响与展望
- 开发者现在可以依赖Kimi K3和GLM 5.2等中文开放模型完成大部分编码与代理工作流,无需完全依赖GPT或Claude,但需注意API延迟和部署成熟度因素。
- 开放模型生态的专业化(提前提供权重与推理优化)降低了用户的集成门槛,但大规模模型的基础设施挑战仍会推迟其通用可用性。
- 中文模型的快速迭代与成本优势正在重塑竞争格局。若这一趋势持续,开放与闭源模型的能力差距可能在短期内进一步收窄。
- 从业者应关注中国团队在专注度与算力获取上的迭代速度,尤其是每日更新检查点的快速反馈机制(如DeepSeek)。此外,外部数据采购市场正在成形,可能改变开源模型的数据稀缺瓶颈,为中小开发者和企业提供更多开源选择。
关键要点
- 开放与封闭模型的差距:不是简单的“落后X个月”,而是因任务而异;编码、代理等特定场景下开放模型已接近闭源。
- Kimi K3的现状:代码能力接近Claude 3.5 Sonnet,但API延迟高、后训练硬件门槛高,短期难以大众化微调。
- GLM 5.2的优势:高速(200-300 tokens/秒)且可用性好,成为许多开发者的首选工作模型。
- 蒸馏的双刃剑:帮助中国模型快速追赶,但引发关于能力来源的争议。
- 中国实验室的结构优势:年轻团队、算力获取改善、资本效率高、用户负载轻,使得持续迭代成本更低。
- 开发者行动建议:关注特定任务的后训练潜力,而非通用基准;警惕API延迟和部署成熟度;可以开始使用中文开放模型替代部分闭源场景。
摘要:中国开源大模型的迭代周期已压缩至1-2个月,MiniMax在许可证上摇摆不定;与此同时,模型蒸馏的效用争议持续升温——业界发现蒸馏在强化学习阶段的作用被高估,而前沿模型的封闭化正在重塑竞争格局。对中国开发者而言,这意味着更多高质量选择,但也需警惕“蒸馏速成”的陷阱。
背景
播客围绕中美开源大模型生态的最新动态展开讨论:Kimi K3、Qwen 3.8等中国模型迭代迅速,美国新兴玩家(如Thinking Machines、Poolside)也开始频繁发布模型。MiniMax在开源许可证上出现摇摆,可能因政策压力重新转向完全开源。同时,模型蒸馏(distillation)的争议愈演愈烈——学界与业界对其实际效果和合规性存在显著分歧。
迭代速度与竞争格局
中国模型:从追赶者到搅局者
中国模型实验室的迭代周期已缩短至1-2个月,接近闭源模型(如GPT、Claude)约6周的更新节奏,说明训练管线已趋于成熟。美国新玩家很快发现,中国模型并非简单的蒸馏或刷榜产物——在内部评测中,这些模型表现优异,追赶难度远超预期。参数量增长也在放缓,2025年不太可能出现5万亿或10万亿参数的模型,最大可能接近3万亿。当前前沿阵营包括Kimi、Zhipu、DeepSeek、Qwen等。
Gemma在采纳率上正追赶Qwen,但Qwen在科研社区的易用性和工具链积累仍占优势,短期内难以被替代。MiniMax面临公开市场压力,其K3模型的开源许可证仍存在不确定性,可能受政策影响而重新完全开源。
美国玩家的突围策略
美国新兴玩家应优先发展可微调的小型模型(如Inkling small preview),抢占自动化任务与垂直场景的市场,而非盲目追求全面领先。从业者应关注可微调、中等规模模型的实际部署价值,专注于特定领域(如代码、自动化)的小模型可能成为差异化机会。美国新玩家在人才和经验上仍有短板,需在这些方面重点突破。
蒸馏真相:被高估的捷径
蒸馏在SFT阶段有用,但非核心
蒸馏在监督微调(SFT)阶段有一定效果,但远非模型能力的主要来源。模型真正的强大能力来自强化学习(RL)阶段,后者需要快速且近算力的评判模型,蒸馏的边际贡献被高估。多个研究团队尝试使用最强闭源模型(如Claude、Gemini)的推理轨迹进行SFT微调,却未能稳定提升开源模型性能。这暗示蒸馏的收益高度依赖于基座模型和中间训练方式,并非简单的“采数据、微调”就能追赶。
RL阶段的蒸馏困境
关于蒸馏的争议:Ben Thompson声称随着强化学习成为主流,蒸馏的影响力反而上升。但实际上,在RL阶段用顶级API模型(如Fable、GPT-5.6)监督数百万次rollout成本极高、速度慢,且未必优于自建奖励模型,因此蒸馏在RL阶段的效用并未被现有研究证实。随着后训练重心从SFT转向大规模RL,仅靠API提取推理令牌不再足以拉近差距,中国实验室需自主研发RL流程才能持续逼近前沿。
中国实验室的双重路径
中国实验室既使用蒸馏数据启动数据引擎,也在自主创新。其在数学、代码等核心领域的爬坡与OpenAI、Anthropic类似,关键在于生成对当前模型足够困难的Prompt和环境本身——这已经是前沿研究,无法靠简单蒸馏实现。
前沿封闭化与政策博弈
模型能力分层
前沿模型在多数任务(如编程)上已足够胜任,但在新数学证明、新药研发等开拓性领域,顶级模型仍不可替代。同时,顶级模型的可及性正持续收紧——Anthropic已建立内部实验室研发药物,不对外共享。模型前沿正日益封闭,而近前沿能力则在快速商品化。
安全与防御的悖论
Hugging Face遭遇黑客攻击时,因闭源前沿模型(GPT、Claude)的护栏限制了防御分析,不得不使用较弱但无限制的开源模型(GLM)。这一案例暴露了闭源前沿对防御方的不利——攻击者可获取更强模型,而防御方被迫使用能力较弱的模型。若美国企业无法使用中国顶尖开源模型,将在网络安全等防御领域陷入劣势,长期将加剧安全风险。
政策动向:酝酿中的“影子禁令”
美国政策圈正在酝酿通过“影子禁令”限制中国开源权重模型在美使用,但这一动向源于对中国模型“窃取IP”或“安全威胁”的恐惧渲染,缺乏明确法律路径。开发者应留意潜在的政策风险,但不必过度恐慌。