Kimi K2.5:视觉智能体智能

Kimi Blog 2026-09-19T18:33:19.240636

今天我们发布 Kimi K2.5,这是迄今为止最强的开源模型。

Kimi K2.5 在 Kimi K2 的基础上继续预训练,使用了约 15 万亿个视觉与文本混合 token。作为原生多模态模型,K2.5 在编码和视觉能力上都达到了业界领先水平,并引入了自主智能体集群(agent swarm)范式。

面对复杂任务,Kimi K2.5 可以自主调度一个由最多 100 个子智能体组成的集群,通过最多 1500 次工具调用并行执行工作流。相比单智能体方案,执行时间最多缩短 4.5 倍。整个智能体集群由 K2.5 自动创建和编排,无需预先定义任何子智能体或工作流。

Kimi K2.5 目前可通过 Kimi.com、Kimi App、API 和 Kimi Code 使用。Kimi.com 和 Kimi App 现在支持 4 种模式:K2.5 Instant、K2.5 Thinking、K2.5 Agent 和 K2.5 Agent Swarm(Beta)。Agent Swarm 目前正在 Kimi.com 上测试,高阶付费用户可免费获得额度。

在 HLE、BrowseComp 和 SWE-Verified 三项智能体基准测试中,Kimi K2.5 以极低的成本实现了强劲的表现。

1. 视觉编码

Kimi K2.5 是迄今为止最强的开源编码模型,在前端开发方面尤为突出。

K2.5 可以把简单的对话变成完整的前端界面,实现交互式布局和丰富动画,比如滚动触发效果。以下是 K2.5 配合图像生成工具、根据单条提示词生成的示例:

除了文本提示,K2.5 还擅长视觉编码。通过对图像和视频进行推理,K2.5 提升了图像/视频转代码的生成能力和视觉调试能力,降低了用户用视觉方式表达意图的门槛。

以下是 K2.5 根据视频重建网站的示例:

这种能力源于大规模视觉-文本联合预训练。当规模足够大时,视觉和文本能力之间不再是此消彼长的关系——它们会同步提升。

以下是 K2.5 推理一道谜题并用代码标出最短路径的示例:

K2.5 在真实软件工程任务中表现突出。我们使用 Kimi Code Bench 对它进行评估,这是我们的内部编程基准测试,覆盖多种编程语言下的各类端到端任务——从构建到调试、重构、测试和脚本编写。在该基准上,K2.5 相比 K2 在各类任务中均展现出稳定且显著的提升。

想体验 K2.5 的智能体编程能力,K2.5 Agent 提供了一套预配置工具,可以立即上手操作。对于软件工程场景,我们建议将 Kimi K2.5 与我们全新的编程产品 Kimi Code 搭配使用。

Kimi Code 在终端中运行,可以集成到多种 IDE 中,包括 VSCode、Cursor、Zed 等。Kimi Code 已开源,支持图片和视频作为输入。它还能自动发现现有的技能和 MCP,并将其迁移到 Kimi Code 的工作环境中。

下面是一个用 Kimi Code 把马蒂斯《舞蹈》的美学风格转化到 Kimi App 中的例子。这个演示展示了自主视觉调试方面的一项突破。借助视觉输入和文档查询,K2.5 能直观地检查自己的输出并自主迭代。它端到端地生成了一个以艺术为灵感的网页:

2. Agent Swarm

横向扩展,而非单纯纵向增强。我们发布 K2.5 Agent Swarm 作为研究预览版,标志着从单一智能体扩展向自主协调的群体式执行的转变。

K2.5 通过并行智能体强化学习(PARL)训练,学会了自主指挥一个最多包含 100 个子智能体的智能体群体,执行跨越最多 1,500 个协调步骤的并行工作流,无需预定义角色或手工编排流程。

PARL 使用一个可训练编排智能体将任务分解为可并行的子任务,每个子任务由动态实例化的冻结子智能体执行。相比串行的智能体执行方式,并行运行这些子任务能大幅降低端到端延迟。

训练一个可靠的并行编排器并不容易,因为各个子智能体独立运行,回传的反馈往往延迟、稀疏,而且不断变化。一个常见的失败模式叫「序列塌缩」(serial collapse):明明有并行能力,编排器却退化成单智能体执行。为此,PARL 采用分阶段奖励塑形(staged reward shaping),训练早期鼓励并行,之后逐步把重点转向任务完成质量。

奖励的定义如下:

性能奖励 r_perf 衡量给定任务 x 下方案 y 的整体成功度与质量。在此之上再加两个辅助奖励,分别对应并行编排学习中的两个难题。并行奖励 r_parallel 用来缓解序列塌缩——这是一种局部最优,编排器会退化成单智能体执行。通过奖励子智能体的创建,这一项推动模型去探索并发调度的空间。完成奖励 r_finish 则关注分配出去的子任务是否被成功完成,用来防止「虚假并行」。虚假并行是一种钻奖励空子的行为:编排器大量生成子智能体,把并行指标刷得很高,却并没有真正拆分任务。奖励已完成的子任务,能保持方案的可行性,引导策略做出有效、合理的任务拆分。超参数 λ1 和 λ2 在训练过程中逐渐退火到零。

为了进一步逼出并行策略,研究引入了一个计算瓶颈,让串行执行变得不划算。这里不再统计总步数,而是用「关键步骤」(Critical Steps)来衡量性能。这个指标关注延迟,灵感来自并行计算中的关键路径:

CriticalSteps=∑t=1T(Smain(t)+max⁡iSsub,i(t))\text{CriticalSteps} = \sum_{t=1}^{T} \left( S_{\text{main}}^{(t)} + \max_{i} S_{\text{sub},i}^{(t)} \right)CriticalSteps=∑t=1T​(Smain(t)​+maxi​Ssub,i(t)​)

其中,Smain(t)S_{\text{main}}^{(t)}Smain(t)​ 表示编排开销,max⁡iSsub,i(t)\max_{i} S_{\text{sub},i}^{(t)}maxi​Ssub,i(t)​ 则反映每个阶段中最慢的子智能体。按这个指标来看,只有当新增子任务能缩短关键路径时,增加子任务数量才有意义。

Kimi K2.5 Agent Swarm 架构图:编排器动态创建任务并分配给专职子智能体并行执行

智能体集群(Agent Swarm)由一个编排器负责,它动态创建专职子智能体(比如 AI 研究员、物理研究员、事实核查员),把复杂任务拆解成可并行的子任务,从而实现高效的分布式执行。

Kimi K2.5 训练指标:强化学习过程中,训练准确率和平均并行度随 RL flops 稳步上升

在我们的并行智能体强化学习环境中,奖励随训练推进平稳增长。与此同时,训练期间的并行度也在逐步提高。

K2.5 Agent Swarm 通过并行化和专职化执行,提升了复杂任务的表现。在我们的内部评测里,端到端运行时间最多可缩短 80%,同时还能支撑更复杂、更长时间跨度的任务,具体如下。

基准测试对比:Kimi K2.5 Agent Swarm 在 BrowseComp、Wide Search 和内部基准上均优于 Claude Opus 4.5

解决不同复杂度任务所需的执行时间

在大范围搜索场景中,Agent Swarm 将达成目标性能所需的最少关键步骤减少了 3 到 4.5 倍,目标越高节省越明显——通过并行化,实际耗时最多可缩短 4.5 倍。

以下是展示 K2.5 Agent Swarm 实际运行的代表性轨迹:

3. 办公生产力

Kimi K2.5 把智能体能力带入了真实世界的知识工作。

K2.5 Agent 能够端到端完成高密度、大规模的办公工作。它能对体量大、信息密集的输入进行推理,协调多步骤的工具调用,并直接通过对话交付专家级成果:文档、表格、PDF 和幻灯片。

我们围绕真实的专业任务,设计了两套内部专家生产力基准。AI Office Benchmark 评估端到端的 Office 输出质量,General-Agent Benchmark 则衡量多步骤、生产级工作流与人类专家水平的差距。两套基准中,K2.5 相比 K2 Thinking 分别提升了 59.3% 和 24.3%,说明在真实任务上的端到端表现更强。

基准测试结果:Kimi K2.5 相比 K2 Thinking 有明显提升,AI Office Bench 提升 71.2%,General-Agent Bench 提升 39.0%

K2.5 Agent 支持更复杂的任务,比如在 Word 里添加批注、用数据透视表搭建财务模型、在 PDF 中编写 LaTeX 公式,同时还能扩展到长篇输出,例如一万字的论文或上百页的文档。

过去要花几小时甚至几天的任务,现在几分钟就能完成。下面是一些示例:

4. 结论

基于在视觉编码、Agent 集群和办公生产力上的进展,Kimi K2.5 是开源社区迈向 AGI 的有意义一步,在真实约束条件下展现了处理真实任务的强大能力。未来我们会继续推进 Agent 智能的前沿,重新定义 AI 在知识工作中的边界。

附录

基准测试表

如果想复现 Kimi-K2.5 的官方基准结果,建议使用官方 API。第三方服务商可参考 Kimi Vendor Verifier(KVV)来选择高准确率的服务。详情见:https://www.kimi.com/blog/kimi-vendor-verifier

脚注

  1. 通用测试细节

  2. Kimi K2.5 和 DeepSeek-V3.2 均开启思考模式;Claude Opus 4.5 开启扩展思考模式;GPT-5.2 使用 xhigh 推理强度;Gemini 3 Pro 使用高思考等级。视觉基准测试中,另外报告了 Qwen3-VL-235B-A22B-Thinking 的结果。

  3. 除特别说明外,Kimi K2.5 的所有实验均采用 temperature = 1.0、top-p = 0.95、上下文长度 256k tokens 的配置。

  4. 官方未公开成绩的基准测试,我们在与 Kimi K2.5 相同的条件下重新评测,结果用星号(*)标注。

  5. 由于服务稳定性问题,GPT-5.2 xhigh 未能跑完全部基准测试。未测试的项目标记为“-”。

2. 文本与推理

3. 工具增强 / 智能体搜索

4. 视觉基准测试

5. 编程任务

6. 长上下文基准

7. 智能体集群

查看原文