Kimi K2.5:视觉智能体智能
今天我们发布 Kimi K2.5,这是迄今为止最强的开源模型。
Kimi K2.5 在 Kimi K2 的基础上继续预训练,使用了约 15 万亿个视觉与文本混合 token。作为原生多模态模型,K2.5 在编码和视觉能力上都达到了业界领先水平,并引入了自主智能体集群(agent swarm)范式。
面对复杂任务,Kimi K2.5 可以自主调度一个由最多 100 个子智能体组成的集群,通过最多 1500 次工具调用并行执行工作流。相比单智能体方案,执行时间最多缩短 4.5 倍。整个智能体集群由 K2.5 自动创建和编排,无需预先定义任何子智能体或工作流。
Kimi K2.5 目前可通过 Kimi.com、Kimi App、API 和 Kimi Code 使用。Kimi.com 和 Kimi App 现在支持 4 种模式:K2.5 Instant、K2.5 Thinking、K2.5 Agent 和 K2.5 Agent Swarm(Beta)。Agent Swarm 目前正在 Kimi.com 上测试,高阶付费用户可免费获得额度。

在 HLE、BrowseComp 和 SWE-Verified 三项智能体基准测试中,Kimi K2.5 以极低的成本实现了强劲的表现。
1. 视觉编码
Kimi K2.5 是迄今为止最强的开源编码模型,在前端开发方面尤为突出。
K2.5 可以把简单的对话变成完整的前端界面,实现交互式布局和丰富动画,比如滚动触发效果。以下是 K2.5 配合图像生成工具、根据单条提示词生成的示例:
除了文本提示,K2.5 还擅长视觉编码。通过对图像和视频进行推理,K2.5 提升了图像/视频转代码的生成能力和视觉调试能力,降低了用户用视觉方式表达意图的门槛。
以下是 K2.5 根据视频重建网站的示例:
这种能力源于大规模视觉-文本联合预训练。当规模足够大时,视觉和文本能力之间不再是此消彼长的关系——它们会同步提升。
以下是 K2.5 推理一道谜题并用代码标出最短路径的示例:
K2.5 在真实软件工程任务中表现突出。我们使用 Kimi Code Bench 对它进行评估,这是我们的内部编程基准测试,覆盖多种编程语言下的各类端到端任务——从构建到调试、重构、测试和脚本编写。在该基准上,K2.5 相比 K2 在各类任务中均展现出稳定且显著的提升。

想体验 K2.5 的智能体编程能力,K2.5 Agent 提供了一套预配置工具,可以立即上手操作。对于软件工程场景,我们建议将 Kimi K2.5 与我们全新的编程产品 Kimi Code 搭配使用。
Kimi Code 在终端中运行,可以集成到多种 IDE 中,包括 VSCode、Cursor、Zed 等。Kimi Code 已开源,支持图片和视频作为输入。它还能自动发现现有的技能和 MCP,并将其迁移到 Kimi Code 的工作环境中。
下面是一个用 Kimi Code 把马蒂斯《舞蹈》的美学风格转化到 Kimi App 中的例子。这个演示展示了自主视觉调试方面的一项突破。借助视觉输入和文档查询,K2.5 能直观地检查自己的输出并自主迭代。它端到端地生成了一个以艺术为灵感的网页:
2. Agent Swarm
横向扩展,而非单纯纵向增强。我们发布 K2.5 Agent Swarm 作为研究预览版,标志着从单一智能体扩展向自主协调的群体式执行的转变。
K2.5 通过并行智能体强化学习(PARL)训练,学会了自主指挥一个最多包含 100 个子智能体的智能体群体,执行跨越最多 1,500 个协调步骤的并行工作流,无需预定义角色或手工编排流程。
PARL 使用一个可训练编排智能体将任务分解为可并行的子任务,每个子任务由动态实例化的冻结子智能体执行。相比串行的智能体执行方式,并行运行这些子任务能大幅降低端到端延迟。
训练一个可靠的并行编排器并不容易,因为各个子智能体独立运行,回传的反馈往往延迟、稀疏,而且不断变化。一个常见的失败模式叫「序列塌缩」(serial collapse):明明有并行能力,编排器却退化成单智能体执行。为此,PARL 采用分阶段奖励塑形(staged reward shaping),训练早期鼓励并行,之后逐步把重点转向任务完成质量。
奖励的定义如下:
性能奖励 r_perf 衡量给定任务 x 下方案 y 的整体成功度与质量。在此之上再加两个辅助奖励,分别对应并行编排学习中的两个难题。并行奖励 r_parallel 用来缓解序列塌缩——这是一种局部最优,编排器会退化成单智能体执行。通过奖励子智能体的创建,这一项推动模型去探索并发调度的空间。完成奖励 r_finish 则关注分配出去的子任务是否被成功完成,用来防止「虚假并行」。虚假并行是一种钻奖励空子的行为:编排器大量生成子智能体,把并行指标刷得很高,却并没有真正拆分任务。奖励已完成的子任务,能保持方案的可行性,引导策略做出有效、合理的任务拆分。超参数 λ1 和 λ2 在训练过程中逐渐退火到零。
为了进一步逼出并行策略,研究引入了一个计算瓶颈,让串行执行变得不划算。这里不再统计总步数,而是用「关键步骤」(Critical Steps)来衡量性能。这个指标关注延迟,灵感来自并行计算中的关键路径:
CriticalSteps=∑t=1T(Smain(t)+maxiSsub,i(t))\text{CriticalSteps} = \sum_{t=1}^{T} \left( S_{\text{main}}^{(t)} + \max_{i} S_{\text{sub},i}^{(t)} \right)CriticalSteps=∑t=1T(Smain(t)+maxiSsub,i(t))
其中,Smain(t)S_{\text{main}}^{(t)}Smain(t) 表示编排开销,maxiSsub,i(t)\max_{i} S_{\text{sub},i}^{(t)}maxiSsub,i(t) 则反映每个阶段中最慢的子智能体。按这个指标来看,只有当新增子任务能缩短关键路径时,增加子任务数量才有意义。

智能体集群(Agent Swarm)由一个编排器负责,它动态创建专职子智能体(比如 AI 研究员、物理研究员、事实核查员),把复杂任务拆解成可并行的子任务,从而实现高效的分布式执行。

在我们的并行智能体强化学习环境中,奖励随训练推进平稳增长。与此同时,训练期间的并行度也在逐步提高。
K2.5 Agent Swarm 通过并行化和专职化执行,提升了复杂任务的表现。在我们的内部评测里,端到端运行时间最多可缩短 80%,同时还能支撑更复杂、更长时间跨度的任务,具体如下。


在大范围搜索场景中,Agent Swarm 将达成目标性能所需的最少关键步骤减少了 3 到 4.5 倍,目标越高节省越明显——通过并行化,实际耗时最多可缩短 4.5 倍。
以下是展示 K2.5 Agent Swarm 实际运行的代表性轨迹:
3. 办公生产力
Kimi K2.5 把智能体能力带入了真实世界的知识工作。
K2.5 Agent 能够端到端完成高密度、大规模的办公工作。它能对体量大、信息密集的输入进行推理,协调多步骤的工具调用,并直接通过对话交付专家级成果:文档、表格、PDF 和幻灯片。
我们围绕真实的专业任务,设计了两套内部专家生产力基准。AI Office Benchmark 评估端到端的 Office 输出质量,General-Agent Benchmark 则衡量多步骤、生产级工作流与人类专家水平的差距。两套基准中,K2.5 相比 K2 Thinking 分别提升了 59.3% 和 24.3%,说明在真实任务上的端到端表现更强。

K2.5 Agent 支持更复杂的任务,比如在 Word 里添加批注、用数据透视表搭建财务模型、在 PDF 中编写 LaTeX 公式,同时还能扩展到长篇输出,例如一万字的论文或上百页的文档。
过去要花几小时甚至几天的任务,现在几分钟就能完成。下面是一些示例:
4. 结论
基于在视觉编码、Agent 集群和办公生产力上的进展,Kimi K2.5 是开源社区迈向 AGI 的有意义一步,在真实约束条件下展现了处理真实任务的强大能力。未来我们会继续推进 Agent 智能的前沿,重新定义 AI 在知识工作中的边界。
附录
基准测试表
如果想复现 Kimi-K2.5 的官方基准结果,建议使用官方 API。第三方服务商可参考 Kimi Vendor Verifier(KVV)来选择高准确率的服务。详情见:https://www.kimi.com/blog/kimi-vendor-verifier
脚注
-
通用测试细节
-
Kimi K2.5 和 DeepSeek-V3.2 均开启思考模式;Claude Opus 4.5 开启扩展思考模式;GPT-5.2 使用 xhigh 推理强度;Gemini 3 Pro 使用高思考等级。视觉基准测试中,另外报告了 Qwen3-VL-235B-A22B-Thinking 的结果。
-
除特别说明外,Kimi K2.5 的所有实验均采用 temperature = 1.0、top-p = 0.95、上下文长度 256k tokens 的配置。
-
官方未公开成绩的基准测试,我们在与 Kimi K2.5 相同的条件下重新评测,结果用星号(*)标注。
-
由于服务稳定性问题,GPT-5.2 xhigh 未能跑完全部基准测试。未测试的项目标记为“-”。
2. 文本与推理
-
HLE、AIME 2025、HMMT 2025(2 月)、GPQA-Diamond 和 IMO-AnswerBench 的最大输出预算为 96k tokens。
-
AIME 和 HMMT 的成绩取 32 次运行的平均值(avg@32);GPQA-Diamond 取 8 次(avg@8)。
-
HLE 报告的是完整测试集(文本+图像)成绩。Kimi K2.5 在无工具条件下文本得分 31.5、图像得分 21.3;有工具条件下文本 51.8、图像 39.8。DeepSeek-V3.2 的分数对应纯文本子集(标 †)。为防止潜在的数据泄漏,Hugging Face 访问被屏蔽。带工具的 HLE 采用简单的上下文管理策略:一旦上下文超过阈值,仅保留最新一轮的工具消息。
3. 工具增强 / 智能体搜索
-
在“带工具的 HLE”以及所有智能体搜索基准测试中,Kimi K2.5 均配备了搜索、代码解释器和网页浏览工具。
-
除 BrowseComp(K2.5 和 DeepSeek-V3.2 采用 discard-all 策略)外,其余测试不做上下文管理,超出支持上下文长度的任务直接判为失败。
-
测试系统提示词强调深入、主动地使用工具,要求模型仔细推理、善用工具、核验不确定的信息。完整提示词将在技术报告中提供。
-
Seal-0 和 WideSearch 的成绩取四次运行的平均值(avg@4)。
4. 视觉基准测试
-
最大 tokens = 64k,取三次运行的平均值(avg@3)。
-
ZeroBench(带工具)在做多步推理时,每步最多 24k token,最多 30 步。
-
MMMU-Pro 遵循官方协议,保持输入顺序,并把图片放在最前面。
-
GPT-5.2-xhigh 约有 10% 的失败率(重试 3 次仍无输出),这些情况按错误处理;也就是说,它公布的分数很可能低估了真实水平。
-
WorldVQA 是一个用于评估“原子级”视觉世界知识的基准测试。可在这里获取:https://github.com/MoonshotAI/WorldVQA。
-
OmniDocBench 的分数按 (1 − 归一化 Levenshtein 距离) × 100 计算,分数越高代表越准确。
5. 编程任务
-
Terminal-Bench 2.0 的分数使用默认智能体框架(Terminus-2)和提供的 JSON 解析器获得。在我们的实现中,Terminal-Bench 2.0 在非思考模式下评估。这么做是因为我们目前针对思考模式的上下文管理策略与 Terminus-2 不兼容。
-
SWE-Bench 系列评估(包括 verified、multilingual 和 pro)使用内部开发的评估框架。该框架包含一组最小工具——bash 工具、createfile 工具、insert 工具、view 工具、strreplace 工具和 submit 工具——以及为任务定制的系统提示词。最高分在非思考模式下取得。
-
Claude Opus 4.5 在 CyberGym 上的分数是在非思考设置下报告的。
-
所有报告的编程任务分数均为 5 次独立运行的平均值。
6. 长上下文基准
-
AA-LCR:分数为三次运行的平均值(avg@3)。
-
LongBench-V2:提示词完全一致,输入上下文统一标准化为约 128k token。