免费AI Coding模型Agnes-2.5-Flash跻身第一梯队:能力实测与解析
Agnes AI 发布新一代文本模型 Agnes-2.5-Flash,其 Coding 能力进入全球第一梯队,且不限期免费开放。本文通过三项实测任务(Bug 修复、长代码注入、复杂 App 构建)验证其性能,并与前代及 Claude Opus 4.7 等主流模型对比,揭示其对 AI 编程开发者的实际价值。
2026 年下半场,AI Coding 赛道最大的痛点已从“模型不够强”转向“根本用不上”。海外头部 Coding 工具的使用门槛集体抬高,“Claude 被封天才程序员陨落”话题一度冲上热搜。寻找一个长期稳定可用、Coding 能力在线、且价格合理的模型,成为越来越多开发者的刚需。

△ 图源微博热搜
在此背景下,Agnes AI 发布了新一代文本模型 Agnes-2.5-Flash,定位为开发者日常使用的主力模型,并在 Coding 能力上进入全球第一梯队。官方提供了与 Claude Opus 4.7 的同题对比视频(生成《AI生态进化模拟器》),肉眼已难分辨两者差距。
重点在于:Claude 每月最低 20 美元,而 Agnes-2.5-Flash 不限期免费。官方明确表示:“在进一步提升模型性能、生成质量与响应效率的同时,继续坚持免费开放。” 这意味着普通消费者可免费使用,日常与 API 打交道的开发者也可免费调用。
此外,Agnes AI 同步上线了 Agnes Code 桌面端,支持 Codex、Claude Code 等类似工具的使用场景。
Agnes-2.5-Flash 的 Coding 能力升级
根据官方介绍,Agnes-2.5-Flash 围绕 Coding、Agent 和日常开发场景进行了全面优化。相比上一代 Agnes-2.0-Flash,在“代码理解、工程修复、多步骤任务执行,以及复杂推理能力上均有显著提升”。内部评估显示,2.5 Flash 在每一项基准测试上均有进步,其中 SWE Atlas 的提升最为显著。

(左:2.0 版输出,右:2.5 版输出;视频地址:https://mp.weixin.qq.com/s/5ASyTtnqVxHvxdB1XTdfAg)
右侧 2.5 版输出的赛博朋克雨夜城市,完整实现了建筑、霓虹灯、雨、全息广告牌等核心要素,而 2.0 版仅生成了一片抽象极光。
第一关:手埋 Bug,它能发现并修复吗?
为测试 Bug 修复能力,我们选取了 GitHub 经典开源项目 Clumsy Bird,确认正常后,手动将其重力参数从 0.2 改为 0。

将包含该 Bug 的代码文件输入 Agnes-2.5-Flash,模型能否正确识别并修复?实测结果:模型不仅准确指出了 gravity 参数异常,还给出了正确的修改建议和解释。后续在 Agnes Code 桌面端执行修复后,游戏恢复正常逻辑。
第二关:注入代码,它会破坏原有逻辑吗?
考验模型在复杂工程中注入新功能时的代码完整性。我们将 Agile Copilot(AI 驱动的命令行工具)的代码输入,要求模型为其注入“文件分析”能力——获取文件路径、大小、修改时间等信息。
Agnes-2.5-Flash 生成的代码包含三个函数,分别处理文件统计、格式化输出和路径过滤。我们手动将代码注入后,原有 CLI 功能(如聊天、对话)未受影响,新功能可独立运行并正确返回文件信息。
第三关:仅凭描述,能构建一个完整 App 吗?
最终测试是生成一个完整的「番茄时钟 + ToDo 应用」。前端需包含计时器、任务列表、数据本地存储;后端需包含用户认证和任务持久化。Agnes-2.5-Flash 一次性生成了前后端完整代码,并附带说明如何启动。我们直接运行后,应用界面可用,核心功能全部就绪:计时器可开始/暂停/重置,任务可增删改,数据存储正常。
关键要点
- 免费与性能兼具:Agnes-2.5-Flash 不限期免费开放,Coding 能力进入全球第一梯队,与 Claude Opus 4.7 的可视化生成结果已无明显差距。
- 升级显著:相比 2.0 Flash,2.5 Flash 在代码理解、工程修复、多步骤执行等方面均有明显提升,SWE Atlas 基准进步最大。
- 实测三项任务通过:手埋 Bug 修复、长代码功能注入、完整 App 构建均能正确完成,且不破坏原有逻辑。
- 生态同步:Agnes Code 桌面端已灰度上线,API 预计本周内全面开放,为开发者提供稳定、低成本的 AI Coding 工具选择。
对于 AI 编程领域的开发者而言,Agnes-2.5-Flash 的出现,意味着在预算有限或对稳定性和可用性有高要求时,多了一个值得尝试的选项。
在手动制造的无公开答案 Bug 修复、从零构建完整应用、以及跨文件大规模改造三个典型场景中,Agnes-2.5-Flash 展示出快速定位、高效执行与复杂协调能力。以下为具体测试过程与结果。
第一关:修复一个全网无答案的隐藏 Bug
为了排除模型“背答案”的可能,我手动制造了一个 Bug——该 Bug 在项目的公开 Issue 和 PR 中均无记录。修复前的表现非常诡异:点击后小鸟正常起飞,但之后完全不下来,一直飘在空中。游戏不崩溃,但无法正常游玩。

之后,我将整个项目导入 Agnes Code,仅描述症状(未告知具体修改内容),让 Agnes-2.5-Flash 自行定位并修复问题。
结果:模型仅用时 3 分钟便输出了完整的问题报告。

视频地址:https://mp.weixin.qq.com/s/5ASyTtnqVxHvxdB1XTdfAg
快速浏览报告,逻辑清晰无遗漏。随后让模型直接修改代码。
仅过了 12 秒,修改完成。(原本想趁间隙测试游戏的我,措手不及)
打开游戏验收:小鸟重新正常下落,撞管子会结束游戏,分数正确增长——一切恢复正常。

一个全网无现成答案的手动 Bug,3 分钟定位原因,12 秒完成修复。第一关通过。
第二关:从零构建一个完整应用,能否跑通?
修 Bug 只是日常工作之一。更多时候,开发者需要模型从零开始独立完成一个完整任务:理解需求、规划步骤、选择方案、动手实现、检查结果。
在前面的模型对比测试中,我需要分别跑两个模型并录屏拼接,非常繁琐。于是,我向 Agnes-2.5-Flash 提出了一个需求:做一个 AI 前端竞技场。
用户输入一个 Prompt,将三个 AI 模型各自生成的代码分别粘贴到三个面板中,平台自动运行并并排展示效果。然后从视觉效果、创意表现、代码完整性、指令遵循度、运行稳定性五个维度自动评分,最终输出雷达图对比、总分排行榜和一句话点评。整个工具仅用一个 HTML 文件实现,双击即可打开。
对模型而言,这不是一个简单的页面。它需要同时处理多个模块:代码编辑器负责输入,iframe 沙箱负责隔离运行,评分引擎负责自动评测,图表组件负责结果展示,还要集成自然语言分析逻辑生成点评。
那么 Agnes-2.5-Flash 表现如何?就在我起身去厨房倒水的时间,它已经完成了全部代码。这样的复杂度并没有让模型等待太久,体感速度确实很快。
完成速度测试后,我用一道经典题目检验结果:用代码画一个爱心。
将三个模型的代码分别粘贴进去,上传、运行、渲染、评分——一气呵成。
从 Prompt 输入到三面板并排展示,再到自动评分出图,整个流程顺利跑通。

而且这不仅仅是一个演示。后续我真正用它来对 Agnes-2.5-Flash 与其他顶流模型进行横向对比——用 Agnes 做的工具来评 Agnes 做的代码,这种套娃本身就是对第二关能力最好的注脚。

第三关:跨文件改造,能接住吗?
前两关考察的是模型的单体任务能力:给一个任务,模型交一份作业。但真实开发中,情况远比这复杂。
模型需要读取多个文件的上下文,理解文件间的依赖关系,进行跨文件联动修改,且不能改崩。一个文件改了接口,另一个文件的调用未同步更新,项目就会直接崩溃。这种场景在真实开发中非常普遍。
而这也正是 Agnes AI 的优势所在。Agnes Harness 不只是一个模型,而是一套将模型能力、工具调用和项目理解串联起来的 Agent 系统。 在内部实测中,它已展现出持续领先的态势。
第一关使用的 Clumsy Bird 项目还在手边,这次直接用来测试。打开文件夹,发现该项目并非单一 HTML 文件:js/ 目录下有多个模块负责游戏逻辑,data/ 目录存放资源文件,外加 index.html、style.css 和一堆配置文件,大大小小十几个文件。
在 Agnes Code 桌面端打开整个项目文件夹,然后布置了一个大任务:
这个 Flappy Bird 太孤独了,给它加个双人竞速模式。画面分成上下两半,上面一只红色小鸟用 W 键控制,下面一只蓝色小鸟用方向键上键控制,两边各自有独立的水管和计分。谁先撞管子谁输,另一方自动获胜。再加一个 WINS 计数器记录历史胜负。
任务复杂,这一次运行时间较长(约十几分钟),但最终结果令人满意。