Gemini 3.7 Flash 突袭:性能逼近旗舰、价格打“骨折”!!DeepMind新帅重画性价比斩杀线

InfoQ 中文 2026-08-16T01:54:03.882824

谷歌正在以前所未有的速度更新 Gemini。

昨晚 当地时间 8 月 13 日,Google DeepMind 正式发布 Gemini 3.7 Flash。谷歌给它的定义非常直接:“迄今最智能的主力模型(workhorse model)”,重点面向编程和 Agent。

有意思的是,3.7 Flash 的发布时间,距离 Gemini 3.6 Flash 发布,仅仅过去了三周。谷歌自己也在官方博客开头特意强调了这一点:Gemini 3.7 Flash 是在 3.6 Flash 发布仅三周后推出的,背后来自开发者反馈以及一系列算法创新。

更微妙的是,距离 Google DeepMind 完成近年来最剧烈的一次权力重组,也只有八天。

严格来说,Koray 并没有获得 CEO 头衔,而是升任 Google DeepMind 高级副总裁。但从实际权力来看,他已经成为 Google AI 新一代“掌门人”:Gemini 模型研发、Frontier AI 研究、Gemini App 和开发者团队全部归他负责,并直接向 Sundar Pichai 汇报。谷歌随后还向路透确认,Koray 将对 DeepMind 的重大决策拥有最终决定权。

于是,一个很难忽略的时间线出现了:

8 月 5 日,DeepMind 换帅 然后 8 月 13 日,Gemini 3.7 Flash 发布。

如果再把谷歌过去几个月发生的事情串在一起,这次 Flash 更新看起来就不只是一场普通的模型迭代。

三周迭代一次,谷歌开始抢时间

谷歌把 Gemini 3.7 Flash 的重点几乎全部压在了两个关键词上:Coding 和 Agent。

这样的重心并不让人意外,因为过去一年,大模型竞争的重心已经从聊天、知识问答,迅速转向代码生成、工具调用、Computer Use 和长链条 Agent 任务,单次 Benchmark 的胜利不足以让用户为之付费了,但一个模型如果能连续几十步调用工具、修改代码、读文档、访问系统并完成实际任务,还是值得期待的。

Gemini 3.7 Flash 正是在这个方向上强化。

按照谷歌官方数据,在衡量生产级代码质量的 FrontierCode 1.1 Main 中,Gemini 3.7 Flash 得分达到 43.6%,相比 Gemini 3.6 Flash 的 34.4% 明显提升。

在考察长周期软件工程任务的 DeepSWE v1.1 中,成绩则从 3.6 Flash 的约 49% 提升到 65.3%。

Web 开发同样是这次升级的重点。

谷歌称,3.7 Flash 可以用更少的 Prompt 生成更加完整、功能可用的 Web 应用,对截图、图片以及完整 Design System 的还原能力也有所提升。

在 WebDev Arena 上,其 Elo 分数从 3.6 Flash 的 1538 提升到 1588。

从简单的文本提示到完全可玩的 3D 游戏,使用了 Gemini 3.7 Flash 和 Nano Banana 来实时动态生成角色、物品和纹理。

从静态 PDF 到交互式数据故事。观看复杂的年度报告如何转化为吸引人的网页体验,其中包含实时图表和汇总分析。

Agent 能力的变化更加明显。

在测试企业真实工作流自动化能力的 AutomationBench 中,3.7 Flash 从 17.0% 提升到 30.4%。

Computer Use 也出现了明显进步。在 OSWorld 2.0 上,3.7 Flash 得到 47.9%,而 3.6 Flash 为 33.8%。

换句话说,3.7 Flash 并不是简单提高数学或者知识问答得分,而是集中攻击谷歌目前最需要补强的区域:代码、工具调用和 Agent 执行。

谷歌甚至在博客中专门强调,3.7 Flash 在遇到执行障碍时会更主动调整策略,在必要时澄清用户意图,并且更加严格地遵循指令。

一次生成即可打造很好的交互式落地页。使用 Gemini 3.7 Flash 来协调子代理,并使用 Gemini Omni 创建流畅的交互式视差组件。

模型会在多步骤规划和工具调用中“投入更多思考”,减少人工监督和重复重试。

这句话背后的目标非常现实:模型不能只停留于“第一次回答得不错”,现在需要它把任务彻底完成。

Flash 开始逼近旗舰模型

如果只看谷歌公布的模型卡,3.7 Flash 的另一个变化也很明显:Flash 与高价旗舰模型之间的性能差距正在缩小。

当然,这并不意味着 Gemini 3.7 Flash 已经全面超过旗舰模型。

例如 DeepSWE v1.1 中,GPT-5.6 Terra 仍然达到 69.6%;Terminal-bench 3.0 中,GPT-5.6 Terra 为 20.8%,明显高于 3.7 Flash 的 14.9%;GDPVal-AA v2 知识工作测试中,3.7 Flash 也落后于几款竞争模型。

但这恰恰说明了谷歌现在对 Flash 的定位:它不需要在所有 Benchmark 上成为绝对第一,转而希望用接近前沿模型的能力,更低的价格和更高的吞吐量,成为真正能够大规模跑 Agent 的模型。

这也是“workhorse model”这个表述真正值得注意的地方。

谷歌也要打 Agent 成本战了

Gemini 3.7 Flash 更猛烈的地方其实是价格。今年年底之前,其介绍期价格为:输入 0.75 美元/100 万 Token,输出 3.75 美元/100 万 Token。按照谷歌的说法,这相当于 Gemini 3.6 Flash 最初价格的一半。

这不是永久的价格,但现阶段谷歌还是想参与到这场成本战中来。

Google DeepMind 模型卡显示,3.7 Flash 的促销价格将在 2026 年 12 月 31 日结束。

从 2027 年 1 月 1 日起,价格将恢复至输入 1.5 美元/百万 Token、输出 7.5 美元/百万 Token。

即便如此,这个定价策略仍然说明,谷歌正在越来越认真地争夺 Agent 的实际工作负载。因为进入 Agent 时代之后,大模型成本结构发生了变化。

一个聊天机器人可能只调用模型一两次,但一个真正工作的 Agent 可能需要规划任务、搜索资料、读十几个文件、调用多个工具、失败后重试,再不断把执行结果送回模型。

Agent 一旦规模化,Token 和工具调用次数会迅速膨胀。

谁能够以最低成本,让一个足够聪明的模型运行几十步甚至几百步,可能才是杀出重围的关键,Flash 正在承担这个角色。

Gemini 3.7 Flash 发布当天,谷歌就将其部署到了 Gemini Spark。

Spark 是谷歌在今年 I/O 上推出的个人 AI Agent,面向 Google AI Pro 和 Ultra 用户,目前覆盖超过 160 个国家和地区。谷歌把它定义为一个可以 24 小时持续运行、在用户控制下代替用户采取行动的个人 Agent。

3.7 Flash 上线之后,Spark 将使用新模型处理 Google Workspace 等工具调用。谷歌给出的场景包括整合多个文件、起草邮件以及更新项目状态文档。

也就是说,Gemini 3.7 Flash 并不是一个只用来刷 Benchmark 的模型。

发布当天,它就进入了谷歌自己的 Agent 产品。与此同时,开发者可以通过 Gemini API、Google AI Studio、Android Studio 和 Google Antigravity 使用 3.7 Flash;企业用户则可以通过 Gemini Enterprise Agent Platform 等产品调用。

但又有一个问题来了,Flash 都已经从 3.6 更新到 3.7 了,Gemini 3.5 Pro 在哪里?

答案是:还没有正式发布。

早在 7 月 21 日发布 Gemini 3.6 Flash 时,谷歌就表示,Gemini 3.5 Pro 正在与合作伙伴测试,会在准备完成之后尽快公开。

当时谷歌甚至已经宣布,Gemini 4 正在进行公司“迄今最雄心勃勃”的预训练。

但直到 3.7 Flash 发布,谷歌依然没有公布 3.5 Pro 的正式发布时间。

路透在 8 月 13 日的报道中也特别指出,这次发布没有提供任何关于旗舰 Pro 模型何时上线的新消息。

这就让 Gemini 3.7 Flash 的突然出现显得更加耐人寻味。因为就在一天前,路透刚刚披露了 Google DeepMind 大重组背后的更多细节。

“内斗”真相浮出水面

如果一定要用“内斗”形容这次谷歌 AI 巨震,它实际上并不是简单的高管私人恩怨,而是几组长期矛盾同时爆发:科研与商业化、伦敦与硅谷、不同 Gemini 技术负责人,以及有限算力到底应该投向哪里。

路透援引多位知情人士称,今年 4 月,在 Anthropic 推进 Claude 新模型时,Google 联合创始人 Sergey Brin 曾在一次数百人规模的内部会议上要求 DeepMind “加快速度”,把更多精力投入 Gemini。

而到了 8 月,Google 原计划推出的新一代旗舰 Gemini 已经推迟约两个月。

知情人士称,内部测试显示,它在代码等关键能力上仍然落后于部分竞争对手。

更麻烦的是组织结构。

路透称,Gemini 项目长期存在多位负责人之间的意见分歧,加上计算资源受限,使一些后来证明非常重要的方向——包括 Coding——没有及时获得足够资源。

与此同时,Google Cloud 与 DeepMind 之间围绕有限 TPU 算力如何分配也存在紧张关系。一些 Google Cloud 高管认为,Koray 接管 DeepMind 后,有望缓解这种资源分配矛盾。

权力也正在从伦敦进一步转向 Mountain View。

Koray 去年已经从伦敦迁往谷歌总部,并成为 Alphabet 首席 AI 架构师。一些伦敦团队负责人随后感受到自己对 Gemini 技术路线的影响力下降。

与 Hassabis 相比,Koray 在 Google 内部也一直被认为更接近产品与商业化体系。他此前就是 DeepMind 与 Google Cloud 之间更加主要的接口。

8 月 5 日重组之后,这种权力迁移被正式固定下来。Hassabis 转向 AGI、科学研究和长期战略,Koray 则直接掌管 Gemini。一些非技术团队也开始从 DeepMind 转入 Google 公司体系。

在 X 上,有网友很贴切地将 DeepMind 这种独立性描述为一种和平时代的“特权”,只要市场出现一些风吹草动,这种“特权”岌岌可危。他写道:

“DeepMind 能保持独立,说到底只是太平日子里的"特权"罢了。Alphabet 一慌,2014 年的协议直接作废,布林亲自下场开全员会。”

过去由大量明星研究者共同推动的 Gemini,正在变成一个权力更加集中的项目。

Gemini 3.7 Flash,是 Koray 时代的第一声枪响

所以再来看 Gemini 3.7 Flash,就会发现它的意义可能不只是 Benchmark 又涨了几个百分点。

它几乎精准对应了 Google DeepMind 新阶段最关心的问题:更快发布、更强 Coding、更强 Agent、更低成本,以及更直接地进入产品和商业场景。

Pichai 在宣布重组时已经把话说得相当清楚:谷歌必须继续加快速度,在 AI 前沿研究上保持专注。

而 3.7 Flash 距离上一代只有三周,这种速度上的追赶是重组后的 DeepMind 最直观的变化之一。

Hassabis 时代最重要的标签是 AlphaGo、AlphaFold、科学突破和 AGI。

到了 Koray 手里,Google DeepMind 面临的问题则更加现实:Gemini 能不能更快迭代?能不能把 Coding 抢回来?能不能真正跑进 Agent?以及,能不能把 Google 庞大的 TPU、Cloud、Workspace、Android 和 Gemini 用户规模真正组织成一个统一的商业机器?

Gemini 3.7 Flash 还回答不了所有这些问题。

特别是迟迟没有正式亮相的 Gemini 3.5 Pro,依然是判断谷歌是否真正重回最前沿的一场更关键考试。

但至少从 3.7 Flash 开始,一个信号已经非常明显:换帅之后的 DeepMind,首先选择了提速。

参考链接:

查看原文