Google Gemini 3.6 Flash 发力降低企业智能体的 Token 成本
Google 的 Gemini 3.6 Flash 模型将目标瞄准企业智能体(Agent)的 Token 开销。
谷歌发布了 Gemini 3.6 Flash 和 3.5 Flash-Lite,这两款新模型旨在降低企业AI代理的延迟和 token 成本。在生产环境中运行自主软件代理(agent)的经济账,其实是一个厂商很少明说的固定公式:模型需要能胜任多步骤任务的推理,但每多生成一个 token,都会给每小时可能运行数千次的工作流增加成本和延迟。对于开发后台代理(而非聊天界面)的团队来说,吞吐量是第一位的,参数规模反而排第二。谷歌本周公布的方案,把这个权衡拆分成了三个模型:Gemini 3.6 Flash 用于编码和多模态推理,Gemini 3.5 Flash-Lite 用于高吞吐、低延迟的任务,还有一个受限版本的 Gemini 3.5 Flash Cyber,专门用于漏洞修复。
Gemini 3.6 Flash 背后的数据
谷歌为 3.6 Flash 准备的开发者文档,核心只有一个数字:根据 Artificial Analysis Index 的测量,它的输出 token 比上一代 3.5 Flash 减少了 17%。在特定的合成测试中(包括 Datacurve DeepSWE 基准测试),谷歌报告 token 用量下降高达 65%。定价方面,输入 token 每百万个 1.5 美元,输出 token 每百万个 7.5 美元——这个价格适合持续运行的推理循环,而非按需调用。在 DeepSWE 上,3.6 Flash 的成功率是 49%,而上一代是 37%。在 MLE Bench 上,得分从 49.7% 提升到 63.9%。在谷歌自己的 GDPval-AA v2 测试(旨在衡量真实世界的知识工作,而非单纯的编码难题)中,3.6 Flash 得分 1421,旧模型得分 1349。
Figma、Hebbia 和 Harvey 正在应用该模型
Figma 已将 3.6 Flash 集成到其原型制作基础设施中。据该公司产品工程总监 Matt Colyer 称,这个模型让开发者能更快地完成设计迭代,而且输出质量没有下降。
Google Gemini 3.6 Flash 瞄准企业代理的 Token 成本
法律技术平台 Harvey 和研究工具 Hebbia 将数据通过该模型进行多模态文档处理:摄入原始财务文件、解析文档结构、读取内嵌图表,并生成供审核用的草稿报告。Google 还直接将一个客户端侧的计算机使用工具集成到 Gemini API 和 Gemini Enterprise 平台,省去了以往工程师们为让模型在操作系统上运行而构建的自定义中间软件。该公司报告 OSWorld-Verified 得分为 83.0%,高于此前的 78.4%,并表示针对化学、生物、放射和核能滥用场景的更新防护措施,提高了对抗越狱攻击的能力,同时没有增加对正常请求的拒绝率。
一个面向高容量后台代理的更便宜档位——Gemini 3.5 Flash-Lite,则瞄准不同的任务:以批量方式处理文档和代理搜索,而非追求推理深度。根据 Google 的说法,Artificial Analysis Index 测得该模型每秒输出 350 个 Token,是 3.5 系列中最快的。定价为每百万输入 Token 0.3 美元,每百万输出 Token 2.5 美元,便宜到工程团队可以把简单、高容量的子代理请求路由到最低的思考层级,而把更高的思考层级留给多步骤工作。在 Google 的 GDM-MRCR v2 长上下文测试中,Gemini 3.5 Flash-Lite 成功率达到 72.2%,前代只有 60.1%;其 GDPval-AA v2 分数几乎翻倍,从 642 上升到 1140。该模型与 3.6 Flash 一样,自带原生计算机使用工具。
另外,Google 表示 Gemini 3.5 Pro 仍在合作伙伴测试阶段,正式发布前还需时日,而下一代 Gemini 4 架构的预训练工作已经启动。