Cloudflare用三个类别取代了之前单一的屏蔽AI机器人开关。Search(搜索)涵盖那些索引页面以便稍后回答关于该页面问题的爬虫。Agent(代理)涵盖实时为用户行事的自动化系统,包括ChatGPT的抓取机器人和驱动浏览器的agent。Training(训练)涵盖将内容拉入模型权重的爬虫。

AI News 2026-07-13T12:15:34.989427

这些控制措施已于7月1日对每位客户生效,包括免费套餐用户。从9月15日起,默认设置将发生变化。在显示广告的页面上,Training和Agent将被屏蔽,而Search保持允许。新的默认设置适用于新加入Cloudflare的域名、现有客户建立的新站点以及所有现有的免费套餐用户。任何不希望应用这些默认设置的人都可以在9月15日之前通过安全设置选择退出。

Cloudflare的逻辑是,广告证明该页面是为人类访问而构建的。将读者引导回页面的搜索爬虫是一种引荐。而读取页面并将答案转交给其他人的爬虫则不是。

现在AI agent爬虫会遇到什么

Agentic部署一直基于开放网络保持开放的假设。一个研究agent抓取竞争对手的定价页面。一个监控工具检查供应商的公告。一个客服agent拉取制造商的规格表。这些都不涉及许可,而在此之前,也不需要许可。

Cloudflare 处理着全球很大一部分网络流量,其拦截机制在网络层面运行,而不是作为爬虫可以忽略的 robots.txt 建议。广告支持的页面正是智能体想要的页面,因为那里有新闻、评论、定价和产品报道。企业智能体的失败模式不是诉讼,而是沉默,或基于它仍然能触及的内容拼凑出的答案。

还有一个与 Google 相关的复杂因素。Googlebot 使用单一爬虫同时进行搜索抓取和训练,因此在最严格的规则下,屏蔽训练也会屏蔽 Googlebot。Cloudflare 首席执行官 Matthew Prince 表示,公司希望这些变化能"鼓励混合用途爬虫将搜索从智能体使用和训练中分离出来",这其实是委婉地说,压力本身就是重点。

获取 AI 智能体爬虫的权限

任何运行智能体的人都应该首先确认他们的哪个 Cloudflare 账户会被归类为 Agent 类。分类是基于行为的,而不是你主动选择加入的,因此一个实时浏览的研究智能体,无论其运营者是否将其视为爬虫,都会被纳入。预计会出现覆盖率下降而非完全失败的情况,因为拦截针对的是广告支持的页面,而其他页面仍可访问。解决问题的途径是协商访问权限,而不是重写 user-agent 字符串。

发布者则有另一份待办清单。首先检查你的套餐等级,因为现有的免费套餐用户会在 9 月 15 日自动迁移到新的默认设置——大多数报道都忽略了这一细节。然后决定屏蔽训练是否值得付出代价,因为它会同时屏蔽 Googlebot,并影响你的搜索可见性。

值得关注的机制是金钱。按爬取付费正在转变为按使用付费,Ceramic.ai 会在其内容出现在 AI 搜索结果中时向发布者付费,You.com 则会在智能体访问高质量内容时付费。Cloudflare 表示,超过一半的 AI 爬虫流量用于重复抓取未更改的页面,因此双方都存在值得定价的浪费。

这是内容争夺战的第一轮,提供的答案是一份费率,而不是一堵墙。

查看原文