Cloudflare 重构 AI 爬虫管控体系:细分选项、新规拦截,剑指多用途爬虫!
Cloudflare 宣布彻底重构 AI 爬虫管控体系,将过去一键“拦截所有 AI 机器人”的开关拆分为 Search(搜索)、Agent(智能体)、Training(训练)三个独立选项,全部客户(包括免费版)均可分别配置。
Search 爬虫旨在索引内容并在查询时给出答案;Agent 爬虫替用户实时执行任务,像 ChatGPT - User、Gemini 或 Claude 驱动的浏览器操作都属此类;Training 爬虫则是拿数据做训练,数据会“永久嵌入模型的底层架构”。
新默认规则将于 9 月 15 日生效,对于新接入 Cloudflare 的域名,Training 和 Agent 爬虫在展示广告的页面上将默认被拦截,而搜索爬虫不受影响。
对于 Googlebot、Applebot、BingBot 这类既做搜索索引又做 AI 训练的多用途爬虫,将按最严格的规则执行。一旦网站主拦截了 Training,这些巨头爬虫将被拒之门外。Cloudflare 认为广告意味着网站主期望真人看到,机器人不应消耗广告位带宽,更不该拿去训练模型。
Cloudflare 还推出了三个配套动作。一是 BotBase,这是面向企业客户的爬虫可见性数据库,可列出所有已验证机器人的分类、用途,还能搜索、过滤、导出检测 ID 用于自定义安全规则。
二是扩展 Content Signals 规范,新增 `use` 信号,有 `immediate`(交互但不存储)、`reference`(索引、摘要、回链,默认值)、`full`(摘要和复现)三个取值。托管 robots.txt 默认添加 `use = reference`,违反信号的机器人会被吊销 Verified 状态,全量复制内容的机器人不能获得 Verified 认证。
三是实验性的“传递信任”方案,通过 RFC 7239 定义的 `Forwarded` 头,爬虫可携带身份和使用意图穿越中间层。鉴于 Cloudflare 背后站着超 20% 的全球网站,丧失信任状态的威慑力不容小觑。
这一系列动作的逻辑起点是 2025 年 7 月 Cloudflare 推出的“一键拦截 AI 爬虫”按钮,当时认为爬虫和网站主 30 年的默契已破裂。一年后,一刀切拦截被证明太粗糙,此次三段式分类是改进的第二步。
Cloudflare 还预告 2027 年初将披露一个覆盖全网络的新功能,目标是构建一个以信任为基础的网络生态系统,让创造内容的人能决定内容如何被使用。
编辑观点:Cloudflare 重构 AI 爬虫管控体系,细分规则、配套动作及未来规划,有望平衡网站主与爬虫利益,构建信任生态,但实施效果待市场检验。
