Cloudflare 推出“禁止 AI 训练”设置:保留搜索收录,拒绝训练抓取
Cloudflare 宣布推出新的 “禁止 AI 训练”(Disallow AI Training) 设置,试图解决网站所有者长期面临的两难:如果允许搜索引擎爬取内容,内容可能同时被用于 AI 训练;如果完全拒绝爬虫,又可能影响搜索可见性。
这一问题的核心在于,一些大型互联网公司使用的是 混合用途爬虫:同一个爬虫既用于搜索索引,也可能用于 AI 训练。过去,网站所有者往往无法只拒绝其中一种用途。
新设置解决什么问题?
“禁止 AI 训练”设置会通过 robots.txt 发布相应偏好,让网站在继续允许搜索索引的同时,表达不允许内容被用于 AI 训练的意愿。
Cloudflare 表示,Apple、Google 和 Microsoft 已经遵守或承诺在明确时间范围内遵守这一设置。
也就是说,对于被 Cloudflare 认定为符合要求的混合用途爬虫,网站可以:
- 继续允许其用于搜索索引;
- 拒绝其将内容用于 AI 训练;
- 避免“一封全封”导致搜索可见性受损。
为什么 robots.txt 本身还不够?
Cloudflare 认为,仅靠 robots.txt 指令无法完整解决问题,原因包括:
- robots.txt 可以表达偏好,但无法确认是谁在抓取;
- 无法判断爬虫抓取的具体目的;
- 无法阻止不遵守规则的爬虫。
Cloudflare 的做法是结合网络层能力:发布网站偏好、识别爬虫身份、分类爬取目的,并阻止不遵守偏好的爬虫。
“Accountable” designation:对爬虫运营方提出要求
Cloudflare 还引入了一个名为 Accountable 的认定,用于标识那些提供控制能力并作出明确承诺的爬虫运营方。
要获得这一认定,爬虫运营方需要满足或承诺满足以下要求:
- 提供网站所有者退出 AI 训练的机制,例如通过 robots.txt 或类似标准;
- 提供退出 AI 摘要的机制,当前可由运营方直接设置,未来计划通过 Cloudflare 统一设置;
- 提供 URL 级别的可见性,让网站所有者了解哪些页面可被用于训练,并提供内容在搜索中出现的相关指标;
- 保证退出 AI 训练不会影响传统搜索结果。
Cloudflare 称,Apple、Google 和 Microsoft 均符合 Accountable 的资格要求,既包括已经可用的能力,也包括仍在开发但有明确时间表的承诺。
三类爬虫行为:搜索、训练、代理
Cloudflare 将机器人行为分为三类,并提供对应控制:
- Search(搜索):用于构建搜索索引;
- Training(训练):用于训练或微调模型;
- Agent(代理):代表用户访问页面,例如聊天检索机器人或浏览器使用代理。
混合用途爬虫的问题在于,它们同时承担搜索和训练任务。新的“禁止 AI 训练”设置主要针对这类场景。
设置选项发生变化
随着新设置上线,Cloudflare 的相关控制项也发生调整。可选项包括:
-
Allow(允许)
默认允许所有爬虫,除非被其他设置或防火墙规则拦截。 -
Disallow AI Training(禁止 AI 训练)
通过 robots.txt 发布不允许训练的偏好。符合 Accountable 要求的混合用途爬虫仍可用于搜索;其他训练爬虫会被阻止。Cloudflare 提到,Amazon、Anthropic、Meta 和 OpenAI 的训练专用爬虫会被阻止,而这不会影响搜索。 -
Block on pages with ads(在含广告页面阻止)
只在检测到页面投放广告时阻止爬虫,包括混合用途爬虫。 -
Block(阻止)
阻止所有相关爬虫,包括混合用途爬虫。这也意味着 Applebot、Bingbot、Googlebot 等无法访问网站,搜索收录也可能受到影响。
Cloudflare 特别强调,如果网站希望拒绝训练但保留搜索,应选择 Disallow AI Training,而不是直接选择 Block。
9 月 15 日起的变化
Cloudflare 表示,自 9 月 15 日起,Bot Management 和 AI Crawl Control 将发生以下变化:
- “Block”和“Block on pages with ads”将适用于混合用途爬虫,包括 Applebot、Bingbot 和 Googlebot;
- 这意味着使用这些阻止选项会同时影响搜索和训练;
- “Block AI Bots”将被更细粒度的 Search、Training、Agent 控制取代;
- Managed Robots.txt 将由 Bot Preference Sync 取代;
- 已启用 Managed Robots.txt 的客户会迁移到新系统;
- “禁止 AI 训练”将成为部分新域名的推荐配置之一。
对于大多数现有用户,Cloudflare 表示无需额外操作,现有设置会自动迁移。
对主要爬虫的影响
Cloudflare 将 Applebot、Bingbot 和 Googlebot 归类为 Accountable。启用“禁止 AI 训练”后,它们仍可用于搜索抓取;如果选择“阻止”,则会被完全拦截,包括搜索用途。
此外,Cloudflare 也将 Amazon、Anthropic、Meta 和 OpenAI 的相关爬虫归入 Accountable 范畴。不过这些公司的搜索与训练爬虫是分开的,因此 Cloudflare 可以只阻止训练爬虫,而不影响搜索。
Applebot
Applebot 支持网站通过 robots.txt 中针对 “Applebot-Extended” 的 Disallow 规则退出训练。
网站也可以通过页面 HTML 中的 nosnippet 指令表达对 AI 摘要的偏好。对于付费墙内容,也可以通过标记方式将其排除在生成式输出之外。
Cloudflare 提到,Applebot 目前尚未提供 URL 级别检查工具,但 Apple 团队已分享正在开发中的方案,目标是在明年提供。Apple 也表示,禁止训练不会影响搜索排名。
Googlebot
Googlebot 支持网站通过 robots.txt 中针对 “Google-Extended” 的 Disallow 规则退出训练。
Google 还在站长工具中提供开关,允许网站将内容排除在生成式搜索结果之外,并提供与搜索结果和 AI 摘要结果相关的指标与报告。
Cloudflare 表示,Google 已分享现有和近期推出的控制能力,并正在开发与 Google-Extended 相关的更多 URL 级透明度工具,预计将在未来数周推出。Google 也表示,禁止 Google-Extended 不会影响网站在 Google 搜索中的收录或排名信号。
仍待发展的部分:AI 摘要控制
Cloudflare 认为,AI 摘要是下一步需要解决的问题。简单地允许或拒绝并不够,因为摘要中包含多少内容同样重要。
Cloudflare 的目标是在明年初,让网站所有者可以通过 Cloudflare 一次性控制内容在 AI 摘要中的使用程度,而不必分别到不同运营方处设置。
对网站运营者的意义
这项更新对依赖搜索流量、广告、订阅或直接访问关系的网站较为重要。它提供了一种更细粒度的选择:
- 不必为了拒绝 AI 训练而牺牲搜索发现;
- 可以区分搜索、训练和代理访问;
- 对混合用途爬虫有更明确的控制路径;
- 对不遵守偏好的训练爬虫进行阻止。
不过,这一机制的实际效果仍取决于爬虫运营方是否遵守相关偏好,以及 Cloudflare 对爬虫身份和用途的识别能力。
