隐私与科技政策

Cloudflare 将搜索可见性与内容用于训练人工智能模型分开

Cloudflare 推出名为 Disallow AI Training 的新设置,允许网站所有者禁止将其内容用于训练人工智能模型,同时继续允许遵守透明度规范的机构旗下搜索爬虫访问。该计划涵盖 Apple、Google 和 Microsoft,同时对部分爬虫以及人工智能摘要控制仍存在专门限制。

2026-09-15
2 分钟阅读
3 浏览量
فريق تحرير certi.news
Cloudflare 将搜索可见性与内容用于训练人工智能模型分开

Cloudflare 于 2026 年 9 月 15 日宣布推出名为 Disallow AI Training 的新设置,允许网站所有者拒绝将其内容用于训练人工智能模型,同时不屏蔽能够维持网站可发现性的搜索爬虫。该设置针对的是混合爬虫问题:同一个爬虫同时用于搜索和模型训练,实际上迫使网站所有者要么接受两种用途,要么同时屏蔽两者。

该设置面向所有 Cloudflare 客户,并适用于所有套餐,可在安全设置中按域名进行配置。该公司表示,Apple、Google 和 Microsoft 已承诺或将承诺遵守这一选项,该选项属于名为 Accountable 的框架。该分类授予能够提供人工智能训练及其摘要的拒绝机制、有关所使用页面的透明度,以及确保拒绝不会影响传统搜索结果的保障措施的爬虫运营方。

新设置如何运作?

Bot Preference Sync 会在 robots.txt 文件中发布相应偏好。当选择 Disallow AI Training 时,被归类为 Accountable 的混合爬虫仍可出于搜索目的访问,而其他训练爬虫则会被屏蔽,包括 Amazon、Anthropic、Meta 和 OpenAI 运营的爬虫;这不会影响网站通过这些机构出现在搜索结果中的情况。

Cloudflare 还重新定义了部分现有选项。BlockBlock on pages with ads 现在适用于 Applebot、Bingbot 和 Googlebot 等混合爬虫,这意味着使用这些选项可能会同时屏蔽搜索和训练。Block AI Bots 和 Managed Robots.txt 这两个名称也将被弃用,改用针对搜索、训练和代理的独立控制项,同时将现有客户的设置迁移到新系统。

各家公司之间有什么不同?

Apple 允许网站所有者通过 Applebot-Extended 专用的 robots.txt 规则拒绝训练,目前也支持通过 nosnippet 指令控制人工智能摘要,但尚未提供按 URL 检查页面的工具。Apple 表示,拒绝训练不会影响搜索排名。

Google 支持 Google-Extended 规则,并在网站管理员门户中提供开关,用于将内容排除在生成式搜索结果之外,同时提供搜索结果和人工智能摘要报告。Microsoft 目前则允许通过 NOARCHIVE 标记以及 Bing Webmaster Tools 中的 URL 屏蔽或内容移除工具进行控制,但计划在 2027 年初增加在域名或网站层面通过 robots.txt 设置拒绝训练偏好的支持。在此之前,Cloudflare 的新设置不会自动将该偏好传递给 Bing。

网站所有者在实际操作上会有什么变化?

大多数现有客户无需立即采取行动,因为 Cloudflare 会迁移当前设置,同时保持其实际效果。不过,希望完全屏蔽 Applebot、Bingbot 或 Googlebot,包括其用于搜索的访问时,必须选择 Block,而不是 Disallow AI Training。对于新域名,Cloudflare 将根据网站对广告的依赖程度提供不同的预设设置,因为屏蔽访问或以生成式回答取代访问,可能会影响盈利模式。

certi.news 的编辑解读

这里的实际变化并不只是向 robots.txt 添加一条规则,而是将决策从二元选项转变为更细致的策略,把爬虫身份与访问目的联系起来。这对希望保持搜索可见性、又不愿对模型训练给予全面许可的出版商而言十分重要,但仍不能免除核实每个运营方是否真正遵守已发布偏好的必要性。

人工智能摘要与训练仍是两个不同的问题:摘要可能减少进入网站的访问量,但也可能带来数量更少、购买意图更强的用户。因此,Cloudflare 计划在明年年初之前,通过集中式设置提供对摘要中显示内容数量的更精细控制,而不是让用户分别管理每个运营方的偏好。此外,标准的互操作性(包括 ai-prefs)以及代表人类使用的代理的行为,仍是有待解决的问题。

新闻来源
Cloudflare Blog
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻