网络安全

Cloudflare推出Bot Preference Sync,将AI机器人偏好与robots.txt同步

Cloudflare宣布推出Bot Preference Sync,该功能会根据网站针对搜索、代理和训练机器人的设置自动更新robots.txt。该功能将向所有客户开放,从免费版到Enterprise版均可使用,同时保留禁用同步的选项。

2026-08-21
1 分钟阅读
12 浏览量
فريق تحرير certi.news
Cloudflare推出Bot Preference Sync,将AI机器人偏好与robots.txt同步

Cloudflare宣布推出Bot Preference Sync功能,可根据网站针对三类人工智能机器人流量的偏好,自动同步robots.txt文件:搜索(Search)、代理(Agent)和训练(Training)。该功能旨在避免网站在公开文件中声明的内容与Cloudflare在边缘执行的规则之间出现不一致,无需单独管理静态文件。

该公司表示,一些网站可能会在robots.txt中设置指令,禁止某个特定爬虫,但实际执行规则并未禁止该爬虫,或者情况恰好相反。这种冲突可能导致某些爬虫忽略已声明的偏好,或试图绕过强制执行的规则。启用Bot Preference Sync后,反映AI机器人配置设置的指令将被添加到现有文件的开头,同时保留此前已有的Disallow指令。

搜索、代理和训练的不同选项

对于搜索机器人和代理机器人,Cloudflare保留了其于2026年7月1日宣布的三个选项:允许;禁止访问展示广告的页面;或禁止访问所有页面。训练类别则包含Disallow选项,用于在robots.txt中写入“不用于训练”的偏好。

该选项允许合作的混合型爬虫继续访问内容,以便在遵守“不用于训练”偏好并提供所需透明度的情况下将其编入搜索索引。这类爬虫使用同一个爬虫进行搜索、训练或其他用途。Cloudflare表示,在这种情况下,合作爬虫在搜索中的展示不会受到影响;而在选择禁止训练时,不提供透明度的爬虫仍会被阻止。

透明度是处理混合型爬虫的条件

Cloudflare将其对同时进行搜索和训练的爬虫的处理,与这些爬虫明确说明自身身份及其使用所收集数据的方式的能力相关联。根据公告,这些爬虫应通过任何机制尊重“不用于训练”的偏好,为网站所有者提供拒绝人工智能生成摘要的选项,并以URL级别提供可用于训练的页面可见性,同时提供说明内容在搜索和训练中使用情况的指标。

这些爬虫还应能够证明,禁止训练不会损害传统搜索结果。Cloudflare会将符合这些标准的机器人列入Cloudflare Radar中的人工智能机器人透明度部分,并提供其是否遵守所要求实践的示例。

可用性和默认设置

据该公司表示,Bot Preference Sync将在2026年8月21日发布的公告后的下一周内向所有客户开放,从免费版到Enterprise版均可使用。对于新客户,该功能将默认启用。对于目前使用旧版托管robots.txt功能的现有客户,Cloudflare将在新功能推出时要求他们检查偏好,并确认迁移到新功能。

对于默认情况下未被归类为发布者的新客户,Cloudflare在注册新域名时不会添加任何阻止或禁止规则;搜索、代理或训练政策仍由客户决定。对于从广告支持页面获得收入的网站,可以选择“我通过该域名中包含广告的页面获得收入”设置,这会使Training默认设置为Disallow,同时继续允许搜索访问内容。

该功能不会读取复杂的单独规则或针对特定公司的例外,因为其设计目标是应用类别级别的政策。因此,拥有精细化政策的网站所有者可以禁用同步,并根据自己的定制规则管理robots.txt。实际上,Bot Preference Sync为网站所有者提供了一个统一控制点,用于协调其向爬虫声明的内容与其对人工智能流量实施的规则;具体适合的决定则取决于网站模式及其在曝光、引荐和禁止将内容用于训练之间的优先级。

新闻来源
Cloudflare Blog
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻