Cloudflare 推出了BotBase for Operators功能,为机器人运营者提供一种更清晰的方式,将其机器人提交至 BotBase 目录,并在提交后跟踪请求状态。新功能可以显示请求处于审核中、已接受还是已拒绝,并展示拒绝原因或 Cloudflare 对机器人分类所作的任何修改。
此举是在 Cloudflare 在控制面板中推出可搜索的已知机器人目录,以及帮助网站所有者了解爬虫程序如何与其内容互动的工具之后进行的。该公司认为,自动化流量管理不能仅依赖网站所有者的决定,还需要机器人运营者进行自我识别、说明其工作方式,并保持数据准确。
用于提交请求的统一空间
此前,机器人提交表单位于Manage Account → Configurations中,这使流程更多地与账户相关,而不是与机器人生态系统相关。现在,用户可以在 Cloudflare 控制面板中通过Protect & Connect → Application Security → BotBase路径访问 BotBase for Operators。该公司表示,所有客户都可以访问这一功能。
界面分为三个主要部分:
- Bots directory:浏览、搜索和筛选 Cloudflare 跟踪的机器人。
- Submission form:提交将新机器人加入目录的请求。
- Submission history:跟踪账户提交的请求。
请求历史页面显示三种基本状态:收到请求并将其加入审核队列时显示Waiting for review;机器人获批并加入目录后显示Accepted;当请求需要修改时显示Rejected。在最后一种情况下,页面会显示拒绝原因以及重新提交所需的步骤。
修改机器人数据并描述其行为
现在,运营者可以修改已提交的请求,而不必在详细信息发生变化时创建新的条目,例如访问 IP 地址列表的端点发生变化,或从 IP 地址允许列表转而使用Web Bot Auth签名。只要请求仍在等待审核,也可以取消请求。Cloudflare 建议保持这些数据的最新状态,因为数据准确性会影响机器人获得并保持Verified状态;不过,是否允许流量的最终决定权仍属于各个网站所有者。
新的提交表单采用 Cloudflare 于 7 月 1 日推出的行为和内容使用模型,而不是强制运营者选择单一分类。该表单要求确定三个方面:
- 机器人做什么,例如索引页面、代表用户执行操作、收集数据、训练模型或支持搜索引擎优化工具。
- 机器人如何使用所读取的内容,并根据Content Signals模型确定使用级别。
- 运营方是谁:直接管理自身基础设施的直接运营者,或代表其他产品或平台执行请求的中介。
Cloudflare 说明,用于读取页面并生成搜索摘要的机器人,与将页面存储起来训练模型的机器人有所不同。该公司举例称,一条信号可以包含Content-Signal: search=yes, ai-train=no, use=reference,这允许为搜索建立索引并保留引用,但不允许用于人工智能训练。
实际会发生什么变化?
Cloudflare 还重新构建了审核流程,加入自动检查;自 2023 年以来,年度新增请求数量已增加约七倍。系统会检查机器人是否可能重复、用户代理模式是否具有独特性,以及所声明的验证方式是否有效。系统可以获取 IP 地址列表,验证反向域名系统,或检查 Web Bot Auth 签名。如果请求需要人工审核,系统会将其转交团队,并明确检查原因,而不是将其放入一个没有说明的等待队列。
此次更新标志着 BotBase 从一个主要面向网站所有者的目录,转变为一个也涵盖机器人运营者的空间。不过,目前的发布重点仅是可见性;后续计划包括声明并管理条目所有权,以及了解网站如何处理这些条目;而建立运营者与网站所有者之间对话渠道的想法,则是更长期的目标。因此,BotBase 并不会取代各个网站的决定,而是提供更加规范的信息,供这些决定参考。