Cloudflare hat die Funktion Bot Preference Sync zur automatischen Synchronisierung der Datei robots.txt mit den Website-Präferenzen für drei Kategorien des KI-Bot-Datenverkehrs angekündigt: Suche (Search), Agenten (Agent) und Training (Training). Die Funktion soll Widersprüche zwischen den öffentlichen Angaben einer Website in ihrer Datei und den Regeln, die Cloudflare an der Edge durchsetzt, verhindern, ohne dass eine separate statische Datei verwaltet werden muss.
Das Unternehmen erklärte, dass einige Websites in robots.txt eine Anweisung festlegen könnten, die einen bestimmten Crawler blockiert, während die tatsächlichen Durchsetzungsregeln dies nicht tun – oder umgekehrt. Dieser Widerspruch kann dazu führen, dass einige Crawler die angegebenen Präferenzen ignorieren oder versuchen, die auferlegten Regeln zu umgehen. Bei aktiviertem Bot Preference Sync werden die Anweisungen, die die Einstellungen der AI bot configuration widerspiegeln, am Anfang der bestehenden Datei ergänzt, wobei bereits vorhandene Disallow-Anweisungen erhalten bleiben.
Unterschiedliche Optionen für Suche, Agenten und Training
Für Such- und Agenten-Bots behält Cloudflare die drei am 1. Juli 2026 angekündigten Optionen bei: Erlauben, Blockieren auf Seiten, auf denen Anzeigen geschaltet werden, oder Blockieren auf allen Seiten. Die Kategorie Training umfasst dagegen die Option Disallow, um eine Präferenz „kein Training“ in robots.txt festzulegen.
Diese Option ermöglicht es kooperierenden gemischten Crawlern, die denselben Crawler für Suche und Training oder für andere Zwecke verwenden, weiterhin auf Inhalte zuzugreifen, um sie für die Suche zu indexieren, sofern sie die Präferenz gegen Training respektieren und das erforderliche Maß an Transparenz bieten. Cloudflare zufolge wird die Sichtbarkeit in der Suche für kooperierende Crawler in diesem Fall nicht beeinträchtigt, während Crawler, die keine Transparenz bieten, bei Auswahl der Trainingssperre weiterhin blockiert werden.
Transparenz als Voraussetzung für den Umgang mit gemischten Crawlern
Cloudflare macht den Umgang mit Crawlern, die Suche und Training kombinieren, von ihrer Fähigkeit abhängig, ihre Identität und die Nutzung der von ihnen erfassten Daten zu erläutern. Laut der Ankündigung sollten diese Crawler die Präferenz gegen Training über jeden Mechanismus respektieren, Websitebetreibern eine Option zur Ablehnung von KI-generierten Zusammenfassungen bieten und eine Übersicht auf URL-Ebene über die für das Training verfügbaren Seiten bereitstellen; außerdem sollten sie Kennzahlen zur Nutzung der Inhalte für Suche und Training liefern.
Sie sollten zudem nachweisen können, dass die Verhinderung des Trainings die herkömmlichen Suchergebnisse nicht beeinträchtigt. Cloudflare führt Bots, die diese Kriterien erfüllen, im Bereich zur Transparenz von KI-Bots in Cloudflare Radar auf, einschließlich Beispielen dafür, ob die erforderlichen Praktiken eingehalten werden oder nicht.
Verfügbarkeit und Standardeinstellungen
Bot Preference Sync wird laut Angaben des Unternehmens allen Kunden – vom kostenlosen Tarif bis hin zu Enterprise – in der Woche nach der am 21. August 2026 veröffentlichten Ankündigung zur Verfügung stehen. Für neue Kunden wird die Funktion standardmäßig aktiviert sein. Bestehende Kunden, die die alte verwaltete robots.txt-Funktion verwenden, wird Cloudflare auffordern, ihre Präferenzen zu überprüfen und beim Start der neuen Funktion den Wechsel zu bestätigen.
Cloudflare wird bei neuen Kunden, die nicht als Publisher klassifiziert sind, standardmäßig keine Blockierungen oder Sperren hinzufügen, wenn eine neue Domain registriert wird; die Festlegung der Such-, Agenten- oder Trainingsrichtlinie bleibt dem Kunden überlassen. Für Websites, die Einnahmen mit werbefinanzierten Seiten erzielen, kann die Einstellung „Ich erziele Einnahmen mit Seiten, die Anzeigen auf dieser Domain enthalten“ ausgewählt werden. Dadurch wird Training standardmäßig auf Disallow gesetzt, während die Inhalte für die Suche verfügbar bleiben.
Die Funktion liest keine komplexen individuellen Regeln oder speziellen Ausnahmen für bestimmte Unternehmen, da sie für die Anwendung von Richtlinien auf Kategorieebene konzipiert ist. Betreiber mit präzisen Richtlinien können daher die Synchronisierung deaktivieren und robots.txt entsprechend ihren benutzerdefinierten Regeln verwalten. Praktisch bietet Bot Preference Sync Websitebetreibern einen einzigen Kontrollpunkt, um die Angaben, die sie Crawlern gegenüber machen, mit den Regeln für KI-Datenverkehr in Einklang zu bringen. Die geeignete Entscheidung hängt dabei vom Modell und den Prioritäten der jeweiligen Website ab – zwischen Sichtbarkeit, Verweisen und der Verhinderung der Nutzung von Inhalten für das Training.