Cloudflare a annoncé la fonctionnalité Bot Preference Sync, qui synchronise automatiquement le fichier robots.txt avec les préférences du site concernant trois catégories de trafic de robots d’intelligence artificielle : la recherche (Search), les agents (Agent) et l’entraînement (Training). Cette fonctionnalité vise à éviter les contradictions entre ce que le site déclare dans son fichier public et ce que les règles de Cloudflare appliquent à la périphérie, sans nécessiter la gestion séparée d’un fichier statique.
L’entreprise a indiqué que certains sites peuvent placer dans robots.txt une directive empêchant un robot donné d’accéder au site, alors que les règles d’exécution effectives ne l’en empêchent pas, ou inversement. Cette contradiction peut inciter certains robots à ignorer les préférences déclarées ou à tenter de contourner les règles imposées. Lorsque Bot Preference Sync est activée, les directives qui reflètent les paramètres de configuration des robots d’IA sont ajoutées au début du fichier existant, tout en conservant les instructions Disallow déjà présentes.
Des options différentes pour la recherche, les agents et l’entraînement
Pour les robots de recherche et les agents, Cloudflare conserve les trois options annoncées le 1er juillet 2026 : autoriser, bloquer les pages qui affichent des publicités ou bloquer toutes les pages. La catégorie de l’entraînement comprend quant à elle l’option Disallow, qui inscrit dans robots.txt la préférence « ne pas entraîner ».
Cette option permet aux robots hybrides coopératifs, qui utilisent le même robot pour la recherche et l’entraînement ou pour d’autres usages, de continuer à accéder au contenu afin de l’indexer dans les résultats de recherche s’ils respectent la préférence de ne pas entraîner et fournissent le niveau de transparence requis. Cloudflare affirme que la visibilité dans les résultats de recherche des robots coopératifs n’est pas affectée dans ce cas, tandis que les robots qui n’offrent pas cette transparence restent bloqués lorsque l’entraînement est interdit.
La transparence, une condition pour les robots hybrides
Cloudflare conditionne le traitement des robots qui combinent recherche et entraînement à leur capacité à expliquer leur identité et la manière dont ils utilisent les données collectées. Selon l’annonce, ces robots devraient respecter la préférence de ne pas entraîner par quelque mécanisme que ce soit, proposer aux propriétaires de sites une option permettant de refuser les résumés générés par l’intelligence artificielle et fournir une visibilité au niveau des URL sur les pages disponibles pour l’entraînement, ainsi que des indicateurs précisant l’utilisation du contenu pour la recherche et l’entraînement.
Ils devraient également être capables de montrer que l’interdiction de l’entraînement ne nuit pas aux résultats de recherche traditionnels. Cloudflare répertorie les robots qui remplissent ces critères dans la section consacrée à la transparence des robots d’intelligence artificielle de Cloudflare Radar, avec des exemples de respect ou de non-respect des pratiques requises.
Disponibilité et paramètres par défaut
Bot Preference Sync sera disponible pour tous les clients, de l’offre gratuite à Enterprise, au cours de la semaine suivant l’annonce publiée le 21 août 2026, a indiqué l’entreprise. La fonctionnalité sera activée par défaut pour les nouveaux clients. Quant aux clients existants qui utilisent l’ancienne fonctionnalité robots.txt gérée, Cloudflare leur demandera de vérifier leurs préférences et de confirmer la migration vers la nouvelle fonctionnalité lors de son déploiement.
Par défaut, pour les nouveaux clients qui ne sont pas classés comme éditeurs, Cloudflare n’ajoutera aucun blocage ni aucune interdiction lors de l’enregistrement d’un nouveau domaine ; il appartiendra au client de définir la politique concernant la recherche, les agents ou l’entraînement. Pour les sites qui tirent des revenus de pages financées par la publicité, il est possible de sélectionner le paramètre « Je tire des revenus des pages contenant des publicités sur ce domaine », ce qui configure par défaut Training sur Disallow tout en maintenant le contenu accessible pour la recherche.
La fonctionnalité ne lit pas les règles individuelles complexes ni les exceptions propres à certaines entreprises, car elle est conçue pour appliquer des politiques au niveau des catégories. Les propriétaires qui ont besoin de politiques précises peuvent donc désactiver la synchronisation et gérer robots.txt conformément à leurs règles personnalisées. En pratique, Bot Preference Sync offre aux propriétaires de sites un point de contrôle unique pour harmoniser ce qu’ils déclarent aux robots et ce qu’ils imposent au trafic d’intelligence artificielle, le choix approprié variant selon le modèle du site et ses priorités entre visibilité, recommandations et interdiction d’utiliser le contenu pour l’entraînement.