Cloudflare a annoncé le 15 septembre 2026 un nouveau paramètre baptisé Disallow AI Training, qui permet aux propriétaires de sites de refuser l’utilisation de leur contenu pour entraîner des modèles d’intelligence artificielle sans bloquer les robots d’exploration des moteurs de recherche capables de maintenir le site découvrable. Ce paramètre vise le problème des robots mixtes qui utilisent le même robot pour la recherche et l’entraînement des modèles, ce qui obligeait concrètement le propriétaire du site à accepter les deux usages ou à les bloquer tous les deux.
Le paramètre est disponible pour tous les clients de Cloudflare, quelle que soit leur offre, et peut être configuré au niveau du domaine depuis les paramètres de sécurité. L’entreprise affirme qu’Apple, Google et Microsoft respectent ou se sont engagés à respecter cette option dans le cadre baptisé Accountable, une classification accordée aux opérateurs de robots qui fournissent des mécanismes de refus de l’entraînement de l’intelligence artificielle et de ses résumés, une transparence sur les pages utilisées et des garanties selon lesquelles le refus n’aura pas d’incidence sur les résultats de recherche traditionnels.
Comment fonctionne le nouveau paramètre ?
Bot Preference Sync publie une préférence appropriée dans le fichier robots.txt. Lorsque l’utilisateur sélectionne Disallow AI Training, les robots mixtes classés Accountable restent autorisés à accéder au site à des fins de recherche, tandis que les autres robots d’entraînement, notamment ceux exploités par Amazon, Anthropic, Meta et OpenAI, sont bloqués, sans incidence sur la visibilité du site dans les recherches effectuées par ces entités.
Cloudflare a également redéfini certaines de ses options existantes. Les options Block et Block on pages with ads s’appliquent désormais aux robots mixtes tels qu’Applebot, Bingbot et Googlebot, ce qui signifie que leur utilisation peut bloquer à la fois la recherche et l’entraînement. Les intitulés Block AI Bots et Managed Robots.txt seront également retirés au profit de contrôles distincts pour la recherche, l’entraînement et les agents, les paramètres des clients actuels étant transférés vers le nouveau système.
Qu’est-ce qui diffère selon les entreprises ?
Apple permet aux propriétaires de sites de refuser l’entraînement au moyen de la règle robots.txt propre à Applebot-Extended. L’entreprise prend également actuellement en charge les préférences relatives aux résumés générés par l’intelligence artificielle via la directive nosnippet, mais ne propose pas encore d’outil permettant d’inspecter les pages au niveau de l’URL. Apple a indiqué que le refus de l’entraînement n’a pas d’incidence sur le classement dans les résultats de recherche.
Google prend en charge la règle Google-Extended et propose une option dans le portail pour les webmasters permettant d’exclure le contenu des résultats de recherche génératifs, ainsi que des rapports sur les résultats de recherche et les résumés générés par l’intelligence artificielle. Microsoft permet actuellement le contrôle au moyen de la balise NOARCHIVE et d’outils de blocage des URL ou de suppression de contenu dans Bing Webmaster Tools, mais prévoit d’ajouter la prise en charge d’une préférence de refus de l’entraînement dans robots.txt au niveau du domaine ou du site au début de l’année 2027. D’ici là, le nouveau paramètre de Cloudflare ne transmet pas automatiquement cette préférence à Bing.
Qu’est-ce qui change concrètement pour les propriétaires de sites ?
La plupart des clients actuels n’auront pas besoin d’agir immédiatement, car Cloudflare transférera les paramètres existants tout en préservant leur effet pratique. Toutefois, ceux qui souhaitent bloquer complètement Applebot, Bingbot ou Googlebot, y compris leur accès à des fins de recherche, devront sélectionner Block plutôt que Disallow AI Training. Pour les nouveaux domaines, Cloudflare proposera des paramètres prédéfinis différents selon la dépendance du site à la publicité, car le blocage des visites ou leur remplacement par une réponse générée peut avoir une incidence sur le modèle de monétisation.
Analyse éditoriale de certi.news
Le changement réel ne consiste pas simplement à ajouter une règle à robots.txt, mais à faire passer la décision d’un choix binaire à une politique plus détaillée reliant l’identité du robot au but de la visite. Cela est important pour les éditeurs qui souhaitent préserver leur visibilité dans les recherches sans accorder une autorisation générale pour l’entraînement des modèles, mais cela ne supprime pas la nécessité de vérifier que chaque opérateur respecte effectivement les préférences publiées.
Les résumés générés par l’intelligence artificielle restent une question distincte de l’entraînement : un résumé peut réduire les visites vers le site, mais il peut aussi orienter un nombre inférieur d’utilisateurs présentant une intention d’achat plus élevée. Cloudflare prévoit donc, d’ici le début de l’année prochaine, de permettre un contrôle plus précis de la quantité de contenu apparaissant dans les résumés grâce à un paramètre centralisé, au lieu de gérer la préférence auprès de chaque opérateur séparément. L’interopérabilité des normes, notamment ai-prefs, ainsi que le comportement des agents utilisés au nom des humains, restent également des questions ouvertes.