Cloudflare anunció la función Bot Preference Sync para sincronizar automáticamente el archivo robots.txt con las preferencias del sitio relacionadas con tres categorías del tráfico de bots de inteligencia artificial: búsqueda (Search), agentes (Agent) y entrenamiento (Training). La función pretende evitar contradicciones entre lo que el sitio declara en su archivo público y lo que imponen las reglas de Cloudflare en el borde, sin necesidad de gestionar un archivo estático por separado.
La empresa afirmó que algunos sitios pueden incluir una directiva que impide el acceso de un rastreador concreto en robots.txt, mientras que las reglas de ejecución reales no lo impiden, o puede ocurrir lo contrario. Este conflicto puede llevar a algunos rastreadores a ignorar las preferencias declaradas o intentar eludir las reglas impuestas. Al activar Bot Preference Sync, las directivas que reflejan la configuración de bots de IA se añaden al principio del archivo existente, manteniendo las instrucciones Disallow ya presentes.
Opciones diferentes para la búsqueda, los agentes y el entrenamiento
Para los bots de búsqueda y agentes, Cloudflare mantiene las tres opciones que anunció el 1 de julio de 2026: permitir, bloquear las páginas que muestran anuncios o bloquear todas las páginas. En cuanto a la categoría de entrenamiento, incluye la opción Disallow para escribir una preferencia de «no entrenar» en robots.txt.
Esta opción permite que los rastreadores mixtos cooperantes, que utilizan el mismo rastreador para la búsqueda y el entrenamiento u otros usos, continúen accediendo al contenido para indexarlo en la búsqueda si respetan la preferencia de no entrenar y proporcionan el nivel de transparencia requerido. Cloudflare afirma que, en este caso, la aparición en las búsquedas para los rastreadores cooperantes no se ve afectada, mientras que los rastreadores que no ofrecen transparencia permanecen bloqueados al seleccionar la opción de impedir el entrenamiento.
La transparencia es un requisito para tratar con rastreadores mixtos
Cloudflare vincula el tratamiento de los rastreadores que combinan búsqueda y entrenamiento con su capacidad para aclarar su identidad y cómo utilizan los datos que recopilan. Según el anuncio, estos rastreadores deben respetar la preferencia de no entrenar mediante cualquier mecanismo, ofrecer a los propietarios de sitios una opción para rechazar los resúmenes generados por la inteligencia artificial y proporcionar visibilidad a nivel de URL sobre las páginas disponibles para el entrenamiento, además de métricas que muestren el uso del contenido en la búsqueda y el entrenamiento.
También deberían poder demostrar que impedir el entrenamiento no perjudica los resultados de búsqueda tradicionales. Cloudflare incluye los bots que cumplen estos criterios en la sección de transparencia de bots de inteligencia artificial de Cloudflare Radar, con ejemplos de cumplimiento o incumplimiento de las prácticas requeridas.
Disponibilidad y configuración predeterminada
Bot Preference Sync estará disponible para todos los clientes, desde el plan gratuito hasta Enterprise, durante la semana siguiente al anuncio publicado el 21 de agosto de 2026, según indicó la empresa. La función estará activada de forma predeterminada para los nuevos clientes. En cuanto a los clientes actuales que utilizan la antigua función de robots.txt administrado, Cloudflare les pedirá que revisen sus preferencias y confirmen la migración a la nueva función cuando se implemente.
En la configuración predeterminada para los nuevos clientes que no estén clasificados como editores, Cloudflare no añadirá bloqueos ni prohibiciones al registrar un nuevo dominio; el cliente seguirá siendo quien determine la política de búsqueda, agentes o entrenamiento. Para los sitios que generan ingresos a partir de páginas con anuncios, se puede seleccionar la configuración «Genero ingresos a partir de páginas que contienen anuncios en este dominio», lo que establece Training en Disallow de forma predeterminada y mantiene el contenido disponible para la búsqueda.
La función no lee reglas individuales complejas ni excepciones específicas de determinadas empresas, porque está diseñada para aplicar políticas a nivel de categoría. Por ello, los propietarios con políticas detalladas pueden desactivar la sincronización y gestionar robots.txt de acuerdo con sus reglas personalizadas. En la práctica, Bot Preference Sync ofrece a los propietarios de sitios un único punto de control para conciliar lo que declaran a los rastreadores con lo que imponen al tráfico de inteligencia artificial, mientras que la decisión adecuada varía según el modelo del sitio y sus prioridades entre visibilidad, referencias y evitar el uso del contenido para el entrenamiento.