Cloudflare는 사이트의 robots.txt 파일을 AI 봇 트래픽의 세 가지 범주인 검색(Search), 에이전트(Agent), 학습(Training)에 관한 설정과 자동으로 동기화하는 Bot Preference Sync 기능을 발표했습니다. 이 기능은 별도의 정적 파일을 관리할 필요 없이, 사이트가 공개 파일에서 선언하는 내용과 Cloudflare가 엣지에서 적용하는 규칙 사이의 불일치를 방지하는 것을 목표로 합니다.
회사 측은 일부 사이트가 robots.txt에서 특정 크롤러를 차단하는 지침을 설정했지만 실제 시행 규칙에서는 이를 차단하지 않거나, 그 반대의 경우가 발생할 수 있다고 밝혔습니다. 이러한 불일치로 인해 일부 크롤러가 명시된 선호 설정을 무시하거나 적용된 규칙을 우회하려 할 수 있습니다. Bot Preference Sync를 활성화하면 AI bot configuration 설정을 반영하는 지침이 현재 파일의 시작 부분에 추가되며, 기존에 있던 Disallow 지침은 유지됩니다.
검색, 에이전트 및 학습에 대한 서로 다른 옵션
검색 봇과 에이전트 봇에 대해 Cloudflare는 2026년 7월 1일 발표한 세 가지 옵션인 허용, 광고가 표시되는 페이지에서 차단, 모든 페이지에서 차단을 유지합니다. 학습 범주에는 robots.txt에 ‘학습하지 않음’ 선호를 기록하는 Disallow 옵션이 포함됩니다.
이 옵션을 사용하면 검색과 학습 또는 기타 용도에 동일한 크롤러를 사용하는 협력적 혼합 크롤러가 학습하지 않음 선호를 준수하고 필요한 수준의 투명성을 제공하는 경우 검색 색인 생성을 위해 콘텐츠에 계속 접근할 수 있습니다. Cloudflare는 이 경우 협력적 크롤러의 검색 노출에는 영향이 없으며, 학습 차단을 선택했을 때 투명성을 제공하지 않는 크롤러는 계속 차단된다고 설명합니다.
혼합 크롤러를 처리하기 위한 조건인 투명성
Cloudflare는 검색과 학습을 결합하는 크롤러에 대한 처리를 해당 크롤러가 자신의 신원과 수집한 데이터를 사용하는 방식을 명확히 설명할 수 있는지에 연계합니다. 발표에 따르면 이러한 크롤러는 어떤 방식으로든 학습하지 않음 선호를 존중하고, 사이트 소유자가 AI가 생성한 요약을 거부할 수 있는 옵션을 제공하며, 학습에 이용 가능한 페이지를 URL 수준에서 확인할 수 있도록 해야 합니다. 또한 검색과 학습에서 콘텐츠가 사용되는 방식을 보여주는 지표도 제공해야 합니다.
또한 학습 차단이 기존 검색 결과에 악영향을 미치지 않는다는 점을 보여줄 수 있어야 합니다. Cloudflare는 이러한 기준을 충족하는 로봇을 Cloudflare Radar의 AI 봇 투명성 섹션에 포함하고, 요구되는 관행을 준수하는지 여부에 대한 사례를 제공합니다.
제공 범위 및 기본 설정
회사에 따르면 Bot Preference Sync는 2026년 8월 21일 게시된 발표 이후 다음 주 동안 무료 요금제부터 Enterprise까지 모든 고객에게 제공될 예정입니다. 신규 고객에게는 이 기능이 기본적으로 활성화됩니다. 기존의 레거시 관리형 robots.txt 기능을 사용하는 기존 고객의 경우 Cloudflare는 새 기능이 출시될 때 선호 설정을 검토하고 새 기능으로의 전환을 확인하도록 요청할 예정입니다.
신규 고객 중 게시자로 분류되지 않은 고객에게 Cloudflare는 기본적으로 새 도메인을 등록할 때 어떠한 차단이나 금지도 추가하지 않습니다. 검색, 에이전트 또는 학습 정책을 정하는 것은 계속 고객의 몫입니다. 광고가 지원되는 페이지에서 수익을 창출하는 사이트의 경우 ‘이 도메인에서 광고가 포함된 페이지로 수익을 창출합니다’ 설정을 선택할 수 있으며, 이 경우 검색에는 콘텐츠를 계속 제공하면서 Training은 기본적으로 Disallow로 설정됩니다.
이 기능은 개별적이고 복잡한 규칙이나 특정 회사에 대한 예외를 읽지 않습니다. 범주 수준의 정책을 적용하도록 설계되었기 때문입니다. 따라서 세밀한 정책을 가진 사이트 소유자는 동기화를 비활성화하고 자신들의 맞춤 규칙에 맞게 robots.txt를 관리할 수 있습니다. 실질적으로 Bot Preference Sync는 사이트 소유자가 크롤러에 공개하는 내용과 AI 트래픽에 적용하는 내용을 조정할 수 있는 단일 제어 지점을 제공합니다. 적절한 결정은 노출, 추천 유입 및 콘텐츠의 학습 사용 차단 사이에서 사이트의 모델과 우선순위에 따라 달라집니다.