Cloudflare가 모든 고객에게 검색, 에이전트, 학습 용도별로 AI 트래픽을 관리할 수 있는 새로운 옵션과 BotBase를 제공합니다.
1년 전, 우리는 첫 콘텐츠 독립 기념일을 선언하고 웹사이트 소유자가 콘텐츠에 대한 통제권을 되찾을 수단을 제공했습니다. 30년간 유지되어 온 크롤러와 웹사이트 소유자 간의 거래, 즉 크롤러가 사이트를 수집하면 사이트는 유입을 얻는다는 거래는 더 이상 성립하지 않았습니다. AI는 모든 것을 가져가면서 아무것도 돌려주지 않았고, 이는 웹사이트 소유자에게 실존적 위협이 되었습니다. 이에 따라 원클릭 "AI 봇 차단" 옵션과 크롤링당 지불 마켓플레이스를 출시했습니다.
1년 사이 많은 것이 바뀌었습니다. 지난 7월 "AI 봇"을 둘러싼 대화는 보상 없는 AI 학습 차단에 집중되어 있었습니다. 콘텐츠가 웹사이트 소유자에게 어떤 가치도 되돌려 주지 않은 채 모델 학습에 사용되는 승자독식 거래를 가리킨 것이었습니다. 그러나 이제는 더 세밀한 접근 방식에 대한 요구가 생겼습니다. 콘텐츠 소유자는 여전히 자신의 콘텐츠를 보호할 수 있기를 바라며, 힘들여 만들고 선별하고 공유하는 원본 콘텐츠에 대해 보상받아야 합니다. 또한 콘텐츠를 잠그는 것이 모두에게 맞는 단일 해법이 아니라는 점도 알고 있습니다. 웹사이트 소유자는 매번 "모든 자동화를 차단"하는 것 말고 더 많은 선택지를 원합니다.
소규모 사이트를 운영한다면, 문제는 누군가가 내 콘텐츠로 모델을 학습할 수 있다는 점만이 아닙니다. 애초에 아무도 나를 찾지 못할 수도 있다는 점입니다. 그래서 파우스트적 거래를 해야 합니다. 검색에 노출되고 AI가 나를 학습하도록 허용하거나, 발견 가능성을 잃을 위험을 감수해야 합니다. 기존 검색 제공업체가 검색과 학습에 동일한 봇을 사용한다면 이는 부당하게 유리해집니다. 그리고 이 부당한 이점은 신규 참여자가 경쟁 격차를 줄이려 하면서 회피적으로 행동하게 만드는 유인이 됩니다.
오늘날 AI는 어디에나 들어갈 수 있습니다. Google 검색은 AI로 정렬되는 방식에서 결과 페이지에서 질문에 직접 답하는 완전한 답변 엔진으로 바뀌었습니다. 그리고 Google만 이런 위치에 있는 것은 아닙니다. 이것이 "검색"이 나아가는 방향입니다.
오늘 무엇이 "AI"에 해당하는지 그 기준을 논할 수도 있겠지만, 내일이면 그 기준은 바뀔 것입니다. 따라서 봇을 주로 "AI인지 아닌지"로 정의하는 대신, 분류에 대한 업데이트된 접근 방식에서는 봇 또는 에이전트의 행동에 관해 더 깊은 질문을 던집니다. 내 사이트에서 무엇을 하는가? 무엇을 저장하는가? 그리고 내 콘텐츠를 어떻게 다시 공유할 것인가?
이 질문들에 답하려면 더 세밀한 관점, 즉 고객이 중요하게 여기는 AI 사용 사례에 부합하는 실용적인 분류 체계가 필요합니다. 그래서 AI 학습만을 넘어 논의를 확장하고, 모든 고객이 관리할 수 있기를 바라는 세 가지 AI 사용 사례에 집중합니다.
웹에서 널리 쓰이는 많은 크롤러는 위 분류 중 하나에 속하며, 일부는 여러 분류에 속합니다. 위의 세 가지 외에도 광고 검증, 피드 가져오기, 에이전트 거래 등 다양한 행동을 분류합니다(이에 대해서는 아래에서 자세히 설명합니다). 그러나 모든 웹사이트 소유자가 이 세 가지 AI 중심 사용 사례에 대한 접근을 간단히 관리할 수 있어야 한다고 믿습니다. 봇 운영자는 크롤러를 분리해야 한다고 생각합니다. 그러면 웹사이트 소유자가 특정 크롤러가 방문하는 이유를 더 잘 이해하고, 해당 크롤러에 부여하는 접근 권한도 더 잘 관리할 수 있어 투명성이 높아지기 때문입니다. 한 회사가 검색 색인을 구축하고, 에이전트로 행동하며, 모델을 학습할 데이터를 수집하는 자동화를 운영한다면, 해당 자동화를 세 개의 별도 크롤러로 분리할 것을 강력히 권장합니다.
우리는 확장 가능하고 변화하는 자동화 트래픽 세계를 대표하는 분류 시스템을 원합니다. 봇의 목적을 추적하는 일은 새로운 일이 아니지만, 새로운 분류 체계에는 오늘날 봇 트래픽의 상태를 더 잘 반영하는 몇 가지 업데이트가 포함됩니다. 특히 여러 목적을 가진 봇은 그중 하나만이 아니라 모든 목적으로 추적되어야 한다는 점을 인정하고자 합니다.
Cloudflare 네트워크의 모든 웹사이트 소유자에게 다양한 종류의 AI 트래픽을 관리할 수 있는 더 많은 옵션을 제공하고자 합니다.
과거에 발표한 "AI 봇 차단" 관리형 사전 설정에는 아래와 같이 모델 학습을 위해 데이터를 크롤링하는 단일 목적 봇이 포함되어 있었습니다.

2025년 7월 1일 기준 AI 봇 트래픽 관리용 기존 설정의 스크린샷.
하지만 모든 AI 사용 방식이 같지는 않으며, 고객이 필요한 제어 기능을 갖추기를 바랍니다. 이에 검색, 에이전트, 학습 크롤러라는 세 가지 주요 사용 사례에 따라 AI 트래픽을 관리할 수 있는 기능을 출시합니다. 이 새로운 옵션을 통해 무료 요금제 고객을 포함한 고객은 AI 봇 트래픽 관리 방식을 더욱 세밀하게 조정할 수 있습니다.

2026년 7월 1일 기준 AI 봇 트래픽 관리용 새 옵션의 스크린샷.
2026년 9월 15일에 이 세 가지 분류 각각에 대한 새 기본값을 설정할 예정입니다. Cloudflare에 새로 온보딩하는 모든 도메인에서 광고가 표시되는 페이지는 학습 및 에이전트 카테고리가 기본적으로 차단되고, 검색은 기본적으로 허용됩니다.
광고는 웹사이트 소유자가 사람이 해당 페이지에 방문하여 이를 보기를 의도했다는 신호이며, 사업을 움직이는 수익화 가능한 요소입니다. 따라서 해당 페이지에서는 사람의 관심을 최종 목표로 보고, 이 관심을 방해할 수 있는 봇, 즉 학습 및 에이전트 봇을 차단합니다. 반면 검색은 방문자를 다시 유입시키는 데 가장 자연스럽게 기여하는 행동이며, 대부분의 사이트 소유자에게 이를 허용하는 것이 이익이라고 생각합니다.
9월 15일부터 적용될 또 다른 변경 사항은 여러 목적의 크롤러, 특히 검색과 학습을 결합하는 크롤러가 웹사이트 소유자의 투명성에 대한 우리의 요구에 맞춰 모든 행동에 따라 허용 또는 차단된다는 점입니다. 기본값은 적용 가능한 규칙 중 가장 제한적인 규칙에 따라 시행되므로, Googlebot, Applebot, BingBot 같은 다목적 크롤러는 학습 차단을 선택한 고객에 의해 차단됩니다(새로운 AI 트래픽 관리 옵션 또는 기존 AI 봇 차단 서비스를 통해).
물론 고객의 선택이 가장 중요합니다. 웹사이트 소유자가 이 새로운 기본 구성에서 제외되기를 원한다면, 9월 15일까지 언제든 보안 설정에서 쉽게 표시하여 검색 목적으로도 크롤링하는 학습 크롤러에 대해 _어떤 변경도 원하지 않는다_는 점을 확인할 수 있습니다. 또한 기본값과 다른 설정을 선택하려는 고객이 그렇게 할 기회를 가질 수 있도록, 9월 15일이 다가오면서 기본값 변경 예정도 계속 알려드리겠습니다.
또한 Enterprise Bot Management의 새로운 기능으로 대규모 가시성 업데이트를 출시하게 되어 기쁩니다. Cloudflare가 추적하는 봇 디렉터리가 성장하면서, 이 봇들을 합리적인 그룹으로 관리하고 특정 봇에 관한 더 자세한 정보를 파악하려는 요구도 커졌습니다.
BotBase를 소개합니다. BotBase는 검증된 봇과 에이전트를 비롯한 알려진 모든 봇을 추적하는 새로운 데이터베이스입니다. 이 데이터베이스는 Cloudflare 대시보드에서 직접 전체 봇 디렉터리를 포괄적으로 검색할 수 있는 보기를 제공합니다. 먼저 가시성 문제를 해결하고 있으며, 올해 후반에는 BotBase를 확장하여 웹사이트의 알려진 자동화 콘텐츠를 위한 직접적인 제어 센터를 제공할 예정입니다.
이 새로운 보기를 통해 Enterprise Bot Management 고객은 모든 검증된 봇 및 에이전트의 전체 카탈로그와 업데이트된 분류 체계에서의 분류 위치를 확인할 수 있습니다. 이는 이전에는 Cloudflare 대시보드에서 동적으로 보여드린 적 없는 보기입니다. 특정 봇을 정밀하게 대상으로 지정하려는 고객은 해당 봇의 모든 트래픽을 쉽게 필터링하고, 탐지 ID를 복사하여 보안 규칙에 사용할 수도 있습니다. 이 모든 기능은 이제 전용 페이지에서 제공되며, Bot Management 구성 카드를 통해 접근할 수 있습니다.
BotBase를 구축하면서, 봇마다 확장 가능하고 강력한 인사이트를 구축할 수 있도록 하는 모든 정보를 고려하고자 했습니다. 그중 하나는 업데이트된 분류 체계의 초석으로, 봇이 사이트에서 할 수 있는 일, 즉 그 행동을 기반으로 합니다. 아래와 같이 이러한 분류를 구분하며, 각 봇은 하나 이상의 행동으로 분류됩니다.
| 봇 분류 | 행동 및 용도 |
|---|---|
| 검색 | 검색 엔진 결과에 사이트가 표시되도록 사이트를 스캔하기 위한 크롤링 |
| 에이전트 | 사람을 대신해 페이지를 방문하는 사용자 지시형 에이전트 |
| 학습 | 모델 학습 또는 미세 조정을 위한 크롤링 |
| 거래 | 사용자를 대신한 결제 작업 |
| 데이터 수집 | 가격 스크래핑, 경쟁 정보 수집, 타사 분석 포함 |
| 보안 테스트 | 취약점 스캔 및 침투 테스트 포함 |
| SEO | SEO 크롤링, 사이트 감사, 접근성 검사 |
| 광고 검증 | 광고 게재 위치 검증, 광고 사기 탐지 |
| 소셜 / 링크 미리보기 | 소셜 플랫폼 및 메시징 앱용 링크 미리보기 |
| 피드 가져오기 | RSS 리더, 팟캐스트 수집기, 뉴스 피드 봇 포함 |
| 모니터링 및 운영 | 가동 시간 모니터링, 웹훅, 상태 점검 포함 |
굵은 기울임꼴 행은 모든 고객이 이용할 수 있는 새로운 구성 가능 옵션을 나타냅니다.
고객이 중요하다고 말씀하신 또 다른 정보는 봇의 콘텐츠 사용 방식, 즉 봇이 콘텐츠를 크롤링한 뒤 보관하고 다시 공유할 수 있는 방식입니다. 이를 해결하기 위해 Bot Management 고객이 "콘텐츠 사용"을 기준으로 선택하고 차단할 수 있는 기능을 구축하고 있습니다. 이 설정은 가장 제한적인 수준부터 가장 허용적인 수준까지 다음 세 단계 중 하나로 지정할 수 있습니다.
immediate — 상호작용하되 아무것도 저장하거나 재사용하지 않음reference(기본값) — 색인화, 발췌, 원문 링크 제공full — 요약 및 재현이 값은 봇 분류와 결합하여 "검색, SEO, 광고 검증에 사용되는 모든 봇은 허용하되, reference 사용 수준까지만 허용"과 같은 세밀한 규칙을 표현할 수 있습니다. 이를 통해 웹사이트 소유자는 봇별 개별 규칙을 관리하는 대신 합리적인 그룹 단위로 결정을 내릴 수 있습니다**.**
이를 더욱 지원하기 위해 오늘부터 Content Signals를 확장하고 robots.txt에 포함되는 새로운 신호 use를 테스트합니다. 이는 첫 번째 버전의 Content Signals에 있던 세 필드에, 위와 동일한 선호를 표현하는 선택적 네 번째 필드를 추가합니다.
use=immediateuse=referenceuse=fullrobots.txt 파일에 나열된 다른 모든 항목과 마찬가지로 콘텐츠 사용 값은 직접 차단을 적용하는 것이 아니라 웹사이트 소유자의 _선호_를 나타냅니다. 이제 이 확장을 지원합니다. 이미 관리형 robots.txt를 활성화한 모든 고객, 즉 검색을 위한 크롤링은 괜찮지만 학습을 위한 크롤링은 안 된다는 선호를 robots.txt 앞에 추가한 고객의 robots.txt에는 이제 use=reference라는 추가 선호도 포함됩니다.
# Cloudflare Managed content with original Content Signals
User-agent: *
Content-Signal: search=yes,ai-train=no
Allow: /
원래 Content Signals 값을 포함한 Cloudflare 관리형 robots.txt의 내용.
# Cloudflare Managed content with the new content-use signal
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
매개변수가 추가된 Cloudflare 관리형 robots.txt의 내용.
또한 BotBase에서 모든 봇의 콘텐츠 사용 방식을 추적하기 시작했으며, 봇이 이러한 신호를 악용하는 것을 발견하면 해당 봇은 "검증됨" 상태를 잃어 더는 허용되지 않습니다. 오늘날 콘텐츠를 완전하게 재현하는 봇은 검증됨 상태를 받을 수 없습니다.
"검증됨"에 관해 말하자면, 기본 허용 및 차단 기준선의 예정된 변경을 반영하도록 검증됨의 정의가 업데이트되고 있습니다. 이전에는 모든 검증된 봇이 기본적으로 허용되었습니다. 이는 원치 않는 자동 트래픽을 차단하는 기본 Bot Fight Mode 서비스와 Enterprise Bot Management 고객용 규칙 템플릿에 반영되어 있었습니다.
오늘부터 더 세밀한 기준을 추가하도록 이를 조정합니다. 검증되지 않은 봇은 여전히 기본 차단되지만, 더는 검증됨을 "기본 허용"으로 보지 않습니다. 이제 검증됨 레이블은 봇이 관련 카테고리에 따라 허용될 수 있음을 의미하며, _허용된 카테고리_가 웹사이트 접근을 허용할 대상을 결정합니다(예: 검색 허용).
이 변경의 균형을 맞추기 위해 검증된 봇이 되는 과정을 개방하고 더 투명하게 만들고 있습니다. 봇을 "검증"받으려면 봇 운영자는 두 가지를 보여주어야 합니다. 자신을 정직하게 표현한다는 점과, 그 정직함으로 얻은 접근 권한을 악용하지 않는다는 점입니다. 또한 봇 운영자가 더 쉽게 이를 수행할 수 있도록, 현재 봇 운영자가 Cloudflare의 분류 시스템에서 정확하게 표현되고 있는지 더 잘 확인할 수 있는 관리 도구를 구축하고 있습니다(가까운 시일 내에 발표 예정).

BotBase에 참여하고 있거나 참여하고자 하는 봇 운영자를 위해 직접 구축된 예정 플랫폼의 미리보기 스크린샷입니다. BotBase는 차세대 Cloudflare 봇 디렉터리입니다.
한 가지를 더 말씀드리겠습니다. 사이트 문 앞에 있는 봇 또는 에이전트는 점점 더 그것을 만든 회사가 운영하지 않습니다. Cloudflare의 Developer Platform 같은 플랫폼은 대기업부터 한 번도 들어본 적 없는 개발자에 이르기까지 수천 개의 서로 다른 운영자를 위한 자동화를 한꺼번에 실행합니다. Stripe는 신뢰할 수 있지만, Stripe의 도구를 주말 프로젝트에 연결한 모든 사람을 반드시 신뢰하는 것은 아닙니다.
우리는 (사이트 소유자 → 봇 소유 회사 → 최종 사용자)의 경우를 전이적 신뢰의 문제라고 부릅니다. 요청과 함께 전달되어 "프록시 처리 과정에서 손실된 정보를 프록시 구성 요소가 공개할 수 있도록" 하는 RFC 7239에 정의된 기존 Forwarded 헤더를 활용할 것을 제안합니다.
이는 IP 주소에 X-Forwarded-For가 하는 일이나 원래 Host 헤더를 보존하기 위해 X-Forwarded-Host가 하는 일과 유사합니다. 따라서 웹사이트 소유자가 "이 운영자를 허용"한다고 말하면, 운영자가 직접 방문하든 신뢰할 수 있는 세 계층의 중개자를 거쳐 오든 이 선호는 유지됩니다. 자세한 내용은 문서에서 확인할 수 있으며, 아래에는 형식을 보여주는 간단한 예시가 있습니다.
Forwarded: for="openai"
위에서 설명한 콘텐츠 사용 확장을 추가하면, 헤더 추가는 아래와 같이 운영자가 접근하는 콘텐츠를 어떻게 사용하겠다고 밝히는지 지정하게 됩니다.
Forwarded: for="openai";use="reference"
이는 우리가 조성하고자 하는 인센티브 모델과도 부합합니다. Cloudflare 뒤에 있는 웹 도메인 20% 이상에서 신뢰 상태를 잃는 것은 실질적인 억제력입니다. 신뢰는 가지고 다닐 수 있는 것이 되고, 잃을 수도 있는 것이 됩니다.
하지만 봇 트래픽이 사람 트래픽과 섞이면서, 이 전이적 신뢰 시스템은 신원을 밝힐 여유가 있는 사용자 너머로 확장되지 못할 가능성이 있습니다. 오늘 제안하는 조치는 신뢰를 전달하는 데 도움이 되지만, 모든 시대의 전체 웹에 맞지는 않을 것입니다. 소규모 트래픽 출처에는 프라이버시가 필요하며, 자체 프라이버시 약속을 유지하려는 기업은 비공개 속도 제한과 같은 에이전트형 인터넷의 미래를 위한 공정한 구성 요소를 탐색할 수 있어야 합니다.
이러한 변화는 모두 같은 방향으로 나아가는 작은 변화입니다. 사이트 소유자는 누가 자신의 콘텐츠를 어떻게 사용하는지에 대해 더 큰 통제권을 얻습니다. 오늘 논의하고 곧 구현할 새로운 기본값은 투명성을 장려하고 세상이 향하는 방향을 더 잘 반영한다고 믿습니다.
물론 웹의 흐름은 계속 우리 아래에서 바뀔 것이며, 우리도 그에 맞춰 계속 조정할 것입니다. 하지만 방향은 바뀌지 않을 것입니다. 그것은 Cloudflare가 처음부터 취해 온 방향이기 때문입니다. 신뢰를 중심으로 구축된 웹 생태계입니다. 무언가를 만드는 사람이 그것이 어떻게 사용될지 결정할 수 있고, 무엇을 하는지 정직하게 밝히는 것이 더 적은 접근이 아니라 더 많은 접근을 얻게 하는 생태계입니다.
AI 트래픽을 관리하는 이 새로운 옵션은 지금 제공되고 있으며, 기존의 모든 고객은 영역 설정에서 구성할 수 있습니다. 아직 Cloudflare를 사용하지 않으시나요? 지금 원하는 트래픽 제어를 설정하려면 무료로 시작하세요.
콘텐츠 독립 기념일을 축하합니다.
