13% 감시된 사이트의 AI 크롤러 차단 — 우리 자체 40.8% 수정
우리는 샘플에서 모든 robots.txt를 다시 읽었고, 우리 자체 파서에서 2 결함을 발견했습니다. 수정된 비율은 6의 45 감사된 사이트 중에서 — 13.3%, 처음에 발표한 40.8%가 아니라. 훈련-검색 분할은 여전히 AI 어시스턴트가 당신을 인용할 수 있는지 여부를 결정합니다.
업데이트된 August 31, 2026. 8월 20에 게시된 이 기사 버전은 "20 감시된 사이트 중 49 — 40.8%"를 선두에 두었습니다. " 그 숫자는 두 번 잘못되었습니다. 40.8%는 개별 감시 실행에서 검사에 실패한 비율이었으며, 고유 사이트 비율이 아니었고, 이를 사이트 수에 다시 곱하면 아무도 세지 않은 "20 사이트"가 생성되었습니다. 더 나쁜 것은, 우리가 돌아가서 모든 로봇을 다시 읽었을 때였다. 샘플에서 사양에 반대되는 txt, 2 결함은 우리 자체 파서에서 제조 결함의 절반이 된 것으로 드러났다. 수정된 수치는 아래에 있으며, 수정은 이제 이 기사에서 더 유용한 절반이 되었습니다. 우리가 수행하는 모든 감사는 robots.txt를 가져와 AI 크롤러가 읽는 방식으로 읽습니다. August 31, 2026에서 우리는 현재 엔진 창에서 감사한 모든 48 개별 도메인에서 파일을 다시 가져왔으며, 그 중 45는 하나의 을 제공했습니다. 그 중 45, 6 사이트들 — 13.3% — 전체 사이트 중 최소 1 개의 주요 AI 크롤러를 차단합니다. 반대 극단에서는 8 사이트는 AI 크롤러에 적용되는 규칙이 전혀 없으며, 그들을 따라야 할 와일드카드 지시문조차 없습니다. 그것은 17.8% 샘플의. 그 결과 31개의 사이트—샘플의 68.9%—는 AI 크롤러가 실제로 읽는 정책을 명시한 robots.txt를 가지고 있으며, 사이트 전체를 차단하지 않습니다. ChatGPT 검색, Perplexity, Claude가 소스를 가져와 인용하는 해에, 가장 많은 소유자가 출시 이후 열지 않은 파일이 조용히 가시성 스위치가 되었다. robots.txt 태도. 사이트.
| 최소 한 번 차단 1 AI 크롤러 전체 사이트 | 6 | 13.3% |
| AI 크롤러에 대한 규칙이 전혀 적용되지 않음 | 8 | 17.8% |
| 명시적 규칙, 사이트 전체 차단 없음 | 31 | 68.9% |
방법론. 인구는 현재 엔진 창에서 완료된 감사를 가진 모든 고유 도메인으로, 이는 5월 23부터 August 31, 2026까지 실행됩니다. 그것은 48 도메인으로 228 보고 실행을 통해 이루어집니다. 저장된 평결은 결함이 있는 파서의 답변을 담고 있으므로, 위 표는 저장된 합계가 아닙니다. 그것은 그 도메인들의 실시간 로봇을 같은 날 재가져오기입니다. txt 파일은 8월 31에 읽혀지고 수정된 파서로 평가됩니다. 3의 48는 더 이상 로봇을 제공하지 않습니다. txt는 전혀 없으며, 그 이유가 분모가 45이기 때문입니다. 샘플은 자발적으로 선택된 사이트들로, 이는 소규모에서 중간 규모로 편향됩니다. 비율을 웹 전체가 아니라 웹의 긴 꼬리에 대한 방향성으로 보아야 합니다. 도메인은 이름이 지정되지 않았습니다.
우리 파서가 잘못한 것과 그걸 어떻게 찾았는가
검사는 단순합니다. 우리 엔진은 모든 robots.txt 그룹을 파싱하고 6개의 사용자 에이전트를 평가합니다: GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, Claude-SearchBot, 그리고 CCBot. 크롤러는 그를 관리하는 그룹이 사이트 전체 Disallow: /를 포함할 때만 차단된 것으로 간주됩니다. Disallow: /admin와 같은 부분 차단은 명시된 정책으로 등록되며, 이는 건전하며 통과합니다.
그 정의를 올바르게 적용하는 것이 실패한 지점입니다. 모든 45 파일을 다시 읽어보니 2개의 고유 결함이 발견되었으며, 반대 방향으로 끌어당깁니다.
빈 Disallow:은 차단이 아닙니다. RFC 9309는 경로가 없는 규칙은 무시된다고 명시하고 있어, Disallow:이 모든 것을 허용하는 표준적인 방법입니다. Yoast는 기본적으로 정확히 그 파일을 발행하며, 여러 공유 호스트도 마찬가지입니다. 우리의 파서는 빈 값을 /와 동일하게 간주하고 모든 6개의 크롤러를 차단된 것으로 표시했습니다. 5의 10 사이트 중 엔진이 차단으로 표시한 것은 일반 허용 파일을 실행 중이었습니다: 그 중 3는 Yoast 기본 차단을 그대로 사용했고, 1는 단순 2-라인 파일이었습니다.
이름이 지정된 그룹이 와일드카드를 덮어씁니다. RFC 9309는 또한 크롤러가 자신을 명시하는 가장 구체적인 그룹을 따르고, 해당 그룹이 존재할 때는 User-agent: *를 완전히 무시한다고 말합니다. 우리의 파서는 파일 순서대로 모든 일치 그룹을 읽고 마지막 그룹이 승리하도록 했습니다. 이것은 양쪽 모두에 영향을 미칩니다. 샘플에서 GPTBot, ClaudeBot, 그리고 PerplexityBot를 이름으로 지정한 대형 소셜 플랫폼은 좁은 경로 규칙을 사용한 뒤 파일을 모든 것을 포괄하는 User-agent: * / Disallow: /로 닫습니다 — 우리의 파서는 그 3개의 이름이 지정된 크롤러에게 그들이 면제된 모든 것을 부여했습니다. 그리고 1 사이트는 반대 방향으로 잘못 계산되었습니다: 파일 상단 근처에서 3 AI 크롤러를 이름으로 차단한 뒤, 아래쪽에서 더 느슨한 와일드카드 규칙을 명시하고, 우리의 파서는 와일드카드가 실제 의도된 차단을 지우도록 했습니다. 그 사이트는 통과하고 있었습니다.
두 결함 모두 이제 수정되었으며, 정확히 그 파일들에서 발생한 단위 테스트가 만들어졌습니다. 이 샘플에서의 순수 효과는 다음과 같습니다: 5 사이트 중 이전 파서가 차단으로 표시한 것은 차단되지 않았고, 1 사이트 중 이전 파서가 깨끗하다고 표시한 것은 입니다. 3 숫자를 나란히 표시하면, 모두 같은 창에서: 엔진이 저장한 평결은 42.9%의 226 개별 감사 실행과 21.3%의 47 사이트 중 13.3%의 45 사이트를 읽어들입니다. 마지막 하나만이 사이트에 대한 주장으로, 사양을 올바르게 읽는 파서를 사용해 측정한 것입니다.
검사의 한 가지 속성은 이 모든 것을 견디며, 여전히 보수적입니다. WAF 챌린지, CDN 봇 규칙, 또는 방화벽 차단은 robots.txt에 나타나지 않으므로 13.3%는 실제로 이러한 크롤러를 차단하는 사이트 수의 최저값이 됩니다. 그리고 사이트는 이름을 입력하지 않고도 크롤러를 차단할 수 있습니다 — 미리보기 환경용으로 작성된 전체 와일드카드 차단은 GPTBot에 정확히 동일하게 적용됩니다. 2의 6 확인된 차단자는 최소 1 크롤러를 그 방식으로 차단합니다: 전체 robots.txt가 3-라인 전체 차단인 미리보기 호스트와, 이름을 지정하지 않은 3 크롤러를 모두 포함하는 대형 플랫폼입니다.
2023에서 작성된 규칙은 2026에서 잘못된 질문에 답합니다.
우리의 수정된 비율은 현재 더 큰 외부 샘플이 보고하는 것보다 낮습니다. March 2026 분석 of 10,000 sites by SEO Score Tools는 18.7%가 GPTBot을 적극적으로 차단하고 41.3%가 AI 전용 robots 규칙을 전혀 갖지 않는다고 밝혔습니다. 그들의 수치는 우리보다 높습니다 — 정의가 샘플마다 다르고, 우리의 샘플은 크기의 일부이며, 우리의 검사는 와일드카드 그룹을 적용된 정책으로 계산하지만 그들은 이름이 지정된 것만 찾습니다. 우리는 우리의 13.3%가 그들의 18.7%를 뒤집는다고 주장하지 않습니다; 45-사이트 샘플은 할 수 없습니다. 두 데이터 세트가 일치하는 점은 형태입니다: 웹의 소수는 AI 접근 결정을 내렸고, 추가적인 일부는 알지 못한 채로 결정을 내렸으며, 나머지는 요청받지 않았습니다. 고려되지 않은 부분은 이야기이며, 우리의 수정된 데이터는 그 부분이 무엇인지 신중히 다룹니다. 우리가 확인한 6 차단은 대부분 의도적입니다 — 4는 크롤러를 명시하고, 그 중 2는 올해 작성된 정책이며 남은 것은 아닙니다. 우리가 45 사이트에서 보여줄 수 없는 것은 더 넓은 웹이 아직도 오래된 규칙을 유지하고 있다는 정도이며, 바로 위의 외부 샘플이 그 목적입니다. 메커니즘을 언급할 가치가 있는 이유는 바로 오래된 규칙이 비용이 많이 드는 이유이기 때문입니다. 2023에서 GPTBot이 서버 로그에 처음 등장하고 CCBot이 교육 자료로 새롭게 악명 높아졌을 때, 접근의 유일한 알려진 결과는 모델 훈련이었으므로 봇 차단 목록이 유통되고, 플러그인이 1-클릭 토글을 제공하며, robots.txt 파일은 아무도 다시 읽지 않은 차단을 상속했습니다. 그 규칙이 답한 질문은 "내 콘텐츠를 훈련 코퍼스로 포함시키고 싶나요?"입니다. 2026에서 중요한 질문은 다릅니다: "내 주제에 대해 어시스턴트가 답변할 때 내 콘텐츠가 검색되고 인용될 수 있기를 원하나요?" 첫 번째 질문을 위해 작성된 규칙은 이제 두 번째 질문을 조용히 답합니다.
교육 크롤러와 검색 크롤러는 다른 답변이 필요합니다.
우리가 조사하는 6 크롤러는 2 작업으로 깔끔하게 나뉘며, 각 운영자의 공개 봇 문서를 기준으로 합니다:
- 검색 및 검색. OAI-SearchBot는 콘텐츠를 색인화하여 ChatGPT 검색이 이를 표출하고 연결할 수 있도록 합니다 — OpenAI 문서는 이 접근, 오직 이 접근이 페이지가 ChatGPT 검색 결과에 포함되는지 여부를 결정한다고 명시합니다. PerplexityBot은 Perplexity의 검색 색인을 구축합니다. Claude-SearchBot는 Claude의 검색 기반 답변을 개선하기 위해 색인화합니다. 이 중 하나라도 차단하면 해당 어시스턴트의 인용에서 제외됩니다.
- 교육. GPTBot은 OpenAI의 모델을 훈련시킬 수 있는 콘텐츠를 수집합니다. ClaudeBot은 Anthropic을 위해 동일한 크롤링을 수행합니다. CCBot은 Common Crawl, 많은 연구 및 교육 데이터 세트 뒤에 있는 공개 코퍼스를 공급합니다. OpenAI는 GPTBot을 차단해도 ChatGPT 검색 포함에 영향을 주지 않는다고 명시합니다 — 두 파이프라인은 별개입니다.
Google는 다른 이름으로 동일한 분할을 실행합니다: 그 AI는 일반 Googlebot 접근을 활용하며, 별도의 Google-Extended 토큰은 Gemini 교육 및 기반을 제어합니다. 우리는 그 기계를 우리의 Google 생성 검색 가이드에서 다루었습니다.
분할은 모호한 불안을 2-부분 결정으로 바꿉니다. 훈련 크롤러 차단은 귀하의 콘텐츠가 재사용될 수 있는 방식에 대한 정당한 입장이며, AI 검색에서 비용이 들지 않습니다. 검색 결과 차단은 가시성 결정입니다 — noindexing과 같은 범주이며, 동일한 신중함이 필요합니다.
결정 사항을 기록하는 robots.txt를 작성하십시오
AI 검색에서 완전히 가시적이면서 훈련 동의를 보류하는 정책은 다음과 같습니다 — 가장 흔한 의도적 분할입니다:
# Search & retrieval — open, so assistants can find and cite this siteUser-agent: OAI-SearchBotAllow: /User-agent: PerplexityBotAllow: /User-agent: Claude-SearchBotAllow: /# Training — withheld; this has no effect on AI search visibilityUser-agent: GPTBotDisallow: /User-agent: ClaudeBotDisallow: /User-agent: CCBotDisallow: /
모든 것을 공개하려면 생략 대신 명시적으로 말하십시오 — 각 크롤러마다 명명된 Allow: / 그룹이 누군가가 결정했음을 문서화합니다. 이는 17.8%의 해당 규칙이 없는 경우와 동일합니다.
3 검증 단계가 루프를 닫습니다. https://yoursite.com/robots.txt를 네트워크 외부에서 가져와 실제로 제공되는 것을 읽어보십시오 — CDN 및 플랫폼은 저장소의 파일을 삽입하거나 덮어쓸 수 있으며, 일부 엣지 제공업체는 1-클릭 AI-봇 차단을 제공하여 귀하의 지침을 완전히 무시합니다. 동일한 6 사용자 에이전트에 대한 WAF 또는 봇 관리 규칙을 확인하십시오. robots.txt 권한은 403를 받는 크롤러에게는 아무 의미가 없습니다. 그런 다음 인프라 변경 후마다 검사를 다시 실행하십시오; 공급업체 마이그레이션은 코드를 건드리지 않고도 이 스위치를 바꿀 수 있습니다.
우리의 감사가 위의 의도적 정책을 읽는 방식에 대한 한 가지 메모: GPTBot, ClaudeBot, 및 CCBot에 대한 사이트 전체 차단은 여전히 발견으로 표시됩니다. 이는 설계된 대로입니다. 사이트 전체 AI 크롤러 차단은 항상 확정된 결정이어야 하며, 발견은 이를 확인하는 곳입니다 — 이 검사가 포착하려는 실패 모드는 아무도 기억하지 못하는 차단입니다.
올해 실행할 가장 저렴한 가시성 감사
robots.txt는 AI 시스템과 통신하는 1 2 파일입니다 — 다른 것은 llms.txt이며, 우리의 데이터는 파일 중 76%가 작성된 에이전트에 실패함을 보여줍니다(/articles/llms-txt-validity-report). 두 파일은 이 보고서의 차단과 동일한 실패 시그니처를 공유합니다: 한 번 작성되고, 문법적으로 그럴듯하며, 다시 읽히지 않습니다. 우리 파서도 마찬가지였으며, 이는 이 수정을 불편하게 만드는 부분입니다 — 작성된 날 이후 재읽지 않은 규칙은 이 검사가 포착하려는 바로 그 것입니다. 우리도 재읽지 않았습니다. 수정된 그림은 우리가 처음 실행한 헤드라인보다 더 격려적입니다. AI 크롤러를 사이트 전체 차단하는 4 6 사이트 중, 그 크롤러를 명시적으로 차단하는 이름과 2 그 중 4는 Cloudflare의 관리형 콘텐츠 신호 차단을 실행 중입니다 — 이는 누군가가 선택한 2026 정책이며, 재읽지 않은 2023 규칙이 아닙니다. 실수로 차단된 것은 나머지이며, 그 수는 적습니다. 이 샘플에서 더 큰 차이는 AI 크롤러를 차단하는 사이트가 아니라, robots.txt에 AI 크롤러가 읽을 수 있는 내용이 전혀 없는 8 사이트들입니다. 자신의 파일을 읽는 데는 2분이 걸리며, 무료 보고서가 대신 읽어 주고, 6개의 크롤러 각각의 이름을 표시하며, 각 규칙이 정확히 어떤 크롤러에 적용되는지 보여 줍니다 — 따라서 기록상의 결정은 실제로 당신이 내린 결정입니다
사이트 순위 확인하기
실행 가능한 인사이트와 우선 순위 수정을 포함한 무료 AI 기반 SEO 보고서를 받아보세요.
가입 필요 없음.