2에서 5 사이트를 감시할 때 최소 1 AI 크롤러가 차단됩니다
Audit data from 49 sites: 40.8% shut out at least 1 major AI crawler sitewide. The training-vs-search split decides whether AI assistants can cite you.
우리가 수행하는 모든 감시는 robots.txt를 가져와 AI 크롤러가 읽는 방식으로 읽습니다. 5월 5와 August 15, 2026 사이에, 우리가 감시한 49 사이트 중 20는 — 40.8% — 전체 사이트에서 최소 1의 6 주요 AI 크롤러를 차단하는 규칙을 제공했습니다. 또 다른 7 사이트(14.3%)는 반대 극단에 있었습니다: AI 크롤러에 적용되는 규칙이 전혀 없으며, 심지어 그들이 따를 와일드카드 지시문도 없습니다. 이는 샘플의 절반 이하 — 22 사이트 — 가 명시적인 AI 크롤러 정책을 명시하고 사이트 전체를 차단하지 않는 robots.txt를 가지고 있음을 의미합니다. ChatGPT 검색, Perplexity, Claude가 소스를 가져와 인용하는 해에, 대부분의 소유자가 출시 이후 열어본 적이 없는 파일이 조용히 가시성 스위치가 되었습니다.
| 최소 1 AI 크롤러를 사이트 전체 차단 | 20 | 40.8% |
| AI 크롤러에 적용되는 규칙이 전혀 없음 | 7 | 14.3% |
| 명시적 규칙, 사이트 전체 차단 없음 | 22 | 44.9% |
방법론: 현재 체크셋에서 각 도메인별 최신 완료 감시 스냅샷, 5월 5 – August 15, 2026, 익명화. 각 체크의 분모는 46와 49 사이에서 변동하며, 모든 체크가 모든 사이트에서 실행되는 것은 아니기 때문입니다 — 이 2 체크는 성공적으로 제공된 robots.txt가 필요합니다. txt. 샘플은 자체 선택적이며 — 감시를 수행한 소유자 — 소규모에서 중간 규모로 편향되어 있으므로 비율을 웹 전체가 아니라 웹의 장기 꼬리 방향성으로 해석하십시오.
이 데이터에서 차단된 것은 robots.txt에서 사이트 전체 차단을 의미합니다
우리 엔진은 모든 robots.txt 그룹을 파싱하고 6개의 사용자 에이전트를 평가합니다: GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, Claude-SearchBot, 그리고 CCBot. 크롤러는 그룹이 이름으로 일치하거나 User-agent: * 와일드카드를 통해 일치할 때만 차단된 것으로 간주됩니다 — 그리고 사이트 전체에 Disallow: / 가 적용됩니다. Disallow: /admin 와 같은 부분 차단은 명시적 정책으로 등록되며, 이는 건전하며 그들은 통과합니다.
2 그 정의의 속성은 숫자를 읽는 데 중요합니다. 첫째, 보수적입니다: WAF 챌린지, CDN 봇 규칙, 또는 방화벽 차단은 robots.txt에 나타나지 않으므로 40.8%는 실제로 이러한 크롤러를 차단하는 사이트 수의 하한입니다. 둘째, 와일드카드 조항은 사이트가 AI 크롤러의 이름을 입력하지 않고도 모든 AI 크롤러를 차단할 수 있음을 의미합니다 — 스테이징 환경용으로 작성된 전체 차단, 또는 수년간 재검토되지 않은 템플릿은 GPTBot에 정확히 적용되는 것처럼 모든 다른 것에도 적용됩니다.
이들 차단 중 대부분은 2023의 질문에 답합니다.
우리가 보는 차단 패턴은 더 큰 외부 샘플이 보고한 것과 일치합니다. March 2026 분석 of 10,000 sites by SEO Score Tools는 18.7%가 GPTBot을 적극적으로 차단하고 41.3%가 AI 전용 robots 규칙을 전혀 갖고 있지 않음을 발견했습니다. 그들의 규칙 없음 수치는 우리 14.3%보다 높습니다 — 샘플 간 정의가 다르고, 우리의 검사는 와일드카드 그룹을 적용된 정책으로 계산합니다 — 그러나 두 데이터 세트는 형태에 대해 일치합니다: 웹의 소수는 AI 접근 결정을 무의식적으로 내렸습니다. 의도치 않은 부분이 스토리입니다. 2023에서 GPTBot이 서버 로그에 처음 등장하고 CCBot이 교육 소스로 새롭게 악명 높아졌을 때, 접근의 유일한 알려진 결과는 모델 훈련이었습니다 — 따라서 봇 차단 목록이 유통되고, 플러그인이 1-클릭 토글을 제공하며, 수천 개의 robots.txt 파일이 재검토되지 않은 차단을 상속했습니다. 그 규칙이 답한 질문은 "내 콘텐츠를 교육 코퍼스에 포함시키고 싶습니까?"입니다. 2026에서 중요한 질문은 다릅니다: "어시스턴트가 내 주제에 대해 답할 때 내 콘텐츠가 검색 가능하고 인용 가능하도록 하고 싶습니까?" 첫 번째 질문을 위해 작성된 규칙은 이제 두 번째 질문에 조용히 답합니다.
교육 크롤러와 검색 크롤러는 다른 답변이 필요합니다.
우리가 조사하는 6 크롤러는 각 운영자의 공개 봇 문서에 따라 2 작업으로 깔끔하게 분리됩니다:
- 검색 및 검색. OAI-SearchBot는 콘텐츠를 색인화하여 ChatGPT 검색이 이를 표면화하고 연결할 수 있도록 합니다 — OpenAI 문서는 이 접근이, 그리고 오직 이 접근이, 페이지가 ChatGPT 검색 결과에 포함되는지 여부를 결정한다고 기록합니다. PerplexityBot은 Perplexity의 검색 색인을 구축합니다. Claude-SearchBot는 Claude의 검색 기반 답변을 개선하기 위해 색인화합니다. 이 중 하나를 차단하면 해당 어시스턴트의 인용에서 제외됩니다.
- 교육. GPTBot은 OpenAI의 모델을 훈련시킬 수 있는 콘텐츠를 수집합니다. ClaudeBot은 Anthropic을 위해 동일한 크롤링을 수행합니다. CCBot은 Common Crawl에 데이터를 공급하며, 이는 많은 연구 및 교육 데이터 세트 뒤에 있는 공개 코퍼스입니다. OpenAI는 GPTBot 차단이 ChatGPT 검색 포함에 영향을 주지 않는다고 명시하고 있습니다 — 2개의 파이프라인은 별개입니다.
Google은 다른 이름으로 같은 분할을 실행합니다: AI가 일반 Googlebot 접근을 활용해 라이드에 노출되고, 별도의 Google-Extended 토큰은 Gemini 훈련과 기반을 제어합니다. 우리는 우리의 Google 생성 검색 가이드에서 그 기계를 다루었습니다.
분할은 모호한 불안을 2-부분 결정으로 전환합니다. 훈련 크롤러 차단은 귀하의 콘텐츠가 재사용될 수 있는 방식에 대한 정당한 입장이며, AI 검색에서 비용이 들지 않습니다. 검색 크롤러 차단은 가시성 결정입니다 — 자체 noindex와 같은 범주이며, 동일한 신중함이 필요합니다.
결정을 기록하는 robots.txt를 작성하십시오
여기에는 AI 검색에서 완전히 가시적이면서 훈련 동의를 보류하는 정책이 있습니다 — 우리가 가장 흔히 보는 의도적 분할입니다:
# Search & retrieval — open, so assistants can find and cite this siteUser-agent: OAI-SearchBotAllow: /User-agent: PerplexityBotAllow: /User-agent: Claude-SearchBotAllow: /# Training — withheld; this has no effect on AI search visibilityUser-agent: GPTBotDisallow: /User-agent: ClaudeBotDisallow: /User-agent: CCBotDisallow: /
모든 것을 열려 두고 싶다면 생략 대신 명시적으로 말하십시오 — 각 크롤러마다 명명된 Allow: / 그룹이 누군가가 결정했음을 문서화하며, 이는 14.3%의 해당 규칙이 없는 경우와 동일합니다.
3 검증 단계가 루프를 닫습니다. 네트워크 외부에서 https://yoursite.com/robots.txt을 가져와 실제로 제공되는 내용을 읽어보십시오 — CDN 및 플랫폼은 저장소의 파일을 삽입하거나 덮어쓸 수 있으며, 일부 엣지 제공업체는 1-클릭 AI-봇 차단을 제공해 귀하의 지침을 완전히 무시합니다. 동일한 6 사용자 에이전트에 대한 WAF 또는 봇 관리 규칙을 확인하십시오. robots.txt 권한은 403를 얻는 크롤러에게는 아무 의미가 없습니다. 그런 다음 인프라 변경 후마다 검사를 다시 실행하십시오; 제공업체 마이그레이션은 코드를 건드리지 않고도 이 스위치를 바꿀 수 있습니다.
1 우리 감사가 위의 의도 정책을 읽는 방식에 대한 메모: GPTBot, ClaudeBot, 그리고 CCBot에 대한 사이트 전체 차단은 여전히 발견으로 표시됩니다. 그게 설계상입니다. 사이트 전체 AI 크롤러 차단은 항상 확정된 결정이어야 하며, 그 결정을 확인하는 곳이 바로 찾는 곳입니다 — 이 검사가 존재하는 실패 모드는 아무도 기억하지 못하는 차단을 포착하는 것입니다.
올해 실행할 가장 저렴한 가시성 감사
robots.txt는 1의 2 파일 중 하나로, 귀하의 사이트가 AI 시스템과 통신하는 경로입니다 — 다른 하나는 llms.txt이며, 우리의 데이터는 76%의 파일이 작성된 대상을 실패시킵니다. 두 파일은 이 보고서의 차단과 동일한 실패 시그니처를 공유합니다: 한 번 작성되면 문법적으로는 타당하지만 다시 읽히지 않습니다. 우리 샘플에서 깨끗한 AI 크롤러 태도를 가진 사이트는 가장 크거나 가장 자원이 풍부한 것은 아니었습니다. 그들은 2023 이후 파일을 열었고 현재 질문에 답한 사이트였습니다. 귀하의 파일을 읽는 데 2분이 걸립니다; 무료 보고서가 대신 읽어 주고, 6개의 크롤러 각각의 이름을 표시하며, 각 규칙이 어떻게 적용되는지 정확히 보여 줍니다 — 따라서 기록상의 결정은 실제로 귀하가 한 결정입니다
사이트 순위 확인하기
실행 가능한 인사이트와 우선 순위 수정을 포함한 무료 AI 기반 SEO 보고서를 받아보세요.
가입 필요 없음.