Back to articles

13%의 감사 사이트는 AI 크롤러를 차단합니다 — 우리 자신의 40.8%를 수정합니다

SEOReport Team·
ai-crawlersrobots-txtai-searchgenerative-engine-optimizationtechnical-seodata-analysis

우리는 샘플에서 모든 robots.txt를 다시 읽었고, 우리 자체 파서에서 2 결함을 발견했습니다. 수정된 비율은 6의 45 감사된 사이트 중 — 13.3%, 우리가 처음 발표한 40.8%이 아닙니다. 수정된 수치는 훈련 및 검색 크롤러를 결합한 것이며, AI-검색 제외율이 아닙니다.

업데이트된 August 31, 2026. 이 버전의 이 기사 게시된 8월 20 다음으로 선두를 차지했다 "20의 49 사이트 우리가 감사한 — 40.8%." 그 숫자는 두 번 잘못되었습니다. 40.8%는 개별 감사 실행에서 검사에 실패한 비율이었으며, 고유 사이트의 비율이 아니었고, 이를 사이트 수에 다시 곱하면 아무도 세지 않은 "20 sites"가 생성되었습니다. 더 나쁘게도, 샘플의 모든 robots.txt를 사양에 따라 다시 읽었을 때, 우리 파서의 2 결함이 실패의 절반을 제조한 것으로 밝혀졌습니다. 수정된 수치는 아래에 있으며, 수정은 이제 이 기사의 더 유용한 절반이 되었습니다.

August 31, 2026에 우리는 현재 엔진 창에서 감사한 모든 48 고유 도메인에서 파일을 다시 가져왔으며, 그 중 45는 하나의를 제공했습니다. 그 중 45의 6 사이트 — 13.3% — 전체 사이트 중 최소 1 주요 AI 크롤러를 차단했습니다. 반대 극단에서는 8 사이트가 AI 크롤러에 적용되는 규칙이 전혀 없으며, 그들을 따르도록 하는 와일드카드 지시문조차 없습니다. 이는 샘플의 17.8%입니다.

이는 31 사이트 — 샘플의 68.9% — 로 남으며, robots.txt가 AI 크롤러가 실제로 읽는 정책을 명시하고 그들을 사이트 전체에서 차단하지 않습니다. 이 수치는 몇 명의 소유자가 고의로 이러한 정책을 검토했는지 밝히지 않으며, 훈련 크롤러에 대한 제한만으로 검색 가시성 손실이 발생한 것은 아닙니다.

최소 1 AI 크롤러를 사이트 전체에서 차단613.3%
AI 크롤러에 적용되는 규칙이 전혀 없음817.8%
명시적 규칙, 사이트 전체 차단 없음3168.9%

방법론. 인구는 현재 엔진 창에서 완료된 감사를 받은 모든 고유 도메인으로, 5월 23부터 August 31, 2026까지 실행됩니다. 즉, 48 도메인이 228 보고 실행에서 발생합니다. 저장된 평결은 결함이 있는 파서의 답변을 담고 있으므로 위 표는 저장된 합계가 아닙니다. 이는 해당 도메인들의 실시간 robots.txt 파일을 같은 날 재가져와 8월 31에 읽고 수정된 파서로 평가한 것입니다. 48 중 3는 더 이상 robots.txt를 제공하지 않으므로 분모가 45가 됩니다. 샘플은 자발적으로 선택된 사이트들로, 누군가가 감사를 수행하도록 선택한 사이트이며, 소규모에서 중간 규모로 편향됩니다. 비율은 웹 전체가 아니라 웹의 긴 꼬리 방향성을 나타내는 것으로 간주하십시오. 도메인은 이름이 지정되지 않았습니다.

AI-Crawler Posture in robots.txt Across 45 Audited Sites (re-read 2026-08-31)

교정은 증거의 일부입니다

파일을 다시 읽어보면 빈 disallow 값 처리와 명명된 크롤러 그룹과 와일드카드 규칙 간의 관계가 잘못 처리된 것을 드러냈습니다. RFC 9309는 공개 해석을 제공합니다: 빈 경로는 무시되고, 해당 명명된 그룹이 와일드카드 그룹보다 우선합니다. 동일한 크롤러에 대한 그룹은 결합해야 할 수 있으며, 파일 순서만으로는 신뢰할 수 있는 정책이 아닙니다.

결함은 수정되었으며 회귀 테스트는 이를 드러낸 사례를 보존합니다. 이 샘플에서 5 사이트는 이전에 차단으로 표시되었으나 차단되지 않았고, 1는 이전에 명확하게 표시되었으나 차단되었습니다. 수정된 결과는 가져온 파일의 시기별 관찰입니다. 이는 오늘의 접근성을 확립하거나 웹 전체의 유행률을 나타내지 않습니다.

robots.txt는 하나의 접근 표면일 뿐입니다. CDN 챌린지, 로그인 벽 또는 네트워크 거부는 파일이 허용하더라도 검색을 방해할 수 있습니다. 반대로, 의도적인 교육 제한은 사이트가 AI 검색에서 보이지 않는다는 증거가 아닙니다. 13.3% 수치는 크롤러 목적을 결합한 것이며 AI-검색 제외율로 제시될 수 없습니다.

검색 접근과 교육 허가는 다른 결정입니다

OpenAI의 봇 문서는 검색 탐지를 위해 사용되는 OAI-SearchBot과 잠재적 모델 교육에 사용되는 GPTBot을 구분합니다. 그들의 제어는 독립적입니다. ChatGPT-User는 사용자 지향 방문을 나타내며 다시 다른 역할을 가집니다. 정책 검토는 허용하거나 제한하려는 목적을 명시해야 합니다.

Anthropic documents separate crawlers는 교육, 검색 및 사용자 검색에도 사용됩니다. 광범위한 문구 AI 봇을 단일 권한 토글로 바꾸지 말고, 실제로 소유자의 의도라면 그렇게 하세요.

Google는 자체 제어면을 가지고 있습니다. 우리의 generative search guide는 검색 콘솔 포함 설정과 크롤, 인덱스 및 스니펫 자격을 다룹니다. Google-Extended는 별도의 제어이며, robots.txt에 존재한다고 해서 검색 설정 검토를 대체하지는 않습니다.

이러한 구분은 상업적으로 유용합니다. 기업은 잠재 고객이 공개 문서를 발견하도록 하고, 교육에 대한 별도 결정을 내릴 수 있습니다. 허용 규칙이나 포함 설정이 답변이 페이지를 인용한다는 보장을 주지 않습니다. 그들은 발견이 일어날 수 있는 조건의 일부를 설정합니다.

의도한 정책과 비교하여 중요한 URL를 검토하십시오

잠재 고객이 찾아야 할 페이지를 선택하십시오: 유용한 가이드, 제품 설명 또는 개발자 예시. 제공자와 크롤러 목적, 적용 가능한 정책, 실제로 전달된 응답을 기록하십시오. 타임스탬프를 보관하고 실제 검증된 제공자 요청과 단순히 사용자 에이전트 이름을 사용하는 테스트를 구분하십시오.

소유자가 검색 발견을 원하고 관련 검색 크롤러가 의도치 않게 금지된 경우, 해당 충돌을 수정하십시오. 교육 차단이 의도적이라면, 그것을 의도적으로 기록하십시오. 광범위한 봇 점수를 녹색으로 만들기 위해 단순히 제거하지 마십시오.

누락된 명명 규칙이 자동으로 결함이 되는 것은 아닙니다. 와일드카드 규칙이 크롤러를 관리할 수 있으며, 그룹이 적용되지 않으면 robots 표준은 그 부재를 금지로 간주하지 않습니다. 명시적 규칙은 의도를 문서화할 수 있지만, 더 많은 줄이 반드시 더 나은 접근 정책을 의미하지는 않습니다.

파일을 변경한 후, 실시간 응답을 검사하십시오. 제공자 관리 파일이나 캐시는 저장소 복사본과 다를 수 있습니다. 그런 다음 중요한 페이지 자체를 확인하고, 리디렉션 후 최종 목적지를 포함하십시오. indexability conflicts article는 크롤링 권한과 색인 권한이 별개의 관찰임을 설명합니다.

접근이 유용한 가시성으로 전환되는지 측정합니다.

결과를 찾기 전에 정책과 응답 증거를 보존합니다. Google 생성형-AI 인상, 제공자 인용, 추천 방문 및 유용한 제품 행동은 각각 다른 질문에 답합니다. 그들의 출처와 보고 기간을 기록하고, 인위적인 AI 가시성 총계로 합산하지 않습니다.

SEOReport의 가장 강력한 공개 증거는 영향을 받은 페이지, 소유자의 의도된 행동, 구체적인 수리 및 반복 가능한 검증 결과입니다. 독자는 개인 감지 레시피 없이도 그 사실들을 평가할 수 있습니다. AI search readiness guide는 이러한 관찰을 실용적인 검토로 연결합니다.

이 수정은 원래 헤드라인에서 교훈을 바꿉니다. 우리의 샘플은 소규모, 구식의 크롤러 제한 수를 지원합니다. 유용한 작업은 소유자의 의도와 일치하는 제한을 결정하고, 전달된 페이지를 확인하며, 선택된 검색 표면이 실제로 보고하는 결과를 측정하는 것입니다.

사이트의 완전한 진단을 받으세요

근거 기반 보고서와 우선순위 실행 계획을 월간 크레딧 요금제로 받으세요.