Back to articles

13% の監査済みサイトがAIクローラーをブロック — 自社の 40.8% を修正

SEOReport Team·
ai-crawlersrobots-txtai-searchgenerative-engine-optimizationtechnical-seodata-analysis

私たちはサンプル内のすべての robots.txt を再読し、独自のパーサーに 2 欠陥があることを発見しました。修正後の率は 6 の 45 対象サイトであり、13.3% であり、最初に公開した 40.8% ではありません。修正されたカウントはトレーニングと検索クローラの両方を組み合わせたもので、AI 検索除外率ではありません。

更新済み August 31, 2026。 8月 20 に公開されたこの記事のバージョンは「監査した 49 サイトの 20 — 40.8%」と述べていました。 「その数は2回間違っていました。」 40.8% は、個別の監査実行でチェックに失敗した割合であり、異なるサイトの割合ではありません。これをサイト数に戻すと、誰も数えたことのない「20 サイト」という表現になりました。 もっと悪いことに、私たちが戻ってきてすべてのロボットを再読したとき。 サンプルに対する仕様書に対してのテキスト、2は私たち自身のパーサーの欠陥で、失敗の半分を製造していることが判明しました。 修正後の数値は以下に示されており、修正は現在この記事のより有用な半分となっています。 August 31, 2026で、現在のエンジンウィンドウで監査されたすべての48個別ドメインからファイルを再取得し、45のうち1つはを提供しました。 その 45、6 サイトのうち — 13.3% — では、サイト全体から少なくとも 1 の主要な AI クローラーをシャットダウンします。対照的に、8 サイトには AI クローラーに適用されるルールが一切ありません — 彼らが従うべきワイルドカード指令さえもありません. それは17.8%サンプルの。 それにより、サンプルの68.9%件のうち、31件のサイトが、AIクローラーが実際に読み取り、サイト全体でブロックしないポリシーを記載したrobots.txtを持つことになります。 robots.txt の姿勢。

1613.3%
AIクローラーに対して適用されるルールは全くありません817.8%
明示的なルール、サイト全体のブロックはなし3168.9%

方法論。 人口は、現在のエンジンウィンドウで監査が完了したすべての独立したドメインであり、期間は5月23からAugust 31, 2026までです。 それは48ドメインで、228レポート実行にわたります。 保存された判定は欠陥のあるパーサーの回答を保持しているため、上記の表は保存された合計ではありません。 それはそのドメインのライブロボットの同日再取得です。 txt ファイルは8月31に読み取り、修正されたパーサーで評価されました。 3の48はもはやロボットを提供しません。 txt は全くなく、したがって分母は45です。 サンプルは自己選択であり、監査を実行するように誰かが選んだサイトであり、サイズは小〜中規模に偏っています。 レートは、ウェブ全体ではなく、ウェブの長尾に対して方向性として扱ってください。 ドメインは名前付きではありません。

AI-Crawler Posture in robots.txt Across 45 Audited Sites (re-read 2026-08-31)

修正は証拠の一部です

ファイルを再読込すると、空の disallow 値の不正処理と、名前付きクローラグループとワイルドカードルールの関係が露呈しました。 RFC 9309 は公的解釈を提供します:空のパスは無視され、適用可能な名前付きグループがワイルドカードグループより優先されます。 同じクローラのグループは結合する必要がある場合があります;ファイル順序だけでは信頼できるポリシーではありません。 欠陥は修正され、回帰テストはそれらを露呈したケースを保持します。 このサンプルでは、5サイトは以前ブロックとラベル付けされていましたが、実際にはそうではなく、1は以前クリアとラベル付けされていましたがブロックされました。 修正された結果は、取得されたファイルの時系列観測です。 それは今日のアクセスやウェブ全体の普及率を確立するものではありません。 robots.txt はアクセス面の一つにすぎません。 CDN のチャレンジ、ログイン壁、またはネットワーク拒否は、ファイルが許可していても取得を妨げる可能性があります。 逆に、意図的なトレーニング制限は、サイトが AI 検索で不可視であるという証拠にはなりません。 13.3% の図はクローラの目的を組み合わせており、AI検索除外率として提示することはできません。

検索アクセスとトレーニング許可は別々の決定です

OpenAI's bot documentation は検索発見に使用される OAI-SearchBot と、潜在的なモデルトレーニングに使用される GPTBot を区別します それらの制御は独立しています。 ChatGPT-User はユーザー指向の訪問を表し、再び別の役割を持ちます。 ポリシー審査では、許可または制限したい目的を明示すべきです。 Anthropic documents separate crawlers はトレーニング、検索、ユーザー検索のために別々に設計されています 広範なフレーズ AI bot を単一の許可トグルに変えるのは、所有者の真意でない限り避けてください。 Google は独自の制御面を持っています 私たちの generative search guide は、検索コンソールの含有設定とクローラ、インデックス、スニペットの適格性を網羅しています。 Google-Extended は別の制御であり、robots.txt に存在しても検索設定のレビューを代替しません これらの区別は商業的に有用です。 企業は将来の顧客に公開ドキュメントを発見させつつ、トレーニングに関して別途決定することがあります。 許可ルールや含有設定だけでは、回答がページを引用することを保証しません。 それらは発見が起こる条件の一部を設定します。

目的に沿ったポリシーと照らし合わせて重要な URL をレビューしてください

将来の顧客が見つけるべきページを選択してください:有用なガイド、製品説明、または開発者例。 プロバイダーとクローラの目的、適用ポリシー、実際に提供された応答を記録してください。 タイムスタンプを保持し、実際に検証されたプロバイダーリクエストと、単にユーザーエージェント名を使用したテストを区別してください。 所有者が検索発見を望み、関連検索クローラが意図せず禁止されている場合は、その特定の衝突を修復してください。 トレーニングブロックが意図的であれば、それを意図的として記録してください。 広範なボットスコアを緑化するためだけにそれを削除しないでください。 名前付きルールが欠落しているからといって自動的に欠陥とは限りません。 ワイルドカードルールはクローラを管理する場合があります。グループが適用されない場合、robots 標準はその欠如を禁止とみなしません。 明示的なルールは意図を文書化できますが、行数が多いほどアクセスポリシーが優れているわけではありません。 ファイルを変更した後、ライブレスポンスを確認してください。 プロバイダー管理ファイルまたはキャッシュはリポジトリコピーと異なる場合があります。 その後、重要なページ自体を確認し、リダイレクト後の最終先も含めて確認してください。 indexability conflicts article は、クロール許可とインデックス許可が別々の観測である理由を説明しています。

アクセスが有用な可視性になるかを測定する

結果を探す前に、ポリシーとレスポンス証拠を保持してください。 Google 生成AI印象、プロバイダー引用、紹介訪問、有用な製品アクションはそれぞれ異なる質問に答える。 それらのソースと報告窓を記録し、発明された AI 可視性合計にまとめないでください。 SEOReport の場合、最も強力な公開証拠は、影響を受けたページ、所有者の意図した動作、具体的な修復、および再現可能な検証結果です。 読者は、プライベート検出レシピを必要とせずにそれらの事実を評価できます。 AI search readiness guide は、これらの観測を実践的なレビューに結び付けます。 この修正は、元の見出しからレッスンを変更します。 私たちのサンプルは、クローラ制限の小規模で時代遅れのカウントをサポートします。 有用な作業は、どの制限が所有者の意図に合致するかを決定し、提供されたページを確認し、選択された検索サーフェスが実際に報告する結果を測定することです。

サイトの完全な診断を受ける

根拠に基づくレポートと優先順位付きの改善計画を、毎月のクレジット付きプランで。