SEO監査した5サイト中2サイトが、AIクローラーを1つ以上ブロックしている
49サイトのSEO監査データ。40.8%が主要なAIクローラーを1種類以上、サイト全体で締め出しています。学習と検索の線引きが、AIアシスタントに引用されるかどうかを決めます。
私たちが実行するすべての監査は robots.txt を取得し、AI クローラーが読むように読み取ります. 5月5からAugust 15, 2026まで、監査した49サイトのうち20は、— 40.8% —、少なくとも1の主要AIクローラーを遮断するルールを提供し、私たちが調査する6主要AIクローラー全体でサイト全体で。 別の 7 サイト(14.3%)は、AI クローラーに適用されるルールがまったくなく、彼らが従うべきワイルドカードディレクティブさえもありません. その結果、サンプルの半分未満 — 22 サイト — が明示的な AI クローラー ポリシーを記載した robots.txt を持ち、サイト全体でそれらをブロックしていません. ChatGPT 検索、Perplexity、Claude がソースを取得して引用する年に、ファイルは最初に公開されて以来ほとんどオーナーが開いていないものが、静かに可視性スイッチになりました。
| 少なくとも 1 AI クローラーをサイト全体でブロック | 20 | 40.8% |
| AI クローラーに適用されるルールはまったくない | 7 | 14.3% |
| 明示的なルール、サイト全体のブロックはなし | 22 | 44.9% |
方法論:現在のチェックセットから、5月 5 – August 15, 2026 の各ドメインの最新完了監査スナップショットを使用し、匿名化しています。 チェックごとの分母は 46 と 49 の間で変動します。すべてのチェックがすべてのサイトで実行されるわけではないため — これら 2 チェックは、成功裏に提供された robots.txt を必要とします。 txt. サンプルは自己選択であり、監査を実施したオーナーのみで構成され、小規模から中規模の傾向が強く、ウェブ全体ではなく長尾のウェブに対して方向性のある率として扱ってください。
このデータでブロックされているとは、robots.txt でサイト全体を disallow していることを意味します
私たちのエンジンは、robots.txt の各グループを解析し、6 つのユーザーエージェント(GPTBot、OAI-SearchBot、PerplexityBot、ClaudeBot、Claude-SearchBot、CCBot)を評価します。 クローラがブロックされたとみなされるのは、名前で一致するか、User-agent: * ワイルドカードを通じて一致するグループがサイト全体の Disallow: / を持つ場合のみです。 Disallow: /admin のような部分的な禁止は、明示的なポリシーとして登録され、健全であり、通過します。
2 その定義のプロパティは、数値を読む際に重要です. まず、保守的です:WAF チャレンジ、CDN ボットルール、またはファイアウォールブロックは robots.txt に現れません。したがって、40.8% は、実際にこれらのクローラを遠ざけるサイト数の下限です。 次に、ワイルドカード条項は、サイトが AI クローラの名前を入力せずにすべての AI クローラをブロックできることを意味します。ステージング環境用に書かれたブランケット禁止、または数年も再読されていないテンプレートは、GPTBot に対して他のすべてと同じように適用されます.
これらのブロックのほとんどは 2023 の質問に答えます。
私たちが見るブロッキングパターンは、より大きな外部サンプルが報告するものと一致します. March 2026 analysis of 10,000 sites by SEO Score Tools は、18.7% が GPTBot を積極的にブロックし、41.3% が AI 専用の robots ルールを一切持っていないことを発見しました。 彼らの no-rules 数値は私たちの 14.3% より高く、サンプル間で定義が異なり、私たちのチェックはワイルドカードグループを適用済みポリシーとしてカウントしますが、両方のデータセットは形状について合意しています:ウェブの大きな少数派が AI アクセスの意思決定を無意識に行っています. 意図しない部分が物語です. 2023 では、GPTBot がサーバーログに初めて登場し、CCBot がトレーニングソースとして新たに悪名高くなったとき、アクセスの唯一の既知の結果はモデルトレーニングでした — したがって、ボットブロックリストが循環し、プラグインが 1-クリックトグルを配布し、何千もの robots.txt ファイルが誰も再読していない禁止を継承しました. それらのルールが答えた質問は「私のコンテンツをトレーニングコーパスに入れたいか?」です。 2026 で重要な質問は異なります:「アシスタントが私のトピックについて回答するとき、私のコンテンツが検索可能で引用可能であることを望みますか?」 最初の質問のために書かれたルールは、第二の質問に静かに答えます.
トレーニングクローラと検索クローラは異なる回答を受けるべきです。
私たちが調査する 6 クローラは、各オペレーターの公開ボットドキュメントに従って 2 ジョブにきれいに分割されます:
- 検索と検索結果。 OAI-SearchBot はコンテンツをインデックス化し、ChatGPT 検索がそれを表面化しリンクできるようにします — OpenAI はこのアクセスのみがページが ChatGPT 検索結果に考慮されるかどうかを支配することを文書化しています。 PerplexityBot は Perplexity の検索インデックスを構築します. Claude-SearchBot は Claude の検索ベースの回答を改善するためにインデックス化します。 これらのいずれかをブロックすると、あなたはそのアシスタントの引用から除外されます.
- トレーニング。 GPTBot は OpenAI のモデルをトレーニングする可能性のあるコンテンツを収集します。 ClaudeBot は Anthropic のために同等のクローリングを行います. CCBot は Common Crawl にフィードし、多くの研究およびトレーニングデータセットの背後にあるオープンコーパスです. OpenAI は、GPTBot をブロックしても ChatGPT 検索の含有に影響がないことを明示しています — 2 つのパイプラインは別々です。
Google は同じ分割を別名で実行します:その AI は通常の Googlebot アクセスに乗って現れ、別の Google-Extended トークンは Gemini のトレーニングと基盤を制御します。 その機械装置については、Google の生成検索ガイドで説明しました。
分割は曖昧な不安を 2-部門の決定に変えます. トレーニングクローラーをブロックすることは、あなたのコンテンツが再利用される方法に関する正当な立場であり、AI 検索で何も費用はかかりません. 取得クローラーをブロックすることは可視性の決定です — 自分で noindex するのと同じカテゴリであり、同じ慎重さが求められます.
決定を記録する robots.txt を書きます
ここに、AI 検索で完全に可視化されつつトレーニング同意を保留するポリシーがあります — これは私たちが最もよく見る意図的な分割です:
# Search & retrieval — open, so assistants can find and cite this siteUser-agent: OAI-SearchBotAllow: /User-agent: PerplexityBotAllow: /User-agent: Claude-SearchBotAllow: /# Training — withheld; this has no effect on AI search visibilityUser-agent: GPTBotDisallow: /User-agent: ClaudeBotDisallow: /User-agent: CCBotDisallow: /
すべてをオープンにしたい場合は、除外ではなく明示的に言いましょう — クローラーごとに名前付き Allow: / グループが、誰かが決定したことを文書化し、適用規則がない 14.3% が欠けているものと同じです。
3 検証手順でループを閉じます. ネットワーク外から https://yoursite.com/robots.txt を取得し、実際に本番環境が提供しているものを読みます — CDN やプラットフォームはリポジトリ内のファイルを注入または上書きでき、いくつかのエッジプロバイダーは 1 回クリックで AI ボットをブロックし、あなたの指示を完全に上書きします。 同じ 6 ユーザーエージェントについて、WAF やボット管理ルールを確認してください。robots.txt の許可は、403 を取得するクローラーには意味がありません。 その後、インフラストラクチャの変更ごとにチェックを再実行してください。プロバイダーの移行はコードに触れずにこのスイッチを反転させる可能性があります.
私たちの監査が上記の意図的ポリシーを読む方法についての 1 つの注意:GPTBot、ClaudeBot、CCBot のサイト全体の disallow は、発見としてまだ表面化します。 それは設計上のものです. サイト全体のAIクローラブロックは常に肯定的な決定であるべきであり、発見はそれを肯定する場所です — このチェックが捕捉する失敗モードは、誰も書いたことを覚えていないブロックです.
今年実行する最も安価な可視性監査
robots.txt は 1 の 2 ファイルを通じてあなたのサイトがAIシステムと通信する場所です — もう一つは llms.txt で、私たちのデータは 76% のファイルがそれらのエージェントに対して失敗していることを示しています. 両者はこのレポートのブロックと同じ失敗シグネチャを共有しています:一度書かれ、構文的に妥当で、決して読み戻されません. 私たちのサンプルでクリーンなAIクローラ姿勢を持つサイトは、最大規模でも最良のリソースを持つものではありませんでした. それらは誰かが 2023 以来ファイルを開き、現在の質問に答えたサイトでした. あなたのものを読むのに2分かかります;無料レポート が代わりに読み、6つのクローラそれぞれの名前を付け、各ルールが適用される正確な箇所を示します — したがって記録上の決定は実際にあなたが行ったものです。
サイトのランキングを確認する
アクション可能な発見と優先修正を含む無料のAI搭載SEOレポートを取得
サインアップ不要.