Back to articles

13% の監査済みサイトは AI クローラーをブロック — 私たち自身の 40.8% を修正

SEOReport Team·
ai-crawlersrobots-txtai-searchgenerative-engine-optimizationtechnical-seodata-analysis

私たちはサンプル内のすべての robots.txt を再読し、独自のパーサーに 2 欠陥があることを発見しました。修正後の割合は 6 の 45 審査済みサイトであり、13.3% であり、最初に公開した 40.8% ではありません。トレーニング対検索の分割は、AI アシスタントがあなたを引用できるかどうかを決定し続けます.

更新済み August 31, 2026。 8月 20 に公開されたこの記事のバージョンは、監査した 49 サイトの 20 — 40.8% を示していました。 「その数値は二度も誤っていました。」 40.8% は、個別の監査実行でチェックに失敗した割合であり、異なるサイトの割合ではなく、サイト数に戻して掛け合わせると、誰も数えたことのない「20 サイト」という表現になりました。 もっと悪いことに、私たちが戻ってきてすべてのロボットを再読したとき。 サンプルに対する仕様書に対してのテキスト、2は私たち自身のパーサーの欠陥で、失敗の半分を製造していることが判明しました。 修正後の数値は以下に示されており、修正は現在この記事のより有用な半分となっています。 私たちが実行するすべての監査は、AI クローラーが行うように robots.txt を取得し、読み取ります. August 31, 2026で、現在のエンジンウィンドウで監査されたすべての48個別ドメインからファイルを再取得し、そのうち45が1つのを提供しました. それらの45、6サイトのうち、13.3%は、サイト全体から少なくとも1の主要AIクローラーをシャットダウンします。対照的に、8サイトにはAIクローラーに適用されるルールが全くありません — 彼らが従うべきワイルドカード指令さえもありません. それは 17.8% サンプルの. それにより、サンプルの68.9%のうち31サイトが、AIクローラーが実際に読み取り、サイト全体でブロックしないポリシーを記載したrobots.txtを持つことになります. ChatGPT検索、Perplexity、Claudeがソースを取得して引用する年に、ファイルは公開以来ほとんど所有者が開いていないものの、静かに可視性スイッチになりました。 彼らの多くは全く触れたことがありません. robots.txt の姿勢.

1613.3%
AIクローラーに対して適用されるルールは全くありません817.8%
明示的なルール、サイト全体のブロックはありません3168.9%

方法論。 人口は、現在のエンジンウィンドウで監査が完了したすべての独立したドメインであり、これは5月23からAugust 31, 2026まで実行されます。 それは48ドメインで、228レポート実行にわたります。 保存された判定は欠陥のあるパーサーの回答を持っているため、上記の表は保存された合計ではありません。 それはそのドメインのライブロボットの同日再取得です。 txtファイルは8月31に読み取り、修正されたパーサーで評価されました。 3の48はもはやロボットを提供しません。 txtは全くありません、だから分母は45です。 サンプルは自己選択であり、これは誰かが監査を実行するように選んだサイトであり、サイズは小〜中規模に偏っています。 レートはウェブ全体ではなく、ウェブの長尾に対して方向性として扱ってください。 ドメインは名前付きではありません。

AI-Crawler Posture in robots.txt Across 45 Audited Sites (re-read 2026-08-31)

私たちのパーサーが間違えたことと、どのようにそれを発見したか

チェック自体は単純です. 私たちのエンジンはすべてのrobots.txtグループを解析し、GPTBot、OAI-SearchBot、PerplexityBot、ClaudeBot、Claude-SearchBot、CCBotの6つのユーザーエージェントを評価します。 クローラーは、管理するグループがサイト全体のDisallow: /を持つときのみブロックと見なされます。 Disallow: /adminのような部分的な禁止は、健康的なポリシーとして登録され、通過します。 その定義を正しく適用することが失敗した場所です. すべての45ファイルを再読込した結果、2の異なる欠陥が判明し、逆方向に引っ張られました. 空のDisallow:はブロックではありません。 RFC 9309は、パスのないルールは無視されると明示しており、Disallow:は「すべてを許可する」ことを示す標準的な方法です。 Yoast はデフォルトでそのファイルを出力し、いくつかの共有ホストも同様です. パーサーは空の値を / と同等とみなし、すべての 6 つのクローラーをブロックされたとフラグ付けしました。 5 の 10 サイトでエンジンがフラグ付けしたものは、普通のすべて許可ファイルを実行していました: 3 のそれらは Yoast のデフォルトブロックを逐語的に、 1 のそれらは単純な 2 行ファイル. 名前付きグループはワイルドカードを上書きします。 RFC 9309 はまた、クローラーがそれを名前付けした最も具体的なグループに従い、そうしたグループが存在する場合は User-agent: * を完全に無視すると述べています。 パーサーはファイル順で一致するすべてのグループを読み取り、最後のものを勝たせました. それは両方向に効きます. サンプルの大規模ソーシャルプラットフォームは GPTBot、ClaudeBot、および PerplexityBot を狭いパスルールで名前付けし、ファイルをキャッチオール User-agent: * / Disallow: / で閉じます — パーサーはそれら 3 つの名前付きクローラーに、除外されていたキャッチオールを与えました。 そして 1 サイトは逆方向で誤算されました: それはファイルの上部で名前で 3 AI クローラーを禁止し、さらに下部で緩やかなワイルドカードルールを述べ、パーサーはワイルドカードで実際の意図的ブロックを消去しました. そのサイトは通過していました. 両方の欠陥は修正され、正確なファイルから作成されたユニットテストで検証されました. このサンプルへの純粋な影響は次のとおりです: 5 サイトで古いパーサーがブロックと呼んだものはブロックではなく、 1 サイトでクリーンと呼んだものはクリーンです. 3 の数字を横並びで、すべて同じウィンドウから: エンジンの保存された判定は 42.9% の 226 個別監査実行と 21.3% の 47 サイトを読み取り、修正されたパーサーでライブファイルを再読込すると 13.3% の 45 サイトが得られます. それだけがサイトに関する主張で、仕様を正しく読み取るパーサーで測定されています. チェックの一つの特性はすべてを通過します: それはまだ保守的です. WAF チャレンジ、CDN ボットルール、またはファイアウォールブロックは robots.txt に現れませんので、13.3% は実際にクローラーを追い払うサイト数の底値として残ります。 そしてサイトはクローラーの名前を入力せずにブロックできる — プレビュー環境用に書かれたブランケットワイルドカード禁止は GPTBot に対しても、他のすべてに対しても同じように適用されます. 2 の 6 は、少なくとも 1 クローラーがその方法でブロックされることを確認しました: すべての robots.txt が 3 行のブランケット禁止であるプレビューホストと、閉じるキャッチオールで名前を付けていない 3 クローラーを掃き出す大規模プラットフォーム.

2023 で書かれたルールは 2026 で誤った質問に答えます

修正されたレートは、より大きな外部サンプルが報告するものより低くなっています. 2026年3月の SEO Score Tools による 10,000 サイトの分析 は、18.7% が GPTBot を積極的にブロックし、41.3% が AI 専用 robots ルールを一切持っていないことを発見しました。 彼らの数値は私たちより上回ります — 定義はサンプル間で異なり、私たちのサンプルはサイズの一部であり、私たちのチェックはワイルドカードグループを適用されたポリシーとしてカウントしますが、彼らは名前付きものを探します. 私たちは私たちの 13.3% が彼らの 18.7% を覆すと主張していません; 45 サイトサンプルはできません. 両データセットが合意するのは形です: ウェブの少数は AI アクセス決定を行い、さらに一部は知らずに行い、残りは尋ねられていません. 考慮されていない部分は物語であり、私たちの修正データはそれがどの部分かを注意深く扱います. 私たちが確認した 6 ブロックはほとんどが意図的です — 4 はクローラーを名前付けし、 2 はそれらのうち Cloudflare の管理コンテンツシグナルリストを実行し、これは今年書かれたポリシーであり、残留物ではありません. 私たちが45サイトから示せないのは、広範なウェブのどれだけがまだ古いルールを保持しているかです;それが外部サンプルが示すものです. メカニズムは、古いルールが高価になる理由を示すため、いずれにせよ述べる価値があります. 2023では、GPTBotがサーバーログに初登場し、CCBotが訓練ソースとして新たに悪名高くなったとき、アクセスの唯一の既知の結果はモデル訓練でした — したがってボットブロックリストが循環し、プラグインが1-クリックトグルを配布し、robots.txtファイルは誰も再読していない禁止事項を継承しました. それらのルールが答えた質問は「私のコンテンツを訓練コーパスに入れたいか?」でした 2026で重要なのは別の質問です:「アシスタントが私のトピックについて回答するとき、私のコンテンツが見つけられ引用できるようにしたいか?」 最初の質問のために書かれたルールは、静かに二番目の質問に答えます.

訓練クローラーと検索クローラーは異なる回答を受けるべきです

私たちが調査する6クローラーは、各オペレーターの公開ボットドキュメントに従って2ジョブにきれいに分割されます:

  • 検索と検索結果取得。 OAI-SearchBotはコンテンツをインデックス化し、ChatGPT検索がそれを表面化しリンクできるようにします — OpenAIドキュメントはこのアクセス、そしてこのアクセスのみがページがChatGPT検索結果に含まれるかどうかを決定します。 PerplexityBotはPerplexityの検索インデックスを構築します. Claude-SearchBotはClaudeの検索ベースの回答を改善するためにインデックス化します。 これらのいずれかをブロックすると、そのアシスタントの引用から除外されます.
  • 訓練。 GPTBotはOpenAIのモデルを訓練する可能性のあるコンテンツを収集します。 ClaudeBotはAnthropicのために同等のクローリングを行います. CCBotはCommon Crawlにフィードし、多くの研究・訓練データセットの背後にあるオープンコーパスです. OpenAIはGPTBotをブロックしてもChatGPT検索への含有に影響がないと明示しています — 2つのパイプラインは別々です。

Googleは異なる名前で同じ分割を実行します:そのAIは通常のGooglebotアクセスに乗って乗り、別のGoogle-ExtendedトークンはGemini訓練と基盤を制御します。 私たちはその機械装置をGoogleの生成検索ガイドで取り上げました。

graph TD A[AIクローラーがあなたのページをリクエストします] --> B{どの種類?} B --> C["検索 & 取得:<br/>OAI-SearchBot, PerplexityBot,<br/>Claude-SearchBot"] B --> D["訓練:<br/>GPTBot, ClaudeBot, CCBot"] C -->|許可| E[AI回答と引用文献に適格です] C -->|禁止| F[そのアシスタントの回答から除外されます] D -->|許可| G[コンテンツは将来のモデルの訓練に使用される可能性があります] D -->|禁止| H[AI検索の可視性には影響しません]

分割は漠然とした不安を2-部門の意思決定に変えます. 訓練クローラーのブロックは、コンテンツの再利用に関する正当な立場であり、AI検索で何も費用はかかりません. 取得クローラーのブロックは可視性の決定です — 自分でnoindexするのと同じカテゴリで、同じ慎重さが求められます.

決定を記録するrobots.txtを書いてください

ここに、AI検索で完全に可視化されつつ訓練同意を保留するポリシーがあります — 私たちが最もよく見る意図的な分割です:

# Search & retrieval — open, so assistants can find and cite this site
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
# Training — withheld; this has no effect on AI search visibility
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /

すべてをオープンにしたい場合は、除外ではなく明示的に言ってください — 各クローラーごとにAllow: /グループが文書化され、誰かが決定したことを示します。これは、該当ルールがない17.8%が欠けているものと同じです。 3 検証ステップがループを閉じます. https://yoursite.com/robots.txt をネットワーク外から取得し、実際に本番環境が提供しているものを読み取ってください — CDNやプラットフォームはリポジトリ内のファイルを注入または上書きでき、いくつかのエッジプロバイダーは1クリックAIボットブロックを提供し、あなたの指示を完全に上書きします。 同じ6 ユーザーエージェントに対する WAF やボット管理ルールを確認してください。robots.txt の許可は、403 を取得するクローラーには意味がありません。 その後、インフラストラクチャの変更ごとにチェックを再実行してください。プロバイダーの移行はコードに触れずにこのスイッチを切り替えることがあります. 私たちの監査が上記の意図的ポリシーを読む方法についての1つの注意:GPTBot、ClaudeBot、CCBot へのサイト全体の禁止は、発見として表面化します。 それは設計上のものです. サイト全体の AI クローラーブロックは常に確定した決定であるべきで、発見はそれを確認する場所です — このチェックが存在する失敗モードは、誰も書いた覚えのないブロックです.

今年度に実行する最も安価な可視性監査

robots.txt は AI システムにサイトが話す 1 の 2 ファイルです — もう一つは llms.txt で、私たちのデータは 76% のファイルが書かれたエージェントに失敗していることを示しています. 両方とも、このレポートのブロックと同じ失敗シグネチャを共有します:一度書かれ、構文的に妥当で、決して読み戻されません. 私たちのパーサーも同様で、これはこの修正の不快な部分です — 書かれた日以来再読されていないルールは、このチェックが存在する理由であり、私たちのものも再読されていません. 修正された画像は、最初に実行したヘッドラインよりも励ましのあるものです. 4 は、AI クローラーをサイト全体でブロックする 6 サイトのうち、クローラーが明示的に名前を付けたものの 2 で、4 は Cloudflare の管理されたコンテンツシグナルブロックを実行しています — これは誰かが選んだ 2026 ポリシーであり、誰も再読しなかった 2023 ルールではありません. 事故ブロックは残りのもので、数は少ないです. このサンプルでの大きなギャップは、AIクローラーをブロックするサイトではなく、robots.txt に AI クローラーが全く読めないような記述がある 8 サイトです. 自分のファイルを読むのに 2 分かかりますが、free report が代わりに読み取り、6 つのクローラーそれぞれの名前を表示し、どのルールが適用されるかを正確に示します ― したがって、記録上の決定は実際にあなたが下したものになります

サイトのランキングを確認する

アクション可能な発見と優先修正を含む無料のAI搭載SEOレポートを取得

サインアップ不要.