Back to articles

2 dans 5 Sites que nous auditons bloquent au moins 1 AI Crawler

SEOReport Team·
ai-crawlersrobots-txtai-searchgenerative-engine-optimizationtechnical-seodata-analysis

Audit data from 49 sites: 40.8% shut out at least 1 major AI crawler sitewide. The training-vs-search split decides whether AI assistants can cite you.

Chaque audit que nous effectuons récupère robots.txt et le lit comme le ferait un AI crawler. Entre mai 5 et August 15, 2026, 20 des 49 sites que nous avons audités — 40.8% — ont servi des règles qui excluent au moins 1 des 6 principaux AI crawlers que nous interrogeons, sur l'ensemble du site. Un autre 7 sites (14.3%) se trouvaient à l'extrême opposé : aucune règle ne s'applique aux AI crawlers, pas même une directive générique pour qu'ils obéissent. Cela laisse moins de la moitié de l'échantillon — 22 sites — avec un robots.txt qui indique une politique explicite pour les AI crawlers et ne bloque aucun d'entre eux sur l'ensemble du site. En une année où ChatGPT search, Perplexity, et Claude citent des sources en les récupérant, le fichier que la plupart des propriétaires n'ont pas ouvert depuis le lancement est devenu silencieusement un interrupteur de visibilité.

Bloque au moins 1 AI crawler sur l'ensemble du site2040.8%
Aucune règle ne s'applique aux AI crawlers714.3%
Règles explicites, pas de blocages sur l'ensemble du site2244.9%

Méthodologie : dernier instantané d'audit terminé par domaine à partir de notre ensemble de vérifications actuel, mai 5 – August 15, 2026, anonymisé. Les dénominateurs par vérification varient entre 46 et 49 car chaque vérification ne s'exécute pas sur chaque site — ces 2 vérifications nécessitent un robots.txt correctement servi. txt. L'échantillon est auto-sélectionné — propriétaires ayant effectué un audit — et penche vers les petites à moyennes tailles, donc considérez les taux comme indicatifs pour la longue traîne du web plutôt que pour le web en général.

AI-Crawler Posture in robots.txt Across 49 Audited Sites

Bloqué dans ces données signifie un disallow sur l'ensemble du site dans robots.txt

Notre moteur analyse chaque groupe robots.txt et évalue 6 agents utilisateurs contre celui‑ci : GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, Claude-SearchBot, et CCBot. Un crawler est considéré bloqué uniquement lorsqu’un groupe le correspondant — par nom, ou via le joker User-agent: * — porte un Disallow: / global. Les interdictions partielles comme Disallow: /admin s’enregistrent comme une politique explicite, ce qui est sain, et elles passent. 2 les propriétés de cette définition comptent pour la lecture des nombres. Tout d'abord, c'est conservateur : un défi WAF, une règle bot CDN, ou un blocage de pare-feu n'apparaît jamais dans robots.txt, donc 40.8% est le minimum de sites qui repoussent réellement ces crawlers. Ensuite, la clause joker signifie qu’un site peut bloquer chaque crawler IA sans jamais taper le nom d’un crawler IA — une interdiction générale écrite pour un environnement de mise en scène, ou un modèle que personne n’a relu depuis des années, s’applique à GPTBot exactement comme à tout le reste.

La plupart de ces blocages répondent à une question de 2023

Le motif de blocage que nous voyons correspond à ce que rapportent des échantillons externes plus larges. Une analyse de mars 2026 de 10,000 sites par SEO Score Tools https://seoscore.tools/blog/llms-txt-guide/ a révélé que 18.7% bloquent activement GPTBot et que 41.3% ne disposent d'aucune règle robots spécifique à l'IA. Leur chiffre sans règles dépasse notre 14.3% — les définitions diffèrent entre les échantillons, et notre vérification compte un groupe joker comme une politique appliquée — mais les deux ensembles de données s’accordent sur la forme : une grande minorité du web a pris une décision d’accès IA qu’elle n’a jamais consciemment prise. La partie involontaire est l’histoire. Dans 2023, lorsque GPTBot est apparu pour la première fois dans les journaux serveurs et que CCBot est devenu nouvellement notoire comme source d’entraînement, la seule conséquence connue de l’accès était l’entraînement du modèle — donc les listes de blocage de bots se sont propagées, les plugins ont été livrés avec des bascules 1-click, et des milliers de fichiers robots.txt ont hérité d’interdictions que personne n’a relues depuis. La question que ces règles répondaient était « veux‑je que mon contenu figure dans un corpus d’entraînement ? » La question qui compte dans 2026 est différente : « veux‑je être trouvable et citée lorsqu’un assistant répond sur mon sujet ? » Une règle écrite pour la première question répond maintenant silencieusement à la seconde.

Les crawlers d’entraînement et les crawlers de recherche méritent des réponses différentes

Les crawlers 6 que nous sondons se répartissent proprement en tâches 2, selon la documentation bot publiée de chaque opérateur :

  • Recherche et récupération. OAI-SearchBot indexe le contenu afin que ChatGPT recherche puisse le mettre en avant et le lier — OpenAI documents que cet accès, et uniquement cet accès, détermine si les pages sont prises en compte pour les résultats de recherche ChatGPT. PerplexityBot construit l’index de recherche de Perplexity. Claude-SearchBot indexe pour améliorer les réponses basées sur la recherche de Claude. Bloquer l’un de ces éléments vous retire des citations de cet assistant.
  • Entraînement. GPTBot recueille du contenu qui peut entraîner les modèles OpenAI. ClaudeBot effectue l’équivalent de crawling pour Anthropic. CCBot alimente Common Crawl, le corpus ouvert derrière de nombreuses bases de données de recherche et d’entraînement. OpenAI est explicite que bloquer GPTBot n'a aucun effet sur l'inclusion de recherche ChatGPT — les 2 pipelines sont séparés.

Google exécute la même division sous différents noms : son IA apparaît sur un accès Googlebot ordinaire, tandis que le jeton séparé Google-Extended contrôle l’entraînement et la mise à jour de Gemini. Nous avons couvert cette mécanique dans notre guide sur la recherche générative de Google.

graph TD A[Le robot IA demande votre page] --> B{Quel type?} B --> C["Recherche et récupération :<br/>OAI-SearchBot, PerplexityBot,<br/>Claude-SearchBot"] B --> D["Entraînement :<br/>GPTBot, ClaudeBot, CCBot"] C -->|Autorisé| E[Éligible aux réponses IA et aux citations] C -->|Interdit| F[Absente des réponses de cet assistant] D -->|Autorisé| G[Le contenu peut entraîner de futurs modèles] D -->|Interdit| H[Aucun effet sur la visibilité de la recherche IA]

La division transforme une anxiété vague en une décision 2-partielle. Bloquer les robots d’entraînement est une position légitime sur la façon dont votre contenu peut être réutilisé, et cela ne vous coûte rien en recherche IA. Bloquer les robots de récupération est une décision de visibilité — la même catégorie que l’auto‑noindex — et mérite la même intentionnalité.

Rédigez un robots.txt qui consigne la décision

Voici une politique qui reste entièrement visible dans la recherche IA tout en retenant le consentement d’entraînement — la division la plus courante que nous voyons :

# Search & retrieval — open, so assistants can find and cite this site
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
# Training — withheld; this has no effect on AI search visibility
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /

Si vous voulez que tout soit ouvert, dites-le explicitement plutôt que de l'omettre — un groupe nommé Allow: / par crawler documents que quelqu'un a décidé, ce qui est exactement ce que le 14.3% sans règles applicables manque. Les étapes de vérification 3 ferment la boucle. Récupérez https://yoursite.com/robots.txt depuis l’extérieur de votre réseau et lisez ce que la production sert réellement — les CDN et plateformes peuvent injecter ou remplacer le fichier dans votre dépôt, et certains fournisseurs de périphérie expédient un blocage AI‑bot à 1‑clic qui annule complètement vos directives. Vérifiez toute règle WAF ou de gestion de bots pour les mêmes agents utilisateurs 6, car la permission robots.txt ne signifie rien pour un robot qui obtient un 403. Puis relancez la vérification après chaque changement d’infrastructure ; une migration de fournisseur peut basculer ce commutateur sans toucher votre code. 1 remarque sur la façon dont notre audit lit la politique délibérée ci‑dessus : les interdictions globales sur GPTBot, ClaudeBot et CCBot apparaîtront toujours comme une constatation. C’est intentionnel. Un blocage d’AI-crawler à l’échelle du site doit toujours être une décision affirmée, et la constatation est là où vous l’affirmez — le mode d’échec que cette vérification vise à détecter est le bloc que personne ne se souvient d’avoir écrit.

L’audit de visibilité le moins cher que vous effectuerez cette année

robots.txt est 1 de 2 fichiers par lesquels votre site communique avec les systèmes d’IA — l’autre est llms.txt, où nos données montrent 76% de fichiers échouent les agents pour lesquels ils ont été écrits. Les deux partagent la même signature d’échec que les blocs de ce rapport : écrit une fois, syntaxiquement plausible, jamais lu en retour. Les sites de notre échantillon ayant une posture propre d’AI-crawler n’étaient pas les plus gros ni les mieux dotés. Ce sont les sites où quelqu’un avait ouvert le fichier depuis 2023 et répondu à la question actuelle. Lire le vôtre prend 2 minutes ; le rapport gratuit le lit pour vous, nomme chacun des 6 crawlers, et montre exactement quelle règle s’applique à chacun — ainsi la décision enregistrée est celle que vous avez réellement prise.

Voir comment votre site se classe

Get a free IA-powered SEO report with actionable findings and priority fixes for your website.

Aucune inscription requise.