Préparation à la recherche IA : être utilisable par les assistants ainsi que par les crawlers
Les crawlers de recherche comme OAI-SearchBot et les crawlers d'entraînement comme GPTBot lisent robots.txt séparément. Comment définir une politique explicite pour les crawlers et un llms.txt utile.
Les assistants répondent aux questions en lisant directement les pages et en les citant, plutôt que de renvoyer une liste de liens classés. Ils accèdent à votre site via des crawlers nommés, et chacun lit robots.txt indépendamment. OAI-SearchBot, Claude-SearchBot et PerplexityBot récupèrent des pages pour la recherche ChatGPT, les réponses Claude et Perplexity, et Claude-User récupère une page lorsqu'une personne demande. GPTBot, ClaudeBot et CCBot collectent des données d'entraînement à la place, donc les bloquer est un choix de licence qui ne retire pas le site de la recherche IA. Un site peut être largement ouvert à Googlebot et fermé à chaque assistant, généralement parce qu'une règle par défaut a été copiée d'un modèle. La première décision est une décision de politique, et elle est la vôtre : quels agents peuvent lire votre contenu, et pour quoi. Rendre cela explicite dans robots.txt vaut mieux que de le laisser à une valeur par défaut, dans les deux sens. Une autorisation explicite indique à un assistant qu'il est le bienvenu ; une interdiction explicite est un signal clair plutôt qu'un silence ambigu. Le fichier llms.txt est la deuxième couche. Il s'agit d'un court document Markdown à la racine de votre site nommant ce que le site est et liant aux pages que vous voulez le plus citer. Il complète les sitemaps et les données structurées, et il ne rapporte rien en soi : les pages auxquelles il fait référence doivent toujours être accessibles, actuelles et dignes d'être citées. Passez en revue les deux du point de vue d'un assistant : lisez votre robots.txt comme chaque crawler nommé le ferait, puis ouvrez llms.txt et confirmez que chaque lien à l'intérieur se résout toujours. Un fichier nommant des pages qui ne se résolvent plus coûte plus de crédibilité que d'avoir aucun fichier du tout.
Rien de tout cela ne doit être revu à la main. Sur un plan payant, les mêmes résultats de politique de crawler et llms.txt sont disponibles sur demande en JSON, via l'API de rapport SEO et le serveur MCP.
Le diagnostic payant de SEOReport examine cela à travers les pages de votre propre site, montre les preuves derrière chaque constatation, et classe les corrections par priorité. Voir les plans et les prix.
Obtenez le diagnostic complet de votre site
Un rapport fondé sur des preuves et un plan d’action priorisé, avec une offre à crédits mensuels.