Back to articles

des sites avec un fichier llms.txt le comprennent mal

SEOReport Team·
llms-txtai-seoai-searchai-readinesstechnical-seodata-analysis

We audited 142 websites between May and July 2026. 56% had no llms.txt at all, and 48 of the 63 that published one failed validity. Here are the 3 mistakes that account for nearly every failure.

Parmi les 142 sites que nous avons audités entre le 4 mai et le 19 juillet 2026, 79 n’avaient pas du tout de fichier llms.txt. Parmi les qui en ont publié un, en ont publié un cassé. Il reste sites — de l’échantillon — avec un fichier valide. La proposition llms.txt est simple : placez un fichier markdown à la racine de votre domaine qui donne aux agents IA une carte curatée, en texte brut, de votre site. Quand quelqu’un demande à ChatGPT, Claude ou Perplexity une question que votre site pourrait répondre, un agent qui récupère votre llms.txt au moment de l’inférence obtient exactement le contexte que vous avez choisi — au lieu d’un scraping à la volée de votre page d’accueil HTML. La spécification est délibérément minimale : un H1 avec le nom de votre site, un résumé en blockquote, et des listes markdown de liens vers votre contenu le plus important. Un an après l’adoption, l’écart n’est plus une question de prise de conscience. C’est une question d’exécution.

Le jeu de données

IndicateurValeur
Sites avec données d’audit par vérification
Sites sans fichier llms.txt()
Sites avec un fichier présent()
Fichiers ayant échoué la validité( des présents)
Fichiers valides( des présents)

Méthodologie : dernier instantané d’audit terminé par domaine, tiré des vérifications de production entre le mai et le . Tous les domaines anonymisés. L’échantillon est auto-sélectionné — sites dont les propriétaires ont effectué un audit — et penche vers les petites et moyennes propriétés, il faut donc le considérer comme indicatif plutôt que comme un recensement du web.

llms.txt Outcomes Across 142 Audited Websites

Les erreurs derrière presque chaque fichier invalide

Notre moteur valide un llms.txt par rapport à la structure de la spécification, et les preuves d’échec sont remarquablement cohérentes. problèmes représentent presque tout — la plupart des fichiers cassés ont ou d’entre eux en même temps :

. Pas de liens de référence ( de fichiers invalides). Le fichier existe, mais il ne contient pas de liens markdown. C’est tout le point du format — une liste triée d’URL qu’un agent doit lire. Un fichier sans liens est un poster sans carte. 2. Manque le bloc de citation de résumé (38 sur 48). La spécification exige un bloc de citation > Summary juste après le titre qui indique à un agent ce qu’est le site et comment interpréter les liens. Sans cela, un agent obtient une liste d’URL sans cadre pour choisir entre elles. . Manque le titre H ( sur ). La seule section que la spécification marque comme strictement requise. Les fichiers qui s’ouvrent avec de la prose, un commentaire ou un H ne donnent rien aux analyseurs pour s’ancrer.

Le motif sous tous les est le même : les équipes génèrent un espace réservé — parfois littéralement le mot « llms.txt » répété, ou un paragraphe de texte marketing — et le déploient comme une case à cocher. Un agent lisant un tel fichier n’apprend rien et passe à autre chose. La récupération a été gaspillée.

Quand les liens eux‑mêmes sont morts

La validité est structurelle. La prochaine vérification est de savoir si les URL référencées se résolvent réellement. La plupart des sites avec une structure valide passent aussi cette étape, mais les échecs sont instructifs : sites ont listé des liens qui ont renvoyé des erreurs, avec une médiane de références mortes par site. Une propriété e‑commerce a listé 3 042 URL de produits dans son llms.txt qui ne se résolvaient plus — le fichier avait clairement été généré une fois à partir d’un flux de produits et jamais régénéré. Cette anecdote est un échantillon de , il faut donc la considérer comme un avertissement plutôt que comme une statistique. Mais le mécanisme vaut la peine d’être retenu : un llms.txt est un document vivant. Si votre catalogue, vos documents ou vos pages de tarification bougent, le fichier se détériore — et un agent suivant des liens morts peut conclure que votre contenu est disparu, pas déplacé.

À quoi ressemble un fichier valide

L’exemple propre de la spécification est le meilleur modèle. Un llms.txt minimal et valide a besoin d’un H1, d’un bloc de citation de résumé, et d’au moins une liste de liens annotés:

markdown
# Acme Analytics
> Acme Analytics is a reporting API for ecommerce teams. This file lists our most useful resources for AI agents.
## Docs
- [API quickstart](https://acme.example/docs/quickstart): Authentication and first request in 5 minutes
- [Metrics reference](https://acme.example/docs/metrics): Every metric, its definition, and its SQL
## Product
- [Pricing](https://acme.example/pricing): Plans and usage limits
- [Changelog](https://acme.example/changelog): Release notes since 2024
## Optional
- [Full documentation index](https://acme.example/docs): Everything else, for larger context windows

La section Optional a une signification définie : les agents disposant de peu de contexte peuvent la sauter. Mettez votre meilleur matériel au-dessus.

graph TD A[L'agent récupère /llms.txt] --> B{Fichier présent.} B -->|ou erreur| C[L'agent revient à l'extraction HTML] B -->|| D{Structure valide.} D -->|Pas de H, résumé ou liens| E[Récupération gaspillée — aucun contexte utilisable] D -->|Valide| F{Références résolues.} F -->|Liens morts| G[L'agent conclut que le contenu est perdu] F -->|Liens vivants| H[L'agent lit vos pages sélectionnées]

Pourquoi cela vaut minutes

Les sitemaps indiquent aux moteurs de recherche ce qui existe. robots.txt indique aux robots ce qui est autorisé. llms.txt est le seul fichier qui indique à un agent IA ce qui compte — écrit dans le format qu'il lit nativement, au moment où il décide si votre site aide à répondre à une question d'utilisateur. C'est aussi l'un des rares leviers de recherche IA que vous contrôlez entièrement : pas de fournisseur de modèle, pas d'algorithme de classement, pas d'attente d'un crawl. La séquence de correction est courte. Écrivez le fichier à partir du modèle ci-dessus — minutes. Liez uniquement aux pages qui se résolvent, et privilégiez les URLs stables. Régénérez ou révisez-le chaque fois que votre architecture d'information change. Ensuite vérifiez-le de la même manière qu'un agent : récupérez-le, analysez-le, suivez les liens. Chaque audit que nous exécutons vérifie toutes les couches — présence, validité et si les références se résolvent — dans le cadre de la famille de préparation à l'IA. Si vous voulez savoir à quel groupe des 3 votre site appartient, vous pouvez exécuter votre propre rapport et trouver les vérifications llms.txt dans la section de préparation à l'IA.

Le bilan

L'adoption est le premier écart : des sites audités n'ont pas de fichier. Mais la constatation la plus marquante est que publier un fichier n'est pas la ligne d'arrivée — sur des sites qui en ont publié un ne peuvent pas l'utiliser par un agent. Les sites de la minorité valide n'ont rien fait d'exotique. Ils ont écrit un H, un résumé de phrases, et une liste de liens qui fonctionnent. C'est l'ensemble complet — et de l'échantillon en est sous.

See How Your Site Ranks

Get a free AI-powered SEO report with actionable findings and priority fixes for your website.

No signup required.