76% des Sites Avec un fichier llms.txt Qui se Fait Mal
Nous avons audité 142 sites entre mai et juillet 2026. 56% n'avaient pas du tout de llms.txt, et 48 des 63 qui en publiaient un ont échoué en validité. Voici les 3 erreurs qui expliquent presque tous les échecs.
Parmi les 142 sites que nous avons audités entre le 4 mai et le 19 juillet 2026, 79 n'avaient pas du tout de fichier llms.txt. Parmi les 63 qui en publiaient un, 48 en a publié un cassé. Cela laisse 13 sites — 9% de l'échantillon — avec un fichier valide.
La proposition llms.txt est simple : placez un fichier markdown à la racine de votre domaine qui donne aux agents IA une carte curatée, en texte brut, de votre site. Quand quelqu'un demande ChatGPT, Claude, ou Perplexity une question que votre site pourrait répondre, un agent qui récupère votre llms.txt au moment de l'inférence obtient exactement le contexte que vous avez choisi — au lieu d'un scraping à la volée de votre page d'accueil HTML. La spécification est délibérément minimale : un H1 avec le nom de votre site, un résumé en blockquote, et des listes markdown de liens vers votre contenu le plus important.
Un an après l'adoption, l'écart n'est plus la prise de conscience. C'est l'exécution.
Le jeu de données
| Sites avec données d'audit par vérification | 142 |
| Sites sans fichier llms.txt | 79 (55.6%) |
| Sites avec un fichier présent | 63 (44.4%) |
| Fichiers qui ont échoué en validité | 48 (76.2% des présents) |
| Fichiers valides | 13 (20.6% des présents) |
Méthodologie : dernier instantané d'audit terminé par domaine, tiré des vérifications de production entre mai 4 et July 19, 2026. Tous les domaines sont anonymisés. L’échantillon est auto-sélectionné — sites dont les propriétaires ont effectué un audit — et penche vers les petites et moyennes propriétés, il faut donc le considérer comme indicatif plutôt que comme un recensement du web.
Les 3 erreurs derrière presque chaque fichier invalide
Notre moteur valide un llms.txt par rapport à la structure de la spécification, et les preuves d’échec sont remarquablement cohérentes. Les problèmes 3 représentent presque tout — la plupart des fichiers cassés ont 2 ou 3 d’entre eux en même temps :
- Aucun lien de référence (40 de 48 fichiers invalides). Le fichier existe, mais il ne contient pas de liens markdown. C’est le but même du format — une liste triée d’URL qu’un agent doit lire. Un fichier sans liens est un poster sans carte.
- Manque le bloc de citation de résumé (38 sur 48). La spécification exige un bloc de citation
> Summaryjuste après le titre qui indique à un agent ce qu’est le site et comment interpréter les liens. Sans cela, un agent obtient une liste d’URL sans cadre pour choisir entre elles. - Manque le titre H1 (33 de 48). La seule section que la spécification marque comme strictement requise. Les fichiers qui s’ouvrent avec du prose, un commentaire ou un H2 ne donnent rien aux analyseurs pour s’ancrer.
Le motif sous tous les 3 est le même : les équipes génèrent un espace réservé — parfois littéralement le mot « llms.txt » répété, ou un paragraphe de texte marketing — et le déploient comme une case à cocher. Un agent lisant un tel fichier n’apprend rien et passe à autre chose. La récupération a été gaspillée.
Lorsque les liens eux‑mêmes sont morts
La validité est structure. La prochaine vérification est de savoir si les URL référencées se résolvent réellement. La plupart des sites avec une structure valide passent aussi cette étape, mais les échecs sont instructifs : 7 sites ont listé des liens qui ont renvoyé des erreurs, avec une médiane de 19 références mortes par site. Une propriété e‑commerce a listé 3,042 URL de produits dans son llms.txt qui ne résolvaient plus — le fichier avait clairement été généré une fois à partir d'un flux de produits et n'a jamais été régénéré.
Cette anecdote est un exemple de 7, il faut donc la considérer comme un avertissement plutôt que comme une statistique. Mais le mécanisme vaut la peine d’être retenu : un llms.txt est un document vivant. Si votre catalogue, vos documents ou vos pages de tarification bougent, le fichier se détériore — et un agent suivant des liens morts peut conclure que votre contenu est disparu, pas déplacé.
À quoi ressemble un fichier valide
L’exemple propre de la spécification est le meilleur modèle. Un fichier minimal, valide llms.txt nécessite un H1, un bloc de citation de résumé, et au moins une liste de liens annotés :
# Acme Analytics> Acme Analytics is a reporting API for ecommerce teams. This file lists our most useful resources for AI agents.## Docs- [API quickstart](https://acme.example/docs/quickstart): Authentication and first request in 5 minutes- [Metrics reference](https://acme.example/docs/metrics): Every metric, its definition, and its SQL## Product- [Pricing](https://acme.example/pricing): Plans and usage limits- [Changelog](https://acme.example/changelog): Release notes since 2024## Optional- [Full documentation index](https://acme.example/docs): Everything else, for larger context windows
La section Optional a une signification définie : les agents à court de contexte peuvent la sauter. Mettez votre meilleur matériel au-dessus de celui-ci.
Pourquoi cela vaut 30 minutes
Les sitemaps indiquent aux moteurs de recherche ce qui existe. robots.txt indique aux robots ce qui est autorisé. llms.txt est le seul fichier qui indique à un agent IA ce qui compte — écrit dans le format qu'il lit nativement, au moment où il décide si votre site aide à répondre à une question d'utilisateur. C'est aussi l'un des rares leviers de recherche IA que vous contrôlez entièrement : pas de fournisseur de modèle, pas d'algorithme de classement, pas d'attente d'un crawl.
La séquence de correction est courte. Écrivez le fichier à partir du modèle ci-dessus — 10 minutes. Liez uniquement aux pages qui se résolvent, et privilégiez les URLs stables. Régénérez ou révisez-le chaque fois que votre architecture d'information change. Ensuite vérifiez-le comme le ferait un agent : récupérez-le, analysez-le, suivez les liens.
Chaque audit que nous effectuons vérifie toutes les couches 3 — présence, validité et résolution des références — dans le cadre de la famille de préparation à l'IA. Si vous voulez savoir à quel groupe des 3 votre site appartient, vous pouvez exécuter votre propre rapport et trouver les vérifications llms.txt dans la section préparation à l'IA.
Le bilan
L'adoption est le premier écart : 56% des sites audités n'ont pas de fichier. Mais la constatation la plus marquante est que publier un fichier n'est pas la ligne d'arrivée — 3 dans 4 des sites qui ont publié un agent ne peut pas l'utiliser. Les sites de la minorité valide n'ont rien fait d'exotique. Ils ont écrit un H1, un résumé en une phrase 2, et une liste de liens fonctionnels. C'est l'ensemble complet — et 91% de l'échantillon est sous celui-ci.
Voir comment votre site se classe
Get a free IA-powered SEO report with actionable findings and priority fixes for your website.
Aucune inscription requise.