13% der geprüften Seiten blockieren einen KI-Crawler — Korrektur unserer eigenen 40.8%
Wir haben jede robots.txt in unserer Stichprobe erneut gelesen und fanden 2 Fehler in unserem eigenen Parser. Die korrigierte Rate beträgt 6 von 45 geprüften Seiten — 13.3%, nicht die 40.8%, die wir zuerst veröffentlicht haben. Die korrigierte Anzahl kombiniert Trainings- und Suchcrawler; es ist keine KI-Suchausschlussrate.
Aktualisiert August 31, 2026. Die Version dieses Artikels, veröffentlicht am August 20, begann mit "20 von den 49 Seiten, die wir geprüft haben — 40.8%. " Diese Zahl war zweimal falsch. 40.8% war der Anteil der einzelnen Prüfläufe, die die Prüfung fehlgeschlagen haben, nicht der Anteil der eindeutigen Seiten, und die Multiplikation zurück auf eine Seitenzahl erzeugte eine "20 Seiten", die niemand jemals gezählt hatte. Schlimmer noch, als wir zurückgingen und jede robots. txt in der Stichprobe erneut gegen die Spezifikation prüften, zeigten 2 Fehler in unserem eigenen Parser, dass sie die Hälfte der Fehler verursachten. Die korrigierten Zahlen sind unten, und die Korrektur ist jetzt die nützlichere Hälfte dieses Artikels. Am August 31, 2026 haben wir die Datei von allen 48 eindeutigen Domains, die in unserem aktuellen Engine-Fenster geprüft wurden, erneut abgerufen, und 45 von ihnen lieferten einen. Von diesen 45, 6 Seiten — 13.3% — wurden mindestens 1 große KI-Crawler aus dem gesamten Site-Set ausgeschlossen. Im gegenteiligen Extrem haben 8 Seiten keine Regeln, die für KI-Crawler gelten — nicht einmal eine Wildcard-Direktive, die sie befolgen müssten. Das ist 17.8% des Samples. Das lässt 31 Seiten — 68.9% des Samples — mit einer robots.txt, die eine Richtlinie angibt, die ein KI-Crawler tatsächlich lesen wird und keine von ihnen sitewide blockiert. Die Anzahl verrät nicht, wie viele Eigentümer diese Richtlinien absichtlich überprüft haben, und eine Einschränkung nur eines Trainingscrawlers begründet nicht den Verlust der Suchsichtbarkeit.
| Blockiert mindestens 1 KI-Crawler sitewide | 6 | 13.3% |
| Keine Regeln, die für KI-Crawler gelten | 8 | 17.8% |
| Explizite Regeln, keine weltweiten Blockierungen | 31 | 68.9% |
Methodik. Die Population umfasst jede eindeutige Domain mit einem abgeschlossenen Audit in unserem aktuellen Engine-Fenster, das von Mai 23 bis August 31, 2026 läuft. Das sind 48 Domains über 228 Berichtläufe. Die gespeicherten Urteile tragen die Antwort des fehlerhaften Parsers, daher ist die obige Tabelle nicht die gespeicherte Summe. Es ist ein Same-Day-Re-Fetch der Live-Robots dieser Domains. txt-Dateien, gelesen am August 31 und mit dem korrigierten Parser bewertet. 3 der 48 dienen nicht mehr als Robots. txt überhaupt nicht, weshalb der Nenner 45 ist. Die Stichprobe ist selbstgewählt – dies sind Sites, die jemand ausgewählt hat, um ein Audit durchzuführen – und sie ist von klein bis mittelgroß verzerrt. Behandle die Raten als richtungsweisend für den langen Schwanz des Webs statt für das Web im Allgemeinen. Domains sind nicht benannt.
Die Korrektur ist Teil des Beweises
Das erneute Lesen der Dateien zeigte eine fehlerhafte Behandlung leerer Disallow-Werte und die Beziehung zwischen benannten Crawler-Gruppen und Wildcard-Regeln. RFC 9309 liefert die öffentliche Interpretation: ein leerer Pfad wird ignoriert, und anwendbare benannte Gruppen haben Vorrang vor der Wildcard-Gruppe. Gruppen für denselben Crawler müssen möglicherweise kombiniert werden; die Dateiorder allein ist keine zuverlässige Richtlinie. Die Fehler wurden korrigiert und Regressionstests bewahren die Fälle, die sie aufgedeckt haben. In dieser Stichprobe waren 5 Sites, die zuvor als blockiert gekennzeichnet waren, nicht blockiert, während 1 zuvor als klar gekennzeichnet waren, blockiert wurden. Das korrigierte Ergebnis ist eine datierte Beobachtung der abgerufenen Dateien. Es etabliert weder den heutigen Zugriff noch eine webweite Prävalenzrate. robots.txt ist nur eine Zugriffsebene. Eine CDN Herausforderung, Login-Wall oder Netzwerkverweigerung kann die Wiederbeschaffung verhindern, selbst wenn die Datei dies zulässt. Im Gegensatz dazu ist eine absichtliche Trainingsbeschränkung kein Beweis dafür, dass eine Site in der KI-Suche unsichtbar ist. Die 13.3% Figur kombiniert Crawler-Zwecke und kann nicht als KI-Such-Ausschlussrate dargestellt werden.
Suchzugang und Trainingsberechtigung sind unterschiedliche Entscheidungen
OpenAI's Bot-Dokumentation unterscheidet OAI-SearchBot, verwendet für Suchentdeckung, von GPTBot, verwendet für potenzielles Modelltraining. Ihre Kontrollen sind unabhängig. ChatGPT-User repräsentiert benutzergerichtete Besuche und hat erneut eine andere Rolle. Eine Richtlinienüberprüfung sollte den Zweck benennen, den sie zulassen oder einschränken möchte. Anthropic-Dokumente trennen Crawler für Training, Suche und Benutzerabruf ebenfalls. Verwandeln Sie die breite Bezeichnung KI-Bot nicht in einen einzigen Berechtigungsschalter, es sei denn, das ist wirklich die Absicht des Eigentümers. Google hat seine eigenen Kontrollflächen. Unser generatives Suchleitfaden behandelt dessen Search Console-Einbindungseinstellung neben Crawl, Index und Snippet-Eignung. Google-Extended ist eine separate Kontrolle; seine Präsenz in robots.txt ersetzt nicht die Überprüfung der Sucheinstellung. Diese Unterscheidungen sind kommerziell nützlich. Ein Unternehmen kann wollen, dass seine öffentliche Dokumentation von potenziellen Kunden entdeckt wird, während es eine separate Entscheidung über das Training trifft. Weder eine Erlaubnisregel noch eine Einbindungseinstellung garantiert, dass eine Antwort die Seite zitieren wird. Sie legen einen Teil der Bedingungen fest, unter denen Entdeckung stattfinden kann.
Prüfen Sie ein wichtiges URL gegen die von Ihnen beabsichtigte Richtlinie
Wählen Sie eine Seite, die ein potenzieller Kunde finden sollte: ein nützlicher Leitfaden, Produktbeschreibung oder Entwicklerbeispiel. Dokumentieren Sie den Anbieter und den Crawler-Zweck, die anwendbare Richtlinie und die tatsächlich ausgelieferte Antwort. Halten Sie einen Zeitstempel fest und unterscheiden Sie eine echte verifizierte Anbieteranfrage von einem Test, der lediglich seinen User-Agent-Namen verwendet. Wenn der Eigentümer Suchentdeckung möchte und der relevante Suchcrawler unbeabsichtigt ausgeschlossen ist, beheben Sie diesen spezifischen Konflikt. Wenn ein Trainingsblock beabsichtigt ist, dokumentieren Sie ihn als beabsichtigt. Entfernen Sie ihn nicht ausschließlich, um die breite Bot-Bewertung grüner zu machen. Eine fehlende benannte Regel ist nicht automatisch ein Defekt. Eine Wildcard-Regel kann den Crawler regeln; wenn keine Gruppe zutrifft, behandelt der Robots-Standard diese Abwesenheit nicht als Verbot. Explizite Regeln können die Absicht dokumentieren, aber mehr Zeilen sind nicht zwangsläufig eine bessere Zugriffsrichtlinie. Nach dem Ändern der Datei, prüfen Sie die Live-Antwort. Eine vom Anbieter verwaltete Datei oder ein Cache kann sich von der Repository-Kopie unterscheiden. Dann überprüfen Sie die wichtige Seite selbst, einschließlich des endgültigen Ziels nach eventuellen Weiterleitungen. Der Artikel zu indexability conflicts erklärt, warum die Erlaubnis zum Crawlen und die Erlaubnis zum Indexieren separate Beobachtungen sind.
Messen Sie, ob der Zugriff nützliche Sichtbarkeit erlangt
Bewahren Sie die Richtlinie und die Nachweise der Antwort auf, bevor Sie nach Ergebnissen suchen. Google generative-AI-Eindrücke, Anbieterzitierungen, Verweisbesuche und nützliche Produktaktionen beantworten jeweils eine andere Frage. Erfassen Sie deren Quelle und Berichtszeitraum, anstatt sie in eine erfundene AI-Sichtbarkeitsgesamtzahl einzubeziehen. Für SEOReport ist der stärkste öffentliche Beweis eine betroffene Seite, das beabsichtigte Verhalten des Eigentümers, eine konkrete Reparatur und ein wiederholbares Verifizierungsresultat. Leser können diese Fakten bewerten, ohne das private Erkennungsrezept zu benötigen. Der AI search readiness guide verbindet diese Beobachtungen zu einer praktischen Überprüfung. Diese Korrektur ändert die Lektion vom ursprünglichen Titel. Unsere Stichprobe unterstützt eine kleine, veraltete Anzahl von Crawler-Beschränkungen. Die nützliche Arbeit besteht darin, zu entscheiden, welche Beschränkungen dem Intent des Eigentümers entsprechen, die gelieferte Seite zu prüfen und die Ergebnisse zu messen, die die gewählte Suchoberfläche tatsächlich meldet.
Erhalten Sie die vollständige Diagnose Ihrer Website
Ein belegter Bericht und ein priorisierter Aktionsplan – in einem Plan mit monatlichen Credits.