Back to articles

13% de Sitios Auditados Bloquean un Rastreador IA — Corrigiendo Nuestro Propio 40.8%

SEOReport Team·
ai-crawlersrobots-txtai-searchgenerative-engine-optimizationtechnical-seodata-analysis

Releemos cada robots.txt en nuestra muestra y encontramos 2 defectos en nuestro propio analizador. La tasa corregida es 6 de 45 sitios auditados — 13.3%, no el 40.8% que publicamos primero. La división entrenamiento-vs-búsqueda sigue decidiendo si los asistentes IA pueden citarte.

Actualizado August 31, 2026. La versión de este artículo publicada el agosto 20 encabezaba con "20 de los 49 sitios que auditamos — 40.8%. " Ese número estaba equivocado dos veces. 40.8% fue la proporción de ejecuciones de auditoría individuales que fallaron la verificación, no la proporción de sitios distintos, y multiplicarlo de nuevo sobre un recuento de sitios produjo un "20 sitios" que nadie había contado jamás. Peor, cuando volvimos y releímos cada robots. txt en la muestra contra la especificación, 2 defectos en nuestro propio analizador resultaron ser la causa de la mitad de los fallos. Las cifras corregidas están abajo, y la corrección ahora es la mitad más útil de este artículo. Cada auditoría que realizamos descarga robots.txt y lo lee de la manera que un rastreador IA lo haría. En August 31, 2026 volvimos a descargar el archivo de todos los 48 dominios distintos auditados en nuestra ventana de motor actual, y 45 de ellos sirvieron uno. De esos 45, 6 sitios — 13.3% — cerraron al menos 1 rastreador IA principal fuera de todo el sitio. En el extremo opuesto, 8 sitios no tienen reglas que apliquen a rastreadores IA en absoluto — ni siquiera una directiva comodín para que los obedecieran. Eso es 17.8% de la muestra. Eso deja 31 sitios — 68.9% de la muestra — con un robots.txt que indica una política que un rastreador IA realmente leerá y no bloquea ninguno de ellos a nivel de sitio. En un año cuando ChatGPT búsqueda, Perplexity y Claude citan fuentes al recuperarlas, el archivo que la mayoría de los propietarios no han abierto desde el lanzamiento se ha convertido silenciosamente en un interruptor de visibilidad. Menos personas lo han apagado de lo que reportamos primero. Más de ellos nunca lo han tocado en absoluto.

Bloquea al menos 1 rastreador IA a nivel de sitio613.3%
No reglas aplican a rastreadores de IA en absoluto817.8%
Reglas explícitas, sin bloqueos a nivel de sitio3168.9%

Metodología. La población es cada dominio distinto con una auditoría completada en nuestra ventana de motor actual, que va desde mayo 23 hasta August 31, 2026. Eso son 48 dominios en 228 ejecuciones de informe. Los veredictos almacenados llevan la respuesta del analizador defectuoso, por lo que la tabla anterior no es el conteo almacenado. Es una reobtención del mismo día de los robots en vivo de esos dominios. Archivos txt, leídos en agosto 31 y evaluados con el analizador corregido. 3 de los 48 ya no sirven robots. txt en absoluto, por lo que el denominador es 45. La muestra es auto-seleccionada — estos son sitios que alguien eligió auditar — y tiende a ser de tamaño pequeño a medio. Trata las tasas como direccionales para la cola larga de la web en lugar de la web en general. Los dominios no están nombrados.

AI-Crawler Posture in robots.txt Across 45 Audited Sites (re-read 2026-08-31)

Lo que nuestro analizador falló y cómo lo encontramos

La propia verificación es simple. Nuestro motor analiza cada grupo robots.txt y evalúa 6 agentes de usuario contra él: GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, Claude-SearchBot, y CCBot. Un rastreador se cuenta como bloqueado solo cuando el grupo que lo gobierna lleva un Disallow: / a nivel de sitio. Los prohibiciones parciales como Disallow: /admin se registran como una política declarada, lo cual es saludable, y pasan. Aplicar esa definición correctamente es donde fallamos. Releer todos los archivos 45 dio 2 defectos distintos, tirando en direcciones opuestas. Un Disallow: vacío no es un bloqueo. RFC 9309 es explícito en que una regla sin ruta se ignora, lo que hace que Disallow: sea la forma canónica de decir permitir todo. Yoast emite exactamente ese archivo por defecto, y lo hacen varios hosts compartidos. Nuestro analizador trató el valor vacío como equivalente a / y marcó los 6 rastreadores como bloqueados. 5 de los 10 sitios que el motor marcó estaban ejecutando un archivo de permiso total: 3 de ellos el bloque por defecto de Yoast literalmente, 1 de ellos un archivo de línea 2-linea. Un grupo nombrado anula el comodín. RFC 9309 también dice que un rastreador obedece el grupo más específico que lo nombra e ignora User-agent: * por completo cuando tal grupo existe. Nuestro analizador leyó cada grupo coincidente en orden de archivo y dejó que el último ganara. Eso corta en ambas direcciones. Una gran plataforma social en la muestra nombra GPTBot, ClaudeBot, y PerplexityBot con reglas de ruta estrecha y luego cierra el archivo con un comodín User-agent: * / Disallow: / — nuestro analizador dio a esos 3 rastreadores nombrados el comodín del que estaban exentos. Y el sitio 1 se contó mal en la otra dirección: desautoriza 3 rastreadores de IA por nombre cerca de la parte superior de su archivo, luego declara reglas de comodín más laxas más abajo, y nuestro analizador dejó que el comodín borre un bloqueo real y deliberado. Ese sitio había estado pasando. Ambos defectos ahora están arreglados, con pruebas unitarias construidas a partir de los archivos exactos que los expusieron. El efecto neto en esta muestra: 5 sitios que el analizador antiguo llamaba bloqueados no lo son, y 1 sitio que llamó limpio es. Los números 3 lado a lado, todos del mismo ventana: los veredictos almacenados del motor leídos 42.9% de 226 ejecuciones de auditoría individuales y 21.3% de 47 sitios; volver a leer los archivos en vivo con el analizador corregido da 13.3% de 45 sitios. Solo el último es una afirmación sobre sitios, medido con un analizador que lee la especificación correctamente. Una propiedad de la verificación sobrevive a todo esto: sigue siendo conservadora. Un desafío WAF, una regla de bot CDN, o un bloqueo de firewall nunca aparece en robots.txt, así que el 13,3% sigue siendo un piso sobre cuántos sitios realmente rechazan estos rastreadores. Y un sitio aún puede bloquear un rastreador sin escribir su nombre — un comodín de desautorización escrito para un entorno de vista previa se aplica a GPTBot exactamente como a todo lo demás. 2 de los 6 bloqueadores confirmados llegan al menos a 1 rastreador de esa manera: un host de vista previa cuyo robots.txt completo es un desautorización de línea 3-linea, y una gran plataforma cuyo comodín de cierre barre los 3 rastreadores que no nombró.

Una regla escrita en 2023 responde a la pregunta equivocada en 2026

Nuestra tasa corregida ahora está por debajo de lo que reportan muestras externas más grandes. Un análisis de marzo de 2026 de 10,000 sitios por SEO Score Tools encontró que el 18,7% bloquea activamente GPTBot y el 41,3% no tiene reglas de robots específicas de IA en absoluto. Ambas de sus cifras están por encima de las nuestras — las definiciones difieren entre muestras, nuestra muestra es una fracción de su tamaño, y nuestra verificación cuenta un grupo de comodín como una política aplicada donde la suya busca grupos nombrados. No estamos afirmando que nuestro 13.3% revierte su 18.7%; una muestra de sitio 45 no puede. Lo que ambos conjuntos de datos acuerdan es la forma: una minoría de la web ha tomado una decisión de acceso a IA, una fracción adicional lo hizo sin saberlo, y el resto no ha sido preguntado. La parte no considerada es la historia, y nuestros datos corregidos son cuidadosos sobre cuál parte es esa. Los bloques 6 que confirmamos son mayormente deliberados — 4 nombran el rastreador, y 2 de esos ejecutan la lista de señales de contenido gestionado de Cloudflare, que es una política escrita este año y no un residuo. Lo que no podemos mostrar desde 45 sitios es cuánta parte del web más amplio sigue llevando una regla obsoleta; eso es lo que los ejemplos externos anteriores demuestran. El mecanismo vale la pena mencionarlo de todos modos, porque es lo que hace que una regla obsoleta sea costosa. En 2023, cuando GPTBot apareció por primera vez en los registros del servidor y CCBot se volvió recién notorio como fuente de entrenamiento, la única consecuencia conocida del acceso era el entrenamiento del modelo — así que se difundieron listas de bloqueo de bots, se enviaron complementos con interruptores de clic 1, y los archivos robots.txt heredaron prohibiciones que nadie ha vuelto a leer desde entonces. La pregunta que esas reglas respondieron fue "¿quiero que mi contenido esté en un corpus de entrenamiento?" La pregunta que importa en 2026 es diferente: "¿quiero ser encontrable y citable cuando un asistente responde sobre mi tema?" Una regla escrita para la primera pregunta ahora responde silenciosamente la segunda.

Los rastreadores de entrenamiento y los rastreadores de búsqueda merecen respuestas diferentes

Los rastreadores 6 que examinamos se dividen claramente en trabajos 2, según la documentación publicada del bot de cada operador:

  • Búsqueda y recuperación. OAI-SearchBot indexa contenido para que ChatGPT búsqueda pueda mostrarlo y enlazarlo — OpenAI documentos que este acceso, y solo este acceso, determina si las páginas se consideran para los resultados de ChatGPT búsqueda. PerplexityBot construye el índice de búsqueda de Perplexity. Claude-SearchBot indexa para mejorar las respuestas respaldadas por búsqueda de Claude. Bloquear cualquiera de estos te elimina de las citas de ese asistente.
  • Entrenamiento. GPTBot recopila contenido que puede entrenar los modelos de OpenAI. ClaudeBot hace el equivalente de rastreo para Anthropic. CCBot alimenta Common Crawl, el corpus abierto detrás de muchos conjuntos de datos de investigación y entrenamiento. OpenAI es explícito en que bloquear GPTBot no afecta la inclusión en ChatGPT búsqueda — los 2 pipelines son separados.

Google ejecuta la misma división bajo nombres diferentes: su IA se despliega sobre el acceso ordinario de Googlebot, mientras que el token separado Google-Extended controla el entrenamiento y la fundamentación de Gemini. Cubrimos esa maquinaria en nuestra guía sobre la búsqueda generativa de Google.

graph TD A[El rastreador de IA solicita tu página] --> B{Qué tipo?} B --> C["Búsqueda y recuperación:<br/>OAI-SearchBot, PerplexityBot,<br/>Claude-SearchBot"] B --> D["Entrenamiento:<br/>GPTBot, ClaudeBot, CCBot"] C -->|Permitido| E[Elegible para respuestas e citas de IA] C -->|No permitido| F[Ausente de las respuestas de ese asistente] D -->|Permitido| G[El contenido puede entrenar modelos futuros] D -->|No permitido| H[No afecta la visibilidad de búsqueda de IA]

La división convierte una ansiedad vaga en una decisión de 2 partes. Bloquear los rastreadores de entrenamiento es una postura legítima sobre cómo se puede reutilizar tu contenido, y no te cuesta nada en la búsqueda de IA. Bloquear los rastreadores de recuperación es una decisión de visibilidad — la misma categoría que no indexarse — y merece la misma deliberación.

Escribe un robots.txt que registre la decisión

Aquí tienes una política que permanece totalmente visible en la búsqueda de IA mientras retiene el consentimiento de entrenamiento — la división deliberada más común que vemos:

# Search & retrieval — open, so assistants can find and cite this site
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
# Training — withheld; this has no effect on AI search visibility
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /

Si quieres que todo esté abierto, dilo explícitamente en lugar de omitirlo — un grupo Allow: / nombrado por rastreador documenta que alguien decidió, lo cual es exactamente lo que los 17,8 % sin reglas aplicables están perdiendo. 3 los pasos de verificación cierran el bucle. Obtén https://yoursite.com/robots.txt desde fuera de tu red y lee lo que realmente sirve la producción — los CDN y las plataformas pueden inyectar o anular el archivo en tu repositorio, y algunos proveedores de borde envían bloqueo de bot de IA de un clic que anula por completo tus directivas. Revisa cualquier regla de WAF o gestión de bots para los mismos agentes de usuario 6, porque el permiso de robots.txt no significa nada para un rastreador que recibe un 403. Luego vuelve a ejecutar la comprobación después de cada cambio de infraestructura; una migración de proveedor puede cambiar este interruptor sin tocar tu código. Una nota sobre cómo nuestro auditor lee la política deliberada anterior: las prohibiciones a nivel de sitio en GPTBot, ClaudeBot, y CCBot seguirán apareciendo como hallazgo. Eso es por diseño. Un bloqueo de rastreador de IA a nivel de sitio siempre debe ser una decisión afirmada, y el hallazgo es donde lo afirmas — el modo de falla que esta comprobación existe para detectar es el bloqueo que nadie recuerda haber escrito.

La auditoría de visibilidad más barata que ejecutarás este año

robots.txt es 1 de 2 archivos a través de los cuales tu sitio habla con sistemas de IA — lo otro es llms.txt, donde nuestros datos muestran 76% de archivos fallan los agentes para los que fueron escritos. Ambos comparten la misma firma de falla que los bloques en este informe: escritos una vez, sintácticamente plausibles, nunca leídos de nuevo. Así lo hizo nuestro analizador, que es la parte incómoda de esta corrección — una regla que no se ha vuelto a leer desde el día que se escribió es exactamente lo que esta comprobación existe para detectar, y la nuestra tampoco se volvió a leer. La imagen corregida también es más alentadora que el titular que ejecutamos primero. 4 de los sitios 6 que bloquean un rastreador de IA a nivel de sitio nombrado explícitamente, y 2 de esos 4 están ejecutando el bloqueo de señales de contenido gestionado de Cloudflare — una política 2026 que alguien eligió, no una regla 2023 que nadie volvió a leer. Los bloques accidentales son los restantes, y son un número pequeño. La brecha mayor en esta muestra no es que los sitios bloqueen a los rastreadores de IA; es que los sitios 8 cuyo robots.txt no contiene nada que un rastreador de IA pueda leer en absoluto. Leer tu propio archivo lleva 2 minutos; el free report lo lee por ti, nombra cada uno de los 6 rastreadores y muestra exactamente qué regla se aplica a cada uno — así que la decisión registrada es la que tú realmente tomaste.

Ver cómo se clasifica tu sitio

Get a free IA-powered SEO report with actionable findings and priority fixes for your website.

Sin registro obligatorio.