Back to articles

13% de Sitios Auditado Bloquean un Rastreador IA — Corrigiendo Nuestro Propio 40.8%

SEOReport Team·
ai-crawlersrobots-txtai-searchgenerative-engine-optimizationtechnical-seodata-analysis

Releemos cada robots.txt en nuestra muestra y encontramos 2 defectos en nuestro propio analizador. La tasa corregida es 6 de 45 sitios auditados — 13.3%, no el 40.8% que publicamos primero. El recuento corregido combina rastreadores de entrenamiento y búsqueda; no es una tasa de exclusión de búsqueda IA.

Actualizado August 31, 2026. La versión de este artículo publicada en agosto 20 encabezó con "20 de los 49 sitios que auditamos — 40.8%. " Ese número fue incorrecto dos veces. 40.8% fue la proporción de ejecuciones de auditoría individuales que fallaron la verificación, no la proporción de sitios distintos, y multiplicarlo de nuevo sobre un recuento de sitios produjo un "20 sitios" que nadie había contado jamás. Malo, cuando volvimos y releímos cada robots. txt en la muestra contra la especificación, 2 defectos en nuestro propio analizador resultaron ser la fabricación de la mitad de los fallos. Las cifras corregidas están a continuación, y la corrección ahora es la mitad más útil de este artículo. En August 31, 2026 volvimos a obtener el archivo de todos los 48 dominios distintos auditados en nuestra ventana de motor actual, y 45 de ellos sirvieron uno. De esos 45, 6 sitios — 13.3% — cerraron al menos 1 rastreador IA principal fuera de todo el sitio. En el extremo opuesto, 8 sitios no tienen reglas que apliquen a rastreadores IA en absoluto — ni siquiera una directiva comodín para que los obedecieran. Eso es 17.8% de la muestra. Eso deja 31 sitios — 68.9% de la muestra — con un robots.txt que declara una política que un rastreador IA realmente leerá y no bloquea ninguno de ellos a nivel de sitio. El recuento no revela cuántos propietarios revisaron deliberadamente estas políticas, y una restricción solo en un rastreador de entrenamiento no establece pérdida de visibilidad de búsqueda.

Bloquea al menos 1 rastreador IA a nivel de sitio613.3%
No hay reglas que apliquen a rastreadores IA en absoluto817.8%
Reglas explícitas, sin bloqueos a nivel de sitio3168.9%

Metodología. La población es cada dominio distinto con una auditoría completada en nuestra ventana de motor actual, que va desde mayo 23 hasta August 31, 2026. Ese es 48 dominios a través de 228 ejecuciones de informe. Los veredictos almacenados llevan la respuesta del analizador defectuoso, por lo que la tabla anterior no es el conteo almacenado. Es una reobtención del mismo día de los robots en vivo de esos dominios. Archivos txt, leídos en agosto 31 y evaluados con el analizador corregido. 3 de los 48 ya no sirven robots. txt en absoluto, lo que explica por qué el denominador es 45. La muestra es auto-seleccionada — estos son sitios que alguien eligió auditar — y tiende a ser de tamaño pequeño a medio. Tratar las tasas como direccionales para la cola larga de la web en lugar de la web en general. Los dominios no están nombrados.

AI-Crawler Posture in robots.txt Across 45 Audited Sites (re-read 2026-08-31)

La corrección forma parte de la evidencia

Releer los archivos expuso manejo incorrecto de valores vacíos de disallow y la relación entre grupos de rastreadores nombrados y reglas comodín. RFC 9309 suministra la interpretación pública: una ruta vacía se ignora, y los grupos nombrados aplicables tienen prioridad sobre el grupo comodín. Los grupos para el mismo rastreador pueden necesitar combinarse; el orden de los archivos por sí solo no es una política fiable. Los defectos fueron corregidos y las pruebas de regresión conservan los casos que los expusieron. En esta muestra, 5 sitios previamente etiquetados como bloqueados no lo eran, mientras que 1 previamente etiquetados como claros fueron bloqueados. El resultado corregido es una observación con fecha de archivos recuperados. No establece el acceso de hoy ni una tasa de prevalencia a nivel web. robots.txt es solo una superficie de acceso. Un desafío CDN, muro de inicio de sesión o rechazo de red pueden impedir la recuperación incluso cuando el archivo lo permite. Por el contrario, una restricción de entrenamiento deliberada no prueba que un sitio sea invisible en la búsqueda AI. La figura 13.3% combina propósitos de rastreo y no puede presentarse como una tasa de exclusión de búsqueda AI.

El acceso a la búsqueda y el permiso de entrenamiento son decisiones diferentes

OpenAI's bot documentation distingue OAI-SearchBot, usado para descubrimiento de búsqueda, de GPTBot, usado para posible entrenamiento del modelo. Sus controles son independientes. ChatGPT-User representa visitas dirigidas por el usuario y tiene un papel diferente nuevamente. Una revisión de política debe nombrar el propósito que pretende permitir o restringir. Anthropic documents separate crawlers para entrenamiento, búsqueda y recuperación de usuarios también. No conviertas la frase amplia AI bot en un único interruptor de permiso a menos que esa sea realmente la intención del propietario. Google tiene sus propias superficies de control. Nuestra generative search guide cubre su configuración de inclusión en Search Console junto con la elegibilidad de rastreo, indexación y fragmento. Google-Extended es un control separado; su presencia en robots.txt no sustituye la revisión de la configuración de búsqueda. Estas distinciones son comercialmente útiles. Un negocio puede querer que su documentación pública sea descubierta por clientes potenciales mientras toma una decisión separada sobre el entrenamiento. Ni una regla de permitir ni una configuración de inclusión garantizan que una respuesta citará la página. Establecen parte de las condiciones bajo las cuales puede ocurrir el descubrimiento.

Revisa una importante URL contra la política que pretendías

Elige una página que un cliente potencial debería poder encontrar: una guía útil, explicación de producto o ejemplo de desarrollador. Registra al proveedor y el propósito del rastreador, la política aplicable y la respuesta realmente entregada. Mantén una marca de tiempo y distingue una solicitud de proveedor verificada real de una prueba que solo usa su nombre de user-agent. Si el propietario quiere descubrimiento de búsqueda y el rastreador de búsqueda relevante está prohibido involuntariamente, repara ese conflicto específico. Si un bloqueo de entrenamiento es deliberado, regístralo como deliberado. No lo elimines solo para hacer que la puntuación del bot sea más verde. Una regla nombrada faltante no es automáticamente un defecto. Una regla comodín puede gobernar el rastreador; si no se aplica ningún grupo, el estándar de robots no trata esa ausencia como una prohibición. Las reglas explícitas pueden documentar la intención, pero más líneas no son inherentemente mejor política de acceso. Después de cambiar el archivo, inspecciona la respuesta en vivo. Un archivo gestionado por el proveedor o una caché pueden diferir de la copia del repositorio. Luego verifica la página importante en sí, incluyendo el destino final después de cualquier redirección. El artículo sobre conflictos de indexabilidad explica por qué el permiso para rastrear y el permiso para indexar son observaciones separadas.

Mide si el acceso se vuelve una visibilidad útil

Conserva la política y la evidencia de respuesta antes de buscar resultados. Google impresiones de generative-AI, citas de proveedores, visitas de referencia y acciones de producto útiles responden cada una a una pregunta diferente. Registra su origen y ventana de reporte en lugar de incluirlos en un total inventado de visibilidad AI. Para SEOReport, la evidencia pública más fuerte es una página afectada, el comportamiento previsto por el propietario, una reparación concreta y un resultado de verificación repetible. Los lectores pueden evaluar esos hechos sin necesitar la receta de detección privada. La guía de preparación para búsqueda AI conecta estas observaciones en una revisión práctica. Esta corrección cambia la lección del titular original. Nuestra muestra respalda un pequeño recuento anticuado de restricciones de rastreo. El trabajo útil es decidir qué restricciones coinciden con la intención del propietario, verificar la página entregada y medir los resultados que la superficie de búsqueda elegida realmente reporta.

Obtenga el diagnóstico completo de su sitio

Un informe basado en evidencia y un plan de acción priorizado, con un plan de créditos mensuales.