2 de cada 5 sitios que auditamos bloquean al menos 1 rastreador de IA
Datos de auditoría de 49 sitios: el 40,8 % excluye al menos 1 rastreador de IA importante en todo el sitio. La distinción entre entrenamiento y búsqueda decide si los asistentes de IA pueden citarte.
Cada auditoría que realizamos descarga robots.txt y lo lee de la manera en que un rastreador AI lo haría. Entre mayo 5 y August 15, 2026, 20 de los 49 sitios que auditamos — 40.8% — sirvieron reglas que excluyeron al menos 1 de los 6 principales rastreadores de IA que examinamos, en todo el sitio. Otro 7 sitios (14.3%) se encontraban en el extremo opuesto: sin reglas que apliquen a rastreadores AI en absoluto, ni siquiera una directiva comodín para que los obedecieran. Eso deja menos de la mitad de la muestra — 22 sitios — con un robots.txt que declara una política explícita de rastreador AI y no bloquea ninguno de ellos a nivel de sitio. En un año en que ChatGPT search, Perplexity y Claude citan fuentes al recuperarlas, el archivo que la mayoría de los propietarios no han abierto desde el lanzamiento se ha convertido silenciosamente en un interruptor de visibilidad.
| Bloquea al menos 1 rastreador AI a nivel de sitio | 20 | 40.8% |
| No hay reglas que apliquen a rastreadores AI en absoluto | 7 | 14.3% |
| Reglas explícitas, sin bloqueos a nivel de sitio | 22 | 44.9% |
Metodología: instantánea de auditoría completada más reciente por dominio de nuestro conjunto de comprobaciones actual, mayo 5 – August 15, 2026, anonimizada. Los denominadores por comprobación varían entre 46 y 49 porque no todas las comprobaciones se ejecutan en cada sitio — estas 2 comprobaciones requieren un robots.txt servido con éxito. txt. La muestra es auto-seleccionada — propietarios que realizaron una auditoría — y se inclina hacia pequeños y medianos, por lo que trate las tasas como orientativas para la cola larga de la web en lugar de la web en general.
Bloqueado en estos datos significa una prohibición a nivel de sitio en robots.txt
Nuestro motor analiza cada grupo robots.txt y evalúa 6 agentes de usuario contra él: GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, Claude-SearchBot, y CCBot. Un rastreador se considera bloqueado solo cuando un grupo que lo coincide — por nombre, o a través del comodín User-agent: * — lleva un Disallow: / a nivel de sitio. Los bloqueos parciales como Disallow: /admin se registran como una política explícita, lo cual es saludable, y pasan.
2 las propiedades de esa definición importan para leer los números. Primero, es conservador: un desafío WAF, una regla de bot CDN, o un bloqueo de firewall nunca aparece en robots.txt, así que 40.8% es un piso sobre cuántos sitios realmente alejan a estos rastreadores. Segundo, la cláusula comodín significa que un sitio puede bloquear a cada rastreador de IA sin escribir el nombre de un rastreador de IA — un bloqueo general escrito para un entorno de pruebas, o una plantilla que nadie ha vuelto a leer en años, se aplica a GPTBot exactamente como a todo lo demás.
La mayoría de estos bloqueos responden a una pregunta de 2023
El patrón de bloqueo que vemos coincide con lo que reportan muestras externas más grandes. Un análisis de marzo de 2026 de 10,000 sitios por SEO Score Tools encontró 18.7% bloqueando activamente GPTBot y 41.3% no tiene reglas de robots específicas de IA. Su cifra de sin reglas es más alta que la nuestra 14.3% — las definiciones difieren entre muestras, y nuestra verificación cuenta un grupo comodín como una política aplicada — pero ambos conjuntos de datos coinciden en la forma: una gran minoría de la web ha tomado una decisión de acceso a IA que nunca tomó conscientemente. La parte no intencional es la historia. En 2023, cuando GPTBot apareció por primera vez en los registros del servidor y CCBot se volvió recién notorio como fuente de entrenamiento, la única consecuencia conocida del acceso era el entrenamiento del modelo — así que las listas de bloqueo de bots se difundieron, los complementos enviaron 1-clics de conmutación, y miles de archivos robots.txt heredaron bloqueos que nadie ha vuelto a leer desde entonces. La pregunta que esas reglas respondieron fue "¿quiero que mi contenido esté en un corpus de entrenamiento?" La pregunta que importa en 2026 es diferente: "¿quiero ser encontrable y citable cuando un asistente responde sobre mi tema?" Una regla escrita para la primera pregunta ahora responde silenciosamente la segunda.
Los rastreadores de entrenamiento y los rastreadores de búsqueda merecen respuestas diferentes
Los rastreadores 6 que examinamos se dividen limpiamente en trabajos 2, según la documentación de bot publicada por cada operador:
- Búsqueda y recuperación. OAI-SearchBot indexa contenido para que ChatGPT búsqueda pueda surfacear y enlazar a él — OpenAI documentos que este acceso, y solo este acceso, determina si las páginas se consideran para resultados de búsqueda ChatGPT. PerplexityBot construye el índice de búsqueda de Perplexity. Claude-SearchBot indexa para mejorar las respuestas respaldadas por búsqueda de Claude. Bloquear cualquiera de estos te elimina de las citas de ese asistente.
- Entrenamiento. GPTBot recopila contenido que puede entrenar los modelos de OpenAI. ClaudeBot hace el equivalente de rastreo para Anthropic. CCBot alimenta Common Crawl, el corpus abierto detrás de muchos conjuntos de datos de investigación y entrenamiento. OpenAI es explícito en que bloquear GPTBot no afecta la inclusión en búsqueda ChatGPT — los 2 pipelines son separados.
Google ejecuta la misma división bajo nombres diferentes: su IA aparece en el acceso ordinario de Googlebot, mientras que el token separado Google-Extended controla el entrenamiento y la fundamentación de Gemini. Cubrimos esa maquinaria en nuestra guía sobre la búsqueda generativa de Google.
La división convierte una ansiedad vaga en una decisión de 2-parte. Bloquear rastreadores de entrenamiento es una postura legítima sobre cómo se puede reutilizar tu contenido, y no te cuesta nada en búsqueda de IA. Bloquear rastreadores de recuperación es una decisión de visibilidad — la misma categoría que no indexarse — y merece la misma deliberación.
Escribe un robots.txt que registre la decisión
Aquí tienes una política que permanece totalmente visible en búsqueda de IA mientras retiene el consentimiento de entrenamiento — la división deliberada más común que vemos:
# Search & retrieval — open, so assistants can find and cite this siteUser-agent: OAI-SearchBotAllow: /User-agent: PerplexityBotAllow: /User-agent: Claude-SearchBotAllow: /# Training — withheld; this has no effect on AI search visibilityUser-agent: GPTBotDisallow: /User-agent: ClaudeBotDisallow: /User-agent: CCBotDisallow: /
Si quieres que todo esté abierto, dilo explícitamente en lugar de omitirlo — un grupo Allow: / nombrado por cada crawler que alguien decidió, que es exactamente lo que el 14.3% sin reglas aplicables está faltando.
Los pasos de verificación 3 cierran el bucle. Obtén https://yoursite.com/robots.txt desde fuera de tu red y lee lo que la producción realmente sirve — Los CDN y las plataformas pueden inyectar o sobreescribir el archivo en tu repositorio, y algunos proveedores de edge incluyen bloqueo de AI-bot de 1-click que anula tus directivas por completo. Revisa cualquier regla de WAF o gestión de bots para los mismos agentes de usuario 6, porque el permiso de robots.txt no significa nada para un rastreador que recibe un 403. Luego vuelve a ejecutar la comprobación después de cada cambio de infraestructura; una migración de proveedor puede cambiar este interruptor sin tocar tu código.
1 nota sobre cómo nuestro auditor lee la política deliberada anterior: las prohibiciones a nivel de sitio en GPTBot, ClaudeBot y CCBot seguirán apareciendo como hallazgo. Eso es por diseño. Un bloqueo de rastreador AI a nivel de sitio siempre debe ser una decisión afirmada, y el hallazgo es donde lo afirmas — el modo de falla que esta verificación existe para detectar es el bloqueo que nadie recuerda haber escrito.
La auditoría de visibilidad más barata que ejecutarás este año
robots.txt es 1 de 2 archivos a través de los cuales tu sitio habla con sistemas AI — el otro es llms.txt, donde nuestros datos muestran 76% de archivos fallan los agentes para los que fueron escritos. Ambos comparten la misma firma de falla que los bloques en este informe: escrito una vez, sintácticamente plausible, nunca leído de nuevo. Los sitios en nuestra muestra con una postura limpia de rastreador AI no eran los más grandes ni los mejor dotados. Eran los sitios donde alguien había abierto el archivo desde 2023 y respondió la pregunta actual. Leer el tuyo toma 2 minutos; el informe gratuito lo lee por ti, nombra cada uno de los 6 rastreadores, y muestra exactamente qué regla se aplica a cada uno — así que la decisión registrada es la que realmente hiciste.
Ver cómo se clasifica tu sitio
Get a free IA-powered SEO report with actionable findings and priority fixes for your website.
Sin registro obligatorio.