13% de Sites Auditados Bloqueiam um Rastreador de IA — Corrigindo Nosso Próprio 40.8%
Releemos cada robots.txt em nossa amostra e encontramos defeitos 2 em nosso próprio analisador. A taxa corrigida é 6 de 45 sites auditados — 13.3%, não o 40.8% que publicamos inicialmente. A divisão treinamento-vs-busca ainda decide se os assistentes de IA podem citar você.
Atualizado August 31, 2026. A versão deste artigo publicada em agosto 20 liderou com "20 de 49 sites que auditamos — 40.8%. " Esse número estava errado duas vezes. 40.8% era a proporção das execuções de auditoria individuais que falharam na verificação, não a proporção de sites distintos, e multiplicá‑la de volta em um contador de sites produziu um "20 sites" que ninguém havia contado. Pior, quando voltamos e releemos cada robots. txt na amostra contra a especificação, defeitos 2 em nosso próprio analisador resultaram em metade das falhas. As cifras corrigidas estão abaixo, e a correção agora é a metade mais útil deste artigo. Cada auditoria que executamos busca robots.txt e lê como um rastreador de IA faria. Em August 31, 2026 relebemos o arquivo de todos os 48 domínios distintos auditados em nossa janela de motor atual, e 45 deles serviram um. Dos 45, 6 sites — 13.3% — fecharam pelo menos 1 rastreador de IA principal fora do site inteiro. No extremo oposto, 8 sites não têm regras que se apliquem a rastreadores de IA — nem mesmo uma diretiva curinga para que eles obedecam. Isso é 17.8% da amostra. Isso deixa 31 sites — 68.9% da amostra — com um robots.txt que declara uma política que um rastreador de IA realmente lerá e não bloqueia nenhum deles em todo o site. Em um ano em que ChatGPT search, Perplexity e Claude citam fontes ao buscá‑las, o arquivo que a maioria dos proprietários não abriu desde o lançamento tornou‑se silenciosamente um interruptor de visibilidade. Menos pessoas o desligaram do que relatamos inicialmente. Mais de eles nunca o tocaram.
| Bloqueia pelo menos 1 rastreador de IA em todo o site | 6 | 13.3% |
| Nenhuma regra se aplica a crawlers de IA | 8 | 17.8% |
| Regras explícitas, sem bloqueios em todo o site | 31 | 68.9% |
Metodologia. A população é todos os domínios distintos com uma auditoria concluída na nossa janela de motor atual, que vai de maio 23 a August 31, 2026. Isso é 48 domínios em 228 execuções de relatório. Os veredictos armazenados carregam a resposta do analisador defeituoso, então a tabela acima não é a contagem armazenada. É uma rebusca no mesmo dia dos robôs ao vivo desses domínios. Arquivos txt, lidos em agosto 31 e avaliados com o analisador corrigido. 3 dos 48 não servem mais a um robots. txt de forma alguma, que é por isso que o denominador é 45. A amostra é auto-selecionada — esses são sites que alguém escolheu auditar — e tende a ser de pequeno a médio porte. Trate as taxas como direções para a cauda longa da web em vez da web em geral. Os domínios não são nomeados.
O que nosso analisador errou, e como o encontramos
A verificação em si é simples. Nosso motor analisa cada grupo robots.txt e avalia 6 agentes de usuário contra ele: GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, Claude-SearchBot, e CCBot. Um crawler é contado como bloqueado apenas quando o grupo que o governa carrega um Disallow: / em todo o site. Disallow parciais como Disallow: /admin registram como uma política declarada, o que é saudável, e eles passam.
Aplicar essa definição corretamente é onde falhamos. Releitura de todos os arquivos 45 revelou 2 defeitos distintos, puxando em direções opostas.
Um Disallow: vazio não é um bloqueio. RFC 9309 é explícito de que uma regra sem caminho é ignorada, o que faz do Disallow: a forma canônica de dizer permitir tudo. Yoast emite exatamente esse arquivo por padrão, e assim fazem vários hosts compartilhados. Nosso analisador tratou o valor vazio como equivalente a / e sinalizou todos os 6 rastreadores como bloqueados. 5 dos 10 sites que o motor sinalizou estavam executando um arquivo comum de permissão total: 3 deles o bloqueio padrão do Yoast literalmente, 1 deles um arquivo de linha 2 simples.
Um grupo nomeado substitui o curinga. RFC 9309 também diz que um rastreador obedece ao grupo mais específico que o nomeia e ignora User-agent: * completamente quando tal grupo existe. Nosso analisador leu cada grupo correspondente na ordem do arquivo e deixou o último vencer. Isso funciona nos dois sentidos. Uma grande plataforma social no exemplo nomeia GPTBot, ClaudeBot, e PerplexityBot com regras de caminho estreitas e depois fecha o arquivo com um curinga User-agent: * / Disallow: / — nosso analisador deu a esses 3 rastreadores nomeados o curinga do qual eles eram isentos. E o site 1 foi contado erroneamente na outra direção: ele proíbe 3 rastreadores de IA por nome perto do topo de seu arquivo, depois declara regras de curinga mais frouxas mais abaixo, e nosso analisador deixou o curinga apagar um bloqueio real e deliberado. Esse site estava passando.
Ambos os defeitos agora estão corrigidos, com testes unitários construídos a partir dos arquivos exatos que os expuseram. O efeito líquido neste exemplo: 5 sites que o analisador antigo chamava de bloqueados não são, e 1 site que ele chamava de limpo é. Os números 3 lado a lado, todos da mesma janela: os veredictos armazenados do motor leem 42.9% de 226 execuções de auditoria individuais e 21.3% de 47 sites; relembrar os arquivos ao vivo com o analisador corrigido dá 13.3% de 45 sites. Apenas o último é uma afirmação sobre sites, medido com um analisador que lê a especificação corretamente.
Uma propriedade da verificação sobrevive a tudo isso: ela ainda é conservadora. Um desafio WAF, uma regra de bot CDN, ou um bloqueio de firewall nunca aparece em robots.txt, então 13,3% permanece um piso de quantos sites realmente afastam esses rastreadores. E um site ainda pode bloquear um rastreador sem jamais digitar seu nome — um curinga de proibição abrangente escrito para um ambiente de pré‑visualização se aplica ao GPTBot exatamente como se aplica a tudo mais. 2 dos 6 bloqueadores confirmados alcançam pelo menos 1 rastreador dessa forma: um host de pré‑visualização cujo robots.txt inteiro é um bloqueio abrangente de linha 3, e uma grande plataforma cujo curinga de fechamento varre os 3 rastreadores que não nomeou.
Uma regra escrita em 2023 responde à pergunta errada em 2026
Nossa taxa corrigida agora fica abaixo do que amostras externas maiores relatam. Uma análise de março de 2026 de 10.000 sites pelo SEO Score Tools encontrou 18,7% bloqueando ativamente o GPTBot e 41,3% sem regras de robots específicas de IA. Ambas as suas cifras ficam acima das nossas — definições diferem entre amostras, nossa amostra é uma fração do tamanho, e nossa verificação conta um grupo de curinga como uma política aplicada onde a deles procura por grupos nomeados. Não estamos afirmando que nosso 13.3% anula o 18.7% deles; uma amostra de site 45 não pode. O que ambos os conjuntos de dados concordam é a forma: uma minoria da web tomou uma decisão de acesso à IA, uma fatia adicional tomou uma sem saber, e o resto não foi perguntado. A parte não considerada é a história, e nossos dados corrigidos são cuidadosos sobre qual parte isso é. Os blocos 6 que confirmamos são em sua maioria deliberados — 4 nomeiam o rastreador, e 2 desses executam a lista de sinais de conteúdo gerenciados da Cloudflare, que é uma política escrita este ano e não um resíduo. O que não podemos mostrar a partir de sites 45 é quanto da web mais ampla ainda está mantendo uma regra obsoleta; isso é o que os exemplos externos acima servem. O mecanismo vale a pena ser declarado de qualquer maneira, porque é o que torna uma regra obsoleta cara. Em 2023, quando o GPTBot apareceu pela primeira vez nos logs do servidor e o CCBot se tornou recém-notório como fonte de treinamento, a única consequência conhecida do acesso era o treinamento do modelo — então listas de bloqueio de bots circulavam, plugins enviavam alternadores de clique 1, e arquivos robots.txt herdavam proibições que ninguém re-ler desde então. A pergunta que essas regras responderam foi "quero que meu conteúdo esteja em um corpus de treinamento?" A pergunta que importa em 2026 é diferente: "quero ser encontrado e citável quando um assistente responde sobre meu tópico?" Uma regra escrita para a primeira pergunta agora responde silenciosamente a segunda.
Crawlers de treinamento e crawlers de busca merecem respostas diferentes
Os crawlers 6 que investigamos se dividem claramente em trabalhos 2, por cada documentação de bot publicada pelo operador:
- Busca e recuperação. OAI-SearchBot indexa conteúdo para que a busca ChatGPT possa exibir e vincular a ele — OpenAI documentos que esse acesso, e apenas esse acesso, determina se as páginas são consideradas para resultados de busca ChatGPT. PerplexityBot constrói o índice de busca do Perplexity. Claude-SearchBot indexa para melhorar as respostas baseadas em busca do Claude. Bloquear qualquer um desses remove você das citações desse assistente.
- Treinamento. GPTBot coleta conteúdo que pode treinar os modelos OpenAI. ClaudeBot faz o equivalente de crawling para Anthropic. CCBot alimenta o Common Crawl, o corpus aberto por trás de muitos conjuntos de dados de pesquisa e treinamento. OpenAI é explícito ao dizer que bloquear o GPTBot não afeta a inclusão na busca ChatGPT — as 2 pipelines são separadas.
Google executa a mesma divisão sob nomes diferentes: seu AI surge sobre acesso comum do Googlebot, enquanto o token separado Google-Extended controla o treinamento e a fundamentação do Gemini. Cobertamos essa maquinaria em nosso guia sobre a busca generativa de Google.
A divisão transforma uma ansiedade vaga em uma decisão de 2-partes. Bloquear rastreadores de treinamento é uma postura legítima sobre como seu conteúdo pode ser reutilizado, e não custa nada em busca por IA. Bloquear rastreadores de recuperação é uma decisão de visibilidade — a mesma categoria de auto‑indexação — e merece a mesma deliberatividade.
Escreva um robots.txt que registre a decisão
Aqui está uma política que permanece totalmente visível na busca por IA enquanto retém consentimento de treinamento — a divisão deliberada mais comum que vemos:
# Search & retrieval — open, so assistants can find and cite this siteUser-agent: OAI-SearchBotAllow: /User-agent: PerplexityBotAllow: /User-agent: Claude-SearchBotAllow: /# Training — withheld; this has no effect on AI search visibilityUser-agent: GPTBotDisallow: /User-agent: ClaudeBotDisallow: /User-agent: CCBotDisallow: /
Se você quer tudo aberto, diga explicitamente em vez de omitir — um grupo nomeado Allow: / por rastreador documenta que alguém decidiu, que é exatamente o que os 17,8% sem regras aplicáveis estão faltando.
3 etapas de verificação fecham o ciclo. Busque https://yoursite.com/robots.txt de fora da sua rede e leia o que a produção realmente serve — CDNs e plataformas podem injetar ou substituir o arquivo em seu repositório, e alguns provedores de borda enviam bloqueio de bot de IA de 1‑clique que anula totalmente suas diretrizes. Verifique quaisquer regras de WAF ou gerenciamento de bots para os mesmos agentes de usuário 6, porque permissão em robots.txt não significa nada para um rastreador que recebe um 403. Em seguida, execute a verificação novamente após cada mudança de infraestrutura; uma migração de provedor pode inverter essa chave sem tocar seu código.
1 nota sobre como nossa auditoria lê a política deliberada acima: as proibições globais no GPTBot, ClaudeBot, e CCBot ainda aparecerão como um achado. Isso é por design. Um bloqueio global de rastreador de IA deve sempre ser uma decisão afirmada, e o achado é onde você a afirma — o modo de falha que esta verificação existe para detectar é o bloqueio que ninguém lembra de ter escrito.
A auditoria de visibilidade mais barata que você fará este ano
robots.txt é 1 de 2 arquivos pelos quais seu site fala com sistemas de IA — o outro é llms.txt, onde nossos dados mostram 76% de arquivos falham nos agentes para os quais foram escritos. Ambos compartilham a mesma assinatura de falha que os blocos neste relatório: escrito uma vez, sintaticamente plausível, nunca lido de volta. Assim como nosso analisador, que é a parte desconfortável desta correção — uma regra que não foi re‑lida desde o dia em que foi escrita é exatamente o que esta verificação existe para detectar, e a nossa também não foi re‑lida. A imagem corrigida também é mais encorajadora do que o título que rodamos primeiro. 4 dos 6 sites que bloqueiam um rastreador de IA globalmente nomeando explicitamente o rastreador, e 2 desses 4 estão executando o bloqueio de sinais de conteúdo gerenciado da Cloudflare — uma política 2026 que alguém escolheu, não uma regra 2023 que ninguém re‑lê. Os blocos acidentais são os restantes, e são poucos. A lacuna maior neste exemplo não é que os sites bloqueiem os crawlers de IA; é nos sites 8 cujo robots.txt não contém nada que um crawler de IA possa ler. Ler seu próprio arquivo leva 2 minutos; o relatório gratuito lê para você, nomeia cada um dos 6 crawlers e mostra exatamente qual regra se aplica a cada um — assim a decisão registrada é a que você realmente tomou.
Veja como seu site está classificado
Get a free IA-powered SEO report with actionable findings and priority fixes for your website.
Não é necessário cadastro.