13% de Sites Auditados Bloqueiam um Rastreador de IA — Corrigindo Nosso Próprio 40.8%
Releemos cada robots.txt em nossa amostra e encontramos 2 defeitos em nosso próprio analisador. A taxa corrigida é 6 de 45 sites auditados — 13.3%, não o 40.8% que publicamos inicialmente. A contagem corrigida combina rastreadores de treinamento e de busca; não é uma taxa de exclusão de busca por IA.
Atualizado August 31, 2026. A versão deste artigo publicada em agosto 20 liderou com "20 de 49 sites que auditamos — 40.8%." Esse número estava errado duas vezes. 40.8% era a participação das execuções de auditoria individuais que falharam na verificação, não a participação de sites distintos, e multiplicá‑la de volta em uma contagem de sites produziu um "20 sites" que ninguém havia contado. Pior, quando voltamos e relemos cada robots.txt na amostra contra a especificação, 2 defeitos em nosso próprio analisador acabaram por fabricar metade das falhas. As cifras corrigidas estão abaixo, e a correção agora é a metade mais útil deste artigo.
Em August 31, 2026 rebuscamos o arquivo de todos os 48 domínios distintos auditados em nossa janela de motor atual, e 45 deles serviram um. Dos esses 45, 6 sites — 13.3% — fecharam pelo menos 1 rastreador de IA principal de todo o site. No extremo oposto, 8 sites não têm regras que se apliquem a rastreadores de IA — nem mesmo uma diretiva curinga para que eles obedecam. Isso é 17.8% da amostra.
Isso deixa 31 sites — 68.9% da amostra — com um robots.txt que declara uma política que um rastreador de IA realmente lerá e não bloqueia nenhum deles em todo o site. A contagem não revela quantos proprietários revisaram deliberadamente essas políticas, e uma restrição apenas a um rastreador de treinamento não estabelece perda de visibilidade de busca.
| Bloqueia pelo menos 1 rastreador de IA em todo o site | 6 | 13.3% |
| Nenhuma regra que se aplique a rastreadores de IA | 8 | 17.8% |
| Regras explícitas, sem bloqueios em todo o site | 31 | 68.9% |
Metodologia. A população é cada domínio distinto com uma auditoria concluída em nossa janela de motor atual, que vai de maio 23 a August 31, 2026. Isso é 48 domínios em 228 execuções de relatório. Os veredictos armazenados carregam a resposta do analisador defeituoso, então a tabela acima não é a contagem armazenada. É uma rebusca no mesmo dia dos arquivos robots.txt ao vivo desses domínios, lida em agosto 31 e avaliada com o analisador corrigido. 3 dos 48 não servem mais nenhum robots.txt, o que explica por que o denominador é 45. A amostra é auto-selecionada — esses são sites que alguém escolheu auditar — e tende a ser de pequeno a médio porte. Trate as taxas como direções para a cauda longa da web em vez da web em geral. Os domínios não são nomeados.
A correção faz parte da evidência
Releitura dos arquivos expôs tratamento incorreto de valores vazios de disallow e a relação entre grupos de rastreador nomeados e regras de curinga. RFC 9309 fornece a interpretação pública: um caminho vazio é ignorado, e grupos nomeados aplicáveis têm precedência sobre o grupo de curinga. Grupos para o mesmo rastreador podem precisar ser combinados; a ordem dos arquivos por si só não é uma política confiável.
Os defeitos foram corrigidos e os testes de regressão preservam os casos que os expuseram. Nesta amostra, 5 sites previamente rotulados como bloqueados não foram, enquanto 1 previamente rotulados como claros foram bloqueados. O resultado corrigido é uma observação datada dos arquivos buscados. Não estabelece o acesso de hoje ou uma taxa de prevalência em toda a web.
robots.txt é apenas uma superfície de acesso. Um desafio CDN, parede de login ou recusa de rede pode impedir a recuperação mesmo quando o arquivo o permite. Por outro lado, uma restrição de treinamento deliberada não prova que um site é invisível na busca por IA. A figura 13.3% combina propósitos de rastreador e não pode ser apresentada como taxa de exclusão de busca por IA.
Acesso de busca e permissão de treinamento são decisões diferentes
OpenAI's bot documentation distingue OAI-SearchBot, usado para descoberta de busca, de GPTBot, usado para potencial treinamento de modelo. Seus controles são independentes. ChatGPT-User representa visitas direcionadas pelo usuário e tem um papel diferente novamente. Uma revisão de política deve nomear o propósito que pretende permitir ou restringir.
Documentos Anthropic separam rastreadores para treinamento, busca e recuperação de usuários também. Não transforme a frase ampla “AI bot” em um único interruptor de permissão, a menos que essa seja realmente a intenção do proprietário.
Google tem suas próprias superfícies de controle. Nosso guia de busca generativa cobre a configuração de inclusão do Search Console junto com rastreamento, indexação e elegibilidade de snippet. Google-Extended é um controle separado; sua presença em robots.txt não substitui a revisão da configuração de Busca.
Essas distinções são comercialmente úteis. Uma empresa pode querer que sua documentação pública seja descoberta por clientes em potencial enquanto toma uma decisão separada sobre treinamento. Nem uma regra de permitir nem uma configuração de inclusão garantem que uma resposta citarei a página. Elas estabelecem parte das condições sob as quais a descoberta pode ocorrer.
Revise um importante URL contra a política que você pretendia
Escolha uma página que um cliente em potencial deva ser capaz de encontrar: um guia útil, explicação de produto ou exemplo de desenvolvedor. Registre o provedor e o propósito do rastreador, a política aplicável e a resposta realmente entregue. Mantenha um carimbo de data/hora e diferencie um pedido de provedor verificado real de um teste que apenas usa seu nome de user-agent.
Se o proprietário quiser descoberta por busca e o rastreador de busca relevante for inadvertidamente proibido, corrija esse conflito específico. Se um bloqueio de treinamento for deliberado, registre-o como deliberado. Não o remova apenas para tornar a pontuação do bot mais verde.
Uma regra nomeada ausente não é automaticamente um defeito. Uma regra curinga pode governar o rastreador; se nenhum grupo se aplicar, o padrão robots não trata essa ausência como proibição. Regras explícitas podem documentar intenção, mas mais linhas não são inerentemente melhor na política de acesso.
Após alterar o arquivo, inspecione a resposta ao vivo. Um arquivo ou cache gerenciado pelo provedor pode diferir da cópia do repositório. Em seguida, verifique a própria página importante, incluindo o destino final após quaisquer redirecionamentos. O artigo de conflitos de indexabilidade explica por que permissão para rastrear e permissão para indexar são observações separadas.
Meça se o acesso se torna visibilidade útil.
Preserve a política e a evidência de resposta antes de procurar resultados. Google impressões de generative-AI, citações de provedor, visitas de referência e ações de produto úteis cada uma responde a uma pergunta diferente. Registre sua origem e janela de relatório em vez de agregá-las em um total de visibilidade de IA inventado.
Para SEOReport, a evidência pública mais forte é uma página afetada, o comportamento pretendido do proprietário, um reparo concreto e um resultado de verificação repetível. Os leitores podem avaliar esses fatos sem precisar da receita de detecção privada. O guia de prontidão de busca por IA conecta essas observações em uma revisão prática.
Esta correção muda a lição do título original. Nossa amostra apoia uma contagem pequena e datada de restrições de rastreador. O trabalho útil é decidir quais restrições correspondem à intenção do proprietário, verificar a página entregue e medir os resultados que a superfície de busca escolhida realmente relata.
Obtenha o diagnóstico completo do seu site
Um relatório baseado em evidências e um plano de ação priorizado, em um plano com créditos mensais.