Back to articles

2 em 5 Sites que Auditamos Estão Bloqueando pelo Menos 1 Crawler de IA

SEOReport Team·
ai-crawlersrobots-txtai-searchgenerative-engine-optimizationtechnical-seodata-analysis

Audit data from 49 sites: 40.8% shut out at least 1 major AI crawler sitewide. The training-vs-search split decides whether AI assistants can cite you.

Cada auditoria que realizamos busca o robots.txt e o lê da maneira que um crawler de IA faria. Entre maio 5 e August 15, 2026, 20 dos 49 sites que auditamos — 40.8% — serviram regras que excluíram pelo menos 1 dos 6 principais crawlers de IA que investigamos, em todo o site. Outro conjunto de sites 7 (14.3%) estava no extremo oposto: nenhuma regra que se aplique a crawlers de IA, nem mesmo uma diretiva curinga para que eles obedecam. Isso deixa menos da metade da amostra — 22 sites — com um robots.txt que declara uma política explícita de crawler de IA e não bloqueia nenhum deles em todo o site. Em um ano em que ChatGPT search, Perplexity e Claude citam fontes ao buscá-las, o arquivo que a maioria dos proprietários não abriu desde o lançamento silenciosamente se tornou um interruptor de visibilidade.

Bloqueia pelo menos 1 crawler de IA em todo o site2040.8%
Nenhuma regra que se aplique a crawlers de IA714.3%
Regras explícitas, sem bloqueios em todo o site2244.9%

Metodologia: instantâneo da última auditoria concluída por domínio do nosso conjunto atual de verificações, maio 5 – August 15, 2026, anonimizado. Os denominadores por verificação variam entre 46 e 49 porque nem toda verificação é executada em todos os sites — esses 2 verificações exigem um robots.txt servido com sucesso. txt. A amostra é auto-selecionada — proprietários que realizaram uma auditoria — e tende a ser de pequeno a médio porte, então trate as taxas como diretrizes para a cauda longa da web em vez da web em geral.

AI-Crawler Posture in robots.txt Across 49 Audited Sites

Bloqueado nesses dados significa uma desautorização em todo o site no robots.txt

Nosso motor analisa cada grupo robots.txt e avalia 6 agentes de usuário contra ele: GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, Claude-SearchBot, e CCBot. Um rastreador é considerado bloqueado apenas quando um grupo que o corresponda — por nome, ou através do curinga User-agent: * — possui um Disallow: / em todo o site. Restrições parciais como Disallow: /admin registram-se como uma política explícita, o que é saudável, e elas passam. 2 propriedades dessa definição importam para ler os números. Primeiro, é conservador: um desafio WAF, uma regra de bot CDN, ou um bloqueio de firewall nunca aparece em robots.txt, então 40.8% é um piso de quantos sites realmente afastam esses rastreadores. Segundo, a cláusula curinga significa que um site pode bloquear todo rastreador de IA sem nunca digitar o nome de um rastreador de IA — uma proibição geral escrita para um ambiente de teste, ou um modelo que ninguém re-lerá em anos, se aplica ao GPTBot exatamente como se aplica a tudo o mais.

A maioria desses bloqueios responde a uma pergunta de 2023

O padrão de bloqueio que vemos corresponde ao que amostras externas maiores relatam. Uma análise de março de 2026 de 10,000 sites pelo SEO Score Tools (https://seoscore.tools/blog/llms-txt-guide/) encontrou 18.7% bloqueando ativamente o GPTBot e 41.3% não possui regras de robots específicas para IA. A cifra de sem regras deles fica mais alta que a nossa 14.3% — definições diferem entre amostras, e nossa verificação conta um grupo curinga como política aplicada — mas ambos os conjuntos de dados concordam na forma: uma grande minoria da web tomou uma decisão de acesso à IA que nunca tomou conscientemente. A parte não intencional é a história. Em 2023, quando o GPTBot apareceu pela primeira vez nos logs do servidor e o CCBot se tornou recém-notório como fonte de treinamento, a única consequência conhecida do acesso era o treinamento de modelo — então listas de bloqueio de bots circulavam, plugins enviavam 1-click toggles, e milhares de arquivos robots.txt herdaram restrições que ninguém re-lerá desde então. A pergunta que essas regras responderam foi "quero que meu conteúdo esteja em um corpus de treinamento?" A pergunta que importa em 2026 é diferente: "quero ser encontrado e citável quando um assistente responde sobre meu tópico?" Uma regra escrita para a primeira pergunta agora responde silenciosamente a segunda.

Rastreadores de treinamento e rastreadores de busca merecem respostas diferentes

Os rastreadores 6 que investigamos se dividem claramente em trabalhos 2, por cada documentação de bot publicada pelo operador:

  • Busca e recuperação. OAI-SearchBot indexa conteúdo para que a busca ChatGPT possa exibir e vincular a ele — OpenAI documentos que esse acesso, e apenas esse acesso, determina se as páginas são consideradas para resultados de busca ChatGPT. PerplexityBot constrói o índice de busca da Perplexity. Claude-SearchBot indexa para melhorar as respostas baseadas em busca do Claude. Bloquear qualquer um desses remove você das citações desse assistente.
  • Treinamento. GPTBot coleta conteúdo que pode treinar os modelos OpenAI. ClaudeBot faz o equivalente de rastreamento para Anthropic. CCBot alimenta o Common Crawl, o corpus aberto por trás de muitos conjuntos de dados de pesquisa e treinamento. OpenAI é explícito ao dizer que bloquear o GPTBot não afeta a inclusão na busca ChatGPT — os 2 pipelines são separados.

Google executa a mesma divisão sob nomes diferentes: sua IA aparece em acessos normais do Googlebot, enquanto o token separado Google-Extended controla o treinamento e a fundamentação do Gemini. Cobertamos essa mecânica em nosso guia sobre a busca generativa do Google.

graph TD A[O rastreador de IA solicita sua página] --> B{Que tipo?} B --> C["Busca e recuperação:<br/>OAI-SearchBot, PerplexityBot,<br/>Claude-SearchBot"] B --> D["Treinamento:<br/>GPTBot, ClaudeBot, CCBot"] C -->|Permitido| E[Elegível para respostas e citações de IA] C -->|Não permitido| F[Ausente das respostas desse assistente] D -->|Permitido| G[O conteúdo pode treinar modelos futuros] D -->|Não permitido| H[Sem efeito na visibilidade da busca de IA]

A divisão transforma uma ansiedade vaga em uma decisão 2-parte. Bloquear rastreadores de treinamento é uma postura legítima sobre como seu conteúdo pode ser reutilizado, e não custa nada na busca de IA. Bloquear rastreadores de recuperação é uma decisão de visibilidade — a mesma categoria de não indexação — e merece a mesma deliberatividade.

Escreva um robots.txt que registre a decisão

Aqui está uma política que permanece totalmente visível na busca de IA enquanto retém o consentimento de treinamento — a divisão deliberada mais comum que vemos:

# Search & retrieval — open, so assistants can find and cite this site
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
# Training — withheld; this has no effect on AI search visibility
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /

Se você quiser tudo aberto, diga explicitamente em vez de omitir — um grupo Allow: / nomeado por crawler documents que alguém decidiu, que é exatamente o que o 14.3% sem regras aplicáveis está faltando. Passos de verificação 3 fecham o ciclo. Busque https://yoursite.com/robots.txt de fora da sua rede e leia o que a produção realmente serve — CDNs e plataformas podem injetar ou substituir o arquivo em seu repositório, e alguns provedores de borda enviam bloqueio de AI-bot de 1 clique que anula totalmente suas diretrizes. Verifique quaisquer regras de WAF ou gerenciamento de bots para os mesmos agentes de usuário 6, porque permissão em robots.txt não significa nada para um rastreador que recebe um 403. Em seguida, reexecute a verificação após cada mudança de infraestrutura; uma migração de provedor pode inverter essa chave sem tocar seu código. 1 observação sobre como nossa auditoria lê a política deliberada acima: as proibições em todo o site no GPTBot, ClaudeBot e CCBot ainda aparecerão como um achado. Isso é por design. Um bloqueio de crawler de IA em todo o site deve sempre ser uma decisão afirmada, e a descoberta é onde você a afirma — o modo de falha que esta verificação existe para detectar é o bloqueio que ninguém lembra de ter escrito.

A auditoria de visibilidade mais barata que você fará este ano

robots.txt é 1 de 2 arquivos pelos quais seu site fala com sistemas de IA — o outro é llms.txt, onde nossos dados mostram 76% de arquivos falham nos agentes para os quais foram escritos. Ambos compartilham a mesma assinatura de falha que os blocos neste relatório: escrito uma vez, sintaticamente plausível, nunca lido de volta. Os sites em nossa amostra com postura limpa de crawler de IA não eram os maiores ou os melhor equipados. Eles eram os sites onde alguém havia aberto o arquivo desde 2023 e respondido à pergunta atual. Ler o seu leva 2 minutos; o relatório gratuito lê para você, nomeia cada um dos 6 crawlers, e mostra exatamente qual regra se aplica a cada um — assim a decisão registrada é a que você realmente fez.

Veja como seu site está classificado

Get a free IA-powered SEO report with actionable findings and priority fixes for your website.

Não é necessário cadastro.