Back to articles

2 在 5 我们审计的网站中,至少阻止了 1 AI 爬虫

SEOReport Team·
ai-crawlersrobots-txtai-searchgenerative-engine-optimizationtechnical-seodata-analysis

Audit data from 49 sites: 40.8% shut out at least 1 major AI crawler sitewide. The training-vs-search split decides whether AI assistants can cite you.

我们每次审计都会获取 robots.txt 并以 AI 爬虫的方式读取它. 在 5 月至 August 15, 2026 月之间,我们审计的 49 网站中,20 的网站——40.8%——提供了阻止至少 1 的 6 主要 AI 爬虫的规则,覆盖整个网站. 另一个 7 网站(14.3%)则处于相反的极端:根本没有适用于 AI 爬虫的规则,甚至没有给它们遵守的通配符指令. 这意味着样本中不到一半——22 网站——拥有声明明确 AI 爬虫政策且未全站阻止任何 AI 爬虫的 robots.txt. 在 ChatGPT 搜索、Perplexity 和 Claude 通过获取来源来引用来源的一年里,文件中大多数所有者自发布以来从未打开的文件悄然成为可见性开关。

至少阻止 1 AI 爬虫全站2040.8%
根本没有适用于 AI 爬虫的规则714.3%
明确规则,无全站阻止2244.9%

方法论:每个域名的最新完成审计快照来自我们当前的检查集,时间为 5 月至 August 15, 2026 月,已匿名化。 每次检查的分母在 46 与 49 之间变化,因为并非每次检查都在每个网站上运行——这些 2 检查需要成功提供 robots.txt。 txt. 样本为自选——仅包含已进行审计的所有者——并倾向于中小型网站,因此请将这些比率视为网络长尾的方向性指标,而非整个网络的代表。

AI-Crawler Posture in robots.txt Across 49 Audited Sites

在此数据中被阻止意味着 robots.txt 中全站禁止。

我们的引擎会解析每个 robots.txt 组,并评估 6 个用户代理:GPTBot、OAI-SearchBot、PerplexityBot、ClaudeBot、Claude-SearchBot 和 CCBot。 只有当一个匹配它的组——按名称或通过 User-agent: * 通配符——携带全站 Disallow: / 时,爬虫才算被阻止。 像 Disallow: /admin 这样的部分禁止会被视为明确的策略,这很健康,它们会通过。 2 该定义的属性对读取数字很重要. 首先,它是保守的:WAF 挑战、CDN 机器人规则或防火墙阻止从未出现在 robots.txt 中,因此 40.8% 是实际将这些爬虫拒之门外的网站数量的下限。 其次,通配符条款意味着一个网站可以阻止每个 AI 爬虫,而不必输入 AI 爬虫的名称——一条为暂存环境编写的 blanket disallow,或多年未被重新阅读的模板,正如它对 GPTBot 的适用方式一样,也适用于其他所有内容.

这些阻止中的大多数回答了 2023 的问题

我们看到的阻止模式与更大规模的外部样本报告相匹配. 一份对 10,000 个网站的 2026 年 3 月 SEO Score Tools 分析 发现 18.7% 积极阻止 GPTBot,41.3% 完全没有 AI 专用的 robots 规则。 他们的无规则数字高于我们的 14.3%——样本之间的定义不同,我们的检查将通配符组计为已应用的策略——但两个数据集在形状上达成一致:网络上有相当少数的网站做出了 AI 访问决策,却从未有意识地做出. 无意的部分是故事. 在 2023 中,当 GPTBot 首次出现在服务器日志中,CCBot 作为训练来源变得新近臭名昭著时,已知的访问后果仅是模型训练——于是机器人阻止列表流传,插件发布了 1-点击切换,成千上万的 robots.txt 文件继承了自从未被重新阅读的禁止项. 那些规则回答的问题是“我是否想让我的内容出现在训练语料库中?” 在 2026 中真正重要的问题不同:“我是否想在助手回答我的主题时被发现并被引用?” 为第一个问题编写的规则现在悄悄回答了第二个.

训练爬虫和搜索爬虫需要不同的答案

我们探测的 6 爬虫在 2 任务中干净地分离,每个运营商发布的机器人文档如下:

  • 搜索与检索。 OAI-SearchBot 索引内容,以便 ChatGPT 搜索能够检索并链接到它——OpenAI 文档表明此访问,且仅此访问,决定页面是否被考虑进入 ChatGPT 搜索结果。 PerplexityBot 构建 Perplexity 的搜索索引. Claude-SearchBot 索引以改进 Claude 的搜索支持答案。 阻止任何一个都会让你从该助手的引用中消失.
  • 训练。 GPTBot 收集可能用于训练 OpenAI 模型的内容。 ClaudeBot 对 Anthropic 执行等效爬取. CCBot 为 Common Crawl 提供数据,后者是许多研究和训练数据集背后的开放语料库. OpenAI 明确表示阻止 GPTBot 对 ChatGPT 搜索包含没有影响 — 2 条管道是分开的。

Google 在不同名称下执行相同的拆分:其 AI 通过普通 Googlebot 访问来展示,而单独的 Google-Extended 令牌则控制 Gemini 的训练和基础。 我们在我们的 Google 生成式搜索指南中讨论了这套机制。

graph TD A[AI 爬虫请求您的页面] --> B{哪种类型?} B --> C["搜索与检索:<br/>OAI-SearchBot, PerplexityBot,<br/>Claude-SearchBot"] B --> D["训练:<br/>GPTBot, ClaudeBot, CCBot"] C -->|允许| E[有资格获得 AI 回答与引用] C -->|禁止| F[在该助手的答案中缺失] D -->|允许| G[内容可能用于训练未来模型] D -->|禁止| H[对 AI 搜索可见性无影响]

拆分将一种模糊的焦虑转化为 2 部分决策. 阻止训练爬虫是对您内容可能被重用的合法立场,并且在 AI 搜索中不产生任何成本. 阻止检索爬虫是可见性决策——与自行设置 noindex 相同——并且值得同样的慎重.

编写一个记录此决策的 robots.txt

这是一个在 AI 搜索中保持完全可见,同时保留训练同意的政策——我们最常见的有意拆分:

# Search & retrieval — open, so assistants can find and cite this site
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
# Training — withheld; this has no effect on AI search visibility
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /

如果您想让一切开放,请明确说明,而不是省略——每个爬虫的命名 Allow: / 组记录有人决定,这正是 14.3% 没有适用规则所缺失的。 3 验证步骤闭环. 从网络外部获取 https://yoursite.com/robots.txt 并阅读生产环境实际提供的内容——CDN 和平台可能会注入或覆盖你仓库中的文件,一些边缘服务商甚至提供 1-click AI‑bot 阻止功能,完全覆盖你的指令。 检查任何 WAF 或机器人管理规则中相同的 6 用户代理,因为 robots.txt 权限对获得 403 的爬虫毫无意义. 然后在每次基础设施更改后重新运行检查;提供商迁移可能在不触及代码的情况下切换此开关. 1 条关于我们如何读取上面 deliberate policy 的说明:整个站点对 GPTBot、ClaudeBot 和 CCBot 的禁用仍将被视为一次发现。 那是有意为之. 全站 AI 爬虫阻止应始终是一个确认的决定,而发现则是你确认它的地方——此检查存在的失败模式是阻止没人记得写过的.

你今年将进行的最便宜的可见性审计

robots.txt 是 1 的 2 文件,通过它们你的网站与 AI 系统沟通——另一个是 llms.txt,我们的数据表明 76% 的文件未能满足它们所写的代理. 两者共享与本报告中阻止相同的失败签名:写一次,语法上可行,永不被读取. 我们样本中具有干净 AI 爬虫姿态的网站并不是最大或资源最丰富的. 它们是有人自 2023 开启文件并回答当前问题的网站. 阅读你的文件需要 2 分钟;免费报告 为你完成,列出 6 个爬虫并精确显示每个规则适用的情况——因此记录中的决定就是你实际做出的。

查看您的网站排名

获取一份免费的 AI 驱动的 SEO 报告,包含可操作的发现和优先修复建议,帮助提升您的网站。

不需要注册。.