Back to articles

13% 的已审计站点阻止 AI 爬虫 — 更正我们自己的 40.8%

SEOReport Team·
ai-crawlersrobots-txtai-searchgenerative-engine-optimizationtechnical-seodata-analysis

我们重新阅读了样本中的每个 robots.txt,发现了我们自己解析器中的 2 缺陷。更正后的比例为 6 的 45 已审计站点 — 13.3%,而不是我们最初发布的 40.8%。训练与搜索的划分仍决定 AI 助手是否可以引用你.

已更新 August 31, 2026。 本文章在 8 月 20 发表时,标题为“20 的 49 站点我们已审计 — 40.8%”。 “ 这个数字两次都错误。 40.8% 是单个审计运行失败检查的比例,而不是不同站点的比例,将其乘回站点计数后产生了一个“20 站点”的数字,没人曾经计数过。 更糟的是,当我们回去重新阅读每一台机器人时。 txt 在样本与规范对照时,2 缺陷在我们自己的解析器中导致了半数失败。 下面给出了更正后的数字,现在更正部分已成为本文更有用的一半。 每一次我们运行的审计都会获取 robots.txt 并像 AI 爬虫一样读取它. 在 August 31, 2026 我们从当前引擎窗口审计的所有 48 个不同域重新获取了文件,并且 45 个域提供了一个. 在那些 45、6 站点中——13.3%——至少关闭了 1 个主要 AI 爬虫,整个站点都无法访问。 在相反的极端,8 站点根本没有适用于 AI 爬虫的规则——甚至没有任何通配符指令让它们遵守. 那是 17.8% 的样本. 这就剩下31个站点——样本中的68.9%——它们的 robots.txt 声明了 AI 爬虫实际上会读取的策略,并且没有阻止任何站点的全部访问. 在ChatGPT搜索、Perplexity和Claude通过获取来源来引用来源的一年里,最初发布后大多数所有者未曾打开的文件悄然成为了可见性开关。 他们中有更多人根本没有触碰过它. robots.txt 立场.

1613.3%
对 AI 爬虫没有任何规则817.8%
明确规则,无全站封锁3168.9%

方法论。 人口统计是我们当前引擎窗口内完成审计的每个独立域名,窗口从 5 月 23 到 August 31, 2026。 这意味着 48 个域名跨 228 次报告运行。 存储的裁决携带缺陷解析器的答案,因此上表不是存储的总计。 它是对那些域名实时 robots 的同日重新获取。 txt 文件,于 8 月 31 读取并使用已校正的解析器评估。 3 的 48 不再提供 robots。 txt 完全不提供,这就是分母为 45 的原因。 样本是自选的——这些是有人选择进行审计的网站——并且倾向于中小型。 将速率视为网络长尾的方向性指标,而非整个网络。 域名未命名。

AI-Crawler Posture in robots.txt Across 45 Audited Sites (re-read 2026-08-31)

我们的解析器错误的地方以及我们如何发现

检查本身很简单. 我们的引擎解析每个 robots.txt 组,并评估 6 个用户代理:GPTBot、OAI-SearchBot、PerplexityBot、ClaudeBot、Claude-SearchBot 和 CCBot。 仅当管理该组的全站 Disallow: / 时,爬虫才算被阻止。 像 Disallow: /admin 这样的部分禁止被视为声明的政策,这很健康,它们通过。 正确应用该定义是我们失败的地方. 重新阅读所有 45 文件发现 2 个不同缺陷,方向相反. 空的 Disallow: 不是阻止。 RFC 9309 明确指出没有路径的规则被忽略,这使得 Disallow: 成为“允许所有”的规范方式。 Yoast 默认会发出完全相同的文件,其他共享主机也是如此. 我们的解析器将空值视为等同于 / 并将所有 6 个爬虫标记为被阻止。 5 的 10 网站中,搜索引擎标记为运行普通允许所有文件的有 3:其中 Yoast 默认块逐字复制,1 为单行 2 文件. 命名组覆盖通配符。 RFC 9309 还说爬虫遵循最具体的命名组,并在存在此类组时完全忽略 User-agent: *。 我们的解析器按文件顺序读取每个匹配组,并让最后一个生效. 这两面都适用. 样本中的大型社交平台命名 GPTBot、ClaudeBot 和 PerplexityBot,使用狭窄路径规则,然后以通配符 User-agent: * / Disallow: / 关闭文件——我们的解析器给这 3 个命名爬虫分配了它们被豁免的通配符。 而 1 网站在相反方向被错误计数:它在文件顶部附近按名称禁止 3 AI 爬虫,然后在更下方声明更宽松的通配符规则,我们的解析器让通配符抹去真正的、故意的阻止. 那个网站已通过. 两个缺陷现在已修复,单元测试基于暴露它们的确切文件构建. 对此样本的净影响是:5 网站旧解析器称为阻止的现在不是,1 网站它称为干净的则是. 3 数字并排显示,全部来自同一窗口:引擎存储的判决为 42.9% 的 226 次单独审计运行和 21.3% 的 47 网站;使用已校正解析器重新读取实时文件得到 13.3% 的 45 网站. 只有最后一个是关于网站的声明,用正确读取规范的解析器测量. 检查的一个属性在这一切中存活:它仍然保守. WAF 挑战、CDN 机器人规则或防火墙阻止从未出现在 robots.txt 中,因此 13.3% 仍是实际阻止这些爬虫的网站数量的下限。 并且网站仍可在未输入其名称的情况下阻止爬虫——为预览环境编写的通配符禁止适用于 GPTBot,正如它适用于其他所有内容. 2 的 6 确认阻止器至少以 1 爬虫方式到达:一个预览主机,其整个 robots.txt 是 3 行的通配符禁止,以及一个大型平台,其关闭的通配符扫除未命名的 3 爬虫.

用 2023 编写的规则在 2026 中回答错误的问题

我们校正后的速率现在低于更大外部样本报告的值. 一份 2026 年 3 月 SEO Score Tools 对 10,000 个网站的分析 发现 18.7% 主动阻止 GPTBot,41.3% 完全没有 AI 特定 robots 规则。 它们的两项数据均高于我们的——样本之间的定义不同,我们的样本仅为一小部分,且我们的检查将通配符组计为已应用策略,而它们寻找命名组. 我们并未声称我们的 13.3% 推翻它们的 18.7%;一个 45-网站样本无法. 两个数据集一致的是形状:少数网站做出了 AI 访问决策,进一步一部分在不知情的情况下做出了决策,其余未被询问. 未考虑的部分是故事,我们的校正数据仔细说明那是哪一部分. 我们确认的 6 阻止大多是故意的——4 命名爬虫,且 2 的那些运行 Cloudflare 的托管内容信号列表,这是今年制定的政策,而非遗留. 我们无法从 45 网站看到更广泛的网络中仍在使用过时规则的程度;这正是上面外部样本的用途. 机制仍值得说明,因为它决定了过时规则的成本. 在 2023,当 GPTBot 首次出现在服务器日志中,CCBot 作为训练来源变得臭名昭著时,访问的唯一已知后果是模型训练——于是机器人阻止列表流传,插件发布了 1-点击切换,robots.txt 文件继承了自从没人重新阅读以来的禁止规则. 那些规则回答的问题是“我是否想让我的内容出现在训练语料库中?” 在 2026 中真正重要的问题不同:“我是否想在助手回答我的主题时被发现并被引用?” 为第一个问题写的规则现在悄悄回答了第二个.

训练爬虫和搜索爬虫需要不同的答案

我们探测的 6 爬虫按每个运营商发布的机器人文档清晰划分为 2 任务:

  • 搜索与检索。 OAI-SearchBot 索引内容,以便 ChatGPT 搜索能够检索并链接到它——OpenAI 文档表明,只有此访问决定页面是否被考虑进入 ChatGPT 搜索结果。 PerplexityBot 构建 Perplexity 的搜索索引. Claude-SearchBot 索引以改进 Claude 的搜索支持答案。 阻止任何这些会让你从该助手的引用中消失.
  • 训练。 GPTBot 收集可能用于训练 OpenAI 模型的内容。 ClaudeBot 对 Anthropic 执行等效爬取. CCBot 提供 Common Crawl,许多研究和训练数据集背后的开放语料库. OpenAI 明确表示阻止 GPTBot 对 ChatGPT 搜索包含没有影响——这两条管道是分开的。

Google 在不同名称下运行相同的拆分:其 AI 通过普通 Googlebot 访问来获取信息,而单独的 Google-Extended 令牌控制 Gemini 的训练和基础。 我们在我们的 Google 生成式搜索指南中讨论了这套机制。

graph TD A[AI 爬虫请求您的页面] --> B{哪种类型?} B --> C["搜索与检索:<br/>OAI-SearchBot,PerplexityBot,<br/>Claude-SearchBot"] B --> D["训练:<br/>GPTBot,ClaudeBot,CCBot"] C -->|允许| E[有资格获得 AI 答案和引用] C -->|禁止| F[未出现在该助手的答案中] D -->|允许| G[内容可能用于训练未来模型] D -->|禁止| H[对 AI 搜索可见性没有影响]

分割将模糊的焦虑转化为 2-部分决策. 阻止训练爬虫是对您的内容可能被重用的合法立场,并且在 AI 搜索中不花费您任何成本. 阻止检索爬虫是可见性决策——与自行设置 noindex 相同类别——并且它值得同样的深思熟虑.

编写一个记录决策的 robots.txt

这是一个在 AI 搜索中保持完全可见,同时保留训练同意的政策——我们看到的最常见的有意分割:

# Search & retrieval — open, so assistants can find and cite this site
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
# Training — withheld; this has no effect on AI search visibility
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /

如果您想让一切开放,请明确说明,而不是省略——每个爬虫的命名 Allow: / 组记录有人决定,这正是 17.8% 没有适用规则的人缺失的 3 验证步骤闭环. 从网络外部获取 https://yoursite.com/robots.txt 并阅读生产环境实际提供的内容——CDN 和平台可以在您的仓库中注入或覆盖文件,一些边缘提供商提供 1-点击 AI 机器人阻止,完全覆盖您的指令 检查任何 WAF 或机器人管理规则是否有相同的 6 用户代理,因为 robots.txt 权限对获取 403 的爬虫毫无意义. 然后在每次基础设施更改后重新运行检查;提供商迁移可能在不触及代码的情况下切换此开关. 关于我们如何读取上述有意政策的一个注释:对 GPTBot、ClaudeBot 和 CCBot 的全站禁用仍会作为发现出现 这是有意设计的. 全站 AI 爬虫阻止应始终是一个确认的决定,发现是您确认它的地方——此检查存在的失败模式是没人记得写的阻止.

今年您将运行的最便宜的可见性审计

robots.txt 是 1 的 2 文件,通过它们您的站点与 AI 系统交流——另一个是 llms.txt,我们的数据表明 76% 的文件未能满足其编写的代理. 两者共享与本报告中阻止相同的失败签名:一次写入,语法上合理,永不读取. 我们的解析器也如此,这也是此更正中不舒服的部分——自写之日起未被重新阅读的规则正是此检查存在的原因,而我们的规则也未被重新阅读. 更正后的图景也比我们最初运行的标题更令人鼓舞. 4 的 6 站点全站阻止 AI 爬虫,明确命名该爬虫,并且 2 的这些 4 正在运行 Cloudflare 的托管内容信号阻止——这是有人选择的 2026 政策,而不是无人重新阅读的 2023 规则. 意外阻止是剩余的,数量很少. 这份样本中更大的差距并不是网站阻止 AI 爬虫,而是那些 robots.txt 完全没有任何 AI 爬虫能读取的 8 网站. 阅读你自己的文件需要 2 分钟;free report 会为你完成,列出 6 个爬虫的名称,并准确显示每个规则适用于哪一个——因此记录中的决定就是你真正做出的决定。

查看您的网站排名

获取一份免费的 AI 驱动的 SEO 报告,包含可操作的发现和优先修复建议,帮助提升您的网站。

不需要注册。.