Back to articles

13% 的审计站点阻止 AI 爬虫 — 更正我们自己的 40.8%

SEOReport Team·
ai-crawlersrobots-txtai-searchgenerative-engine-optimizationtechnical-seodata-analysis

我们重新阅读了样本中的每个 robots.txt,发现我们自己的解析器存在 2 个缺陷。更正后的比例为 6 的 45 个审计站点 — 13.3%,而不是我们最初发布的 40.8%。更正后的计数结合了训练和搜索爬虫;它不是 AI 搜索排除率。

已更新 August 31, 2026。 在 8 月 20 发布的本文版本中,标题为“20 的 49 个我们审计的站点 — 40.8%。” 该数字错误两次。 40.8% 是单个审计运行失败检查的比例,而不是不同站点的比例,将其乘回站点计数会产生一个“20 个站点”的数字,没人曾经计数过。 更糟的是,当我们回去重新阅读样本中的每个 robots.txt 并与规范对照时,2 个缺陷在我们自己的解析器中导致了失败的一半。 更正后的数字如下,且更正现在是本文更有用的一半。

在 August 31, 2026 我们重新获取了当前引擎窗口中所有 48 个不同域的文件,并且 45 其中提供了一个。 在这些 45 中,6 个站点 — 13.3% — 至少关闭了 1 个主要 AI 爬虫。 在相反的极端,8 个站点根本没有适用于 AI 爬虫的规则 — 甚至没有让它们遵守的通配符指令。 这占样本的 17.8%.

这留下了 31 个站点 — 样本的 68.9% — 拥有一个 robots.txt,声明了 AI 爬虫实际上会读取的策略,并且没有对它们进行全站阻止。 计数并未揭示有多少所有者有意审查这些策略,仅对训练爬虫的限制并不意味着搜索可见性丧失。

至少阻止 1 个 AI 爬虫的全站613.3%
根本没有适用于 AI 爬虫的规则817.8%
明确规则,无全站阻止3168.9%

方法论。 人口是我们当前引擎窗口内完成审计的每个不同域名,窗口从五月 23 到 August 31, 2026。 这意味着 48 个域名跨 228 次报告运行。 存储的裁决携带缺陷解析器的答案,因此上表不是存储的总计。 它是对这些域名实时 robots.txt 文件的同日重新获取,读取于八月 31 并使用已纠正的解析器评估。 3 的 48 不再提供 robots.txt,因而分母为 45。 样本是自选的——这些是有人选择进行审计的网站——并且倾向于小到中等规模。 将速率视为网络长尾的方向性指标,而非整个网络。 域名未命名。

AI-Crawler Posture in robots.txt Across 45 Audited Sites (re-read 2026-08-31)

校正是证据的一部分

重新阅读文件暴露了对空 disallow 值的错误处理以及命名爬虫组与通配符规则之间的关系。 RFC 9309 提供了公共解释:空路径被忽略,适用的命名组优先于通配符组。* 同一爬虫的组可能需要合并;仅文件顺序不是可靠的策略。

缺陷已被纠正,回归测试保留了暴露它们的案例。 在此样本中,5 个先前标记为阻止的网站并未被阻止,而 1 个先前标记为清晰的则被阻止。 已纠正的结果是对获取文件的有日期观察。 它并未确立今天的访问或网络范围的普遍率。

robots.txt 仅是一个访问表面。 一个 CDN 挑战、登录墙或网络拒绝即使文件允许也可能阻止检索。* 相反,刻意的训练限制并不能证明网站在 AI 搜索中不可见。 13.3% 数值结合了爬虫目的,不能作为 AI 搜索排除率呈现。

搜索访问与训练许可是不同的决策

OpenAI 的机器人文档 区分 OAI-SearchBot,用于搜索发现,和 GPTBot,可能用于模型训练。 它们的控制是独立的。 ChatGPT-User 代表用户指向的访问,并再次扮演不同的角色。 政策审查应说明其意图允许或限制的目的。

Anthropic documents separate crawlers 用于训练、搜索和用户检索等。 除非确实是所有者的意图,否则不要将广义的 AI 机器人词组变成单一的权限切换。

Google 有自己的控制面板。 我们的 generative search guide 覆盖了其搜索控制台包含设置以及爬取、索引和摘要资格。 Google-Extended 是一个单独的控制;它在 robots.txt 中的存在并不能替代对搜索设置的审查。

这些区别在商业上是有用的。 企业可能希望其公开文档被潜在客户发现,同时对训练做出单独决定。 允许规则或包含设置都不能保证答案会引用该页面。 它们确立了发现可能发生的部分条件。

对照你所意图的政策,检查一个重要的 URL

选择一个潜在客户应该能找到的页面:有用的指南、产品说明或开发者示例。 记录提供者和爬虫目的、适用政策以及实际交付的响应。 保留时间戳,并区分真实已验证的提供者请求与仅使用其 user-agent 名称的测试。

如果所有者想要搜索发现,而相关搜索爬虫被无意中禁止,修复该特定冲突。 如果训练阻止是有意的,记录为有意。 不要仅为使广义机器人评分更绿而移除它。

缺失的命名规则并不自动视为缺陷。 通配符规则可能管理爬虫;如果没有组适用,robots 标准不会将该缺失视为禁止。 明确规则可以记录意图,但更多行并不一定意味着更好的访问政策。

更改文件后,检查实时响应。 由提供者管理的文件或缓存可能与仓库副本不同。 然后验证重要页面本身,包括任何重定向后的最终目的地。 indexability conflicts article 解释了爬取权限和索引权限为何是分开的观察。

衡量访问是否变得有用可见性。

在寻找结果之前先保留政策和响应证据。 Google 生成式 AI 印象、提供者引用、转介访问和有用产品操作各回答不同的问题。 记录它们的来源和报告窗口,而不是将它们合并为一个虚构的 AI 可见性总数。

对于 SEOReport,最强的公开证据是受影响页面、所有者的预期行为、具体修复和可重复验证结果。 读者可以在不需要私有检测配方的情况下评估这些事实。 AI search readiness guide 将这些观察连接成实用评估。

这次更正将课程从原始标题中改变。 我们的样本支持少量、过时的爬虫限制计数。 有用的工作是决定哪些限制符合所有者意图,检查交付页面,并衡量所选搜索表面实际报告的结果。

获取您网站的完整诊断

一份有据可依的报告和优先级行动计划,采用每月积分的订阅方案。