13% 的审计站点阻止 AI 爬虫 — 更正我们自己的 40.8%
我们重新阅读了样本中的每个 robots.txt,发现我们自己的解析器存在 2 个缺陷。更正后的比例为 6 的 45 个审计站点 — 13.3%,而不是我们最初发布的 40.8%。更正后的计数结合了训练和搜索爬虫;它不是 AI 搜索排除率。
已更新 August 31, 2026。 在 8 月 20 发布的本文版本中,标题为“20 的 49 个我们审计的站点 — 40.8%。” 该数字错误两次。 40.8% 是单个审计运行失败检查的比例,而不是不同站点的比例,将其乘回站点计数会产生一个“20 个站点”的数字,没人曾经计数过。 更糟的是,当我们回去重新阅读样本中的每个 robots.txt 并与规范对照时,2 个缺陷在我们自己的解析器中导致了失败的一半。 更正后的数字如下,且更正现在是本文更有用的一半。
在 August 31, 2026 我们重新获取了当前引擎窗口中所有 48 个不同域的文件,并且 45 其中提供了一个。 在这些 45 中,6 个站点 — 13.3% — 至少关闭了 1 个主要 AI 爬虫。 在相反的极端,8 个站点根本没有适用于 AI 爬虫的规则 — 甚至没有让它们遵守的通配符指令。 这占样本的 17.8%.
这留下了 31 个站点 — 样本的 68.9% — 拥有一个 robots.txt,声明了 AI 爬虫实际上会读取的策略,并且没有对它们进行全站阻止。 计数并未揭示有多少所有者有意审查这些策略,仅对训练爬虫的限制并不意味着搜索可见性丧失。
| 至少阻止 1 个 AI 爬虫的全站 | 6 | 13.3% |
| 根本没有适用于 AI 爬虫的规则 | 8 | 17.8% |
| 明确规则,无全站阻止 | 31 | 68.9% |
方法论。 人口是我们当前引擎窗口内完成审计的每个不同域名,窗口从五月 23 到 August 31, 2026。 这意味着 48 个域名跨 228 次报告运行。 存储的裁决携带缺陷解析器的答案,因此上表不是存储的总计。 它是对这些域名实时 robots.txt 文件的同日重新获取,读取于八月 31 并使用已纠正的解析器评估。 3 的 48 不再提供 robots.txt,因而分母为 45。 样本是自选的——这些是有人选择进行审计的网站——并且倾向于小到中等规模。 将速率视为网络长尾的方向性指标,而非整个网络。 域名未命名。
校正是证据的一部分
重新阅读文件暴露了对空 disallow 值的错误处理以及命名爬虫组与通配符规则之间的关系。 RFC 9309 提供了公共解释:空路径被忽略,适用的命名组优先于通配符组。* 同一爬虫的组可能需要合并;仅文件顺序不是可靠的策略。
缺陷已被纠正,回归测试保留了暴露它们的案例。 在此样本中,5 个先前标记为阻止的网站并未被阻止,而 1 个先前标记为清晰的则被阻止。 已纠正的结果是对获取文件的有日期观察。 它并未确立今天的访问或网络范围的普遍率。
robots.txt 仅是一个访问表面。 一个 CDN 挑战、登录墙或网络拒绝即使文件允许也可能阻止检索。* 相反,刻意的训练限制并不能证明网站在 AI 搜索中不可见。 13.3% 数值结合了爬虫目的,不能作为 AI 搜索排除率呈现。
搜索访问与训练许可是不同的决策
OpenAI 的机器人文档 区分 OAI-SearchBot,用于搜索发现,和 GPTBot,可能用于模型训练。 它们的控制是独立的。 ChatGPT-User 代表用户指向的访问,并再次扮演不同的角色。 政策审查应说明其意图允许或限制的目的。
Anthropic documents separate crawlers 用于训练、搜索和用户检索等。 除非确实是所有者的意图,否则不要将广义的 AI 机器人词组变成单一的权限切换。
Google 有自己的控制面板。 我们的 generative search guide 覆盖了其搜索控制台包含设置以及爬取、索引和摘要资格。 Google-Extended 是一个单独的控制;它在 robots.txt 中的存在并不能替代对搜索设置的审查。
这些区别在商业上是有用的。 企业可能希望其公开文档被潜在客户发现,同时对训练做出单独决定。 允许规则或包含设置都不能保证答案会引用该页面。 它们确立了发现可能发生的部分条件。
对照你所意图的政策,检查一个重要的 URL
选择一个潜在客户应该能找到的页面:有用的指南、产品说明或开发者示例。 记录提供者和爬虫目的、适用政策以及实际交付的响应。 保留时间戳,并区分真实已验证的提供者请求与仅使用其 user-agent 名称的测试。
如果所有者想要搜索发现,而相关搜索爬虫被无意中禁止,修复该特定冲突。 如果训练阻止是有意的,记录为有意。 不要仅为使广义机器人评分更绿而移除它。
缺失的命名规则并不自动视为缺陷。 通配符规则可能管理爬虫;如果没有组适用,robots 标准不会将该缺失视为禁止。 明确规则可以记录意图,但更多行并不一定意味着更好的访问政策。
更改文件后,检查实时响应。 由提供者管理的文件或缓存可能与仓库副本不同。 然后验证重要页面本身,包括任何重定向后的最终目的地。 indexability conflicts article 解释了爬取权限和索引权限为何是分开的观察。
衡量访问是否变得有用可见性。
在寻找结果之前先保留政策和响应证据。 Google 生成式 AI 印象、提供者引用、转介访问和有用产品操作各回答不同的问题。 记录它们的来源和报告窗口,而不是将它们合并为一个虚构的 AI 可见性总数。
对于 SEOReport,最强的公开证据是受影响页面、所有者的预期行为、具体修复和可重复验证结果。 读者可以在不需要私有检测配方的情况下评估这些事实。 AI search readiness guide 将这些观察连接成实用评估。
这次更正将课程从原始标题中改变。 我们的样本支持少量、过时的爬虫限制计数。 有用的工作是决定哪些限制符合所有者意图,检查交付页面,并衡量所选搜索表面实际报告的结果。