Back to articles

检查您想要的 AI 搜索流量是否被机器人保护阻止

SEOReport Team·
bot-protectionai-crawlerscrawl-accesswaftechnical-seoai-search

验证预期的提供商、实时响应以及控制它的策略。在更改机器人规则之前,分别处理搜索检索、模型训练和用户指向的访问.

网站所有者可以允许搜索发现,并且仍会收到一份报告,说明请求已被阻止. 解决这一明显矛盾的第一步是查看确切的请求:哪个提供商尝试访问哪个页面,目的是什么,以及它收到了什么响应? 一个 SEOReport 分析 可以提供需要调查的访问问题证据。 将该观察视为诊断的起点. 特定提供商的政策和特定请求的行为都很重要.

决定您打算允许的目的

AI 服务为不同任务使用不同的代理. OpenAI 文档 OAI-SearchBot 用于搜索,GPTBot 用于潜在的模型训练收集,ChatGPT-User 用于用户指向的请求。 它的 爬虫文档 解释了搜索和训练设置是独立的。 Anthropic 的 爬虫文档 同样区分了 Claude-SearchBot、ClaudeBot 和 Claude-User。 记录您关心的提供商和目的的预期选择. 拒绝训练并不是标记网站搜索政策缺陷的理由. 对于 Google,请在正确的 Search Console 属性上验证 搜索生成式 AI 控制。 这是一个账户级的参与选择,除了网站的技术状态之外. 检查继承的设置以及明确的选择.

将政策与交付的响应进行比较

审查公共 robots.txt、托管或 CDN 规则以及实际页面响应。 它们回答不同的问题. robots.txt 声明爬虫政策;访问规则可能阻止已允许的请求获取页面. 检查一个代表性的关键 URL 并记录观察到的最终目的地、状态和内容。 一个成功状态的挑战页面仍然是挑战页面. 相反,在工作中的联系表单上放置 CAPTCHA 小部件并不能证明整个页面被阻止. 我们的 爬虫访问指南 帮助组织对预期政策和受影响 URL 的审查.

已识别的搜索提供商收到挑战观察到的请求无法检索预期页面哪条规则导致了此情况以及行为是否重复
本地测试请求收到一个 403测试请求被拒绝已验证的提供商是否收到相同响应
页面包含 CAPTCHA 小部件页面包含人类验证控件请求的内容是否确实被扣留
Robots.txt 允许预期爬虫声明的爬虫政策允许访问托管规则是否交付页面

这些是示例性解释. 在实际规则调查旁边保留真实观察.

在更改例外前验证提供商身份

用户代理标签易于复制. 在决定是否接收流量时,使用提供商的文档识别指南和托管提供商支持的验证工具. 用复制标签进行测试可以揭示该请求的处理方式,但无法证明请求来自提供商. 优先采用实现预期政策的最小更改. 合法的搜索访问问题不需要从站点中移除所有保护措施. 保持身份验证和客户数据边界完整,然后验证预期的公开内容是否已交付给预期的读者.

在托管或政策更改后重新检查

保存原始观察,记录更改的设置并重复相关请求. 在检查中包含页面主体,以便更改的状态码无法隐藏挑战或空响应. 提供商默认值和账户选项可能会更改. 读取实际站点上的当前设置,而不是从提供商的公告或存储库中的配置文件推断. 在托管平台上,还要确认哪个层提供公开的 robots.txt. 更广泛的代理接受测试将此审查从读取页面扩展到完成允许的任务. 搜索访问、可用内容和成功操作每个都需要自己的观察.

确认访问后观察发现

一旦预期读者能够检索页面,允许提供商的处理和报告延迟. 在可用时分别审查专用 AI 印象或引用、可识别的推荐访问和有用的产品操作. 恢复访问建立技术修复. 后续引用或客户访问建立不同的结果. 保留两份记录为团队提供可辩护的改进情况和进一步工作可能有价值的地方.

查看您的网站排名

获取一份免费的 AI 驱动的 SEO 报告,包含可操作的发现和优先修复建议,帮助提升您的网站。

不需要注册。.