AI 搜索就绪:既可被助手使用也可被爬虫使用
GPTBot、ClaudeBot 和 PerplexityBot 独立读取 robots.txt。如何设置明确的爬虫策略并发布一个 llms.txt 供遵循.
助手回答问题的方式,是直接阅读页面并加以引用,而不是返回一份排好序的链接列表。它们通过命名爬虫访问你的网站,其中包括 GPTBot、ClaudeBot、PerplexityBot 和 Google-Extended,每个都独立读取 robots.txt。一个网站可能对 Googlebot 开放,对所有助手关闭,通常是因为默认规则从模板复制过来。第一个决定是政策决定,它属于你:哪些代理可以读取你的内容,以及用途。将其明确写在 robots.txt 中优于默认设置,无论哪种方向。明确允许告诉助手它受欢迎;明确禁止则是清晰信号,而非含糊沉默。llms.txt 文件是第二层。它是一个位于你站点根目录的简短 Markdown 文档,命名网站并链接你最想被引用的页面。它补充站点地图和结构化数据,并且本身不产生任何收益:它链接的页面仍需可访问、最新且值得引用。这些检查从助手视角读取你的 robots.txt,然后获取 llms.txt 并跟随其中每一个同源链接。命名已不再解析的页面文件比根本没有文件更能损害可信度.
这些都不必手动检查。本页的每一项检查都可以按需运行,并以JSON返回同样的爬虫策略、llms.txt与引用解析结果,详见 SEO报告API与MCP服务器.
AI 爬虫规则缺失于 robots.txt
为什么重要
显式的 AI 爬虫规则减少了歧义,让哪些 AI 搜索系统可以使用您的公开内容更加清晰。
我们如何检查
扫描了 robots.txt 中的 AI 爬虫 Allow/Disallow 规则.
如何修复
为您计划服务的 AI 搜索爬虫(如 OAI-SearchBot)设置明确的 robots.txt 策略,并验证 CDN 或 WAF 规则是否允许相同的请求。OAI-SearchBot 的访问是将页面内容纳入 ChatGPT 搜索摘要和片段的前提,但访问并不保证出现或位置。.
AI 爬虫被阻止
为什么重要
如果 AI 爬虫被阻止,即使您的内容是最佳来源,也更难出现在 AI 生成的答案中。
我们如何检查
扫描了 robots.txt 中的 AI 爬虫禁用规则.
如何修复
移除阻止 AI 搜索爬虫访问内容的 Disallow 规则.
缺少 llms.txt
为什么重要
llms.txt 为 AI 代理提供了一份简明、由站点所有者维护的网站用途和首选资源地图,减少了从复杂 HTML 中提取结构所需的工作。它支持推理时的上下文发现;但不保证排名或被纳入模型训练。
我们如何检查
检查了 llms.txt 是否存在于 well-known 位置。
如何修复
创建 /llms.txt 文件,概述你的网站以供 LLM 训练和检索。重要性说明:主要 AI 平台越来越多地使用 llms.txt 来了解网站结构和内容范围;拥有一个可提升 AI 系统对你品牌和产品的表示准确性.
llms.txt 格式无效
为什么重要
AI 搜索工具对它们能读取和引用的内容越来越挑剔.
我们如何检查
llms.txt 与 llmstxt.org 格式规范进行了验证.
如何修复
修复 llms.txt 文件中的格式问题。遵循 llmstxt.org 规范.
llms.txt 链接失效
我们如何检查
获取并验证了 llms.txt 中的同源链接。
如何修复
确保 llms.txt 中引用的所有 URL 在你的网站上解析为有效页面.
检测到 AI 就绪性缺口
我们如何检查
报告结合了观察到的 AI 爬虫策略、llms.txt 的可用性与有效性,以及首选资源链接检查,而未推断排名或模型包含。.
如何修复
解决列出的 AI 就绪性缺口:在 robots.txt 中添加明确的 AI 爬虫规则,创建 /llms.txt 文件,并确保 llms.txt 中的链接可解析。重要性:AI 搜索引擎(ChatGPT Search、Perplexity、Gemini)使用 robots.txt 和 llms.txt 来决定可以读取和引用的内容;缺少这些信号会降低您在 AI 生成答案中的可见度。
查看您的网站排名
获取一份免费的 AI 驱动的 SEO 报告,包含可操作的发现和优先修复建议,帮助提升您的网站。
不需要注册。.