AI 搜索就绪:既可被助手使用也可被爬虫使用
搜索爬虫如 OAI-SearchBot 和训练爬虫如 GPTBot 分别读取 robots.txt。如何设置明确的爬虫策略和有用的 llms.txt。
助手通过直接读取页面并引用它们来回答问题,而不是返回链接列表。它们通过命名的爬虫访问你的网站,每个爬虫独立读取 robots.txt。OAI-SearchBot、Claude-SearchBot 和 PerplexityBot 为 ChatGPT 搜索、Claude 和 Perplexity 答案抓取页面,Claude-User 在有人提问时抓取页面。GPTBot、ClaudeBot 和 CCBot 收集训练数据,因此阻止它们是一个许可选择,不会让站点失去 AI 搜索。一个站点可以对 Googlebot 开放,对每个助手关闭,通常是因为默认规则从模板复制。第一个决定是政策决定,它是你的:哪些代理可以读取你的内容,以及出于什么目的。让 robots.txt 明确允许比留给默认更好,无论哪种方向。明确允许告诉助手它受欢迎;明确禁止是一个清晰的信号,而不是含糊的沉默。llms.txt 文件是第二层。它是你站点根目录下的一个简短 Markdown 文档,命名站点并链接到你最想被引用的页面。它补充站点地图和结构化数据,并且本身不产生任何收益:它链接的页面仍然必须可达、当前且值得引用。从助手的角度审查两者:像每个命名爬虫一样读取你的 robots.txt,然后打开 llms.txt 并确认其中的每个链接仍能解析。命名已不再解析的页面的文件比没有文件更损害可信度。
这不必手工审查。在付费计划中,相同的爬虫策略和 llms.txt 结果可按需以 JSON 形式获取,透过 SEO报告API与MCP服务器.
SEOReport 的付费诊断在你自己网站的各页面上进行评估,展示每项发现背后的证据,并按优先级排列修复方案。 查看方案与定价.