XML 站点地图:为爬虫提供干净的站点地图
站点地图是发现工具,而非排名杠杆。如何保持你的站点地图可发现且诚实,以及哪些 URL 永远不应出现在其中.
站点地图是发现工具。它告诉搜索引擎哪些 URL 你认为值得爬取,以及每个 URL 大约何时最后更改。在小型内部链接干净的网站上,它几乎不变。对于大型网站、新站点或有用页面离主页 4 次点击的情况,它往往决定一周内是否能被发现。两个属性使站点地图有用:它可被发现,并且它诚实。可发现意味着它被 robots.txt 引用或直接提交,并且位于稳定的 URL。诚实意味着其中的每个 URL 都是你想要索引的,即 canonical、返回 200 并可被爬取。最常见的缺陷是一次生成后从未重新生成,列出现在已重定向或 404 的 URL,同时遗漏自那以后发布的所有内容。第二个缺陷是站点地图包含 CMS 能生成的每个 URL,包括标签归档、分页重复和参数化变体。两者都会让搜索引擎对文件失去信任。检查确认站点地图可被发现、解析为有效 XML,并正确使用索引和子结构。随后它们会把列出的每个 URL 与你自己的指令逐一比对:一份写着被阻止、noindex 或非 canonical 网址的文件是在自相矛盾,而搜索引擎化解矛盾的办法,就是减少对这份文件的信任。
未找到网站地图
为什么重要
网站地图帮助搜索引擎更快、更一致地找到您的重要页面.
我们如何检查
检查了 sitemap 是否通过 robots.txt 引用或常见位置存在.
如何修复
将您的 XML 网站地图链接到 robots.txt 中的 Sitemap 指令,并使用绝对网站地图 URL,或直接提交给 Google Search Console。包含您希望搜索系统考虑的规范 URL;网站地图支持发现,但并不保证每个列出的 URL 都会被抓取或显示。
Sitemap XML 无效
我们如何检查
将完整站点地图作为 XML 解析,并检查了 sitemap 命名空间和文档结构、绝对同站 loc 值,以及有效的 W3C lastmod 日期或带时区的日期时间。
如何修复
修复站点地图中的 XML 验证错误。使用站点地图验证工具.
robots.txt 声明了另一个网站上的站点地图
为什么重要
跟随该声明的爬虫会把网站的抓取预算花在另一个域名的页面上,这通常是迁移未完成的残留。
我们如何检查
将 robots.txt 中的每一条 Sitemap: 声明与提供该文件的域名进行了比较。
如何修复
将站点地图托管在它所描述的域名上,并更新 robots.txt 中的 Sitemap: 声明。跨域声明通常意味着迁移未完成,或 robots.txt 由错误的网站提供。
网站地图 URL 无索引标签
为什么重要
意外的 noindex 或 robots 屏蔽会在网站没有任何可见错误的情况下将页面移出搜索结果。
我们如何检查
检查了站点地图 URL 是否存在 noindex 指令。
如何修复
从 sitemap 中列出的页面移除 noindex,或将其从 sitemap 中删除。重要性说明:带 noindex 的 sitemap URL 产生直接矛盾,浪费抓取预算并向搜索引擎发出网站维护不佳的信号.
网站地图 URL 在 robots.txt 中被阻止
我们如何检查
对照 robots.txt 的 Disallow 规则检查了站点地图 URL。
如何修复
从 robots.txt 中移除对 sitemap 中列出页面的 Disallow 规则。重要性说明:在 robots.txt 中阻止 sitemap URL 会产生矛盾——搜索引擎会看到你既推荐又禁止访问同一页面,削弱对 sitemap 的信任.
网站地图 URL 非规范化
为什么重要
站点地图列出非规范 URL,会向搜索引擎发出关于哪个版本才是真实页面的矛盾指令。
我们如何检查
检查了站点地图 URL 的规范一致性。
如何修复
修复指向非规范页面的 sitemap URL。sitemap 应列出规范 URL。重要性说明:sitemap 中的非规范 URL 会将抓取预算分散到重复页面,可能导致搜索引擎索引错误版本的内容.
查看您的网站排名
获取一份免费的 AI 驱动的 SEO 报告,包含可操作的发现和优先修复建议,帮助提升您的网站。
不需要注册。.