区分访问抓取与索引结果,最直接的方法是看日志和搜索控制台里记录的是“谁来过、拿了什么”,还是“谁把页面收进了结果库”。前者是抓取,后者是索引。域名规范化要解决的正是这两步之间的偏差:同一内容有多个域名或主机名可访问时,抓取可能分散,索引也可能选错代表 URL。时间人手有限时,先查抓取是否被正确引导,再查索引是否收敛到规范域名。
要查的是服务器访问日志中搜索引擎爬虫的请求记录。按主机名分组统计,例如 example.com、www.example.com、m.example.com 各被请求了多少次,返回码分布如何。怎么查:用日志分析工具或命令行过滤爬虫 UA,再按 Host 字段聚合。结果说明什么:如果爬虫大量抓取非规范主机名,说明抓取入口没有收敛,规范化工作要先从重定向和内部链接入手;如果抓取集中在规范主机名,抓取层面基本正常,可以进入索引核查。
要查的是 sitemap 中列出的 URL 是否全部使用规范域名,以及 robots.txt 是否对非规范主机名做了不必要的抓取限制。怎么查:直接打开 sitemap 文件核对 URL 前缀,再逐条检查 robots.txt 的 Disallow 规则是否误伤了规范域名的可抓取路径。结果说明什么:sitemap 中混入非规范域名,会把抓取预算引向重复入口;robots.txt 限制抓取不等于可靠的索引移除,被 robots.txt 阻止的 URL 仍可能因外部链接而被索引,只是内容无法被抓取确认。两者不一致时,优先修正 sitemap,再评估 robots.txt 规则是否必要。
要查的是规范域名下的页面是否出现在搜索结果中,以及非规范域名是否也在结果里。怎么查:分别对规范域名和非规范域名执行 site: 查询,观察返回的 URL 形态;再对单个代表性页面使用 URL 检查类工具,查看“已抓取”“已索引”“已发现但未索引”等状态。结果说明什么:能访问不等于已索引,站点地图提交也不保证收录。如果规范域名页面显示已抓取但未索引,问题可能在内容质量或重复度过高;如果非规范域名页面仍被索引,说明规范化信号还不够强,需要检查重定向和 canonical 是否一致。
要查的是每个页面的 canonical 标签、HTTP 重定向和内部链接是否都指向同一个规范主机名。怎么查:抽取一批代表性页面,检查 <link rel="canonical"> 的 href 是否与当前访问主机名一致;再用 curl -I 查看非规范主机名返回的是 301 还是 302,以及跳转目标是否稳定。结果说明什么:canonical 指向 A、重定向指向 B、内部链接指向 C,会向搜索引擎发出矛盾信号,索引结果就容易摇摆。三者统一后,再观察索引是否逐步收敛。HTTPS 是独立事项,它不保证安全无漏洞,也不保证排名,不要把它当作规范化的替代手段。
site: 结果和 URL 检查状态。结果说明索引是否收敛;未收敛则回到前四项复查。如果上述检查显示抓取已集中在规范域名、canonical 与重定向一致,但非规范域名仍被索引,下一步应针对仍被索引的非规范 URL 逐条确认其当前返回状态和 canonical 指向,而不是继续扩大检查范围。不同搜索引擎对 canonical 和重定向的支持情况须分别核查,不能用一个引擎的结果推断另一个。