上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能到达页面、能读懂页面是否允许被抓取、能拿到正确的规范地址。时间和人手有限时,不要逐个页面翻,按“入口文件—页面级指令—规范与状态—复查”四步走,先处理会挡住整站的问题,再处理单页问题。
robots.txt 是抓取入口,写错会挡住整站或整个目录。打开浏览器访问站点根目录下的 /robots.txt,逐行确认:
Disallow: /。如果这是测试期留下的,上线前必须删除或改成只挡后台、搜索结果页等不该收录的路径。判断结果:如果 Disallow: / 存在,这是最高优先级问题,先改再谈其他。如果只挡了少量无关路径,属于正常配置,可以继续下一步。
页面 head 里的 <meta name="robots"> 决定单页能否被索引。常见冲突是:robots.txt 允许抓取,但页面写了 noindex,结果内容永远进不了索引。检查时重点看:
noindex 或 none。测试环境复制过来的模板最容易残留这类标签。noindex 和 canonical。两者叠加时,规范地址指向的页面若也被标了 noindex,等于整组页面都不收录。适用条件:页面数量少时可以直接查看源码;页面多时用抓取工具批量提取 head 中的 robots 指令,按模板分组检查,比逐页看快得多。
canonical 用来告诉搜索引擎哪个地址是正版。上线前要确认它指向的地址真实可访问,且返回 200 状态码。检查项:
www 与不带 www、http 与 https 是否统一。选定的主域名之外的版本应做跳转,而不是各自返回 200。假设一个例子:某页面 canonical 写成 http://test.example.com/about,而正式地址是 https://example.com/about。搜索引擎会认为正版在测试域名上,正式页面反而可能不被索引。这类问题靠肉眼扫源码就能发现,属于上线前必查项。
配置改完不等于生效,需要复查。时间有限时按这个顺序:
如果复查发现页面被抓取但未索引,先检查内容是否与站内其他页面高度重复、canonical 是否指向别处,而不是直接归因于某个单一原因。同一现象可能有多种解释,逐项排除比一次改一堆设置更可靠。
下一步:把 robots.txt、首页和三个核心栏目的 head 源码各截一份,按上面的检查项逐条打勾,改完后再提交一次 sitemap 并记录日期,方便后续对比索引变化。