上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、愿意保留页面、不会把重复或无效页面当成主版本。建议用“robots 规则、可抓取性、canonical 与状态码、sitemap、索引提交”五项清单逐项检查,每项都留下可复查的结果。下面按两种常见处理方案展开:一种适合内容量小、结构稳定的新站,另一种适合页面多、筛选参数多的站点。
如果站点页面数量不多,上线前可以逐类抽查,不必依赖复杂工具。要查的是 robots.txt、页面状态码、canonical 和 sitemap 是否一致。怎么查:用浏览器直接访问 /robots.txt,确认没有误写 Disallow: /;再抽首页、栏目页、详情页各一个,查看返回状态码和 canonical 指向。结果说明:状态码为 200 且 canonical 指向自身,表示该页可被抓取并作为主版本;若 canonical 指向别的页面,说明你主动告诉搜索引擎“别把这个地址当主版本”。
适用条件是模板统一、URL 规则简单。判断结果时注意:如果抽查页面全部正常,仍要检查分页和标签页,因为这些页面常被模板自动加上 canonical 到列表首页,导致它们不被单独索引。
页面数量大或有筛选参数时,逐页看不现实,应按规则核对。要查的是:哪些 URL 允许抓取、哪些参数应被规范化、哪些页面应返回 404 或 410。怎么查:先导出站点地图中的 URL 列表,再与 robots.txt 的禁止规则、canonical 规则做比对,找出“sitemap 里存在但 robots 禁止抓取”的冲突项。结果说明:冲突项会让搜索引擎收到矛盾信号,通常应让 sitemap 只保留允许抓取且希望索引的 URL。
适用条件是站点有清晰的 URL 生成逻辑。若筛选参数会生成大量近似页面,可用 canonical 指向主列表页,或对无内容参数页返回 404。判断结果时看:同一内容是否只保留一个可索引地址;若多个地址返回 200 且 canonical 各自指向自己,就可能形成重复内容竞争。
Disallow 行。若出现 Disallow: /,所有页面都无法被抓取。curl -I 看返回码。200 表示正常,301 表示跳转,404 表示不存在,5xx 表示服务器错误。<link rel="canonical">。若详情页 canonical 指向首页,该详情页通常不会被单独索引。手工核对适合页面少、改动少的站点,优点是直接、无需额外配置;缺点是页面一多就容易漏。批量规则核对适合页面多、参数复杂的站点,优点是覆盖全;缺点是规则写错时影响面大。选择依据看两点:可索引页面数量,以及 URL 是否由参数动态生成。若可索引页面少于几百且结构固定,先用手工核对;若超过这个量级或存在筛选参数,应先用规则批量核对,再抽查关键页面。
无论选哪种,上线前都应确认一件事:你希望被索引的页面,必须同时满足“允许抓取、返回 200、canonical 指向自身或正确主版本、出现在 sitemap 中”。四项缺一项,都可能让页面无法按预期进入索引。
上线不是终点。提交 sitemap 后,隔几天在站长平台查看已抓取页面和已索引页面数量,重点看是否有大量页面被抓取但未索引。若出现这种情况,回到清单中的 canonical 和重复版本两项,确认是否存在多个地址返回 200 或 canonical 指向混乱。把每次修改前后的抓取数据记录下来,才能判断调整是否有效。