上线前核对抓取与索引配置,目标不是让页面立刻被收录,而是确认搜索引擎能正常访问、理解并选择是否收录你的页面。最有效的起点是:把网站当作一个陌生爬虫来走一遍,从robots.txt、可抓取链接、canonical、sitemap到索引状态逐项检查。下面是一份可执行清单,每项都说明查什么、怎么查、结果说明什么。
查什么:根目录下的robots.txt有没有误封整站、关键栏目或静态资源。
怎么查:在浏览器打开 你的域名/robots.txt,逐行看 Disallow 规则。再打开一个希望被抓取的具体页面,用搜索引擎的robots测试工具或抓取测试功能验证该URL是否被允许。
结果说明什么:如果关键页面返回“被robots.txt阻止”,爬虫不会抓取它,索引也就无从谈起。注意区分“阻止抓取”和“阻止索引”:noindex 是允许抓取但拒绝收录,两者不要混用。测试环境遗留的 Disallow: / 是常见事故。
查什么:目标页面是否有站内链接指向,HTTP状态码是否为200。
怎么查:从首页出发,只用鼠标点击,看能否在合理层数内到达每个重要页面。再用命令行或在线工具请求该URL,查看响应头:
curl -I https://你的域名/目标页面
结果说明什么:返回 200 表示可正常访问;301/302 表示发生了跳转,要确认最终落地页是否是你想被索引的地址;404 表示页面不存在;5xx 表示服务器错误,爬虫会放弃或稍后重试。只靠sitemap提交、没有任何站内链接的“孤岛页面”,被抓取的概率明显更低。
查什么:每个页面声明的规范地址是否指向自己,是否存在多个URL展示同一内容。
怎么查:查看页面源码中的 <link rel="canonical">,对比它和当前URL是否一致。同时检查带参数版本、http与https版本、带www与不带www版本是否都能打开同一内容。
结果说明什么:如果A页面的canonical指向B页面,搜索引擎会倾向把B当作规范版本,A可能不被单独索引。重复版本同时可访问且没有规范指向,会分散信号。上线前应统一协议和域名版本,并让每个页面的canonical自指。
查什么:sitemap里列出的URL是否都是可索引的200页面,是否遗漏了重要页面。
怎么查:打开sitemap文件,抽查其中若干URL,确认它们返回200、未被robots阻止、没有noindex。再反向抽查几个重要页面,看是否出现在sitemap中。
结果说明什么:sitemap是给爬虫的候选清单,不是收录保证。如果里面混入404、重定向或被noindex的地址,会浪费抓取预算并降低清单可信度。sitemap应只放你希望被索引的规范URL。
查什么:搜索引擎实际看到的页面内容与渲染结果,以及页面是否已进入索引。
怎么查:使用搜索引擎提供的URL检查或抓取测试功能,查看抓取到的HTML、渲染后的截图和发现的链接。上线一段时间后,用 site:你的域名 或直接搜索页面标题,观察是否被收录。
结果说明什么:抓取测试显示“已抓取”“可索引”说明配置层面没有硬性阻挡;显示“已发现但未抓取”通常意味着爬虫还没排到,或站内链接权重不足。收录本身需要时间,配置正确不等于立即收录,也不保证排名。若测试显示被阻止或noindex,应先解决配置问题,再等待重新抓取。
下一步:选一个最重要的页面,按上面顺序从robots.txt走到抓取测试,把每一项的实际结果记下来。任何一项显示“被阻止”或“noindex”,先修复它,再提交sitemap并观察后续抓取状态。