判断采集是否遗漏,不能只看站长统计工具的总访问量,而要把同一时间段的“站内统计”“搜索引擎后台报告”“服务器日志”三份数据放在一起对照。如果站内统计记录的爬虫访问明显少于服务器日志中的爬虫请求,或者重要栏目长期没有出现在搜索引擎的抓取记录里,就说明采集可能遗漏。起点是先确认你用的是哪一层数据,再逐步缩小范围。
站长统计工具通常统计的是页面被访问时触发的脚本或像素,属于站内口径。搜索引擎后台报告反映的是搜索引擎自己愿意展示的抓取与索引情况,属于平台口径。服务器日志记录的是所有到达服务器的请求,包括未执行脚本的爬虫请求,属于原始口径。三者天然不一致:爬虫可能只请求了HTML而没有执行JavaScript,也可能被CDN或缓存拦截,导致统计工具收不到记录。因此判断遗漏时,应以服务器日志作为基准,把站长统计工具的数据当作辅助信号,而不是反过来用统计工具去否定日志。
可以按下面的顺序做一次检查,每一步都留下可对照的记录:
noindex、是否依赖JavaScript渲染主要内容。如果日志里有请求、统计工具里没有,可能是脚本未执行或被拦截;如果日志和统计工具都有、搜索引擎后台没有,可能是抓取配额、robots规则或页面质量导致未被索引;如果日志里根本没有请求,则要检查内链、站点地图和外部入口是否让爬虫能够发现这些页面。每一步只能说明一种可能,不能凭单一现象断定原因。
只依赖站长统计工具,成本最低,但只能看到执行了统计代码的访问,容易把“统计不到”误判为“没有被采集”。只依赖搜索引擎后台,能看到平台视角,但报告有延迟,且不展示全部抓取细节。结合服务器日志最可靠,但需要日志访问权限和一定的筛选能力,适合重要栏目或流量异常时使用。第一次接触这个问题时,建议先用搜索引擎后台做一次范围扫描,找出可疑栏目,再针对这些栏目拉取日志做精确对照,避免一开始就处理全量日志。
假设某站点有一个“帮助中心”栏目,站长统计工具显示该栏目每天只有个位数访问。此时不能直接认定采集遗漏。先查服务器日志中该栏目URL的爬虫请求:如果请求存在但统计工具没有记录,优先检查统计代码是否在该模板中缺失,或是否被广告拦截、Cookie同意工具阻断。如果日志中也没有爬虫请求,再检查该栏目是否在导航和站点地图中可发现,以及是否被robots.txt误屏蔽。只有排除了这些环节,才能把问题归到搜索引擎未抓取或未索引上。
下一步,选定一个你认为最可能遗漏的栏目,按上面的四步做一次对照,把日志、统计工具和搜索引擎后台的差异记录下来,再决定是修统计代码、改抓取入口,还是提交重新抓取。