排查重复页面,核心是先用Google Search Console的“页面”报告和site:查询找出被索引的相似URL,再用抓取工具对比标题、正文、canonical和参数,判断是技术重复还是内容重复,最后按类型选择301、canonical或内容合并。不要一上来就批量提交删除,先确认哪一组URL真正在互相竞争。
在动手之前,把重复分成三类,后面处理方式完全不同:
?color=red、?sort=price。可以用一个短例子判断:假设站点有/shoes和/shoes?sort=new两个地址,页面主体商品相同,只有排序不同。这属于参数重复,优先考虑canonical指向/shoes,而不是删除参数页。若两个地址正文几乎一致但面向不同城市,则属于近似重复,需要判断是否应合并为单页。
最关键的一步是建立“重复组清单”,而不是逐个URL凭感觉处理。操作顺序如下:
site:example.com配合关键词查询,观察同一内容出现几个不同URL。这里只作为线索,不作为最终判断依据。<title>、<h1>、正文首段、canonical标签、meta robots和状态码。检查项要具体:canonical是否自引用、是否指向组内主版本、是否被其他信号冲突。比如页面A的canonical指向B,但B又指向A,这种循环会让Google难以判断,需要先修正为单向指向。
处理之后,不要立刻下结论。验证分两步:
如果处理的是参数重复,可以观察参数页是否逐渐退出索引;如果处理的是近似重复,重点看主版本的展示是否集中。若两周后组内仍有多个URL被索引,回到抓取清单,检查是否有内链、站点地图或外部链接仍在指向非主版本。
重复页面不是一次性问题。新功能、新参数和新模板都可能重新制造重复。建议在以下节点复查:
维护时保留一份重复组清单,记录每组的主版本、处理方式和复查日期。这样下次出现相似URL时,可以直接对照,而不是从头再查一遍。
下一步:打开Search Console的“网页”报告,导出“重复网页”相关URL,按标题和正文首段做一次分组,先选出三组最明显的重复,再决定用301、canonical还是内容合并。