重复页面排查的核心不是把所有相似页面都删掉,而是先确认哪些 URL 能被访问、哪些被索引、哪些互相竞争同一批查询。时间和人手有限时,最先做的是拉取一份可索引 URL 清单,再用站点指令和页面自身信号交叉比对。只有确认重复关系后,才决定合并、规范化还是保留。
不要凭感觉猜重复。从站点地图、站内链接、日志和搜索平台提供的索引报告里各取一份 URL 列表,合并去重后作为排查底稿。底稿里至少保留四列:完整 URL、页面标题、页面主要目标词、是否返回 200 状态。若同一内容存在带参数、带大小写、带尾斜杠等多种写法,也要分别列出,因为它们在技术上就是不同地址。
这一步的判断标准很直接:同一套内容对应多个可访问 URL,且这些 URL 没有明确的主次关系,就属于需要继续核查的候选重复。若只是列表里出现相似标题,但正文主体不同,不应直接归为重复。
确认重复时,单看标题相似度不够。更可靠的做法是同时检查正文主体、规范标签和内部链接指向。
<link rel="canonical"> 指向哪里。若多个 URL 都指向同一个规范地址,说明站点已表达主次;若各自指向自己,则需要人工判断。假设某商品页存在 /product/123 和 /product/123?color=red 两个地址,正文主体几乎一致,前者被导航链接,后者只从筛选页进入。此时可先把后者规范到前者,并观察后续索引变化。这个例子只用于说明判断方法,不代表任何真实站点数据。
完成规范化或合并后,不要只看一两天数据就下结论。搜索需求本身会随季节和热点变化,数据采集也可能有延迟。比较时尽量固定查询范围、设备类型和统计周期,并记录改动日期。若规范标签已生效,可重点观察重复 URL 是否逐渐退出索引、主 URL 是否获得更稳定的展示。若一段时间后重复地址仍被大量访问,需要回到内部链接和站点地图继续排查,而不是反复修改页面正文。
排查一次只能解决存量问题。更省人力的做法是在发布流程里加一道检查:新页面是否已存在同主题旧页面;筛选参数是否会被站内链接大量暴露;分页、打印页和移动端地址是否有明确规范。把这几项写成发布前清单,比事后全站扫描更省时间。
下一步可以直接从底稿中挑出访问量最高、内部链接最集中的十个候选 URL,先核对它们的规范标签和内部链接指向,再决定处理顺序。