重复页面排查的核心不是把所有相似网址都改掉,而是先找出“同一批内容被多个网址访问、且这些网址都可能被搜索引擎抓取和收录”的情况。人手有限时,优先处理站内可抓取重复和参数重复,因为它们通常改动成本低、影响面大;跨域名转载和近似主题页可以放到后面,用规范标签、合并或差异化来治理。
第一类是技术性重复:同一页面能通过带 www 和不带 www、http 和 https、带斜杠和不带斜杠、带 index 和不带 index 等地址打开。这类问题通常一次规则配置就能覆盖大量网址,代价最低,应最先查。
第二类是参数和排序重复:列表页、筛选页、分页、跟踪参数可能生成大量内容相近的网址。比如一个商品列表加 ?sort=price、?page=2、?ref=abc 后,主体内容变化很小。这类要看参数是否改变核心内容,再决定保留、规范还是屏蔽抓取。
第三类是内容近似重复:同一篇文章发在两个栏目、不同城市页面只换了地名、产品页描述大量复用。这类往往需要编辑判断,代价最高,不适合作为第一轮清理对象。
最直接的办法是抽取页面标题或正文中的一句独特文字,放到搜索引擎里搜索,观察返回结果中是否出现同一站点的多个网址。也可以使用站点抓取工具,导出所有可抓取网址,按标题、正文摘要、状态码分组,找出标题相同或正文相似度高的网址。
检查时重点看四项:
如果两个网址内容相同、都返回 200、都没有互相指向的规范标签,并且站内还有链接指向它们,就应列入优先处理清单。
时间和人手有限时,可以用一个简单判断:先处理被抓取概率高、改动成本低的重复。被抓取概率高,意味着它有站内链接、在站点地图里、或者已经被搜索引擎收录;改动成本低,意味着可以通过服务器重定向、规范标签、robots 规则批量处理。
假设某站有 500 个带跟踪参数的网址和 20 组栏目重复文章。参数网址有站内链接、数量大、可用规范标签或参数处理规则统一解决;栏目重复文章只有 20 组,但每篇都要人工判断保留哪一版。此时先处理参数网址,再处理文章重复,通常更划算。这里只是假设例子,实际排序要看你自己的抓取数据和链接分布。
验证时不要只看一天的数据。一次改动前后比较要考虑季节、搜索需求变化和数据采集差异,短时间内的排名或流量波动不能直接归因于重复页面处理。
如果两个网址内容相似,但一个主要给用户看、另一个只用于站内搜索或临时活动,且后者没有站内链接、没有被收录、也不在站点地图中,可以先记录,不必立刻投入人力。反过来,如果重复网址已经被收录、有外部链接或承担转化入口,就应优先处理,避免用户和搜索引擎在多个版本之间分散信号。
下一步,从你的站点导出可抓取网址,按标题分组,先标出返回 200 且标题相同的网址。只处理这一批,改完验证后再进入参数和内容近似重复。