重复页面排查的起点不是删除,而是确认“重复”发生在哪一层:是多个网址返回了相同或高度相似的内容,还是同一内容被不同参数、不同域名、http与https、带不带www等版本同时暴露。对第一次接触这个问题的人来说,下一步应是先做一份网址清单,再用抓取和日志判断哪些版本真正被访问、被链接、被收录,最后才决定保留哪个版本、如何处理其余版本。
很多人发现两个页面正文几乎相同,第一反应是删掉其中一个。这个做法可能带来新问题:被删的网址如果有外部链接或已有访问量,会直接损失入口;如果两个页面面向不同地区、不同设备或不同筛选条件,简单删除还会破坏用户体验。
更稳妥的判断是:重复页面不一定都要消失,但需要让搜索引擎明确知道哪个是首选版本。处理方式包括保留一个主版本、把其他版本重定向到主版本、用规范标签指向主版本,或者让无价值的参数版本不被抓取。选哪种,取决于重复产生的原因和这些网址是否还有独立价值。
排查时按来源分类,比逐个页面看内容更有效:
http与https、带www与不带www同时可访问,返回同一套内容。/page与/page/、路径大小写不同,服务器分别返回200状态码。这些来源的处理优先级不同:协议和主机名变体通常应统一到一个版本;参数版本要看是否影响页面实质内容;分页和打印版则要判断是否应被索引。
假设你有一个内容站,怀疑筛选参数产生了重复页面。可以按下面步骤操作:
这里的判断结果很具体:如果某个参数版本没有任何外链和访问量,且内容与主版本完全一致,通常可以重定向或限制抓取;如果它有自己的外链和访问量,直接删除会损失入口,应先评估能否把外链和访问引导到主版本,再决定处理方式。
三种手段解决的不是同一个问题:
选择条件可以简化为:用户是否还需要访问旧地址?需要,就优先考虑规范标签;不需要,就考虑重定向;数量极大且无独立价值,才考虑抓取限制。三者可以组合,但不能互相矛盾,例如一个网址既被robots禁止抓取,又在页面里写规范标签指向别处,搜索引擎可能无法读取这个规范标签。
重复页面处理不是一次改动就结束。复查时至少看三项:
比较改动前后数据时,要避开季节、搜索需求变化和数据采集差异带来的干扰。例如促销期前后流量本身会波动,不能把波动全部归因于重复页面处理。判断应基于同一类页面的趋势,而不是单个页面的单日数字。
下一步,你可以先导出最近30天被访问过的网址清单,按标题和正文摘要分组,找出重复组最多的那一类来源,再决定先处理协议主机名变体,还是先处理参数版本。这样比逐个页面删除更接近问题的起点。