排查重复页面时,先把“内容近似或相同、但URL不同”的页面列出来,再判断它们是否都能被搜索引擎抓取和索引。时间和人手有限时,最先处理的不是所有重复,而是那些会互相争抢同一批查询、且至少有一个版本能被索引的页面。处理完成后,用站点查询和页面收录状态观察变化,而不是期待固定几天内见效。
“重复页面”在日常排查中常混在一起,实际要分开看:
优先顺序建议是:完全重复和跨协议重复先处理,因为它们最容易造成抓取分散;近似重复其次,因为往往涉及产品筛选、分页等有实际用途的页面。判断依据不是“看起来像”,而是页面主体内容是否高度一致、是否都返回正常状态码、是否都允许索引。
没有现成重复报告时,可以按下面步骤手工建立清单:
canonical标签、robots元标签和HTTP状态码。这里的关键检查项是:页面是否返回200、是否被noindex排除、canonical指向哪个地址。如果两个URL都返回200且都允许索引,又指向不同canonical,就属于需要优先处理的候选。
假设一个站点有A、B两个URL,正文相同,A被索引,B也被索引,且B没有canonical指向A。此时B会与A争抢同一批查询。可执行的处理是:确认A为希望保留的版本,把B的canonical指向A;如果B没有独立价值,也可以让B返回301跳转到A,或对B加noindex。三种做法适用条件不同:
如果B本身有独立搜索需求,例如不同筛选条件对应不同查询,就不要简单合并,而应检查标题、描述和正文是否真的足够不同。判断结果是:能独立满足不同查询的页面保留;只是同一内容换URL的页面合并或排除。
改动后不要只看一个页面是否还在。可核对的信号包括:目标URL是否仍能被抓取、重复URL是否逐渐从索引中消失、同一组查询下是否还出现多个近似结果。比较前后数据时要考虑季节和搜索需求变化,不能把一次波动直接归因于本次修改。若两周后重复URL仍被索引,先检查canonical是否被正确读取、页面是否仍返回200、是否有其他内链持续指向重复版本。
时间和人手有限时,下一步是:从清单中挑出“两个URL都返回200、都允许索引、正文前200字相同”的一组,先处理这一组,再按同样方法推进下一组。