重复页面排查的目标不是把所有相似URL都删掉,而是找出真正会让搜索引擎难以判断主版本的URL,并保留有独立价值的页面。常见误解是“内容相似就是重复页面,删掉就行”,但相似只是线索,是否构成重复还要看可访问性、规范化信号、内链指向和实际搜索表现。
排查前先给问题分类,否则容易误删有效页面。
判断依据是“这个URL是否值得被单独搜索到”。如果答案是否定的,才考虑合并或规范化;如果每个URL都有独立筛选价值,应保留并让内容差异更明确。
不需要一开始就抓取全站。可以先用站内搜索和服务器日志找出可疑URL:
site:你的域名加一段正文中的独特句子,观察返回了哪些URL。?的请求,统计哪些参数被大量抓取。假设某篇文章可通过/post/1、/post/1?from=home和/print/1访问,正文一致,那么前两者属于参数重复,打印页属于功能重复。若打印页没有独立搜索需求,应让它指向主版本,而不是直接删除后留下404。
找到可疑URL后,逐项核对页面上的信号:
rel="canonical"是否都指向同一个主URL。如果canonical指向A,但内链和站点地图都指向B,搜索引擎收到的信号就是矛盾的。此时优先统一信号,而不是马上删除B。只有确认B没有独立价值、也没有外部链接时,才考虑重定向到A。
排查结束后,每个可疑URL都应落到一个明确动作:
改动前后比较时,要考虑季节、搜索需求变化和数据采集差异,不能把一次波动直接归因于重复页面处理。判断是否有效,应看主版本是否稳定获得展示、重复URL是否逐渐减少被抓取,而不是只看某一天的数据。
下一步可以选一个内容集群,先列出它的全部可访问URL,再按上面的三种动作逐条标记;标记完成后再统一修改canonical、内链和站点地图,避免边查边改导致信号反复。