在自建博客里排查重复页面,核心是找出“同一篇内容被多个网址访问”或“多篇内容高度相似”的情况,再按影响范围决定先处理哪些。时间和人手有限时,不要一上来就全站翻查,而是先看索引与站点地图的差异,再检查标签、分页、参数和转载这几类高频来源。
假设你的博客有 80 篇文章,其中一篇讲“新手选域名”,同时存在三个可访问网址:文章正式地址、带 ?from=home 的首页推荐地址、以及按标签聚合出来的列表页。搜索引擎可能把这三个都当成候选页面,导致正式文章获得的权重被分散。
排查时可以按这个顺序执行:
site:你的域名 观察实际出现的网址形态,记录带参数、带标签、带分页的地址。常见错误是只删掉页面,却不处理内链和站点地图,结果旧地址仍被访问、仍被引用。另一个错误是把所有标签页都当成重复页面删除,实际上标签页如果有独立筛选价值,可以保留但限制其被索引。
这四类里,参数地址和标签页通常最容易批量出现,也最适合优先处理。分页和转载则要结合博客规模判断,不必一次全部改动。
可以按“影响面 × 处理成本”排序。影响面指重复地址数量、是否指向核心文章、是否已被搜索结果显示;处理成本指改模板、改链接、提交更新所需时间。
优先处理同时满足以下条件的:
如果某类重复只涉及两三篇文章,且这些文章本来就不是重点,可以放到后面。不要因为某个工具报告了上百条重复就立刻全部处理,先看这些地址是否真的被索引、是否真的带来访问。
处理重复页面后,不要用“今天改完、明天看排名”来判断效果。搜索需求会随季节和热点变化,数据采集也有延迟,单日波动不能说明问题。
比较时可以这样做:
判断结果时,重点看“重复地址是否减少”和“正式地址是否更集中”,而不是只看某一天的整体流量。流量受需求变化影响,不能单独作为重复页面是否解决的证据。
从现在开始,只做一件事:打开站点地图,挑出 10 篇最重要的文章,逐一搜索它们的标题或网址片段,记录出现的不同地址。把这份清单按“已索引、可批量处理、涉及核心文章”三个条件排序,先处理排在最前面的三条。处理完再复查同一批地址,确认正式版本是否稳定保留。