判断采集是否遗漏,核心方法不是看总量,而是做“抽样比对”:从你已知存在的页面里抽一批,逐一检查它们是否出现在采集结果中。只要抽样中出现稳定比例的缺失,就说明采集有遗漏;如果抽样全部命中,也只能说明当前样本范围内没有遗漏,不能直接推断全站完整。
遗漏是相对某个基准说的。做网站排名检测时,常见基准有三类,判断前必须先选定一种:
把“采集基准”和另外两者比对,才能得出遗漏结论。如果只对比总量,比如站内有一千页、采集到八百页,只能说明数量差,不能说明差在哪、是否属于遗漏。真正可执行的做法是先固定基准来源,再抽样。
时间和人手有限时,优先做分层抽样,而不是全量核对。具体步骤如下:
这里最关键的一步是复核缺失项。很多所谓遗漏,其实是比对时标识不一致造成的假缺失。只有复核后仍然找不到的,才算真实遗漏。
同一现象可能有多种解释,不能一看到缺失就断定采集漏了。可以按下面的证据强度判断:
假设某站有“详情页”和“标签页”两类,抽样各二十条。详情页命中二十条,标签页只命中五条。此时不能直接说全站遗漏,但可以判断标签页这一类存在明显缺口,应优先检查采集规则是否覆盖了标签页的入口和链接。
得出遗漏结论后,要留下可复查的记录:抽样层级、抽样数量、命中与缺失清单、复核结果、判断依据。下次再检测时,用同一套抽样方法对比,才能看出遗漏是偶发还是持续。
维护阶段建议固定两件事:一是固定抽样比例和分层方式,避免每次口径不同导致结论无法比较;二是固定复核规则,明确哪些情况算缺失、哪些算标识不一致。这样即使人手有限,也能用较小成本持续监控采集完整性。
下一步,先选一个页面类型做二十条抽样,完成一次命中与缺失的复核记录。这份记录会成为后续判断采集是否遗漏的基线。