判断采集是否遗漏,不能只看“抓到了多少条”,而要把采集结果与一个可核对的参照集合做比对:先确定目标范围内应有多少条链接,再检查实际结果缺了哪些、缺在什么条件上。链接质量检测中的“采集”通常指抓取页面上的链接、记录链接指向和锚文本等属性;遗漏就是目标范围内本该出现的链接没有被记录。判断方法不是猜,而是建立参照、分层抽样、复核差异。
遗漏是相对于范围而言的。同一个页面,如果只要求采集正文内指向站内的链接,那么导航、页脚、广告位里的链接没采到不算遗漏;如果要求采集全页所有可点击链接,它们就是遗漏。开始比对前,先把下面几项写清楚:
<a> 元素,还是包含按钮、脚本跳转在内的全部可点击目标。范围没定,后面的数量对比就没有意义。判断遗漏的第一步不是跑工具,而是把这份范围说明写成可执行的筛选条件。
采集器报告“本次采集 5000 条链接”,只能说明它记录了多少,不能说明漏了多少。要判断遗漏,需要另一个来源作为参照。可用的参照包括:
参照集合不必覆盖全站,但必须覆盖不同模板:首页、列表页、详情页、分页、专题页各取若干。模板之间的链接结构差异,往往正是遗漏集中出现的地方。
全量逐条比对成本高,实际诊断通常先抽样。假设某站点有 5 类页面模板,每类抽 10 个页面,共 50 页,逐页记录目标链接数并与采集结果对比。如果详情页比对一致、列表页分页部分缺失,问题就集中在分页链接的识别或翻页逻辑上。这种对比只用于定位方向,不能据此推算全站遗漏比例。
比对时按下面顺序记录,避免把不同问题混在一起:
第 1 步和第 2 步的结论不同,处理方向也不同。把“页面没抓到”当成“链接漏采”,会修错地方。
同一现象可能有多个解释,不要一看到数量偏少就断定是解析规则写错。可以按下面几类逐一排查:
每一项都要有可核对的证据,例如原始 HTML 片段、采集日志条目、入库前后条数。只有现象、没有证据,无法区分是采集遗漏还是统计口径差异。
完成比对后,结论应当能回答三个问题:遗漏发生在哪类页面、哪类链接、哪个环节;影响范围是抽样中的个别情况还是整类模板;修复后用什么标准验收。验收标准可以设为:同一批抽样页面重新采集后,目标链接与参照集合逐条一致,且字段完整。达不到就继续缩小范围定位,而不是用“大概齐了”结束。
下一步,选 3 到 5 个不同模板的页面,保存其源码快照,人工列出目标链接,再与采集结果逐条对照。这份对照表就是后续修复和验收的依据。