判断采集是否遗漏,核心不是看总收录数,而是把“站内真实存在的URL”与“搜索引擎已处理的URL”做差集,再判断差集里的页面是否值得被采集。时间和人手有限时,先查高价值页面,再查全站,不要一上来就铺开。
要查什么:站内实际可访问、且希望被采集的URL清单。怎么查:从XML站点地图、站内导航、栏目列表页、数据库导出的内容表三个来源各取一份,合并去重。结果说明什么:如果三个来源的URL数量差异很大,说明站点地图或导航本身就有遗漏,此时先修来源,再谈采集遗漏。适用条件:内容量在可人工处理范围内时用表格,量级过大时按栏目抽样。
要查什么:某目录或某批URL是否被搜索引擎处理。怎么查:用site:你的域名/目录/逐段查询,同时用site:域名 关键词查具体页面。结果说明什么:site结果只能作粗筛参考,它不区分“已收录”“已发现未收录”“被过滤”,也可能只显示部分结果。适用条件:适合快速判断某个栏目是否整体缺失;不适合用它算出精确收录率。判断结果时,若某栏目在site里几乎不出现,而站内该栏目有大量正常页面,就要进入下一步逐条核验。
要查什么:差集里每个URL的处理状态。怎么查:在搜索引擎结果页直接搜索完整URL,或用站长平台提供的URL检查工具查看“已发现”“已抓取”“已编入索引”等状态。结果说明什么:
适用条件:优先核验有搜索需求、有转化价值的页面;纯功能页、参数页、重复列表页可以放后。注意,以上只是可能原因,不能凭单一现象断定唯一原因,需要结合日志和页面本身交叉判断。
要查什么:搜索引擎爬虫对目标URL的访问记录。怎么查:在服务器日志中筛选爬虫User-Agent,统计目标目录或目标URL的访问次数与响应码。结果说明什么:如果日志里从未出现该URL,问题更可能在发现环节,如内链和站点地图;如果日志里有访问但状态码是5xx、超时或频繁429,问题在抓取环节;如果访问正常却仍未收录,问题在内容采用环节。适用条件:日志需要保留足够时间窗口,且要区分不同爬虫,不要用一次访问就下结论。
要查什么:遗漏页面的类型和数量。怎么查:把差集按栏目、页面模板、是否有内链、是否有搜索需求分组。结果说明什么:
假设某站有1000个详情页,其中某栏目200页在site查询中几乎不出现,日志显示爬虫从未访问,则该栏目优先处理;若另一栏目200页日志显示已抓取但未编入索引,则应先查内容与结构,而不是继续加内链。
下一步:先导出你站内希望被采集的URL清单,按栏目分组,再对每组做一次site粗筛和日志核对,把“从未被抓取”的组排在“已抓取未收录”的组前面处理。