先给结论:当一批页面只有一部分被发现时,不要按“已发现”和“未发现”直接分组对比,而要先按一个可独立核对的变量分层,再在层内划分对照组。更稳的做法是选一个你能够从服务器日志、站点地图提交记录或页面自身属性中独立确认的差异,例如链接入口数量、模板类型或发布时间段,用它把页面分成两组,然后观察两组在发现率上的差异。如果这个差异同时伴随抓取频率、页面层级或内链结构的变化,那么它才值得作为下一步动作的候选原因。
把“已发现”和“未发现”当成两个对照组,看起来最省事,但它把结果当成了分组依据。发现本身就是你要解释的结果,用它来分组,等于在问“为什么被发现的页面被发现了”。更麻烦的是,这种分组会同时混入多个变量:已发现的页面可能恰好发布时间更早、内链更多、模板更简单,你无法判断到底是哪一个在起作用。
可操作的做法是换一个分组轴。假设一批 200 个页面中 60 个被发现,你可以先按“是否有至少两个站内链接指向”分成两组,再在每组内部统计发现比例。这样得到的比较才具备可解释性。这个例子是假设的,数字只用于说明分组方法,不代表任何真实站点的表现。
选择分层变量时,优先选那些不依赖“是否被发现”就能确认的事实:
这三个变量的共同点是:你可以从页面本身或服务器记录中直接读出,不需要等抓取结果。分层之后,如果某一层内部两组差异明显缩小,说明这个变量很可能解释了大部分分歧。
如果整批页面都放在同一个站点地图中,且站点地图本身没有被成功抓取,那么按链接入口或模板分层都不会产生有效对照,因为所有页面在抓取入口这一层就已经被同等阻断。这时你需要先确认站点地图是否可访问、是否被引用,再谈分层。站点地图不保证收录,但站点地图不可达会让基于页面属性的分组失去意义。
另一个需要排除的情况是抓取限制。robots.txt 的抓取限制不等于可靠的索引移除:它可能阻止抓取,却不能让已经进入索引的页面消失。反过来,如果限制规则误伤了部分路径,那么未发现的页面可能只是被规则挡住,而不是内容或链接问题。此时按模板分层同样会失真,因为阻断发生在更早的环节。
当多个角色对“为什么只有一部分被发现”有不同理解时,不要继续争论,而是把分歧写成一个可核对的对照表。具体动作是:选定一个分层变量,把页面分成两组,记录每组的发现数量、抓取次数和最后一次抓取时间,然后约定一个观察窗口。窗口结束后,如果两组差异稳定,就把该变量作为下一步优化对象;如果差异消失,说明原来的分歧来自观察时点不同,而不是页面本身。
这个动作的结果会直接决定下一步:差异稳定时,优先调整链接入口或模板输出;差异不稳定时,先复查抓取日志和站点地图状态,而不是改动页面内容。无论哪种结果,都不要把“请求量归零”或“抓取量下降”单独当作处理正确的证据,因为缓存、抓取配额调整或外部链接变化都可能产生同样的现象。