先把结论说清楚:当一批页面只有一部分被搜索引擎发现时,不要按“已发现/未发现”直接分组,而应先按抓取入口和链接路径划分对照组,再观察同一规则下两组的行为差异。如果所有页面共用同一入口、同一模板、同一内链结构,那么“已发现”与“未发现”的差异更可能来自页面本身或外部信号,而不是抓取规则;反之,如果两组在入口层级、链接深度或站点地图覆盖上明显不同,优先怀疑抓取路径而非内容质量。
“被发现”至少可以指三种状态:搜索引擎知道这个 URL 存在、抓取工具访问过这个 URL、以及该 URL 进入了可被检索的索引。三种状态对应的证据不同,混在一起分组会让后续判断失去意义。
noindex 与 robots.txt 的作用完全不同。实际操作时,先导出这批页面的 URL 清单,再分别标注“站点地图是否收录”“内链是否可达”“抓取日志是否出现”“索引状态是否可见”。只有完成这一步,后面的对照组才有可核对的基础。缺少任何一列,分组都可能把不同原因混进同一组。
最容易被忽略的划分维度是入口来源。同一批页面如果一部分只靠站点地图提交,另一部分同时有站内链接指向,那么两组的抓取概率本来就不对等。此时把“被发现”和“未发现”直接对比,等于把入口差异误读成页面质量差异。
可以按以下方式建立对照组:
然后观察每组在抓取日志中的请求次数和首次请求时间。如果组 A 明显高于组 B,说明内链仍然是有效的发现路径;如果组 B 和组 A 接近,则说明站点地图在这批页面上起到了替代作用。注意,站点地图不保证收录,它只提供发现线索,不能把“已提交”直接等同于“已抓取”。
一个假设例子:某批 200 个页面中,120 个有站内链接,80 个只在站点地图里。假设两周后日志显示有站内链接的页面被抓取 110 个,仅站点地图的页面被抓取 20 个。这个差距提示入口差异是主要变量,下一步应优先给仅站点地图的页面补内链,而不是先改页面正文。
如果所有页面都同时有内链和站点地图,但发现比例仍然分裂,下一步要看链接深度和模板位置。首页直接链接、列表页第一页链接、分页深处链接,对抓取工具来说路径长度不同。把这三类混成一组,会掩盖真正的分层。
可以建立三个对照维度:
如果深度为 1 到 2 的页面发现率明显高于深度 4 以上的页面,优先调整链接结构,而不是反复提交站点地图。如果深度相同但发现率仍然分裂,再检查模板是否对某些页面输出了不同的链接属性,例如 nofollow 或动态参数。这里要注意,不同搜索引擎对链接属性和动态参数的处理并不完全一致,必须分别核查,不能用一个引擎的表现推断另一个。
假设你发现某组页面在抓取日志中请求很少,于是判断“抓取规则限制了它们”。但如果这些页面本身返回了 noindex,或者 robots.txt 禁止了抓取,那么日志减少只是结果,不是原因。更关键的是,robots.txt 的抓取限制不等于可靠的索引移除:被禁止抓取的 URL 仍可能因为外部链接而出现在索引中,只是摘要可能受限。反过来,即使抓取日志显示请求正常,也不能证明页面一定会被索引。
因此,当对照组出现“抓取少但索引有”或“抓取多但索引无”的反常组合时,先检查三个证据:HTTP 状态码、页面级 meta robots、以及 robots.txt 是否覆盖该路径。只有排除这三项之后,才把差异归因于链接路径或内容判断。否则,后续所有调整都可能建立在错误前提上。
确定对照组之后,不要同时改内链、站点地图和页面内容。选一个最可疑的变量做最小改动,例如只给“仅站点地图”组补上从相关列表页到目标页的站内链接,保持站点地图和页面正文不变。然后观察抓取日志中该组的请求是否增加。
如果请求增加,说明入口路径是主要限制,下一步可以扩展到其他深度较深的页面;如果请求没有变化,则要回到页面级信号,检查是否存在重复内容、参数冲突或服务器响应不稳定。这个动作的关键不是一次改多少,而是让改动前后的对照组保持可比较。请求量或抓取量归零也不能单独证明处理正确,它还可能来自日志采样、抓取配额调整或站点整体流量波动,需要结合其他证据一起判断。
最后提醒一点:HTTPS 不保证安全无漏洞,也不保证排名;它只是抓取和索引的基础条件之一。把发现率问题简单归因于协议,通常会错过真正的入口差异。