检查重要页面是否被发现,核心是分清两件事:搜索引擎是否已经抓到页面,以及页面是否已经进入可被展示的索引。时间和人手有限时,先处理“重要但连抓取都没有发生”的页面,再处理“已抓取但未收录”的页面。判断依据不是感觉,而是抓取日志、站点地图提交后的响应、以及站内链接能否让爬虫顺着走到目标页。
如果服务器日志可查,筛选目标页面的URL,看是否出现过搜索引擎爬虫的访问记录。有访问记录,说明至少被发现过;没有访问记录,可能是入口太深、站内链接太少、站点地图未提交,或者页面被robots规则挡住了。没有日志权限时,可以在搜索框直接查完整URL,观察返回的是目标页本身,还是提示没有找到匹配结果。这个结果只能作为线索,不能单独当作收录结论。
检查时按下面顺序做,能快速排除最明显的问题:
site:加完整URL查一次,看目标页是否出现在结果中。<meta name="robots" content="noindex">。<a>标签,不是只能靠脚本触发。先观察再动手,避免把已经正常的页面反复改动。若日志显示爬虫来过,但搜索中没有该页,优先判断内容是否太薄、是否与站内其他页面高度重复、是否缺少独立标题和描述。若日志里完全没有爬虫痕迹,优先补入口:从相关栏目页、旧文章正文或导航中加入指向该页的链接,并确认站点地图包含该URL。
处理时只改一个变量,便于复查。例如,先补一条站内链接并提交站点地图,不同时改标题、正文和URL结构。一次改动前后比较要考虑季节、搜索需求变化和数据采集差异,不能把波动全部归因于这次调整。
假设某产品说明页很重要,但搜索不到。先查日志,发现没有爬虫访问记录;再查站内链接,发现只有首页轮播图指向它,而轮播图依赖脚本加载。处理方式是在相关分类页正文中增加一条文字链接,并把该URL加入站点地图。复查时看两件事:日志中是否出现对该URL的抓取,以及搜索该完整URL时是否从“无结果”变为能返回目标页。若日志有抓取但搜索仍无结果,下一步应检查内容质量和重复度,而不是继续加外链。
复查周期不必太短,给抓取和索引留出处理时间。重点看三个信号:目标URL是否被爬虫访问、是否返回200、搜索完整URL时是否出现该页。三个信号都满足,说明“被发现”这一步基本完成;若只满足前两个,问题更可能出在索引判断上。此时应回到内容层面,确认页面是否有独立价值、是否与已有页面解决同一个问题。
下一步,挑出你最重要的三个页面,按上面的清单逐项记录抓取、状态码、站内入口和搜索返回结果,先处理完全没有入口的那一个。