核对抓取限制,关键是先确认搜索引擎是否真的被阻止访问,而不是只看搜索结果多少。起点是查 robots.txt、页面 meta 指令、HTTP 响应头和服务器日志。第一次接触时,先做只读检查,不要急着改文件。
抓取限制可能来自多个层面,不要一上来就认定是某个原因。按下面顺序逐项记录:
robots.txt 是否对目标路径写了 Disallow<meta name="robots"> 是否含 noindex 或 nofollowX-Robots-Tag 是否限制了抓取或索引准备阶段只记录现状和检查时间,不修改任何配置。这样后续对比才有基线。
最关键的一步,是把搜索引擎看到的内容与你在浏览器看到的内容分开验证。可以用命令行工具模拟一次普通请求,观察状态码和响应头:
curl -I -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://example.com/page
这条命令是假设示例,把网址换成你自己的页面即可。重点看三处:
X-Robots-Tag: noindex 或 nofollow。如果 robots.txt 写了限制,再单独读取该文件确认规则作用范围。注意 Disallow 只影响抓取,不等于页面一定不会出现在结果里;noindex 才是针对索引的指令。两者要分开判断。
单次请求只能说明那一刻的响应。要确认限制是否长期存在,可以查服务器访问日志,筛选搜索引擎爬虫的 User-Agent,看它们请求目标路径时拿到的状态码。若日志里大量出现 403、429 或 5xx,说明服务器端确实在拦截。
还可以用搜索引擎官方提供的抓取测试或网址检查类工具,查看抓取状态和渲染结果。不同搜索引擎的抓取测试入口和报告字段不同,以各自官方文档为准。验证时至少记录三项:检查时间、请求返回码、页面内容是否完整。只凭“搜不到”就断定被限制,理由不充分,因为排名波动、索引延迟和内容质量也会影响展现。
解除限制后,不要马上认定已经恢复。抓取和索引都需要时间,而且搜索需求、季节变化和采集差异都会影响前后对比。建议保留一份简单记录:
如果改动后返回码变为 200,但页面仍未被索引,继续核对 noindex、canonical 指向和内容是否与目标查询相关。抓取限制只是索引链路中的一环,不是唯一条件。
下一步:选一个你怀疑被限制的具体页面,按上面的命令做一次请求,记录返回码和响应头,再和 robots.txt 规则对照。先拿到这两项事实,再决定要不要修改配置。