判断问题属于哪一层,核心是看页面在“被抓取—被索引—被展现”这条链路中停在了哪一步。搜索引擎收录入口并不是一个单独的提交按钮,而是一组让搜索引擎发现、抓取并收录页面的路径,包括站内链接、站点地图、外部链接以及搜索平台的提交工具。第一次接触这个问题时,不要急着改代码或反复提交,先确认现象:是搜索引擎完全不知道这个网址,还是抓取了但不收录,还是收录了却搜不到。这三类现象对应不同层级,处理方式也不同。
假设你新建了一个页面 https://example.com/guide/seo-basics,上线三天后在搜索引擎里搜完整标题,结果没有出现。这个现象至少有三种解释:第一,搜索引擎还不知道这个网址;第二,搜索引擎抓取了,但判断不值得索引;第三,页面已被索引,只是排名太靠后或标题被改写,导致你搜不到。把这三层分开,才能找到真正的起点。
可以按下面的顺序执行检查:
site: 查询该网址,看是否已有索引记录。有记录说明问题在展现层,没有记录则继续往下查。noindex、robots.txt 拦截、登录墙或大量重复内容。这些都会阻断索引。常见错误是跳过前两步,直接反复提交网址或修改标题。如果爬虫根本没来过,改标题不会让页面被收录;如果页面已被索引只是排名靠后,反复提交也没有意义。另一个错误是把 robots.txt 的抓取限制当成可靠的索引移除手段:它只阻止爬虫抓取,已经收录的页面仍可能留在索引中,需要配合 noindex 或搜索平台的移除工具处理。
抓取层要回答两个问题:网址是否被发现,以及是否被允许抓取。发现途径包括站内导航链接、站点地图、外部链接和搜索平台的手动提交。站点地图能帮助发现网址,但不保证收录,也不保证抓取频率。允许抓取则要检查 robots.txt 是否误拦截、服务器是否返回 5xx 错误、页面是否需要登录才能访问。如果日志里爬虫从未出现,优先排查发现路径和拦截规则,而不是内容质量。
索引层的问题表现为爬虫来过,但页面没有进入索引。可能原因包括:页面返回 noindex、内容与站内其他页面高度重复、正文过少或主要由模板构成、 canonical 指向了别的网址、页面需要 JavaScript 渲染而渲染失败。这里要注意区分“可能原因”和“已经定位的原因”:看到“已抓取,未编入索引”只说明卡在索引层,具体是哪一个原因,需要逐项核对页面源代码、响应头和渲染结果。HTTPS 只解决传输加密,不保证页面安全无漏洞,也不保证被收录或获得排名。
如果 site: 查询显示页面已被索引,但搜目标词找不到,问题在展现层。可能原因包括:关键词竞争激烈、页面主题与查询意图不匹配、标题和摘要被搜索引擎改写、内容时效性不足。此时修改抓取设置或重新提交网址不会带来变化,应该把精力放在内容与查询意图的匹配上。不同搜索引擎的索引和展现机制不同,同一页面在一个引擎有收录、在另一个引擎没有收录是正常现象,需要分别核查,不能用一个引擎的结果推断另一个。
把检查结果对应到层级:日志无爬虫、robots.txt 拦截、无任何入口链接,属于抓取层;有抓取记录但无索引、存在 noindex 或重复内容,属于索引层;已有索引但搜索不可见,属于展现层。下一步是先确认当前页面处于哪一层,再只针对该层做一项改动,观察后续抓取和索引状态是否变化,避免同时修改多个变量导致无法判断哪一步起了作用。