抓取、索引和排名是三个先后不同、失败表现也不同的环节:抓取是搜索引擎发现并读取页面,索引是判断页面是否值得存入可供检索的库,排名是用户搜索时从已索引内容中挑选并排序。时间人手有限时,先看页面有没有被抓取,再看有没有进入索引,最后才判断排名,因为前一步没完成,后一步就无从谈起。
如果目标是让某个页面在搜索结果里出现,那么需要的不是一上来就改标题和正文,而是按顺序拿到三类证据。抓取环节要确认搜索引擎是否访问过这个地址;索引环节要确认这个地址是否被收录;排名环节才轮到某个查询下页面出现在什么位置。把这三件事混成一句“没排名”,就会把抓取失败误当成内容质量差,把索引失败误当成外链不够。
假设有一个新页面迟迟没有流量,可以按下面顺序做,每一步都设一个判断结果,避免同时改十处。
这个顺序的适用条件是:页面本身可以正常打开,且你只关心一个具体地址。若整站大量页面同时消失,应先查规则文件和服务器状态,而不是逐页改内容。
抓取不等于索引。搜索引擎可以访问一个页面却不收录它,常见解释包括内容重复、质量判断、规则限制,但这些只是可能原因,不能凭一个现象断定唯一原因。索引不等于排名。页面进入索引只代表有资格参与检索,具体查询下是否出现、出现在第几位,还取决于该查询的竞争和页面与查询的匹配程度。排名波动不等于抓取故障。如果页面仍能被搜到,只是位置变化,优先看查询意图和内容更新,而不是先怀疑抓取。
做技术记录时,把 HTML 标签写成文字说明即可,例如讨论标题层级时写 <h2>,不要把它当成可执行代码。排查项之间要分开记录,避免把“未收录”和“排名下降”写进同一条结论。
按交付结果倒推,最先处理的一定是阻断抓取的因素,其次是阻断索引的因素,最后才是排名优化。判断依据很简单:如果抓取和索引都没通过,做排名相关工作的收益接近零。责任划分上,抓取和索引通常涉及服务器、规则文件、站点结构和内容发布流程;排名更多涉及内容、内链和外部信号。验收时分别设定检查项:抓取看访问记录,索引看地址级收录状态,排名看具体查询下的自然结果位置。三者不要用同一个指标验收。
下一步,选一个目标页面,按上面的四步顺序各记录一次结果,再决定把时间投在哪一环。