Google分层索引:页面被分进Base、Zeppelin还是Landfill层?
本文目录
摘要:页面被谷歌抓取、甚至在站长后台显示“已编入索引”,却始终进不了搜索结果,很多时候原因不在内容质量,而在于它进入索引时就被分到了错误的层级。谷歌的索引并不是一个平面的大池子,而是分成Base、Zeppelin、Landfill三层,2024年泄露的内部文档证实了这一点。本文说明三层各收录什么页面、哪些信号决定页面落在哪一层、掉进最底层之后怎么恢复,以及出海独立站怎样避免上线第一天就被分进“填埋场”。
先看一个很多独立站卖家都遇到过的情况。你写了一篇产品长文,提交了sitemap,几天后打开Google Search Console,状态显示“已抓取 — 尚未编入索引”;或者显示“已编入索引”,可拿关键词去搜,翻到第8页也找不到自己。接下来的排查通常是:关键词是不是不够?外链是不是太少?是不是该再加几个H2?
保哥做了二十多年SEO,常年给出海DTC独立站做顾问,见过很多人在这一步把力气用错了方向。实际情况往往是:页面质量未必是瓶颈,问题出在谷歌把它放进了一个几乎不参与排名的索引层。这套机制有专利、有泄露文档、有内部系统名称作为依据。下面逐层拆开。
为什么页面已被Google抓取和索引,却仍然没有排名?
问题出在很多人把“抓取”“索引”“排名”看成一条直线:谷歌爬到页面 → 把页面存进索引 → 页面参与排名。错的是最后一步。
在实际链路里,“被存进索引”和“被存进哪一层索引”是两件事。谷歌响应一次查询时,不会把全网几千亿个页面平铺开来逐个比对,那样的算力成本任何公司都承受不了。它的做法是按预估的重要程度,提前把文档分进不同的“货架”;查询进来先翻最上层的货架,质量够高、结果够多就停止,不再往下翻。
于是会出现这样的状态:谷歌抓到了页面,也建了索引条目,却把它放在最底层的货架。用户查询翻不到那一层,页面自然“查无此页”。收录只是拿到入场券,能不能上场,取决于被分到哪个看台。在英文站众多、竞争激烈的出海赛道,这个差别往往决定了页面是有自然流量还是零自然流量。
这也解释了GSC里长期被误读的“已抓取 — 尚未编入索引”。很多人以为是谷歌没抓全,或者抓取预算不够。实际上不少情况是谷歌评估过页面后,直接把它判到了最底层,连主索引条目都没有建。瓶颈不在爬虫抓得勤不勤,而在分配系统把页面放在了哪里。
这个区分很关键,后面会专门用一节讨论经常被当成原因的抓取预算。这里先记住:页面能不能被翻到,取决于层级,与谷歌有没有“看见”它无关。
Google索引是单一的大池子,还是分层存储的?
分层索引并非某个SEO博主凭空编出的概念。它有两条独立的证据链:一条是公开了二十年的专利,一条是2024年泄露的内部文档。两者相互印证,分层索引的存在基本可以确定。
先看专利。2004年,谷歌申请了一项名为《Index partitioning based on document relevance for document indexes》的专利(专利号US7293016B1)。专利写明:被索引的文档按“静态排名”(static ranking)排列、分区;查询时先访问第一个分区,只有当后续分区里某个文档的静态排名高于一定阈值时,才继续搜索下一个分区。谷歌二十年前已经在专利里写下了“分层、先查高层、不够再往下”的检索方式。同期还有Anna Patterson的短语索引(phrase-based indexing)专利,思路一致:索引不是均质的,有结构、有层次、有取舍。
专利只能证明谷歌设计过这种方案。证明它确实在用、而且至今仍在用的,是2024年3月的泄露事件。谷歌内部的Content Warehouse API文档被意外发布到GitHub,共2596个模块、上万个属性。其中有一个系统叫SegIndexer,职责描述只有一句:把文档放进索引中的不同层级(tiers)。与它配套的还有 scaledSelectionTierRank 属性,以及索引阶段(内部代号Alexandria)的 IndexTier 分类。这些字段给三个层级起了内部名称:Base、Zeppelins、Landfills。
两条证据由此对上:二十年前的专利描述了分层,二十年后的泄露给出了分层系统的名字SegIndexer和三层的名称。这期间,supplemental index(补充索引)这个老概念指的也是同一类机制。谷歌2007年取消了搜索结果里的“补充结果”标签,但底层的分层逻辑并没有消失,只是不再对外显示。名称换过几轮、标签也撤了,核心机制二十年来一直在运转,可见它在谷歌检索架构中的分量。
关于这次泄露的逐模块拆解,Mike King的长文分析得最完整,他理清了Mustang、NavBoost和各类Twiddler之间的关系;Shaun Anderson对PerDocData文档模型的解析,则单独讲清了分层命名(Base/Zeppelins/Landfills)和 scaledSelectionTierRank。两篇都列在文末参考资料里,需要深入研究的读者可以核对原文,不要只依赖二手转述。
再看分层在整条排名管线中的位置。一次查询进来,谷歌大致这样处理:先由打分系统(泄露文档中称为Mustang)算出一批候选,而候选从哪里取,由分层决定:优先从Base层取,不够再往下层找;取出后,再交给一组称为Twiddler的重排函数做调整。
分层发生在排名链路的最上游,决定页面有没有资格进入候选池。在上游被筛掉,后面精心优化的页面因素、关键词布局、内链锚文本都没有机会起作用。这就是很多人把页面级优化做到极致、排名却不动的原因:优化都做在下游,卡住页面的环节在上游。
Base、Zeppelin、Landfill三层索引分别收录哪些页面?
这三个名字可以用快递分拣中心来理解。同一个仓库里,包裹按时效和价值分进不同区域:次日达的高优先件放在离出货口最近、随时能调用的核心区;普通件放在常规货架;地址不全、反复退回、无人认领的包裹堆在角落的暂存区,基本不进入正常发货流程。谷歌的三层索引按类似的逻辑分拣。
| 层级 | 内部代号 | 装什么页面 | 排名待遇 |
|---|---|---|---|
| 第一层 | Base(基础层) | 高质量、原创、有需求支撑的页面 | 主力排名索引,绝大多数搜索结果出自这一层;用户查询首先检索这层 |
| 第二层 | Zeppelin(齐柏林层) | 中等质量、价值不明确的页面 | 只有基础层结果不够用时,才会通过“扩展搜索”被调取,排名机会大幅减少 |
| 第三层 | Landfill(填埋场) | 低质、重复、单薄(thin)内容 | 在排名流程开始前基本就被取消资格,相当于“收录了但不会出场” |
还有一个细节需要单独说明:根据对泄露文档的解析,链接权重也随层级变化。来自Base层页面的链接,传递的权重远高于来自Landfill层页面的链接。这解释了为什么购买的站群外链、目录外链基本没有效果:发出链接的页面本身就在填埋场里,谷歌几乎不计算它们投出的票。买了100条外链,实际有效的可能只有个位数。所以同样花一万块预算,有人买到一堆数字好看却不起作用的链接,有人只换来三五条真正有用的链接,差别就在于源页面处在哪一层。
如何大致判断一个页面够不够格进Base层?官方没有清单,但结合泄露信号和多年实操,主要看这几条:内容是否真正满足某个具体查询的需求;是否提供第一手信息或新增数据;页面所在站点的整体权重能否支撑;是否有真实用户的点击和停留作为佐证。前两条可以靠单篇内容改善,后两条只能靠站点长期积累。
新站最容易卡在后两条:单篇写得再好,站点权重不够,照样进不了Base层。所以对出海新站来说,“先建站点权重、再提高内容产量”这个顺序非常关键,后面会专门展开。
保哥去年给一个做跨境宠物用品的DTC独立站做诊断,就遇到了这种情况。站长说自己半年积累了三百多条外链,可Ahrefs上的DR没有变化,目标关键词排名也没涨。我导出一批源页面查看,七成以上是内容空洞、用模板批量生成的“资源页”,是典型的填埋场页面。三百条的数量看着不少,能进Base层、真正计入权重的没几条。这个案例我在站内网站权威到底是什么、DR怎么一步步提上去里详细讲过:外链质量要看源页面在哪一层,数量本身说明不了问题。
分层索引的层级分配,为什么不只取决于页面质量?
这一点最反直觉,也最容易被忽略。多数人默认页面写得好就进Base,写得差就进Landfill,由单页质量决定。这个判断是错的。
泄露文档显示,static rank(静态排名)不只看单个页面,整个站点的信号会影响新页面的初始层级分配。一篇新文章还没经过用户检验,谷歌就已经根据站点的整体水平给它分配了起始位置。影响起始位置的因素包括但不限于:
- 站点整体的链接情况,即有多少高质量站点指向你;
- 历史上用户从搜索结果点进来的次数和频率;
- 站点级的权重积累;
- 外链的质量构成(注意是质量,不是数量);
- 用户行为数据,包括停留、点击、回访;
- 历史点击表现。
这会形成一个“马太效应”循环。已有权重的老站发一篇新文,默认分到较高层级,获得更多曝光;用户的点击和停留进一步巩固它的位置,下一篇的起点也更高。权重薄弱的新站,新文默认进入低层,曝光很少;没有曝光就没有用户信号,没有信号层级就上不去,于是越弱越没机会,越没机会越弱。
这对出海新站尤其不利。你做美妆、户外装备或3C配件,排在前面的可能是经营了十几年、积累了大量品牌外链的老牌竞品。同样一篇评测,对方发布后默认进Base层,当天就有排名;你发布后默认进Zeppelin甚至Landfill,没有任何水花。差距未必在内容本身,而在于两边的页面从落地起就不在同一层货架上。明白这一点,就不必再纠结“我写得更用心为什么排不过它”:这是结构性差距,与单篇发挥关系不大。
站点级信号由哪些要素构成、怎样系统地提升,建议配合站内这篇E-E-A-T完整指南与8大信号清单阅读,文中把“怎样让谷歌认为整个站可信”拆得比较细。站点级信号积累得越早,后续每篇内容就越省力。
把索引和排名问题归咎于抓取预算,是常见的误诊吗?
抓取预算是最常被拿来解释问题的因素。页面收录不理想、排名上不去时,很多人第一反应是:“抓取预算(crawl budget)不够,得优化爬虫效率。”然后花大量时间处理robots.txt、nofollow和URL参数清理。
抓取预算并非不重要,对几百万页规模的超大电商站,它确实是实际问题。但对绝大多数中小独立站,把排名问题归咎于抓取预算,属于典型的误诊。瓶颈通常不在抓取层(crawling),而在服务层(serving),也就是前面讲的分层分配。
原因很直接:谷歌可能早已抓取甚至索引了页面,只是把它分配到了Zeppelin或Landfill。此时即使把抓取预算优化到让爬虫每天来一百趟,页面仍然在低层。爬虫来得勤和页面能否排名,属于两个不同环节。这就像反复修一扇并不漏水的窗,真正漏水的是另一扇。
怎样快速分辨属于哪种情况?有一个粗略但有效的判断方法:如果页面在GSC里大面积显示“已发现 — 尚未抓取”,可能确实存在抓取层问题,值得检查抓取预算和站点架构;如果大面积显示“已抓取 — 尚未编入索引”,或者“已编入索引”却没有任何排名,多半是分层导致的,继续优化抓取没有用,应该去提升站点级质量。
抓取预算该怎样看待、哪些站才真正需要管理它,站内这篇谷歌抓取预算优化的12项实操指南给出了完整的判断框架。建议先读它,确认自己是否真有抓取问题,再决定下一步。把力气花在错误的环节上,是SEO里最常见、也最不容易察觉的浪费。
一个典型的误诊案例:某出海独立站站长发现新品页迟迟不收录,马上开始砍内链、调sitemap优先级,还上了日志分析工具盯爬虫,折腾了一个月没有起色。后来查看服务器日志才发现,爬虫访问很频繁,页面也早就被抓取了,只是全部被分进了Zeppelin。原因是整个站三个月前才新建,站点级权重还没有建立起来。
这种情况下该做的,是争取几条质量过硬的外链,把几个核心品类页做深做透,而不是在没有问题的抓取环节上耗费时间和预算。方向错了,投入越多离正确答案越远;先花一天把诊断做对,往往比埋头优化一个月更有效。
HCU为什么会造成站点级索引降层,而且一年都难以恢复?
理解了分层,才能看清HCU(Helpful Content Update,有用内容更新)这类站点级打击为什么影响这么大。
过去大家以为算法更新是逐篇判罚:哪篇没用就降哪篇的权重。从分层的角度看,HCU实际上是站点级的层级重新分配。它下调的不是某几篇文章,而是整个站的“起始位置”,幅度可能是一档,也可能是几档。原本默认进Base的页面,现在默认进Zeppelin;原本在Zeppelin的页面,直接掉进Landfill。全站页面的起点同时后移。所以很多被HCU命中的站,流量跌幅不是20%、30%,而是断崖式地跌70% 以上:这是系统性的整体降层,不是零散的扣分。
恢复周期同样漫长。业内有人长期追踪了近400个被HCU打击的站:被打击一年后,只有约22% 的站出现20% 以上的流量回升,完全恢复的站被形容为“异常值”级别的罕见。将近两年后,大部分站仍未恢复。站点级降层一旦发生,恢复周期要按“年”计算。对依赖自然流量维持现金流的独立站来说,这几乎意味着业务停摆。
追踪中还有一个发现:少数恢复的站里,相当一部分并没有做大规模改造,有的只是降低了发文频率,有的只是减少了广告密度,之后在某次核心更新中被算法重新上调。可见恢复在很大程度上来自谷歌算法侧的重新评估,而非站长的“抢救动作”。
这个结论不太符合直觉,但需要说清楚:很多时候能做的是先止损、等待重新评估,而不是向已被判入低层的站里继续大量灌内容,那只会让算法更确定这是一个内容工厂。站点声誉这类整体性信号如何被谷歌的垃圾政策识别,可以对照站内这篇站点声誉滥用与寄生SEO的三方防御,它讲的正是“整个站被打上标签”的情况。
如何判断页面处于分层索引的哪一层?
机制讲完,接下来是最实际的问题:怎样知道某个页面现在在哪一层?谷歌不会发通知,但可以通过几项间接指标做出比较可靠的推断。只讲理论的文章大多缺这部分,下面是可以直接执行的自查步骤。
第一步,看收录与排名是否错位。用页面的精确标题或一整句正文,加引号在谷歌搜索。如果连这种完全唯一、几乎没有竞争的查询都搜不到,这个页面大概率在Landfill,没有拿到出场资格。如果精确查询能搜到,稍微宽泛一点的关键词就搜不到,页面多半在Zeppelin:已被收录,但只在结果不够用时才被调取。
第二步,查看GSC的状态分布。把“已抓取 — 尚未编入索引”和“已编入索引但零展示”的页面单独整理成一张表。前者连主索引都没进,是填埋场的候选;后者是典型的低层页面。这两类页面占比越高,站点整体层级偏低的可能性越大。建议每个月导出一次,趋势变化比某一天的快照更能说明问题。
第三步,看展示量,不看排名。排名受个性化和地域影响,波动很大,GSC的“展示次数”则稳定得多。一个页面如果展示量长期接近零,说明它没有进入用户查询会检索到的那一层。展示量是判断层级最直接的指标,比任何第三方工具的“预估排名”都可靠。
第四步,做站内横向对比。把站里表现最好和最差的几个页面放在一起比较:如果差距不大、整体都表现不佳,问题大概率在站点级层级(整个站被压低了);如果只有个别页面表现差、其他正常,更可能是单页质量问题。这个区分决定接下来是“治站”还是“治页”,方向判断错了,后续工作都会白做。
走完这四步,就能判断是某几篇文章需要重写,还是整个站的基础需要重建。不要笼统地说“排名不好”,而要能说出“大概率是整站被压在了Zeppelin”。诊断越具体,措施越准确。
页面落入Landfill层后,还能恢复吗?
能恢复,但成本很高,而且拖得越久越高。落入低层不等于判了死刑,但从低层爬出来要花的力气,远大于一开始避免掉进去所需的力气。
恢复的核心思路只有一条:停止在单页层面零碎修补,转向系统性地重建站点级权重。决定层级的是站点级信号,逐篇改title、加关键词,对整体层级的作用很小。具体可以从以下几个方向入手:
- 先止损,再增长。找出站里单薄、重复、纯粹凑数的页面,该删除的删除,该合并的合并。大量填埋场页面留在站上,会拉低整站的平均水平,持续向谷歌传递“这个站质量一般”的信号。清理这些页面,是解除站点级信号拖累的第一步。很多独立站为了“显得内容丰富”铺了几百个空洞的产品页,拉低全站层级的恰恰是这些页面。
- 把有限资源集中到少数页面。与其发50篇平庸内容,不如把这50篇的工作量投入到5篇有深度、有第一手经验、别人难以替代的文章上。先让这几篇进入Base层,带动站点级评估回升。
- 争取来自高层页面的链接。链接权重随层级变化,所以要追求的是“来自Base层页面的链接”,而不是数量。一条来自权威站正文的链接,效果超过一百条来自填埋场资源页的链接。宁可花三个月争取一条真实链接,也不要一周买一百条垃圾链接。
- 放慢发布节奏。前面提到,部分恢复的站正是降低了发文频率。在已被压低的站上大量堆内容,只会让算法更确定这是内容工厂。放慢速度、把每篇做扎实,反而恢复得更快。
恢复这件事,七分靠重建站点基础,三分靠等待谷歌的下一次重新评估。它不是一两周能完成的事,需要做好长期投入的准备。反过来看,正因为爬出低层这么难,已经稳定在Base层的站,竞争壁垒也同样高;把站点级质量当作长期资产经营,回报相当可观。现在多投入的这些工作,会成为竞品短期内难以跨越的门槛。
还有一点常被忽略:层级的重新评估不是实时的。今天清理完低质页面、补上几篇高质量文章,谷歌不会第二天就给你升层。它需要重新抓取、重新积累用户信号,再等到合适的更新窗口,这个周期短则数周、长则数月。所以不要上周改完、这周就天天盯着排名,那只会让人焦虑,进而做出更多打乱节奏的调整。给自己设一个以季度为单位的观察周期,留出时间让算法重新评估站点;耐住性子,是低层恢复中最难做到的一点。
新站或新页面,如何避免一上线就被分进Landfill层?
预防比补救更划算。如果你正在做一个新的出海独立站,或者准备给老站上一批新内容,下面这几条能帮你避免起步就掉进低层,成本远低于事后恢复。
第一,发布前先做SERP侦察,不要盲目增加产量。动笔之前,先搜索目标关键词,看清排在前面的内容质量如何、站点规模多大。如果头部全是权威大站的深度长文,而你用新站发一篇泛泛而谈的文章去竞争,它大概率一发布就进入低层。要么换一个更长尾、竞争更小的切入点,要么把内容做到能与头部竞争的深度。先看清竞争格局,再决定做不做、怎么做。
第二,先建立站点权重,再提高内容产量。新站最忌上线第一周就发100篇。站点级信号还是空白,这100篇大概率集体进入Landfill,大量低质页面还会让站点从一开始就被当作“内容工厂”。正确的顺序是:先用少量高质量文章打基础,争取几条像样的链接,让站点级权重有一个基本盘,再逐步、稳定地提高产量。基础没打好就快速扩张,扩张越快,垮得越彻底。
第三,每篇新内容都要有别人提供不了的东西。分层系统筛选的,就是“这篇内容值不值得占用Base层的位置”。能让内容胜出的,始终是第一手经验、真实数据和独立判断,这些是AI和同行复制不了的。保哥之前帮一个做出海家居SaaS工具的团队起步,要求他们每篇都结合自家产品的真实使用数据和客户踩坑案例,产量虽然上得慢,但十几篇里有一大半直接进了Base层,稳定带来流量。在分层机制下,慢一点反而更快。
第四,搭好内部链接,让权重在站内流动。新页面借助老页面的内链推荐,能更快获得初始层级的认可。用合理的内链把站里已在Base层的强页面指向新页面,类似老员工带新人,效果比让新页面孤立存在好得多。
这几条可以归结为一句:分层系统奖励“克制的高质量”,惩罚“无节制的平庸量产”。理解了这一点,你对内容节奏的判断就会与仍在大量堆内容的同行拉开差距。这也是谷歌这次泄露给SEO从业者最重要的启示:不要再想怎样骗过算法,而要想怎样让页面真正值得进入第一层。先把站点级质量做扎实,再谈放量。
常见问题解答
“已编入索引”是不是就代表我能参与排名了?不一定。编入索引只说明谷歌给页面建了条目,这个条目可能在Zeppelin甚至Landfill层。这两层的页面,要么只在结果不够时才被调取,要么在排名流程开始前就被取消资格。收录只是入场券,被分进哪层货架,才决定页面能不能上场。
Base、Zeppelin、Landfill这三个名字是真的,还是SEO圈编的?是真的。它们来自2024年泄露的谷歌Content Warehouse API文档,由SegIndexer系统和scaledSelectionTierRank等属性确认;更早还有2004年的分区专利US7293016B1可以佐证分层逻辑。两条证据链相互印证,并非民间猜测。
我买了一大堆外链,为什么DR和排名都不动?很可能因为这些外链来自处在Landfill层的低质页面。链接权重随层级变化,谷歌基本不计算填埋场页面投出的票。与其追求数量,不如争取来自Base层权威页面正文的链接,一条的效果超过一百条。
我的页面收录了却零排名,是不是该去优化抓取预算?大概率不是。零排名通常是分层(服务层)问题,不是抓取层问题。抓取预算优化只对几百万页的超大站才有意义,中小站把排名问题归咎于抓取预算,是最常见的误诊。应该做的是提升站点级质量,不必在没有问题的抓取环节上花力气。
被HCU打击后,多久能恢复?要做好以年为单位的准备。有追踪数据显示,被打击一年后仅约22% 的站出现20% 以上的回升,完全恢复属于罕见情况。而且恢复通常来自谷歌的算法重新评估,而非站长的抢救动作。先止损、打牢站点基础、耐心等待,比盲目采取措施更有效。
怎么判断我是站点级被降层,还是单个页面质量差?做站内横向对比。如果全站页面普遍表现差、彼此差距不大,问题大概率在站点级层级;如果只有个别页面表现差、其余正常,更可能是单页质量问题。这个区分决定该治站还是治页,判断错了会白费力气。
新站应该一上线就大量发文抢收录吗?不应该。新站的站点级信号还是空白,大量发文大概率会集体进入低层,还会让站点被当作内容工厂。正确顺序是先用少而精的内容打基础、争取几条像样的链接建立基本权重,再稳步提高产量。在这个阶段,慢一点反而更快。
权威参考资料
本文标题:《Google分层索引:页面被分进Base、Zeppelin还是Landfill层?》
本文链接:https://zhangwenbao.com/google-index-tiers-base-zeppelin-landfill.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0