# 保哥笔记 — 谷歌SEO > 本分片含 35 篇文章,按发布日期倒序。全部分片索引见 https://zhangwenbao.com/llms-full.md **站点**:https://zhangwenbao.com/ **分类**:谷歌SEO **生成**:2026-09-12 13:06:31 CST --- ## Googlebot抓取2MB限制:8步实战优化指南 - URL:https://zhangwenbao.com/googlebot-crawl-limits-2mb-deep-analysis.html - 分类:谷歌SEO - 发布:2026-03-14 | 更新:2026-05-16 - 摘要:Googlebot抓取有三层限制:通用15MB、HTML索引只取前2MB、PDF最大64MB,超过2MB的部分会被静默截断。本文基于Google官方播客披露的信息详解这套体系,给出审计、内容前置、外部化、SSR裁剪等八步优化清单,附一个财经站22%文章被截断导致流量跌18%的修复案例。 - 关键词:技术SEO,爬取预算,Googlebot,Google爬虫,索引 > **TLDR**:摘要:Googlebot的抓取不是一个数字而是分层的——通用15MB、HTML索引只取前2MB、PDF最大64MB,超过2MB的部分会被静默截断。本文基于Google官方播客披露的信息详解这套体系,给审计、内容前置、外部化、SSR裁剪等八步优化和Mueller的实用检测方法,附一个新闻站22%文章被截断的修复案例。 > 摘要:Googlebot的抓取不是一个数字而是分层的——通用15MB、HTML索引只取前2MB、PDF最大64MB,超过2MB的部分会被静默截断。本文基于Google官方播客披露的信息详解这套体系,给审计、内容前置、外部化、SSR裁剪等八步优化和Mueller的实用检测方法,附一个新闻站22%文章被截断的修复案例。 最近在 Google 官方播客 Search Off The Record 中听到了一段非常有价值的对话——Google 的 Gary Illyes 和 Martin Splitt 首次详细披露了 Googlebot (https://zhangwenbao.com/why-googlebot-ignores-resource-hints.html) 抓取限制背后的运作机制。这些信息对于做技术 SEO 的人来说堪称金矿,因为它揭开了我们过去对 Google 爬虫理解中的很多盲区。 这篇文章把这些新信息和 2026 年 2 月以来的抓取限制文档更新完整串起来,覆盖三层抓取限制体系、2MB 静默截断的实测案例、8 步实战优化清单、前端框架内联状态排查、PDF 64MB 限制、John Mueller 的检测技巧和 10 条 FAQ,给你一篇真正能用的技术 SEO 实操指南。 ## 三层抓取限制体系:不是一个数字,而是一套分层架构 过去大多数 SEO 从业者只知道"Googlebot (https://developers.google.com/search/docs/crawling-indexing/googlebot?hl=zh-cn) 有 15MB 的抓取限制"。但 2026 年 2 月 Google 更新了官方文档后,我们才发现这个认知远远不够准确。实际上,Google 的抓取限制是一套分层体系: 第一层:通用基础设施层——15MB 默认限制。这是 Google 整个爬虫基础设施的默认上限。任何没有主动覆盖这个设置的 Google 爬虫,都会受到 15MB 的约束。当爬虫从服务器获取字节流时,内部有一个计数器,一旦达到 15MB 就停止接收数据。 第二层:Google 搜索特定层——HTML 文件 2MB 限制。这是对 SEO 影响最直接的数字。Google 搜索团队主动将默认的 15MB 限制下调为 2MB,专门用于 Googlebot 处理 HTML 内容进行搜索索引。一旦 HTML 文件的未压缩大小超过 2MB,超出部分的内容将被静默截断。 第三层:特定文件类型例外——PDF 64MB 限制。考虑到 PDF 文件通常比 HTML 大得多(比如 HTTP 标准导出为 PDF 后可达 96MB),Google 为 PDF 单独设置了 64MB 的抓取上限。 Gary Illyes 在播客中的原话非常关键,他明确表示这些限制是可被覆盖的:Google 内部的各个团队会经常根据需要调整这些限制。某些场景下会调高(比如 PDF 从 15MB 调到 64MB),某些场景下会调低(比如搜索团队从 15MB 调到 2MB)。如果需要在几秒内快速推送内容通过索引管线,截断限制甚至可能被压到 1MB 以进一步加速处理。 爬虫/场景 | 限制 | 影响 | 通用基础设施 | 15MB | 所有 Google 爬虫的默认上限 | Googlebot HTML 索引 | 2MB | 超出部分静默截断,索引不可见 | Googlebot PDF | 64MB | 大型规范文档/白皮书的特殊上限 | Googlebot Image / Video | 独立配置 | 不参与 HTML 2MB 计算 | Google-InspectionTool(URL 检查) | 15MB | 不等于真实 Googlebot 行为 | 快速索引管线 | ≤1MB | 新闻、突发、Discover (https://zhangwenbao.com/google-discover-core-update-local-publishers-traffic-loss.html) 极限场景 | ## Google 的爬虫系统不是铁板一块 Martin Splitt 在播客中用了一个很精准的描述:"Google 的爬虫基础设施不是 monolithic(铁板一块的)"。他将其描述为一种软件即服务(SaaS)架构——Google 搜索只是这个爬虫服务的众多客户端之一。这意味着什么?翻译成实操语言: 不同的 Google 爬虫有不同的限制配置。Googlebot Image(图片爬虫)允许的文件大小肯定比 2MB 大得多,因为图片本身就经常超过 2MB。Googlebot Video 同样有自己的独立限制。你在 Google 文档中看到的限制数字,并不是跨所有 Google 爬虫的硬性规定。 同一个爬虫在不同请求级别也可以有不同配置。Splitt 明确说了:"配置可以在请求级别改变,而不仅仅是在 Googlebot 层面固定不变。"这意味着同一个 Googlebot 在抓取不同页面时,可能会应用不同的参数配置。 快速索引场景可能有更严格的限制。Illyes 提到,如果需要在几秒内将内容推过索引管线,截断限制可能会被压缩到 1MB 甚至更低。这暗示了 Google 在处理突发新闻、实时内容等场景时,会牺牲完整性换取速度。 ## 2MB 限制的真实影响:恐慌还是淡定 先给你一颗定心丸:对 99.99% 的网站来说,2MB 的 HTML 限制不是问题。 根据 HTTP Archive (https://almanac.httparchive.org/en/2022/page-weight) Web Almanac 的数据,网页 HTML 的中位数大小大约是 30KB(移动端约 33KB)。这意味着你需要一个比平均水平大 67 倍的页面才会触及 2MB 的门槛。一个纯文本文件要达到 2MB,需要超过 200 万个字符——这大约相当于一部中长篇小说的篇幅。 但不会让你就此放松警惕,因为有几类网站确实需要关注。 ## 真正受影响的场景 内嵌大量 JavaScript 或 JSON 数据的页面。如果你的页面把巨大的 JavaScript 代码块、JSON-LD 数据对象、或者 base64 编码的图片直接内联在 HTML 中,这些都会计入 HTML 文件大小。一些前端框架生成的初始 HTML 可能因为包含服务端渲染的状态数据而膨胀到几 MB。 超长单页文档。技术文档、法律法规全文、产品规格大全等以单页形式呈现的超长内容,确实可能超过 2MB。比如 HTML Living Standard (https://html.spec.whatwg.org/) 导出为单页版本后达到 14MB。 内容型电商页面。产品页面如果同时包含大量详细参数表、用户评价(直接内嵌在 HTML 中而非异步加载)、以及内联的结构化数据,也可能逼近或超过限制。 评论密集型博客。开放评论的热门博客,单篇文章评论达数千条且全部在 HTML 中渲染(非异步加载),是被静默截断的高危群体。 论坛主帖页。一个被回复几千楼的主帖,HTML 体积轻松破 2MB。Discuz/Vanilla/Discourse 这类论坛要特别留意。 ## Spotibo 的实测发现:静默截断的陷阱 Spotibo 团队做了一个非常有价值的实测。他们创建了一个 3MB 的 HTML 测试文件并提交给 Google 索引。结果: - Google Search Console 的 URL 检查工具显示一切正常——因为该工具使用的是"Google-InspectionTool"爬虫,它运行在 15MB 的通用限制下,而不是 Googlebot 搜索索引用的 2MB 限制。所以 URL 检查工具会显示完整内容,但这跟 Googlebot 实际索引的内容是两回事。 - 查看实际索引的源代码后发现:内容在 2MB 处被截断。源代码在第 15,210 行左右中断,文字在"Prevention is b"处戛然而止,后面直接跟了一个 闭合标签。2MB 之后的所有内容被静默丢弃。 - 但 Google Search Console 的状态显示"URL 已在 Google 上"且"页面已编入索引"。没有任何错误提示或警告。 这是最危险的地方——截断是静默发生的,没有任何告警。你的页面看起来一切正常,实际上后半部分的内容从未被索引。强烈建议你使用 Googlebot 抓取大小检测器来检测你网站关键页面的实际 HTML 大小是否逼近或超过 2MB 阈值。这类工具可以模拟 Googlebot 在 2MB 截断点处停止抓取的行为,直观展示哪些内容会被丢弃。发现问题远比等到排名莫名下跌后再排查要划算得多。 ## 为什么这些限制存在 很多 SEO 从业者把抓取限制理解为"Google 对网站的限制",但 Gary Illyes 的解释让我对此有了全新认识。他的原话是:这些限制主要是 "for our own protection or our infrastructure's protection"——为了保护 Google 自身的基础设施。 想想看,Google 每天要抓取数十亿个页面。如果没有任何大小限制,遇到一个动态生成的无限长页面(比如某些日历应用可以无限展开),Google 的抓取和处理系统就会被淹没。Illyes 专门用 HTTP Living Standard 的例子来说明:14MB 的单页 HTML 标准文档如果完整抓取、转换为 HTML、再进行处理,会 "overwhelm(压垮)"他们的基础设施。 这个视角很重要,因为它暗示了一个底层逻辑:Google 在效率和完整性之间做了明确的权衡取舍。对于搜索索引来说,2MB 的 HTML 已经足够覆盖绝大多数网页的全部有意义内容,而更高的限制带来的边际收益远不如对基础设施的额外负担。 ## 8 个可直接执行的实战优化 ## 审计:找出你的"胖页面" 第一步永远是摸清现状。使用以下方法检测你网站中 HTML 文件大小可能超标的页面: - Chrome DevTools → Network 标签:过滤 HTML 请求,查看"Size"列(注意区分压缩前和压缩后的大小,Googlebot 的限制针对的是未压缩数据); - Screaming Frog SEO Spider:抓取全站后按 HTML 大小排序,快速定位异常页面; - Googlebot 抓取大小检测器:专门模拟 Googlebot 2MB 截断行为的工具; - 命令行实测:curl -A "Googlebot" https://your-site.com/page | wc -c,直接得出未压缩字节数; - Google Search Console → URL 检查 → 查看已抓取的页面:但请记住 Spotibo 的发现——这个工具使用的不是 Googlebot 搜索爬虫,结果可能具有误导性。 建议把阈值设在 1.5MB 而非 2MB。留出 500KB 的安全缓冲,因为页面内容可能会因为 A/B 测试、个性化注入、广告代码等原因动态变化。 ## 内容前置:把最重要的东西放在最前面 既然 Googlebot 在 2MB 处截断,那最重要的内容就必须出现在 HTML 的前 2MB 之内。"关键内容前置"原则: - 标题标签(title)、meta description (https://zhangwenbao.com/tools/meta-checker.php)、H1 标题应该出现在 HTML 的最前面; - 核心正文内容应该在 HTML 结构中优先于侧边栏、页脚、评论区等辅助内容; - 结构化数据(JSON-LD)如果体积较大,考虑只保留最关键的标记在页头,其余通过外部文件加载; - 重要的内部链接确保出现在页面早期位置,不要全部堆在页面底部。 ## 外部化:把"重量"从 HTML 中搬出去 减少 HTML 文件大小最有效的方法就是把不属于它的东西搬出去: - CSS 外部化:将所有样式从内联