专题索引

网站抓取与收录指南:上线前把抓取许可、状态码、渲染和规范化做对

按爬虫走过的顺序排:从URL规划、抓取许可、状态码、渲染、规范化,一路到索引控制、提交、内链拓扑、多语言与迁移改版。角标标的是这一条做错了会怎样。

收录文章
167
分区
11

摘要:技术SEO的资料通常按知识点罗列,这一页换成爬虫走过的那条路:先得知道你这个地址存在,再得被允许抓,抓回来得给对状态码,得渲染得出内容,得判断出哪个地址才是正主,最后才轮到决定收不收。十一组167条,每条先给一句结论。八组条目后面还挂了角标,回答做错了会怎样——最狠的一档,一条配置就能让整站从搜索里消失;最轻的一档,只是把抓取额度花在没人搜的页面上。上线前只剩一天,就只看最狠那两档。

为什么按爬虫走过的顺序排

技术SEO的清单大多是平的:robots、站点地图、规范网址、结构化数据、内链、速度,一条挨一条。这种排法看着全,用起来别扭——它没告诉你哪一条断了会让后面全白干。

抓取和收录其实是一条有先后的链路。爬虫得先知道这个地址存在,才谈得上抓;得被允许抓,才谈得上拿到内容;拿到的内容得渲染得出来,才谈得上判断这页讲什么;判断完还得决定同一份内容留哪个地址,最后才轮到收不收进索引。

这条链路上任何一环断了,它下游所有的功夫都不产生效果,而且不会报错。我见过最典型的一次:团队花了一个月补站点地图、补结构化数据、织内链,收录纹丝不动,最后查出来是三年前有人在服务器配置里加了一行规则,把整个目录挡在门外。这不是能力问题,是查的顺序反了。

所以这一页把十一组按爬虫走过的顺序排开,前六组尤其建议顺着走。真要挑一组先看,选第二组——那里的东西错了,后面九组做得再好也白搭。

那个角标回答的是先做哪条

一份三十条的上线前检查表,最大的问题不是不够全,是每一条看起来都一样重要。真到上线前那个下午,你得知道哪几条漏了会出事、哪几条漏了只是可惜。

所以八个分区里每个条目后面都挂了一个角标,只有四个值。整站不收录是最狠的,一条配置能让整站从搜索里消失;成批漏收指一批页面进不了索引但站还活着;权重分散是收也收了,只是同一份内容的信号被摊到几个地址上;浪费预算最轻,不丢收录,只是把抓取额度花在没人搜的地方。

规划、提交、验收这三组不标角标。那里讲的是取舍和流程,选哪个都能做好,没有单一的失败后果,硬给一个标只会让角标本身失去含义。

这一页和故障诊断、性能那两页怎么分

站内另有两个专题会和这一页碰上,边界划得很死。

故障诊断那一页按症状组织,进去的路径是收录掉了、排名没了、页面从结果里消失了。它回答坏了怎么修,这一页回答怎么一开始就别坏。同一个话题在两页里完全不是一种写法:规范网址这件事,在那一页是已经被判给别的地址了怎么抢回来,在这一页是上线前先查一眼有没有两个标记同时输出——后者只要三十秒。

性能那一页里有一组叫性能与抓取,讲的是慢怎么拖垮收录,因果方向从性能指向收录。这一页里的抓取预算走另一条因果:地址空间设计不当造成的浪费,筛选器的自由组合、站内搜索的无限空间、内链上挂的追踪参数。同一笔预算,一边是被慢吃掉的,一边是被烂地址吃掉的,治法完全不同。

正文之后还有一段讲为什么这条链路不能跳着做。如果你手上已经列了一份待办,那段值得先看,它能帮你把清单重排一遍。

01

开工前定死的三件事:URL、域名和站型

18篇

顺序是从最难改的往最好改的排:域名形态定完才谈URL结构,URL结构定完才谈站型的特殊约束。这一组刻意不给角标——这里全是取舍不是对错,选哪个都能做好,怕的是上线半年后再改。

站型偏门一点的情况2篇
02

许可层:别把爬虫挡在门外

23篇

顺序是从最狠的往最细的排:先是能让整站消失的robots.txt,再是响应头这一层的索引控制,最后才是防火墙和AI爬虫的取舍。这一组的共同点是全都在服务器和配置层,改起来快,错起来也快。

服务器加固和更细的口子3篇
03

状态码与跳转:每个地址都得给对答案

23篇

顺序是先建立状态码的全局判断,再进跳转,最后才是死链和内容下架的收尾。这一组几乎全是服务器配置活,但错了的后果差别极大——有的只是浪费抓取,有的能让整站进不去。

各平台的具体写法7篇
04

渲染层:爬虫看见的和用户看见的是不是同一个页面

8篇

顺序是先把抓取、渲染、索引三步拆开,再看框架选型,最后是AI爬虫这一层新增的约束。这一组最容易被漏掉,因为页面在浏览器里打开完全正常,问题只在爬虫那一侧才显形。

05

规范化:同一份内容只留一个可收录地址

20篇

顺序是先把规范网址这件事本身讲透,再进参数和筛选,最后是分页与商品变体这两个电商重灾区。这一组的后果几乎都是权重分散和抓取浪费——站不会消失,只是一直吃不到该有的排名。和故障诊断那一页的分工也在这儿:那边问规范网址已经被判给别人了怎么抢回来,这边问上线前怎么让它压根不出错。

具体平台的收口写法3篇
06

索引控制:该收的收进来,不该收的别放进去

18篇

顺序是先建立索引这件事的底层认知,再看怎么把不该收的挡住,最后是抓取预算和移动优先这两个全站级前提。这一组和上一组的分工是:上一组管同一份内容留哪个地址,这一组管这个地址到底该不该进索引。

更细的口径和其他引擎3篇
07

提交与站长平台:让新页面被发现,别指望它提排名

13篇

顺序是先站点地图、再各家推送通道、最后是搜索后台的配置和读数。这一组刻意不给角标——提交做得再好也只是加快发现,它不会让不该收的页面变成该收,后果都落在速度上不落在生死上。

各平台的推送实现5篇
08

站点结构:让爬虫走得到每一个该收的页面

10篇

顺序是先定层级和点击深度,再看内链怎么织,最后是面包屑和链接属性这些细节。这一组的特点是没有单点故障,全是慢性病——不会突然出事,但放着不管半年后一批页面就悄悄没人管了。

09

多语言多地区:断一根线,整组标注全失效

9篇

顺序是先把语言标注这件事的机制讲清,再进同语言多地区这个最容易翻车的场景,最后是编码和实体这两层更深的坑。这一组单独拎出来,是因为它的失败方式很特别——不是配错一处,是整组一起被忽略。

具体市场和落地生产线1篇
10

迁移改版:一次性事件里最容易丢收录的那些动作

11篇

顺序是先按迁移类型建立全局判断,再进加密协议和改版这两个高频场景,最后是换主机换平台的执行细节。这一组和别组最大的不同是不可逆——同一批动作只有一次做对的机会,回滚的代价往往比做错还大。

具体平台的迁移执行3篇
11

守住:上线前验收和常驻巡检

14篇

顺序是先给新站一份起步清单,再是全站爬取和日志这两种验收视角,最后是把检查接进日常流程。这一组同样不给角标——这里全是流程不是配置,做与不做的差别不在某一条会怎样,在半年后整站还剩多少没走形。

更细的巡检和自动化4篇
12

为什么这条链路不能跳着做

技术SEO最常见的返工,是从中间某一环开始动手。站点地图交了、结构化数据补了、内链也织了,收录就是不涨——回头一查,robots.txt里有一行三年前加的规则,把整个目录挡在门外。链路上任何一环断了,它下游所有的功夫都不产生效果,而且不会报错。下面这个顺序不是理论偏好,是被返工次数排出来的。

第一段是发现和许可,也就是本页第二组。爬虫得先被允许进门。这一段的特点是配置极少、后果极重,一行规则能让整站消失,而站长后台不会替你尖叫。所以它排第一,也是唯一建议每次上线都重新验一遍的一段——只要有人碰过服务器配置,就重新验。

第二段是抓回来之后的三件事:状态码、渲染、规范化。这三件的共同点是爬虫已经拿到了东西,但拿到的对不对。状态码错了它不知道该不该保留,渲染丢了它拿到个空壳,规范化没做它把同一份内容记成好几份。这一段的活最杂,也最需要拿工具实测——因为在浏览器里看,这三样全都正常。

第三段才轮到索引控制和提交。很多团队一上来就在这儿花时间,交站点地图、点请求收录、研究推送接口。这些动作本身没错,但它们只影响发现速度,不影响判决结果。页面被判成不值得收,提交一百次也是一百次不收。先把前两段做干净,这一段才有意义。

最后两段是内链拓扑和验收,它们管的是时间维度。前面所有配置解决的是今天对不对,内链解决的是新页面进来之后爬虫走不走得到,验收解决的是三个月后这些配置还在不在。这两段没有单点故障,也正因为如此最容易被无限期推迟——直到某天发现一批页面已经成了孤岛,而没有任何一个环节报过警。

13

常见问题解答

7问
  • 这一页和SEO故障诊断那个专题怎么分工?

    边界只有一条:时间点。故障诊断那一页按症状组织,进去的路径是收录掉了、排名没了、页面从结果里消失了——它回答坏了怎么修,排查步骤按代价从低到高排。这一页的路径是还没上线、或者刚决定要改某个东西,它回答的是怎么一开始就别坏。同一个话题在两页里的写法完全不同:规范网址这件事,在那一页是已经被判给别的地址了怎么抢回来,在这一页是上线前先查有没有两个标记同时输出。真要说得更实用一点,这一页适合在需求评审和上线前的检查表里用,那一页适合在流量出事的当天用。

  • 那和网站性能那个专题呢,抓取预算不是也在讲?

    性能那一页里确实有一组叫性能与抓取,讲的是慢怎么拖垮收录——服务器响应慢导致抓取额度被浪费、页面太大被截断、渲染管线排不上队。那一组的因果方向是从性能指向收录。这一页里的抓取预算走的是另一条因果:地址空间设计不当造成的浪费,筛选器的自由组合、站内搜索的无限空间、追踪参数的重复抓取。同一笔预算,一边是被慢吃掉的,一边是被烂地址吃掉的,治法完全不同。如果你的站首字节时间正常但抓取额度就是不够用,那多半是这一页第五组和第六组的事。

  • 条目后面那个角标是什么意思,怎么用?

    它回答扫清单时最实际的一个问题:这一条做错了,后果落在哪一档。整站不收录是最狠的那一档,一个配置能让整站从搜索里消失,比如robots.txt写废了、防火墙把爬虫一并拦了、预发布站泄露出去;成批漏收指一批页面进不了索引但站还活着,渲染丢内容、语言标注断链都属于这一档;权重分散是收也收了,只是同一份内容的信号被摊到几个地址上;浪费预算最轻,不丢收录,只是把抓取额度花在了没人搜的地方。用法很直接:如果你只有一天时间做上线前检查,就只看前两档。角标标在许可、状态码、渲染、规范化、索引控制、内链拓扑、多语言、迁移这八组,规划、提交、验收三组不标——那里讲的是取舍和流程,没有单一的失败后果。

  • 十一个分区要按顺序读吗?

    按顺序读是有道理的,因为它就是爬虫走过的那条路:先得知道你这个地址存在,再得被允许抓,抓回来得给对状态码,得渲染得出内容,得判断出哪个地址是正主,才轮到决定收不收,收完还得能从别的页面走过来。前六组建议顺着走一遍,尤其是新站或者要大改的站。后面五组更像专项:提交那一组随时能补,内链拓扑是慢性病,多语言和迁移看你做不做得到那一步,验收那一组适合在上线前一周单独拿出来过。真要挑一组先看,选第二组——那里的东西错了,后面九组做得再好也白搭。

  • 新站上线前,最少要做对哪几件?

    按后果严重程度排,五件事:第一,robots.txt确认没有把整站或者样式脚本目录拦掉,顺手确认防火墙和托管商没在默认拦爬虫;第二,域名形态选定一个,另外三种地址全部永久跳过去,别让四套地址同时活着;第三,预发布环境和测试域名彻底关掉外部访问,这是工程级事故的高发地;第四,页面的核心内容在源码里就有,而不是靠脚本渲染出来,拿工具看一眼原始返回就知道;第五,规范网址一页只输出一个,主题和插件常常各塞一个。这五件全部在本页前六组里,也全部标着最重的两档角标。剩下的站点地图、内链、语言标注都可以上线后再补,唯独这五件补起来要赔一次流量。

  • 已经上线一年多的老站,这一页还用得上吗?

    用得上,但读法不一样。老站不需要从第一组的域名选型开始看,那些已经沉没了。建议从第六组索引控制切入,先量一个数:搜索后台报的已收录页面数和你自己知道的真实页面数差多少。差得多就往第五组走,那是规范化和参数的问题;差得少但流量不涨,就往第八组走,看是不是有一批页面成了孤岛。第十一组的日志分析对老站尤其值——它能告诉你抓取额度实际花在哪儿了,这个数字通常会让人吃一惊,因为很大一部分往往花在了几年前就该删掉的地址上。至于第一组,只在准备改版或者换平台的时候回头看。

  • 这些做完了,收录还是上不去怎么办?

    先确认问题出在哪一层。如果搜索后台显示已经抓取但未编入索引,那是质量判定不是技术问题——技术层已经做完了,页面被判成不值得收,这时候该去看内容本身而不是继续调配置。如果显示已发现但一直没抓,那多半还是抓取额度或者内链拓扑,回第六组和第八组。如果连发现都没有,回第七组确认提交通道通着、回第八组确认这些页面真的有内链指过去。还有一种常见情况是数字本身在骗你——各家工具口径不同,同一批页面在三个后台能给出三个数,那属于度量口径的事,站内另有一页专讲怎么读这些数字。

14

配完之后,接下来干什么?

这一页只负责把上线前该做对的事按链路排好。真出了状况或者要往下走,下面四个入口比继续往下读更有用。