robots.txt分组不继承:157个站的实测
给robots.txt做一次分组体检的完整量法:先数通配组的Disallow条数,再数每个专属组的条数,两边做减法找出被漏掉的路径;接着把不会生效的Crawl-delay、Noindex、Host这类字段清掉;最后用测试工具按地址乘爬虫名做一个小矩阵逐个验证,把结果存下来当回归基线。文中给出157份真实robots.txt的实测数据、三种写法的效果对照表、五步自查清单,以及把平台默认模板接管过来之后要承担什么。
标签
保哥笔记 技术SEO 标签下共 50 篇文章合集,含《技术SEO一堆问题先修哪个?500站实测排出来的优先》《Core Web Vitals在AI搜索时代还值不值》《电商SEO最重要的5点:从AI爬虫到accessib》等,与 Core Web Vitals、AI爬虫、结构化数据 主题密切相关,覆盖 SEO/GEO 实战角度的深度解析与可落地方案。
给robots.txt做一次分组体检的完整量法:先数通配组的Disallow条数,再数每个专属组的条数,两边做减法找出被漏掉的路径;接着把不会生效的Crawl-delay、Noindex、Host这类字段清掉;最后用测试工具按地址乘爬虫名做一个小矩阵逐个验证,把结果存下来当回归基线。文中给出157份真实robots.txt的实测数据、三种写法的效果对照表、五步自查清单,以及把平台默认模板接管过来之后要承担什么。
把响应的不成文缺省测出来的完整做法:对同一个地址发三次请求,分别换掉语言偏好、去掉压缩声明、保持原样,再比对最终地址、页面语言标记、标题与正文体积这四项稳定证据;拿到变化维度清单之后逐项去核对Vary头,多了删、少了补。文中给出139个站的实测分布、判据从宽到严导致数字缩水3.8倍的完整过程、五分钟版与半天版两套清单,以及修复该落在哪一层。
把一个页面对自己地址的所有声明抠出来做对齐,这件事有一套可复现的跑法。先取事实,用跟随跳转的请求拿到服务器实际服务的那个地址,别拿你输入的那个当基准;再从原始源码里取出规范网址、og:url、hreflang默认版本、结构化数据里的url这四处声明;然后做分层比对,第一层严格比字符串,第二层忽略末尾斜杠,第三层忽略www,记下它在哪一层变成一致,那一层就是问题的性质;最后比对站点地图,逐字符比。一个页面十分钟,全站按模板抽八到十个就够。
一个页面拿不到,先别急着改内容。正确的顺序是把同一个地址换几种身份各要一次,逐项比较状态码、正文字节数和最终落点,两次结果不一样就说明问题出在送达层而不是内容层。本文给出七种身份对照的完整跑法,包括基线怎么从数据内部长出来、什么算真的拿到了页面、拒绝页可以用哪四类信号自动识别、声明层与送达层的两层对齐审计怎么在半小时内做完,最后是一份每天跑一分钟、覆盖五个地址三种身份的监测清单。
排查条件请求要按关卡来:先看响应头里有没有可以拿来协商的凭据,再连发两次看凭据稳不稳,然后带着凭据重发一次看回不回304,最后确认最后修改时间填的不是当前时刻。文中把这套顺序在211个国际化电商域名上走了一遍,逐关给出该看哪个头、判据定在哪、失败对应哪种成因,末尾附一张四种失败对应四种修法的对照表和一份三分钟自检。
排查顺序比工具重要:先抓一次首页把标签剥干净数字符,判断这一页有没有把内容交出来;正文正常再进第二层,在字节里找按钮的名字、图片的替代文本、表单标签和地标区域;只有字节里找不到、而页面上确实有的,才需要打开浏览器看渲染后的无障碍树。文中把这三层在211个国际化独立站上走了一遍,逐层交代口径怎么定、基线从哪来、哪些样本必须先剔掉,末尾给出一张行业参照表、一份分诊流程和三个能在一个下午跑完的动作。
把一个站上不归自己管的部分清点出来的完整方法:先扫首页与结算流程的外部域,逐条标注归属、用途和去掉之后的后果分四档;再把清单转成内容安全策略的来源白名单;最后挂一个每日快照差分,盯住外部域清单、页面标题和结构化数据块这三个低噪声字段。文中给出135个品牌站的依赖图谱、两次快照相隔两天半的变化率拆分,以及一次删掉九个域的清理复盘。
谷歌把自己的抓取客户端分成三份清单,其中特例爬虫那一份里,AdsBot-Google、AdsBot-Google-Mobile、Mediapartners-Google和APIs-Google四条下面写着同一句话:全局用户代理会被忽略;Google-Safety更彻底,完全不看robots.txt。这意味着你那行星号覆盖的范围小于你以为的范围,而覆盖之外那几个恰好后果最直接。本文把日志里的用户代理与robots.txt里的令牌这两套字典…
Googlebot对单个网址只取前2097152个字节,超出的部分不会报错,只是不存在。本文逐字节量了46个真实电商与建站平台的页面:未压缩HTML中位数972274字节、均值1131569字节,4个页面已越过上限,7个用掉八成以上预算,其中lovevery一个组合装页离上限只剩23个字节。更值得看的是受伤程度完全不按超标幅度排:anker两个页面超标最多却一个链接都没丢,allbirds男款分类页只超27.49%,288个链接被切掉9…
客户拿着一条当地语言法规过来要求照做,可实测下来那套字在网上一个字符都找不到。这里给出网页侧与搜索侧的两组零结果、国界另一侧八个站的编码欠账清单,以及一套不懂这门语言也能跑完的排查动作。
离网太阳能站的缅甸语页面,团队和本地同事截出来的图不一样。这里给出50个缅甸站的编码实测、一条从三分之二掉到零的迁移曲线、21个旧地址今天全部打不开的存量账,以及两天能跑完的排查流程。
规范把这项默认值定成零,而它自称等价的HTTP/2参数默认是4096:同一套机制迁过来,默认状态从开着变成了关着。逐档扫描还量出一个反常现象——容量从1024加到3072,均摊不降反升二十字节,付了管理开销却没省到最长那个字段。把请求头拆开这一招在长度过线之前越拆越亏、过线之后拆四条能省2.3倍。另含服务端可接收头部上限的取值分布,以及十三个站根本没宣告这一项。
自建nginx五端口实验台把发现机制逐条复现:漏写listen ssl而只留quic那一档,语法检查通过、进程正常、端口在听,浏览器却永远找不到它;撤掉广告头之后服务照常应答,证明它只是块牌子而非开关;OpenSSL兼容层下ssl_early_data形同虚设且毫无提示。另含缓存有效期中位二十四小时、十个站还挂着旧草案版本号、云安全组只放行TCP时形成的排查盲区,以及那条能救回首次连接的DNS记录为何多数客户端拿不到。
对六个真实站点各发一次HEAD和一次GET做集合差:三分之一的站两边对不上,缺的字段里有cache-control、last-modified、content-length和vary,而RFC 9110第9.3.2节明写服务器MAY省略这些只在生成正文时才确定的值,还点名了Content-Length与Vary。同轮实测另外三组数据:裸curl收到的字节是压缩后的6到13倍,而Googlebot那2MB上限按未压缩数据计算;同一个URL…
户外露营站的波兰语页展现涨了点击不动,三轮排查都在自己这一侧。这里给出取材源清单怎么列、二十分钟抄写自查怎么做、四类差异各修哪一处,以及站点名那一格怎么定。
nginx实验台实测:上游按语言分内容却不发Vary,德语用户灌入缓存后,中文、英文、法语用户与Googlebot全部命中同一份德语页面;把Vary补上又会让20个Accept-Language取值生成20份副本、实际只对应3种内容。另含230个URL的Vary现网分布、首访下发Cookie占比50.4%,以及proxy_ignore_headers导致会话串号的最小复现。
230个真实URL连抓三遍的实测:40.9%三次原始指纹不全同,其中56.4%三次字节数完全相同、靠Content-Length根本看不出来;剥掉nonce与请求ID等高熵串之后仍有34.3%在变;nginx实验台上一个CSP nonce把条件请求的304命中率从100/100打成0/100,另附抖动成因归类与五步基线测法。
同一份HTML挂在带与不带尾斜杠两个地址下,19条链接有13条解析结果不同;152格双引擎判决矩阵中51格RFC 3986与WHATWG给出不同答案;含真实Chrome实测的HTML解析层空白剥离行为与116站链接形态普查。
nginx实验台实测:多余斜杠、点段、百分号编码共11种路径写法全部返回200且字节完全相同;105站普查显示一个页面平均带2.66个等价地址,61.9% 的站至少多出一个;附大小写三档分布与收敛决策表。
一条抄来的limit_req写在server级,爬虫抓到第4个页面就把配额吃光,接着robots.txt和sitemap.xml双双吃到503。而按官方规矩,robots.txt取不到会让Google前12小时停止抓取整站。想把它摘出来时才发现,limit_req off这条指令根本不存在。