AI代理只能猜着用你的站,四个动作83个站里1个全通
做法是用真实浏览器把131个英文电商品牌站的首页、一个类目页和一个产品页各打开一遍,在渲染后的DOM上取四组静态特征:搜索输入框在不在GET表单里且带name与action、类目页有没有带筛选参数的链接、有没有真分页链接或rel=next、加购按钮在不在带action的表单里。建站平台的判定另外补了一轮首页HTML特征探测才敢用——最初拿加购表单地址是不是/cart/add来认Shopify,把61个站认成了19个,低估3.2倍,那一版…
做法是用真实浏览器把131个英文电商品牌站的首页、一个类目页和一个产品页各打开一遍,在渲染后的DOM上取四组静态特征:搜索输入框在不在GET表单里且带name与action、类目页有没有带筛选参数的链接、有没有真分页链接或rel=next、加购按钮在不在带action的表单里。建站平台的判定另外补了一轮首页HTML特征探测才敢用——最初拿加购表单地址是不是/cart/add来认Shopify,把61个站认成了19个,低估3.2倍,那一版…
对131个海外独立站首页跑三轮:关掉脚本数一次外部域,脚本跑完再数一次,最后把所有第三方请求全部拦断再跑一次,逐项量正文、链接、图片、结构化数据的存活情况。另把462个第三方域按出现频次排开,做两两清单的重合度比对,并与大样本公开分析的筛选口径做了一次对照,附带记下一次因跨域重定向造成的测量翻车。
做法是用真实浏览器打开131个英文电商品牌站,从首页两跳之内进到产品页,取渲染之后的document.body.innerText当作机器实际拿到的那条文本流,用一份六十多个词的英文规格字段词表定位字段名所在的行,再逐条看它下一行是什么;同时在DOM那一侧记录字段名用的标签、有没有落在table与dl里、JSON-LD有没有写offers和additionalProperty。关键的一步是尺子自检:脚本自动判据给出的93.6%被187条…
在浏览器里同时取文档树文字与渲染树文字两个数,量出118个海外独立站首页的可见率分布,再把所有隐藏容器按用途归类,看清那些看不见的字到底是菜单、弹层还是同意条款。另在本机搭台造出16种藏法各一个页面,让8个读取器逐一去读,得到一张谁读得到谁读不到的裁决表,并记下无障碍量法自己打架的两处。
做法是用真实浏览器在1440宽视口打开112个电商独立站首页,遍历主内容区每个元素、只取它自己直接持有的那段文字,记下渲染后的实际字号、字重、标签名与位置,再按字号排序看排在最前的几段挂的是什么标签;同时把全部h1到h6单独取出比对字号、可见性与是否为空,并把被同意层整个盖住的13个站单独剔出。
用同一个浏览器对171个海外独立站首页各跑两轮,唯一变量是脚本开关,两轮都拿到200的有131个。三个文本口径在同一次访问里取,配47个两轮几乎不变的站作对照,再用1秒、3.5秒、10秒三档等待时间做敏感性检验,逐层拆开正文、链接、结构化数据、主标题、商品入口五类结构件的丢失情况,并把测量过程中翻车的两次尺子问题一并记下来。
做法是把127个电商独立站首页用真实浏览器打开、滚三屏逼出懒加载,再按原始地址下载渲染面积最大的8张图(不截屏,避免把叠在上面的HTML文字拍进去),用RapidOCR逐行读出文字,最后拿回由正文、DOM全部文字、alt与aria属性、meta和JSON-LD拼成的文本池里逐行比对;OCR这把尺子先用12张已知文案的合成图和24张人工标注的真图考过两轮,并做了置信度敏感性检查。
把171个海外品牌站的首页抽出六个自我介绍字段——标题标签、社交分享标题、推特卡片标题、页面H1、结构化数据里的名称、站点名称字段,逐对比对完全相同、包含还是完全不同;再用浏览器、搜索引擎爬虫、社交抓取器、AI爬虫四种身份各抓一轮,看不同的读者拿到的是不是同一份页面。文中给出字段覆盖率、五组两两一致率、消费方的取用顺序与回退链、四种身份的状态码差异、同一份规则文件对不同爬虫的判定落差,以及一条从模板层收敛六个副本的路线和几段可直接跑的核…
把同一件事分别写进HTTP响应头和HTML,再交给真实浏览器裁决:字符编码两个方向各测一次,防嵌套做成六格对照,其中一格同时写了最严的老字段和较松的新指令。另一头拿674份配着响应头的真实页面逐项对账,统计响应头层各字段的实际覆盖率、meta里那些规范根本不承认的写法、以及站点规则文件里各类指令的接收方现状。文中给出三条线的层级顺序、三层规则的方向性、一张按层归位的对照表,以及四条能直接跑的核对命令与一段响应头变更监控脚本。
把188个海外品牌站的首页在两个时间点各抓一次,337份可解析文档、17423条head声明,逐类统计那些语义上本该唯一的字段被写了几遍、值一不一样;再用一个最小的本地服务制造六组典型冲突,交给真实的浏览器内核解析,看它最终采纳了哪一条。文中给出重复率与冲突率的两次快照对照、内页与首页的差距、七类字段各自的裁决方式、被一个div赶出head的三条声明、编码声明写到十几万字节之后为什么仍然没事,以及三档整改优先级和一段能直接接进流水线的检…
从73个多语言站的首页抽出2529条语言版本声明,实抓258个目标页,逐个解析对面自己的清单,按规范要求做集合比对与逐地址标法比对;非正常响应一律换第二种身份重抓一次,把不受接待与真的坏掉分开;跨域目标另做一次平台指纹对照。文中给出集群规模与跨域分布、自指与集合一致率、标法冲突的形态排序、跳转造成的错位比例、按责任方划分的问题清单,以及一套先修自己再推别人的优先级与可直接抄的沟通结构。
从116个海外品牌独立站的sitemap里各随机抽6条地址做实抓,把提交层、交付层、索引层三处的声明逐条比对。做法是先确认sitemap本身拿得到,再按固定随机种子抽样,一次请求同时取回状态码、跳转链、页面与响应头里的索引声明和canonical,最后对所有非200的地址换普通浏览器身份重抓一次做对照。文中给出一致率、各项失分分布、系统性与零星的分辨方法、六步自查顺序,以及五处差点搞错的判据。
把122个海外品牌站首页上的3102条资源提示逐条拆开,跟页面实际加载的资源域名做差集,再把所有第三方主机拿去做域名解析与请求验活,最后用同一批站在两个时间点的快照比对这块配置动没动。文中给出五种提示类型各自的空转率、重复声明的规模与三种成因、字体预加载缺跨域属性的比例、被指得最多的第三方域各自的空转情况、两次快照的变更率,以及一套先删哪些、哪些要先确认、删完怎么验证的完整操作顺序。
把142个海外品牌独立站首页的最终响应逐字段拆开,按十二种形态归类,再对着规范逐条判它们的下场。做法是先切出跳转链最后一段2xx响应,再按字段名分组找同名重复,然后查缓存、防嵌套、Cookie到期这三对经典冲突,最后把内容安全策略里的关键字逐个过一遍。文中给出各形态的站数分布、平台指纹与自写部分的拆分、六步自查顺序,以及把合并误判成矛盾之后数字从69降到57的修正过程。
把143个站声明的sitemap两层全拉下来,435份文件、41万条地址,逐条解析修改时间字段,再按2小时22分、7分钟、4秒三种间隔各重抓一遍做前后比对;对声称刚刚改过的页面另做一次正文闭环,逐字比对标题、描述、H1与正文词集;最后用两种身份同时请求同一份文件,把测量顺序造成的假差异从身份差异里扣干净。文中给出覆盖率、精度、年龄七档分布、时间戳聚集度、索引层与子文件层的对账结果,一次把尺子量歪的完整复盘,以及一套可以在自己站上一分钟跑…
按RFC 9309从零实现一遍匹配器,再用三种办法把157份robots.txt的合并效果逐条判出来:给每条规则生成一个一定能匹配的代表路径,做删除实验看这条规则删掉之后判定变不变,以及把规则随机洗牌五遍验证顺序到底有没有影响。文中给出撞车率、胜负分布、空转成因分类、三种解析器读法的分歧规模,以及一套五步自查顺序和两次量错口径的完整过程。
给robots.txt做一次收件人体检的量法:先把字段名去重列出来,多出常规四五种的逐个查谁在读;再比通配组与专属组的条数差;抽三条具体路径实际请求看还在不在;最后把依据和日期写成注释留下。含157份真实文件的逐字段实测、四步自查清单与两种服务端替代写法。
给robots.txt做一次分组体检的完整量法:先数通配组的Disallow条数,再数每个专属组的条数,两边做减法找出被漏掉的路径;接着把不会生效的Crawl-delay、Noindex、Host这类字段清掉;最后用测试工具按地址乘爬虫名做一个小矩阵逐个验证,把结果存下来当回归基线。文中给出157份真实robots.txt的实测数据、三种写法的效果对照表、五步自查清单,以及把平台默认模板接管过来之后要承担什么。
要判断一个站的承诺有多少是说给机器听的,有一套可以照着跑的量法。第一步把页面上人能读到的文字提出来,去掉脚本和样式只留正文,用一组模式匹配承诺类表述:免运费、免退货、多少天退货、多少天试用、多少天送达、多少年质保、终身质保、满意保证,各语言的常见说法都要覆盖。第二步在同一个页面的机器可读部分里找对应字段:配送详情、退货政策、退货天数、免运费门槛、处理时长、运输时长。两步结果交叉,就能算出只对人说、两边都说、只对机器说和两边都没说各有多少…
要判断一份hreflang声明里有多少是实的,有一套可以照着跑的量法。把首页里所有带alternate的链接标签整个取出来,别只按一种属性顺序匹配,逐条记下语言地区码和目标地址;先数声明总条数,再数目标地址去重之后还剩几个,两个数一除就是虚声明倍率;接着把每条拆成语言和地区两半分别统计,看语言那一半有几种、地区那一半有几个;最后把页面顶部的语言属性和正文实际语言做一次对照,检验可核验的那半准不准。默认项要单独计数,别混进语言里。