配送和退货承诺,63个站说给人听,11个说给机器听
要判断一个站的承诺有多少是说给机器听的,有一套可以照着跑的量法。第一步把页面上人能读到的文字提出来,去掉脚本和样式只留正文,用一组模式匹配承诺类表述:免运费、免退货、多少天退货、多少天试用、多少天送达、多少年质保、终身质保、满意保证,各语言的常见说法都要覆盖。第二步在同一个页面的机器可读部分里找对应字段:配送详情、退货政策、退货天数、免运费门槛、处理时长、运输时长。两步结果交叉,就能算出只对人说、两边都说、只对机器说和两边都没说各有多少…
要判断一个站的承诺有多少是说给机器听的,有一套可以照着跑的量法。第一步把页面上人能读到的文字提出来,去掉脚本和样式只留正文,用一组模式匹配承诺类表述:免运费、免退货、多少天退货、多少天试用、多少天送达、多少年质保、终身质保、满意保证,各语言的常见说法都要覆盖。第二步在同一个页面的机器可读部分里找对应字段:配送详情、退货政策、退货天数、免运费门槛、处理时长、运输时长。两步结果交叉,就能算出只对人说、两边都说、只对机器说和两边都没说各有多少…
要判断一份hreflang声明里有多少是实的,有一套可以照着跑的量法。把首页里所有带alternate的链接标签整个取出来,别只按一种属性顺序匹配,逐条记下语言地区码和目标地址;先数声明总条数,再数目标地址去重之后还剩几个,两个数一除就是虚声明倍率;接着把每条拆成语言和地区两半分别统计,看语言那一半有几种、地区那一半有几个;最后把页面顶部的语言属性和正文实际语言做一次对照,检验可核验的那半准不准。默认项要单独计数,别混进语言里。
要判断一段内容的来源能不能被核实,有一套可以照着跑的量法。先把目标站的首页抓下来存成文件,从中取出机器可读的结构化数据块,把代表组织的那个实体找出来;然后逐字段清点有无,把字段按外人能不能独立查证排成一列——名称和描述属于纯自述,网址和标志一点就知道,关联主页要去对面看,法定名称和税号能在登记处查;最后画出填写率随可核验度变化的那条线,看它在哪一档出现断崖。整套逻辑不到两百行,唯一要留神的是结构化数据的嵌套解析,只在顶层找会漏掉一大半样…
把一个页面对自己地址的所有声明抠出来做对齐,这件事有一套可复现的跑法。先取事实,用跟随跳转的请求拿到服务器实际服务的那个地址,别拿你输入的那个当基准;再从原始源码里取出规范网址、og:url、hreflang默认版本、结构化数据里的url这四处声明;然后做分层比对,第一层严格比字符串,第二层忽略末尾斜杠,第三层忽略www,记下它在哪一层变成一致,那一层就是问题的性质;最后比对站点地图,逐字符比。一个页面十分钟,全站按模板抽八到十个就够。
一个页面拿不到,先别急着改内容。正确的顺序是把同一个地址换几种身份各要一次,逐项比较状态码、正文字节数和最终落点,两次结果不一样就说明问题出在送达层而不是内容层。本文给出七种身份对照的完整跑法,包括基线怎么从数据内部长出来、什么算真的拿到了页面、拒绝页可以用哪四类信号自动识别、声明层与送达层的两层对齐审计怎么在半小时内做完,最后是一份每天跑一分钟、覆盖五个地址三种身份的监测清单。
排查条件请求要按关卡来:先看响应头里有没有可以拿来协商的凭据,再连发两次看凭据稳不稳,然后带着凭据重发一次看回不回304,最后确认最后修改时间填的不是当前时刻。文中把这套顺序在211个国际化电商域名上走了一遍,逐关给出该看哪个头、判据定在哪、失败对应哪种成因,末尾附一张四种失败对应四种修法的对照表和一份三分钟自检。
排查顺序比工具重要:先抓一次首页把标签剥干净数字符,判断这一页有没有把内容交出来;正文正常再进第二层,在字节里找按钮的名字、图片的替代文本、表单标签和地标区域;只有字节里找不到、而页面上确实有的,才需要打开浏览器看渲染后的无障碍树。文中把这三层在211个国际化独立站上走了一遍,逐层交代口径怎么定、基线从哪来、哪些样本必须先剔掉,末尾给出一张行业参照表、一份分诊流程和三个能在一个下午跑完的动作。
判断顺序建议改一改:先拿候选词的词集跟自己的站点地图比一遍,命中就说明这一页可能已经有了;没命中再去比搜索结果、建大纲、看结构位置。文中把这套顺序在87个电商站21.9万个网址上跑了一遍,给出重复的四种形态与各自的处理方式、合并时的五道检查,以及一份十步的照抄清单。
排查展示层身份要按顺序来:先数首页声明了几个图标,再逐个请求确认返回的是能读出宽高的图片,然后核对形状与尺寸,最后修兜底路径;名字那一半则是先补WebSite结构化数据,再把og:site_name和标题尾段调成同一个词。文中把这套顺序在211个国际化电商域名上走了一遍,逐步给出每一步该看什么、判据定在哪、什么情况可以放过,末尾附一张九项核对表和一份发布流程挂钩清单。
盘点品牌名要按顺序来:先把站上所有会说出名字的位置列全,再定一个顾客口头在用的基线名,最后逐个语言版本做减法。多出来的词按去处分流,国家地区直接删掉,法律后缀移进legalName,另一种文字移进alternateName,母公司名交给关系属性。文中把这套顺序在112个域名上走了一遍,逐步说明每一步该看哪个字段、判据定在哪、什么情况该弃权,末尾附一张六列盘点表、一张别名分流表和一份三分钟自检。
读这两条线要按顺序来:先确认自己的品牌名在英语词表里是什么,再决定这两个数该打几折,最后才谈怎么用。跳过第一步,后面所有解读都建立在一个不知道大小的偏移量上。文中把这套顺序在169个DTC品牌名上跑了一遍,给出四个口径的分档结果、一张五列的品牌名附注表,以及一个三十分钟就能做完的手工对照测量。
排查多语言标注要按顺序来:先确认每个语言版本的规范网址自指,再看hreflang有没有成对声明,最后才轮到x-default和地区细分。顺序反了,前面的活儿全是在一批别名之间改关系。文中把这套顺序在211个国际站的抓取数据上走了一遍,逐步给出该量哪个数、阈值定在哪、什么情况才需要人介入,末尾附一张五列的对账表模板和一份八条自检清单。
9月1日起用了自动创建资产的搜索广告系列会被自动迁移,不操作即默认同意。既然文案由平台从落地页现抓,就该先看它能抓到什么。66个站的实测:25个没有主标题标签,52个的标题是模板拼的;70份爬虫规则文件里27份抹掉店铺编号后一字不差。
这一页在多数公司里没有主人:不属于内容团队,不属于设计团队,也不出现在任何一份优化清单上。可它正在接住一批意图最明确的访客。本文给出三十秒判断自己属于哪一类的方法,四个按性价比排序的改动,以及一个团队用四天半跑完这套改造的完整账。
把95个DTC品牌的发信配置查了一遍:93个有SPF记录,7个展开后已经超过规范的10次上限,6个正好卡在10。最短的一条记录只有39字节、一个引用都没写,展开出来正好10次。文中给出各家发信服务的真实查询成本、四种记录形态的对照,以及一份接新工具前必过的四行检查卡。
内容安全策略的覆盖率是个骗人的指标。87个DTC与电商站的购物车页里,56个拿到真页面,47个带了这条响应头,但其中42条的长度落在49到175字节之间、内容一字不差,真正约束脚本来源的只有5个。文中给出长度分布、第三方脚本清单、完整性校验的真实归属,以及一份两小时能做出来的脚本基线。
谷歌把自己的抓取客户端分成三份清单,其中特例爬虫那一份里,AdsBot-Google、AdsBot-Google-Mobile、Mediapartners-Google和APIs-Google四条下面写着同一句话:全局用户代理会被忽略;Google-Safety更彻底,完全不看robots.txt。这意味着你那行星号覆盖的范围小于你以为的范围,而覆盖之外那几个恰好后果最直接。本文把日志里的用户代理与robots.txt里的令牌这两套字典…
浏览器请求里有84.54%的来源字段是空的。在剩下能看清来路的那部分里,AI入口带来575次访问,其中527次来自国内产品。同一份日志换三种口径统计,会得到4979、575、23三个数字,本文把口径差异、六类常见坑,以及一套不依赖技术链路的补救办法一并给出。
四条被反复引用的效果证据,在做法完全无效的时候也照样成立。本文用51天、230万条访问日志做了一次对照实验,把robots.txt当作已知被使用的参照,量出AI客户端对llms.txt的真实请求只有17次,并给出对照组的七步流程与一条能长期挂在站上的地板线。
Gmail从2024年2月起把退订拆成了两个互不相干的层:信头里的List-Unsubscribe与List-Unsubscribe-Post,以及正文里那个清晰可见的链接,官方原文用的是并列句,不是二选一。本文把这两层的失效方式逐条摆开:正文那层要经过HTML解析、样式应用、图片加载、暗色模式反色、屏幕适配这五个环节,任何一个出岔子链接就消失;信头那层零环节,唯一的失效方式是你没写。而找不到退订入口的人不会放弃,他会去点举报垃圾邮件,…