SEO优化

想让网站在谷歌和百度持续拿到免费流量,靠的不是碰运气而是体系。这里汇集保哥二十多年的SEO实战经验,从关键词研究、页面与技术优化到外链建设、内容策略和算法应对,手把手带外贸、独立站与SEO从业者把搜索排名做成可复制的长期增长。

  • 实验台分三层搭:分母取各站公开的商品清单接口并翻页到底,第一跳取首页渲染后DOM里的分类链接(只用静态HTML会漏,gymshark从0变92),第二跳取这些分类各自的商品清单。名次按商品在各分类里的最好位置计,再按每页24、36、50三档分别换算页码,不预设某个站用了哪一档。逐条扣掉地区路由、变体级伪商品、语言分卷重复、翻页截断、导航不走collections路径这五类干扰,60个候选站最后41个进干净口径。

    商品页从首页点两下到不了,六成还挂在sitemap上
  • 给robots.txt做一次分组体检的完整量法:先数通配组的Disallow条数,再数每个专属组的条数,两边做减法找出被漏掉的路径;接着把不会生效的Crawl-delay、Noindex、Host这类字段清掉;最后用测试工具按地址乘爬虫名做一个小矩阵逐个验证,把结果存下来当回归基线。文中给出157份真实robots.txt的实测数据、三种写法的效果对照表、五步自查清单,以及把平台默认模板接管过来之后要承担什么。

    robots.txt分组不继承:157个站的实测
  • 要判断一个站的承诺有多少是说给机器听的,有一套可以照着跑的量法。第一步把页面上人能读到的文字提出来,去掉脚本和样式只留正文,用一组模式匹配承诺类表述:免运费、免退货、多少天退货、多少天试用、多少天送达、多少年质保、终身质保、满意保证,各语言的常见说法都要覆盖。第二步在同一个页面的机器可读部分里找对应字段:配送详情、退货政策、退货天数、免运费门槛、处理时长、运输时长。两步结果交叉,就能算出只对人说、两边都说、只对机器说和两边都没说各有多少…

    配送退货承诺结构化数据实测:136个站只有11个写了
  • 要判断一份hreflang声明里有多少是实的,有一套可以照着跑的量法。把首页里所有带alternate的链接标签整个取出来,别只按一种属性顺序匹配,逐条记下语言地区码和目标地址;先数声明总条数,再数目标地址去重之后还剩几个,两个数一除就是虚声明倍率;接着把每条拆成语言和地区两半分别统计,看语言那一半有几种、地区那一半有几个;最后把页面顶部的语言属性和正文实际语言做一次对照,检验可核验的那半准不准。默认项要单独计数,别混进语言里。

    hreflang实测:236条地区声明背后只有6个真实页面
  • 把响应的不成文缺省测出来的完整做法:对同一个地址发三次请求,分别换掉语言偏好、去掉压缩声明、保持原样,再比对最终地址、页面语言标记、标题与正文体积这四项稳定证据;拿到变化维度清单之后逐项去核对Vary头,多了删、少了补。文中给出139个站的实测分布、判据从宽到严导致数字缩水3.8倍的完整过程、五分钟版与半天版两套清单,以及修复该落在哪一层。

    Vary响应头实测:说变的3个,真变的17个
  • 把一个页面对自己地址的所有声明抠出来做对齐,这件事有一套可复现的跑法。先取事实,用跟随跳转的请求拿到服务器实际服务的那个地址,别拿你输入的那个当基准;再从原始源码里取出规范网址、og:url、hreflang默认版本、结构化数据里的url这四处声明;然后做分层比对,第一层严格比字符串,第二层忽略末尾斜杠,第三层忽略www,记下它在哪一层变成一致,那一层就是问题的性质;最后比对站点地图,逐字符比。一个页面十分钟,全站按模板抽八到十个就够。

    canonical你说了不算:132个首页有23%自相矛盾
  • 一个页面拿不到,先别急着改内容。正确的顺序是把同一个地址换几种身份各要一次,逐项比较状态码、正文字节数和最终落点,两次结果不一样就说明问题出在送达层而不是内容层。本文给出七种身份对照的完整跑法,包括基线怎么从数据内部长出来、什么算真的拿到了页面、拒绝页可以用哪四类信号自动识别、声明层与送达层的两层对齐审计怎么在半小时内做完,最后是一份每天跑一分钟、覆盖五个地址三种身份的监测清单。

    robots.txt说允许,GPTBot仍有10个站进不去
  • 排查条件请求要按关卡来:先看响应头里有没有可以拿来协商的凭据,再连发两次看凭据稳不稳,然后带着凭据重发一次看回不回304,最后确认最后修改时间填的不是当前时刻。文中把这套顺序在211个国际化电商域名上走了一遍,逐关给出该看哪个头、判据定在哪、失败对应哪种成因,末尾附一张四种失败对应四种修法的对照表和一份三分钟自检。

    304状态码能省抓取预算,142个站只有52个回得出
  • 排查顺序比工具重要:先抓一次首页把标签剥干净数字符,判断这一页有没有把内容交出来;正文正常再进第二层,在字节里找按钮的名字、图片的替代文本、表单标签和地标区域;只有字节里找不到、而页面上确实有的,才需要打开浏览器看渲染后的无障碍树。文中把这三层在211个国际化独立站上走了一遍,逐层交代口径怎么定、基线从哪来、哪些样本必须先剔掉,末尾给出一张行业参照表、一份分诊流程和三个能在一个下午跑完的动作。

    AI爬虫读不到你的正文?132个独立站首页有28个是空壳
  • 判断顺序建议改一改:先拿候选词的词集跟自己的站点地图比一遍,命中就说明这一页可能已经有了;没命中再去比搜索结果、建大纲、看结构位置。文中把这套顺序在87个电商站21.9万个网址上跑了一遍,给出重复的四种形态与各自的处理方式、合并时的五道检查,以及一份十步的照抄清单。

    一个词值不值得单开一页,87个站的站点地图先替你答了一半
  • 排查展示层身份要按顺序来:先数首页声明了几个图标,再逐个请求确认返回的是能读出宽高的图片,然后核对形状与尺寸,最后修兜底路径;名字那一半则是先补WebSite结构化数据,再把og:site_name和标题尾段调成同一个词。文中把这套顺序在211个国际化电商域名上走了一遍,逐步给出每一步该看什么、判据定在哪、什么情况可以放过,末尾附一张九项核对表和一份发布流程挂钩清单。

    favicon要上广告位,211个站有152个拿不出图标
  • 盘点品牌名要按顺序来:先把站上所有会说出名字的位置列全,再定一个顾客口头在用的基线名,最后逐个语言版本做减法。多出来的词按去处分流,国家地区直接删掉,法律后缀移进legalName,另一种文字移进alternateName,母公司名交给关系属性。文中把这套顺序在112个域名上走了一遍,逐步说明每一步该看哪个字段、判据定在哪、什么情况该弃权,末尾附一张六列盘点表、一张别名分流表和一份三分钟自检。

    Google商家名称禁双语重复,112个独立站里17个在犯
  • 排查多语言标注要按顺序来:先确认每个语言版本的规范网址自指,再看hreflang有没有成对声明,最后才轮到x-default和地区细分。顺序反了,前面的活儿全是在一批别名之间改关系。文中把这套顺序在211个国际站的抓取数据上走了一遍,逐步给出该量哪个数、阈值定在哪、什么情况才需要人介入,末尾附一张五列的对账表模板和一份八条自检清单。

    hreflang里写的那些语言版本,Google只把它们当规范页的别名
  • 做法是把每张表最多20行12列的单元格连同标签类型一起原样取下来,再写一段还原程序按四条判据逐张试:首行是不是全部为表头单元格、有没有跨行跨列、各行格子数是否一致、列名是不是既非空也非纯数字,任何一条不满足就归进对应的失败类型。单位不从采集端的正则读,改成从表格矩阵离线重算,因为括号写法那种形式会被常规正则整批漏掉。格子总数不超过两个的空壳表单独摘出,不进还原成功率的分母。

    表头去哪了?110张商品页表格,程序读得出的只有38%
  • 实验台用真实浏览器逐页打开55个英文独立站的商品页,等渲染完成并滚动一次之后,同时清点五类可能承载尺码信息的东西:真表格、计算样式为网格的伪表、老式CSS表格布局、整张图片形态的对照表,以及定义列表;再单独记录页面上有没有尺码指南这类入口,把入口与内容逐页对上。为了区分“页面没写”和“我没等到”,另挑三十个站做了两组对照:同一个地址等5秒与再等20秒各量一次,以及替用户点开尺码指南之后再量一次。限流与失效的页面逐条记录,没有拿去凑分母。

    商品页尺码表载体实测55站:有入口的近一半DOM里没有表