商品列表页优化的97条准则,只有70条会变成分数

商品列表页优化的97条准则,只有70条会变成分数
张文保 100 分钟阅读 2,206 阅读
本文目录
  1. 同一份研究里,“有几条准则”这个问题为什么有四个答案?
  2. 先把四个数原样摆出来
  3. 97这个数是怎么来的
  4. 83这个数是页面自己写的
  5. 84这个数来自博客那一侧
  6. 70这个数才是会变成分数的那个
  7. 四个数各自回答的是什么问题
  8. 那27条的差额到底有多大
  9. 顺手验一下21000这个参数量是怎么凑出来的
  10. 算下来还有一成多的格子是空的
  11. 免费能读到的那8条,是按什么标准挑的
  12. 这一节能带走的两句话
  13. 为什么这种数字打架在成熟机构里反而常见
  14. 这套对数的方法能不能用在竞品分析上
  15. 落榜的那27条准则,跟进了评分表的70条差在哪?
  16. 先排除一个最容易想到的解释
  17. 入选门槛其实只有一条
  18. W3C把这件事写进了规则格式里
  19. 标准自己承认客观这道门槛挡住了一批东西
  20. 主观性会往上传染
  21. 于是删掉那一条成了最理性的选择
  22. 三句话就能把一条检查项归好类
  23. 拿这三句去过一遍公开的那8条
  24. 这一层的边界必须先说清楚
  25. 落榜那27条大概长什么样,能不能猜出来
  26. 换到你熟悉的审计工具上,这条线画在哪
  27. 这条门槛跟“标准由谁定”不是同一个问题
  28. 为什么参与方越多,清单越只剩及格线
  29. 十个主题的一句话介绍里,“怎么做”和“什么时候做”各占多少?
  30. 一个只要数措辞就能做的检验
  31. 八个主题用的都是“怎么做”
  32. 另外两个主题出现了条件性措辞
  33. 比较工具是唯一一个把“要不要有”写进第一句的
  34. 那个“考虑”也落在同一个位置
  35. 这两个主题的条目数也说了点什么
  36. 每条准则配几页示例,能不能当第二把尺子
  37. 为什么措辞这把尺子比数字那把好用
  38. 这个检验能直接用在你自己的清单上
  39. 顺手看一眼那10个主题的厚薄分布
  40. 同一个筛选按钮,两份评分表符号相反
  41. 八条公开建议里,唯一没有百分比的那条在说什么?
  42. 七个百分比和一个空位
  43. 那一条到底写了什么
  44. 它给的不是达标率,是一句条件
  45. 那个“8个左右”是从哪来的
  46. 跟“五种必备筛选”那条放在一起看
  47. 两条独立证据落在同一个位置
  48. 你自己的清单里有没有这样一条
  49. 这类条目为什么在转述中最先丢失
  50. 把“视情况”写成能执行的样子要补什么
  51. 为什么“有没有”能打分,“多少合适”打不了
  52. 分页和加载条数也是同一种形态
  53. 把不可判定项交给谁来判
  54. 七个失分率从14%排到80%,分界线画在哪一处?
  55. 先把七个数排一排
  56. 第一个假设:越依赖品类知识的越容易缺
  57. 第二个假设:要改的是界面,还是商品数据
  58. 一个比均值更硬的检验
  59. 逐条说一下为什么排序那条要补数据
  60. 缩略图那条为什么排最后
  61. 迁移到技术SEO这一侧,规律是一样的
  62. 这个结论的反面同样重要
  63. 于是长期看分差会集中在哪
  64. 这条分界线为什么在SEO那一侧更明显
  65. 数据类的活为什么总排不进去
  66. 先补哪个字段,有没有排序办法
  67. 全绿的检查报告到底能证明什么,标准自己怎么说?
  68. 一个大多数人没意识到的不对称
  69. W3C的原话:失败项能判定不达标
  70. 通过项判定不了达标,同一份文档写得很清楚
  71. 另一份标准把这件事写成了正式的结论映射
  72. 结论有五种,不是两种
  73. 你的报表里为什么没有“说不准”这一栏
  74. 还有一类做法,标准直接把它移出了符合性
  75. Google那一侧也是同一个三层结构
  76. “毫无察觉就通过了”这句话的分量
  77. 标准还规定了必须写出假设,这一条最值得抄
  78. 误报和漏报,标准是怎么定义的
  79. 还有一件事标准明说了不管
  80. 上线前30项全部打勾,为什么第二个月加购率一动不动?
  81. 这个站是做什么的
  82. 接手时那份30项清单
  83. 三个月后的数:一半涨了,一半没动
  84. 所有报表都是绿的
  85. 一个日本客户的一句话
  86. 站内搜索日志里躺着六百多次零结果
  87. 这个问题在通用清单上占几行
  88. 改法与代价
  89. 最扎心的是清单一格都没动
  90. 三个月零报警,是因为它落进了一个正常类目
  91. 算不出来的那笔账
  92. 五个岗位看的是五份材料,没一份是用户屏幕上那页
  93. 这次踩的坑跟“抽样抽错了”不一样
  94. 为什么颜色筛选那一条反而最容易被判成合格
  95. 换个品类,同样的坑长什么样
  96. 不加预算、不排开发,这周能先把哪几件做了?
  97. 六件事的总览
  98. 第一件:把站内搜索的零结果按周导一次
  99. 第二件:给每条检查项补一个“假设”字段
  100. 第三件:给报表加第三栏“说不准”
  101. 第四件:把清单按三句判据拆成两栏
  102. 第五件:数一次待办里改界面和改商品数据各占多少
  103. 第六件:让最懂品类的人写五条外人判不出的事
  104. 卡点挂在哪一张表单上
  105. 这套做法的四条边界
  106. 口径迁移要提前说的一句话
  107. 小站和大站的做法要不要分开
  108. 这套做法跟现有的审计流程冲不冲突
  109. 三个月后回头看什么
  110. 常见问题解答
  111. 说清单里只剩及格线,是不是等于说通用最佳实践没用?
  112. 怎么判断一条检查项是不是“外部可判”,有没有更简单的办法?
  113. 我们没有站内搜索,第一件事怎么做?
  114. 那27条落榜的准则,能不能想办法弄到手?
  115. “说不准”这一栏加上之后,老板会不会觉得团队在推卸责任?
  116. 只有几百个商品的小站,值不值得做这一套?
  117. 这套判据会不会被用来给不做事找借口?
  118. 外部审计报告还有没有必要买?
  119. 权威参考资料

摘要:Baymard那份商品列表与筛选的研究,公开页面上关于“到底有多少条准则”给出了四个数——十份分主题报告的条目加起来97条,页面自己写83条,博客口径8条加另外76条,而真正拿去给335个站打分的只有70条。四个数都没错,但只有70那个会变成分数。落榜的27条不是被谁藏起来了,是因为它们判不了——判它们得先知道你卖的是什么。这篇把那27条的形状挖出来,顺带算了一件源文没算的事:七个公开失分率从14%排到80%,分界线不在重不重要,在这件事要改的是界面还是商品数据。

做电商站的人多少都经历过这么一轮:拿一份体验或者技术的对照清单,逐条走查,一条一条打勾,最后交出一份漂亮的完成度。清单上的问题确实修掉了,报表也确实变绿了。

然后呢?

然后往往什么都没发生。类目页的流量可能涨一点,加购率纹丝不动。你回头再看那份清单,找不出哪一条做错了——因为确实一条都没做错。

保哥翻Baymard那份商品列表与筛选的公开材料时,本来只是想看看今年的失分率有没有变化。结果在两个页面之间对了一下数,发现了一件更有意思的事:同一个主题,“有多少条准则”这个问题在他们自己的站上有四个答案

把十个分主题报告里逐条写明的准则数加起来,是97条。页面自己在段落里写的是“全部83条商品列表与筛选研究发现”。博客文章里说“本文讲了8条,建议你把另外76条也过一遍”,加起来84条。而在介绍基准测试的那一段里,写的是“我们用最重要的(加权的)70条商品列表准则,对335个头部电商站做了基准”。

97、83、84、70。

这四个数看着像笔误,其实一个都不是。它们分别回答了四个不同的问题:知识库里存在多少条、研究发现被算作多少条、公开文章覆盖到哪里、以及——最关键的那个——有多少条真的被拿去打了分。

只有最后那个数会变成分数。会变成分数,就意味着会变成排名、变成对比、变成你老板发给你的那张截图。剩下那27条永远不会出现在任何一个站的评分卡上,因为它们从一开始就没上评分表。

它们凭什么落榜,才是这篇要说的事。

同一份研究里,“有几条准则”这个问题为什么有四个答案?

先把四个数原样摆出来

这四个数不在同一个地方,需要来回翻两个页面才凑得齐,所以正常读法下你只会碰到其中一个。博客文章的结尾写着一句:本文只讲了8条准则,建议把另外76条也看一遍。研究概览页的正文里写着“全部83条商品列表与筛选研究发现被分成以下10份报告”。同一页往上翻一屏,介绍基准的那段写的是70条。而97这个数,页面上任何一个地方都没有写出来——它是把10份报告各自标注的条目数一个一个加起来才得到的。

加法本身没有任何技巧,就是把10张报告卡片上的数字抄下来相加:7加6加16加10加5加12加14加11加11加5。中间那个16是列表项的商品信息与缩略图,是十份里最厚的一份,配了113页示例;两个5分别是列表项个性化和商品比较工具,是最薄的两份,分别配了23页和27页。

一路加下来是97。加完之后再回头看那句“全部83条”,感觉就完全不一样了。

97这个数是怎么来的

Baymard在商品列表与筛选研究概览页上把这个主题拆成了10份报告,每份报告的封面上都标着两个数:这份报告里有几条准则,配了几页示例。这两个数是给订阅者做取舍用的,用来判断哪份报告值得先读、哪份可以放到后面。它们是产品信息,不是研究结论。

正因为是产品信息,所以没有人会去把这10个数加起来——对订阅者来说加起来毫无用处,你要读哪份就点哪份,总量是多少并不影响今天的动作。但把它们加起来之后,你拿到的是另一样东西:这个知识体系在这个主题上真正落到纸面上的条目总量。

这里还有个细节值得留意。页数的加总是591页,准则数的加总是97条,平均每条准则配6.09页示例。10份报告的这个比值从4.60到7.17,最高的和最低的只差1.56倍。换句话说,无论哪个子主题,写一条准则要配的示例量是相当均匀的——这个体系在举例这件事上没有明显偏心,也没有哪一块是靠堆例子撑起来的。

83这个数是页面自己写的

研究概览页在列出那10份报告之前,有一句引导语,说的是全部83条商品列表与筛选研究发现被分成下面这些报告。83比加出来的97少了整整14条,而这句引导语和那10张卡片之间隔了不到一屏。

最合理的解释是“研究发现”和“准则”不是同一个计数单位。一条发现在落地成准则的时候可能被拆成两条,也可能两条相邻的发现最后共用了一条准则。这在做研究的机构里非常常见——定性阶段数发现,落地阶段数条目,两套编号并行推进,各自都对,只是从来不放在一起对账。

但页面上没有任何一句话解释这两个数为什么不一样。你如果只读那句引导语,会以为这个主题一共83条;你如果只看下面那10张卡片,加起来是97条。两个数在同一屏里,相差14条,中间没有一个字做过渡。这不是谁的疏忽,是因为在他们的使用场景里,这两个数根本不会相遇。

84这个数来自博客那一侧

博客文章的收尾段落是这么写的:本文这份高层次的分析只覆盖了我们电商体验基准里的8条商品列表与筛选准则,我们建议你把另外76条也过一遍,以便完整理解这个主题的现状、找出本文没覆盖到的站点特有问题。

8加76等于84。这个数跟研究概览页的83只差一条,跟加总出来的97差13条。差一条那个几乎可以忽略——很可能就是两边取数的时点不同,中间新增或者合并过一条,这种小幅漂移在持续更新的知识库里是常态。

真正值得注意的是这句话的立场。博客把84当成了“这个主题的全部”,并且明确告诉你,你今天免费读到的是其中的8条。8除以84是9.5%,8除以97是8.2%。无论按哪个分母算,公开出来的都不到十二分之一。这个比例本身没什么可指摘的,人家是靠订阅吃饭的机构;值得琢磨的是被留在门外的那十一份是什么形状。

70这个数才是会变成分数的那个

基准那一段的原话是:我们随后用最重要的(加权的)70条商品列表准则,对全球335个营收最高的美欧电商站做了基准测试,加到我们已有的电商基准上,形成了一个庞大的数据库。

这句话里有两个限定词,都很关键。一个是“最重要的”,一个是“加权的”。加权说明这70条在总分里的分量不相等,最重要说明它们是从一个更大的池子里挑出来的。两个词摆在一起,等于承认了存在一次筛选,而且筛选发生在打分之前。

挑出来的动作发生在哪一步、按什么标准挑,公开页面上没有说,这也很正常,方法学细节通常在付费内容里。但有一件事是确定的:一个站的商品列表体验分数,就是这70条算出来的。剩下的27条对分数没有任何贡献——不是权重低到可以忽略,是压根不在这个公式里。

四个数各自回答的是什么问题

把它们并排放到一张表里,误会基本就消失了。这四个数之间不存在矛盾,它们只是站在四个不同的位置上,各自回答了一个不同的问题。

数字出处它回答的问题会不会变成分数
9710份报告标注的条目数加总这个知识体系在这个主题上写出了多少条
83研究概览页引导语定性研究阶段产出了多少条发现
84博客收尾段(8加76)面向公众时这个主题被表述成多少条
70基准介绍段有多少条被拿去给335个站打分

四个数没有一个是错的。它们的关系也不复杂:写出来的最多,公开表述的次之,被打分的最少。这个逐层递减的顺序,在任何一个成熟的评估体系里都会出现,是分工的结果,不是谁的疏漏。站内那篇讲核心指标的行业基准还值不值得追的文章里,也遇到过同一份数据在不同口径下给出不同结论的情况。

问题不在于递减本身,在于只有最后那一层会流出去。你在网上能查到的排名、能看到的对比图、能截给老板的百分位、能写进季度汇报的那句“我们在这个主题上处于行业前多少”,全部产自那70条。前面三层的差额对外界而言是不存在的,它既不加分也不扣分,就像没发生过一样。

那27条的差额到底有多大

97减70等于27。这27条准则被写进了报告,配了示例,订阅者花钱能读到,但它们不参与任何一次打分,因此不会出现在任何一个站的评分卡上,也不会出现在任何一张对比图里。占比是27.8%——这个主题下每四条准则里,就有一条从来不参与评分

27.8%这个比例值得多看两眼。它不是个位数,说明落榜的不是零星几条边角料;它也没到一半,说明大部分准则确实是可以打分的。四分之一强,正好落在“多到不能忽略、少到不会有人专门去问”的那个区间里。

换个角度看这个差额更直观:如果一个站把70条全做满,它的商品列表分数就是满分。而它在那27条上是什么状况,评分表既不知道,也不打算知道。满分并不代表这个主题被做完了,只代表被打分的那部分做完了。

顺手验一下21000这个参数量是怎么凑出来的

博客那一侧说,这份基准包含超过21000个商品列表与筛选的体验参数,全部由研究员人工审阅打分。这个数看着很大,但把它除一除,就能反推出参数这个单位到底是什么。

第一种算法:335个站乘以70条准则等于23450。第二种算法:博客提到的170多个站,乘以70条准则,再乘以桌面和移动两个终端,等于23800。两种算法都落在21000到24000这个区间里,说明所谓“一个参数”,就是“一个站在一条准则上的一次判定”,不是别的。

这个反推有个实际用处。当你看到某份研究声称自己有几万个数据点的时候,先别急着被这个量级唬住,把它除以站数和条目数试试。除完之后你通常会发现,这个几万级的数字背后是几十条准则乘以几百个站,而真正决定研究深度的是那几十条准则,不是那几万个格子。

算下来还有一成多的格子是空的

按170个站乘70条乘2个终端算,满格应该是23800。实际是21000出头,差了大约2800个格子,空格率11.8%,大约每8.5个格子里空一个。

空格的原因基本只有一个:这条准则对这个站不适用。尺码筛选对电视机不适用,单位价格对整机不适用,商品变体合并对只卖单一规格的品类不适用。不适用不是失分,也不是漏做,它是一个正当的第三种状态。

需要留意的是,21000这个数带了个加号,是个下限而不是精确值,所以11.8%只是个量级估算,别拿它当精确结论用。但量级本身是稳的:不适用的比例是一位数到十几个百分点,不是三成也不是百分之一。这个量级对做站的人有个直接含义——你拿到一份通用清单,先天就有一成左右的条目跟你没关系,而清单不会主动告诉你是哪一成。

免费能读到的那8条,是按什么标准挑的

博客文章自己交代了挑选标准,原话是:这些最佳实践之所以被选中,是因为它们对大多数站的商品列表体验都广泛适用。

这句话读起来像句客套话,其实是这篇文章后面所有推论的起点。“对大多数站广泛适用”这个标准,翻译过来就是“跟你这个站的具体情况关系最小”。一条准则越是不挑品类、不挑客单价、不挑用户结构,它就越容易被选进公开的那一批。

这个标准也解释了为什么各种公开的电商SEO常见错误清单读起来总是似曾相识——能上清单的本来就只剩下那些不挑品类的条目。反过来,一条准则如果只在特定品类下成立——比如“颜料类商品必须能按颜料索引号筛选”,或者“工业紧固件必须能按公制英制两套标准并行筛选”——它对绝大多数站是废话,永远上不了这种面向所有人的公开清单。可它对做那个品类的人来说,重要性可能排第一。

这一节能带走的两句话

第一句:一份研究报告里“有多少条”这个问题,往往有好几个答案,而你需要盯的是“有多少条会变成分数”那一个。其余几个数不管多大,都只影响这份材料的厚度,不影响任何人对你的评价。

第二句:被打分的那部分和没被打分的那部分之间,存在一条稳定的分界线,而这条线不是按重要性画的。接下来要做的事,就是把这条线画出来看看它到底长什么样。做电商类目页的人如果对这类结构性差异感兴趣,站内那篇讲电商类目页SEO机制的文章里,也拆过一次类似的“表面指标与真实结构对不上”的问题。

为什么这种数字打架在成熟机构里反而常见

看到一个机构在自己站上给出四个不同的数,第一反应容易是“他们不严谨”。实际情况往往相反:数字打架通常是分工细化的副产品,越是分工细的机构越容易出现。

做定性研究的人数发现,做产品的人数报告条目,做基准的人数打分项,做内容的人数文章覆盖面。四拨人各自维护一套编号,各自都对,唯一没做的事是把四套编号放到同一张表上对一遍——而在他们的日常里,这四个数从来不会同框。

这件事对你的实际意义是:看到一份研究里的数字对不上,先别急着质疑对方的可信度,先去找这几个数各自属于哪一套编号体系。找到之后你往往会发现,真正需要盯的只是其中一个,其余几个只是把材料的厚度描述了几遍。第三方工具给出的各种指标之所以互相对不上,机制也是类似的,站内那篇讲关键词难度各家算法为什么差那么多的文章里拆得更细。

这套对数的方法能不能用在竞品分析上

能,而且成本很低。做竞品或者行业研究的时候,遇到对方给出的任何一个总量数字,都值得多问一句:这个数是写出来的总量、公开表述的总量,还是真正被拿来评价的总量?

三个总量里,第三个才有杀伤力。前两个只影响这份材料看起来有多厚,第三个决定了谁会被排在谁前面。一份材料如果只公布前两个而不公布第三个,那它基本上就是一份宣传材料,不是一份评价材料。

另一个顺手能做的动作是把总量除一除。一份研究声称有几万个数据点时,除以站数、除以条目数、除以终端数,两三步之内就能反推出它的最小计量单位。这类“把数字拆回它的产生方式”的习惯,读任何一份行业基准都用得上,站内那篇第三方SEO工具数据准确性的文章里给过一套完整的估算流程。

落榜的那27条准则,跟进了评分表的70条差在哪?

先排除一个最容易想到的解释

看到“最重要的70条”这个说法,第一反应通常是有人藏了私货:把不好看的条目拿掉,或者把自家客户容易达标的条目留下。这种猜测在别的场景里未必没道理,但放在这里站不住脚,因为落榜的那27条并没有被藏起来——它们写在付费报告里,订阅者随时能读到,只是不参与打分而已。

藏私货的做法要么是不写,要么是写了不给看。这里两样都不是:写了,也给看了,就是不打分。所以这不是一个透明度问题,追问“你按什么标准挑的”并不能把那27条捞回评分表。它们进不去是有别的原因的。

这个区别很重要,因为它决定了你该往哪个方向使劲。如果是透明度问题,正确动作是要求对方公开标准;如果不是,要求公开标准只会拿到一个你早就该想到的答案。

入选门槛其实只有一条

把能打分的和不能打分的分别列一列,共同点会自己浮出来:凡是能进评分表的,都是一个不认识这家公司、不知道它卖什么的人,看一眼页面就能判对错的。

有没有已应用筛选的总览?看一眼就知道有还是没有。同一个筛选类型能不能多选?点两下就知道。排序下拉框里有没有按销量、按上新?展开一看就完了。这些判断不需要任何背景知识,不需要问这个站卖的是颜料还是螺丝,甚至不需要看懂页面上的文字。

反过来,“这个类目的筛选粒度合不合适”这种问题,同一个人看一辈子也判不出来。他得先知道这个品类的用户是怎么挑东西的,得知道260个色号在专业用户眼里是260个不同的商品还是12个颜色桶,而这些东西不写在页面上。判定成本不在难度上,在前置知识上。

W3C把这件事写进了规则格式里

这个分野不是电商研究的特产,它在一个完全不相干的领域里被写成了国际标准的正式条款。W3C有一份叫“无障碍符合性测试规则格式”的推荐标准,专门规定一条自动化检测规则该怎么写。它把规则的适用范围明确分成了客观和主观两类。

标准里的原话是:适用范围应当被客观地、用平实语言描述;客观描述指的是在给定技术下可以毫无疑义地判定的描述。它举的客观例子是这样的:带autoplay属性的video或audio元素、指定在HTML或SVG元素上的role属性、在顶层上下文里渲染的html元素。都是机器一查就有的东西。

然后它举了主观的例子:装饰性的、导航机制、预先录制的。标准对这三个词的评价是:这类概念可以用多种方式定义,往往依赖人的判断。它还专门举了一条“判定元素是否被样式化成了标题”的规则,说这条规则的适用范围没法写成客观的,因为“看起来像标题”取决于页面上下文。

标准自己承认客观这道门槛挡住了一批东西

最能说明问题的不是上面那些定义,是这份标准的版本变更说明。它在1.1版的开头写着:相对于1.0版,1.1版包含两项重大改动,其中一项是现在允许主观的适用范围。

换句话说,1.0版是要求客观的。要求客观的结果是,有一整类规则根本写不出来,因为它们的适用范围没法用毫无疑义的语言描述。这批规则不是不重要,是被格式挡在了门外——挡了整整一个大版本。

到了1.1版,标准让步了,原话是:在无法客观定义适用范围的情况下,使用主观描述是可以接受的。同时它给规则加了一个可选的标注位,让规则作者写明这条是客观的还是主观的。一个国际标准的两项重大改动之一,就是把“判不清楚”这件事正式接纳进来。这个让步本身就是最有力的证据。

主观性会往上传染

这份标准里还有一条规定,实操价值特别高。它把规则分成原子规则和复合规则:原子规则测一个具体做法,复合规则把多条原子规则的结论合成一个结论。

关于复合规则的适用范围类型,标准写得很干脆:只要任何一条输入规则含有主观的适用范围,复合规则就被算作主观;全部客观时才算客观。没有加权,没有多数决,一条就够。

把这条规则搬到你自己的检查清单上,含义是这样的:一份清单里只要有一条需要业务判断,这份清单就不能全自动跑完。不是跑得慢一点,是那一条必须有人坐下来看。而一旦有人必须坐下来看,这份清单就没法做成“上传网址、点一下、出报告”的形态。

于是删掉那一条成了最理性的选择

站在做工具的人的位置上想一想:你有一份30条的检查清单,其中28条能自动判,2条必须人工判。你把它做成产品,用户上传网址,等30秒拿报告。那2条怎么办?

三个选项。第一,保留并标注“需人工确认”——用户会觉得这个产品不完整。第二,用某种近似算法硬判——判错了要背锅。第三,删掉——报告变成28条,全自动,看起来干净利落,没有人会发现少了什么,因为用户手里并没有一份31条的原版可以对照。

这一点在各类内容评分器上表现得更明显,站内那篇拆内容评分器怎么把可见性拆成维度的文章里,能打分的维度和真正影响引用的因素之间也有一段没被覆盖的空白。第三个选项几乎必然胜出,而且没有任何人在这个过程中做错事。选材机制本身会持续地把需要业务判断的条目筛出去,这是个结构性的结果,不需要任何人有私心。这也是为什么市面上的审计工具越来越像,检查项越来越多,但每一款都不会问你卖的是什么。站内那篇讲SEO自动化边界的文章从另一个角度谈过同一件事:哪些活能交给工具、哪些交出去就变形了。

三句话就能把一条检查项归好类

这三句判据不需要任何工具,也不需要任何数据,坐在会议室里就能对着清单一条一条过。

顺序要问的话答案的含义
第一问一个不认识我们公司、不知道我们卖什么的人,看一眼页面能不能判它对错?能——外部可判;不能——需要品类知识
第二问判完之后,我们改不改它,取决于我们卖的是什么吗?不取决于——通用项;取决于——特异项
第三问前两问的答案是“能”和“不取决于”吗?是——这条是及格线,不是竞争力

这三问跟各种加权评分模型不是一回事:加权评分解决的是同一栏内部谁先谁后,而这三问解决的是一条该进哪一栏。第三问看着像废话,其实是整套判据的收口。前两问是分类,第三问是定性:凡是外部能判、又跟你卖什么无关的条目,它的上限就是不扣分。做满了你不会因此赢,做漏了你会因此输,这两件事不对称。

拿这三句去过一遍公开的那8条

结果相当整齐。已应用筛选总览、同一类型多选、四种必备排序、三张以上缩略图,这四条第一问全答“能”,第二问全答“不取决于”——一个外人扫一眼就判完,而且不管你卖颜料还是卖螺丝,答案都一样。

商品变体合并、单位价格、五种必备筛选这三条稍微特殊一点:第一问还是“能”,但第二问是“部分取决于”——你得先知道这个品类有没有变体、是不是按容量卖、尺码这个维度适不适用。这就是前面说的那一成空格的来源。

只有横向筛选工具栏那一条,第一问的答案是“不能”。八条里有七条是及格线,一条不是。而那一条,恰好就是唯一一条没给出百分比的。这个巧合值得单独用一节来说。

这一层的边界必须先说清楚

把及格线这个词说出来,很容易被听成“这些不重要”。恰恰相反,及格线是必要条件:漏一条会实打实地掉分,用户会实打实地卡住,该修还是要修,而且要尽快修完。

它的特点不是不重要,是做完之后就不再产生任何差异。所有同行迟早都会做完,因为它便宜、明确、有工具提醒。做完那天你和所有人站在同一条线上,谁也没赢。

真正麻烦的是时间分配。及格线的条目数天然更多,工具还会不断往里加新的检查项,于是每周例会的议程被它们占满,而那几条真正需要你自己判断的东西——通常不到十条——一次都排不上讨论。这个错配是后面那些动作要解决的问题。

落榜那27条大概长什么样,能不能猜出来

公开信息不足以逐条还原,但可以从主题分布上做一个有依据的推测。10份报告里,商品比较工具5条、列表项个性化5条,是最薄的两块。这两块恰好也是最依赖“你卖什么”的两块——比较工具值不值得做,取决于你的品类里用户会不会横向比参数;个性化能不能做,取决于你有没有足够的行为数据可用。

再看举例密度。列表项个性化那份报告是全部10份里最低的,每条准则只配4.60页示例,比最高的加载方式那一份(7.17页)少了三分之一。示例是要截图的,而个性化的截图天然难截——同一个页面对不同用户长得不一样,你截哪一张都不具代表性。举例难,往往就是判定难的前兆。

这个推测的证据强度需要说明白:每份报告只有5到16条,样本太小,把4.60和7.17拿来做因果推断是站不住的。它只能当成一条线索,不能当结论。真正硬的证据在下一节——不用统计,只数措辞就行。

换到你熟悉的审计工具上,这条线画在哪

把三句判据搬到技术SEO这一侧,结果同样整齐。标题长度、H1个数、alt缺失、状态码、规范标签有没有自指、结构化数据格式合不合法、页面能不能被抓取——这些全部第一问答“能”,第二问答“不取决于”。它们是及格线,而且现在基本上都有工具自动提醒。

那另一栏是什么?“这个筛选组合该不该有一个可索引的落地页”“这个类目要不要拆成两个”“这批长尾商品页应该合并成参数页还是各自保留”。这些问题没有任何工具会问你,因为回答它们要先知道你的用户是怎么搜的、你的库存深度有多少、你的类目未来还会不会扩。

要注意的是,第一栏里也有轻重之分,站内那篇讲技术SEO三类站点的高ROI修复顺序的文章和另一篇讲电商技术审计新增的五层的文章,处理的都是第一栏内部怎么排;本文说的是第一栏和第二栏之间的分配。而恰恰是第二栏那几条,决定了这个站的天花板在哪。第一栏做满,你得到的是一个没有明显缺陷的站;第二栏做对,你得到的是一个别人抄不走的结构。站内那篇讲技术SEO怎么按业务影响排序的文章里有一组500个站的实测数据,跟这里的分栏思路正好互为印证。

还有一个更扎心的观察:第一栏的条目数会被工具无限扩充,因为加检查项是工具厂商最自然的增长方式;第二栏的条目数只能由你自己写出来,而且通常写不满十条。于是两栏的条目数比例大概是八比二,而价值的比例很可能是倒过来的。

这条门槛跟“标准由谁定”不是同一个问题

这里有个容易混淆的地方,值得单独说清楚。有一类批评是这样的:评分标准是他们自己定的,及格线是他们自己划的,所以分数不可信。这个批评在有些场景下成立,但它跟本文说的事完全是两码事。

“标准由谁定”是个透明度问题——你追问对方按什么划的线、样本怎么选的、权重怎么给的,对方要么答得出来,要么答不出来,追问是有用的。而这里说的是另一回事:就算标准完全公开、完全公正、完全善意,被选进评分表的条目仍然系统性地是那些不需要了解你就能判的。

这个筛选不是任何人的私心,它是“要给几百个站打同一套分”这个目标的必然结果。你追问“为什么是这70条”,得到的答案会是“因为剩下那27条判不了”——这个答案完全合理,而且答完之后什么都不会改变。

为什么参与方越多,清单越只剩及格线

把这个机制往前推一步会得到一个不太舒服的推论:一份清单要被越多方共用,它能容纳的条件性条目就越少。

道理很直接。两个人共用一份清单,可以在里面写“这一条你根据自己的类目判断”,因为两个人能当面对齐。二十个团队共用,这句话就开始产生分歧。几百个站共用一套评分,这句话就必须删掉——不删的话,同一个站找两个人打分会得到两个结果,评分体系本身就垮了。

所以清单的通用性和它的信息量是互相牵制的。越权威、越通用、参与方越多的清单,越只剩下及格线;而一份只在你团队内部用的清单,反而是唯一能容纳条件性条目的地方。这也说明了外部审计报告和内部检查清单不该是同一份东西——前者天然只能覆盖第一栏,后者才有机会覆盖第二栏。

反过来说,如果你的团队内部清单跟公开的行业清单几乎一模一样,那它其实没在做内部清单该做的事——站内那篇讲全职SEO每天该做哪七件事的文章里,那份日常清单之所以有用,恰恰是因为它写的是这个岗位的工作节奏而不是行业通例。这一点跟内容质检的分工问题很像,站内那篇讲人机分工怎么做内容质检的文章里,机器能判的和必须人判的也是这样分开列的。

十个主题的一句话介绍里,“怎么做”和“什么时候做”各占多少?

一个只要数措辞就能做的检验

上一节的推论听着有道理,但推论终归是推论。有没有一个不靠猜、不靠统计、任何人打开那个页面都能自己复核一遍的检验?有,而且做起来只要五分钟:数一数那10份报告的一句话介绍分别用了什么动词

这个检验之所以可靠,是因为这10句介绍是同一批人在同一个模板下写出来的,字数相近,目的相同——告诉订阅者这份报告里有什么。在这么整齐的一组文案里,某一句偏离了句式,通常不是随手写的,是内容本身逼出来的。

还有个好处:措辞是明摆着的,不需要任何解读。你我读同一句话,数出来的结果应该一样。这在一篇满是推论的文章里是很难得的一段硬地面。

八个主题用的都是“怎么做”

先看这八句。列表布局那份写的是“如何创建一种能促进商品浏览的列表布局”。加载方式那份写的是“如何在商品列表里加载条目”。列表项信息与缩略图那份写的是“列表项里要包含哪些信息、如何格式化和展示”。列表项界面与点击区那份写的是“如何在列表项里呈现和排布信息”。

剩下四句同理:个性化那份是“站点如何为每个用户定制列表项”,可用筛选那份是“用户需要哪些筛选类型来收窄列表”,筛选范围与逻辑那份是“常见陷阱与优化”,排序那份是“如何提供……以及需要哪些排序类型”。

这种“默认你要做、只讨论怎么做”的写法在SEO这一侧同样普遍,比如面包屑导航的四种类型和结构化数据写法,讲的全是怎么做,从来没人问一句这个站需不需要面包屑。八句,全部落在如何、哪些、什么这三类词上。它们共同的隐含前提是:这件事你肯定要做,问题只在于怎么做。前提既然是给定的,判定就只剩下一件事——你做了没有、做对了没有,而这正是可以打分的形状。

另外两个主题出现了条件性措辞

第九句,筛选界面与布局那份,写的是“筛选的布局、界面样式和可发现性,包括如何在侧边栏里做视觉嵌套、什么时候截断筛选项,以及考虑用一个横向的统一排序筛选工具”。一句话里出现了两处条件性措辞。

第十句,商品比较工具那份,写的是“什么时候该有一个比较工具、以及它的选择流程和比较页该怎么设计,什么时候该有一个比较功能,以及比较入口和比较视图该怎么做”。同一句话里“什么时候”出现了两次,而且第一次就在句首。

十句话里,条件性措辞只出现在这两句,其余八句一处都没有。

报告主题介绍语的领头词句中有无条件性措辞准则条数
列表布局如何7
加载方式如何6
列表项:信息与缩略图哪些信息16
列表项:界面与点击区如何呈现10
列表项:个性化如何定制5
筛选:可用筛选类型哪些类型12
筛选:范围与逻辑常见陷阱14
筛选:界面与布局布局与样式有(什么时候截断、考虑用横向工具栏)11
排序如何提供11
商品比较工具什么时候该有有(两处“什么时候”)5

比较工具是唯一一个把“要不要有”写进第一句的

其他九份报告的第一句都在讲怎么做,默认这件事你得做。只有比较工具这一份,第一句先问你该不该有。

这个差别不是文案风格,是这件事本身的性质。比较工具做不做,取决于你的品类里用户会不会横向比参数:卖显示器、卖相机镜头、卖电动工具,用户天天在比刷新率比光圈比扭矩,比较工具是刚需;卖服装、卖香氛、卖单一规格的耗材,硬塞一个比较工具进去只会多一个没人点的按钮,还占掉列表项上本来就紧张的位置。

同一个功能,在两个品类里的正确答案是相反的。只要存在这种相反,这条准则就没法被写成一个所有站通用的判定项。它只能写成“什么时候该有”,而“什么时候”这三个字,外部评测替你答不了。

那个“考虑”也落在同一个位置

第九句里的“考虑用一个横向的统一排序筛选工具”,用的动词是“考虑”,不是“提供”也不是“使用”。这是十句话里唯一一次出现这个动词。

而横向筛选工具栏,恰好就是博客那8条公开建议里唯一一条没有给出百分比的。两个独立的证据——研究概览页的措辞、博客文章的数据缺口——落在了同一个位置上。这不太可能是巧合。

把这两处对上之后,前面那个“判定成本在前置知识上”的推论就从猜测变成了有支撑的结论。而且这个支撑是任何人都能自己复核的:打开那个页面,读那十句话,数一遍条件性措辞出现在哪几句。

这两个主题的条目数也说了点什么

含条件性措辞的两份报告,准则数是11和5。其中比较工具的5条,和个性化并列全场最少。

这个数不能证明什么因果关系,样本只有10个点,两个含条件措辞的样本里一个最少一个中等,趋势并不明显。但它至少跟前面那个推论方向一致:越是取决于你卖什么的主题,能写成通用准则的条目就越少,因为通用准则的写法要求你把品类差异抹掉,而抹掉之后剩下的话就不多了。

这里必须把话说死:我把这条当线索,不当结论。真正硬的是上一节那个措辞统计,因为它不需要任何统计推断,只需要识字。

每条准则配几页示例,能不能当第二把尺子

还有一个能自己算的量:每份报告的页数除以准则数。这个比值代表写一条准则平均要配多少页示例,某种程度上反映了这条准则说清楚有多费劲。

报告主题准则数示例页数每条配几页
加载方式6437.17
列表项:信息与缩略图161137.06
列表项:界面与点击区10696.90
筛选:界面与布局11726.55
列表布局7456.43
筛选:可用筛选类型12695.75
商品比较工具5275.40
筛选:范围与逻辑14745.29
排序11565.09
列表项:个性化5234.60
合计/平均975916.09

排下来最低的是个性化的4.60,最高的是加载方式的7.17,全场只差1.56倍。这个离散度小得有点出乎意料——我原本猜想越难判定的主题示例越少,落差应该更明显才对。

所以这把尺子基本上是失效的。它没有把可判定和不可判定分开,只是均匀地告诉你每条准则都要配六页左右的图。写出来是因为我确实算了,算完发现不好用,这一步该留下来而不是抹掉——一篇只展示成功推论的文章,读者没法判断作者试了几次。

为什么措辞这把尺子比数字那把好用

回头看这两把尺子的差别很有意思。示例密度是个数字,看起来更“客观”,实际上被太多因素干扰:报告的成稿年份、截图当时能找到几个合适案例、排版时一页放几张图,都会影响这个比值。

措辞不一样。这10句介绍是同一个人在同一天写同一种东西,其他条件基本被控住了。在一组高度同质的文案里,一处偏离句式的措辞,信息量比一个受多因素干扰的比值大得多。

Google那份质量评估员手册也可以这么读,站内那篇讲质量评估员手册怎么落成自查清单的文章拆过它的评级词,那份手册里同样是一部分能给出明确档位、另一部分只能写“需要评估员判断”。这个经验可以直接搬到你自己的工作里。看竞品、看行业报告、看别人的方法论文档时,与其去抠他们给的数字,不如先数一遍措辞:哪几处用了“可以考虑”“视情况”“取决于”,哪几处用的是“必须”“始终”“不要”。前者是他们自己也判不了的地方,后者是他们敢打包票的地方。

这个检验能直接用在你自己的清单上

把你团队现在用的那份检查清单打开,逐条数一遍措辞。凡是写着“必须”“确保”“不得”的,八成是及格线条目;凡是写着“建议评估”“根据品类判断”“视流量情况”的,就是那另一栏。

做完这一遍你大概率会发现两件事。第一,条件性措辞的条目数比你以为的少,很多清单上一条都没有——不是你的业务没有这类问题,是写清单的时候大家默认只写能判的。第二,那些少数几条条件性条目,在过去半年的复盘里被讨论的次数,可能是零。

这两件事凑在一起,就是那个八比二的错配。写清单的时候把判不了的删掉,开会的时候按清单走,于是判不了的那部分永远不上桌。它不是被否决的,是压根没被提出来过。

顺手看一眼那10个主题的厚薄分布

97条准则摊在10个主题上,分布并不均匀。最厚的是列表项的商品信息与缩略图,16条;最薄的是个性化和比较工具,各5条。最厚的是最薄的3.2倍。

把这10个主题按大类合并一下更清楚:跟列表项本身有关的三份合起来31条,跟筛选有关的三份合起来37条,剩下的布局、加载、排序、比较工具四份合起来29条。筛选这一块占了全部的38%,是这个主题里最重的一块。

这个分布对做电商SEO的人有个直接含义:筛选相关的准则条数最多,而筛选恰恰也是最容易在技术侧出事的地方——筛选组合会生成大量URL,处理不好就是抓取预算的黑洞。体验侧的37条准则和技术侧的URL治理讲的是同一个界面上的两件事,而这两件事在大多数团队里由两拨人分头做,中间没有交接。站内那篇讲筛选器URL怎么不爆炸的文章和另一篇讲电商过滤器五类参数怎么处理的文章,覆盖的就是技术那一侧。

同一个筛选按钮,两份评分表符号相反

这里有个特别值得电商团队注意的冲突。体验准则里那条“允许同一筛选类型多选”,在体验评分表上是加分项——只有14%的站没做到,属于基本盘。

但同一个动作在技术SEO那一侧的账是反的。允许多选意味着筛选值的组合数从相加变成了相乘,URL空间会指数级膨胀;如果这些组合URL可被抓取、可被索引,抓取预算会被大量低价值页面吃掉,索引里还会堆积一批近似重复的页面。

收不住的后果不只是抓取预算,还有索引里堆出一大批近似页面,也就是站内那篇讲索引膨胀怎么诊断的文章说的那种局面。同一个按钮,体验记加分,技术记减分。这不是谁错了,是两套评分表各自只看自己那一侧。正确的做法当然是两边一起做——多选照做,同时用规范标签和抓取规则把组合URL收敛掉;但要做到这一点,前提是有人同时看着两份评分表,而这个位置在大多数团队里是空的。站内那篇讲筛选URL该不该写Disallow的文章里,那三类判断标准就是给这个空位准备的。

八条公开建议里,唯一没有百分比的那条在说什么?

七个百分比和一个空位

那篇讲商品列表现状的博客里,8条建议的标题都是同一个格式:先说该怎么做,后面括号里跟一个百分比,表示有多少比例的站没做到。42%、80%、67%、14%、51%、20%、69%——七个数,一个不缺。

只有第四条的标题里没有百分比。它写的是“横向筛选工具栏:两个需要谨慎的理由”。同一篇文章,同一套排版,同一个作者,八条里七条给了达标率,一条给了两个理由。

建议没做到的比例判定形态
把同一商品的多个变体合并成一个列表项42%做了/没做
列表和搜索结果里提供3张以上缩略图80%做了/没做
容量或数量不一的商品展示单位价格67%做了/没做
横向筛选工具栏:两个需要谨慎的理由——视情况判断
允许同一筛选类型多选14%做了/没做
提供五种必备筛选类型51%做了/没做
把已应用的筛选集中展示20%做了/没做
提供四种必备排序类型69%做了/没做

七条是二元的,一条不是。这张表本身就是这篇文章的核心论点的缩影。

那一条到底写了什么

它讲的是横向筛选工具栏——就是把筛选条摆在列表上方横着一排,而不是竖在左侧边栏里的那种做法。文章给了两个需要谨慎的理由。

第一个理由是可见性:横向工具栏里每个筛选类型下面的具体选项默认是收起来的,用户得先点开筛选类型才能看到里面有哪些选项,也看不到每个选项对应多少件商品。而侧边栏可以把选项和数量一起铺出来。文章举了一个宜家的例子,用户看不到颜色选项,就没法一眼判断这个类目里有没有他想要的颜色的沙发。

第二个理由是容量:横向那一行的宽度是有限的,筛选类型一多就装不下,站点只能加第二行,或者做一个“全部筛选”按钮把多出来的收进去。而测试里发现,有些用户完全没注意到那个按钮,或者是先跟可见的几个筛选交互过之后才发现它。文章举的例子是史泰博。

它给的不是达标率,是一句条件

这一节的收尾句是这么写的:一般来说,横向筛选工具栏只有在筛选类型数量有限的情况下才行得通。接着补了一句:比如很多服装站提供的筛选不超过8个左右,横向工具栏放得下。

注意这个句式。它没说横向工具栏是错的,也没说侧边栏是对的。它说的是:正确答案取决于一个数——你的类目需要几种筛选类型。这个数在你自己手里,不在评测机构手里。

所以这一条打不了分。评测的人打开你的类目页,能数出你现在用了几种筛选,但数不出你“应该”用几种。应该用几种取决于你的商品属性有多少维、用户挑选时会用到哪几维、你的品类里有没有那种一维定生死的属性。这些信息不在页面上,在你的商品数据库和用户搜索日志里。

那个“8个左右”是从哪来的

文章顺带给了一个参考值:很多服装站提供的筛选不超过8个左右。这个数看着像一条可以直接抄的规则,但抄之前得看清它的前提——前提是服装。

服装的筛选维度天然收敛:尺码、颜色、价格、品牌、款式、材质,加上几个季节性维度,八个差不多到顶。换个品类就不是这样了。卖工业紧固件,光是规格维度就有材质、标准体系、螺纹类型、直径、长度、头型、表面处理,七八个还没碰到价格和品牌。卖颜料,色系、系列、透明度、耐光等级、容量、载体,也是六七个起步。

所以“8个左右”这个数不是一条准则,是服装品类下的一个观测值。把它当准则抄走的人,会在紧固件站上做出一个装不下的横向工具栏,然后把一半筛选塞进“全部筛选”按钮里——正好踩中文章说的第二个理由。

跟“五种必备筛选”那条放在一起看

第六条建议说要提供五种必备筛选:价格、用户评分、颜色、尺码、品牌,51%的站没做到。这条有百分比,是可判定项。但它后面跟了三个字——“如果适用”。

这三个字承担了全部的品类差异。尺码对电视机不适用,颜色对螺丝不适用,品牌对自有品牌独立站不适用。判定的时候,评测的人得先决定哪几条对这个站适用,才能算它做到了几条。“如果适用”这四个字,就是那一成空格的来源,也是可判定项和不可判定项之间那条缝。

各种电商SEO进阶清单里的条目也能这么分一遍,凡是带“如果适用”“视品类而定”的,都是把判断转嫁回给了你。把第四条和第六条放一起,能看出一个层次:第六条是“这几种筛选你该有”,是内容清单,可判定;第四条是“这些筛选该横着放还是竖着放”,是形态选择,取决于数量,不可判定。同一个功能,问“有没有”能打分,问“多少合适”打不了分。

两条独立证据落在同一个位置

这里可以把前面两节的结论并起来了。研究概览页那10句介绍里,唯一用了“考虑”这个动词的,是筛选界面与布局那一句,而它“考虑”的对象正是横向统一排序筛选工具。博客那8条建议里,唯一没有百分比的,就是横向筛选工具栏。

一个来自付费产品的目录文案,一个来自免费博客的数据呈现,两条完全不同的线索指向同一个功能。这两处不太可能是同一个人在同一天写的,也没有理由互相参照。

这种交叉验证在做资料分析的时候特别值钱,因为它排除了“我从一句话里读出了太多东西”的可能。一处偏离可以是随手写的,两处不相干的材料在同一个位置偏离,就说明这个位置本身有性质。

你自己的清单里有没有这样一条

现在可以做个小练习。把你团队的检查清单打开,找一找有没有哪一条是这个形态的:它写了要注意什么,但没给你一个可以打勾的标准;或者它给了标准,但标准里带着一个“视情况”“根据品类”“取决于规模”。

如果一条都找不到,那不是好消息。一份完全由可打勾条目组成的清单,说明写清单的人在编写阶段就把判不了的那些条目过滤掉了——过滤动作往往是无意识的,因为“写不出判定标准”的条目在草稿里看起来就像没写完,很自然会被删掉。

如果找到了一两条,那它们大概率是这份清单里最有价值的部分,也大概率是过去半年里从来没有被认真讨论过的部分。这两件事同时成立,是这篇文章想说的全部。

这类条目为什么在转述中最先丢失

一条准则从原始研究走到你手上的检查清单,中间要经过好几道转述:研究报告写一遍,博客文章缩一遍,行业媒体转一遍,某个工具把它做成检查项,最后你的同事把它抄进团队文档。每一道转述都会做同一件事——把话说得更利落。

“视筛选类型数量而定”这种话在每一道转述里都是负担。它不好排版,不好做成勾选框,写在幻灯片上还会被追问“那到底是几个”。相比之下,“提供五种必备筛选”干净利落,转述四道之后一个字都不会变。

结果是条件性条目的衰减速度远高于二元条目。它在源头是有的,到你手里就没了,而且没有人在任何一个环节撒过谎。这跟各家工具的数字对不上是同一个机制,站内那篇讲几家工具和后台的数据怎么对账的文章里,也拆过一次“中间环节的合理简化最后变成了失真”的过程。

把“视情况”写成能执行的样子要补什么

条件性条目不是不能落地,它需要补一样东西:把那个“情况”变成一个你自己能算出来的数。横向工具栏这条的完整写法应该是这样的。

第一步,数一下你主力类目里实际会用到的筛选类型有几种——不是后台配置了几种,是用户真的会点的那几种。第二步,看这个数是不是超过了你的横向工具栏在最常见屏宽下放得下的数量。第三步,如果超了,选侧边栏;如果没超,横着放没问题,还能省掉左边那一栏的宽度。

三步走完,这条“视情况”的准则就变成了一个可以在这周做完的动作,而且答案对你的站是唯一确定的。资深团队的技术审计之所以也会失灵,很多时候就是卡在这类没人去算那个数的地方,站内那篇讲资深团队的技术SEO为什么会失灵的文章里有几个类似的例子。不可判定说的是外部判不了,不是没有答案;答案存在,只是必须由掌握那个数的人来算。这一点后面还会反复出现。

为什么“有没有”能打分,“多少合适”打不了

这两种问法的差别,值得再挖一层,因为它是判断一条准则能不能被外部评测的最快捷径。

“有没有”是关于存在的判断,答案在页面上,看一眼就有。“多少合适”是关于取值的判断,答案不在页面上——页面只能告诉你现在是几个,告诉不了你应该是几个。应该是几个,取决于一个只存在于你的商品数据和用户行为里的数。

顺着这个思路数一遍就会发现,凡是带数量、带阈值、带比例的准则,几乎都落在不可判定那一侧:筛选类型该有几个、列表页一屏该放几个商品、加载多少条之后该分页、缩略图该给几张、类目该拆到几层。这些问题的公开答案永远是一个区间,而区间就是“我们也不知道你的情况”的委婉说法。

技术侧同样如此:noindex和规范标签能不能同时用这类问题之所以要分九种场景讨论,正是因为答案取决于你这个站的页面结构,而不是取决于标签本身。唯一的例外是那些被硬性规定死的数——比如缩略图那条给的是“三张以上”。它之所以能给出确定的数,是因为它取的是下限而不是最优值:三张是绝大多数品类都不该低于的底线,至于你该给五张还是十五张,源文自己也只能说“服装配饰可能需要5到15张”。

分页和加载条数也是同一种形态

同一份研究里还有一条类似的:加载方式那份报告讲的是新条目该怎么加载、默认显示多少条,这两个都是取值问题。默认显示多少条,跟商品图大小、用户设备结构、单个商品的决策成本都有关——卖服装一屏能塞十几个,卖工业设备一屏放四个就满了,答案差好几倍。

而分页方式的选择还牵扯到技术侧的收录问题——无限滚动做得不对,后面几页的商品可能根本进不了索引。这又是一个体验取值和技术后果绑在一起的位置,而通用清单上关于它的表述通常只有一句“提供清晰的分页”。站内那篇讲分页和无限滚动怎么选的文章里,把这几种方式各自的收录代价拆开算过一遍。

把不可判定项交给谁来判

说了这么多不可判定,得回答一个实际问题:那这些条目到底该由谁来判?

答案是三方凑在一起:掌握品类知识的人提供判据,掌握数据的人提供那个数,做决定的人拍板。三方缺一个,这条就判不了——只有品类知识没有数,判断变成拍脑袋;只有数没有品类知识,会算出一个方向错误的最优解。

这也解释了为什么这类条目在很多团队里长期悬着。它需要三个人坐在一起花半小时,而排一个三个人的半小时,比跑一遍自动化审计难得多。不是难在判断本身,是难在把这三个人凑齐这件事没有任何流程在推它。后面那个挂在工单模板上的必填项,解决的就是这个问题。

七个失分率从14%排到80%,分界线画在哪一处?

先把七个数排一排

把那七个百分比从小到大排开:14%、20%、42%、51%、67%、69%、80%。均值是49.0%,中位数是51%,极差66个百分点。这个跨度非常大——最容易做到的那条只有14%的站没做到,最难的那条有80%没做到,差了将近六倍。

这七条在源文里是并列的,谁在前谁在后只按叙述顺序排,没有任何解释说明为什么有的条目缺失率是14%、有的是80%。这就留下了一个可以自己做的分析:这七个数的高低,是被什么决定的?

这个问题值得做,因为答案直接影响你的排期。如果高低是随机的,那就按业务影响挨个修;如果有规律,那规律本身就是排期依据。

第一个假设:越依赖品类知识的越容易缺

假设怎么来的

顺着前面几节的思路,最自然的猜测是:判定越需要品类知识的条目,站点做到的比例越低。理由听起来很顺——需要品类知识才能判的事,做的时候也需要品类知识,而品类知识在很多团队里是稀缺的。

按这个口径给七条排个序:已应用筛选总览和同类型多选完全不需要知道你卖什么,排最前;变体合并和五种必备筛选需要知道品类有没有变体、哪几个维度适用,排中间;单位价格需要知道商品是不是按容量卖,缩略图需要知道这个品类值不值得多拍几张,排最后。

被哪一条推翻的

排完之后对一下实际数字,前面几条都对得上:多选14%、总览20%,确实最低;单位价格67%、缩略图80%,确实最高。看起来假设成立。

然后卡在四种必备排序上。提供按价格、按评分、按销量、按上新排序,这件事跟你卖什么几乎没有关系——任何品类的用户都会用这四种排序,判定它也不需要一丁点品类知识。按假设它应该跟多选、总览一样落在低位,实际却是69%,排在倒数第二高。

一条反例就够了。这个假设不成立,排序那条把它打断得干干净净。

为什么不该把这个失败藏起来

写到这里其实可以悄悄把排序那条挪走,只留下六条,图表会漂亮很多,结论也会显得很硬。但那样做等于把一个不成立的规律包装成成立的。

更要紧的是,这次失败本身指向了正确答案。排序这条为什么反常,就是下一个假设的入口——它需要的不是品类知识,而是别的什么东西。想清楚那是什么,答案就出来了。

第二个假设:要改的是界面,还是商品数据

换个口径重新问一遍

把问题从判它需要什么换成修它需要什么,七条立刻分成了泾渭分明的两堆。

已应用筛选总览,改的是前端模板:把当前选中的筛选值取出来,渲染成一排可点掉的标签。同类型多选,改的是筛选查询的逻辑:同一类型内部从取交集换成取并集。这两件事都在代码里,商品数据一个字段都不用动。

这两件事的共同点是,做完之后商品表里一个字段都没多——而让商品页对AI可读这类工作的重心,恰恰全在字段那一侧。另外五条不是。变体合并要求商品数据里存在“这几个SKU是同一款商品的不同变体”这层关系;五种必备筛选要求颜色、尺码、品牌这些属性字段被真的填过;单位价格要求每个SKU都有净含量和单位;四种排序要求销量和上新时间这两个数在数据库里可查、可排;三张以上缩略图要求每个SKU都有三张以上的图,而图是要拍的。

按这个口径重排

建议没做到的比例要改的是什么
允许同一筛选类型多选14%前端与查询逻辑
把已应用的筛选集中展示20%前端模板
把同一商品的变体合并成一个列表项42%商品数据(变体归组关系)
提供五种必备筛选类型51%商品数据(属性字段填充)
容量或数量不一的商品展示单位价格67%商品数据(净含量与单位)
提供四种必备排序类型69%商品数据(销量与上新时间可查)
列表和搜索结果里提供3张以上缩略图80%商品数据(每个SKU要有图,图要拍)

排出来是这样的:前两条是纯代码活,缺失率14%和20%,均值17.0%;后五条要动商品数据,缺失率42%到80%,均值61.8%。两组差3.63倍。

一个比均值更硬的检验

均值差3.63倍听起来有力,但两组各只有两条和五条,均值很容易被单个极端值拉动。有个更严格的检验方式:看组间的间隔有没有大过组内任何一个间隔。

组内的相邻间隔是这些:14到20差6个点,42到51差9个点,51到67差16个点,67到69差2个点,69到80差11个点。组内最大间隔是16个点。

而组间的间隔——从20%跳到42%——是22个百分点。它比组内任何一个间隔都大,而且比第二大的16个点还高出三分之一。这七个点在数轴上不是均匀分布的,它们真的聚成了两团,中间空着一段。

检验项数值说明
前端组均值17.0%2条
数据组均值61.8%5条
两组倍数3.63倍61.8÷17.0
组内最大间隔16个百分点51%到67%
组间间隔22个百分点20%到42%

这个检验之所以比均值可靠,是因为它不依赖组内有几个样本,只依赖这些点在数轴上的位置。组间间隔大于组内任何间隔,是“确实分成了两堆”最朴素也最难反驳的证据。

逐条说一下为什么排序那条要补数据

排序看起来是最纯的界面功能:加一个下拉框,四个选项,前端半天就做完了。但下拉框里那四个选项各自要排的是什么?按价格排要有价格,这个每个站都有;按用户评分排要有评分,没接评价系统的站就没有;按销量排要有销量,而销量通常在订单库里,不在商品库里;按上新排要有一个可靠的上架时间字段。

后两个是真正的坎。销量要从订单系统里聚合出来,写回商品表,还得定期刷新——多久刷一次、算多长时间的销量、退货算不算,全是要拍板的事。上架时间字段听起来简单,但很多站的商品是批量导入的,导入时间不等于真实上架时间,一批货导进去几千个SKU时间戳全一样,按它排出来的“最新”毫无意义。

所以四种排序缺69%,缺的不是那个下拉框,是下拉框背后的两个数。这也解释了为什么它明明不需要品类知识,缺失率却排在倒数第二高。

缩略图那条为什么排最后

三张以上缩略图缺80%,是七条里最高的。它的特殊之处在于,补数据这件事在这里不只是数据库操作,是要拍照。

一个SKU补两张图,意味着实物要在摄影棚里再走一遍,或者至少要从已有素材里挑出两张能用的、尺寸和背景对得上的。一个五千SKU的站,这是一万张图的工程,而且没有任何自动化手段能跳过它。

商品数据这一侧的投入其实不止服务于列表页,Google购物图谱那一侧的可见性吃的也是同一批字段,这笔账合起来算才划得来。源文自己也给了一个品类差异的注脚:服装配饰这类既看细节又看气质的商品,可能需要5到15张图才够用户做一次完整的视觉评估。同样是“提供三张以上缩略图”,服装站的成本和五金站的成本差一个数量级,而清单上写的是同一句话。

迁移到技术SEO这一侧,规律是一样的

这个分界线不是电商体验的专利。把它搬到技术SEO审计上,那些年年出现在报告里、年年修不完的项目,几乎全是要补数据的。

规范标签缺失、跳转链、robots规则写错、分页标记不对——这些是模板项,改一处代码影响一批页面,通常一个迭代就清干净了。结构化数据该不该做这件事也一样,写一次模板就全站生效。而商品描述重复、标题超长、结构化数据缺必填字段、图片没有alt、类目描述为空——这些是数据项,得一条一条填,填的人还得懂业务,永远修不完。

如果你的技术SEO待办清单每个季度都长得差不多,去看一眼里面模板项和数据项各占多少。大概率模板项早就清零了,剩下的全是数据项,而它们的进度取决于有没有人愿意花几个月往数据库里补东西。站内那篇讲SEO技术债务怎么审计的文章里,这两类债务的还款方式也是分开算的。

这个结论的反面同样重要

界面项做完就没了。这句话听起来是好消息,但它有个不太舒服的推论:界面项是所有同行都能在一个季度内做完的事情,所以它带来的优势有效期只有一个季度。

已应用筛选总览只有20%的站没做,说明八成的站已经做完了。你今天把它补上,追平了;你今天没补,掉队了。无论哪种,都不构成优势。

而数据项那五条,缺失率42%到80%,说明有一半到八成的站还没做。为什么没做?不是不知道该做,是补数据要跨部门、要预算、要几个月,很多站算完账觉得不值。凡是大家都算过账觉得不值的地方,一旦你算出来值,那就是真正的差距。

于是长期看分差会集中在哪

把两条线延长几年就很清楚了。界面项的缺失率会一路往零收敛,因为它便宜、有工具提醒、竞品做了你很快就会知道。数据项的缺失率会长期卡在一个不低的水平,因为它贵,而且贵得不均匀——同一条准则在不同品类下的成本差一个数量级。

结果就是,一份通用评分表在跑了几年之后,剩下的分差会几乎全部落在“要补商品数据”的那几条上;而补哪些数据、值不值得补,答案又取决于你卖的是什么。

通用清单转了一大圈,最后还是把你逼回了品类特异性,只是它自己不知道,也不会在报告里告诉你。这大概是这一节最值得记住的一句话。

这条分界线为什么在SEO那一侧更明显

把界面与数据这条线搬到技术SEO上,会发现分界比体验那一侧还要干净,因为技术SEO的待办本来就天然分成两类。

模板类的问题——规范标签、跳转链、robots规则、面包屑结构化数据、移动端视口、内链模块——一处代码影响一整批页面,做完一次就不用再做,连Google选规范网址的那套判断逻辑也只需要在模板层对付一次。数据类的问题——标题重复、描述为空、图片缺替代文本、类目描述没写、商品属性字段没填——得一条一条填,填完还会因为新品上架重新出现。

模板类的待办数量随时间递减,数据类的待办数量随SKU数递增。一份季度审计报告如果每次的总条数都差不多,多半是模板类早就清完了,剩下的全是数据类在原地打转。站内那篇讲全站爬虫审计12类问题的文章里,那份问题分类表可以直接拿来做这个二分。

数据类的活为什么总排不进去

数据类的待办有三个特点,凑在一起就注定了它排期困难。第一,成本跟SKU数成正比,估出来的数字总是很大。第二,它没有明确的完成时点,新品一上架又会产生新的缺口。第三,它的执行者通常不是技术,是运营或者内容,而这两个岗位的排期表上从来没有“补数据”这一项。

于是每次排期会上,模板类的活因为“两天就能做完”一直插队,数据类的活因为“得先评估工作量”一直往后挪。半年下来模板类清零,数据类原地未动。

破这个局的办法不是把数据类的优先级调高——调高也没用,它还是估不出完成时点。办法是换一种承诺方式:不承诺什么时候做完,只承诺每周填多少。一周填两百个SKU的净含量字段,四千个SKU二十周填完,这个节奏是可以承诺的,而“什么时候能把商品数据补齐”这个问题永远没有答案。

先补哪个字段,有没有排序办法

有,而且不需要复杂模型。把要补的字段按两个问题排:这个字段能不能变成一个筛选类型或者一个排序维度?这个字段有没有出现在站内搜索的零结果查询里?

两个都是“是”的排最前。这类字段补完之后是立竿见影的——用户本来就在找它,找不到才走的。两个都是“否”的排最后,那类字段补完只能改善页面的完整度,短期看不到任何行为变化。

这个排序办法的好处是它用的全是你自己站上的一手数据,不需要任何行业基准。而在竞争力那一栏里,你本来也拿不到任何行业基准可用。能用来做决定的证据只有两样:你自己的搜索日志,和最懂品类的那个人的判断。站内那篇讲电商用户旅程各阶段的关键词布局的文章里,把用户在不同阶段用的词分层列过一遍,跟这里的零结果分类可以对着用。

全绿的检查报告到底能证明什么,标准自己怎么说?

一个大多数人没意识到的不对称

先问一个看起来很傻的问题:一份检查清单跑完,30项全绿,这能证明什么?

直觉的答案是“证明这30件事都做对了”。但更准确的答案是“证明这30项检查没有发现问题”。这两句话之间的距离,比它看上去大得多,而且这个距离已经被写进了国际标准的正式条款里,写得比任何一篇方法论文章都直白。

红色是确定的,绿色是不确定的。这句话是接下来几节的全部内容,剩下的都是把它拆开看。

W3C的原话:失败项能判定不达标

W3C那份无障碍准则技术说明里,把技术分成三类:充分技术、建议技术、失败项。谈到失败项的时候,它的措辞是这样的:失败项对评估特别有用,因为它们确实指示了不符合。后面跟了一个括号——除非提供了不含这个失败项的替代版本。

“确实指示了不符合”这个说法很硬。一条内容如果命中了某个失败项,那它就是不达标的,不需要再讨论,也不需要更多测试。这是一个终结性的结论。

把这个搬到你的场景里:你的检查清单发现的每一个红叉,都是一个确定的问题。这部分的可靠性是满的,红叉的价值也在这里——它省掉了你去论证“这算不算问题”的时间。像移动端那十个致命错误那样的清单,用途就在这儿:它列的全是命中即确定的失败项。

通过项判定不了达标,同一份文档写得很清楚

同一份文档在讲技术测试的时候,把反方向的话说得同样直白。它先说:这些测试只针对某项技术,它们不是对成功准则符合性的测试。然后列了几条推论。

第一条:没通过某项技术的测试,不必然意味着不符合标准,因为技术是离散的,而且不是必须的。第二条:内容可以用别的方式满足准则。第三条也是最要命的一条——通过了某项技术的充分技术测试,不必然意味着满足了全部成功准则。

最后它给了一句结论:因此,虽然这些技术对评估内容有用,评估必须超出对充分技术测试的检查本身。一份国际标准,在自己的技术文档里明确写下“照着我的技术清单检查是不够的”。这句话值得贴在每一个用审计工具的团队的墙上。

另一份标准把这件事写成了正式的结论映射

W3C还有一份叫无障碍符合性测试规则格式的推荐标准,把这个不对称写成了必须遵守的条款。它规定每条规则都必须说明自己的结论对符合性意味着什么,并且给了两条硬规定。

第一条:只要有任何一个结论是失败,这个被测对象就不满足该项要求。第二条:当所有结论都是通过或不适用时,该项要求可能被满足,或者需要进一步测试。

两句话的语气完全不对等。失败那句用的是确定语气,通过那句用的是“可能……或者需要进一步测试”。

检查结果标准规定的含义确定性
任意一项失败该要求不被满足确定的结论
全部通过或不适用可能被满足,或需要进一步测试不是结论
全部通过(在特定的满足性测试里)该要求被满足仅当这条规则被明确设计成满足性测试

标准还专门加了一条注解:在无障碍指南里,成功准则不会得出通过、失败或不适用,它们只有满足与不满足两种状态。也就是说,测试工具输出的“通过”和标准意义上的“满足”,本来就不是同一个东西。

结论有五种,不是两种

还有一件事,绝大多数审计报表都没做对:这份标准定义的结论有五种,不是两种。

结论含义常见报表里的去向
通过被测对象满足了全部预期绿色
失败被测对象没满足全部预期红色
不适用页面上不存在这条规则的适用对象通常被算成绿色
说不准是否适用、或是否满足预期,测试者无法完全确定通常被算成绿色
未测压根没有对这条规则做过评估通常不出现

标准给“说不准”的定义是:规则是否适用、或者是否全部预期都被满足,测试者无法完全确定。它还给了一个典型场景:适用范围能自动判定,但预期必须人工评估。

这个场景太常见了。工具能自动认出页面上有一个筛选组件,但判不了这个筛选组件的粒度对不对。按标准,这应该输出“说不准”;按大多数报表的做法,这一项要么不出现,要么显示为通过。

你的报表里为什么没有“说不准”这一栏

原因不复杂,做产品的人都懂:一份三栏报表比两栏报表难看。用户打开一看,30项里有6项写着“说不准”,第一反应是这个工具不行。

而把这6项归进通过栏,用户看到的是30项全绿,体验好得多,投诉也少得多。把不确定归进确定,是所有报表在产品化过程中最容易发生也最难被发现的一次失真。它不篡改任何数据,只是少了一栏。

后果是什么?后果是那6个真正需要人看一眼的地方,被一片绿色盖住了。你以为清单已经替你把全站扫了一遍,实际上它替你扫了24项,剩下6项它悄悄跳过了。这跟报表里那些看着正常其实口径已经变了的数字是同一类问题,站内那篇讲Search Console的数字为什么人人都读错的文章里,也有好几个类似的例子。

还有一类做法,标准直接把它移出了符合性

回到那三类技术里的第二类:建议技术。W3C对它的描述值得逐字读一遍——建议技术是改善可访问性的建议做法,它们对某些用户往往非常有帮助,甚至可能是某些用户能够访问某类内容的唯一途径。

“唯一途径”这四个字分量很重。一个国际标准承认,有一批做法对部分用户来说是唯一可行的,然后把它们放在了符合性判定之外。

它给出的理由列了六条,其中三条格外值得看:它们可能无法被测试;在某些情形下它们可能不适用或不可行,甚至可能在提升一部分用户体验的同时降低另一部分用户的体验;它们可能并不直接针对该成功准则本身,而是提供了相关的其他好处。

第二条那句尤其重要。在不同情境下利弊会反转的做法,天然没法写成通用判定项——你要么规定所有人做,伤到一部分人;要么规定所有人不做,伤到另一部分人。标准的处理方式是:都不规定,写成建议,鼓励作者在合适的地方尽量采用。

Google那一侧也是同一个三层结构

有意思的是,一个完全不同的体系用完全不同的语言,长出了同一个结构。Google的搜索基础规范把内容分成三部分:技术要求、垃圾内容政策、关键最佳实践。

技术要求那一节的原话是:技术要求涵盖了Google搜索为了在结果里展示一个网页所需要的最低限度,需要做的技术性事项其实非常少,大多数站点在毫无察觉的情况下就已经通过了技术要求

垃圾内容政策那一节讲的是哪些行为会导致降权或者被完全排除——这是失败项那一侧,命中即判定。关键最佳实践那一节列了七条,全都是方向性的:创作有帮助的、可靠的、以人为本的内容;用用户会用的词并放在显眼位置;让链接可被抓取;去社区里告诉别人你的站。没有一条能打勾。

体系可判定的通过项可判定的失败项判不了的建议项
W3C无障碍技术充分技术失败项建议技术
Google搜索基础规范技术要求垃圾内容政策关键最佳实践
电商体验基准进入评分表的70条失分记录落榜的27条

这个骨架也解释了一类长期争论的来路:E-E-A-T到底算不算排名因素之所以吵不清,就是因为它天生落在第三格里,既不是通过项也不是失败项。三个体系,三套词汇,同一个骨架。这种在互不相干的领域里重复出现的结构,通常说明它不是谁的设计选择,是这类问题本身的形状。

“毫无察觉就通过了”这句话的分量

Google那句“大多数站点在毫无察觉的情况下就已经通过了技术要求”,是这一整节里最该被记住的一句。

它把及格线这个概念的性质说透了:可判定的那一层门槛之所以能被判定,正是因为它足够低、足够通用、足够不挑对象;而足够低的门槛,大多数人不用努力就已经在门里了。你花三个月把技术要求做到满分,跟一个从没想过这件事的站,站在同一个位置。

规范自己还补了一句更狠的:即便一个页面满足了全部这些要求和最佳实践,也不代表Google就会抓取、索引或者展示它的内容。官方文档亲口告诉你,全绿不是承诺。

做技术SEO久了的人对这句话应该不陌生。审计分数拉到满分、各项指标全绿、流量纹丝不动,这个场景太常见了。站内那篇讲技术SEO做到满分却还是不涨的文章拆的就是这一类局面,而这一节相当于给那个现象补了一份来自标准制定方的口供。

标准还规定了必须写出假设,这一条最值得抄

那份测试规则格式标准里,还有一条规定是市面上几乎没有工具做到的:每条规则必须列出任何已知的假设、限制或例外——关于被测对象的、关于测试环境的、关于所用技术的。

标准给这条规定的理由很实在:同一个要求常常有多种说得通的解读方式。它举的例子是,表情符号到底算文本还是算非文本内容,并不是一眼就清楚的事;无论规则作者采用哪种解读,都必须把这个解读写下来。

再往后一节,标准讲规则准确性的时候,把不准确的成因列了四条,排第一的就是:对被测对象做的假设后来被证明不成立。换句话说,标准自己认为,规则出错最常见的原因不是逻辑写错,是前提没对上。

把这条搬到你的检查清单上,就是后面那六件事里的第二件。它的成本是给清单加一列,收益是让每一条的适用边界从隐性变成显性。

误报和漏报,标准是怎么定义的

同一份标准还给了两个定义,措辞很值得留意。误报是:被规则判为失败、但实际上满足要求的对象所占的比例。漏报是:被规则判为通过、但实际上不满足要求的对象所占的比例。

注意这两个定义的参照系——它们都是拿规则的结论跟一次人工审计的结论去比。也就是说,标准默认了一件事:要知道自动化检测准不准,唯一的办法是找人做一次审计,然后对答案。没有别的捷径。

标准接着说,误报和漏报的可能性始终存在,因此规则很可能需要持续维护。它还提到,规则本身的不准确没法靠补例子来解决,因为规则的不准确来自作者没意识到某个边缘情况——你不知道自己不知道的东西,例子也补不出来。

这段话对用工具的人有个很实际的含义:一份自动化报告的可信度,不取决于它检查了多少项,取决于有没有人拿它跟人工结论对过一次。没对过的报告,你不知道它的漏报率是5%还是50%。选工具的时候这一条比功能列表实用得多,站内那篇五大类SEO工具怎么选的文章里,那套按用途分类的思路可以配着这个问题一起用。

还有一件事标准明说了不管

这份标准在讲协调统一的那一节里,有一句坦率得有点意外的话:本格式里没有任何条款阻止规则作者写出与已有规则不一致的规则,也没有要求规则必须有多少个实现,或者必须达到某个准确率水平

换句话说,一条规则符合这份格式,不代表它准。格式管的是规则怎么写、必须写哪几栏,不管这条规则判得对不对。准不准这件事,标准把它交给了具体的社群去约定——它举的例子是,某个做电子书规则的小组可以自行约定“一条规则要有三家机构批准、两个独立实现才算达成协调”。

顺带说一个更彻底的例子。定义“可用性”这个词的国际标准是ISO 9241-11,它把可用性说成是“使用的结果”,然后在适用范围里明确写着:本文件不描述在设计开发或评估中考虑可用性的具体流程与方法。给这个词下定义的那份标准,自己不提供评估方法。这不是回避,是承认评估必须依赖具体的使用情境,而情境是没法写进通用标准的。

这一点对选审计工具的人是个提醒:“符合某某标准”这句话,含金量可能比你以为的低得多。它可能只是说这个工具的规则写法符合格式规范,跟判得准不准是两回事。这类营销话术的拆法,站内那篇讲SEO工具该不该换、怎么用第一性原理判断的文章里给过一套问法。

上线前30项全部打勾,为什么第二个月加购率一动不动?

这个站是做什么的

去年接触过一个做专业美术用品的跨境独立站,卖丙烯和水彩颜料、画笔、画布框,主要打北美、西欧和日本,客单价60到400美元,团队十来个人。这个品类有个特点:买家很专业,业余爱好者和职业画家的比例大概三七开,而那三成职业买家贡献了大部分复购。

他们的商品结构是这样的:一个颜料系列下面有一两百个色号,每个色号有几个容量规格,全站商品数不算多,四千出头,但属性维度特别密。

找过来的原因很朴素:站做了两年,类目页的自然流量一直上不去,想做一轮体验和技术的双重整改。

接手时那份30项清单

整改方案是一份30项的对照清单,体验和技术各占一半,全部来自公开可查的最佳实践。体验那一半基本就是本文前面那8条的扩展版:筛选可以多选、已应用筛选有总览、四种排序齐全、列表项有三张以上缩略图、同一款颜料的不同容量合并成一个列表项、单位价格展示到每毫升。

技术那一半是常规操作:筛选组合的URL做规范标签收敛、分页标记补齐、类目页的结构化数据补全、图片格式和懒加载、核心指标三项达标、内链结构重排。

这份清单没有一条是编的,每一条都能在公开材料里找到出处。执行也很顺利,四个多月做完,30项全部打勾

三个月后的数:一半涨了,一半没动

整改上线之后跟踪了三个月。类目页的自然流量确实起来了,涨幅在两成上下——这部分是技术那一半的功劳,筛选URL的收敛让抓取预算不再被浪费,类目页的收录也稳了。这个结果符合预期。

但另一半没有动。从类目页进来的用户,加购率跟整改前基本一致,波动在正常范围内。也就是说,更多的人来了,但他们在列表页上的行为没有任何变化。

体验那15项全部做完,用户行为一格没动。这个结果当时没人能解释,只能归到“体验改善的滞后性”上,接着往下走。

所有报表都是绿的

那三个月里,任何一份能打开的报表都没有异常。核心指标三项全绿,页面索引报告没有新增问题,结构化数据校验通过,抓取统计正常,站点没有任何一天出现流量或转化的尖峰或断崖。

那份30项清单当然也还是30项全绿——它检查的东西一件都没变坏。

唯一有点异样的是复购率,三个月里掉了不到两个百分点。这个幅度落在这个站正常的季度波动里,当时没有任何人把它当回事。事后回看,那大概率就是账单,只是它长得跟噪声一模一样。

一个日本客户的一句话

转折点来自客服。一个日本买家在邮件里问:你们有没有PB29?

客服在后台搜了一圈,搜不到这个词,回了一句“抱歉未查到该商品”。买家回了一封邮件说,就是群青,你们网站上应该有的。客服把这封邮件转给了运营。

这类专业词跟普通类目词的关系,就是站内那篇讲电商关键词怎么按意图分层的文章里最内层的那一圈——量小、意图极准、竞争极低,偏偏最容易被忽略。PB29是颜料索引号,Pigment Blue 29,也就是群青这个颜料在国际颜料索引里的编号。对职业画家来说,颜料索引号才是这个商品的真名——不同品牌的“群青”配方可能差很多,但只要索引号一样,颜料成分就是一样的。业余爱好者按颜色名买,职业买家按索引号买。

站内搜索日志里躺着六百多次零结果

运营顺手去翻了一下站内搜索日志,翻出来的东西让所有人沉默了:PV19、PB29、PY35、PR122这一类颜料索引号的查询,一个月有六百多次,全部零结果。

为什么零结果?因为颜料索引号只写在商品详情页的正文描述里,是一段自由文本,既没有做成商品属性字段,也没有进站内搜索的索引。搜索引擎能在正文里找到它,站内搜索找不到。

更要命的是筛选。列表页上确实有一个“颜色”筛选,红、黄、蓝、绿……一共12个选项,完全符合“提供五种必备筛选类型”这一条,检查项理所当然地打了勾。但对职业买家来说,12个颜色桶把260个色号压成了12个,等于没有筛选。他要的是PB29,不是“蓝色”。

这个问题在通用清单上占几行

零行。一行都不占。

把那30项逐条拿来对,没有任何一条会因为“颜色筛选的粒度只有12个桶”而亮红灯。“有没有颜色筛选”是可判定的,一个不认识这家公司的人打开页面看一眼就能判;“颜色筛选的粒度对不对”不可判定,他得先知道这个品类的用户是按颜色名买还是按索引号买。

这正是前面那三句判据里第一问答“不能”的那种条目。而这类条目,从来就没有出现在任何一份通用清单上——不是被否决的,是压根没被写进去过。

材料这个问题在里面占几行看这份材料的人
30项整改清单0行运营、外部顾问
核心指标报告0行技术
页面索引报告0行技术SEO
转化漏斗报表0行(只体现为加购率没涨)运营负责人
站内搜索零结果日志1行(“零结果查询”那一行)当时没有人固定看

值得一提的是,服务器日志也不会记录这件事——日志能告诉你谁抓了什么,站内那篇讲日志分析怎么挖爬虫真相的文章拆的就是这一层,但它同样看不见用户搜了什么却什么都没搜到。五份材料,四份是零,唯一有信号的那一份没人看。这不是谁失职——零结果日志在大多数团队的例行动作里根本不存在,它不在任何一份周报模板上。

改法与代价

方案本身很朴素:把颜料索引号做成一个正式的商品属性字段,回填到全部SKU上,做成列表页的一个筛选类型,同时进站内搜索索引,允许搜索时命中。

代价是一个人干了三周。260个色号,每个色号对应的索引号要从供应商的技术资料里核,有些老品牌的旧批次资料不全,得去查颜料索引的公开数据库,个别对不上的还要发邮件问厂商。这三周里没有一行代码是难写的,难的全在核对上。

做完之后的变化很直接:站内搜索的零结果里,颜料索引号这一类基本消失了;列表页多了一个筛选类型,职业买家能从260个色号里直接点到他要的那一个;那六百多次一个月的查询,第一次有了落点。

最扎心的是清单一格都没动

这件事做完之后,把那30项清单重新跑一遍,结果是30项全绿——和改之前一模一样,一格都没变。

改之前是30项全绿,改之后还是30项全绿。中间那三周的工作,在任何一份可打分的材料上都留不下痕迹。如果这个团队的绩效是按清单完成度算的,这三周等于白干。

这句话值得单独拎出来:真正有效的那次改动,不会让你的清单分数动一格。反过来说也成立——如果一次改动能让清单分数明显上涨,那它大概率是在补及格线,而不是在拉开差距。

三个月零报警,是因为它落进了一个正常类目

回头复盘那三个月为什么完全没有预警,答案跟这个问题的表现形式有关。它没有制造任何异常值:页面正常返回、结构化数据合法、速度指标正常、也没有任何一天的转化数据突然掉下来。

它唯一的表现形式是“该发生的事没有发生”——六百多个人搜了一个词,什么都没搜到,然后走了。走掉的人不会在任何报表上留下一行记录,他们只是让某个分母安静地大了一点。

这也是为什么最后是靠一封客服邮件破的局。客服是全公司唯一一个每天都在接触“用户用他自己的词说出你系统里没有的东西”的岗位,而这些词在别的部门的材料里全部是不存在的。

算不出来的那笔账

那三个月到底损失了多少,算不出来,也不打算硬算。六百多次零结果查询各自代表一个真实的人,其中有多少直接关了页面、有多少去了别的站、有多少后来又回来了,站上没有任何数据能回答。

复购率掉的那不到两个百分点是唯一有形的痕迹,但它跟零结果查询之间的因果关系没法证明,只能说时间上对得上、机制上说得通。

把这笔账写清楚是想说明另一件事:这类问题的代价天然是不可测的,因为它的表现形式就是“没有发生”。而任何一个需要靠数据说服才能立项的组织,都会系统性地把这类问题排在后面——不是因为它不重要,是因为它举不出证据。

五个岗位看的是五份材料,没一份是用户屏幕上那页

复盘的时候把当时各个岗位手里的材料摊开看了一遍,结果挺说明问题:技术看核心指标和抓取报告,SEO看收录和排名,运营看转化漏斗和商品销量,客服看工单系统,外部顾问看那份30项清单。

五份材料,没有一份是“一个日本职业画家打开这个类目页时看到的东西”。把用户看到的那一屏和内部系统里的数并排放一次,这个动作三个月里没有任何一个人做过——不是没人想到,是这个动作不属于任何一个岗位的日常。

后来补的动作很土:每周固定拿一个真实的搜索词,从站内搜索框开始,一路走到商品详情页,全程截图。花不到二十分钟,但它是唯一一个能同时看到用户的词和系统的反应的动作。这跟站内那篇讲SEO和CRO在哪里交接的文章里说的那个断点是同一回事:流量交给谁、在哪一屏断掉,两边的报表各自都看不见。

这次踩的坑跟“抽样抽错了”不一样

做审计的人容易把这类事归到抽样问题上:是不是抽的页面不够多、不够随机?这次不是。

那30项检查是在类目页模板上做的,模板只有一个,抽多少个页面结果都一样——每个类目页上都有一个12选项的颜色筛选,抽一个和抽一百个看到的完全相同。问题不在样本量,在这份清单里根本没有“筛选粒度”这一行。

这个区别很重要,因为两种问题的解法完全不同。抽样问题靠改抽样方法解决,比如按模板分组抽、按分支覆盖抽。而清单缺项的问题,改抽样方法一点用都没有——你抽得再准,也只是把清单上那30项在更多页面上验证了一遍。

为什么颜色筛选那一条反而最容易被判成合格

还有个细节值得说。那条“提供五种必备筛选类型”的检查,这个站不但通过了,还是通过得最漂亮的几条之一——价格、评分、颜色、尺寸、品牌,五种一个不缺,甚至还多了容量和系列两种。

一条检查项做得越“齐全”,越不容易引起怀疑。如果当时颜色筛选是缺失的,反而会被标红,反而会有人去问一句“颜料站怎么能没有颜色筛选”,顺着那一问说不定就问到色号上去了。恰恰是因为它齐全,所有人扫过去就过了。

做转化优化的人对这个陷阱应该更熟,站内那篇讲高转化电商站的90天打法的文章里也强调过,最该测的往往不是缺的那块,是已经做了但做得不对的那块。这大概是可判定清单最隐蔽的一个副作用:它把注意力引向缺失项,而缺失项不一定是问题所在;真正的问题常常藏在那些“做了、而且做得很齐全”的条目背后。

换个品类,同样的坑长什么样

这个案例的形状是可以迁移的。判据就一句:你的品类里,专业买家用来定位商品的那个标识,是不是一个正式的商品属性字段?

紧固件是标准号加规格代码,轴承是型号,电子元件是料号,汽配是原厂件号加适配车型,医疗耗材是规格加型号,工业润滑油是黏度等级。这些标识在各自的行业里就是商品的真名,而在很多站上它们只是商品描述里的一段文字。

能不能按专业买家的方式定位商品,本身也是信任的一部分——站内那篇讲独立站信任怎么一层层建起来的文章里,那种“懂行的人一眼看出你也懂行”的信号,比任何资质展示都管用。检查方法只要两步:拿三个这样的标识去自己的站内搜索框里搜一遍,再去列表页看看能不能按它筛。两步都通过,这一项就没问题;有一步不通过,去翻零结果日志,看看有多少人已经这么搜过了。整个过程十分钟,不需要任何工具。

不加预算、不排开发,这周能先把哪几件做了?

六件事的总览

下面这六件都不需要买工具、不需要加埋点、不需要占用开发排期,全部是这周就能开始的动作。排序按“拿到成本”和“结论能不能直接变成动作”两维相乘,不是按重要性。

顺序动作拿到成本产出能否直接变成动作
第一件把站内搜索的零结果查询按周导一次十分钟能,词就是待办
第二件给每条检查项补一个“假设”字段两小时能,填不出的那几条当场就是问题
第三件给报表加第三栏“说不准”一小时能,落进这栏的就是要人看的
第四件把清单按三句判据拆成两栏半天不能直接,需要下一步讨论
第五件数一次待办里改界面和改商品数据各占多少一小时能,直接影响排期方式
第六件让最懂品类的人单独写五条外人判不出的事半小时(别人的)能,写出来就是第二栏的种子

第一件:把站内搜索的零结果按周导一次

为什么排第一

它排第一有点反直觉,因为它看起来最琐碎。但它是这六件里唯一一份用户用他自己的词,说出你系统里没有的东西的材料。所有其他材料——清单、报表、竞品对标、行业基准——用的都是行业的词,不是你的用户的词。

零结果查询这份数据在Shopify、WooCommerce、Magento的后台里都能直接看,接了站内搜索服务的更是现成的。导出成本基本为零,绝大多数团队没看,只是因为它不在任何一份周报模板上。

看的时候看什么

看词,不看量。一个词一个月只被搜了三次,但它是一个你从来没听说过的行业术语,价值远高于一个被搜了三百次的错别字。零结果日志的用法不是找热门词,是找陌生词。

具体做法:每周导一次,把词分成三类。第一类是你确实没有的商品,这是选品线索。第二类是你有但叫法不同,这是同义词和属性字段的缺口,也就是前面那个案例踩的坑。第三类是拼写错误和无意义输入,直接忽略。

第一类的处理方式跟选品有关,第二类才是本文说的那种清单外问题,处理起来常常还会顺手带出一批没有入口的页面,跟站内那篇讲孤岛页面怎么定位和修复的文章能接上。坚持四周,第二类那一堆通常就能看出形状——它们往往集中在同一个属性维度上,而那个维度大概率是你这个品类的专业买家真正用来挑东西的那一维。

第二件:给每条检查项补一个“假设”字段

这个做法是从标准里搬来的

前面提到的那份测试规则格式标准,有一条硬性规定:每条规则必须列出任何已知的假设、限制或例外,包括对被测对象的假设、测试环境的假设、所用技术的假设。标准还补了一句:如果确实没有已知假设,这一栏可以是空的,但这一栏必须存在。

它甚至举了一个例子:一条通过检查CSS属性来部分测试对比度的规则,应当声明它只适用于可以用CSS设置样式的HTML文本内容。这句声明的作用是——用它的人一眼就知道这条规则在哪里会失效。

怎么落到你的清单上

做法就一句话:在清单每一条后面加一列,填一句“这一条成立的前提是____”。不设格式,不做校验,填一句人话就行。

第一次填的时候会遇到三种情况。一种是前提很清楚,比如“提供尺码筛选”的前提是这个品类的商品有尺码差异;一种是前提填出来之后发现根本不成立,比如某条从服装案例抄来的规则,前提是筛选类型不超过八种,而你的类目有十四种;还有一种是填不出来——这一条你说不清它为什么在这儿。

第三种是最有价值的发现。填不出前提的条目,通常是从别处抄来的,抄的时候连着上下文一起丢了。这类条目在一份用了两年的清单里,比例往往不低。

第三件:给报表加第三栏“说不准”

通过、不通过之外,加第三栏:说不准。定义直接用标准那句——是否适用、或者是否满足要求,判的人无法完全确定。

规矩只有一条:不许把说不准算成通过。这一条是整个动作的全部要害,因为默认行为就是把不确定归进确定,而且这个动作是无意识的。

第一次填完会看到什么

第一次让团队按三栏重填一份走查表,落进第三栏的通常有一到两成。这个比例第一次看到会有点难受,但它本来就在那里,只是以前被涂成了绿色。

更有用的是看这一到两成落在哪几条上。它们通常高度集中——不是均匀分散在30项里,而是扎堆在其中四五条上。那四五条就是你这份清单和你这个品类之间摩擦最大的地方,值得单独拉出来讨论一次。

第四件:把清单按三句判据拆成两栏

拿前面那三句判据,逐条过。第一问答“能”且第二问答“不取决于”的,进及格线栏;其余的进竞争力栏。有争议的条目先放竞争力栏,讨论过再挪回去。

拆完之后大概率是这个分布:及格线栏占八成上下,竞争力栏不到十条,有些团队第一次拆完竞争力栏是空的。竞争力栏为空不代表你没有这类问题,代表写清单的时候这类问题一条都没进来。这种情况下,第六件事就变成了必做项。

拆完之后干什么

两栏的处理方式完全不同。及格线栏的正确做法是尽快清零,然后停止讨论——它没有商量余地,也没有优先级排序的必要,缺哪条补哪条,补完就不要再拿到会上说。

竞争力栏的正确做法相反:每一条都要吵一次,吵的内容是这条对我们这个品类到底成不成立、成立到什么程度、值不值得为它花三周。这一栏的条目数少,但每一条的讨论时间应该是及格线栏的十倍。

这件事排第四而不是第一,是因为拆完之后紧接着的那句话是“然后呢”。它是一个更准确的分类,但分类本身不产出动作,得靠后面几件事往里填东西。

第五件:数一次待办里改界面和改商品数据各占多少

怎么数

把当前的待办清单打开,逐条问一句:修这一条,改的是代码,还是要往商品数据里补东西?两类各记一个数,一小时能数完几十条。

判据只有一句:这件事改完之后,需不需要有人挨个商品去填一遍?需要,就是数据类;不需要,就是界面类。中间态很少,遇到含糊的按数据类记,因为数据类的成本估计更容易被低估。

数出来之后怎么用

两类的排期方式完全不同。界面类是有限的,一个迭代能清掉一批,清完就没了,适合按批推进,也适合承诺时间点。数据类是持续的,成本跟SKU数成正比,适合定一个每周填多少的节奏,不适合承诺什么时候做完。

把两类混在一个待办清单里按优先级排,是很多团队的排期总是失控的原因——界面类的条目会因为“做得快”一直插队,数据类的条目会因为“看不到头”一直往后挪,而真正的差距全在数据类那一侧。

补完字段之后还有一步顺手能做:新增的筛选类型和属性值往往能直接变成新的内链入口,站内那篇讲内链架构怎么搭的文章里那套主题集群的做法,跟新补出来的属性维度是天然配套的。数完之后还有个副产品:如果你的待办里数据类占了七成以上,那说明界面类基本清完了,你已经站在及格线上了,这时候再买一个新的审计工具、再加二十个检查项,边际收益接近于零。

第六件:让最懂品类的人写五条外人判不出的事

找谁写

不一定是运营。在很多团队里最懂品类的是客服,因为他们每天在读用户用自己的词提的问题;也可能是采购,因为他们知道这批货和上批货差在哪;偶尔是仓库的人,因为他们见过所有实物。

要求很简单:半小时,写五条“一个不了解我们卖什么的人,肯定判不出来的事”。明确要求不许参考任何清单——一参考就会被清单的措辞带跑,写出来的还是那些可判定项。

写出来的东西长什么样

通常是这种形态:职业买家按颜料索引号找货,不按颜色名;这个尺码表的胸围是平铺尺寸不是围度,欧洲客户会理解错;同一个型号的插头制式必须能筛,不然澳洲客户会买错;这批货的净含量标注单位跟上一批不一样。

这些话一条都不会出现在任何一份公开清单上,但每一条都可能直接对应一个筛选类型、一个属性字段或者一段文案,而且每一条都可以拿去做一次对照测试验证。它们就是竞争力栏的种子

这件事的成本是别人的半小时,产出是你花多少钱都买不到的东西——因为它不在任何外部材料里,只在这个人的脑子里,而且从来没有人正式问过他。

卡点挂在哪一张表单上

光做这六件是不够的,它们是一次性动作,做完三个月就会松掉。得找一个每次都会被填的地方挂一个钩子,让这件事自己维持下去。

挂在需求评审或者上线工单模板上,加一行必填:这次改动,一个不了解我们卖什么的人,能不能判断它做对了?能/不能。不设选项校验,不做统计强制,判定规则只有填了和没填。

这一行的成本是每次五秒钟。它的副产品才是最值钱的:三个月之后,这一栏的“不能”那一档里积攒下来的改动,就是一张持续更新的、免费的品类知识地图。而如果某个“不能”的改动是由一个完全不懂品类的人独立做完并上线的,那一条最值得复盘——它意味着有人在没有前置知识的情况下替品类做了决定。

这类跨部门的小钩子怎么设计才不被绕过,站内那篇讲SEO怎么推得动跨部门协同的文章里有更细的写法,核心思路是一样的:把判断塞进别人本来就要填的表单,而不是新建一个流程。

这套做法的四条边界

边界具体说明
不降低修问题的成本它只降低“发现清单外问题”的成本;发现了之后该花三周还是三周
竞争力栏天然没有基准这一栏的条目不会有行业百分位、不会有对标数据,别指望拿它写汇报
及格线栏是必要不充分它不是不重要,漏一条实打实掉分;它只是做满了也不会赢
品类知识会过期新品类、新用户群、新渠道都会让第二栏失效,靠上面那行必填自更新,不靠定期盘点

第二条尤其要提前说清楚。竞争力栏的条目没法用“行业里多少比例的站做到了”来论证,因为压根没人统计过。你只能用自己的一手材料论证——零结果日志里那六百多次查询,就是这类论证唯一能用的证据形式。

口径迁移要提前说的一句话

最后一件事,是关于怎么跟老板汇报的。拆成两栏之后,待办条目数不会变,一条都不会少。变的是每周例会上两栏各占多少时间。

第一次拆完常见的分布是:条目数上及格线栏占八成,会议时间上及格线栏也占八成。两个八成看起来很匹配,问题恰恰在这个匹配上——条目数决定了会议时间,而条目数是由工具厂商往清单里加检查项的速度决定的,跟你的业务价值没有任何关系。

动手之前把这句话说出来,比事后解释好得多:接下来我们要把两栏的时间分配拆开,及格线栏以后不上会、只报完成度,省下来的时间全部给竞争力栏那不到十条。等报表出来再解释,听起来全像找补。

小站和大站的做法要不要分开

这六件事里,有几件跟站的大小基本无关,有几件有关。零结果日志那一件,几百个商品的站也该做,甚至更该做——商品少的时候,用户搜不到的东西更容易是你确实该补的品类。让最懂品类的人写五条那一件,也跟规模无关,团队越小反而越好凑。

有关的是拆两栏和数界面数据比例这两件。清单只有十来条的时候,拆成两栏这个动作意义不大,因为十来条本来就能一次讨论完;等清单长到三四十条、每周例会开始讨论不完的时候,拆栏才开始产生价值。

还有一个跟规模有关的判断:如果你的站商品数不到一千,数据类的待办其实不算大工程,硬啃一遍是划算的;商品数上万之后,数据类必须换成按周填的节奏,否则永远开不了工。这一点跟内容资产的清理逻辑很像,站内那篇讲上千篇旧内容怎么决定留改删的文章里,那套按批处理的做法可以直接借用。

这套做法跟现有的审计流程冲不冲突

不冲突,它加的是一列和一栏,不动原有的任何一条。原来的检查项一条都不用删,原来的工具一个都不用换,原来的走查频率也不用改。

评论、问答这类由用户产生的内容也能挂进同一套动作里,站内那篇讲商品评论怎么做结构化和联动的文章里那些真实用词,跟零结果日志是同一类材料。变的只有三件事:每条检查项后面多了一个假设字段,报表多了一栏说不准,清单多了一个分栏标记。这三个改动加起来,一个熟悉清单的人半天就能做完,而且做完之后清单的外观几乎没变,交接给别人也不需要重新培训。

这是有意为之的。凡是要求推翻现有流程的方法,落地率都很低;能挂在现有流程上的小改动,才有机会活过三个月。做外部审计交付的人尤其要注意这一点——你交出去的东西如果要求对方改工作方式,多半会在第二个月被搁置。站内那篇讲买站之前该查清楚什么的文章里,那份尽调清单也是按“能挂在现有交接流程上”来组织的。

三个月后回头看什么

做完这六件事,三个月之后有三个数值得回头看一眼。

第一个,零结果日志里第二类词(有货但叫法不同)的数量有没有下降。下降说明属性字段和同义词补对了;没降说明补的方向不对,得重新看词。

第二个,工单模板里“不能判断”那一栏的占比。这个数不需要下降,它稳定在一到三成是健康的;如果它长期是零,说明大家在敷衍这一栏,或者说明所有改动确实都在及格线上打转。

第三个,例会上竞争力栏的讨论时长。这是六件事里唯一一个直接冲着组织行为去的指标,也是最容易反弹的一个。及格线栏的条目有明确的完成度,天然容易上会;竞争力栏的条目只有争论,天然容易被跳过。三个月后如果它又被挤没了,说明前面那个“提前说清楚”的动作没做够,需要再说一次。

常见问题解答

说清单里只剩及格线,是不是等于说通用最佳实践没用?

不是,正好相反。及格线是必要条件,漏一条会实打实地掉分:没有已应用筛选总览,用户就是会不知道自己筛了什么;缺了按销量排序,一部分用户就是找不到该看哪个。这些问题该修,而且要尽快修完。

它的性质是做完之后不再产生差异。所有同行迟早都会做完,因为它便宜、明确、有工具提醒。所以正确的态度是把它当成一次性的清零任务,尽快做满,然后从每周的议程上撤下来,把讨论时间腾给那些外部替你判不了的条目。把及格线当成竞争力来经营,才是真正的浪费。

怎么判断一条检查项是不是“外部可判”,有没有更简单的办法?

有一个更快的土办法:把这条检查项的描述抄下来,去掉里面所有跟你公司、你品类有关的词,看它还成不成立。“提供按销量排序”去掉之后还成立,是及格线;“颜料商品要能按颜料索引号筛选”去掉之后就没意义了,是竞争力栏。

另一个办法是看措辞。写着“必须”“确保”“不得”的,通常是可判定项;写着“视情况”“根据品类判断”“建议评估”的,通常是不可判定项。一份清单里如果一条条件性措辞都没有,多半是写的时候把判不了的过滤掉了,不是你的业务没有这类问题。

我们没有站内搜索,第一件事怎么做?

没有站内搜索的站,替代材料有三份。第一份是客服工单里用户提问用的原词,尤其是那些客服要回过头去问同事才能回答的问题。第二份是Search Console里那些有曝光但点击率极低的查询词,它们常常是“搜索引擎认为你相关、用户点进来发现不对”的信号。

第三份是退货和售后原因里的自由文本。做时尚这类季节性强的品类,还可以配上搜索需求的趋势预测一起看,找出哪些词是今年新冒出来的。这三份材料的共同点跟站内搜索日志一样:都是用户用自己的词说话,而不是用你的类目结构说话。不过还是建议尽快把站内搜索装上,它是这三份里唯一一个能持续、低成本产出的。

那27条落榜的准则,能不能想办法弄到手?

订阅了就能读到,它们并没有被藏起来。但读到之后你会发现,这件事的价值没有想象中大——那27条对你的意义,跟对另一个卖完全不同东西的站的意义是不一样的,而报告不会替你做这个换算。

更划算的做法是反过来:先用那六件事把你自己的竞争力栏建起来,写出十条左右“外人判不出来的事”,然后再拿任何一份外部材料去对。有了自己的栏目之后,外部材料才知道该往哪儿放;没有的时候,外部材料只会变成又一份没人看的文档。

“说不准”这一栏加上之后,老板会不会觉得团队在推卸责任?

会有这个风险,所以加这一栏的时候得配一句话:落进这一栏的每一条,都会指定一个人在一周内给出结论,而不是永远挂着。说不准是一个中间状态,不是一个终点状态。

这跟服务器日志分析里那些“暂时判不出来源”的请求是同一种处理方式,站内那篇讲日志里的爬虫怎么验真身的文章里,验不了的那部分也是单独一栏而不是默认放行。把它跟解决时限绑在一起之后,它的性质就从“我们不知道”变成了“这几条需要一个懂业务的人花二十分钟”。实际执行下来,第一次填出来的那一到两成,通常两周之内就能全部落定,而且落定过程本身会暴露出团队里品类知识分布不均的问题。

只有几百个商品的小站,值不值得做这一套?

六件事里有四件值得做,两件可以推迟。零结果日志、假设字段、说不准一栏、让最懂品类的人写五条,这四件跟站的大小没关系,成本也都在小时级别。

可以推迟的是拆两栏和数界面数据比例。清单只有十几条的时候,拆栏的收益不明显,因为十几条本来就能一次讨论完;界面和数据的比例在小站上也没什么排期意义,因为几百个商品的数据补一遍不算大工程,硬啃一遍就过去了。等清单长到三四十条、例会开始讨论不完的时候,再补这两件。

这套判据会不会被用来给不做事找借口?

确实可能,而且这是它最容易被滥用的方式:把该做的及格线项说成“那只是通用清单上的东西”,然后一件都不做。所以有必要把话说死——及格线栏的正确处理方式是尽快清零,不是降低优先级。

判据的用途是分配讨论时间,不是分配是否执行。及格线栏的条目照做不误,只是做完就不要再拿到会上反复汇报;竞争力栏的条目才需要吵。如果一个团队用这套判据的结果是及格线也没做完、竞争力栏也是空的,那问题不在判据上。

外部审计报告还有没有必要买?

有必要,但要清楚它能给你什么。外部审计能高效地把第一栏扫一遍,这件事内部做往往做不干净——自己人对自己的站有盲区,看不见那些已经习惯了的问题。像抓取报告里那五类问题网址的排查,或者结构化数据的实体图谱怎么组织这种活,外部做通常又快又准。这是花钱买外部视角最划算的部分。

不该期待的是第二栏。外部机构不了解你的品类,给不出那些需要业务知识才能判的结论,这不是他们不够专业,是这类结论天然产不出来。合理的做法是:第一栏买外部的,第二栏自己建,两边都别指望对方。如果一份外部报告里出现了大量关于你品类的具体判断,反而要多留个心眼,看看这些判断是基于你的数据,还是基于对方的经验类比。

权威参考资料

分享到
标签
版权声明

本文标题:《商品列表页优化的97条准则,只有70条会变成分数》

本文链接:https://zhangwenbao.com/product-list-guidelines-scoring-selection-bias.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交