行业标准把多数成年人算成大码,可只有24%的女性会这样描述自己

行业标准把多数成年人算成大码,可只有24%的女性会这样描述自己
张文保 70 分钟阅读 1,890 阅读
本文目录
  1. 为什么用户在你的体型筛选器前面停了三秒,然后什么都没点?
  2. 三个数,三个位置,同一件事
  3. 这次翻译,是用户免费替你做的
  4. 这篇不谈什么
  5. 为什么这块地方值得单独拆一次
  6. 先说清楚这套东西能搬到哪儿
  7. 只有24%的女性说自己穿大码,而尺子量出来是大多数,这中间差了什么?
  8. 先看看那把尺子量出来是多少
  9. 因为这两条线,画线的判据根本不一样
  10. 被点名的4个词加起来只有92%
  11. Google那份商品数据规范,给这件事装了个默认值
  12. 顺手说一句怎么用这条
  13. 同一个概念,一份规范切成6格,另一份切成17格
  14. 格子数是可以商量的,你的筛选器把它当成了事实
  15. 那个叫壮硕的格子,是一个委婉语被写成了永久标识符
  16. 同一个字段,同时在给商品分段和给人分类
  17. 顺手说说尺码值本身那几条硬规矩
  18. 世界上到底有没有一张公共的尺码对照表?
  19. 第一部分只管怎么量
  20. 第三部分给了方法论,但表格里的数只是示例
  21. 所以那一步到底归谁管
  22. Baymard举的那个例子,值得贴在工位上
  23. 还有一份标准,专门教你算自己漏掉了多少人
  24. 这条注释背后的那件事
  25. 这套标准里,有三样东西你可以直接拿走
  26. 你的商品数据里,为什么只有衣服的尺寸,没有人的尺寸?
  27. 规范里一直有两个字段,你只填了一个
  28. 评论区其实是一个用户自建的字段
  29. 模特那一行小字,就是把这个字段填在了图片旁边
  30. 把这个字段补上,成本比想象中低
  31. 那为什么这个字段几乎没人填
  32. 48%的人翻评论是为了找尺码,这说明评论区在替谁干活?
  33. 评论区在这个品类里被征用了
  34. 合身子评分:一个被验证的组件
  35. 为什么一条动了,另一条没动
  36. 评论里那些字,是你能拿到的最便宜的一手材料
  37. 评价表单该怎么加那两个字段
  38. 还有两条跟评论有关的硬数据,顺手记下
  39. 38%的人说自己来得不够勤,这是一条理由还是一次预测?
  40. 会员制要求用户先替你算一道题
  41. 服饰这个品类,把这道题的难度又抬了一档
  42. 那三条理由,对应三种完全不同的破法
  43. 入会弹窗弹在哪一刻,比弹什么更重要
  44. 这四个数在你自己站上怎么复现
  45. 真要动手,这四层清单的失败方式各不相同
  46. 第一层:入口,别让整条路径挂在一次认领上
  47. 第二层:判断,把用户做那次换算需要的材料给全
  48. 第三层:兜底,翻译失败的时候接住他
  49. 第四层:数据,让机器那一侧也对得上
  50. 还有一条不在任何清单里的:尺码选择器本身用按钮
  51. 顺序建议:先做三条,别一次上完
  52. 四层里最容易被整层跳过的是兜底层
  53. 不加一行埋点,先算哪五个数?
  54. 一、默认档占比
  55. 二、尺码表打开率与打开后的转化差
  56. 三、评论里的尺码词密度
  57. 四、同款多尺码同单率
  58. 五、入会率按下单次数分层
  59. 把第二个数和退货率交叉,会得到一张四格表
  60. 第一次跑出来大概是什么样
  61. 顺带说一句:退货原因里那个“尺码不合”,别太当真
  62. 一个泳装站照着做完了,为什么第三个月自然流量掉了一截?
  63. 一个泳装站,四周做完,两个月四个数全绿
  64. 第三个月,自然流量掉了一截
  65. 预警响过,而且被正式写进了文档,只是用的是另一种语言
  66. 第二层:同一个词,谁先说出口决定了它的性质
  67. 第三层:为什么后台曲线上看不出来
  68. 后来改了三处
  69. 如果重来一次
  70. 所以这些改动该怎么分堆
  71. 三档投入与三条停手信号
  72. 做实验的三个坑
  73. 两周排期,可以直接抄
  74. 立项怎么说,第一次会请谁
  75. 谁最该先做,谁可以往后放
  76. 季度复查,半小时三件事
  77. 常见问题解答
  78. 大码这类独立入口,到底该不该保留?
  79. 尺码表该给成衣尺寸还是身体尺寸?
  80. 版型那一栏不填,实际会有什么后果?
  81. 引导用户在评价里填身高体重,真会有人填吗?
  82. 做合身子评分是不是非得换一套评论系统?
  83. 退货原因里尺码不合占比很高,是不是该先改尺码表?
  84. 多市场站的号型换算,做到哪一步算够?
  85. 权威参考资料

摘要:一份针对1922名美国网购者的调查里,只有24%的女性和14%的男性说自己穿大码,而通行的服装号型标准把大多数美国成年人都划在了那一档里。差出来的这一大块不是统计误差,是两套定义在同一个词上打架:标准按尺寸划线,人按印象划线,而你的导航、筛选器和文案全建在标准那一侧。

同一份调查里还有两个数:38%的人说自己来得不够勤,所以不加入会员;48%的人翻评论是为了确认尺码合不合身。三个数看着不相干,其实是同一件事在三个位置上冒出来——用户要用你的站,得先把自己翻译成一个符号,而这次翻译是他免费替你做的,做错了账算在你头上。本文把这段翻译拆开,讲清标准管到哪一层、商品数据里少了哪个字段,以及五个不用加埋点就能开始收的数。

为什么用户在你的体型筛选器前面停了三秒,然后什么都没点?

他不是没看见,也不是不会用。他是被要求先对自己下一个判断,而这个判断的定义写在一份他从来没见过的文件里。

先说一个我在客户站上反复看到的画面。

一个女性用户点进连衣裙类目,左边筛选栏第一组就是尺码,下面还有一组写着体型。她把鼠标停在那组体型上,停了两三秒,什么都没点,直接往下滚,开始一件一件翻商品图。

热力图上这个动作特别常见,常见到我们一开始以为是筛选器做得不够显眼。改了颜色,加了展开态,把它顶到第一屏。点击率涨了一点点,然后就不动了。

这类改完没反应的情况,通常说明你调的不是那个变量。购买路径上那些看不见的摩擦力那一篇里列过一批类似的例子:真正卡住人的东西往往不在你正盯着的那个控件上。

后来才想明白:她不是没看见,也不是不会用。那组筛选项要求她先回答一个问题——你属于哪一类人。而这个问题,你的页面从来没敢明着问出口,它只是把答案选项摆在那儿,等她自己认领一个。

三个数,三个位置,同一件事

这件事最近有了一份不错的量化材料。Baymard针对服饰与配饰品类的定量研究调查了1922名美国网购者,从中挑了3条高层结论。这3条我读下来,说的是同一件事的3个发生地:

  • 24%的女性、14%的男性自认穿大码,而通行的号型标准把大多数美国成年人都归在这一档(尺码14及以上)。
  • 38%的人不加入会员,理由是自己在这家店买得不够勤——这个理由排在担心邮件太多(31%)和觉得回报不值(26%)之前。
  • 48%的人翻评论是为了看尺码准不准、合身细节如何,排在质量与耐久(43%)、问题与投诉(40%)、性价比(36%)之前。

报告把这3条分别归到了导航、会员和评论3个模块底下,各给了一段建议。这没错,但把它们分开看,会漏掉最要紧的那层关系。

把它们并排放在一起,你会发现每一条的主语都是同一个动作:用户在用你的站之前,先要对自己做一次判断,然后把这个判断压缩成一个你的系统能处理的值。

第一条是把身体压缩成一个体型标签。第二条是把未来的购买频次压缩成一个够不够勤的判断。第三条是他不信任你给的那把尺子,跑去找别人的身体当参照。

这次翻译,是用户免费替你做的

你的数据库里存的是符号:S、M、L、38、Plus、Petite。你的筛选器、导航路径、推荐逻辑、库存扣减,全都建在符号这一侧。

而站在页面另一头的是一个身体,一段购物史,一堆说不清的偏好。从身体到符号,中间必须有一次翻译。这次翻译没有写进任何一份需求文档,因为它压根不发生在你的系统里——它发生在用户脑子里,你既看不见,也不负责,可它错了的账全部算在你头上。

退货、弃单、加购不下单、会员弹窗被关掉,这些是账单。翻译失败是发生现场。

而账单和现场之间隔着好几个部门,这就是为什么它很难被归到一起看:退货算履约的账,弃单算转化的账,会员弹窗关闭率算增长的账。三张表上没有一栏叫做用户没能把自己描述清楚。

这篇不谈什么

为了不和站内已有的几篇撞车,先把边界划清楚。

本文不谈退货率整体怎么降,从包装到物流那一整套在跨境电商退货率的预防体系里;也不谈会员体系本身怎么设计、积分怎么分层怎么算,那是DTC会员忠诚度体系的完整设计那一篇的活儿。

不谈评论区怎么做SEO、怎么出星标、怎么防刷,这几块分别在电商产品评论的结构化数据实操WooCommerce产品评论的审核与防刷里。

也不谈筛选器选完之后怎么把已选项回显给用户,那是集合页已选筛选项的概览设计那一篇;筛选URL怎么治理、会不会撑爆抓取预算,看分面导航的抓取预算治理

本文只做一件事:把用户脑子里那次自我归类,和你系统里那个枚举值,摆在一起看,看它们在哪里对不上,以及对不上的成本落在谁身上。

为什么这块地方值得单独拆一次

因为它是全站唯一一个把用户本人当成输入数据的地方。

价格、库存、运费、时效,这些字段描述的都是货或者服务。只有尺码这一栏,描述的是站在屏幕前的那个人。你在别的字段上填错了,是商品信息不准;在这一栏上让用户填错了,是他对自己的判断被你的枚举值否掉了一次。

这两种错的性质完全不同,而报表上它们长得一模一样,都叫加购未支付。

先说清楚这套东西能搬到哪儿

这篇讲的是服饰,但要求用户先给自己归类才能往下走的地方,远不止服饰一处。翻一下你自己的站,下面这些位置的结构是一样的:

  • 美妆站问你的肤质是干性、油性还是混合性;
  • 鞋类站问你的脚型是宽楦还是标准;
  • 汽配站要你先选车型年份,选错整个目录都不对;
  • B2B站的询盘表单里那个行业下拉框,几十个选项里没有一个是他真正干的那行;
  • 软件站问你是新手还是进阶用户,而没人愿意在陌生人面前选新手。

这些位置的共同点是:它们都要求用户先把自己编码成一个值,才肯把内容给他看。而编码规则是你定的,用户既没参与制定,也查不到定义。本文后面所有的判断方法,在这些位置上都通用,只是数据换一套。

只有24%的女性说自己穿大码,而尺子量出来是大多数,这中间差了什么?

一把尺子和一群人给出了两个差很远的答案,而它们描述的确实是同一批人。

先把这一组数摊开。女性受访者里,说自己按标准码买的占48%,大码24%,娇小16%,矮个4%。男性那一侧报告只点了两个数:标准码63%,大码14%。

而通行的号型标准,把大多数美国成年人划在尺码14及以上,也就是行业口径里的大码那一档。

换句话说:一把尺子量出来说超过一半,一群人自己说是24%。这两个数不可能同时描述同一件事,可它们描述的确实是同一群人。

先看看那把尺子量出来是多少

美国国家卫生统计中心把20岁以上成年人的实测体格数据挂在身体测量的公开统计页上,是实际量出来的,不是自报的:

指标成年男性均值成年女性均值
身高68.9英寸(约175厘米)63.5英寸(约161厘米)
体重199.0磅(约90公斤)171.8磅(约78公斤)
腰围40.6英寸(约103厘米)38.5英寸(约98厘米)

拿女性那一列去对任何一张常见的成衣号型表,38.5英寸的腰围落在哪一档,基本没有悬念。

所以数字这一侧没有争议。有争议的是,为什么一个腰围38.5英寸的人,会在问卷上勾“标准码”。

因为这两条线,画线的判据根本不一样

号型标准画线用的是尺寸,一个可测量、可复现、跟人的感受无关的量。

人画线用的是参照系:我妈是什么码,我高中是什么码,我常买的那家店我穿什么码,我朋友们大概什么码。这条线是相对的,会随着参照系漂移,而且它带着一层没人愿意明说的东西——认领一个标签,等于承认一件事。

这里要说清楚一点,免得被读成心理学讨论:这不是用户在自欺欺人,也不需要你去纠正他。报告里那句话说得很克制:这不只是标签偏好问题,不认同某个类目名的人,更不容易找到、也更不容易走完建立在那个词上的导航路径、筛选项和文案。

翻译成运营语言就是一句:你把一整条发现路径挂在了一个词底下,而这个词有相当一部分目标用户不认领。路径本身没坏,是入口的钥匙孔跟钥匙对不上。

被点名的4个词加起来只有92%

这里有个容易被跳过的细节。女性那4个数——48、24、16、4——加起来是92。剩下的8%落在这4个词之外,报告没有给他们名字。

8%听着不多。放到一个月10万UV的站上,是8000个人,他们在你的体型筛选组里找不到一个能代表自己的选项。

而这8%在你的后台里长什么样?他们看起来跟所有“看了没筛选”的人一模一样。你的筛选器不会记录“我看了一圈没有我这一格”,它只记录点击。没有一个控件会汇报自己没被点的原因。

这个盲区不是筛选器独有的。用户扫完一屏商品一个都没点开这件事在报表里等于没发生那一篇讲的是同一类失明:你的日志只记录发生过的动作,而拒绝是一种不产生动作的动作。体型筛选组里没有他那一格,跟一屏商品里没有一件他想点的,在数据上是同一种沉默。

Google那份商品数据规范,给这件事装了个默认值

把视线从用户挪到你的商品库,同一条线在那边还有一次。

Google的商品数据规范里有一个专门描述版型的字段,叫size type。它的官方说明页写得很直白:这个字段用来描述商品的版型,取值只能从6个里挑——常规、娇小、大码、高个、加大、孕装。

紧接着的一句才是重点:如果你不给这个字段填值,系统会按常规来处理。同一页还写着,这个信息用来生成筛选器,让顾客缩小搜索结果。

把这两句和上面那组调查数据叠在一起看,一个挺有意思的结构就出来了:

位置缺省行为结果
商品这一侧不填size type,按常规处理没人专门标注的商品,全部堆进常规档
人这一侧不认领任何标签,默认自己是标准码没人专门认领的人,全部堆进标准档

两侧的缺省值恰好是同一个词。于是这个词会被双向超额填充:商品被默认成常规,人也默认成常规,而真正需要被区分开的那部分商品和那部分人,被从两头同时挤进了同一个桶。

48%和63%这两个数,我不觉得是一份分布,我觉得是一份引力报告。默认值是唯一一个不需要主动认领、不需要承认任何事、不需要多点一下的选项。别的选项都要付出一点什么,只有它免费。

顺手说一句怎么用这条

如果你的商品feed里size type这一栏大面积是空的,那你在Google那一侧的大码筛选里根本不出现。不是排得靠后,是不在结果集里。

这一栏的填写成本极低,通常是一次批量更新的事。但它得有人想到去填——而它长得实在不像一个会影响流量的字段,更像一个凑数用的选填项。数据规范里最贵的字段,往往长得最像可有可无的那一个。

商品数据这一侧还有别的字段在悄悄决定曝光,比如分类属性最近的那次变动,写在商品结构化数据新增分类属性那一篇里;平台侧的排序逻辑则在Google购物排序的6个因素那一篇。这两条跟本文是同一个方向:你在平台那一侧的可见性,一大半由几个没人爱填的字段决定。

同一个概念,一份规范切成6格,另一份切成17格

格子数不是观察出来的,是切出来的。既然是切出来的,那就可以商量——而你的筛选器把它当成了事实。

上一节那6个取值,是Google那份规范定的。同一件事,schema.org那边也定了一份,而两份不一样长。

schema.org有一个专门的枚举类型,用来列可穿戴商品的版型分组,它的定义页下面挂着17个成员:加大、男童、超矮、超高、女童、壮硕、婴幼、少女、孕装、男装、女装小码、娇小、大码、常规、矮个、高个、女装。

把两份并排放:

规范格子数有娇小有矮个有超高超矮
Google商品数据规范6没有没有
schema.org版型分组17

而调查里,有4%的女性把自己描述成矮个,这是一个跟娇小分开来答的选项。这4%的人在Google那份规范里没有格子。不是排在后面,是那一格不存在。

格子数是可以商量的,你的筛选器把它当成了事实

这两份规范互不隶属,一份是商品分发平台的投喂格式,一份是国际通用的语义词表。它们对同一个概念切出了6格和17格。

这件事本身就说明了一个道理:枚举值不是对世界的观察结果,是一次切分决定。切几刀、刀落在哪儿,是可以商量的。既然可以商量,那它就带着做这个决定的人的立场。

而你的筛选器不这么理解。筛选器把枚举当事实:这里有6格,你是其中一格。没有“其他”,没有“我说不好”,没有跳过。

我见过一个更荒诞的版本:某个站的体型筛选做了单选,还默认选中了标准码。那就不只是不给跳过了,那是替用户先答了一遍,还答的是最不需要被服务的那个答案。

那个叫壮硕的格子,是一个委婉语被写成了永久标识符

17个成员里有一个特别值得看:壮硕(原文是husky)。这是英语零售业几十年来给偏胖男童尺码起的一个委婉说法,避免直接说胖。

它现在是一个国际语义词表里的正式成员,有稳定的地址,被结构化数据引用,被机器读取。

一个当年为了照顾感受而发明的说法,被固化成了一个再也改不动的字符串。这就是标识符的性质:它一旦被广泛引用,措辞的历史包袱就跟着一起被冻住了。你今天觉得哪个词冒犯,跟这个词在数据层还能不能被换掉,是两件独立的事。

这条对做站的启发很具体:面向机器的那一层用行业既定的标识符,面向人的那一层用你自己的措辞,两层之间做映射而不是共用同一个字符串。把展示文案和枚举值绑死,你就永远只能在两难里选一个——要么数据不合规,要么文案伤人。

两层映射具体长什么样

不需要很复杂,一张对照表就够,通常放在商品属性的字典里:

机器那一层(不可改)页面上显示(可随时改)筛选器标签(可A/B)
plus延展码16及以上
petite娇小版型身高160以下更合身
tall加长版型身高175以上更合身
maternity孕期版型孕期可穿

右边两列的写法有个共同思路:把描述人的词,换成描述条件的词。身高160以下更合身这句话里没有任何一个词在给人分类,它给的是一个可验证的条件,用户拿自己的数字对一下就知道,不需要认领任何身份。

这一招不是本文发明的,无障碍和文案领域早就在用,只是很少有人把它用到筛选器标签上。你的筛选器标签是全站被看到次数最多的文案之一,却几乎从来不进文案评审。

同一个字段,同时在给商品分段和给人分类

schema.org对版型分组这个属性的定义原文值得一字一句读:版型分组在时尚行业里很常见,用来定义尺码分段以及建议受众。

注意这句话有两个宾语:尺码分段,和建议受众。

一个字段同时干了两件事:把商品分组,和把人分组。前者是仓储问题,后者是身份问题,而它们共用同一个词。

这就是为什么同样是筛选器,按颜色筛、按材质筛、按价格筛都不会让人卡住,唯独按体型筛会让人停三秒。颜色筛的是货,体型筛的是人。用户很清楚这个差别,只是没人问过他。

顺手说说尺码值本身那几条硬规矩

枚举之外,尺码值本身也有规范。Google那份规范的尺码字段说明页给了几条很实在的要求,做feed的时候容易踩:

  • 格式必须一致。同一件衬衫的3个变体要写成S、M、L,不能一个写S、一个写Medium、一个写Lrg。这条看着像洁癖,其实是筛选器能不能归并的前提。
  • 多维度不能用逗号分开,要合成一个值。比如领围加袖长写成16/34,不能写成16,34。
  • 均码有固定写法,OSFA、OS或者one size。
  • 尺码体系单独有个字段说明页列了11个可选值(澳、巴、中、德、欧、法、意、日、墨、英、美);不提交的话,按你的目标国家默认。

最后这条对做多市场的站是个隐雷:你没填,系统按目标国家猜。猜对了没人知道,猜错了整批商品的尺码在那个市场全是错的,而你的后台一切正常。这类错误的特征是它不报错,它只是安静地把一批商品放进了错的筛选桶。

整套商品数据该怎么盘、哪些字段是硬门槛,可以对着独立站商品页与分类页的12步配齐清单过一遍;商品描述在AI购物场景下要补哪些信号,在让AI读得懂的商品页优化那一篇里。这里不重复。

世界上到底有没有一张公共的尺码对照表?

有,而且不止一份。问题是它管到哪一层,跟你以为它管到哪一层,差了关键的一步。

直觉上会觉得有。毕竟连螺丝的螺距都有国际标准,衣服总不至于没有。

确实有,而且不止一份。国际标准化组织下面有个专门管这事的技术委员会,编号133,主题就是服装号型系统。它出了一整个系列,编号8559,到现在有6个部分。

问题在于,这个系列管到哪一层,和你以为它管到哪一层,差了关键的一步。

第一部分只管怎么量

ISO 8559-1:2017的标题写得清清楚楚:服装号型标识,第一部分,人体测量的人体测量学定义。80页,2017年3月发布。

摘要里说,它给出的是一份人体测量项目的说明,用来建立实体和数字的人体测量数据库;这份清单是给服装从业者当指南用的,帮他们选定人群细分、建立号型与体型档案。

最后一句是关键:这份标准打算与各国、各地区或国际的法规与协议配合使用,以便在定义人群分组上保持一致,并使不同的人体测量数据集之间可以比较。

翻译一下:它标准化的是怎么量,以及量出来的数据怎么记录才能互相对比。至于量出来叫几号,它明确说了要跟别的东西配合。

第三部分给了方法论,但表格里的数只是示例

ISO 8559-3:2018更进一步,讲的是怎么建立人体测量表和号型区间。摘要里有两句我读到的时候愣了一下:

  • 本文件表格中的数值只是示例。
  • 本文件不包含服装尺寸。

也就是说,最接近“尺码表”的这一部分,给的是方法论——主要靠统计分析,而且它特意说明统计门槛压得很低,为了让尽可能多的人读得懂——但表里的数字不是可以直接拿去用的,服装本身的尺寸更是压根不在范围内。

摘要还解释了为什么必须留这个口子:需要一种带内置弹性的通用做法,好让整个号型系统能适应变化,因为任何一个目标人群内部,体型与比例的差异都很显著。

这句话很诚实。它等于承认:这件事没法一张表定死,谁想定死谁就错了。

所以那一步到底归谁管

把三层摊开看:

内容谁定的是否公共
怎么量身体测量项目、测量方法、记录格式国际标准
人群体尺表怎么建统计方法、区间划法国际标准给方法方法公共,数值不公共
这件衣服标几号从测量值映射到一个标签每个品牌自己

公共基础设施修到第二层就停了。第三层——也就是用户唯一真正需要的那一层——是无主之地。

这不是行业偷懒。前面那句“体型与比例差异显著”就是原因:真要定死,定出来的表在相当一部分人身上是错的,还不如不定。

但对做站的人来说,结论是硬的:你的尺码表跟隔壁那家不通用,这不是你们哪一家没做好,这是这个体系设计出来就这样。所以指望用户带着一个跨站通用的自我认知走进你的站,从一开始就不成立。

Baymard举的那个例子,值得贴在工位上

他们在尺码信息那篇研究里举了个例子:一位20多岁的女性,可能还在穿少女线的单号码,同时也穿成人线的双号码;逛牛仔裤的时候又碰上一个直接用英寸标注的品牌。于是同一次购物过程里,她要在5号、6号和28英寸这三种表达之间来回换算。

这不是极端案例,这是常态。同一个人,在同一个下午,有3个不同的号。

那篇研究的整体结论是:桌面端83%、移动端87%的服饰站,尺码信息给得不充分;反过来说,做到充分的只有桌面17%、移动13%。

还有一份标准,专门教你算自己漏掉了多少人

这一条是我读这个系列时最意外的发现。

ISO 8559-4:2023,2023年1月发布,13页,标题是:人体测量表覆盖率的确定。

它描述的是怎么计算一张人体测量表相对于目标人群的覆盖率——拿表去比对目标人群的两到三个身体维度,算出覆盖了百分之几。

然后是那条注释,原文是这么写的:理论上覆盖率的计算可以扩展到更多维度;但实际操作中,基于4个或更多维度做计算会导致百分比很低,难以做出直观的图示,且未被认为有实际意义。

读第二遍我笑出声了。翻译过来是:看两三个维度的时候数字还挺好看,看4个就没法看了,所以我们就看两三个。

而且它还有个前提条件:只有当你手上有目标人群的体尺数据库时,这个计算才适用。

这条注释背后的那件事

三个结论一起来:

  • “一张尺码表覆盖多少人”从来不是一个客观数字,它取决于你同时看几个身体维度。旋钮不在表上,在你手里。
  • 行业默认只看两三个维度,不是因为两三个够用,是因为再加一个数字就不好看了。而人是三维的,同一个腰围可以配很多种身高、臂长和肩宽。
  • 存在一份国际标准专门教你算覆盖率,本身就说明覆盖不全是这门手艺的默认状态。标准做的事不是消灭漏掉的人,是让你把漏掉的比例算出来。

所以回到最开头那个24%。用户拒绝认领一个标签,某种意义上他是对的——那个标签背后的表,本来就只在两三个维度上覆盖了他。他的身体和那个词之间,从来就没有对齐过。

这套标准里,有三样东西你可以直接拿走

标准本身是收费的,几百瑞士法郎一份,绝大多数独立站不需要买。但它公开的摘要里有三个可以直接用的东西:

  • 测量项目的命名要统一。第一部分做的就是这件事——把身体测量项目的定义固定下来,好让不同来源的数据能互相比较。落到你身上:你的尺码表、供应商的量体表、工厂的样衣表,三张表里同一个部位最好用同一个名字。听着像小事,但三方对不上的时候,返工的是整批货。
  • 覆盖率是一个可以自己算的数。你不需要买标准也能算:拿你的号型表去比对你手上真实成交用户的身体数据(评论里那些身高体重就是现成样本),看两三个维度上覆盖了多少人。第一次算出来的数字通常比预想的低。
  • 人群分组是一个显式决定。第三部分把人群分成婴幼、女童、男童、儿童、女性、男性几组来建表。你的站服务的是哪几组,这件事最好写下来,而不是默认继承供应商的分组——很多站在这一步不知不觉地继承了一个跟自己客群完全不匹配的分组。

你的商品数据里,为什么只有衣服的尺寸,没有人的尺寸?

规范里一直有两个字段:一个描述这件衣服,一个描述能穿它的那个人。绝大多数站只填了第一个。

这一节讲的东西,我认为是整篇里最值钱的一个发现,而且它就明晃晃地写在一份公开规范里,只是几乎没人填。

schema.org有个类叫尺码规格,它的定义是:商品的尺码相关属性,通常是一个尺码代号(名称),可选地带上尺码体系、版型分组和商品测量值。

这个类底下挂着6个专有属性。把它们分个组,结构一下就出来了:

属性官方描述在说什么描述的是谁
hasMeasurement某件物品的一项测量值,比如裤子的内缝长、自行车的轮径、螺丝的规格这件商品
sizeSystem用哪套尺码体系标识,可以是标准、国家代码或者度量制这件商品
sizeGroup版型分组,用来定义尺码分段与建议受众商品与人各一半
suggestedMeasurement目标受众或目标人物的一段建议身体测量范围,比如内缝长32到34英寸之间,或者身高170到190厘米之间穿它的那个人
suggestedGender目标人物的建议性别,比如男、女或中性穿它的那个人
suggestedAge目标受众的年龄或年龄区间,比如婴儿3到12个月穿它的那个人

规范里一直有两个字段,你只填了一个

把这张表看完,一个事实很难再绕过去:

商品页上关于尺寸的字段从来不止一个。一个描述这件衣服,一个描述能穿它的那个人。两个字段在规范里都在,而绝大多数站的商品库里只有第一个。

而且第二个字段的官方示例给得非常具体:内缝长32到34英寸之间,身高170到190厘米之间。它要的不是一个标签,是一段区间。区间这个形式本身就承认了一件事——一个尺码对应的不是一个人,是一段人。

顺带说一句性别那个属性:它的取值除了男、女之外还有中性。服饰站这几年中性款越来越多,可绝大多数商品库里性别仍然是一个必填的二选一——这是同一件事在另一个维度上的又一次发生,把一个连续的世界压进两个格子里。

你没填这个字段,用户就得自己去找。他去哪儿找?

他去评论区,找一群已经替你把这个字段填过的人。

评论区其实是一个用户自建的字段

“我身高165,体重52公斤,买的M码,肩略宽”——这句话在评论区里长得像一句闲聊,但它的结构跟规范里那个字段一模一样:一段身体测量值,加上对应的那个尺码代号。

区别只在于,规范里那个字段由你填,评论里这个字段由陌生人填。用户宁可信一个陌生人随手打的一行字,也不信你那张尺码表——不是因为陌生人更权威,是因为陌生人给的是他要的那种数据格式,而你给的是另一种。

你给的是这件衣服的胸围是多少厘米。他要的是一个跟我差不多的人穿这个码好不好看。这两句话之间隔着一次换算,而这次换算你没做,他也不太会做。

模特那一行小字,就是把这个字段填在了图片旁边

Baymard那份尺码研究的第10条建议,是给真人模特图配上模特的身体测量值。他们记录了一位参与者看到这行小字之后的反应,原话大意是:6英尺1,好吧我不是6英尺1,胸围39,腰围30,所以他穿的是M码。

另一位参与者对着女装模特那一行说:它清楚地给了身高、给了她穿的码、给了她的尺寸,所以你能看出她穿的是S,然后拿这个去对尺码表。

这两段原话的价值在于,它们完整地展示了用户在脑子里跑的那个算法:先拿模特的身体跟自己比,得出一个差值,再把这个差值加到模特穿的那个码上。

这就是那个缺失字段的手工版本。用户没有别的办法,只好自己搭一个。

顺带说一句数据:在真人模特图那条准则下面,Baymard的基准测试显示21%的站要么完全不给真人模特图,要么只给一张——一张是不够的,因为一张图看不出动态和不同角度的贴合。

把这个字段补上,成本比想象中低

补法有三档,从便宜到贵:

  • 最便宜:模特图旁边加一行小字,写清模特的身高、主要围度和身上这件的尺码。不需要改数据结构,不需要开发,摄影排期里加一句就行。
  • 中等:在尺码表里同时给两栏——这件衣服的成衣尺寸,和这个码建议的身体尺寸区间。很多站只有前者,用户拿着自己的身体数据对不上。
  • 完整:把建议身体测量区间做成结构化字段落进商品数据,同时驱动页面展示和站内筛选。这一档要动商品模型,属于按季度排的活儿。

第一档我强烈建议本周就做。它是全篇性价比最高的一条:一行小字,解决的是用户脑子里那次换算里最难的一半——他缺的从来不是这件衣服的尺寸,是一个可以拿来当参照的身体。

那为什么这个字段几乎没人填

不是因为难,是因为没有任何一个环节会因为它缺失而报错。

商品上架不检查它,feed诊断不提示它,富媒体结果不因为它变少,同行也没填。一个字段如果既不阻塞流程、又不影响告警,它在任何一个团队里都会被无限期推迟——不是被否决,是被推迟,而推迟没有截止日期。

反过来说,这也是它现在还值钱的原因。凡是规范里定义了、平台不强制、同行也没做的字段,都是一小段窗口期。这类窗口期通常撑不了太久:一旦有一天平台把它纳入某个展示模块的准入条件,所有人会在同一个季度里补齐,那时候它就从优势变回及格线了。

关于商品页上信息该怎么排、哪些信息必须放在同一屏里能对着看,之前在商品页标签页把信息拆散的代价那一篇里拆过一次,这里的模特尺寸和尺码表正好是那条规则的又一个例子:它们必须能被同时看见,分开放在两个标签页里,用户就得靠记忆去做减法。

48%的人翻评论是为了找尺码,这说明评论区在替谁干活?

后面三项是所有品类的评论区都在干的活。只有排第一的那项不是。

先看这一组数。服饰与配饰品类的购物者去评论区,最想找的信息依次是:

想找什么比例这属于哪类问题
尺码准不准、合身细节48%能不能穿
质量与耐用度43%值不值
有没有什么毛病或投诉40%会不会踩雷
性价比36%值不值

后面三项是所有品类的评论区都在干的活:帮人判断这东西好不好。只有排第一的那项不是。

尺码准不准,判断的不是商品,是商品与我之间的关系。这件事在别的品类里几乎不存在——买个充电宝不需要先知道自己是什么型号。

评论区在这个品类里被征用了

报告里那句话说得很准:在多数品类里,商品的属性是固定且可见的,评论主要帮人评估质量与可靠性;在服饰与配饰里,评论额外承担了一件更具体的事——它替代了试衣间。

试衣间干的是什么?它让你把一个不确定,用一次实物接触换成确定。线上没有这个环节,于是这个不确定必须找别的地方落地。

它落到了评论区。而评论区原本不是为这件事设计的。

当用户在你的界面里反复用一个功能去干一件它不是为之设计的事,那不叫误用。那是一份需求规格说明书,而且是已经经过验证的——因为用户已经用行为投过票了,投了很多年。

合身子评分:一个被验证的组件

Baymard对这件事早有一条明确准则:服饰与配饰站应当在评论区提供一个聚合的合身子评分。2024年那篇的标题写着33%的站没做。

它的作用很直接:把散落在几十条评论里的偏大、偏小、正好,聚合成一个可以一眼看完的东西。不做的话,用户只能自己去翻,而报告说他们翻出来的结论经常是错的。

这里有一个可以放在一起看的对照,我认为比单看任何一个数都有信息量:

准则较早一次的数较近一次的数变化
评论区提供合身子评分33%不达标(2024年)24%不达标(2025年)明显改善
尺码信息给得充分83%不达标(2022年)82%不达标(2025年)基本没动

先说口径:这两组数来自同一家机构不同年份的文章,基准站样本会随时间调整,所以不能当成严格的同比。但差别大到这个程度,方向是清楚的。

为什么一条动了,另一条没动

直觉上会觉得,问题越严重越先被修。这两行数说的正好相反:不达标率83%的那一条三年基本没动,24%的那一条反而在改善。

差别不在严重程度,在这件事能不能被一个组件解决。

  • 合身子评分是一个组件。评论系统加一个维度,聚合一下,前端渲染一个条形。有现成的第三方插件,一个排期能上,上完就是上完了。
  • 尺码信息给得充分是一项内容工程。要按品类分别做尺码表、要双单位、要国际换算、要量法说明、要跟每一个SKU对上、要在上新流程里长期维持。它没有终点,它是一条要一直养的线。

一个问题的改善速度,跟它有多严重关系不大,跟它能不能被一个组件解决关系很大。这条规律在你自己的排期表上同样成立:翻一下你过去一年真正做完的事,大概率全是能被一个组件解决的那类;而那些真正重要、但需要长期维持的,多半还停在待办里,每个季度被往后挪一次。

知道了这条,至少可以做一件事:凡是需要长期维持的活儿,别放进项目排期,放进流程。放进排期的东西会被做完然后遗忘,放进流程的东西才会被一直做——比如把尺码表完整度做成上新checklist里的一个必填项,而不是做成一个季度专项。

评论里那些字,是你能拿到的最便宜的一手材料

换个角度看这48%:他们在评论区留下的东西,是一份免费的、持续更新的、带真实人体数据的语料。

能用它干三件事:

  • 算一个指标。统计你的评论里含尺码相关词(偏大、偏小、正常码、建议大一码、身高、体重)的比例。这个比例越高,说明你的尺码信息越不够用——用户是被逼着去评论区替你补课的。一句查询就能出,不需要任何埋点。
  • 反推商品问题。把这个比例按SKU切,冒尖的那几个SKU多半是版型偏了,而不是用户不会选。这类问题在退货原因里通常被归成尺码不合,看不出是哪几件的锅。
  • 直接改文案。评论里出现频率最高的那句提醒,就该被提到商品页尺码选择器旁边。用户已经替你写好了文案,你只是把它从第37条评论挪到第一屏。

怎么把评论这类用户内容做成长期资产,这条线在UGC内容做成会排名的资产那一篇里有系统写法;把评论正文里那些说法反过来喂进商品描述的做法,在把用户评论变成高转化的产品描述里;同一套语料还能拿去看对手,那是从竞品差评里挖差异化卖点那一篇的活儿。这里只取它跟尺码相关的那一小块。

评价表单该怎么加那两个字段

加字段这件事的风险是把评价率拉下来,所以顺序和形态都有讲究:

  • 位置放在星级之后、正文之前。此刻用户已经点过一次,投入已经发生,多两个选项不会让他掉头;放在最前面就是一道门槛。
  • 一律选填,一律给区间。身高给一组区间选项,体重同理,购买尺码直接从他的订单里带出来,不用他填。选一个区间的心理成本远低于打一个具体数字。
  • 加一句说明谁会受益。下一个跟你身材接近的人会看到这条——这句话的效果比任何积分激励都好,因为它把填写的动机从交易换成了互助。
  • 历史评论别急着补。回头去问老买家要身体数据,回收率极低还容易招投诉。让新评论自然积累,三个月后主力SKU上自然会有一批。

评论这块的展示与可被抓取问题是另一条线,写在口碑要搬到机器进得去的地方那一篇里,本文不展开。

还有两条跟评论有关的硬数据,顺手记下

一是评论配图。Baymard的基准测试显示34%的站不允许用户在评论里上传图片;而他们的大规模可用性测试里,最多有95%的用户在考虑商品时会去看评论。

二是评论图的浏览方式。在服饰电商的5条关键准则里,做得最差的恰恰是这一条:90%的站不支持从用户上传的图片横向浏览评论。这份汇总同时给出,90%的站至少有一条准则是做错的。图片能传上来,但堆在那儿,点开一张就出不去,看不了下一张。

这两条合起来说的是同一件事:用户已经把最有价值的那种材料交到你手上了,而你没给它一个像样的浏览通道。他给你的是一份带身体数据的实拍集,你把它做成了一面贴满照片的墙。

38%的人说自己来得不够勤,这是一条理由还是一次预测?

大部分团队看到这张表会去优化后面那三条。可排第一的那条,压根不是一个理由。

调查里问的是:为什么没加入任何一家的会员或积分计划。答案分布是这样:

理由比例这句话在说什么
在这家店买得不够勤38%对自己未来行为的一次预测
担心邮件太多31%对一项已知成本的规避
不想再管一个账号26%对一项已知成本的规避
觉得回报不值26%对价值的判断

大部分团队看到这张表,第一反应是去优化后面三项:少发邮件、简化注册、加大权益。这三项确实该优化,但它们加起来也解释不了排第一的那个。

因为排第一的那条压根不是一个理由,它是一次预测。

会员制要求用户先替你算一道题

把“我在这儿买得不够勤”这句话拆开,它的完整形态是:按我对自己未来的估计,我在这家店的购买次数,撑不起加入会员这件事的成本。

注意这句话里的时态。会员制的价值发生在未来,成本发生在现在,而用户判断未来用的依据只能是过去。三个时态挤在同一个弹窗里,用户要在两秒钟内把它们理顺。

更要命的是那个过去是什么:是他还没加入会员时候的购买频次。而会员制这个东西存在的全部意义,就是把那个频次抬上去。

于是它要求用户拿着“药还没吃时候的体温”来判断“这药值不值得吃”。这道题在逻辑上就是拧的。

凡是加入之后才生效的机制,都在要求用户先替你做一次关于他自己的预测;而他手上唯一能用的依据,恰好是这个机制还没起作用时候的数据。这条对会员制成立,对订阅制成立,对任何一种“用得越多越划算”的定价结构都成立。

服饰这个品类,把这道题的难度又抬了一档

报告解释得挺到位:有些品类里用户会因为方便或者必需而反复回到同一家;服饰不是,服饰的购买天然分散在很多品牌和很多站点上。

一个人可能一年在你这儿买一到两次,每次都很满意,但仍然不认为自己是这家店的常客。

请注意,这句话跟本文第一节那个24%是同一个结构。他都是在给自己贴一个标签,只不过一个贴的是身体,一个贴的是行为。而两次贴标签,用的都是他自己的参照系,不是你的。

你后台里那个人一年买两次、客单价不低、退货率很低,在你的分层里可能已经是中高价值客户了。他自己不这么看。你按金额分层,他按频次自评,两套口径谁也没错,只是从来没对过账。

那三条理由,对应三种完全不同的破法

把这四个数按性质分类之后,动作是分岔的:

  • 对着预测那一条(38%),别去说服,去改结算方式。如果入会的价值必须攒够几次才兑现,那这道预测题就绕不开。把一部分价值改成当场就能兑的——首单立减、当次运费、当次可用的一个具体权益——预测就不需要做了。你要做的不是让他相信自己会常来,是让这件事跟他会不会常来无关。
  • 对着成本那两条(31%和26%),别去解释,去让成本可见且可控。邮件频率在注册那一刻就给选项,不是塞进注册后的偏好设置里;能用邮箱直接开卡就别强制设密码。这两条的共同点是:用户担心的是一个他还没体验过的成本,唯一能消掉的办法是让他在付出之前就看见控制开关。
  • 对着价值那一条(26%),别去加码,去改表述。觉得回报不值,很多时候是因为回报被表述成了一个需要换算的东西(攒多少分换多少钱)。换算这件事本身就有成本,而换算完的结果通常不够惊艳。

最后这条里有个坑,值得单独说一句:把权益换算成明确金额,会让它立刻变得可以跟别人的折扣直接比大小。有些权益的价值恰恰住在它不好换算这件事里,一旦标了价,它就掉进了一张所有人都能一眼比完的表。这条在比价现场那篇里展开讲过,这里不重复。

入会弹窗弹在哪一刻,比弹什么更重要

如果那38%的核心障碍是一次预测,那么最好的时机是预测已经被现实替代的那一刻

  • 第二次下单的确认页。此刻他不用预测了,他已经是第二次了。这一刻的入会转化率通常比首单高出一大截,而多数站把最大的入会力气花在了首单前。
  • 退货完成之后。这个时机违反直觉,但它是服饰品类特有的:一个人愿意为一件衣服走完整个退货流程,说明他还想要合适的那一件。这一刻推“记住你的尺码偏好”比推折扣管用。
  • 尺码表被打开之后。他正在犯难。这一刻能给的最好权益不是钱,是一句“加入之后我们记住你的尺码,下次直接给你标出来”。

你会发现这三个时机都不是流量最大的位置。入会弹窗的位置通常是按曝光量选的,而这道题该按确定性选——用户对自己越确定的地方,那道预测题越不用做。

会员体系本身怎么分层、积分怎么定价、权益怎么排,这些是另一个专题的活儿,写在会员忠诚度体系的完整设计里;插件层面怎么配、怎么防薅,在积分与会员体系的插件运营;会员日这类节奏性动作在独立站会员日营销的5步那一篇。本文只处理那38%——也就是那批连门都还没进的人。

这四个数在你自己站上怎么复现

别直接抄这组比例。它来自美国样本、服饰品类、问卷口径,搬到你自己站上大概率是错的。要拿到你自己那一版,成本也不高:

  • 在退出意向弹窗或者订单完成页挂一道单选题,问一句为什么没有加入会员,选项就用那四条加一个其他,附一个可选的填空框。挂两周,几百份就够看趋势。
  • 那个填空框才是真材料。四个选项收上来的是分布,填空框收上来的是原话,而原话里经常有你四个选项覆盖不到的第五种理由。
  • 跑完之后跟上一节第五个指标交叉。如果问卷里预测型理由占比高,而入会率在第二单那一档明显跳升,两边就互相印证了,这个结论可以直接进立项材料。

顺带提醒一句:调研收上来的选项分布,本身就是本文讲的那件事的又一个实例——用户是在你给的词表里挑最接近的那个。所以填空框不是锦上添花,它是唯一一个不受词表限制的通道。

真要动手,这四层清单的失败方式各不相同

入口、判断、兜底、数据。混在一张清单里做,力气很容易花错地方。

前面几节讲的是问题结构,这一节全是能落地的动作。我把它们按发生顺序分成四层,因为这四层的失败方式完全不同,混在一张清单里做,很容易把力气花错地方。

第一层:入口,别让整条路径挂在一次认领上

先看一个几乎所有服饰站都低估了的事实。Baymard对服饰品类找货行为的研究给出3个数:100%的测试参与者主要靠主导航和手动浏览来找商品;尽管100%的受测站都有站内搜索,90%的参与者在任何一个站上都没用过它;只有一小部分人(约10%)把搜索当兜底,在导航或浏览失败之后才用。

搜索框是整个页面上唯一一个允许用户用自己的词说话的控件。而在这个最需要自我描述的品类里,它恰恰是最不被使用的那一个。

原因不难想:他要说的那句话——我这个身材穿这条裙子好不好看——本来就不是一句能敲进搜索框的话。

所以入口层的三条:

  • 体型标签只能是众多入口之一,不能是唯一入口。同一批商品必须能通过至少两条不依赖自我认领的路径被找到:一条是纯尺码值(比如直接选16或者XXL),一条是常规品类路径(连衣裙、外套)里带上尺码筛选。用户不必先承认自己属于哪一类,才配看到这些货。
  • 体型筛选组一律做成多选,并且允许一个都不选。做成单选加默认值,等于替用户答了题。这条听着像细节,实际影响的是整组筛选的使用率。
  • 大码专区这类页面保留,但降级成入口而不是通道。它对那些主动认领这个标签的人是有用的,而且站外有人正在搜这个词。这一点在本文最后那个复盘里会付出代价,先记在这。

第二层:判断,把用户做那次换算需要的材料给全

这五条是从Baymard那10条尺码信息准则里挑出来的、对翻译这一步真正起作用的部分,顺序按性价比重排过:

  • 模特的身体数据必须给。身高、主要围度、身上这件的码。这是全篇性价比最高的一条,前面说过,不重复。
  • 尺码表按品类做,不做全站一张。研究里记录了一位参与者点开背包的尺码表,发现里面全是服装尺码,他的原话是:这什么都没告诉我,因为这是给衣服用的,放在这儿几乎比没有还糟。另一位在另一个站上要从一长串品类里找自己那一行,找到一半放弃了。一张万能尺码表的伤害大于零,因为它消耗了用户的一次期待。
  • 厘米和英寸都要给,别让用户自己换算。偏好一种单位的人,通常并不知道自己那几个数字在另一种单位下是多少。
  • 做国际市场就必须给号型换算。研究里那位欧洲参与者在美国站上核对自己的鞋码,说的是“我去尺码表里确认一下,哦对,应该是7号”。没有换算表,她只能离站去查,而离站的人不一定回来。
  • 给量法说明,最好配图。有测量数据但不告诉人怎么量,这份数据基本作废——尤其对不常买衣服的人。研究里建议这份说明不只有文字,还要配真人图,标清楚量哪个位置。

第三层:兜底,翻译失败的时候接住他

这一层的存在前提是承认:无论前两层做得多好,总有一部分人算不出结论。

  • 尺码表的入口必须紧挨着尺码选择器。研究里记录的失败案例,是一位参与者完全没看到图集下方那个写着尺码与版型的标签页——链接放得离选择器太远,或者做得太素,都会被整个略过。
  • 浏览器的返回键必须回到商品页。尺码表通常是浮层,很多人本能地按返回而不是找关闭按钮;如果返回把他甩回了列表页,他刚才在商品页上的那次考虑就断了。
  • 尺码表里放一个客服入口。已经给了测量、换算和完整表格还是拿不准的人,需要的是一次对话。顺带,这个入口对所有打开尺码表的人都是一次信任信号。
  • 合身子评分要有。它是把评论区那份自建数据聚合成一眼可读的唯一办法。

第四层:数据,让机器那一侧也对得上

  • size type这一栏别空着。空着等于全部按常规处理,你的大码商品在平台筛选里不出现。
  • 尺码值格式统一,别混写。S、M、L就全部这么写,不要一个变体写Medium。多维度用斜杠合成一个值。
  • size system显式提交,别让系统按目标国家猜。多市场站尤其要注意这一条,猜错了不会报错。
  • 同款的不同尺码要用同一个商品组标识串起来。规范里写得很明确:按尺码区分的变体各自作为独立商品提交,但必须共用同一个商品组标识。串不起来,平台就会把每一个码当成一件独立商品,你的同款在结果页里重复占位,而用户点进去的那个恰好是没货的那一档。
  • 建议身体测量区间尽量落进结构化字段。这一条是长期项,但它是唯一能让机器理解“这个码适合什么样的人”的方式。

还有一条不在任何清单里的:尺码选择器本身用按钮

Baymard对尺码选择控件做过单独研究:28%的桌面基准站在有大量尺码变体的商品上仍然用下拉框,71%已经改成了按钮。而在服饰的5条关键准则那一版口径里(包含“用了按钮但用得不对”),不达标的比例是70%。

下拉框的问题不在于点几下,在于它把哪些码有货这个信息藏了起来。用户要展开才知道自己那个码在不在,而按钮把缺货状态直接摊在页面上。对一个已经在为自我归类犯难的人来说,多一次展开就是多一次放弃的机会。

缺货这件事还有一层:大码档缺货率通常高于标准档,而缺货最集中的恰恰是那些认领成本最高的档。一个刚刚说服自己点开延展码的人,看到一半的码是灰的,他得到的不是缺货信息,是一次印证——这地方本来就不是给我准备的。这一层用任何转化率指标都测不出来,它只体现为这批用户再也不回来。

表单控件该怎么选、下拉框在哪些场景会安静地吃掉转化,这条线在下拉框在独立站表单里的代价那一篇里系统写过,尺码选择器是那条规则在商品页上的一个特例。

顺序建议:先做三条,别一次上完

四层十几条一起排,通常的结局是排期表看着很饱满,三个月后一条都没上完。真要动,按这个顺序:

  1. 模特身体数据那一行小字(本周,摄影排期里加一句)
  2. size type与size system两栏填满(本周,一次批量更新)
  3. 尺码表按品类拆开(两到三周,内容活儿,但一次做完能吃很久)

四层里最容易被整层跳过的是兜底层

入口层有人管,因为它跟导航改版挂钩;判断层有人管,因为它跟内容排期挂钩;数据层有人管,因为它跟feed报错挂钩。

兜底层没人管,因为它服务的是那批已经快要放弃的人,而这批人在任何一份需求文档里都没有代表。产品经理写用户故事的时候,主角永远是那个顺利走完流程的人;写异常分支的时候,写的是系统出错,不是人算不出来。

判断一个站有没有做兜底层,一个最快的办法:打开尺码表,按浏览器返回键。回到商品页说明有人想过这件事,回到列表页说明没有。这个动作花不了10秒,却能大致判断出整层的成色。

这三条的共同点是不动商品模型、不动结算、不动已经存在的用户数据。为什么这一点重要,下一节讲完指标之后再说。

不加一行埋点,先算哪五个数?

五个数都能用你现有的订单表、评论表和日志算出来。第一次跑通大概半天到一天。

这五个数的共同点是:用你现有的订单表、评论表和日志就能算出来,不需要新加任何一行埋点,也不需要等下一个版本上线。第一次跑通大概半天到一天。

一、默认档占比

怎么算:成交订单里落在标准码那一档的比例,和你商品库里标准码档SKU的占比,两个数放一起看。

怎么读:关键不是任何一个数,是两个数的差。如果人这一侧明显高于货这一侧,说明默认值的引力正在起作用——非标准档的商品有货、有展示,但没被选走。

没有档位标注怎么办:直接按尺码值分段算——把最大的那两三个码归成一段,看它们在成交里占多少。这个近似值粗糙,但它跟精确算法给出的结论方向几乎总是一致的,而它只需要一条分组查询,五分钟。

为什么它跟看板上别的指标不一样:它的分母不是用户数,是档位。它测的是你的档位设计有没有被真正使用,而不是有多少人买了东西。第一次跑出来通常会让人愣一下:一个铺了四个档的类目,八成以上的成交落在其中一档。

二、尺码表打开率与打开后的转化差

怎么算:看过商品页的会话里,打开过尺码表(浮层展开或者尺码页浏览)的比例;再把这批人的下单率跟没打开的那批比。

怎么读:打开尺码表的人下单率通常更高,因为他已经投入了。所以这个差值不是效果,是投入程度的副产品,别拿它当尺码表的功劳。真正有信息量的是打开率本身按品类切开之后的差异——同一个站上,裤装的打开率往往是配饰的好几倍,那个倍数告诉你哪些品类的用户在犯难。

三、评论里的尺码词密度

怎么算:评论正文里含尺码相关词的条数占比。词表不用复杂,偏大、偏小、正码、建议大一码、身高、体重、平时穿,七八个词就够了。

怎么读:这是全站少见的一个反向指标——它越高,说明你的尺码信息越不够用。用户在替你补课,而且是当着所有潜在买家的面补。按SKU切开,冒尖的那几个通常是版型跑了,不是用户不会选。

为什么它值钱:它是唯一一个能在退货发生之前、用免费语料测出尺码信息缺口的数。别的办法都得等包裹寄回来。

四、同款多尺码同单率

怎么算:一个订单里包含同一款式两个及以上尺码的比例。

怎么读:这是最贵的一种试衣间。用户已经放弃了在你的页面上做判断,改成把不确定性用运费和退货流程买下来。这一单的毛利在下单那一刻就已经被吃掉一部分了,而且退货几乎是确定发生的——他本来就打算退一件。

这个数在很多站上高得吓人,却几乎从不被单独统计,因为它在报表上表现为客单价上升。一个坏消息伪装成好消息,混在最容易让人放松警惕的那个指标里。

五、入会率按下单次数分层

怎么算:把入会转化率按用户当时的历史下单次数切成三档:首单、第二单、三单及以上。

怎么读:如果第二单那一档明显高于首单,那38%那条理由就在你自己的数据里被验证了——用户不是不想入会,是在首单那一刻他还答不出那道预测题。这时候把入会的主战场从首单前挪到第二单确认页,是一个几乎零成本的调整。

把第二个数和退货率交叉,会得到一张四格表

退货率低退货率高
尺码表打开率高尺码表在干活,保持表被打开了但没解决问题,去查表本身准不准
尺码表打开率低品类本身尺码宽松,别动最容易读错的一格

左下那格(打开率低、退货率高)几乎总是被读成同一个结论:用户不看尺码表,所以退货多,那就把尺码表做得更显眼。于是加大链接、换成高亮、加个提示条。

更常见的真相是:尺码表压根不在他的决策路径上。他没打算量自己,从来就没打算。他用的参照系是评论里那个跟他身高体重接近的人,和模特身上那件衣服。你把一张需要卷尺才能用的表顶到第一屏,对他来说等于什么都没做。

判别法:拉这一格订单对应会话的评论区浏览深度和商品图浏览张数,跟站均比。明显偏高,说明他有一套自己的参照系,只是那套参照系你没给够材料。这时候该做的是补模特数据和合身子评分,不是把尺码表做得更亮。

第一次跑出来大概是什么样

给几个参考区间,来自我手上做过的几个服饰站,样本不大,只当个心理准备,别拿去当行业基准:

  • 默认档占比通常比商品那一侧高出十几到二十几个百分点。差得越大,说明非标准档越是摆着好看。
  • 尺码表打开率裤装和连衣裙明显高于上衣和配饰,这个倍数比绝对值有用。
  • 评论尺码词密度三成上下算常见,超过四成基本可以确定尺码信息不够用。
  • 同款多尺码同单率一位数是正常的,两位数就该单独立项了。
  • 入会率在第二单那一档如果比首单高出一大截,那38%那条理由在你站上就是成立的。

五个数第一次跑完,最好的用法不是拿去汇报,是拿去开一次会:把商品、内容、客服叫到一起,对着这张表问一句这五个数里哪一个最出乎你的意料。意外最大的那一个,通常就是最该先动的那一个——因为意外本身说明这块地方长期没人看。

顺带说一句:退货原因里那个“尺码不合”,别太当真

写到这儿有件事必须点出来,因为它是本文整条逻辑的一次回环。

退货原因是怎么收上来的?用户从一个下拉框里选一项。而那个下拉框里,尺码不合通常排在很前面。

这跟第一节那个体型筛选器犯的是同一个错:都要求用户从一个你定的固定词表里,给自己的经历挑一个最接近的标签。

于是“尺码不合”这一栏里混着一大堆别的东西:穿上不好看、面料手感不对、买的时候上头了、不想写理由所以选了最省事的那一项。它们没有一个属于尺码问题,但它们都会被计进尺码不合。

你的系统里每一个让用户从固定选项里描述自己或自己经历的地方,本质上都是同一件事的不同实例——体型标签、退货原因、满意度评分、注销理由、客服工单分类。它们收上来的从来不是事实,是用户在你给的那张词表里能找到的最接近的那个词。

这条一旦想明白,后台里好几张饼图的可信度都要往下调一档。而调完之后你会发现,最可信的用户描述反而在那些你没有设计过的地方——评论正文、客服聊天记录、退货备注里那半句手写的话。凡是让用户自己组织语言的地方,数据脏但真;凡是让他从枚举里挑的地方,数据干净但可能是假的。

客服那边的原话怎么系统性地捞出来、怎么变成可排期的东西,写在从工单到帮助中心的7个协作动作那一篇里。这里只强调一点:捞原话这件事必须有人负责,不然它永远处在人人都能做、所以没人做的状态。

另外,同一个动作被两套口径算出相反结论的情况在电商后台里非常常见,商品页推荐位的两套报表那一篇拆过一次;本文这几个指标之所以都不需要新埋点,一部分原因就是想绕开口径战争——用现成的订单表和评论表算出来的数,至少大家吵的是同一份数据。

一个泳装站照着做完了,为什么第三个月自然流量掉了一截?

两个月四个数全绿,第三个月掉了一小撮词。预警响过,而且被正式写进了文档,只是用的是另一个部门的语言。

这一节先讲一次真实的翻车,再讲排期。顺序这么排是因为,那次翻车正好解释了为什么排期里必须多加一道检查。

一个泳装站,四周做完,两个月四个数全绿

去年接的一个出海站,做泳装与沙滩装:比基尼、连体泳衣、罩衫、沙滩裙,主销美英澳,客单价35到120美元。这个品类的尺码敏感度是全服饰里最高的一档,退货率也是。

他们照着本文前面那几层做了一轮,四周:

  • 模特图配上身高、围度和身上这件的码,先做销量前80的SKU;
  • 尺码表按品类拆开——比基尼上装、下装、连体、罩衫各一张;
  • 评论加合身子评分,并在评价表单里引导填身高体重与所购尺码;
  • 商品数据里把版型与号型体系两栏填满;
  • 把导航里那个独立的大码入口去掉了,改成全站统一的尺码筛选,尺码值直接一路可选到最大档。

最后那一条是当时全组最有成就感的一条。理由说得也漂亮:不该要求用户先认领一个标签才配看到货。

两个月后数据全绿:默认档在成交里的占比从81%降到63%(商品那一侧一直是58%上下,两条线终于靠拢了);同款多尺码同单率从14%降到6%;评论里的尺码词密度从39%降到21%;客服那边“我这个身材能不能穿”的问询明显少了。

第三个月,自然流量掉了一截

掉的不是大盘,是一小撮词:带大码的那一类品类词。原来那个独立入口是有独立URL的,做过内容,排在第4位上很久了。改造时它被合并进了统一集合页,做了跳转。

站外的人还在搜那个词。搜索量一点没少。而他们能落地的那个页面没有了。排名掉到20开外,那一小撮词的流量基本归零。

预警响过,而且被正式写进了文档,只是用的是另一种语言

这次翻车最值得记的不是损失,是预警的形态。

预警是响了的。第四个月的季度技术SEO报告里有一行:可收录集合页数量下降,长尾覆盖收窄。写报告的人在陈述一个事实,他并不知道三个月前发生过一次UX改造。

而三个月前那次改造的复盘文档里,用的词是:认领成本、筛选器使用率、默认档占比、体型标签。

两份文档摆在一起,找不到一个共同的词。一个说的是集合页和覆盖,一个说的是标签和认领。它们描述的是同一个动作的两面,可是没有任何一个术语能把它们连起来。

于是那行预警被当成一条独立的技术问题,排进了SEO的待办,排在第七位。

一个改动的副作用,常常会以另一个部门的语言出现。而两种语言之间没有翻译。跨部门的因果链断在词汇表上,不是断在流程上——流程其实跑得很好,两边都按时交了报告。

第二层:同一个词,谁先说出口决定了它的性质

把这件事想透之后,我认为它是本文最反直觉的一条。

当初去掉那个入口的理由是对的:不该强迫用户先认领一个标签。

但站外那些人不是被强迫的。他们是自己在搜索框里把那个词敲出来的。他敲这个词的时候,那个词是他手里的一把钥匙——他很清楚自己要找什么,他在主动缩小范围。

同一个词,你在导航里替他贴上去的时候,它是一顶帽子。

字面完全一样,性质完全相反,区别只在于是谁先说出口的。

这条一旦成立,SEO和体验设计就会在同一个词上给出相反的建议,而且两边都没错。SEO说这个词有人搜、有排名、别动;体验设计说这个词有身份成本、不该当唯一入口。正确答案不是选一边,是把入口和通道拆开:词保留、页面保留、外部可搜;但站内主路径不强制经过它。

第三层:为什么后台曲线上看不出来

损失是分散的。那不是一个词,是几十个长尾组合,单看每一个都只有几十上百的月流量,掉了也不显眼。

同期站点在上新,又赶上了季节,自然流量大盘还在涨。一个负号被一个正号盖住,汇总曲线上一点痕迹都没有。

一次改动带来的损失如果分散在几十个小词上,而同期恰好有一个大盘在涨,那它在任何一张汇总曲线上都不会留下痕迹。唯一能看见它的办法,是在动手那一天就把受影响的词单独框成一组,单独出一条线。事后再想框已经晚了——你得先知道出了事,才会想到去框,而框起来正是为了知道出没出事。

后来改了三处

  1. 站外有搜索量的标签词,落地页恢复并单独维护。页面本身按包容性那套改过一遍(模特多体型、尺码表、合身子评分都在),所以恢复之后比原来那版还好用。
  2. 筛选器里高价值的组合(尺码档加品类)做成可被收录的集合页。这条顺手解决了另一批长尾。哪些筛选组合值得开放收录、哪些该拦住,判别方法在电商筛选URL的三类判别法集合页的机制与冷启动那两篇里,这里不展开。
  3. 流程加一条:任何下线一个标签、合并一个集合页的动作,必须先查这个词的站外搜索量与当前排名——由提这个改动的人自己查,不转给SEO。三条里这条最便宜,也最管用。转给别人查,就又变成两份文档的问题了。

结果:三个月内那一组词的流量回到改造前以上。

预期之外的一件事:从那个词搜进来的用户,退货率明显低于从站内筛选进来的用户。

想通之后觉得理所当然:他在打开你的页面之前,就已经替你完成了一次自我归类。而从站内导航一路点进来的人还没有。同一个页面对这两拨人,从来就不是同一个页面。

如果重来一次

只需要在那次改造的评审会上多问一句:我们要删掉的这个词,站外现在有多少人正在用它找我们?

这一句不需要任何额外数据,查一下就有,五分钟。而它会把整个讨论引到完全不同的方向。

最后一句是这次复盘里我最想留下的:包容性做的是别强迫用户认领一个标签,不是把这个标签从世界上抹掉。用户自己愿意用它的时候,它是钥匙;你替他贴上去的时候,它才是帽子。

所以这些改动该怎么分堆

分界线只有一句话:这个改动会不会让用户过去做过的一次自我归类作废。

第一堆第二堆
特征只增不改,不碰已有数据会让用户填过的值失效
例子模特小字、尺码表拆分、双单位、量法说明、按钮化、两个数据字段填满、合身子评分体型筛选组重构、尺码值改写、集合页合并或拆分、尺码偏好保存
周期按周按季度
必须拉谁前端与内容客服与SEO

第二堆为什么必须拉客服:因为用户会来问“我上次买的M,怎么这次变成L了”。这句话客服每天要回答几十遍,而提改动的人通常不知道会有这么一遭。

为什么必须拉SEO:上面那次翻车就是答案。

三档投入与三条停手信号

档位投入做什么
最小1到2周模特小字、两个数据字段、尺码表按品类拆
中等4到6周加合身子评分、评价表单引导字段、入口层三条、尺码选择器按钮化
完整一个季度建议身体测量区间进结构化数据、尺码偏好保存、多市场号型换算

只有最小档的人力,就老实只做最小档。最忌讳的是拿最小档的人力去啃第二堆,结果留下一批一半新一半旧的尺码值,比改之前更乱。

三条该停手的信号:

  • 先算绝对量,再算比例,顺序不能反。一个月只有几十次尺码相关退货的站,比例再难看也不值一个季度的人力。
  • 尺码表打开率上去了,退货率没动。说明问题不在信息量,在版型本身。这时候该去找供应链,不该继续找前端。
  • 发现自己在为一个词做改动,而这个词站外没搜索量、站内也没人点。那你优化的是一个不存在的入口。

做实验的三个坑

  • 分流单位必须是用户,不能是会话。尺码这件事的决策经常跨天,同一个人今天看明天买,按会话分流会把他劈成两半。
  • 观察窗口必须盖住一个完整的退货周期。30天退货政策就至少看45天,否则你只测到了下单,没测到退货——而这件事的收益一大半在退货那一侧。窗口一拉长,样本量的账就得重算,避免假胜利的3个样本量公式那一篇可以直接套。
  • 别拿转化率当唯一成功指标。这里有个很脏的陷阱:把尺码表做得更容易被忽略,短期转化率反而会涨,因为犹豫的人变少了。他们没有变得更确定,只是把犹豫推迟到了收货那天。

两周排期,可以直接抄

  • 第1到2天:把上一节那五个数跑一遍,出一张现状表。
  • 第3天:挑一个主力类目,人工盘商品页——模特数据有没有、尺码表对不对得上品类、双单位、国际换算、量法说明、选择器是不是按钮。一人一天够。
  • 第4到5天:版型与号型体系两栏批量填满,跑一遍feed诊断。
  • 第6到8天:模特身体数据小字上线,先做销量前50的SKU。
  • 第9到10天:尺码表按品类拆开。
  • 第二周最后两天:出汇报和后续观察方案。

两周结束,你手上会多一张别人没有的东西:一份按品类排的尺码信息完整度清单。它后面会一直有用,因为每次上新都要对着它过一遍。

立项怎么说,第一次会请谁

立项话术只有一句:这笔钱已经在账上了。退货运费、二次质检、库存周转变慢、客服工时,全都已经在发生,只是分散在四个部门的成本里,没有任何一张单子上写着“尺码信息不足”这五个字。

第一次会必须到两个人:

  • 管商品数据的人。他知道版型那一栏现在到底是什么状态,也知道批量更新要多久。这两件事没有他,会上说什么都是猜。
  • 客服。他手上有用户原话,而且他能当场说出哪几个SKU天天被问同一个问题——那几个SKU就是你的第一批改造对象。

谁最该先做,谁可以往后放

  • 最该先做:客单价中高、退货率高、尺码档位多的站。这三条同时成立的时候,收益基本是确定的。
  • 可以往后放:以均码和配饰为主的站。它没有这个问题,因为它压根没有“码”这个东西。
  • 还有一类站值得单独提醒:刚从代运营或者铺货转自营、商品页结构直接照搬供应商模板的站。供应商模板里那张尺码表通常是全品类通用的一张大表——在B端场景里它够用,因为看表的是采购,采购本来就懂号型。原样搬到C端,它就变成了本文前面说的那种“伤害大于零”的东西,而团队完全不会察觉,因为那张表看上去信息量很足,甚至比同行还全。B端商品页的信息组织是另一套逻辑,那套逻辑写在B2B产品详情页的14个模块那一篇里,两边最好别互相抄。

季度复查,半小时三件事

这件事做完之后会有一段安静期,而安静期正是它悄悄退化的时候——上新会带进新的品类,新品类默认继承一张不对口的尺码表;换供应商会换一套号型;改版会把尺码表链接挪远。所以每季度留半小时:

  • 抽三个当季新上的SKU,走一遍完整流程。从列表页点进去,找尺码表,按返回键,看模特数据在不在。三个SKU十分钟。
  • 重跑那五个数,只看方向不看绝对值。默认档占比在往回走,说明入口层被某次改版削掉了。
  • 翻当季度评论里的尺码词,看有没有新冒出来的SKU。冒出来的那几个多半是新供应商的版型问题,越早发现越便宜。

复查清单里不要设置已解决这个状态,只留在跟踪与已停止跟踪,并写明是谁批准停止的。一件事一旦被标成已解决,就再也没人会去看它了,而它回来的时候不会发通知。这一条不花钱也不用开发,只要把复查模板里那个已解决的选项删掉;剩下的靠惰性就会自动生效,因为没人愿意主动写申请。

常见问题解答

大码这类独立入口,到底该不该保留?

要保留,但要改它的性质。判断依据不是这个词伤不伤人,是站外有没有人主动在搜它。有人搜,说明它对那批人是一把钥匙,删掉等于把已经举着钥匙来的人关在门外。正确做法是页面保留、内容维护、可被收录,同时把站内的主发现路径改成不依赖它——纯尺码值能筛到,常规品类路径里也能筛到。入口和通道是两件事:入口多一个不吃亏,通道只有一条才危险。另外,保留下来的这个页面本身也要按包容性那一套改一遍,多体型模特、分品类尺码表、合身子评分都得在,否则你只是把一个旧页面原样挂了回去。

尺码表该给成衣尺寸还是身体尺寸?

两个都要给,而且要分开标清楚,这是最容易被合并成一栏的地方。成衣尺寸描述的是这件衣服本身,身体尺寸描述的是这个码适合什么样的人,两者之间差着一个放松量,而放松量随款式变化,用户算不出来。只给成衣尺寸,他量完自己也不知道该选哪一档;只给身体尺寸,想拿家里那件已有的衣服比对的人又没法比。国际语义规范里这两件事本来就是两个不同的字段,一个描述商品,一个描述目标人群的身体测量区间。做成两组列或者两个切换标签,成本都不高,真正的成本在把每个品类的数据补齐,那是内容活儿不是开发活儿。

版型那一栏不填,实际会有什么后果?

不填等于全部按常规处理,这是规范里写明的默认行为。后果有两层。第一层是你的非常规版型商品在平台的版型筛选里根本不出现,不是排得靠后,是不进结果集,而使用这个筛选的人恰恰是意图最明确的一批。第二层更麻烦:你自己的报表看不出任何问题,商品照常展示、照常有曝光,只是少掉了一个入口的曝光,而这部分缺失没有任何地方会告警。填这一栏通常是一次批量更新的事,成本极低,难点只在于得有人想到去填。顺手把号型体系那一栏也显式提交,不提交系统会按目标国家默认,多市场站一旦猜错,整批商品的码都是错的,同样不报错。

引导用户在评价里填身高体重,真会有人填吗?

填的人比想象中多,前提是问法对。三条经验:第一,别做成必填,必填会把整张评价表单的完成率拉下来;第二,给区间选项而不是让他输精确数字,选一个区间的心理成本远低于打一个具体数,而对后来的读者来说区间已经够用;第三,把这几项放在星级之后、正文之前,此时用户已经开始投入了,多两个选项不会中断他。还可以直接告诉他这些信息会帮到谁,一句下一个跟你身材接近的人会看到这条,比任何激励都管用。就算填的人不多也没关系,你要的不是全量,是每个SKU上有那么十几条带身体数据的评论,够后来的人找到参照。

做合身子评分是不是非得换一套评论系统?

多数情况下不用。主流评论应用大多支持自定义评分维度,加一个合身维度通常是后台配置项,不需要开发。真正要做的功课是两件。一是刻度怎么设:偏小、正好、偏大这样的三档或五档,比一到五星好读得多,因为它表达的是方向不是好坏。二是历史评论怎么办:新维度只对新评论生效,聚合样本一开始很小,别急着露出,攒够一定条数再展示,否则拿两三条算出来的合身结论会把人带偏。如果系统实在不支持,退一步的做法是由运营根据评论内容在商品页手工维护一句版型提示,虽然不体面,但用户拿到的信息是一样的。

退货原因里尺码不合占比很高,是不是该先改尺码表?

先别急。退货原因是从一个固定下拉框里选出来的,而尺码不合通常排得很靠前。里面混着大量别的东西:穿上不好看、面料手感不对、下单时上头了、懒得解释所以选了最省事的一项。用户在你给的词表里找不到更贴切的说法,就选了最接近的那个。判别办法有两个:一是看这批订单有没有同款换码的复购,有换码复购的才更可能是真尺码问题;二是去读退货备注里那半句手写的话,那里的信息比下拉框可信得多。确认是真问题之后还要再分一次,集中在少数几个SKU上的是版型跑了该找供应链,散布在全品类的才轮到尺码信息不足这个结论。

多市场站的号型换算,做到哪一步算够?

分三档,按市场贡献排。第一档必做:尺码表里给出目标市场的号型换算列,美、英、欧、日几套体系并排列出。少了这一步,国际用户只能离站去查,而离站的人不一定回来。第二档是在商品数据里显式提交号型体系,别让平台按目标国家去猜,这一步影响的是你在平台筛选里的准确性。第三档是按访问者所在地自动切换默认展示的体系,同时保留手动切换,这一档要动前端和地理判断,属于按季度排的活儿;而且一定要把用户手动切过的选择记住,否则他每翻一件商品就得切一次,那比不做还烦人。

权威参考资料

分享到
标签
版权声明

本文标题:《行业标准把多数成年人算成大码,可只有24%的女性会这样描述自己》

本文链接:https://zhangwenbao.com/apparel-size-self-identification-label-gap.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交