她对着手背比了半天色号,你整页商品信息里没有一条是写给她的

她对着手背比了半天色号,你整页商品信息里没有一条是写给她的
张文保 87 分钟阅读 2,774 阅读
本文目录
  1. 她对着屏幕比了半天手背,到底是在算一道什么题?
  2. 她要的到底是哪一条信息
  3. 缺的那一半长什么样
  4. 三句可以直接拿去用的判据
  5. 为什么这件事在美妆上先崩
  6. 这跟“信息过载”是两回事
  7. 用户不是不会算,是手里没有材料
  8. 它在报表上会变成什么样子
  9. 把商品讲得更清楚这条路,走到第三轮就没有用了
  10. 怎么判断自己正在单侧施工
  11. 保哥的失手:三轮改进全落在同一侧
  12. 指标真的改善了,问题一动没动
  13. 把测量从用户手里拿回来
  14. 三条留下来的规矩
  15. 为什么单侧施工在组织里特别舒服
  16. 另一个隐蔽的原因:内部人都知道答案
  17. 那次复盘留下的一份对照表
  18. 顺带纠正一个常见的误读
  19. 色号的名字该由谁来起,品牌还是要买它的人?
  20. 两套命名,一个都不是给买它的人用的
  21. 谷歌早就要求你把颜色写两遍
  22. 规范里那串禁令,说的全是同一件事
  23. 顺便堵掉两个常见的借口
  24. 2026年5月新加的那个属性
  25. 没有公用尺子这件事,有多严重
  26. 一套可以照抄的色号命名规范
  27. 顺手把标题那一段也理顺
  28. 结构化数据那一侧也只有一半
  29. 一排只有颜色的方块,为什么算是最低一级的无障碍问题?
  30. 先把那条原文摆出来
  31. 规范给了一条豁免,粉底刚好用不上
  32. 落到色号选择器上,具体要改几处
  33. 顺手多接住一批人
  34. 这条要求在欧盟已经不只是指南了
  35. 把它当成合规和体验的重合区来卖
  36. 顺手接住机器那一侧
  37. 一个五分钟的自查
  38. 成分表是整页写得最全、也最没法读的一栏
  39. 成分表的排序规则不是按重要性来的
  40. 同一份配方,两份都合法的成分表
  41. 彩妆那一栏,清单甚至不对应你手上这一支
  42. 法规把商品那一侧拉满,又把用户那一侧按住
  43. 唯一一处按“有什么用”排序的地方
  44. 那商品页上到底能做什么
  45. 国内的规则在这件事上走得更远一步
  46. 为什么这一栏值得花力气,哪怕没几个人读
  47. 顺便处理一个容易忽略的坑
  48. 商品图要补的到底是这件商品,还是站在屏幕前的那个人?
  49. 三类图各自在回答哪个问题
  50. 为什么真人图这一类最容易做成假动作
  51. 拍摄侧的三条具体要求
  52. 移动端上那个来回滚动的坑
  53. 他去站外找图这件事,比看起来更贵
  54. 模特图那一档的数量,怎么定才不是拍脑袋
  55. 手臂试色图的三个技术细节
  56. 视频那一格该怎么排
  57. 图片这一侧还有个白拿的收益
  58. 做了试色工具,为什么两边的数还是没对上?
  59. 两段几乎一样的操作,结局完全不同
  60. 为什么这一步最容易被漏掉
  61. 合并这一步的四条验收
  62. 别用打开率验收这类工具
  63. 浮层这个容器本身就是问题的一部分
  64. 回写之后,那句话该怎么写
  65. 用户推翻了推荐结果,这件事怎么记
  66. 把这一步写进提测清单的具体句子
  67. 评论区那颗星,为什么不如一句这个人跟我像不像?
  68. 星级说明它对某个人有用,那个人是谁没写
  69. 前台筛不出来,是因为采集端就没这一栏
  70. 每个品类要收的属性不一样
  71. 展示上的三条
  72. 顺手说说小样这件事
  73. 补字段这件事的时间账,要提前算清楚
  74. 属性别做成必填
  75. 展示的时候别把星级砍掉
  76. 为什么这一栏在AI那边的权重在涨
  77. 除了美妆页,还有哪些地方也在单侧施工?
  78. 跟“标签词不对味”是两回事
  79. 两种解法,怎么选
  80. 你站上唯一一处用户主动交出自己那一侧信息的地方
  81. 为什么这七个马甲很少被归到一起
  82. 怎么在自己站上做一次横向盘点
  83. 切搜索日志的具体办法
  84. 一个反向提醒:别把用户不需要的输入也收了
  85. 不加一行埋点,今天能先看哪五个数?
  86. 五个不用新增埋点的数
  87. 动手顺序:两个维度相乘
  88. 一个动作就能验收
  89. 卡点挂在哪一步
  90. 五个数的具体口径,别跑歪了
  91. 把结果讲给不同的人听
  92. 这套东西的边界在哪
  93. 最后一句
  94. 常见问题解答
  95. 色号旁边加一句文字描述,会不会显得页面很啰嗦?
  96. 没有预算做试色工具,还能做什么?
  97. 成分表旁边写成分作用,会不会踩到合规红线?
  98. 只有一款主推色,还需要考虑这些吗?
  99. 这套判断只适用于美妆和服饰吗?
  100. 补齐这些字段,对AI购物助手的可见度有帮助吗?
  101. 怎么说服团队把资源从“把商品讲清楚”挪一部分过来?
  102. 权威参考资料

摘要:商品页上写的每一条信息都是关于这件商品的,而用户要下的每一个判断都需要两个输入——商品是什么,加上他自己是什么。缺的那一半从来没出现在页面上,于是求值这一步被悄悄交给了用户,而他手里往往没有算它的材料。美妆是这个缺口最先崩掉的品类,因为色号、成分和评价三样东西都必须落到某一张具体的脸上才产生意义。下面用一场3000多小时的可用性测试、两部化妆品标注法规和一条谷歌商品数据规则把这个缺口拆开,再给出五个不用新增埋点、今天就能跑的诊断口径。

她对着屏幕比了半天手背,到底是在算一道什么题?

她不是在判断这支腮红好不好,她是在判断这支腮红长在自己脸上是什么样。这两件事需要的输入不一样,而页面上只备了一份。

一位受访者在丝芙兰的手机站上看一款腮红。她划到手臂试色那张图,对着屏幕比划了几下,说了句“这个5号或者6号应该就是我的脸”。

然后她开始翻后面的图,想找一张真人上妆的照片确认一下。翻完了,她说了这么一段:不太喜欢他们没放几张模特上脸的照片,模特很漂亮,但我的肤色没她那么深,希望能多几个不同肤色的选项。

最后她退回了列表页:“我再看看别的吧,这个我应该不会加购。”

这一整段行为里,最值得停下来想一想的不是她放弃了,而是她放弃的那一刻,页面上其实什么都不缺。图片有十几张,色号有二十几个,成分表完整,评价四星半,价格清清楚楚。她要的那个东西,一条都不在上面。

她要的到底是哪一条信息

把她的问题写下来,是这样一句:这个色号在我的脸上是什么样。

注意这句话里有两个东西——“这个色号”和“我的脸”。页面把前一个讲得非常充分,后一个连提都没提过。

这不是文案没写好,是结构上就没有那一栏。商品页的整套信息模型是围绕商品建的:标题、图片、参数、价格、库存、评价,每一条的主语都是这件商品。而用户在页面上要完成的动作,主语是他自己。

换成一句更硬的说法:页面提供的是一个只有一个自变量的函数,而用户要求值的那个函数有两个自变量。第二个自变量——他的肤色、他的肤质、他的脸型、他上一副眼镜多宽、他家玄关多深——从来没有被收进来过。

于是求值这一步就落到了用户头上。他得自己知道自己是几号,自己知道那个成分是干什么用的,自己判断那个五星评论者跟自己像不像。这三件事他多半都不知道,而页面默认他知道。

缺的那一半长什么样

把美妆商品页上的主要信息块摊开,缺口的形状是一样的:

信息块页面给了什么用户还差什么他会怎么处理
色号色块二十几个方块,各配一个名字我的肤色对应哪一格凭图猜,猜不准就走
色号名称亚麻、姜黄、4N1、NW20这些词换算成什么颜色当成噪音跳过
成分表一份按重量降序的完整清单哪几个对我这种肤质有用整段不读
评价星级、条数、文字写这条的人跟我像不像去站外找同类人
模特图一张脸,通常是一张跟我肤色接近的那张翻完没有就放弃

最后一列是关键。用户对这类缺口的处理方式不是“降低预期继续买”,是“跳过”或者“离站”。他不会给你留下一次点击、一条搜索、一封工单,页面上什么痕迹都不会有。这一点跟商品列表页上那些被扫过一遍却一个都没点开的商品是同一类现象:拒绝发生了,记录没有。

三句可以直接拿去用的判据

怎么判断一块信息是不是缺了第二个自变量?三句话就够:

第一句:这条信息在不知道读它的人是谁的情况下,能不能得出结论?“净含量30毫升”能,“适合中性偏干肌肤”能,“色号:马提尼克”不能。

第二句:如果不能,站内有没有一条路让用户把自己那一侧的信息交进来?试色工具、肤质问卷、尺码换算、上传照片,都算。一条都没有就是纯单侧。

第三句:交进来之后,两侧有没有在同一个屏幕上合并?这一句杀伤力最大,因为大量团队做完了第二步就收工了——工具算出了答案,答案留在浮层里,用户关掉浮层回到商品页,选择器还停在默认色号。

三句都过了,这块信息才算做完。多数商品页停在第一句就没有再往下走。

为什么这件事在美妆上先崩

它当然不是美妆独有的。但美妆是几个条件同时拉满的品类:

其一,它是视觉驱动程度排第二的电商品类,仅次于服饰配饰。视觉驱动的意思是,用户对这类商品的判断主要靠看,而不是靠读参数。

其二,它的决策变量落在同一个色相内部的连续渐变上。你没法用“深色/浅色”这种粗粒度把它区分开——差别小到要凑近看,而商业价值恰恰在那些小差别里。

其三,它没有一把公用的尺子。服装好歹还有国际尺码标准可以违反,鞋子还有脚长毫米数,粉底的“中等色”在两个牌子之间可以差出一个色阶,而且谁都没做错。

三条叠在一起,缺第二个自变量的代价被放大到肉眼可见:用户不是买错,是根本不敢下单。这在报表上表现为加购率低而不是退货率高,所以它常年被归到“流量质量不行”那一栏里去。

这跟“信息过载”是两回事

看到用户在页面上找不到东西,第一反应常常是信息太多了,该做减法。这个诊断在很多场景下是对的,在这里是反的。

信息过载的症状是用户读了一堆,判断被稀释——他知道每一条说的是什么,只是懒得挨个权衡。减法有用,因为剩下的每一条他都能用。

缺第二个自变量的症状是用户读了一堆,一条都用不上。他不是被淹没,是拿到一手没法出的牌。这时候做减法只会把牌变少,牌的性质没变。

怎么区分?看用户放弃的姿势。信息过载的人会犹豫、会来回比、会加进收藏夹再说;缺输入的人是翻到某一处发现没有,然后直接退出去,动作干脆得多。开头那位受访者就是后一种,她翻完图说了句“我再看看别的”,全程不到两分钟。

用户不是不会算,是手里没有材料

还有一个容易混的判断:这批用户是不是就是“不专业”,多教一教就好了。

教育型内容当然有用,但要看教的是什么。教知识有用,教测量基本没用。告诉用户“底色分冷调、暖调和中性调,冷调偏粉、暖调偏黄”,这是知识,他读完确实多懂了一点;接下来让他自己判断“那我是哪种”,这就是测量,而他手边没有工具、没有参照物、也没有对照过的经验。

行业里那些流传很广的自测方法——看手腕血管颜色、拿白纸贴脸、比对首饰金银——之所以都不太靠谱,正是因为它们本质上是在让人用肉眼做一次色彩测量,而肉眼在没有参照物的情况下做不了这个。

所以这一块的结论有点反常识:面对缺输入的用户,写教程的性价比通常低于给参照物。一张跨肤色的手臂试色图,比一篇两千字的底色科普管用得多,因为它把测量这件事变成了对比这件事,而对比人人都会。

它在报表上会变成什么样子

这个缺口在数据上有一组相当稳定的特征,认出来之后回头翻旧报表会有不少发现:

  • 商品页停留时长不低,甚至偏高——他确实在认真看
  • 图片轮播的翻页深度偏深——他在找那张找不到的图
  • 变体切换次数偏多——他在自己求值
  • 加购率低,而不是退货率高——他压根没敢下单
  • 跳出到站外的比例偏高,去向多是搜索引擎和视频平台

这一组特征最容易被误读成“流量质量不行”。因为除了最后一条,其余几条单独看都像是高意向用户的行为,而结果又是没转化,于是很自然地被归到“看着像意向、其实不是目标人群”那一栏里去。

判断这个归因对不对,有个简单办法:把这批人跟真正的低意向流量放在一起比图片翻页深度。低意向用户不会把二十张图翻到底,他连第三张都懒得点。翻到底还走的那批人,缺的绝不是购买意愿。

把商品讲得更清楚这条路,走到第三轮就没有用了

参数更全、图更大、说明更细,每一轮都在同一侧加码。判断自己是不是也在单侧施工,有一个不用查数据的办法。

缺第二个自变量这件事,最麻烦的地方不在于它难修,而在于它的症状会把你引到错误的那一侧去

用户说“看不出来适不适合我”,团队听到的是“信息不够”。于是下一轮就去补信息:参数写全、图放大、描述加长、再配个对照表。这些动作全都发生在商品那一侧,而缺口在人那一侧。

补得越勤,页面越长,用户要过滤的东西越多,判断反而更慢。这是单侧施工特有的一种代价:它不只是白做,它会主动把体验拖差一点点。

怎么判断自己正在单侧施工

不用查数据,翻一下最近三轮迭代的需求列表就行,问一句:

这些改动,是不是在完全不知道任何一个具体用户是谁的前提下,就能全部做完?

能——那就是单侧。加字段、改排版、换图、扩文案、调顺序,全都是。这类需求有个共同的舒服之处:它们不需要拿到任何外部输入,团队自己关起门来就能交付,评审时也没人反对。

反过来,凡是要求“先知道这个人是谁”的需求,做起来都别扭得多:要收数据、要问用户、要处理没填的情况、要考虑隐私、要处理错的情况。所以它们在排期表上永远排在后面,理由通常写着“先把基础的做完”。

可“基础的”那一侧是永远做不完的。参数可以一直加,图片可以一直拍。一条能无限延伸的路,会持续消耗掉本该分给另一侧的预算。

保哥的失手:三轮改进全落在同一侧

说个自己踩过的。前两年接过一个做眼镜的出海独立站,光学镜架加太阳镜,客单价不低,问题是退货率长期偏高。后台的退货原因里,“尺寸不合适”这一项占了大头。

诊断结论看着毫无悬念:尺寸信息没讲清楚。于是三个月里做了三件事——

第一件,把镜架三围(镜宽、鼻梁宽、镜腿长)从规格表里提出来,做成商品图旁边的独立模块,字号加大。第二件,配了一张标注图,把这三个数字画在镜架示意图上。第三件,写了一篇“怎么量自己的脸宽”的教程页,从产品页挂过去。

指标是有反应的:商品页停留时长涨了,教程页的自然流量还不错,退货原因里“尺寸不合适”的占比确实降了下来

季度复盘的时候,客户那边的运营先发现了不对劲:那一项的占比是降了,可退货总量几乎没动。降下去的那些人,改选了另一个选项——“款式不适合我”。

指标真的改善了,问题一动没动

这就是这次失手最难受的地方。前面几次栽跟头,多少还能怪到预警上:要么没有预警,要么预警响了没人读,要么读成了好消息。这一次预警响了、收件人对、被读懂了,指标还真的往好的方向走了一格。

因为那格指标衡量的是商品那一侧讲清楚了没有——它确实讲清楚了。而用户缺的从头到尾是自己那一侧的数字:他不知道自己脸多宽。

那篇教程页更是把这层说透了。PV不低,看着像是有人在用。真去翻行为数据才发现:平均停留20秒出头,滚动深度绝大多数停在第一屏。教程第一句写的是“请准备一把软尺”,多数人读到这儿就退出去了。

没有人会为了买一副眼镜专门去找尺子。这不是内容质量问题,是把一件本该由系统完成的测量派给了用户

把测量从用户手里拿回来

后来真正见效的是两个动作,都跟“讲清楚”无关。

第一个针对老客:去翻他自己的历史订单。一个买过两副、一副都没退的用户,他手上那副镜架的三围就是他那一侧的数字,早就躺在订单表里。于是复购时直接在商品页上写一句“你上一副是138毫米,这副142毫米,会略宽一点”。这句话没有教任何人量脸,它把用户过去那次成功的选择直接换算成了这次的参照。

第二个针对新客:用一张自拍加一件全球统一尺寸的参照物完成标定。银行卡的宽度是国际标准写死的85.6毫米,误差极小,人人手边都有一张。让用户举着卡拍一张正脸照,脸宽就能算出来,全程不需要软尺,也不需要读教程。

这两个动作上线之后,退货总量才开始真的往下走。

三条留下来的规矩

这次之后定了三条,后来做别的品类也一直在用:

第一,每一次没有被退货的历史订单,都是一次已经完成的、免费的、用户自己签过字的测量。拿不到用户那一侧的数据时,先别急着去问他,先去翻他过去做过的成功选择——那次选择本身就是测量结果,而且比问卷诚实得多。

第二,凡是需要用户自备工具才能完成的步骤,都要按“这一步不会发生”来估算。软尺、色卡、卷尺、体重秤,只要它不在手机里,就当它不存在。要么换一个人人都有的参照物,要么这一步自己扛下来。

第三,改进方案评审时加一栏,写清这一条改的是哪一侧。只有一栏,两个选项。连着三轮全落在同一侧,评审就要停下来问一句为什么。这一栏加进去的当月,那个季度积压的需求列表里,有六成条目属于同一侧。

最后一条其实最便宜——它不需要任何数据支持,也不需要新工具,只是逼着团队每次说出口一次。跨境电商降退货率那套预防体系里的动作大半都可以重新按这一栏分一遍类,分完就知道预算歪到哪儿去了。

为什么单侧施工在组织里特别舒服

那个眼镜项目复盘完,最扎人的问题不是“为什么没想到”,而是“为什么三轮都没人喊停”。

回头看,原因不在能力,在这三件事做起来实在太顺了

它们不需要跨部门。提字段是前端加设计,画标注图是设计,写教程是内容。三件事各自在一个部门里就能闭环,不用等谁,不用排会。

它们的交付物很明确。模块上线了、图画好了、文章发了,每一件都能在周会上拿出来说,都有截图。而“把用户脸宽这个数拿到手”是个没有交付物的目标,说不清楚做到什么程度算完成。

它们不会失败。把三围提到显眼位置,这件事百分之百做得成,只是有没有用不好说。而做测量方案要试、要错、要返工,中间任何一步卡住都会在项目状态里挂红。

三条加起来,就形成了一个相当强的组织偏好:在不确定该做什么的时候,团队会自动漂向那些确定能做完的事。而商品那一侧永远有确定能做完的事,所以漂过去的概率接近百分之百。

另一个隐蔽的原因:内部人都知道答案

还有一层,跟能力和流程都无关。

做眼镜的人,眼里的镜架三围就是活的。他看一眼138和142,脑子里直接浮现出宽窄差别,因为他每天摸这些东西。对他来说,把这三个数写清楚,就等于把问题讲清楚了。

同理,在美妆公司里,几乎每个人都知道自己是什么底色——这是个入职三个月就会被同事顺手教会的常识。所以当有人提出“用户不知道自己是冷调还是暖调”时,会议室里最真实的反应是轻微的意外。

一个团队对自己产品的熟悉程度,恰恰是它最难发现这类问题的原因。缺的那个自变量对内部所有人来说都是已知量,于是那个函数在他们眼里就是一元的,一点毛病没有。

这也是为什么这类问题几乎不可能靠内部评审发现——评审桌上坐的全是知道答案的人。它只能靠看真实用户操作,或者靠前面那个“逐句问能不能得出结论”的机械动作,因为机械动作不依赖判断力。

那次复盘留下的一份对照表

后来把眼镜那次的三个动作和真正见效的两个动作并排列了一下,这张表在后面几个项目里被反复拿出来用:

动作在哪一侧指标反应退货总量
三围提到显眼位置商品侧停留时长涨基本不动
加尺寸标注图商品侧图片查看率涨基本不动
写量脸宽教程看着像用户侧教程页有流量基本不动
复购时对比上一副的尺寸用户侧复购转化涨开始下降
银行卡参照物拍照标定用户侧使用率一般下降明显

第三行是这张表里最值得琢磨的一行。那篇教程从形式上看是站在用户那一侧的——它讲的是“你怎么量自己”——但它把执行成本原封不动留给了用户,所以实际效果跟前两行没有区别。

由此得出一条判断标准:看一个动作在哪一侧,不看它讲的是谁,看执行这一步的人是谁。讲用户但要用户自己动手的,仍然算商品侧;讲商品但由系统替用户算完的,才算用户侧。

最后一行的“使用率一般”也值得说一句:那个拍照标定功能的使用率从来没高过,但用了的人退货率低得非常明显。这类功能不该按覆盖率考核,该按差值考核——这一点和后面要说的匹配工具是同一个道理。

顺带纠正一个常见的误读

有人会把这套说法理解成“别在商品信息上花力气了”。不是这个意思。

商品那一侧的基本功必须扎实——参数准确、图片清晰、库存真实,这些是入场券,缺了什么都别谈。要警惕的是这一侧的边际收益早就掉下来了,而团队还在往里加钱。

判断有没有到那个点,看一个信号:最近一次商品信息的改动,用户有没有在任何渠道提到过。没有人提,说明它已经进了“该有的都有了”那一档,再往上堆用户是感知不到的。这时候预算就该往另一侧挪了。

色号的名字该由谁来起,品牌还是要买它的人?

亚麻、姜黄、马提尼克,还有4N1和NW20。这些名字在品牌手册里各有出处,在买它的人手里一个也用不上。

可用性测试里有一段对话,把这件事讲得比任何理论都清楚。

一位受访者在看一款粉底的色号列表,念出了几个名字:亚麻、姜黄、内衣色。她说了一句:“起码得告诉我这是中等还是深一点,是暖调还是冷调吧。”翻了一圈没找到,她放弃了这款产品,原话是“算了,我也搞不清”。

另一位受访者遇到的是另一种写法——只有编号。她的反应更直接:“有个代号没问题,但你后面总该跟一句'浅色偏中性'吧……这一下子就把我整懵了。”同样没有加购。

两套命名,一个都不是给买它的人用的

美妆的色号名基本只有两个流派。

一派是幻想名:亚麻、姜黄、太浩湖、马提尼克。这类名字是品牌资产的一部分,写在品牌手册里,有调性,有故事,在广告片里非常好用。

另一派是编码:4N1、NW20、SF11。这类名字在实验室里非常好用,一个字符对应一个变量,配方师一看就懂。

两派的共同点是:它们都是给内部人用的。一个服务品牌部,一个服务研发部,谁也没打算服务屏幕前那位对着手背比划的人。

更麻烦的是,色号名这套体系在跨品牌的时候彻底失效。A牌的“中等色”可能比B牌的“中等色”更深,也可能更暖。用户在一个牌子上辛苦攒下来的经验,换一个牌子归零——这是他放弃自己判断、转而去找试色工具或者干脆去社交平台搜的直接原因。

谷歌早就要求你把颜色写两遍

有意思的是,这件事在商品数据那一侧,已经被规范写清楚了,而且写得相当直白。

谷歌商品数据规范里的颜色属性说明要求:提交的颜色值必须跟落地页上写的一致。落地页上写的是“烤核桃色”,你就得提交“烤核桃色”,不许自作主张改成“棕色”。这一条是硬性要求,不照做商品会被拒。

但同一份文档的最佳实践部分,紧接着写了另一句:标题里要放用户会去搜的那个标准颜色名。原话的例子是,顾客更可能搜“红色连衣裙”,而不是“肉桂苹果色连衣裙”。

官方给的示例表格甚至直接把这两栏并排放着:颜色属性填“芒果爆炸”,标题里写“橙色”;颜色属性填“夜幕降临”,标题里写“黑色”。

这份规范承认了一件事:品牌给颜色起的名字和用户用来找颜色的词,是两个不同的东西,都要写,各写各的位置。

而Baymard观测到的商品页现状是:只有第一个,没有第二个。喂给搜索引擎的数据里老老实实写了两遍,给人看的那一页上只留了一遍——留下的还是内部那一遍。

规范里那串禁令,说的全是同一件事

颜色属性的最低要求里还有一串禁令,单独看每条都像技术校验,连起来看就是一份态度声明:

  • 不许用数字当颜色,比如“0 2 4 6 8”
  • 不许用非字母数字字符,比如“#fff000”
  • 不许只写一个字母,比如“R”(中日韩文字例外,“红”这样的单字可以)
  • 不许写“见图片”
  • 不许写不是颜色的值,比如“多款”、“男款”、“不适用”

每一条禁的都是同一类东西:把颜色表达成代码、色值、图片指针或者占位词。规范的立场很清楚——颜色必须用人能读的词写出来。

而“4N1”、“NW20”、“SF11”,正好一条不落地踩在这份清单上。它们不是被明文禁止的那几个字符串,但它们属于被禁的那一类:需要另一份对照表才能解码的字符串

顺便堵掉两个常见的借口

提到写色号描述,最常听到的两句反对是“字段放不下”和“这是品牌调性”。两句都站不住。

字段长度:颜色属性的限制是总长1到100个字符,单个颜色1到40个字符。“中等色调偏橄榄底色”这类描述,中文九个字,英文二十七八个字符,离40还差得远。放不下这个说法,在规范层面就不成立。

品牌调性:没有人要求你删掉“马提尼克”。谷歌那份规范给的做法是两个都留,各占各的位置。落到商品页上就是同一行里前后放:马提尼克 · 中等偏深,粉黄混合底色。品牌名在前保住调性,描述在后接住判断。花不了多少字。

顺带说一句,这两个名字还该进不同的地方:幻想名进颜色属性和商品标题的品牌段,标准色名进标题里用户会搜的那一段。这一层的取舍,跟产品变体的URL该合还是该拆是同一类问题——决定权在用户怎么搜,不在你内部怎么编号。

2026年5月新加的那个属性

还有一条比较新的变化值得留意。2026年5月,谷歌在商品数据里加了一个“变体选项”属性,作用是让你显式声明——这件商品的变体到底是按哪个属性在变

官方建议是,如果颜色是区分变体的属性,那就颜色属性和变体选项属性两个都提交,帮系统更好地理解变体关系。

这个新属性透露的信息是:连“哪个维度才是用户在选的那个维度”这件事,都需要你主动说出来,系统猜不准。你自己站内的选择器同理——一排色块摆在那儿,用户也未必知道这一排是在选颜色、选容量还是选套装。

没有公用尺子这件事,有多严重

值得单独展开一下,因为它决定了这个品类的解法上限。

服装尺码虽然乱,但它至少有一批国家标准和行业标准在那儿,各家怎么偏离都能找到一个基准去描述。鞋子有脚长毫米数,虽然各国换算不一样,但那个毫米数本身是客观的。

粉底色号没有这样的东西。不存在一个跨品牌的色号编号体系,也不存在一个被行业公认的底色分类标准。医学上倒是有按日晒反应给皮肤分型的方法,被广泛引用了几十年,但它分的是“晒不晒得黑、会不会晒伤”,跟“你是粉调还是黄调”完全是两个维度,拿来选粉底用不上。

结果就是每个品牌各建一套。A牌的中等色和B牌的中等色可以差出一个色阶,而且两边都不算做错——它们本来就不指向同一个客观值。

这带来两个后果。第一,用户在一个牌子上积累的经验换牌子就归零,这是他反复求助于试色工具和社交平台的根本原因。第二,也是更实际的:你没法靠“对标行业标准”来解决这件事,因为没有那个标准可对。只能自己在站内建一套内部一致的描述体系,至少保证同一个站里的用词是一个意思。

顺便说一句,这也是这件事有长期价值的原因。凡是行业里有公共标准的事,做好了不构成优势,因为大家迟早都会做到;凡是没有公共标准、只能各家自己建的事,做好了这个优势能留很久。

一套可以照抄的色号命名规范

把前面这些落成一份能直接交给内容团队的规范,大概是这样:

格式:品牌名 · 色深档 + 底色。比如“马提尼克 · 中等偏深,粉黄混合底色”。品牌名不动,后面那截固定结构。

色深档要有限且全站统一。建议五到七档,从最浅到最深依次命名,全站所有产品线共用同一套档位名。档位不能随产品线增减,否则跨产品对比又失效了。

底色用三到四个词封闭取值。粉调、黄调、中性、橄榄调,就这几个,不要发明新词。封闭取值的好处是它可以直接变成筛选器的选项。

禁止在这段描述里出现任何幻想词。“温暖蜜糖色”不行,因为“蜜糖”既不是色深也不是底色,它是第三种命名法混进来了。这条要写死,否则文案同学会不自觉地把品牌调性渗进来。

同一段描述要同时出现在四个地方:色号选择器旁、商品标题的可读段、商品数据源的相关字段、以及筛选器的选项名。四处不一致,用户会以为是四个不同的东西。

顺手把标题那一段也理顺

既然规范要求标题里放用户会搜的标准色名,那商品标题的结构也该定一下。一个能同时喂饱人和搜索引擎的写法是:

品牌 + 品类 + 标准色名 + 品牌色号名 + 规格。比如“某某牌 持妆粉底液 自然色(马提尼克SF11)30ml”。

标准色名在前,是因为它是用户输入搜索框的那个词;品牌色号名放括号里,是因为它是用户在客服对话、评价和社交平台上会看到的那个词,两个都要能被搜到。

这一层跟产品详情页怎么摆脱供应商文案做出唯一内容说的是同一件事:标题不是给内部编号用的位置,它是这个页面上唯一一处必须完全按用户语言写的地方。把内部编码原样搬上去,相当于把这块最贵的位置让给了没人会搜的字符串。

结构化数据那一侧也只有一半

顺着规范这条线再往前一步会发现,缺的这一半在机器可读的那一层同样缺。

schema.org的商品组类型一共只有三个自有属性:指向各个变体的hasVariant、一个文本标识符productGroupID,以及说明变体按哪些属性变化的variesByvariesBy的取值就是属性短名,比如color;而color本身在商品类型下是纯文本。

也就是说,整套词汇表能表达的是“这组商品有二十四个变体,按颜色区分,各自叫什么名字”,没有任何一个字段能表达“这个颜色适合什么肤色”。

这跟前面商品数据规范的情况是一致的:能描述商品,不能描述匹配关系。结构化数据平时的一大好处是“字段的存在本身就是一次提醒”——看到有个字段没填,你会想起这件事该说;而这一格根本没有那个空位,所以它永远不会提醒任何人。

实际能用的补位办法是additionalProperty,它就是为“schema里没有对应属性的特征”准备的通用容器。用它挂一组自定义键值对,比如色深档和底色,机器至少能读到这几个词。它不会带来富结果,但AI助手在读页面时能拿到这层信息,而这已经是目前唯一能把匹配维度写成机器可读的办法。做之前建议先看一眼哪些结构化数据该做别再凭感觉堆类型,别为了这一格把整份标记搞复杂。

一排只有颜色的方块,为什么算是最低一级的无障碍问题?

无障碍规范给了一条豁免:颜色差别够大就不算只靠颜色。粉底色号是全网最拿不到这条豁免的一类色块。

把色号描述当成体验优化建议,是这件事被排期排到后面的主要原因——建议嘛,有空再说。

但它其实不是建议。它是无障碍规范里级别最低、也就是最基础的那一条要求的直接推论,而且是躲不掉的那种。

先把那条原文摆出来

无障碍指南1.4.1颜色的使用写得很短:不得把颜色作为传达信息、指示动作、提示响应或区分视觉元素的唯一视觉手段。

它的级别是A级。无障碍规范分A、AA、AAA三级,A是最低那一级,通常被理解为“不做到这个就不算及格”。国内不少团队做到AA就算不错了,而这一条连AA都不用够。

一排只有颜色不同的色块,用户要靠它做出选择——这正好落在“区分视觉元素”和“提示响应”两项里。没有文字标签的色号选择器,本身就是这条A级要求的典型反例。

规范给了一条豁免,粉底刚好用不上

这条要求不是一刀切,它给了一条相当宽松的出口。规范的注释里写着:如果两个颜色不只是色相不同,明度差别也足够大,对比度达到3比1以上,那这个明度差本身就算一种额外的视觉区分,可以过。举的例子是浅绿和深红。

大部分场景靠这条就能过关。红色的错误提示配深色文字,绿色的成功状态配浅底,明度差随手就有。

粉底色号过不了。

粉底、遮瑕、腮红、口红的色号,本质上就是同一个色相内部的连续渐变。相邻两格的差别小到要凑近屏幕看,明度差远远够不到3比1。而且这不是设计上的疏忽——它的商业价值恰恰来自那些小差别。要是相邻两格明度差能到3比1,那这个色号盘就没必要分这么多格了。

所以美妆色号是全网结构上最拿不到这条豁免的一类色块。规范留了后门,这个品类刚好是唯一走不进去的那个。要过1.4.1,只剩下一条路:给每一格配可读的文字。

换句话说,那段“中等偏深,粉黄混合底色”不是锦上添花,它是这一排色块合规的必要条件。这一层含义在无障碍审计报告里几乎从没被点出来过,因为审计通常只查表单控件和状态提示,很少有人把商品变体选择器当成一个颜色编码系统来看。

落到色号选择器上,具体要改几处

把这条要求翻译成前端待办,大概是四处:

第一处,每一格都要有可读的名字。不是悬浮才出现的提示气泡,气泡在触屏上根本触发不了。至少要有可访问名称,最好选中态直接把名字显示在色块区域旁边。

第二处,选中态不能只靠边框颜色。常见做法是给选中的那格加一圈深色描边,而深色描边落在深色色块上等于没加。加个对勾、加个明显的位移或者加粗描边,都比换颜色可靠。

第三处,缺货和停产状态不能只用置灰。置灰在一排肤色色块里视觉上非常容易被读成“这是个更浅的色号”,得配划线或者文字。

第四处,色块如果是图片,别把alt写成颜色名。写“米色”没有意义,写“中等偏深、粉黄底色”才有。这一条和图片alt到底能不能帮网页排名那篇里的结论一致——alt的价值不在排名,在把图片里的信息用文字讲一遍给读不到图的人听,而“读不到图”包括开着屏幕阅读器的人,也包括色觉有差异的人。

顺手多接住一批人

这里有个数字值得摆一下:红绿色觉异常在男性中的比例大约是8%,也就是每12个男性里有1个。美妆品类的男性访客占比不高,但整站不止美妆一个品类,配色选择、状态标识、图表颜色到处都在用颜色编码。

更容易被忽略的是另一批人——年纪大的用户对颜色的分辨能力会下降,这在规范的解释文档里被明确列为受影响群体之一。而这批人在很多品类里恰恰是客单价最高的那一批。

再加上环境因素:户外强光下的手机屏幕、开了夜间模式的屏幕、色温偏冷的老显示器。这些情况下丢失的不是无障碍指标,是订单。

如果想顺手把整站的颜色对比度一起体检一遍,颜色转换与对比度工具可以直接把色值换算成对比度数字,配合网站无障碍访问那18个改动一起过一遍,成本比想象的低。

这条要求在欧盟已经不只是指南了

如果上面那些还停留在“应该做”的层面,那接下来这条会把优先级往上顶一格,尤其是做欧洲市场的。

欧盟无障碍法案(指令2019/882)第2条第2款写着:自2025年6月28日起向消费者提供的一系列服务须符合本指令的无障碍要求,其中就包括电子商务服务。

它对电商服务的定义在立法说明第42条里给得很具体:以远程方式、通过网站和移动端应用、以电子手段、应消费者个别请求提供的、以订立消费合同为目的的服务。一个卖东西的独立站,逐字对得上。

另一段立法说明说得更直白:本指令包含确保电子商务网站可访问的义务。

这意味着什么?WCAG那一套在欧盟市场上从推荐变成了合规依据。而1.4.1是A级——如果一个站连最低级别的要求都没过,它在这件事上几乎没有辩解空间。

有一条豁免要说清楚,免得吓着人:提供服务的微型企业不在适用范围内。微型企业的定义是雇员少于10人,且年营业额不超过200万欧元或年资产负债表总额不超过200万欧元。多数刚起步的独立站落在这条里;但只要团队扩到十人以上、或者营收过了那条线,豁免就没了。

这带来一个有点尴尬的时间差:豁免消失的时点,恰好是站点最忙、最不想动老代码的时候。色号选择器这类组件如果一开始就带着文字标签,后面什么都不用做;等到规模上来再回头改,改的是已经跑了三年、被十几个页面复用的公共组件。

把它当成合规和体验的重合区来卖

这一层信息在内部推动这件事的时候很有用,因为它换掉了量纲。

“色号旁边加段描述能提升转化”是一个需要举证的主张,会被要求先做A/B测试,测试要排期,排期要等实验位。“欧盟市场的合规底线要求这一排色块不能只靠颜色区分”是一个不需要举证的主张,它不进实验队列,它进合规待办。

而这两件事要做的改动是同一个。找到合规和体验重合的那部分,用合规的通道去推进,是这类长期没人排期的改动最现实的上车方式。

顺带提醒一句别用错力:无障碍这件事在SEO上的收益是间接的,别拿“能提升排名”去说服人,那个因果链太长,被追问一次就崩。网站无障碍访问那18个改动里真正带来流量的是语义结构和文本替代那几条,跟色块标签不是一回事,混着讲会削弱可信度。

顺手接住机器那一侧

还有一层收益是这两年才显现出来的:只靠颜色表达的信息,机器同样读不到。

屏幕阅读器读不出一个色块是什么颜色,AI购物助手同样读不出来。它读到的是页面的文本和结构,一排没有文字标签的色块在它眼里就是一排空的可点击元素。

所以当用户问助手“这个牌子有没有适合黄皮的粉底色号”,页面上如果只有色块和幻想名,它给不出答案——不是它不够聪明,是那个信息从来没有以文字形式存在过。智能体读的是无障碍树而不是页面截图说的正是这件事:无障碍属性在今天已经不只服务于少数用户,它是机器理解页面的主要入口。

这就出现了一个挺划算的局面:同一段“中等偏深、粉黄混合底色”的文字,同时被三类对象消费——看得见颜色的用户拿它确认判断,色觉有差异的用户和屏幕阅读器用户靠它获得信息,AI助手拿它回答带条件的提问。一处改动,三处收益,而这三处平时分属三个不同部门的KPI。

一个五分钟的自查

不用装任何工具,也不用懂无障碍:把商品页截一张图,用系统自带的滤镜转成黑白,然后看那排色块。

如果转成黑白之后你还能分清哪一格是哪一格,说明明度差够,这排色块过关。如果转完是一排深浅几乎一样的灰方块——恭喜,你刚刚亲眼看到了色觉有差异的用户看到的画面,也顺手确认了这排色块拿不到那条豁免。

粉底、遮瑕、腮红几乎必然是后一种结果。而这个动作只要五分钟,比走一遍无障碍检测工具快得多,也更容易让没接触过这套规范的同事当场理解发生了什么。

把这张黑白截图贴进需求文档,是我见过推动这件事最有效的一页材料。它不需要解释,也不需要引用任何条款——所有人看一眼就知道问题在哪,而这正是那些讲了半年没人动的需求缺的东西。

成分表是整页写得最全、也最没法读的一栏

它按投料重量排序,一个百分点以下可以随便排,彩妆还能把整条产品线的着色剂并成一份可能含有。全都合法。

可用性测试里还有一段,看着不起眼,其实是整个话题里最硬的一处。

一位受访者在看一款BB霜,想找找里面有没有养肤成分。她把成分表读了一遍,说:“看着没什么养肤的东西,除非有些长单词我不认识——这完全有可能。”然后她转去看评价,最后没有加购。

那款产品的成分表里,光是明显能归到“养肤”这一类的就有十几个,其中一个是泛醇——一种被广泛用来强化皮肤屏障的成分。它就写在那儿,用的是标准写法,一个字都不少。

她读到了,也没读懂。而这不是她的问题,也不完全是品牌的问题。

成分表的排序规则不是按重要性来的

先说欧盟这边。化妆品法规EC 1223/2009第19条第1款第7项规定,成分表要按成分加入产品时的重量降序排列

注意这句话的量纲:重量。不是效果,不是重要性,不是对用户有多大用,是投料的分量。

这两件事在水和甘油那里是重合的——含量最高的确实也是配方骨架。到了活性成分那里就彻底分开了:烟酰胺、玻尿酸、视黄醇、泛醇,这些用户真正想找的东西,添加量本来就低。

更关键的是同一条法规接下来那半句:浓度低于1%的成分,可以在超过1%的那些之后按任意顺序排列。

大量活性成分的添加量就在1%以下。也就是说,用户看到的这份清单,在前半段代表分量,在后半段连分量都不代表——那一段的顺序是可以随便写的。

同一份配方,两份都合法的成分表

美国那边的规则几乎一样,而且官方文档大方到直接给了对照示例。

FDA的化妆品标签指南在讲21 CFR 701.3的时候,拿一款压粉当例子,给出了两份写法,并且注明两份都合规:

真实浓度写法一写法二
滑石粉:75滑石粉滑石粉
高岭土:7.5高岭土高岭土
硬脂酸锌:5硬脂酸锌硬脂酸锌
二氧化钛:5二氧化钛矿油
矿油:3矿油羊毛脂
氧化铁:2.5氧化铁肉豆蔻酸异丙酯
肉豆蔻酸异丙酯:0.9肉豆蔻酸异丙酯香精
羊毛脂油:0.5羊毛脂油羊毛脂油
羊毛脂:0.2羊毛脂二氧化钛
香精:0.1香精群青
群青:0.05群青氧化铁

看第二列和第三列的差别:羊毛脂(0.2)在写法二里排到了肉豆蔻酸异丙酯(0.9)前面,二氧化钛(5)掉到了倒数第三。两份都对,因为1%以下可以任意排,着色剂可以整体挪到最后任意排。

结论有点冷酷:你在两个牌子的商品页上看到成分顺序不一样,很可能只是两个法务团队在同一条规则里挑了不同的合法写法,跟配方差异一点关系都没有。而用户正在用“排在前面等于含量高等于更重要”这套读法去解读它。

彩妆那一栏,清单甚至不对应你手上这一支

还有更绝的。欧盟那条法规在讲着色剂的时候写着:对于有多个色号的彩妆产品,整个色号系列用到的着色剂可以一起列出来,前面加上“可能含有”或者“+/-”符号。

翻译一下:一支具体色号的口红,它成分表里那部分着色剂,可能根本不是这一支的成分,而是整条产品线的并集。法规明文批准了这种写法。

美国那边还有一条更彻底的:经认定属于商业秘密的成分可以完全不写,末尾用“及其他成分”带过。

把这几条摆在一起:这份清单的顺序可能不代表含量,它的着色剂部分可能不对应这一支,它的末尾可能还漏了几项。它仍然是商品页上最长、最完整、最“专业”的一栏。

法规把商品那一侧拉满,又把用户那一侧按住

那为什么品牌不干脆在成分旁边写一句它是干什么用的?

因为同一部法规的第20条写着:在标签、销售和广告中,不得用文字、名称、商标、图片或其他标志暗示产品具有它并不具备的特性或功能。

这一条是对的,它拦住的是“七天淡斑”那类承诺。但它同时也让品牌的法务对任何一句“这个成分有什么用”都非常敏感——分不清哪句安全的时候,最省事的做法是一句都不写。

于是就有了这个局面:法规强制你把成分写全,又限制你把成分翻译成效果。用户在商品页上拿到的,是一份写得最全、也最没法读的清单。他要的那句“这个对我有什么用”,恰好掉在两条规定中间的空当里。

唯一一处按“有什么用”排序的地方

顺着这个逻辑往下,会发现一个很有意思的例外。

FDA的规则里写着:如果这款化妆品同时也是药品——比如防晒、祛痘、止汗这类——那么活性药物成分必须排在化妆品成分之前声明。标签上会写成“活性成分:某某。其他成分:某某某”。

这是整套标注体系里唯一一处强制把“起作用的那个”排在前面的规定,而它只在这东西被法律当成药的时候才生效。

只要它还算化妆品,成分表就按重量排;一旦它跨进药品那一栏,立刻改按功能排。同一份清单,两套排序逻辑,分界线是监管身份,不是用户需求。

那商品页上到底能做什么

法规管的是标签,商品页上的空间比标签大得多,可做的事其实不少:

第一,把法定清单和阅读辅助分成两块。法定成分表原样保留,不动一个字;旁边或下方另起一块,用中性描述的方式讲几个关键成分是什么类别的东西。讲机制不讲疗效,是这一块的安全边界。

第二,把“这一支实际含有”和“整个系列可能含有”分开标。既然法规允许合并写,那你主动拆开写就是差异化——用户第一次能确认这份清单说的就是他手上这一支。

第三,允许按成分筛选和排除。敏感肌用户真正的需求不是“看懂全部成分”,是“确认里面没有某几样”。这个需求用筛选器解决比用文案解决高效得多,而且它天然是把用户那一侧的输入收进来的动作。

需要提醒的是,这三件事都碰得到宣称的边界。欧盟对商品页上的表述已经在持续收紧,商品页写环保材质要拿证据那套规则就是同一个方向上的动作,写辅助说明之前先把措辞过一遍法务,别为了一句“温和不刺激”惹上不必要的麻烦。

国内的规则在这件事上走得更远一步

前面讲的是欧美。国内的规则值得单独拎出来,因为它在同一个问题上做了一个欧美都没做的动作。

《化妆品标签管理办法》第十二条要求:标签应当标注全部成分的原料标准中文名称,以“成分”作为引导语引出,并按各成分在配方中含量的降序列出。这一句跟欧美一致。

关键是紧接着那一句:配方中存在含量不超过0.1%的成分的,所有不超过0.1%的成分应当以“其他微量成分”作为引导语引出另行标注,可以不按照含量的降序列出。

把三个法域并排看,差别就出来了:

法域降序的门槛门槛以下怎么处理用户看得出分界线吗
欧盟1%混在同一份清单里,任意排看不出
美国1%混在同一份清单里,任意排看不出
中国0.1%拎出来另起一段,加引导语看得出

两处差别都值得注意。门槛更低(0.1%对1%),意味着必须严格按降序的那一段更长。更重要的是第三列:国内的做法把“这一段的顺序不代表含量”这件事明确画了一条线告诉用户。

欧美那份清单是连续的,用户从头读到尾,看不出从哪一行开始顺序失去意义。国内那份清单中间有一句“其他微量成分”,读到这四个字,用户就知道下面这些是另一回事了。

这个对照最有意思的地方在于:监管这一侧已经有人意识到“排序会被用户读成重要性”,并且动手修了这个误读——只不过修的是包装标签,而商品页上没有人跟进。

对出海和跨境的团队来说,这里还有一个可以直接抄的做法:反正国内版包装已经按这个格式做了,商品页上就用同一个格式,全球统一。它不违反欧美任何一条规定——两边只规定了下限,没禁止你分段写得更清楚——而且它比法定最低要求更可读。这是少见的“按最严的那个市场做一版全球通用”能同时改善体验的情况。

为什么这一栏值得花力气,哪怕没几个人读

会有人问:成分表的阅读率本来就低,值得投这么多吗?

阅读率低是真的,但这一栏的用户结构非常特殊——读成分表的那批人,是这个品类里决策权重最高、复购最稳、客单价也最高的一批。敏感肌用户、有明确成分禁忌的用户、有过不良反应经历的用户,他们不是随便看看,他们是在做一次筛除。

而筛除这个动作的性质跟挑选完全不同:挑选可以将就,筛除不能。一个用户如果无法确认里面没有他不能碰的东西,他不会“要不试试看”,他会直接排除这个产品。这一栏的转化影响不体现在浏览量上,体现在这批人的加购率上。

而且这个需求是可以用筛选器解决的,成本比写文案低得多。让用户在列表页就能勾掉“不含某某”,等于把他那一侧的输入提前收进来了,还顺手减少了他进商品页之后再退出的次数。

顺便处理一个容易忽略的坑

成分这一栏在多语言站点上还有一个专属麻烦:成分名不该被翻译。

成分的标准中文名和国际通用名是两套各自有规范的名称体系,它们的存在意义就是消除歧义。把国际通用名扔进机器翻译,出来的可能是一个查不到、也搜不着的词,用户拿它去比对自己的禁忌清单会直接对不上。

正确做法是成分名保留原样,只翻译周边的说明文字。这跟小语种页面正文越本地化越好、结构化数据却要写回国际格式是同一个思路:面向人的部分尽量本地化,面向识别的部分必须保持全球一致。成分名属于后者,它的功能是被精确匹配,不是被读懂。

这三条国内规定的原文出自国家药监局2021年第77号公告发布的《化妆品标签管理办法》,同一条还补了一句常被忽略的细则:以复配或者混合原料形式填报配方的,应当以其中每个成分在配方中的含量作为排序和判别是否为微量成分的依据。这一句堵掉了一个取巧空间——不能把几个微量成分打包成一个复配原料,让它整体越过0.1%的线爬到清单上方去。

把这条细则和欧美那边FDA示例里“复配抗氧化剂必须拆开、按各自含量分别声明、不许写成一串带'及'的组合”放在一起看,会发现三个法域在同一个取巧路径上都设了同一道闸。三份互不通气的规范在同一个位置各堵一次,说明这个漏洞不是想象出来的,是真的有人走过。

商品图要补的到底是这件商品,还是站在屏幕前的那个人?

同一支口红拍二十张白底图,用户仍然不知道它在自己嘴上是什么颜色。他要的那张图里必须有一张脸。

回到开头那位受访者。她翻图片的动作值得再看一遍:她不是在看这支腮红,她是在这一组图里找一张脸。

找不到,她就走了。整个过程里她对产品本身没有任何不满——图很清楚,包装很好看,价格也没问题。

三类图各自在回答哪个问题

把用户翻图的行为拆开,其实是在依次找三种不同的东西:

图片类型回答的问题缺了会怎样
上妆效果图(产品用在该用的部位上)这东西涂上去是什么质地、什么覆盖度用户拿不准是哑光还是有光泽
真人模特图(每个色号配肤色相近的模特)这个色号在跟我像的人身上什么样找不到自己那一档,直接换站
手臂试色图(整个色系一次排开)这些色号横向比是怎么排的只能一个个点开记,记不住

三类图的功能不重叠。真人图回答“像我的人穿上什么样”,试色图回答“这些格子之间差多少”,上妆效果图回答“它到底是什么质感”。少任何一类,都会留下一个用户没法靠其他图补上的空。

Baymard的测试里有一条判断值得记下来:相对于一般电商品类,美妆商品页如果只有几张白底去背图,会直接导致一部分用户弃购。这在别的品类里通常只算体验差一点,在这里是弃购原因。

为什么真人图这一类最容易做成假动作

真人图的坑在于它很容易做成“有了”但不管用。

常见做法是:整个色号系列共用一到两张模特图,模特通常是品牌的形象代言人,肤色只有一档。这在图片数量的验收表上是过关的——每个色号都有真人图。

但用户的问题是“跟我像的人”。一档肤色对应的是一档用户,其余全部落空。验收清单里数的是图的张数,用户数的是肤色的档数,两个数根本不是一回事。

可用性测试里正面的例子长这样:一位受访者看某个眼线色号,看到不同肤色的模特都戴了这个色,说了句“而且它把不同肤色都展示了,这点我喜欢”。另一位在看粉底,直接点开模特图放大比对肤色,最后挑了一个编号说“这个跟我最接近”。

她们做的动作是同一个:拿模特的脸当参照物,去标定自己。这正是把第二个自变量收进来的最低成本方式——不需要用户上传任何东西,不需要任何算法,只要图里的人足够多样。

拍摄侧的三条具体要求

把上面那些翻译成拍摄需求,是这么三条:

第一,真人图的肤色档数要有明确指标,而不是“多样化”这种形容词。写清楚这个系列要覆盖几档,验收时按档数点,不按张数点。

第二,手臂试色图必须一次拍全,而且要跨肤色拍。整排色号在同一条手臂上拍出来才有横向可比性,分批拍会因为光线不同产生色差;跨肤色是因为同一个色号在不同底色的皮肤上呈现完全不同。

第三,摄影棚的光和用户手机屏幕之间那道坎要认。色彩管理这件事很难做到完美,但至少要保证同一系列的所有色号在同一场光下拍完,让相对关系是准的。绝对色准做不到,相对关系还是能守住的。

移动端上那个来回滚动的坑

还有一处非常具体、修起来也不贵的问题,只在手机上出现。

测试里一位受访者在看某品牌的粉底棒,色号选择器在页面中部,图片画廊在页面上部。她每选一个色号,都要往上滚才能看到图变了没有;想比第二个色号,再滚回来选,再滚上去看。二十几个色号,她重复了几轮就烦了。

这是典型的两块必须一起看的信息被放在了不同屏。修法不是删内容,是让它们同屏——色块下面直接给一小块预览区,或者选色号时图片区吸顶。这和那排把商品页收拾得很干净、代价是两块信息再也进不了同一屏的标签是完全同一类错误:为了页面整洁,把需要对照着看的东西拆散了。

他去站外找图这件事,比看起来更贵

用户在你的商品页上找不到合适的图,下一步是去社交平台搜这个产品。测试里这句话反复出现,有位受访者说得很直白:“这种时候我就会去视频平台搜这个产品。”

这一步的代价不是流失一次浏览,是他离开了你的页面,而回来的概率远低于团队的直觉估计。他在站外看到的下一个东西,很可能是另一个牌子的对比视频。

值得一提的是,这个行为现在还多了一层影响:他在站外那一圈里看到的内容,也是AI购物助手在读的内容。口碑得先搬到机器进得去的地方说的就是这个变化——用户绕出去的那一段路,如今不只是流失路径,还是别人的品牌资产在被建设的地方。

模特图那一档的数量,怎么定才不是拍脑袋

“多几档肤色”这个要求很容易停在口号上。给它一个可执行的定法:

按你自己的色号盘反推。如果这个系列有24个色号、跨5个色深档,那真人图至少要覆盖这5档,每档一张。低于这个数,就一定有整档用户在图里找不到自己。

这个定法的好处是它自带上限——不会有人要求你拍24张真人图,因为色深档只有5个。它也自带下限:色号盘有几档,图就得有几档,这是从你自己的产品结构推出来的,不是从预算推出来的。

再往下有个取舍:同一档拍一个模特还是两个?如果预算允许,同一色深档拍两个不同底色的模特收益很高,因为色深相同、底色不同的两张脸放在一起,本身就是一堂关于底色的教学——用户不需要读懂“冷调暖调”这四个字,他看两张图就明白差在哪。

这是把知识型内容换成对比型内容的又一个例子,也是这个品类里最划算的一次换。

手臂试色图的三个技术细节

这类图看着简单,做砸的概率其实不低。三个细节决定它能不能用:

第一,一次拍完。整排色号必须在同一场光下、同一次拍摄里完成。分两次拍,色温和曝光的细微差别会被用户读成产品差别,而这种误差恰恰落在他最想分辨的那个精度上。

第二,顺序要跟选择器一致。试色图上从左到右的排列,要和页面上色块的排列顺序一样。不一致的话,用户在图上认出第三个,回到选择器数第三个,点开是另一个色号——他会当场怀疑这两个东西的对应关系,然后两个都不信了。

第三,图上要有可读的色号名。试色图本质上是一张把颜色和名字对应起来的表,名字缺了它就只是一排色带。这里有个常见的偷懒做法是把名字做进图片里——能用,但要记得这些字搜索引擎和屏幕阅读器都读不到,图片旁边最好再给一份文字版对照。

视频那一格该怎么排

还有一类素材没提:视频。它在这个品类里的位置比较特殊。

视频的优势是能展示质地、延展性、上妆过程这些静态图拍不出来的东西,这些恰好是“上妆效果图”那一格想回答的问题。所以视频最该替代的不是真人图,是质地展示那一类图。

但视频有个结构性缺点:它没法被并排比较。用户想比三个色号,图片可以三张摊开,视频只能一个一个看,看完还得靠记忆。这就是为什么视频再好也替代不了手臂试色图——试色图的全部价值就在于并排。

所以排优先级的顺序建议是:先补真人图的档数,再补手臂试色图,最后才是视频。前两项解决的是“能不能判断”,视频解决的是“判断得更细”,顺序反了就会出现视频拍了一堆、用户还是找不到自己那一档的情况。

图片这一侧还有个白拿的收益

把图配齐之后,有一件顺手的事值得做:让这些图能被搜索到。

真人上妆图、手臂试色图这类内容,恰好是视觉搜索最擅长匹配的东西——用户看到别人用了某个色号,截图去搜,能不能搜到你,取决于你的图有没有被正常索引、有没有可读的替代文本、有没有挂在能被抓取的位置上。视觉搜索崛起之后出海产品怎么被找到这条线上的准备工作,跟本文说的补图工作是完全重合的两件事。

同一批图,一次拍摄,站内解决判断问题,站外接住视觉搜索流量。这类一鱼两吃的机会在电商里不多,值得在立项的时候就把两边的需求合到一个预算里去申请。

还有一个小到容易被忽略的排布细节:真人图不该全部堆在轮播的最后面。不少站的图片顺序是先包装、再质地、再成分示意,真人图排在第七八张。而用户翻图是有耐心上限的,翻到第四五张没看到想要的东西,他就会认为这个站没有。把每个色号的真人图提到第二张,是一次零成本的改动,效果通常比再多拍几张明显。

做了试色工具,为什么两边的数还是没对上?

工具算出来的答案停在浮层里,商品页上的选择器还停在默认色号。用户退出浮层的那一秒,两个答案劈了叉。

到这里为止,前面几块讲的都是第二个自变量根本没被收进来。接下来这一块讲的是更冤的一种情况:收进来了,然后弄丢了。

两段几乎一样的操作,结局完全不同

可用性测试里有两个片段,放在一起看非常有教育意义。

第一段:受访者在一个品牌的站上用了色号匹配工具,工具给出了推荐结果,她记下了那个色号名。她点右上角的叉关掉浮层——顺手说了句这里有好几个地方都能关——回到商品页,发现页面上显示的是另一个色号。她的原话是:“这不是你们刚给我的那个色啊。”

接下来她开始一个一个点色块去找刚才那个,点了几下就烦了:“要一个个试过去,这也太费劲了。”

第二段:另一位受访者在另一个品牌上用同样的功能,工具给出推荐色号,浮层底部有个“去购买”的按钮。她点了那个按钮,落到商品页上,推荐的那个色号已经被选中了。她说了句“跟我以为的不太一样,那就按这个买吧”,然后继续走完流程。

两个站都做了色号匹配工具。功能列表上这一格都是打勾的。差别只有一步:算出来的答案有没有被写回商品页的选择器。

为什么这一步最容易被漏掉

因为它跨了两个东西的边界。

匹配工具通常是一个独立模块,可能是外采的,可能是另一个小组做的,也可能是营销活动期间上的。它的验收标准是“能算出结果”。商品页的选择器是另一套代码,它的验收标准是“能选、能加购”。

两边各自都过了验收,中间那一步不属于任何一方。更麻烦的是,测试的时候多半也发现不了——测试人员知道自己该选哪个色号,他不会像真实用户那样,关掉浮层之后完全依赖页面告诉他刚才发生了什么。

那位受访者点的还是右上角的叉。工具的设计者大概默认用户会点“去购买”,可浮层给了好几个出口,她挑了最眼熟的那个。只有走主路径才会传递的状态,等于没传递。

合并这一步的四条验收

把“两侧数据合并”落成可以放进提测清单的条目,是这四条:

第一,无论从浮层的哪个出口退出,结果都要写回选择器。叉、遮罩、返回键、手势返回,全部算出口。

第二,写回之后要有一句人话说明这是怎么来的。不是默默把某一格点亮,而是写“根据你刚才的匹配结果,为你选中了某某色号”,并且给一个“重新匹配”的入口。用户随时可以推翻它,但他得先知道有这么回事。

第三,结果要能被地址栏带走。选中的色号写进URL参数,用户分享给朋友、自己第二天再打开、从收藏夹回来,结果还在。做不到这一点,那次匹配的价值只有一次会话那么长。这一层的实现细节和变体的Schema、canonical与URL三层治理是绑在一起的,别一边把变体状态塞进URL,一边又忘了规范化,白白造出一堆重复页面。

第四,同一账号下这个结果要跨设备活着。用户在手机上做完匹配,晚上在电脑上下单——这是相当常见的路径。结果只存在浏览器本地存储里,换个设备就没了。

别用打开率验收这类工具

最后说一个指标口径上的坑,因为它会直接影响这类工具的排期命运。

试色工具、肤质问卷、尺码助手这类功能,上线后最常被拿来汇报的数字是打开率。打开率高,说明用户需要它,功能算成功。

这个口径基本没用。打开只说明用户遇到了困难,不说明困难被解决了。该看的是另一个数:用过这个工具的人和没用过的人,在转化率和退货率上差多少。

如果这个差值接近零,那说明工具只是被打开了,没有产生任何输入——用户看了一眼,关掉,回到原来那个靠猜的状态。这时候要修的不是入口曝光,是刚才说的那个“写回”。

更狠一点的口径是分三组:没打开的、打开但没走完的、走完并且结果被用上的。第二组通常是最大的一组,也是所有改进机会藏着的地方。这个分组不需要新埋点,浮层的打开事件和加购时的色号来源标记就够,剩下的用DTC独立站避免假胜利的那几个样本量公式核一下量够不够,别拿三十个人的差值去下结论。

浮层这个容器本身就是问题的一部分

把两段测试记录再往深看一层,会发现“忘了写回”不是一次疏忽,它是浮层这个形态天然带来的结果

浮层的心智模型是“一个临时的、可以随时丢弃的东西”。用户点开、看一眼、关掉,页面回到原样——这是所有浮层的默认行为,也是用户被训练出来的预期。

问题在于,匹配工具跟普通浮层的性质完全不同:普通浮层里的东西丢掉不可惜,匹配结果丢掉就等于这次交互白做了。它形式上是个浮层,实质上是一次状态变更。

两者对不上,就产生了那位受访者的困惑:她按浮层的规则关掉它,系统也按浮层的规则丢弃了状态,双方都没做错,结果是她的答案没了。

由此可以引出一条更一般的判断:凡是会产生“用户之后还要用到的结果”的交互,都不该只做成浮层。要么落到页面主体上,要么在浮层关闭时明确告诉用户结果去哪儿了。这一条同样适用于尺码助手、配置向导、装修方案生成器这类东西。

回写之后,那句话该怎么写

写回选择器只是第一步。第二步是告诉用户发生了什么,而这句话的写法会直接决定他信不信。

三种写法的效果差别很大:

写法用户的反应问题
什么都不说,直接点亮某一格没注意到,或者以为是默认值等于没写回
“已为你推荐:马提尼克”知道了,但不知道凭什么无法判断要不要信
“根据你选的中等偏深、粉黄底色,为你选中马提尼克。重新匹配知道输入、知道结论、知道怎么改——

第三种写法多出来的那部分,是把用户刚才交进来的那个输入复述了一遍。这一句复述看着多余,作用其实很大:它让用户能验证系统有没有听错,而验证的能力是信任的前提。

这跟后端一清二楚用户错在哪、页面上却只剩四个字输入有误是同一类问题的正反面——系统内部有完整信息,问题只在于愿不愿意把它说出来。说出来几乎不花成本,不说的代价是用户没法判断该不该采信。

用户推翻了推荐结果,这件事怎么记

还有一个几乎没人做、但价值很高的细节:记下用户有没有推翻你的推荐。

匹配工具给出色号A,用户改成了色号B并且下单——这条记录同时包含了三个信息:工具算错了、正确答案是什么、以及这个用户真实的那一侧数据。

把这类记录攒起来,是校准匹配算法最便宜也最准的数据源,比任何测试集都真实。而且它不需要用户配合、不需要额外提问、也不需要新埋点——推荐结果和最终下单的色号本来就都在库里,只是很少有人把它们放在一起看。

还可以再多一层:如果这一单最后没被退货,那这条校准数据的置信度就更高了。推荐值、用户修改后的值、以及退货与否,三个字段拼在一起就是一份带标签的训练数据,而它是站点在正常经营中自动产生的。

顺带说一句,这类分析特别容易在归因口径上翻车:一个用了工具又改了结果的用户,到底该算工具的成功还是失败?建议按“最终有没有下单且没退”来算,别按“推荐准不准”来算。商品页上那个推荐位两套报表算出相反结论说的就是这类分歧——两套口径都没算错,但只有一套回答了“这个功能该不该继续投入”。

把这一步写进提测清单的具体句子

前面那四条验收,落到提测单上其实只要一行字,但这行字怎么写决定了它会不会被绕过去。

写“匹配结果需正确回写商品页”——不行,太抽象,测试同学会按主路径走一遍看到色号变了就打勾。

写成这样才管用:“从浮层的每一个可退出方式各走一遍,退出后商品页选中的色号必须与推荐结果一致;把可退出方式逐个列出来。”列出来这一步是关键——叉号、遮罩点击、返回键、手势返回、按下ESC,写成五行,测试就得走五遍。

这是一条更一般的经验:凡是“多条路径都要满足”的验收,必须把路径逐条列出来,不能写成一句概括。概括句在执行时会退化成只走最顺的那一条,而出问题的永远是没人走的那几条。

还有个便宜的补充办法:在提测前先自己造一个必然失败的例子跑一遍。故意把回写逻辑注释掉,确认这条检查项真的会红。不做这一步,你很可能挂了一个永远为真的条件——看着在守,其实什么都没守。

评论区那颗星,为什么不如一句这个人跟我像不像?

五星说明它对某个人有用,那个人是谁没写。用户想找的是跟自己肤质、年龄、发质对得上的那几条。

评价这一栏,是第二个自变量缺口表现得最反直觉的地方。因为它看起来已经是“别人的经验”了,理应最贴近用户。

实际上不是。

星级说明它对某个人有用,那个人是谁没写

一款护发精华,四星半,两千多条评价。一位受访者读到一条好评,说了这么一句:“这条我想知道这个人是什么发质……我有点担心,因为我不知道她头发是什么样的。”

她想找的不是“这个产品好不好”,是“跟我头发一样的人用了怎么样”。评价区给了她前者,没给后者。她的下一步是——去视频平台搜这个产品。

这里的逻辑跟色号是一模一样的:一条评价是一个只有商品那一侧的结论,除非它同时告诉你写它的人是谁。在美妆、服饰、鞋类这些“效果因人而异”的品类里,评价者的属性比星级本身重要得多。

另一位受访者看到评价里带了写评人的肤质描述,反应是:“他们把这个人的情况和皮肤类型都写出来了,这点特别好,你能看出跟你合不合。”——同样是评价区,多了一行属性,作用完全变了。

前台筛不出来,是因为采集端就没这一栏

这件事上有个很具体的技术根因,值得单独点出来。

测试里那个没有发质信息的站,研究人员事后去看了它的评价提交表单:表单里根本没有这几个字段。只有星级、标题、正文和上传图片。

所以前台显示不出发质,不是模板漏了,不是排版没放下——是数据库里从来就没有这一列。前端再怎么改也变不出来。

这一层跟评价能不能被筛、能不能被排序是连在一起的:采集端有几个字段,前台就最多有几个维度可以筛。先补表单,等三个月攒够量,前台的筛选才有东西可筛。这个时间差是这件事最容易被低估的部分——它不是一个前端需求,它是一个从今天开始才有回报的需求。

每个品类要收的属性不一样

属性字段不能一套通吃,它必须跟“这个品类的效果因什么而异”对齐:

品类该收的评价者属性常见的错误做法
底妆肤色档、底色、肤质、年龄段只收“是否推荐”
护肤肤质、主要困扰、使用时长不区分用了三天和用了三个月
护发发质、头皮状况、是否染烫一栏“头发类型”选项只有三个
香水使用场景、留香感受、季节只让打分不让描述
服饰身高、体重、平时穿的码收了但不显示在评价旁

最后一列里“收了但不显示”这种情况比想象的多。数据在库里,前台只显示星级和文字,属性被当成后台分析用的字段。这属于把已经付过的成本浪费掉——采集是最贵的一步,展示只是几行模板。

展示上的三条

第一,属性要显示在评价旁边,不是折叠在里面。用户是扫读评价的,属性一旦要点开才能看到,就等于不存在。

第二,要能按属性筛,而且筛选项要放在评价区顶部。“只看油皮”、“只看深色号”这类筛选,是把用户那一侧的输入收进来的最轻量方式——他不用注册,不用填问卷,点一下就完成了自我标定。

第三,默认排序可以考虑按“跟当前访客最像”来。如果他已经在这次会话里选过色号、用过匹配工具或者点过筛选,这些信号足够做一次粗排。做不到个性化也没关系,至少别默认按时间倒序——时间跟“像不像”完全无关。

评价区的结构化程度还会顺带影响别的事。电商产品评论的Schema结构与GEO联动那套做法里,属性字段本身就是可以进结构化数据的内容;把用户评价和问答做成会排名的资产也要求评价内容有足够的信息密度——一条带了肤质和使用时长的评价,无论对人还是对机器,可用性都高出一截。

顺手说说小样这件事

还有一个细节,跟评价没直接关系,但落在同一个逻辑上。

测试里一位受访者在购物车里看到“任选2件小样”,非常高兴,说了句挺有意思的话:“免费的总是好的……我是在为花钱这件事拿奖励。所以本质上,我等于没花钱!”

这句话的经济学当然站不住,但它准确描述了小样为什么在这个品类里特别有效:用户面对的核心困难是不敢试,而小样是唯一一个能真正解决“上脸看看”的东西。它不是赠品逻辑,是试用逻辑。

所以小样怎么展示很关键——要有清楚的图和名字,让用户能挑,而不是随机塞两包在包裹里。能挑,这一步才算把用户那一侧的输入收进来了;随机塞,它就退回成一个普通赠品。

补字段这件事的时间账,要提前算清楚

前面说了采集端没字段前台就筛不出来。这里要把这笔账算得再细一点,因为它决定了这个需求能不能在立项时活下来。

假设今天在评价表单里加上肤质字段。接下来会发生的是:

第一个月:新评价带属性,老评价没有。一个商品下面十条评价里可能只有一条带。这时候上筛选器,筛出来是空的,体验比不做还差。

第三到六个月:带属性的评价累积到有意义的比例,筛选开始能用。这个时间取决于评价产生速度,商品越畅销越快。

再往后:属性数据本身开始产生额外价值——你第一次知道自己的用户里油皮占多少、哪个色号被哪一档肤色的人买得最多。这些数据以前只能靠调研买,现在是副产品。

这条时间线必须在立项时就摊开说。不说的后果是第二个月有人来问“上了这个东西怎么没效果”,然后需求被判定失败、字段被砍掉——三个月后它本来该开始见效的。

有两个动作能把爬坡期缩短:一是给老评价做一次回填征集,给已经写过评价的用户发一次邀请,只问三个选择题,回收率通常比想象的高,因为成本极低;二是先在评价最密集的几个爆款上上线筛选器,让效果先在有数据的地方显现出来,别全站一起上。

属性别做成必填

一个很容易走反的细节:既然属性这么有用,是不是该做成必填?

不该。评价提交本来就是个转化率很低的环节,每加一个必填项,完成率都会掉一截。而属性缺失的代价是这条评价筛不到,评价缺失的代价是这条评价根本不存在——后者贵得多。

可行的做法是三条:做成选择题不做填空(点两下就完事)、放在提交成功之后再问(这时候用户已经完成主要动作,心理成本低)、老用户默认带出上次填的值(肤质不会每个月变)。

最后这条尤其划算:一个用户填过一次,之后所有评价都自动带属性,采集成本只付一次。

展示的时候别把星级砍掉

还有个容易矫枉过正的地方。说了半天星级不如属性重要,可能会有人想把星级弱化甚至去掉。

不行,两者的功能不重叠:星级负责快速排除烂产品,属性负责在不烂的产品里找到适合我的那个。用户的决策是两步走的,先看整体评分决定要不要认真看,再找同类人的评价决定买不买。砍掉第一步,第二步的入口就没了。

正确的做法是分工:星级留在原来的位置保持醒目,属性长在每条评价旁边,筛选器放在评价区顶部。三者各管各的,谁也不用给谁让位。

技术上还有一点要留意:评价的星级如果参与结构化数据,属性字段的加入不该影响原有标记的有效性。这一层的实现细节在评论怎么配置审核和防刷才能既真实又出星标里有比较完整的处理,改表单之前先确认标记不会被打断。

为什么这一栏在AI那边的权重在涨

最后补一个正在变化的因素。

用户现在越来越多地把“我这种情况该买哪个”直接问给AI助手,而助手在回答时需要的正是带条件的证据。一条写着“油皮、28岁、用了三个月”的评价,对它来说是可用的原料;一条只有五颗星和“很好用”的评价,它拿不出任何东西来支撑推荐。

这意味着评价属性这件事的收益结构变了:以前它只服务于站内那批会翻评价的用户,现在它同时决定了你的商品会不会出现在别人的推荐答案里。口碑得先搬到机器进得去的地方讲的是可抓取性这一层,属性字段讲的是信息密度那一层,两层都要够,缺一层都会让这批内容在AI那边失去引用价值。

除了美妆页,还有哪些地方也在单侧施工?

尺码、尺寸、功率、剂量、电压、镜架宽度。凡是要用户拿自己的数据去比对的信息,缺口都长一个样。

美妆只是这个缺口最显眼的地方。换个品类,同一个形状会以别的名字出现。

品类页面给的(商品侧)用户缺的(自己那侧)常见症状
服饰尺码表、厘米数我平时穿的码对应这里哪一档一次买两码,退一件
家具长宽高、材质它进不进得了我家那道门反复看图,不下单
电脑配件参数、跑分我干的那件活够不够用去论坛问,问完不回来
保健品每粒毫克数我这个情况该吃多少买最便宜的那个
小家电额定电压、插头类型我这边的插座能不能用下单后来问客服
眼镜镜架三围毫米数我的脸多宽凭图猜,退货
床垫软硬分级、材质层我这个体重睡上去是什么感觉只敢在实体店买

第三列全都是用户手里没有的数字。而第四列那些症状,通常被分别归因给“尺码问题”、“物流问题”、“客服问题”、“品类特殊”,很少有人发现它们是同一件事的七个马甲。

跟“标签词不对味”是两回事

这里要跟一个相邻但不同的问题划清界限,否则很容易混着谈。

服饰品类有个著名的现象:行业标准把多数成年人算成大码,可只有24%的女性会这样描述自己。那是命名层的问题——用户那一侧的信息其实是有的,他知道自己穿多大,只是你用的那个词和他用的那个词对不上。修法是改词。

本文说的是结构层的问题——用户那一侧的信息压根不存在。他不知道自己的底色是冷是暖,不知道自己脸宽多少毫米,从来没量过。改词没用,因为没有词可以对上一个他不知道的数。

两者的修法完全不同:命名层的问题靠翻译解决,结构层的问题必须靠测量解决。把结构层的问题当成命名层来修,就是前面那个眼镜案例里三轮白做的原因——一直在改词,而缺的是那把尺子。

两种解法,怎么选

补第二个自变量只有两条路,选哪条有个挺清楚的判断标准。

路线一:把用户那一侧的输入收进来。试色工具、尺码助手、上传照片、肤质问卷、按属性筛评价、地址自动带出电压制式。适用于那个数用户自己也不知道的情况——他没法告诉你,只能你帮他量。

路线二:把商品那一侧的描述预先翻译成“对某类人意味着什么”。把“4N1”写成“中等偏深、粉黄底色”,把“85瓦”写成“够剪4K视频”,把“深度58厘米”写成“标准门框进得去”。适用于那个数用户其实知道,只是你没换算的情况。

判断办法一句话:问用户“你的值是多少”,如果他能当场答上来,走路线二;答不上来,走路线一。

大部分团队的问题是两条路都没走,少数团队的问题是选错了路——给一个“你穿多大码”能当场答上来的品类做了复杂的体型扫描,给一个“你底色是冷是暖”根本答不上来的品类做了一份文字对照表。

你站上唯一一处用户主动交出自己那一侧信息的地方

最后说一个几乎所有站都有、但基本没被这么用过的东西:站内搜索日志。

把搜索词拉出来,会看到相当一部分查询长这样:

  • “适合油皮的粉底液”
  • “敏感肌能用吗”
  • “黄皮显白 口红”
  • “孕妇可以用的防晒”
  • “身高165体重50穿多大码”

这些查询有个共同点:用户在搜索框里主动补上了第二个自变量。他知道页面上没有这一栏,于是把自己的信息塞进了唯一一个能输入文字的地方。

这一栏日志是全站唯一一处用户不用被问、自愿说出“我是谁”的地方。而它通常只被当成关键词表在用——统计一下热搜词,看看有没有搜不出结果的,就结束了。

正确的用法是把带“我”的查询单独切出来做一份清单,那份清单直接就是你缺的属性字段列表。用户搜什么维度,你就该在筛选器、评价属性和商品描述里补什么维度,一条都不用猜。

这份清单还有个附带好处:它同时是长尾内容的选题表。用户用来描述自己的那些词,跟消费者查询意图的那10种电商查询模式里的几类高度重合,而AI购物助手在回答“我这种情况该买哪个”的时候,读的正是这类带条件的表述。页面上没有这一栏,机器也一样答不出来。

为什么这七个马甲很少被归到一起

上面那张表里的七个品类,问题形状完全一样,但在公司内部它们从来不会被放在一张单子上。原因挺现实的:

它们分属不同的团队。尺码归服饰品类组,尺寸归家具品类组,电压归客服和物流,配置归商品运营。每个组都在自己的范围里把它当成一个孤立的品类特性来处理。

它们的症状指标不一样。尺码问题表现为退货率,家具问题表现为加购率,电压问题表现为客服工单量,配置问题表现为跳出率。四个指标挂在四个看板上,永远不会同框。

它们都有一个现成的、听起来很合理的解释。“服装退货率本来就高”、“家具决策周期长”、“电压这事没办法”、“配置这块用户太小白”。每一句都能让讨论就地停下。

把它们归到一起的价值不在于找到一个万能解法——解法还是各做各的——而在于优先级排序会完全不同。七个孤立的品类小问题,每个都排不进季度前五;一个横跨七个品类的结构性缺口,量级立刻不一样了。

这是这类框架真正的用处:它不生产新的解法,它改变的是同一批解法在排期表上的位置。

怎么在自己站上做一次横向盘点

给一个半天能做完的盘点方法:

第一步,把退货原因和客服工单的分类各拉一份,只看文本,不看分类。因为分类是按内部逻辑定的,会把同一类问题拆散。直接读原话,找那些含有“我”的表述——“我家门太窄”、“我平时穿L”、“我这边是220伏”、“我不知道自己适合哪个”。

第二步,把站内搜索日志里带自我描述的查询切出来。方法在下一段说。

第三步,把两份清单合并,按品类分组。合完之后,每个品类下面那一堆“我”就是这个品类缺的那个自变量,一眼能看出来。

这个盘点不需要用户研究、不需要问卷、不需要预算,全部数据都是现成的。它最大的价值是给了一份用用户自己的话写成的需求列表,而这类列表在内部推动时几乎无法被反驳。

切搜索日志的具体办法

把“带自我描述的查询”切出来,不需要什么复杂技术,一组关键词表就够:

  • 身体与状态词:油皮、干皮、敏感、孕妇、儿童、老人、身高数字、体重数字、码数
  • 场景与用途词:上班、约会、送礼、旅行、通勤、夏天、南方、北方
  • 条件式表述:适合、能不能、可不可以、会不会、多大、几号
  • 疑问结构:查询里带问号,或者以“我”开头

命中任何一类就算。跑完统计两个数:这类查询占总查询的比例,以及这类查询的无结果率和点击率

第二个数通常很难看,因为站内搜索多半是按商品名匹配的,用户搜“适合油皮的粉底”往往搜不出东西。这个无结果率本身就是最直接的证据——用户在你的搜索框里问了一个问题,你的库里没有能回答它的字段。

顺便说,这批查询也是筛选器设计的最佳依据。用户反复用文字搜的那些维度,就是筛选器该有而没有的维度。连点五个筛选之后用户已经忘了自己选过什么讲的是筛选器怎么用才不迷路,而这里讲的是筛选器该有哪几栏——两个问题的顺序是先有对的栏,再谈好用

一个反向提醒:别把用户不需要的输入也收了

最后打个补丁,免得走过头。

收用户那一侧的输入是有成本的,成本落在用户身上:每多问一个问题,就多一次流失机会。所以只收那些确实会改变结论的输入。

判断办法是反过来问:如果这个字段填了另一个值,我推荐给他的东西会不会变?会变,就该收;不会变,那它就是一个纯粹的信息采集,别放在用户路径上。

见过一些站把注册流程做成七八个问题的问卷,问完之后推荐的还是首页那几个爆款。这比不问更糟——用户付出了成本,看到的却是通用结果,他会同时失去对这个功能和这个站的信任。宁可只问一个真的会用上的问题。

不加一行埋点,今天能先看哪五个数?

五个数全在你已经存了很多年的表里,一条查询就能跑出来,谁都不用等下个版本。

讲到这里最容易出现的一句反问是:“那我得先做用户研究吧?”不用。下面五个数全在已经存了很多年的表里,一条查询就能跑,谁都不用等下个版本。

五个不用新增埋点的数

第一个:同一个人在同一个商品上切换过多少次变体,然后加购或者离开。

变体切换通常本来就带着URL参数或者前端事件,不用新加埋点。这个数直接衡量“他在自己求值”的成本——切了八次然后离开的人,比看一眼就走的人价值高得多,他明确表达了想买,只是算不出来。把这批人的会话单独拉出来看,缺的那一栏基本就浮出来了。

第二个:用过匹配工具的人和没用过的人,退货率差多少。

注意不是打开率,是两组人的退货率之差。差值明显,说明工具真的产生了输入;差值接近零,说明它只是被打开了。这个数比任何满意度调研都直接,而且订单表和事件表里都有现成数据。

第三个:同一账号在同一品类下的历史“未退货”订单数。

这是前面眼镜案例的核心。大多数站从来没查过自己手里有多少这样的记录。先跑一遍看看量级——如果这个数字可观,说明你有一大批用户的“正确答案”已经躺在库里了,把它调出来用的成本远低于让他们重新做一次测量。

第四个:带属性的评价和不带属性的评价,被投“有用”的比例差多少。

这个数用来给补字段这件事找到内部支持。属性有没有价值这件事,靠讲道理很难说服人;两组“有用”投票率的差值是一个当场就能算、谁都没法反驳的数。如果站内还没有“有用”投票,那用评价的展开率、停留时长替代也行。

第五个:站内搜索里包含自我描述的查询占比。

把搜索日志按几个模式切一遍:包含肤质词、体型词、场景词、人群词的查询各占多少。这个比例通常比团队预估的高出一大截。它是最便宜的需求证据,而且它是用户自己写下来的,不是你推测的。

动手顺序:两个维度相乘

五个数跑完会得到一张单子,接下来的问题是先动哪个。排序用两个维度相乘:

维度一:用户会不会为这件事离开你的站。会离站的排前面。找不到合适的图会去视频平台,找不到同类人的评价会去社交平台,看不懂成分会去搜索引擎——这几件事的代价不是一次流失,是他在别处被别人接走。

维度二:这件事需要的是商品那一侧还是用户那一侧的输入。用户那一侧的排前面。理由很朴素:你的团队在商品那一侧已经施工很多年了,边际收益早就下来了;用户那一侧多半一次都没动过,随便挖一铲子都是新土。

两个维度都占的那几件事,就是这个季度该做的。两个都不占的,可以心安理得往后放。

一个动作就能验收

不需要工具,不需要预算,一个人二十分钟就能做完:

打开你自己的一个热销商品页,把上面所有的文字抄进一个文档,逐句问:这句话在不知道读它的人是谁的情况下,能不能得出一个结论?

然后数一数能得出结论的有几句。

多数页面的答案是零到两句,而且那一两句通常是运费和退货政策。这个数字本身就是这一整篇文章想说的东西——它不需要任何论证,你自己数出来就信了。

做完之后可以再加一步:把不能得出结论的那些句子,按“要收输入”还是“要做翻译”分两堆。分完这一步,需求列表就已经写好了。

卡点挂在哪一步

最后一件事,是怎么让它别再退回去。

把那一栏加进设计评审的模板里,不是上线前的检查表里。上线前才发现要改,代价是延期,延期就会被商量掉;设计评审时发现,代价只是改一版稿。这两个位置的成本差着一个数量级,而拦截效果是一样的。

那一栏就一句话:这次改动补的是商品那一侧还是用户那一侧?选项两个,不许填“两个都有”。填不出来的需求,多半是还没想清楚要解决谁的问题。

另外提一句:新加的检查项,第一次要先拿一个明知道会不合格的页面跑一遍,确认它真的会被拦下来。不然你挂上去的很可能是一个永远为真的条件,看着在守,其实什么都没守——这个坑我见过不止一次,而且发现的时候通常已经过了好几个季度。

五个数的具体口径,别跑歪了

这五个数看着简单,实际跑的时候有几个地方容易出偏差,提前说清楚:

变体切换次数,要按会话去重。同一个人在三天里分三次来看同一个商品,是三个会话,不该合并成一次高强度求值。合并了会把犹豫读成挣扎。

匹配工具的退货率对比,要控制品类和价位。用工具的人本来就更可能买高价位商品,而高价位商品的退货率天然不同。不控制这两个变量,差值算出来是假的。

历史未退货订单数,要排除超过退货期才发现问题的那批。有些品类的问题要用一段时间才暴露,“没退”不等于“合适”。稳妥的做法是只统计有复购的那批人——复购比不退货是强得多的信号。

带属性评价的“有用”率,要控制评价长度。愿意填属性的人往往也写得更长,而长评价本来就更容易被投有用。用同长度区间内的两组比,结论才站得住。

搜索日志的占比,要先去掉品牌词和商品编号。这两类查询占比通常很高,会把分母撑大,把结论稀释成“只有百分之几”。

这五条修正没有一条需要新工具,全是在写查询的时候多加一个条件。但每一条都能把一个会被当场质疑的数字变成一个说得下去的数字,性价比极高。

把结果讲给不同的人听

数跑出来之后,还有一关:怎么让它变成排期。这五个数各自对哪一类人最有说服力,其实是错开的:

数字最能说服谁该配的一句话
变体切换多次后离开产品经理这批人意愿最强,我们没接住
用过工具与没用过的退货率差财务与运营这个差值乘以订单量就是钱
历史未退货订单数技术负责人数据已经在库里,不用新采集
带属性评价的有用率差内容与UGC负责人加三个字段就能拿到这个差
搜索里的自我描述占比所有人这是用户自己写下来的需求

最后一个数是最好用的开场白,因为它没有任何推论环节——用户在搜索框里打了什么字,就是什么字。把二十条真实查询贴在会议第一页,比任何框架图都管用。

这套东西的边界在哪

说了这么多,也该说清楚它不解决什么,免得被当成万能钥匙。

它不解决产品本身不行的问题。如果色号盘本来就只覆盖三档肤色,把描述写得再准,深肤色用户看完只会更确定这里没有他要的东西——这时候该改的是产品线,不是页面。

它不解决价格没有竞争力的问题。用户算得出这个色号适合自己之后,下一步还是要看价格。前面这些工作的作用是把他送到价格这一步,不是替他跨过去。

它也不保证短期数字好看。把信息讲清楚的直接后果之一,是一部分本来会盲买的用户想清楚了不买——这批订单会消失在当期数据里,而它们省下来的退货成本要下个季度才体现。这个时间差要在立项的时候说明白,不然第一个月的数据会把这件事按死。

这一层的账和跨境电商降退货率那套预防体系是一样的:预防型投入的收益永远出现在成本科目里,而不是收入科目里,所以它天生比促销类动作难立项。提前把这句话说在前面,比事后解释省力得多。

最后一句

这篇讲的其实是一件挺朴素的事:商品页不是商品的说明书,是一次匹配的现场。

说明书只需要把这件东西讲清楚,匹配需要两边都在场。而绝大多数商品页上,只有一边在场——那一边还讲得越来越详细,另一边始终是空的。

用户站在屏幕前,对着自己的手背比划,试图用肉眼完成一次本该由系统完成的测量。他做不到,然后离开,而这件事在你的报表里不会留下任何一行。

常见问题解答

色号旁边加一句文字描述,会不会显得页面很啰嗦?

不会,它替代的是用户在脑子里做的那一步猜测,而猜测比多读八个字慢得多。写法是同一行前后放:品牌名在前保住调性,可读描述跟在后面,比如“马提尼克 · 中等偏深,粉黄混合底色”,整行不到二十个字,就是一个副标题的分量。真正让页面显得啰嗦的是另一类内容——把品牌故事、成分背景、使用方法一股脑堆在色号选择器和图片中间,把两块需要对照着看的信息隔开。标准是:这句话能不能帮用户往前走一步。色号描述能,它直接决定他点哪一格;品牌故事不能,它该往下沉。何况这段描述还是这排色块满足无障碍最低级别要求的必要条件。

没有预算做试色工具,还能做什么?

能做的比想象中多,而且几乎都不花钱。第一件是给每个色号补一段“色深加底色”的描述,纯文案工作。第二件是把手臂试色图一次拍全、跨几档肤色拍,这是一次性摄影成本,之后一直在用。第三件是在评价提交表单里加上肤质、肤色档这类字段,前端改动很小,难的只是要等三个月攒数据。第四件是把评价按属性做筛选,用户点一下就完成了自我标定,效果接近一个轻量版的匹配工具。第五件是把站内搜索日志里带自我描述的查询拉一份清单,照着补商品描述。五件事加起来的成本远低于一套匹配工具,而且不依赖任何第三方服务,明天就能开工。

成分表旁边写成分作用,会不会踩到合规红线?

要看怎么写。踩线的是效果承诺,比如“淡化色斑”这类把结果说死的表述,欧盟化妆品法规第20条明确禁止暗示产品具有它并不具备的功能。安全区在描述成分类别和常见用途,比如“保湿类成分”、“常用于配方增稠”、“抗氧化剂”,讲的是这个原料在配方里通常扮演什么角色,不是承诺它会在你脸上产生什么结果。另一个稳妥做法是把法定成分表原样保留、一个字不动,阅读辅助另起一块并标明它是通用科普而非产品宣称。不同市场尺度差别不小,出海站建议按最严的那个市场写一版全球通用表述,省得维护多套。写之前过一遍法务,这步别省。

只有一款主推色,还需要考虑这些吗?

需要,只是重心变了。色号少意味着“选哪一格”不存在,但“这一格适不适合我”反而更尖锐——用户没有备选,答案是不适合就直接走人。这时候要补的不是选择器旁边的描述,是真人图的肤色档数:同一个色号在不同底色的皮肤上效果完全不同,一张模特图只能接住一档人。评价属性的价值在这种情况下也会被放大,因为用户唯一能参考的就是跟他像的人用了怎么样。单色号产品还有个天然优势:你可以把“这个色适合哪几类人、不适合哪几类”直接写进商品描述,不用担心影响其他色号的销量——这句话多色号品牌很难写,对你是免费的差异化。

这套判断只适用于美妆和服饰吗?

不是,它适用于任何效果因人而异的品类,而这个范围比直觉中大。家具看的是能不能进你家那道门,电脑配件看的是够不够你干的那件活,保健品看的是你这个情况该吃多少,小家电看的是你那边的插座能不能用,床垫看的是你这个体重睡上去什么感觉。这些页面上都写满了商品那一侧的数字,都缺用户那一侧的那一个。它不适用的是结论跟人无关的商品——一节五号电池、一包A4纸、一瓶矿泉水,参数写清楚就够了,用户不需要把自己代入进去算。判断办法是问一句:这件商品换个人买,结论会不会变?会变的品类都在这个范围里。

补齐这些字段,对AI购物助手的可见度有帮助吗?

有,而且是同一份工作两处收益。AI购物助手接到的问题大量是带条件的,比如“我是敏感肌有什么防晒推荐”、“我这个身高体重穿这个牌子多大码”。它要回答这类问题,得在页面上找到把商品属性和人群条件对应起来的表述。页面上只有“净含量50毫升、SPF50+”,模型就只能靠通用常识硬答,答不出来就换一个能答的站去引用。反过来,如果商品描述里写着“适合中性偏干、屏障敏感的肌肤”,评价区里带着肤质属性,这些正好是它需要的原料。所以补第二个自变量这件事,做给人看和做给机器读几乎是同一件事,不用分两个项目排期。

怎么说服团队把资源从“把商品讲清楚”挪一部分过来?

别讲道理,让他们自己数一遍。找一个热销商品页,把文字全抄下来,逐句问“这句话在不知道读它的人是谁时能不能得出结论”,数数能的有几句。多数页面的答案是零到两句,通常还是运费和退货政策。这个数字是当场数出来的,没有推论环节,不需要相信任何理论。数完再翻一下最近三轮的需求列表,问一句“这些改动是不是在不知道任何一个具体用户是谁的前提下就能全做完”,多半答案是能。两个动作加起来不到半小时,比任何一份竞品分析都有说服力。之后把“这次改的是哪一侧”加进设计评审模板,连着三轮落在同一侧就停下来问为什么。

权威参考资料

分享到
标签
版权声明

本文标题:《她对着手背比了半天色号,你整页商品信息里没有一条是写给她的》

本文链接:https://zhangwenbao.com/product-page-user-side-input-gap-shade-matching.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交