满意度调查那个92%只覆盖了7.4%的买家,两个数都没算错

满意度调查那个92%只覆盖了7.4%的买家,两个数都没算错
张文保 89 分钟阅读 2,184 阅读
本文目录
  1. 92%和31%能同时是真的吗?
  2. 首屏那句话已经挂了一年多
  3. 报表另一头写着六个月留存28.3%
  4. 为什么一年多没有人把它们放在一起
  5. 把它捅破的人并不是在查这件事
  6. 两条线一交叉,问题自己跳了出来
  7. 问卷名单是从订阅系统里导的
  8. 从14027人到960人,中间掉了四次
  9. 那个92%实际覆盖了多少人
  10. 没有任何一步算错过
  11. 那句话完整写出来其实很长
  12. 我们其实做过一次验证
  13. 96%不是好消息,是坏消息
  14. 更要命的是那200人也来自同一份名单
  15. 手上其实有五份材料,四份都只覆盖还在的人
  16. 应用商店4.6分背后有个默认触发条件
  17. 退货率和留存率量的是两拨人
  18. 同一个词在两张表上指着两件事
  19. 第五份材料才是唯一有用的那份
  20. 走掉这个动作也要经过服务器
  21. 这不是造假,是合成失真
  22. 一个百分比要经过几道门才走到页面上?
  23. 先给这几道门起个名字
  24. 第一道门:名单本身就不全
  25. 你的名单是从哪张表导出来的
  26. 第二道门:联系上和被打开是两回事
  27. 第三道门:打开了不等于会答
  28. 皮尤这一波的应答率是87%
  29. 同一段话里还写着另一个数
  30. 两个数差了29倍
  31. 11年前那份报告的数字是3.7%
  32. 技术全换了,乘积几乎没变
  33. 被优化的那道门确实变好了
  34. 第四道门:什么时候问的
  35. 第五道门:用哪个通道问的
  36. 第六道门:哪些答案被留了下来
  37. 六道门里只有一道会出现在报表上
  38. 人为什么会本能地做加法
  39. 一次算术就够了
  40. 皮尤在门上花钱的两个地方
  41. 权重截尾是一道对称的门
  42. 剔掉7个人,理由跟答案无关
  43. 30秒粗筛只需要两个数
  44. 覆盖率是诊断值,不是及格线
  45. 同一道题换个通道,答案会差多少?
  46. 这是一次专门为了量它而做的实验
  47. 为什么这个设计值得单独说一句
  48. 60道题差了多少
  49. 自己拼出来的那张分档表
  50. 一半的题根本不受影响
  51. 受影响最狠的是哪一类
  52. 最大的那道差了18个百分点
  53. 方向是可以预测的
  54. 为什么会这样,机制其实很朴素
  55. 这件事对独立站意味着什么
  56. 一次让结论翻个个儿的实例
  57. 电话上看不出来的差别,网页上差17个百分点
  58. 还有一道题的偏差方向是反的
  59. 所以偏差不是一个能整体加减的常数
  60. 分组之后才看得见的差别
  61. 最大的一个分组差是20个百分点
  62. 还有一类差别跟体面无关
  63. 一个被念在最后的选项多拿了8个百分点
  64. 他们还顺手排除了一种解释
  65. 看得见全部选项的人更容易走极端
  66. 屏幕上多一个按钮,答案就变了
  67. 界面只影响那些本来就没主意的人
  68. 为什么总数正常反而最难被发现?
  69. 那次实验里两组的完成率几乎一模一样
  70. 把这一行拆开之后
  71. 一个差距是怎么被抵消掉的
  72. 比好看的数字更难发现的是正常的数字
  73. 我们那一整排数字全都很正常
  74. 指标齐整会产生一种体系健康的错觉
  75. 所以看总数的时候要固定拆几刀
  76. 该拿什么变量去拆
  77. 这两套变量经常没有交集
  78. 加权能修掉一部分
  79. 加权成立的前提是有一把外部尺子
  80. 皮尤自己承认有一条修不干净
  81. 修不掉的那一条正好最要命
  82. 换到独立站上,这一条更严重
  83. 而它和肯不肯填问卷由同一种性格驱动
  84. 所以效果类问卷有个天然上限
  85. 有一个办法可以绕开它
  86. 行为数据也有它自己的门
  87. 两类数据的正确用法是互查
  88. 把这一节压成一句可以直接用的话
  89. 哪些答案被留下来,是谁定的规则?
  90. 六道门里只有这一道有成文的法律判据
  91. 它分成互不相干的两半
  92. 前半段列了四种手段
  93. 什么叫无依据的法律威胁
  94. 恐吓这个词的范围比想象中宽
  95. 后半段才是每天都在发生的那一半
  96. 判据落在展示区暗示了什么
  97. 规则给出了可以隐藏的理由清单
  98. 七条理由的唯一共同点
  99. 最要紧的那句话是最终规则才改成这样的
  100. 把好评度换成情绪,也是被评论意见提醒的
  101. 列出的七条不是穷尽的
  102. 内容判据被换成了规则判据
  103. 两个被点名放行的例子
  104. 一个被点名否掉的例子
  105. 合理相信是假的这一条被质疑太宽
  106. 不予显示被改成了不可显示
  107. 但排序照样可能出问题
  108. 营销素材里挑好评也是同样的结构
  109. 为什么这一节能被拿出来立规矩
  110. 这道门是软件厂商替他们装的
  111. 皮尤剔掉那7个人是这条判据的正面样板
  112. 同一部规则里还有一节管自己人写的评价
  113. 同一个判据第三次出现
  114. 落到自己站上该做什么
  115. 一个机构的背书,凭什么比一个人的更可信?
  116. 把话题从评价区挪到榜单上
  117. 它先说清了机构背书为什么更有分量
  118. 所以它的要求也就顺理成章
  119. 第二个要求针对自称专家的机构
  120. 床垫那个例子把话挑明了
  121. 这一句话里塞了两个独立的条件
  122. 为什么必须两条都要
  123. 还差第三个方向
  124. 选条件这种做法的痕迹不在数据里
  125. 三个方向合起来是一张很短的检查单
  126. 蹦床那个例子讲的是另一种毛病
  127. 耳机那个例子最贴近今天的联盟生态
  128. 披露在这里不管用
  129. 不决定排名的付款则必须披露
  130. 最狠的是例子里最后一句
  131. 判据落在结果上,不落在动机上
  132. 落到自建榜单和对比页上
  133. 三个可执行的动作
  134. 一个很便宜的自测
  135. 顺带说一个容易被忽略的细节
  136. 两节法规其实在说同一件事
  137. 六道门的自查表:先算覆盖率,再谈那个数字
  138. 这份表和我上次那份最大的不同
  139. 第一件:把两条线画到同一条横轴上
  140. 它排第一是因为它可能让你直接收工
  141. 第二件:给每个百分比补三个括号
  142. 第三个括号填不出来的时候
  143. 第四件里最容易被忽略的一件事
  144. 为什么默认值总是往好里偏
  145. 第四件:把一个词的所有用法列一遍
  146. 共用一个词的后果
  147. 第五件:在出口设一问
  148. 出口是唯一能问到他们的位置
  149. 第六件:换通道复核,方向不能搞反
  150. 六件事排在一起长这样
  151. 我们最后改了四件事
  152. 三个月后的数字
  153. 转化率这笔账要摊开说
  154. 为什么71%反而比带口径的92%好卖
  155. 真正的收获不是那个数字
  156. 前两条加起来62%
  157. 后来做的两件事都很便宜
  158. 把这条固化下来
  159. 还有一件我们试了但没做成的
  160. 卡点这次挂在名字上
  161. 名字会被复制,脚注不会
  162. 有人提议简称,这件事必须顶住
  163. 顺带配一件更轻的
  164. 措辞:别说这个数不准
  165. 换成这样说
  166. 还有一句可以护住所有人
  167. 先说覆盖率,别先说结论
  168. 这套方法在什么地方会失灵?
  169. 先把它管不了的事说清楚
  170. 边界一:它只对自我报告类的数据有效
  171. 但客观事件仍然要过最后一道门
  172. 边界二:算出覆盖率不等于问题解决了
  173. 那这个数到底是干什么用的
  174. 边界三:剩下那些人是不是同一种人
  175. 为什么这一条最容易被忽略
  176. 补丁比想象中便宜
  177. 我们那次比出来的结果
  178. 而这个补丁自己也有边界
  179. 方法有边界不丢人
  180. 边界四:这笔支出是明码标价的
  181. 两件事必须一起排期
  182. 还有两条附加边界
  183. 第二条:容易走向另一个极端
  184. 还有一种情形它完全帮不上忙
  185. 什么时候该重跑一遍
  186. 说一下这篇文章用的材料是什么立场
  187. 需要选口径才能得出的必须自己重做
  188. 皮尤那份报告本身就是这篇文章的样板
  189. 最后照例说说这篇文章自己的门
  190. 常见问题解答
  191. 我们没有订阅制,只做一次性购买,这套东西怎么用?
  192. 问卷回收率本来就低,把发放时点提前会不会更低?
  193. 在退订页加一道题,会不会让本来犹豫的人更坚定地走掉?
  194. 应用商店评分弹窗那个7天触发条件,该改成几天?
  195. 覆盖率到底多少算够,有没有一个可以直接抄的门槛?
  196. 评价插件的过滤规则不是我们设的,出了问题算谁的?
  197. 老板要一个能对外说的满意度数字,覆盖率这套怎么跟他讲?
  198. 历史数据还能用吗,要不要全部重算一遍?
  199. 权威参考资料

摘要:页面上那个92%没算错,问题在它是从谁身上算的。一个自报数字从提问走到页面要过六道门——谁被抽中、谁被联系上、谁答了、什么时候问、用哪个通道问、哪些答案被留下。每道门单独看都干净,乘起来却换了口径。皮尤同一页印着87%的应答率和3%的累计响应率;同一批人同一道题换个通道,答案能差18个百分点。本文拆16 CFR 465.7的展示筛选判据与255.4的背书流程要求,附一次防打鼾设备复盘:覆盖率从7.4%提到46.2%,数字从92%掉到71%,换回2317条以前收不到的退订理由。

92%和31%能同时是真的吗?

首屏那句话已经挂了一年多

一家做防打鼾与睡眠监测设备的跨境独立站,主机89到259美元,配一个每月9.9美元的App订阅,团队20人上下,站点铺北美、英国和澳洲三个市场。

首屏这种一句话撑住半屏的写法,上一次我拆的是这句话背后有没有人真的做过对应的动作,这一次要拆的是它究竟从多少人身上算出来。

首屏正中间一行大字:92%的用户表示打鼾情况改善。这句话在页面上挂了15个月,投放素材里也用,联盟伙伴的推广页里也用。

报表另一头写着六个月留存28.3%

同一段时间,订阅侧的月度报表里有另一个数:六个月订阅留存28.3%。也就是说,每10个买了设备并开通订阅的人,半年后还剩不到三个。

留存这条曲线怎么算才不失真是另一个大题目,按同期群拆开还原真实回本周期的那套做法我以前专门写过,这里只借用它的中位数。

两个数都在公司内部流转,都没人质疑过,也都没错。它们只是从来没有出现在同一张纸上。

为什么一年多没有人把它们放在一起

满意度那个数归内容与增长团队管,用在页面和素材里;留存那个数归订阅运营管,用在月会和预算里。两条汇报线,两套周报模板。

同一件事在两套系统里有两个数,是所有数据治理问题的起点,把指标收敛到一个可信来源的那套分层做法能挡住其中大半。

这不是谁失职。每个人看的都是自己那一格,而矛盾恰好长在两格中间的那条缝上,而缝在任何一张流程图上都是不画出来的。

把它捅破的人并不是在查这件事

破局的是一位刚接手App端数据的同事。她要做的事跟满意度毫无关系,是画一张用户生命周期的触点图,把邮件、推送、评分弹窗、回访电话全标到一条时间轴上。

这类发现几乎都来自坐标系被统一的那一刻,所以先把测量框架设计清楚再去动埋点工具,比事后补分析要省太多力气。

标到第60天那个满意度问卷的时候,她顺手把订阅留存曲线也叠了上去,因为两张图用的是同一个横轴。她不是在怀疑什么,她只是需要一个统一的坐标系。

两条线一交叉,问题自己跳了出来

退订动作的中位数落在第41天,也就是已经走掉的人里有一半是在这天之前走的;而满意度问卷那根标记立在第60天。中间隔着19天。

问卷发出的那一天,一半以上会走的人已经走了。这句话不需要任何统计知识就能听懂,可它在报表上藏了这么久。

问卷名单是从订阅系统里导的

追下去很快就清楚了。问卷投递名单的取数逻辑是一句SQL:取下单满60天、且当前订阅状态为有效的用户邮箱。

写这句SQL的人没做错任何事。他要发的是App功能满意度回访,取有效订阅用户天经地义。只是这份名单后来被拿去支撑一句关于全体买家的话。

从14027人到960人,中间掉了四次

把那一年的数据完整拉出来,链条是这样的:同期购买者14027人,第60天时订阅仍有效的9240人,邮件被打开3864封,问卷完成1043份,其中960人给出4分及以上。

这个形状跟营销漏斗一模一样,只是它漏掉的不是订单是声音,按认知到留存四个阶段做内容映射的那套框架可以直接套过来用。

960除以1043,正好是92.0%。这个除法一点毛病没有,分子分母也确实是同一批人。

那个92%实际覆盖了多少人

环节人数本环节留存累计覆盖率这道门是谁设的
同期购买者14027100%
第60天订阅仍有效924065.9%65.9%取数SQL的筛选条件
邮件被打开386441.8%27.5%收件人自己
问卷完成104327.0%7.4%收件人自己
给出4分及以上96092.0%6.8%题目设计

一个数字好不好看和它有没有信息量是两回事,砍掉虚荣指标只留真正驱动生意那一个是判断该盯哪个数的第一步。

最后那个数字才是页面上写的92%。而它真正覆盖的,是全部买家里的7.4%。

没有任何一步算错过

我把这五个环节挨个查了一遍,取数正确、去重正确、邮件投递日志对得上、量表编码对得上、百分比四舍五入也对。

整条链上找不到一个错误,而结论已经和字面意思对不上了。这类问题最麻烦的地方就在这儿:没有可以指认的错处,也就没有可以追究的人。

那句话完整写出来其实很长

如果按它真实的口径复述一遍,页面上那行字应该是:在下单满60天、当时订阅仍有效、且打开邮件并填完问卷的1043人里,有960人给出4分及以上。

这句话没人会写在首屏上,因为它太长、太别扭、也太不像广告。可它和那六个字之间的差距,恰恰就是这篇文章要讲的全部内容。

我们其实做过一次验证

更值得说的是后面这段。半年前团队心里也有过一丝不踏实,于是安排客服抽了200个用户打电话回访,问同一道题:使用之后打鼾情况有没有改善。

验证这个动作本身也需要设计,随手找个人问一遍不算验证,按提示词级前后测搭一套对照的做法是我见过成本最低的一种。

结果96%的人说有改善,比邮件问卷还高4个点。当时的会议纪要写的是:邮件问卷偏保守,实际满意度更高,可放心使用。

96%不是好消息,是坏消息

皮尤研究中心做过一次很大的通道对照实验,结论之一是:有人在听的时候,人会把自己往好里说。同样一道满意度题,电话里的答案系统性地高于自己在屏幕上点选的答案。

问法里藏着的坑不止通道一种,把题干主语从你自己换成大家会让同一批人的答案差出16个点,那一条至少还写在题面上。

他们拿一个偏差方向更大的通道,去复核一个偏差较小的通道,得到了更高的数字,于是更加确信。复核的方向搞反了。

更要命的是那200人也来自同一份名单

客服抽样用的还是订阅系统那份有效用户列表。所以两次测量不但通道选反了,还共用同一道被污染的门。

用同一份名单换个方式再问一遍,验证不了名单本身。这句话听起来像废话,但当时在场的六个人,包括我,谁都没想到这一层。

手上其实有五份材料,四份都只覆盖还在的人

复盘时把能拿出来的证据全摊在桌上,一共五份。前四份都很硬,看起来足够互相印证。

材料看着多不代表覆盖得全,一份调研里如果连一个非会员都没有,结论就不该写给非会员看,讲的是同一种越界。

App后台的使用时长数据是真的,但它只记录设备连上App的夜晚;没戴但App开着也算,卸载之后所有历史归零。

应用商店4.6分背后有个默认触发条件

第二份是应用商店评分4.6分,1700多条。查下去发现评分弹窗的触发条件是连续使用满7天,这是接入的那个SDK的默认配置。

评价功能的默认配置值得逐项翻一遍,从已购验证到审核策略再到星级结构化数据该怎么配那篇里列的开关,大半都带着一道隐形的筛选。

没有人设置过它。你没设置的规则不等于没有规则,只等于它是别人替你设的,而且大概率是照着好看的方向设的。

退货率和留存率量的是两拨人

第三份是退货率8.9%。试用期45天,看着不高。可退货动作的中位数落在第12天,而订阅流失的中位数在第41天。

退货这件事本身也有它自己的口径问题,从尺码、产品图到物流逐段拆退货成因的那套预防体系里,第一步就是先把退货理由分对类。

第41天走的人绝大多数不退货,他们只是停掉订阅、把设备扔进抽屉。这两个指标量的根本是两拨人,却经常被并排放在同一行汇报里。

同一个词在两张表上指着两件事

第四份是客服满意度4.7分。这个分数是用户对客服处理过程的评价,跟产品效果没有关系。

一个词在公司里指两件事,最后一定会在某张幻灯片上撞车,用母版和模板体系把口径锁死是成本最低的一道防线。

但它在周报里的字段名就叫满意度,和首屏那个92%用的是同一个词。一个词在公司内部指着两件事,时间一长,两件事就会在某次汇报里被当成互相印证。

第五份材料才是唯一有用的那份

第五份是退订流程的服务器日志。它记录每一步的页面停留时长、点了哪个按钮、在哪一步跳出。

日志这类材料难看却诚实,从服务器日志里读抓取预算和伪造爬虫的那套方法证明过一件事:它记录的是发生了什么,不是谁愿意说什么。

它不好看,没有分数,也做不成图表。但它有一个前四份都没有的性质。

走掉这个动作也要经过服务器

前四份材料记录的都是还在的人,因为只有还在的人才会用App、才会打分、才会接电话。唯一没被这道门筛过的,是记录离开这个动作本身的那份日志。

离开动作留下的痕迹经常被当成噪声扔掉,发货前那次被拒掉的取消请求两周后会变成一个从欧洲寄回来的包裹,说的就是这类痕迹的价值。

一个人退订,他得点进账户页、点取消订阅、过一个挽留弹窗、点确认。这四步全都在服务器上留了印子,而这四步只有要走的人才会走。

这不是造假,是合成失真

整件事里没有人撒谎,没有人改数,没有人删记录。每一个环节拿出来单独审,都能通过。

同一条线上每一段都是真的,接起来却不能比,一条五年趋势线上藏着三处口径变更那篇讲的是时间方向上的同一个毛病。

一个数字的可信度不等于它每一步可信度的和,等于每一步的乘积。而人脑天生习惯做加法:五步都还行,就觉得整体还行。

一个百分比要经过几道门才走到页面上?

先给这几道门起个名字

那次复盘之后,我把这类问题的结构画了出来。任何一个自报类的百分比,从有人想问一句话,到它出现在页面上,中间固定要过六道门。

给结构起名字这件事本身就有价值,从指标体系搭建一路讲到异常诊断的那份数据分析框架里也是先命名后拆解,顺序不能倒过来。

六道门分别是:谁在名单上、谁被联系上、谁真的答了、什么时候被问的、用哪个通道问的、哪些答案被留了下来。每一道都在做同一件事——筛掉一部分人,而且筛掉的从来不是随机的一部分。

第一道门:名单本身就不全

皮尤研究中心现在用的是地址抽样,从美国邮政的投递序列文件里抽住户。这份文件被估算覆盖全国人口的九成到九成八。

名单不全这个毛病在技术侧同样常见,孤岛页面检测的抽样口径决定了你看到的孤岛是真是假,讲的就是名单来源决定结论的那一层。

也就是说,最好的情况下也有2%的人根本不在名单上,最差的情况下是10%。这个数字被写在方法论里,而不是被藏起来,这一点后面还会说到。

你的名单是从哪张表导出来的

换成独立站,第一道门就是那句取数SQL。取有效订阅用户、取近90天下过单的、取邮箱有效且未退订的,每一个条件都合理,每一个条件也都是一道门。

取数条件其实就是一次人群划分,从最近消费频次到生命周期再到互动度的7个分群维度,每一个维度换一下,你的名单就换一批人。

我们那次的门是订阅状态为有效,一刀切掉34.1%。而这一刀的存在感极低,因为它写在一行代码里,不写在任何一张报表上。

第二道门:联系上和被打开是两回事

邮件发出去9240封,被打开3864封,打开率41.8%。这个数字放在电商邮件里算相当好看的,团队甚至为此拿过一次内部表扬。

触达这一层的损耗大到值得单独治理,订阅者管理与群发队列该怎么配才不进垃圾箱那篇里的做法,能把这道门的损耗压下去一截。

但从口径角度看,它是一道损耗58.2%的门。而且它筛的方向很明确:本来就还在用、还愿意看你邮件的人,打开率天然更高。

第三道门:打开了不等于会答

3864个人打开,1043个人填完,完成率27.0%。愿意花4分钟填一份关于自己打鼾情况的问卷的人,跟不愿意的人,本来就不是同一种人。

肯不肯留下点什么高度依赖时机和字段数,弹窗的触发时机、字段设计与移动端合规怎么做那套经验,对问卷同样适用。

这三道门乘完,14027变成1043,只剩7.4%。而页面上那句话是关于全部买家说的。

皮尤这一波的应答率是87%

拿一个做得极认真的例子做参照会更清楚。皮尤2026年2月那一波调查,抽了5854名固定样本组成员,5119人完成,应答率87%。

应答人数直接决定这个数能撑起多重的结论,算样本量的那3个公式虽然是为实验设计的,用来倒推一份问卷够不够也完全成立。

87%这个数在调查行业里高得惊人。原因也不难理解:这些人早就同意长期参与、拿过报酬、答过很多次,是一批被筛选和训练过的受访者。

同一段话里还写着另一个数

就在同一段方法论说明里,紧挨着87%后面那句话是:把招募阶段的不应答与样本组流失都算进去之后,累计响应率是3%

87%和3%印在同一页上,中间只隔一个句号。被引用的永远是前面那个,因为它出现在描述这次调查的那句话里;3%出现在描述这个样本组历史的那句话里。

两个数差了29倍

87除以3约等于29。这不是谁在骗人,这是两个不同问题的两个正确答案:一个回答“这次请的人来了多少”,另一个回答“最初被找过的人里还剩多少”。

同一件事的两个正确答案差出一个量级,这类情况在看板上极常见,仪表盘全是绿灯生意却没动的时候该换掉哪些老指标说的正是它。

页面上、新闻稿里、二手引用里出现的,一律是前一个。不是因为有人挑了它,是因为它就长在描述这次调查的那句话旁边。

11年前那份报告的数字是3.7%

更有意思的是往前翻。皮尤2015年那份通道对照实验,用的还是随机拨号电话招募,那次招募调查的应答率是10.6%,本波网页组完成率64%。

报告里直接写出的累计响应率是3.7%。我拿这三个数回推,中间那段入组与留存大约是55%,三段乘起来正好落在3.7%上。

技术全换了,乘积几乎没变

对照项2015年通道实验2026年第187波变化
招募方式随机拨号电话地址抽样邮寄整套换掉
本波抽样人数2345(网页组)58542.50倍
本波完成人数150951193.39倍
本波应答率64%87%提高35.9%
累计响应率3.7%3%下降18.9%

工具换代不等于结果换代,一把刻度很准的尺子刻的却是上一代分词器的口径那篇讲的也是这种表面更新、实质没动的错觉。

11年,招募方式整套换掉,样本量翻了3倍多,本波应答率从64%提到87%。而累计响应率不升反降。

被优化的那道门确实变好了

唯一被优化过的那道门提高了近36%,总数却下降了19%。因为你能看见并且能优化的,往往是链条上最容易被看见的那道门,而它在乘积里的权重可能恰好是最小的。

局部变好整体没动,是所有优化工作最常见的结局,排名和转化都正常生意却没起色时该问的那3个问题可以直接拿来自查。

这一条我反复想过。它解释了为什么很多团队在指标上花了很大力气,最后什么也没变——力气全花在那道本来就还行的门上。

第四道门:什么时候问的

时点这道门最不像门,因为它不筛人,它只是等。可等待本身就是筛选:你等得越久,能答的人越少,而先走的那批人有共同特征。

时点这道门在获客侧同样致命,从零把邮件列表养到能变现的那套合规做法里,什么时候发第一封信几乎决定了后面所有转化。

我们那次是等到第60天,正好等过了流失中位数。把发放时点往后挪一天,问卷就少覆盖一批人,而这批人恰好是最不满意的那批。

第五道门:用哪个通道问的

通道这道门跟前面四道完全不同。前四道决定谁能答,通道决定同一个人会怎么答。它不改变分母,它改变答案本身。

这一道值得单开一节讲,因为它最反直觉,实证材料也最扎实。

第六道门:哪些答案被留了下来

最后一道是展示。收上来1000条评价,页面上显示800条,那200条去哪了、按什么规则拿掉的,这件事美国的联邦法规专门写了一节。

用户产生的内容要变成资产,前提是它没被筛得只剩一面,把评价、问答和社区内容做成会排名的资产那篇里的取舍值得对照着看。

这一道也单开一节。它是六道门里唯一一道有明确法律判据的。

六道门里只有一道会出现在报表上

回头看那张周报,能查到的只有第三道:问卷完成1043份,写在页脚一行小字里。其余五道全都不在任何一张表上。

报表装不下的东西通常要靠对账补,数据分析师与SEO那7个对账动作点解决的就是同一个问题:让不在字段里的东西也有个落脚处。

不是有人隐瞒,是没有一个字段是用来装它们的。报表模板从来只有分子分母两栏,而这六道门里有四道既不是分子也不是分母。

人为什么会本能地做加法

我在会上试过一个笨办法:让每个人先猜一下最终覆盖率。六个人给的数字集中在四成到六成之间,没有一个人低于三成。

问他们怎么估的,答案几乎一样:每一步感觉都还行,掉一点点,加起来掉了一半左右。他们做的是加法,实际发生的是乘法。

一次算术就够了

假设六道门每一道都很宽松,各自保住九成。零点九的六次方等于零点五三一,只剩53.1%。而这已经是极其理想的情况。

连乘这件事在预测里也一样反直觉,用关键词漏斗模型把自然搜索算成真金白银那篇里最容易出错的一步,就是把几个转化率乘在一起。

我们那次前三道门是65.9%、41.8%、27.0%,乘出来7.4%。凡是乘法,直觉一律失效,这不是能力问题,是人脑的默认算法就不是这么写的。

皮尤在门上花钱的两个地方

顺带说两个值得抄的做法。第一个是报酬分档:5美元到15美元不等,标准是这个人属不属于传统上应答率低的群体。

花更多的钱,去够那些最难够到的人。这句话翻译成运营语言就是:别把预算按人头平摊,按获取难度分配。

权重截尾是一道对称的门

第二个是加权处理。计算出来的权重会在第1和第99百分位截尾,两头各切一刀,目的是避免极端权重把精度吃掉。

清洗规则对不对称,决定了你清掉的是噪声还是信号,把机器流量揪出来再拦掉别让报表失真那套判据也是只看行为不看结果。

这道门也筛,但它两端等距,不管被切掉的是哪一边的答案。这个性质在下面讲展示筛选那一节会变成核心判据。

剔掉7个人,理由跟答案无关

还有一个细节我很喜欢。那一波有7名受访者在加权和分析之前被剔出数据集,理由是敷衍作答:大量留空,或者永远选第一个、永远选最后一个。

判定依据是作答行为,不是答案内容。一个人无论把满意度全打成5分还是全打成1分,只要他是全打同一个,就同样被剔掉。

30秒粗筛只需要两个数

不用记六道门。看到一个自报类百分比,只问一句:这个数是在多少人里算的,同期一共有多少人。两个数一除,覆盖率就出来了。

粗筛之后总要有个参照,转化率、排名周期、流量占比该对标多少才算正常那份基准表可以当第二把尺子,但同样要先问它的口径。

这个粗筛比我上一次给的那个还好用,因为它的答案是个数,不是一段话。数可以填进表格、可以排序、可以拿去比,判断不行。

覆盖率是诊断值,不是及格线

要提前说清楚一件事,免得后面误会:7.4%不必然是错的,46.2%也不必然是对的。覆盖率不设及格线。

它告诉你的是这个数还能承受多重的结论:7.4%可以拿来做趋势观察,不能拿来做首屏断言;46.2%可以做首屏断言,不能拿来跟行业均值比大小。

同一道题换个通道,答案会差多少?

这是一次专门为了量它而做的实验

2014年7月7日到8月4日的那次访问方式效应实验里,皮尤把自己长期固定样本组里3003名平时都在网上答题的成员随机分成两半:一半照旧在网页上填,另一半改由访员打电话问。

把一个变量单独隔离出来测,代价往往是加倍的成本,单因素隔离与最小可检测效应该怎么设计那篇讲清了这笔钱花在哪儿值。

题目一模一样,60道,涵盖政治、宗教、社交关系、日常行为、个人健康、人际信任。两组分别独立加权到全国人口结构,目的就是把除了通道之外的差别全部抹平。

为什么这个设计值得单独说一句

这不是拿一份电话调查和一份网络调查去比。那样比出来的差别里,混着两批人本身不一样、两次时间不一样、两套抽样不一样。

比较两个已经不一样的东西得不到结论,测哪条外链真的撬动了排名要用的那6步实验设计也是先把可比性建立起来再谈效果。

随机分配加独立加权之后,剩下的差别只能来自一件事:这道题是被念出来的,还是被看到的。这种设计在业内不算多见,因为它等于花两份钱做一份调查。

60道题差了多少

结论先给:平均差5.5个百分点,中位数5个百分点,范围从0到18个百分点。60道题里只有4道完全没有数值差异。

同一件事不同来源给出不同的数,本身就是一条重要信息,关键词难度在各家工具之间为什么差那么大那篇的拆法可以直接搬过来。

报告正文没有给出完整的分档表,只散着几句话。我把这些句子拼起来自己算了一张,才看清分布长什么样。

自己拼出来的那张分档表

差异幅度题目数占比说明
0个百分点46.7%完全没有数值差异
1到4个百分点2440.0%多数不具统计显著性
5到6个百分点1118.3%中位数落在这一档
7到9个百分点1321.7%已足以改写一句结论
10个百分点及以上813.3%最大的一道是18

拼法是这样:报告说4道零差异、24道非零但小于5个百分点、21道达到或超过7个百分点、其中8道达到或超过10个百分点。60减去4、24、21,剩下11道落在5到6之间。

一半的题根本不受影响

先说让人安心的那一半。差异小于5个百分点的有28道,占46.7%,而且其中大部分连统计显著性都够不上。

不是所有的分歧都需要处理,同一个问题问十种语言给出十个结论,其中有一类改了就是改错讲的正是先分类再决定动不动。

零差异那4道,加上一批只差一两点的,几乎全是关于具体事实的:有没有护照、有没有驾照、昨天有没有锻炼、昨天有没有给亲友打电话、信不信教。问一件确凿发生过的事,通道几乎不起作用。

受影响最狠的是哪一类

21道差异达到7个百分点以上的题里,7道是给政治人物打分,4道是私密个人处境,3道是对少数群体处境的判断。

剩下几道里有两道特别有代表性:多久跟邻居聊一次天、多久参加一次宗教活动。这些题的共同点是,答案会让答题的人显得好一点或者差一点。

最大的那道差了18个百分点

差异最大的是家庭生活满意度。电话里62%的人说自己非常满意,网页上只有44%。第二大的是社交生活满意度,43%对29%,差14个百分点。

表达方式决定可选答案,这件事在语言层面更极端,你的色卡上蓝和绿是两格,120门语言的样本里只有30门这么分就是同一个机制。

同一批人,同一道题,同一个星期。区别只是一边有人在听,一边没有。18个百分点的差距不来自任何一个人撒谎,它来自一句话是被说出口的还是被点出去的。

方向是可以预测的

凡是让人显得体面的答案,电话里都更高:家庭美满、社交充实、社区极好、夜里散步很安全、经常跟邻居来往、自评健康极好。

偏差方向能预测就意味着它可以被利用也可以被防,5个月里把品牌情感评分从67做到82的那套操作用的正是这种可预测性。

凡是让人显得窘迫的答案,网页上都更高:过去一年买不起家里需要的食物,电话20%,网页28%;生活水平不如父母,电话20%,网页28%。

为什么会这样,机制其实很朴素

调查研究里管这个叫社会赞许偏差。它的意思不复杂:面对一个真人,人会不自觉地把自己往能被接受的那一侧调一点点。

这不是撒谎,也不完全是自觉的。有既往研究拿受访者自述去比对学校的行政记录,凡是落在不体面那一格的人,在电话里否认的比例明显高于自己在网页上填的时候。

这件事对独立站意味着什么

产品效果类的满意度题,几乎每一道都带着体面属性。承认花了两百多美元买回来一个没用的东西,本身就不体面;承认自己没坚持用,更不体面。

红人内容里的效果表述几乎全是自报的,从选人、谈合作到衡量投入产出的那套红人营销框架里,验收表最该加的一栏就是依据。

所以客服电话回访、真人访谈、线下座谈这三种通道,天然是往上偏的。它们的价值在于挖细节,不在于量比例。

一次让结论翻个个儿的实例

接下来这个例子我看到的时候愣了一下。题目是:过去一年有没有因为费用问题该看医生却没去看。

同一件事两套算法给出相反结论而且都没算错,商品页那个推荐位在两套报表里的相反结论是我手上另一个同类例子。

整体上电话22%、网页28%,差6个百分点,属于中等。可是按受访者族裔拆开之后,事情完全变了。

电话上看不出来的差别,网页上差17个百分点

受访者电话组网页组组内差距
白人21%22%1个百分点
非白人23%40%17个百分点
两族裔之差2个百分点18个百分点

如果只做电话调查,你会得出“不同族裔在就医可及性上差不多”这个结论;只做网页调查,你会得出“差距非常大”。

这不是精度差异,是结论方向的差异。两份报告都会说自己是全国代表性样本,都会附上误差范围,而它们对同一件事给出的判断互相矛盾。

还有一道题的偏差方向是反的

更麻烦的在后面。问“黑人是否面临很多歧视”,白人受访者电话里50%、网页上37%,电话更高13个百分点。

而黑人受访者反过来:电话71%、网页86%,网页更高15个百分点。同一道题,两个人群,两个相反的方向。

所以偏差不是一个能整体加减的常数

如果通道偏差是个常数,事情会简单得多,减掉就是了。可它按人群分方向:同一道题,有的群体在电话里说得多,有的群体在电话里说得少。任何一刀切的修正都会同时把一半人改对、把另一半人改得更错。

归因模型的选择也是同一类问题,没有哪个模型可以整体校正,多触点归因模型怎么选才不被最后一次点击骗走预算讲的就是这个取舍。

皮尤自己在结论里也只能写到这一步:对于大多数差异,没有办法判断电话和网页哪一边更接近真实。

分组之后才看得见的差别

整体没差别不代表哪儿都没差别。做过志愿服务这道题,整体上电话61%、网页58%,不显著。

整体看不出来的东西往往要靠分组才现形,按内容类型拆解自然流量表现的那套内容分组配置是成本最低的一种拆法。

但在白人福音派新教徒里,电话71%、网页57%,差14个百分点。一个整体上完全干净的指标,在某个子群里藏着一个足以改写结论的裂口。

最大的一个分组差是20个百分点

生活水平是否不如父母这道题,整体差8个百分点。在黑人受访者中,网页29%、电话9%,差20个百分点,是整份报告里最大的分组差异。

顺着同一条线还有两个:跟邻居来往在高收入人群里差15个百分点;很少或从不参加宗教活动这道题,男性差14个百分点,女性只差1个百分点。

还有一类差别跟体面无关

不是所有通道差异都来自要不要面子。有一类纯粹来自信息是怎么送到脑子里的。

界面本身就在替用户做决定,那些看着无关紧要却真能提转化的9个反直觉设计杠杆里,有一多半靠的是同样的认知机制。

电话里选项是被一个一个念出来的,最后念的那个更容易被记住,因此更容易被选中,这在调查方法里叫近因效应。

一个被念在最后的选项多拿了8个百分点

那次实验里有一道追问:你刚才那个就诊次数是怎么想出来的。四个选项,最后一个是“凭大致印象估的”。

排在最后和排在最前从来不是中性的,搜索框从入口到结果那4层设计里,默认推荐词的顺序就能改变一大批人的下一步。

电话组15%的人选它,网页组只有7%。要么是电话里的人图省事,要么就是因为它排在最后被念到——报告本身也没能把这两种解释分开。

他们还顺手排除了一种解释

有人担心网页组会偷偷去查答案,于是那次实验记录了每道题的作答耗时。两道知识题上,网页组比电话组多花7到8秒,而前后那些态度题的耗时没有差别。

如果真有人在查答案,网页组的正确率应该更高,可实际并没有。多出来的那7秒花在思考上,不是花在搜索上——这个排除动作值得学,因为它花的成本只是记一个时间戳。

看得见全部选项的人更容易走极端

0到100的温度计打分题上还有一个规律:电话受访者更爱往中间靠。给国会民主党领袖打分时,落在34到66这一段的,网页36%、电话45%。

一屏能不能被看全,直接决定用户会不会往下点,用户扫完一整屏商品一个都没点开这件事在报表里等于没发生说的就是这个盲区。

反过来,网页上给出“非常不喜欢”这一档的比例,在被问到的六位政治人物身上无一例外全都更高。没人在听的时候,人更愿意把话说满。

屏幕上多一个按钮,答案就变了

最后一个细节最像我们每天在做的事。网页版给了一个“从没听说过或说不准”的按钮,电话版没有这个选项,访员被要求接受但不主动提示。

首屏放什么就等于替用户圈定了选项范围,首页首屏的导航、主横幅到分类区该怎么设计才留住人那篇里的取舍逻辑完全通用。

对知名度高的人物毫无影响。对两位知名度低的参议员,网页上不给评价的比例分别是44%和40%,电话上是38%和31%。

界面只影响那些本来就没主意的人

一个可点的按钮只对那些心里没数的人起作用,对已经有立场的人一点用都没有。而没主意的那批人,恰好就是转化率最想撬动的那批人。

把这条搬到产品页上就是:你加的那个默认选项、那个预勾选、那个排在第一的规格,只对犹豫的人生效——而它生效的方向是你选的。

为什么总数正常反而最难被发现?

那次实验里两组的完成率几乎一模一样

回到2014年那次通道实验。被分到网页组的人,64%完成了调查;被分到电话组的人,63%完成了调查。差1个百分点。

抽样方式决定了你能看见什么,逐条查网址要跑100天,改成按页面模板抽样半天就查完那篇里换的正是切分维度。

如果只看这一行,任何人都会得出同一个判断:两组的应答情况没有区别,可以放心比较。这个判断在总数层面完全正确,在几乎每一个子群层面都不成立。

把这一行拆开之后

群体网页组完成率电话组完成率差距
全体64%63%1个百分点
非西语裔黑人42%56%电话高14个百分点
自称非常保守电话高11个百分点
农村居民电话高10个百分点
不倾向任何一党网页高7个百分点
女性网页高6个百分点
郊区居民网页高6个百分点
自称非常自由派网页高4个百分点

拆维度这件事的价值在于把一个数变成一组数,27个维度逐项对账揪出你到底缺了什么就是把总分拆开之后才看清的。

年龄、学历、婚姻状况、收入、地区这五项确实没有显著差别,报告里也这么写了。可另外五六项差得相当厉害,其中最大的一项是14个百分点。

一个差距是怎么被抵消掉的

这些分组差异之所以在总数上看不见,是因为它们方向相反、大小相近,在汇总的时候互相抵消:农村的人更愿意接电话,郊区的人更愿意点链接,两边一加就抹平了。

总数正常不是“没有问题”的证据,它同样可能是“两个方向相反的问题恰好一样大”的结果。而这两种情况在报表上长得完全一样。

比好看的数字更难发现的是正常的数字

我以前写过一次教训:一个异常如果表现为一个偏好的数值,任何监控都不会响。这次这一层比那一层还隐蔽。

异常值至少还会引人去看一眼,直接流量突然暴增时那6类成因的排查决策树能提醒你:跳出来的那个数反而是幸运的。

好看的数字至少还会被人夸一句、被人问一句怎么做到的;正常的数字连成为话题的机会都没有。最安全的藏身处从来不是优秀,是平均。

我们那一整排数字全都很正常

回头看自己那次。邮件打开率41.8%,比行业中位数高一点;问卷完成率27.0%,正常;退货率8.9%,同品类偏低;客服满意度4.7分,很好。

一屏指标齐整不代表它们在讲同一件事,私域社群那5个维度的指标看板在搭的时候第一件事就是标清每个数覆盖谁。

四个数排成一行,看上去像一个健康的体系。可它们量的根本不是同一批人:打开率量的是还在的人,退货率量的是第12天走的人,客服满意度量的是遇到过麻烦的人。

指标齐整会产生一种体系健康的错觉

这种错觉的来源很朴素:一屏数字如果没有一个是红的,人就不会想去点开任何一个。看板设计的初衷是让异常跳出来,副作用是让不跳出来的一切显得已经检查过了。

有些指标留在看板上只是因为没人敢删,该淘汰的那9个老指标和它们的替代方案那篇可以当一次清库存来读。

而口径问题永远不会让任何一个格子变红,因为它不产生异常值,它只是让每一个正常值回答了一个它没被问过的问题。

所以看总数的时候要固定拆几刀

皮尤那份报告拆的是人口学变量:性别、族裔、城乡、党派倾向、意识形态。这是民调的标准动作,因为他们的结论就是关于人群的。

拆成漏斗再看是最省事的一种拆法,把社媒指标拆成4层漏斗只盯能驱动生意的那几个给出的分层可以照搬。

独立站该拆的不是这几刀。我们关心的不是“哪一类人怎么想”,是“哪一类人肯答”,这两件事需要的切分变量完全不同。

该拿什么变量去拆

我的做法是固定三刀:获取渠道、下单距今天数、客单价档位。选它们的理由很实际——这三个字段在订单表里本来就有,不用新加埋点,导一次数就能拆完。

选错切分变量比不切分更误事,品牌词和非品牌词为什么必须当两件事做就是一次典型的切分变量选择题。

更要紧的是选取原则:拆那些会影响一个人肯不肯答的变量,而不是拆业务上最关心的变量。业务关心品类和地区,可影响肯不肯答的是他离上次下单多久、有没有找过客服、有没有退过货。

这两套变量经常没有交集

那次我们把问卷回收按获取渠道拆了一下,结果挺难看:搜索来的用户回收率是11.9%,社媒广告来的只有6.2%,联盟渠道来的4.1%。

业务关心的和数据敏感的经常不是同一批变量,搜索缺口、平台评论加小预算投放那套三角验证解决的就是单一视角看不全的问题。

而这三个渠道的退订率排序恰好反过来。回收率最低的渠道退订率最高,于是它在满意度里的权重也最低——这是一个自我加强的循环。

加权能修掉一部分

有人会问:那加权不就行了吗,按渠道占比配回去。可以修一部分,但要清楚它修的是什么。

校正手段能补多少要看你还剩多少信号,归因失真之后重建转化接口与投放回报的那9招里,每一招都得先确认信号还在。

加权修的是你测过并且有基准的那些维度。皮尤能把性别、年龄、学历、族裔、地区、人口密度、电话覆盖、党派、上网习惯全配回官方基准,因为这些维度有全国口径可对。

加权成立的前提是有一把外部尺子

皮尤能把性别、年龄、学历、族裔、地区、人口密度、电话覆盖、党派倾向和上网习惯全部配回去,靠的是这些维度都有权威的全国口径可对:人口普查、社区调查、卫生统计。

独立站手上没有这样的外部基准。你只能用自家历史数据当参照,而历史数据本身就是同一套门筛出来的。拿被污染的样本去校正被污染的样本,这件事在数学上没有出路。

皮尤自己承认有一条修不干净

那份报告里有一段很诚实的话:有一项差异没能被加权完全调整过来,就是这些人以往参与调查的规律性。

数字是这样的:前三波全参加过的人里,网页组完成率97%,电话组83%;漏过一波以上的人里,网页组32%,电话组44%。加权之后,网页组里漏过波次的人占29%,电话组占43%。

修不掉的那一条正好最要命

校正能修的是你测过的维度,修不了你没测过的。而问题总是出在没测过的那一维——因为如果你测过它,你多半早就发现了。

最重要的那一维经常正好是没有数据的那一维,零点击时代后台一片空白时该怎么补归因给的是一整套替代信号的思路。

更巧的是,皮尤这一条修不干净的差异,恰好直接影响的就是上网频率那道题。报告里明说了:唯一一处控制前后结论不一致的分析,就是互联网使用与技术那一组。

换到独立站上,这一条更严重

我们能加权的是渠道、地区、客单价这些。加不上去的是依从性——这个人肯不肯每天按说明书使用这台设备。

依从性没有任何一张表记录,也没有任何基准可以对。它是产品效果最大的一个变量,同时是唯一一个既没被测量也无法被校正的变量。

而它和肯不肯填问卷由同一种性格驱动

愿意花4分钟填一份问卷的人,和愿意每天晚上把设备戴好的人,高度重合。这不是巧合,是同一种特质在两件事上的两次表现。

肯配合的人本来就是一个特殊群体,把素人体验官铺成真实口碑矩阵的那套运营流程里,筛人这一步的偏向必须提前认下来。

这一条我想了很久。它意味着自报类效果数据的向上偏差是结构性的,不是抽样噪声:填问卷这个动作本身,就在筛选那些更可能有效果的人。

所以效果类问卷有个天然上限

你可以把覆盖率从7.4%提到46.2%,可以把发放时点提前,可以在退订页设问,这些都能让数字更接近真相。

但只要作答仍然是自愿的,这层筛选就消不掉。能做的是把偏差压小并且写清楚,做不到的是把它归零。承认这一点比假装能修干净要有用得多。

有一个办法可以绕开它

唯一能真正绕开自愿作答的,是那些不需要人配合就会产生的数据:登录频率、连接次数、耗材复购、订阅续费、退货申请。

行为侧的数据不需要谁配合就会产生,服务器端跟踪加数据仓库还原用户旅程的那8步是把这类数据攒起来的常规做法。

这些事件在服务器上自动落库,走的人和留的人在里面权重相同。它们说不出“为什么”,但它们对所有人一视同仁,这一点是任何问卷都做不到的。

行为数据也有它自己的门

不过别把行为数据当成万能解药。它同样有门,只是门的位置不一样:埋点漏埋、App被卸载之后数据归零、跨设备识别不上、隐私设置拦掉一部分上报。

日志同样会漏,只是漏的地方换了,8类用户代理实测与22周访问账本那份日志解码里,识别不出来的那部分就是它的门。

我们那份App使用时长数据就栽在最后一条:卸载即清零,所以使用时长的分布里天然不包含用得最差的那批人,跟问卷犯的是同一个错,只是换了个地方犯。

两类数据的正确用法是互查

最省事的做法是让两类数据互相当参照:问卷说92%的人有改善,行为数据说六个月留存28.3%,两个数对不上就说明至少有一个的口径需要交代。

两套证据互相解释比任何单一证据都稳,内容、外链、实体、技术栈四层逆向拆解用的也是同一种交叉验证的思路。

它们不需要一致,只需要能互相解释。解释得通就往下走,解释不通就停下来找那道门——我们那次的全部问题,就在于从来没人把这两个数放在同一句话里过。

把这一节压成一句可以直接用的话

看到一个正常的总数,先别放心。至少拆三刀,而且拆的时候别问哪一类人表现好,问哪一类人根本没进这个数。

这个动作花不了多少时间,我实测在自家后台跑完是20分钟左右。它的产出通常不是一个结论,是一份名单:哪些人从来没有出现在任何一份满意度数据里。

哪些答案被留下来,是谁定的规则?

六道门里只有这一道有成文的法律判据

前五道门在多数国家都属于行业自律范围,你做得糙一点也没人管得着。第六道不一样。美国联邦法规第16篇第465部分专门有一节写它,节号465.7,标题就叫评价压制

法务这条线平时用不上,用上的时候通常已经晚了,隐私合规、商标侵权与数据泄露应答那7个协作动作点适合提前铺一遍。

整部规则是2024年8月定下来的,委员会当时发过一页纸的说明把九节内容列成清单,不想读法条可以先看那一页。这一节短得出奇,正文加上例外一共不到500个英文单词。可它给出的判据,是我见过对这类问题最干净的一次表述,干净到可以直接搬去审自己的页面。

它分成互不相干的两半

前半段管的是拦着别人别写,或者逼着别人删掉;后半段管的是写了也收了,但你在展示的时候少放了一部分。两半针对的是完全不同的两种做法。

条文里的例外条款经常比正文更要紧,违禁词检测把本店销量最好标成高风险,而这句话是执法指南里的例外就是一次典型误判。

前半段和大多数独立站关系不大,但值得知道它的边界在哪;后半段几乎每一家有评价功能的站点每天都在触碰。

前半段列了四种手段

无依据或无根据的法律威胁、人身威胁、恐吓,以及明知为假或罔顾真假地公开指控。用这四样里的任何一样去阻止一条评价被写出来,或者让它被拿掉,都算违规。

差评的正确用法是当情报不是当威胁,从对手评论里挖差异化卖点的那套框架给的是另一条比删帖划算得多的路。

注意最后半句:不管那条评价被拿掉之后有没有被别的内容替换上,都算。这句话堵的是“我不是删,我是换了一条上去”这种说法。

什么叫无依据的法律威胁

规则里给了定义:所依据的主张、抗辩或其他法律主张不被现行法律所支持,或者其事实主张没有证据支持、在经过合理的进一步调查后也很可能不会有证据支持。

换句话说,发函这个动作本身不违规,发一封你自己心里清楚站不住脚的函才违规。判据落在你有没有依据上,不落在你用了什么语气上。

恐吓这个词的范围比想象中宽

有评论意见认为恐吓就是武力威胁,跟人身威胁重复,建议删掉。委员会不同意,并且把它的范围说清楚了:辱骂性的沟通、跟踪、人格抹黑、性骚扰,只要目的是通过制造恐惧让人做或者不做某事,都算。

社媒上的应对分寸最容易踩线,海外社媒营销那5类绝对不能碰的雷区与发布前自检清单里有几条正好覆盖这种场景。

这一条对做社媒运营的团队有实际意义。在评论区跟差评用户对线、公开翻他的历史发言,性质上离这里描述的东西并不远。

后半段才是每天都在发生的那一半

465.7的后半段说:如果一家企业在自己网站上专门用来接收和展示消费者评价的那个区域里,实质性地暗示这些评价代表了提交上来的大部分或全部评价,而实际上有评价因为评分或负面情绪被压制,那就构成违规。

评价区既是转化组件也是收录资产,产品评论的结构化数据与生成式引擎联动该怎么做那篇讲的是它的正面用法。

读三遍会发现它的重心在一个很别扭的地方。它禁的不是隐藏,是隐藏的同时还暗示这是全部。

判据落在展示区暗示了什么

一个评价区,上面写着“用户评价(1247条)”,下面挂着按时间排列的一列。它没有明说这是全部,但任何人看了都会这么理解。这就叫由暗示构成的实质性误述。

自家榜单把自己排第一这件事被点过名,自夸式榜单被点名之后该怎么做合规改造给的整改路径和这里的判据是一套。

反过来,如果一个页面只挑了三条好评做成图,标题写着“部分用户反馈”,那它不在这一节的射程内——因为它从头到尾没有主张过自己是全部。

规则给出了可以隐藏的理由清单

可以不显示的理由它判断的是什么
含商业秘密或保密的商业与财务信息信息类型
含诽谤、骚扰、辱骂、淫秽、粗俗或色情内容表达方式
含他人的个人信息或肖像是否侵犯第三人
含基于种族、性别、性取向、族裔等固有特征的歧视内容表达方式
含明显虚假或误导的内容事实真假
卖家合理相信该评价是伪造的来源真假
与本站所售商品或服务完全无关相关性

评价能不能被机器读到是另一层筛选,平台不让人工智能读你的评价,口碑得先搬到机器进得去的地方说的就是这道看不见的门。

七条列在这里,读的时候先别急着记,先看它们有没有共同点。

七条理由的唯一共同点

七条里没有任何一条与评价说了好话还是坏话有关。它们分别判断信息类型、表达方式、第三人权益、事实真假、来源真假和相关性——一条条都能在不知道这条评价是几星的情况下作出判断。

同一部规则的另一节管的是假评价,刷一条假评论挣1美元、罚款上限53088美元,两个数不在一个账本上拆的是它的处罚侧。

这就是整节的枢纽。合规与否不取决于你删了多少,取决于你那条规则在决定删不删的时候,需不需要先看一眼这条评价夸没夸你。

最要紧的那句话是最终规则才改成这样的

提案稿里写的是:只要撤下评价的标准被适用于所有提交的评价,且不考虑评价的好评度。最终稿改成了两处:标准必须被平等地适用于所有评价,且不考虑情绪

一个词的替换能把义务的强度整个改掉,退货政策那句承诺译成日语之后字面写出来是不这么做就不行是同一种措辞级的位移。

加一个“平等地”,是因为“适用于所有评价”这句话有漏洞——一条对所有人开放但只对差评触发的规则,字面上也算适用于所有评价。

把好评度换成情绪,也是被评论意见提醒的

有一家评价平台提出,评价很难被整齐地归成完全正面或完全负面。委员会接受了,说自己原本的意思就是情绪,并顺手把措辞改了,免得被理解成“必须整条都是负面才算”。

这个改动看着小,实际把射程扩大了不少。一条五星好评里夹了一句抱怨物流,因为那句抱怨被拿掉,同样落在这一节里。

列出的七条不是穷尽的

四家行业方的评论意见都提出,正当理由不止这七条,比如描写暴力、鼓励非法使用产品、夹带可能危害用户安全的链接、使用网站不支持的语言。委员会同意,并明确这七条只是非穷尽的举例。

这一步很关键。它意味着规则最后落脚的地方不是那张清单,而是那句话。你完全可以有自己的第八条第九条,只要它满足平等适用且与情绪无关。

内容判据被换成了规则判据

这一节最值得学的地方在于它没有去定义什么样的评价可以删,它定义的是什么样的规则可以用。判据从内容层挪到了规则层,于是它不需要跟上任何新的花样。

判据挪到规则层之后,边界反而更清楚了,黑帽白帽灰帽到底怎么分以及决策红线画在哪用的也是这种按方法而不按结果分类的思路。

一个不管评价内容只管筛选规则的判据,有一个附带好处:它可以被写成一段话贴在页面上,而内容判据永远贴不出来。

两个被点名放行的例子

有人问:能不能定一条不发布提到其他品牌产品的评价的政策。委员会答:只要这条政策被平等适用于所有评价,可以。

又有人问:只讲客服体验不涉及产品本身的评价,能不能不显示。委员会答:只要标准平等适用,规则不禁止;但顺手加了一句,它曾表达过压制关于某个卖家客服体验的评价可能另有问题。

一个被点名否掉的例子

有评论意见举例说:一场暴风雪导致包裹没能按时送达,买家因此写了差评说没按时发货,这种应该允许压制。委员会明确表示不认为这是压制评价的正当理由。

这个例子挺值得回味的。物流延误确实不是卖家的错,可买家写的那句“没按时收到”是真的。规则保护的是这句话的真实性,不是它的公平性。

合理相信是假的这一条被质疑太宽

有个人评论意见说:这一条给了卖家太大裁量,只要声称自己相信是假的就能删。一家评价平台也说,在没有评价者身份、位置、其他评价记录的情况下,准确识别虚假评价其实很难。

委员会的回答绕回同一个地方:只要压制的原因不是评分或负面情绪,卖家就不承担责任;这一条只要求存在足以让一个理性的人相信它是伪造的迹象即可。

不予显示被改成了不可显示

还有一处措辞值得抄。有行业协会问:什么叫被压制。委员会把“不予显示”改成了“不可显示”,意思是只覆盖那些消费者即使换一种排序或筛选方式也看不到的评价。

评价插件的展示逻辑和结构化数据是绑在一起的,给第三方评价应用加上星级结构化数据的那套配置里,被过滤掉的评价同样不会进结构化数据。

这是一个很务实的界定。默认排序把差评排在后面,不算压制;差评根本没有进这个列表,才算。

但排序照样可能出问题

紧接着委员会又补了一句:以某种让消费者难以知道或难以找到负面评价的方式来组织评价,可能构成《联邦贸易委员会法》第5条下的不公平或欺骗行为。

排序和语言过滤经常一起生效,德语页面下面挂着一半英语评论,这一段字你既管不了也不能装作没看见就是一个具体的例子。

整理评价不算压制,可整理到让人找不到,只是换一个法条来管你。规则给的从来不是豁免,是换一个门牌号。

营销素材里挑好评也是同样的结构

有行业协会请求把营销素材中的评价使用整个划出去,理由是消费者本来就知道广告里放的都是特别正面的。委员会说这一节本来就只管评价专区,不管被挑出来的那条评价具不具代表性。

把评价改写成文案的时候,挑选这个动作会被放大一次,用人工智能把用户评论变成高转化产品描述那篇里的挑选原则值得先看一眼。

然后又加了一句:在营销中使用不具代表性的消费者评价,仍然可能构成第5条下的欺骗。同一个动作,换了个法条,一样跑不掉。

为什么这一节能被拿出来立规矩

因为委员会手上有实据。一家做评价管理服务的公司被调查时发现,超过4500家使用它服务的商户在自动发布4星和5星的评价,而提交上来的1星和2星评价大部分被压制。

4500这个数字值得多看两秒。不太可能有4500家商户各自开会决定要作弊。

这道门是软件厂商替他们装的

4500家商户共用一个默认设置。这不是4500次决策,是一次默认值的选择加上4500次没有去改它。你没设置的规则不等于没有规则,只等于它是别人设的。

平台默认规则带来的风险常常算到你头上,站点声誉滥用与寄生式做法的三方防御讲的就是这种你没做却要负责的结构。

这一条和前面应用商店评分弹窗那个7天触发条件是同一件事。装在你系统里的每一个自动化功能,都带着一套别人替你选好的筛选规则。

皮尤剔掉那7个人是这条判据的正面样板

回头看前面提过的细节:那一波有7名受访者在分析前被剔除,理由是大量留空或者永远选同一个位置。这条清洗规则完全符合465.7的判据。

它判断的是作答行为,不是答案内容。全打5分和全打1分被同等对待,规则在执行时根本不需要知道这个人满不满意。

同一部规则里还有一节管自己人写的评价

465.5那一节管的是内部人:高管或经理给自家产品写评价,必须清楚显著地披露关系;高管向亲属或员工索要评价,如果结果是出现了没有披露关系的评价,而他又鼓励过不披露、或者没有要求披露、或者知道了却没补救,同样违规。

但它有一个明确的豁免:面向购买者的泛化征集不受这一节约束。你群发一封“欢迎来写评价”的邮件给所有买过的人,不算索要。

同一个判据第三次出现

泛化征集之所以被豁免,是因为它对所有人一视同仁:谁都收到同一封信,没有人被单独挑出来鼓励说好话。这跟465.7那句平等适用、跟255.4那句此前已经采纳,是同一条判据的第三次露面。

三节规则分属不同章节、针对不同行为,落点却完全重合。能被反复推导出来的判据,通常比任何一条具体规定都值得记住。

落到自己站上该做什么

动作很简单,就三步:把现在正在生效的所有评价过滤规则找出来写成一段话;逐条问这条规则在执行时需不需要先看这条评价的分数;把这段话放到评价区能点开的地方。

把规则写出来贴在页面上这件事本身就有转化价值,退换货政策页怎么写才既是下单前的信任背书又能接住售后搜索是一个现成的样板。

第三步最有意思。一旦你打算把规则公开,前两步的答案会立刻变得诚实很多,这比任何审查都管用。

一个机构的背书,凭什么比一个人的更可信?

把话题从评价区挪到榜单上

前面几节说的都是从很多人身上收数据。还有一类东西的分量比数据更重:某个机构、某家评测站、某份榜单说你好。这类背书在落地页上通常只占一个徽章的位置,能顶半屏的文案。

榜单类内容被算法收拾过一轮,产品评论更新一来那80个联盟站到底谁活下来了那篇复盘里活下来的共同点,正好是本节说的那几条。

美国代言指南里有专门一节管它,节号255.4,标题是机构作出的代言。这一节只有一段正文加三个例子,但它给“背书凭什么可信”下的定义,比我见过的任何行业文章都利落。

它先说清了机构背书为什么更有分量

原文的意思是:机构尤其是专家机构作出的代言,会被理解为代表一个群体的判断,这个群体的集体经验超过其中任何单个成员,而且这类判断通常不受那些因人而异的主观因素影响。

信任是分层堆起来的不是一次给足的,独立站信任那7层落地做法里,机构背书排在靠上的一层,也因此最贵。

这句话把消费者心里那个模糊的感觉说出来了。我们信一个机构,不是因为它比某个人懂得多,是因为我们默认它内部有一套抵消个人偏好的机制。

所以它的要求也就顺理成章

紧接着那句话是:因此,机构的代言必须经由一个足以确保该代言公正反映该机构集体判断的流程作出。

注意落点。它没有要求结论正确,也没有要求参与人数够多,它要求的是流程。这跟前一节465.7把判据放在规则上,是同一种写法。

第二个要求针对自称专家的机构

如果一个机构被表现为具有专业性,那么在按照255.3的要求对产品作出适当的专业评估之外,它还必须动用被该机构认可为专家的人,或者动用该机构此前已经采纳的、适合判断此类产品相关优劣的标准

判断一个自称专家的人靠不靠谱有现成的办法,冒牌专家的那7个典型特征里有一半可以直接换成对机构的判据。

这半句话里藏着本节最要紧的三个字,就是那个“此前已经采纳”。

床垫那个例子把话挑明了

例子是这样:一家床垫厂商宣传自己的产品获得某脊椎按摩师协会背书。由于该协会会被视为在判断床垫方面具有专业性,这份背书必须有支撑。

先定权重再录数据这件事在选词上同样成立,6个维度3档分级的关键词优先级评分矩阵之所以能用,前提就是权重不是看完结果才定的。

支撑的方式有两种:由该协会认可的专家作出评估,或者符合该协会此前已经采纳的、旨在衡量床垫一般性能而非针对该广告床垫独特之处设计的标准

这一句话里塞了两个独立的条件

第一个是时间条件:标准得是此前就采纳好的,不能是这次为了评这张床垫现攒的。第二个是范围条件:标准要衡量的是这一类产品的一般性能,不能是照着这张床垫的长处设计的。

规则必须先于对象存在,规则不能围着对象的优点定做。这两条各自都不难懂,合在一起的威力比分开大得多。

为什么必须两条都要

只守时间条件,你可以事先准备10套标准,评的时候挑那套结果最好看的用。只守范围条件,你可以在看完产品之后,写一套听起来完全通用的标准,而它的每一个维度都恰好是这款产品的强项。

一套评分维度好不好,要看它换个对象还成不成立,把可见性拆成7个维度和9条策略的那套内容评分可以拿去互相验证。

把这两条并起来看,它其实在描述一件更一般的事:一条规则的公正性有两个方向,横着看它对所有对象一样,竖着看它比对象先存在。缺任何一个方向,另一个都能被绕开。

还差第三个方向

上面那两条堵不住一种做法:我确实事先定好了10套标准,每一套都通用,每一套都对所有产品一样,我只是没说我用了哪一套、试过几套。

试过几套用了哪套,这件事只有自己知道,15种策略排个序看先改哪个回报最大那篇里排序的前提就是所有策略用同一把尺子量过。

所以还得加第三问:你一共定过几条规则,最后用了哪一条,其余那几条的结果在哪儿。这一问不查数据,查的是尝试次数。

选条件这种做法的痕迹不在数据里

造假需要撒谎,挑条件不需要。它只是在若干个都真实的做法里,选那个结果最好看的。所以它的痕迹不在留下的那份数据里,在被丢掉的那几次里。

工具给出的分数看着客观,口径却是厂商选的,这类自然语言处理评分工具的真相、正确用法和堆词陷阱那篇拆的正是它的生成条件。

这也是为什么严肃的实验方法要求预先登记方案。预先登记的全部作用,就是让被丢掉的那几次也留下痕迹,它不提高任何一次实验的质量。

三个方向合起来是一张很短的检查单

方向要问的话对应条文不合格的样子
横向对称这条规则对所有对象是同一条吗465.7(b)平等适用只对差评触发的过滤
纵向在先这条规则是评之前就有的吗255.4(b)此前已采纳看完样品再定评分维度
唯一性你一共试过几套,用了哪套无对应条文三套口径里挑最好看的

前两个方向有法条撑腰,第三个没有,因为它很难被外部核查。但它恰恰是自查时最该问的一个,因为只有你自己知道答案。

蹦床那个例子讲的是另一种毛病

第二个例子:一家蹦床厂商搭起并运营一个看上去像是由独立蹦床研究机构运营的评测网站,站上既评自家产品也评竞品。由于该网站虚假地显得独立,构成欺骗。

看起来独立的入口未必真独立,商家资料管理被搬进对话式助手之后有一步千万省不得那篇里省掉的那一步,正好是核实归属。

值得注意的是它也评了竞品。评竞品这个动作通常被当成公正的证明,可在这里它反而是让网站显得独立的手段之一。

耳机那个例子最贴近今天的联盟生态

第三个例子:一家第三方公司运营无线耳机评测网站,从最推荐到最不推荐给出排名,而它收取厂商的钱来换取更高排名。

对比页凭什么被单独收录,取决于它有没有独立的判断,功能页、集成页、用例页、对比页各自的立身之本那篇给的判据可以直接对照。

规则的判定是:无论该网站有没有明确宣称自己客观或独立,这种付费排名都构成欺骗,网站运营方要担责,付钱买排名的厂商也可能担责。

披露在这里不管用

例子里专门写了一句:披露“本站接受耳机厂商付款”是不充分的,因为那些付款实际上决定了耳机的相对排名。

披露和同意在数据侧也有同样的失效边界,同意横幅怎么做才不毁掉数据的那套跨境合规架构里,把选择权给足和把风险推走是两回事。

披露能补救的是读者不知道的事,补救不了读者知道了也没用的事。付款决定排名的时候,告诉读者有付款并不能让排名变得有意义。

不决定排名的付款则必须披露

同一个例子的后半句给了正面写法:如果这个评测网站不收排名费,只是从部分厂商那里获得比如联盟链接推荐带来的收入,那么它应当清楚且显著地披露这些收入。

这条界线画得很清楚。收入影响排名,披露无效,只能不收;收入不影响排名,披露有效,必须披露。联盟站的整个商业模式就卡在这条线上。

最狠的是例子里最后一句

例三还有一个小节,只有一句话:假设该评测网站使用的排名方法,导致那些与运营方有关系的卖家的产品因为这些关系而获得更高排名,那么使用这种方法本身也是误导性的。

读慢一点。这句话里没有提到收钱,没有提到意图,也没有提到披露。它只说方法论产生了这个结果,就算。

判据落在结果上,不落在动机上

你不需要收过一分钱,不需要动过一次歪心思,只要你的排序方法让关联方系统性地排在前面,这件事本身就被判为误导。动机在这里完全不被讨论。

让机器当裁判的时候,判据必须先于对象写死,难的从来不是写,是说清楚哪一页算写好了讲的正是这套判据该怎么立。

这对做算法和做排序的人来说不算陌生。一个模型有没有偏见,从来不是看训练它的人怎么想的,是看它的输出分布长什么样。这条例子里一个技术名词都没有,却正好落在今天最需要判据的地方。

落到自建榜单和对比页上

很多独立站会做一个“我们和竞品的对比表”,或者一个“如何挑选”的选购指南顺带排个序。这类页面的流量往往很好,也确实有用。

对比这件事本身可以做成内容资产,把你的内容和生成式摘要的回答比出差距那套用法里,维度同样必须先定后用。

问题在于那张表的维度是什么时候定的。如果是先看了自家产品的参数再决定列哪几行,那这张表的每一行都真实,整张表却是一个结论的倒推。

三个可执行的动作

第一,先把评分维度和权重写死并存档,再去录竞品数据,中间隔至少一天。第二,如果录完数据之后改了权重,把改动和理由记下来,别覆盖原稿。

第三,把权重表放在页面上能点开的地方。第三个动作会反过来让前两个动作变得认真,因为一份准备公开的权重表,你在写的时候心态是不一样的。

一个很便宜的自测

拿你那套评分维度,去给三款你并不打算推荐的产品打一遍分。如果排名和你的直觉一致,说明维度是有信息量的;如果打出来第一名是你不想推的那个,恭喜,这套维度是真的。

用一个不参与决策的评委先跑一遍,是很划算的自测,不调用引擎就预测9种策略可见性提升的那个代理评分器就是干这个的。

最难受的情况是打完之后你想改维度。那一刻的冲动本身就是答案,也是这个自测唯一的价值所在。

顺带说一个容易被忽略的细节

那句“公正反映集体判断”里,还藏着一个人数问题。规则没有规定要几个人参与,但它要求这个流程足以确保结论代表集体,所以人数不够本身就会让流程不成立。

落到实际,一份由一个人主笔、其他人只在群里回了个赞的评测报告,很难说经过了什么流程。署名是机构的,动作是个人的,这中间那一层没人补上。

两节法规其实在说同一件事

465.7管的是收上来的东西怎么展示,255.4管的是评判的标准怎么产生,一个在第465部分,一个在第255部分,中间隔着几百页。

把评判标准写成公开手册这件事,搜索引擎那边做过一次,质量评估手册里那套评分与训练机制在结构上和这两节法规是同一个思路。

但它们的判据结构完全一样:都不去规定结果应该是什么,都去规定产生结果的那套东西必须满足什么。两个不同年代、不同起因的规则收敛到同一个写法上,这件事本身就说明了点什么。

六道门的自查表:先算覆盖率,再谈那个数字

这份表和我上次那份最大的不同

上一次我给过一份六个动作的自查清单,那份的规矩是顺序不能调、六件必须全做完。这一份不是,这一份带早停

跨部门的清单最难落地,从工单到帮助中心那七个客服协作动作点里,能活下来的都是不需要新增角色的那几条。

原因很实在:口径问题不是每家都有。第一件做完如果什么都没发现,后面五件的优先级立刻下降,那半天可以省下来干别的。一份能让你合法收工的检查表,比一份必须做满的检查表更容易被真的执行。

第一件:把两条线画到同一条横轴上

拉出订阅留存曲线或者复购衰减曲线,横轴是下单后的天数。然后把所有问卷、评分弹窗、回访电话、复购提醒的发放时点,当成竖线标上去。

把散落的触点放到同一条轴上是个万能招,按漏斗查询树做跨引擎测量的那套框架也是先立轴再往上挂点,顺序反过来就画不出图。

只看一件事:每一条竖线落在流失中位数的左边还是右边。落在左边的,覆盖的是全体;落在右边的,覆盖的是幸存者。

它排第一是因为它可能让你直接收工

这件事花不了20分钟,两份现成的数据导出来拼一张图。它不需要跨部门,不需要新埋点,也不需要任何判断力。

如果所有竖线都在左边,你可以合上电脑。后面五件解决的都是同一个病,而这一件已经证明你没得这个病。

第二件:给每个百分比补三个括号

把首屏和第二屏所有带百分号的句子抄进表格第一列。第二列写分子多少人,第三列写分母多少人,第四列写同期一共多少人。

补口径这件事的门槛在于工具顺不顺手,中英文字数、阅读时长与篇幅标准该怎么量那篇里的做法是同一种把隐含前提显式化的思路。

前两个括号大家都会填,第三个才是关键。第四列一填出来,覆盖率就是一道除法,不需要任何人下判断。

第三个括号填不出来的时候

填不出来是很常见的,因为同期总人数往往归另一个系统管。这时候别留空,写“未取数”三个字。

查不到就写查不到,比留白强得多,一次扒清链接结构与扣分项的那套分析里,无法判定的那一类也是单独列一栏。

留白会被下一个人默认成“这一栏不重要”,写“未取数”会让他停一下。这是我从上一份表里搬过来的唯一一条,因为它真的管用。

第四件里最容易被忽略的一件事

第三件是翻触发条件:把站上所有会主动弹出来的问卷、评分请求、评价邀请找出来,逐个看它们在什么条件下触发。

订阅系统的默认设置里藏着大量筛选逻辑,订阅商品、定期扣款与续费失败挽回该怎么配那篇里的每一个开关,都会改变谁还留在名单上。

重点查那些你没有设置过的。评价插件的默认发送时机、App商店评分SDK的默认触发天数、邮件工具里那个自带的满意度模板,这三处我见过的默认值全都偏向老用户。

为什么默认值总是往好里偏

做这些工具的人有充分理由这么设。太早请求评分会打扰新用户,转化差、投诉多;等用户用熟了再请求,通过率高,客户满意度也高。

默认放什么就等于替用户排了序,页脚不是杂物抽屉,它是信任收口和转化的最后一关那篇里的取舍也是同一类。

他们优化的是请求成功率,你误以为他们优化的是代表性。这两件事在默认值上的方向恰好相反。

第四件:把一个词的所有用法列一遍

把“满意度”这个词在公司内部出现过的地方列一列:产品页、周报、月会PPT、客服工单系统、投资人材料。逐个看它们指的是不是同一件事。

一个词有几个意思,最好的办法是给它建一个定义页,把孤岛词条织成主题权威的那套术语库做法顺带能解决内部口径不一的问题。

我们那次列出来四个:产品效果自报率、客服处理评分、应用商店评分、NPS推荐意愿。四个数分别在四个系统里,四个口径,共用一个词。

共用一个词的后果

后果不是有人搞混了,是更隐蔽的东西:这四个数会在某次汇报里被并排放在一页上,形成一种互相印证的观感。

同一个词在不同部门口里变形,是品牌一致性问题的起点,让产品页、客服和社媒听着像同一个人的那套声音体系治的是同一个病。

可它们量的是四批不同的人,任何两个之间都不构成印证。这件事零成本,20分钟,通常能抓出三到四个口径,是性价比最高的一件。

第五件:在出口设一问

退订确认页、退货申请页、取消订单页,各加一道单选题。可跳过,选项不超过六个,必须有“其他”并留一个输入框。

用户原话是最贵的一手材料,从面谈、工单和销售电话里挖词的那套客户之声做法给的采集位置,和退订页那一问是互补的。

这是六件里唯一需要开发排期的一件,也是唯一会带回新信息的一件。前四件都是把已知的东西重新整理一遍,只有这一件能问到那些已经决定走的人。

出口是唯一能问到他们的位置

一个人退订之后,你就再也找不到他了。他不会打开你的邮件,不会点你的推送,不会接你的电话。他跟你产生的最后一次交互,就是那个确认按钮。

退款与退货流程本身就是一串高价值触点,自动与手动退款、部分退款与退货申请该怎么管那篇里的每一步,都可以顺手加一问。

所以那一问的价值不在数据质量,在位置。它是整条链路上最后一个还能听见他说话的地方。

第六件:换通道复核,方向不能搞反

如果你想验证一个自填问卷的结果,找的复核通道必须比它更没人看着,不能更亲切。电话回访、客服跟进、真人访谈得到更高的数字,不构成验证。

要验证一个自述数据,最好的对照物是日志,爬虫到底有没有抓你的站,日志里一步步挖真相用的就是这种不依赖任何人开口的证据。

可用的方向是行为数据、服务器日志、匿名调研。我们那次拿电话去核邮件,等于拿一把偏得更厉害的尺子去校准另一把尺子。

六件事排在一起长这样

动作耗时是否跨部门会带回新信息吗早停条件
留存曲线叠发放时点20分钟竖线全在流失中位数左边
给百分比补三个括号15分钟覆盖率全部高于四成
翻问卷与弹窗触发条件30分钟偶尔触发条件全是你自己设的
列一个词的所有用法20分钟全公司只有一个口径
在出口设一问半天加排期
换通道复核视情况看情况已有行为数据可对照

我们最后改了四件事

问卷发放从下单后第60天提到第21天,卡在流失中位数第41天前面二十天。退订确认页和退货申请页各加一道单选题。通道从纯邮件改成邮件、应用内弹窗、短信三条同时铺,答过一次的不再打扰。

涉及退款的流程改动要先想清楚责任边界,支付渠道、收单方与平台仲裁那三维争议处理流程里,加一问的位置得避开仲裁材料。

第四件是取数逻辑:名单从“当前订阅有效”改成“下单满21天的全部买家”,退订的人照发。这一件改的是那行SQL,工程量最小,影响最大。

三个月后的数字

口径改之前只改措辞那两周改完生成条件三个月后
首屏数字92%92%(后附口径)71%
有效作答份数104310436480
覆盖率7.4%7.4%46.2%
站点转化率2.9%2.5%2.8%
收到的退订理由0条0条2317条
六个月订阅留存28.3%28.3%37.1%

转化率这笔账要摊开说

第一步只改措辞,把口径补在数字后面,转化率从2.9%掉到2.5%,掉了13.8%。这两周所有人都很难受,包括我。

转化率掉几个点值不值,要放进90天的账里看,搜索与转化双轴八模块那套90天实战给的正是这种排期口径。

第二步把数字换成71%之后,转化率回到2.8%,比最初低3.4%。没有回到原点,我也不认为它会回到原点。这是一笔必须提前算进排期的支出。

为什么71%反而比带口径的92%好卖

我们后来做过一次留言收集,比较集中的一句话是:71%这个数看着更像真的。带一长串口径说明的92%反而让人开始琢磨那串小字。

一句需要解释的话在详情页上是负担,摆脱供应商文案做出唯一内容的那套详情页工程里,能自证的句子永远比漂亮的句子值钱。

一个需要解释的数字会把注意力引向解释本身。与其在92%后面挂一段免责,不如换一个不需要免责的数字,这也是那两周最贵的一课。

真正的收获不是那个数字

三个月,退订页和退货页那一问收上来2317条。这是这家店开业以来第一次拿到成规模的离开理由。

愿不愿意把真实情况说出来,往往取决于对方肯不肯认,用户宁可去打电话也不点你的智能客服,差别藏在肯不肯转人工这种细节里说的是同一件事。

分布是这样:38%选“戴着睡不着”,24%选“忘了充电”,19%选“没看到效果”,剩下19%是其他和自由填写。

前两条加起来62%

排在前面的两条都不是“没用”,是“用不下去”。而当时产品路线图上排在最前面的三件事,全都是提升监测精度。

有些结论收不到,不是因为没人说,是因为观察者到不了那个状态,体验报告里那两条建议没给达标率的真实原因就是这种可达性问题。

这就是改生成条件真正换回来的东西。不是一个更准的百分比,是一条以前根本收不到的信息,而这条信息把整个季度的排期方向改了。

后来做的两件事都很便宜

换了一副更软的硅胶垫,单件成本增加0.42美元。App加了一条每周一次的充电提醒,工程量两天。就这两件。

最便宜的改动往往落在最不起眼的地方,把开箱做成复购、口碑和用户内容的杠杆那篇里的几处改动,成本量级和硅胶垫差不多。

六个月订阅留存从28.3%涨到37.1%,涨了8.8个百分点。没有任何一件事跟提升监测精度有关。

把这条固化下来

改口径是止损,改生成条件是投资。前者让你的页面更诚实但更弱,后者让你听见一个以前听不见的房间。只做前一半,你会很自然地得出“合规损害转化”这个结论。

还有一件我们试了但没做成的

本来还想做第七件:给每一份对外发布的数据配一页方法说明,写清楚取数时间、口径、覆盖率和已知偏差。做了两份就停了,因为写一页要一个半小时,而没有人读。

不是这件事没价值,是它的价值和它的成本不在同一个数量级。后来把它压缩成指标名字里的那几个字,效果反而更好——这也是下面那条卡点的由来。

卡点这次挂在名字上

说完动作说卡点。我一直的做法是:不去找最该被记录的地方,去找那个人非去不可的地方。这次找到的不是一个地方,是一个东西——指标的名字。

名字这件事在技术侧同样有杠杆,停用词清洗加100分制评分的那套网址命名做法证明过一个好名字能省下多少后续解释。

那个数不再叫“用户满意度”,改叫“21天全量买家改善自报率”。改名不需要开发、不需要审批、不需要任何人维护,成本是零。

名字会被复制,脚注不会

脚注留在原表底下,数字自己走了。名字不一样,名字会被粘进周报、季度总结、投放素材、给投资人的材料,口径就跟着一起走了。

能被复制的东西才有生命力,把品牌口吻固化成一个可复用技能那篇的核心也是让规则跟着内容一起走,而不是挂在文档里。

这是我这几年试过的所有做法里,唯一一个随着传播距离增加而不衰减的。传得越远,那串限定词跟得越远。

有人提议简称,这件事必须顶住

名字确实变难听了。“21天全量买家改善自报率”念起来很别扭,会上第二次就有人提议简称成“改善率”。

必须顶住。一旦允许简称,第一个被砍掉的一定是限定词,而限定词正是这个名字全部的功能。别扭是它在工作的证据。

顺带配一件更轻的

在报表工具里,把分母做成不可隐藏的第二行:任何一个百分比下面永远跟一行小字,写着分子和同期总数。不弹提示、不拦保存、不生成记录。

不拦流程只提示的工具活得最久,10项加权评分一次体检整页标签那个检测器就是这一路,看完不改也不影响任何事。

它和上一批那条纯前端高亮规则是同一路数:不改变任何流程,只改变一眼看过去时视野里有什么。

措辞:别说这个数不准

最后说怎么开口,因为这件事的失败多半失败在这里。说“这个92%不准”效果是零甚至是负的。

两个团队交界处的话术决定了事情推不推得动,流量到转化那条边界与交点该怎么交接里,最有效的说法都是先摆事实再给替代方案。

“不准”这个词指控的是计算过程,而算这个数的人每一步都做对了。他会把取数逻辑和公式调出来自证,而且他确实没错,接下来半小时全花在核对上。

换成这样说

把话改成:这个92%是在哪些人里算的?我查了一下,是第60天还在订阅的那批。我们的退订中位数是第41天。我想在退订页上也加一问,加完再看一次这个数。

一句话怎么说决定了对方接不接得住,多语种客服那4层服务等级与工单分流里的话术设计,用的是同一套原则。

四句话,一个事实、一个事实、一个事实、一个提议。没有一个字否定那个数字,只是把口径摆出来,让口径自己说话。

还有一句可以护住所有人

如果气氛还是紧,可以加一句:这个数是对的,问题不在它身上,在我们让它回答了一个它没被问过的问题。

这句话把焦点从人和数字挪到“问题与答案的错配”上,房间里就没有人需要认错了。而在多数公司里,不需要有人认错是推进这件事的前提条件。

先说覆盖率,别先说结论

“这个数覆盖了7.4%的买家”是一个事实,“这个数不能用”是一个判断。先摆事实,把判断留给对方自己得出——因为别人自己得出的判断,不需要说服。

跟拿预算的人讲话要先给可算的数,从预算到归因再到资产口径那7个财务协作动作里,第一步永远是把话翻译成钱。

这套方法在什么地方会失灵?

先把它管不了的事说清楚

一套方法如果不写边界,用的人迟早会拿它去干它干不了的事,然后得出“这套东西没用”的结论。所以这一节比前面几节都重要。

下面四条边界里,第三条是真正的大漏洞,我把它单独展开写。前面所有内容加起来,都不如这一条对最终结果的影响大。

边界一:它只对自我报告类的数据有效

满意度、改善率、推荐意愿、购买意向、使用频率自述,这些都是人开口告诉你的,六道门一道不少。

客观事件类数据的难点在口径统一而不在采集,把不同平台的花费拉进来算统一投入产出那篇里最费劲的一步就是对齐定义。

下单、支付、退款、退货、登录、订阅续费这些是另一回事。它们不需要任何人配合就会发生,也就没有触达和应答这两道门,覆盖率天然是百分之百。

但客观事件仍然要过最后一道门

别因此就放心。客观事件躲开了中间几道,躲不开第六道:展示。一张退货率报表里到底算不算换货、算不算未激活退回、算不算物流丢件,这三个口径就能让同一批订单跑出三个数。

一笔订单算不算完成,取决于流程里哪一步被当作终点,发票、发货与贷项通知单那套订单处理工作流把这些状态定义得很清楚。

自报数据的风险在前面,客观数据的风险在后面。查自报数据先查分母,查客观数据先查定义。

边界二:算出覆盖率不等于问题解决了

最常见的滑坡是把“已识别”当成“已处理”。一张表填完,覆盖率算出来了,会开完了,然后什么也没改,页面照挂。

识别出来的问题要排序才有用,500个站实测排出来的技术问题优先级给的排法可以直接借用,判据是业务影响不是问题数量。

这个滑坡有个特点:它让所有人都感觉良好。识别问题这个动作本身带来的成就感,跟解决问题带来的差不多,而成本只有百分之一。

那这个数到底是干什么用的

它是一个量程标签,不是一个合格证。7.4%这个数不说明那个92%是错的,它说明这句话只能撑起某个重量级别的结论。

一个指标能撑起什么样的结论,取决于它测的是哪一层,把可见性拆成3层指标的那套体系就是先分层再决定每层怎么用。

具体说:低覆盖率的数可以用来看方向和趋势,不能用来做首屏断言;中覆盖率的可以做首屏断言,不能拿去跟行业均值比大小;只有高覆盖率的数,才配进入需要对外解释的场合。

边界三:剩下那些人是不是同一种人

这是整套方法最大的漏洞,也是我犹豫了很久要不要写进来的一条。把覆盖率从7.4%提到46.2%,看起来是个巨大的进步。

样本再多也不等于覆盖得全,12个站样本里的4维冗余与8步瘦身那篇在开头就先交代了这12个站代表谁、不代表谁。

可它完全不保证剩下那53.8%的人和已经覆盖的这46.2%在分布上是一样的。覆盖率上去了,代表性未必上去。

为什么这一条最容易被忽略

因为覆盖率是个数,它会给人一种已经量化了的踏实感。而代表性不是一个数,它需要拿两组人去比,而其中一组你手上根本没有他们的答案。

覆盖率上升只保证你听到的声音更多,不保证你听到的声音更全。这两件事在直觉上几乎是同一件,在数据上完全是两件。

补丁比想象中便宜

解决办法是拿一个两边都有的客观变量去比。已作答的那批人和没作答的那批人,在这个变量上的分布接不接近。

用现成字段做对照是最省的做法,积分、分层、权益与复购飞轮那套会员体系设计里,分层依据用的也是订单表里本来就有的字段。

关键在于这个变量必须不依赖任何人回答。首单金额、获取渠道、下单距今天数、有没有用过优惠码、有没有开过工单,这些字段订单表里现成就有,不需要新埋点。

我们那次比出来的结果

改完之后已作答6480人,未作答7547人。首单金额中位数一个是179美元,一个是169美元,差5.9%。获取渠道里搜索来源的占比,一个是34.1%,一个是28.6%。

客单价这个变量在高价品类里解释力特别强,高客单价独立站卖不动时内容和信任为什么才是胜负手那篇讲的就是它背后的决策差异。

结论是:还是有差,但差得有限。这跟“证明没有偏差”完全不是一回事,它只是给偏差圈了一个量级。

而这个补丁自己也有边界

它只能验证你有数据的那几个维度。依从性这一维它验不了,因为没有任何一张表记录一个人昨晚有没有把设备戴上。

看起来一致的东西回头一查是同一个来源,这类假印证很常见,10种语言里10份口径一致的资料其实是同一篇英文翻出来的就是一例。

而依从性恰恰是我们已经知道的、最要命的那一维。所以这个补丁的正确用法是缩小不确定的范围,不是消除它。

方法有边界不丢人

把边界写清楚,是一套方法能被别人真的用起来的前提。没写边界的方法只有两种下场:被当成万能药用坏,或者被试过一次之后彻底扔掉。

边界四:这笔支出是明码标价的

页面会变长,因为口径要写出来。数字会变小,因为分母变大了。转化率会掉,我们实测第一步掉13.8%,补完动作之后回到只掉3.4%。

把一件事说成可以算清楚的支出,是它能被批准的前提,从流量归因到单篇盈亏表那套内容投入产出算法给的是现成的账本格式。

这笔账必须在立项的时候就摆到桌面上。如果做完第一步就停下,你会得到一个更诚实但更弱的页面,然后很自然地得出“合规损害转化”这个结论,然后在下一个旺季悄悄改回去。

两件事必须一起排期

改口径和改生成条件要写进同一张排期表,中间不能隔一个季度。隔开之后第二件事永远不会发生,因为第一件事已经把这个话题的政治资本用光了。

排期这件事决定了第二步会不会发生,把这类工作当产品做的那套指标体系、迭代节奏与路线图里,最要紧的是不留观望窗口。

我们那次是两周加三个月,中间没停。要是第一步之后停下来观望一个月,我不认为第二步还能推得动。

还有两条附加边界

第一条:它管不了这个数该不该被拿来做决定。一个覆盖率46.2%的满意度数字,用来定季度排期是合适的,用来决定要不要砍掉一条产品线就不合适。

入门阶段最该建立的不是工具熟练度而是追踪习惯,3类工具与排名追踪习惯该怎么建那篇里的顺序,跟这里的边界排序是一个道理。

数据质量和决策权重是两条独立的轴,把一个数修好了不代表你就该更听它的。这两件事经常被混在一起。

第二条:容易走向另一个极端

做完这轮自查,很多人的第一反应是给每个数字都挂满限定词,最后页面变成一份法律文件。这个反应可以理解,但它是过头的。

把话说清楚和把话说满是两回事,配送政策页怎么写才既降弃购又接得住时效搜索那篇里的分寸感值得对着改一遍自己的页面。

判据只有一条:这个限定词会不会改变读者的下一个动作。会改变的加上,不会改变的删掉。“在1043位完成回访的用户中”会改变,“数据统计截止至上月末”不会。

还有一种情形它完全帮不上忙

如果一个数字从一开始就是编的,这套方法一点用都没有。查覆盖率的前提是分子分母都真实存在、取数逻辑还查得到,而编出来的数字连一行SQL都没有。

这套东西治的是诚实的人不小心做出的失真,治不了不诚实。两者的区别很好认:真做过的人被问到口径时会去翻记录,编的人会先解释这个数为什么合理。

什么时候该重跑一遍

不跟日历走。跟链路变更走。换了问卷工具、改了发放时点、改了取数逻辑、上线了新的挽留流程、换了评价插件,任一发生就重跑。

什么算真更新什么算假刷新,这条线要自己划清楚,改动时间戳能不能骗过搜索引擎以及真假更新的副作用实测给了判据。

还有一条最容易漏:平台改了默认设置。这一条不是你改的,所以没人会想起来去查,而它的杀伤力和你自己改一模一样。

说一下这篇文章用的材料是什么立场

两份材料都不是中立的。美国联邦贸易委员会那份163页的最终规则说明,通篇在论证自己的规则值得存在,每一节都在回应“你凭什么管这个”。皮尤研究中心在论证自己的方法值得被信任。

引用别人就等于替他背了一次书,出站链接到底要不要做以及权威传递与信用消耗的机制那篇讲的正是这笔账。

这不构成不能用的理由,但它决定了怎么用。采集得到、只需要如实记录的可以直接拿,比如条文原文、报告里印着的百分点、应答率数字。

需要选口径才能得出的必须自己重做

那张60道题的差异分档表是我拿报告里散落的几句话拼出来的,报告本身没有这张表。3.7%和3%的对照、中间那段55%的回推,也是我自己算的。

自己重做一遍的价值在于你知道每一步是怎么选的,12项语言特征拆解与逐句降痕那套做法也是把黑箱拆成可复现的步骤。

案例里的覆盖率、转化率换算、留存变化全部来自那一个站的后台。凡是需要选分母、选口径、选情景才能成立的数字,我都自己重做了一遍,因为这类数字最容易在转述中变形。

皮尤那份报告本身就是这篇文章的样板

写到这儿要说一句题外话。一家民调机构花两份钱做一次实验,只为了告诉同行和公众:我们的数字会因为换一个通道而差最多18个百分点。这在商业上是纯支出。

一份材料值不值得信,很大程度上取决于它有没有主动公布过对自己不利的东西。愿意花钱去量自己的误差并且把它印出来,比任何一句“数据真实可靠”都管用。

最后照例说说这篇文章自己的门

这一节前面所有的怀疑,对这篇文章本身同样成立,所以我得把自己的口径也交代一遍。

这篇讲生成条件的文章,自己的生成条件是:一份2014年7月在美国做的实验、3003个受访者、60道题,加上一份2026年2月的美国调查和两部美国联邦法规。通道偏差的方向大概率可以迁移,因为有人看着的时候人会往好里说,这个机制很稳;但幅度一定不能迁移,18个百分点是美国人在2014年电话里的数,不是你店里的数。这篇文章能给你的是六道门的清单和一个粗筛问题,给不了你任何一个可以直接抄的数字。

常见问题解答

我们没有订阅制,只做一次性购买,这套东西怎么用?

一次性购买同样有流失,只是它不叫退订,叫复购不发生。把横轴从订阅天数换成距首单天数,把留存曲线换成复购率衰减曲线,第一件自查动作原样能跑。发放时点这道门在一次性购买里更隐蔽,因为没有一个明确的离开动作提醒你有人走了,人是静悄悄消失的。出口那一问也照样能设,只是位置换成退货申请页、订单取消页和邮件退订确认页。这三个页面在任何电商系统里都有,而且访问它们的人百分之百是正在离开的人,比任何抽样都精准。真正需要额外注意的是第二道门:一次性购买的用户邮箱有效率通常比订阅用户低不少,触达损耗要单独算一遍。

问卷回收率本来就低,把发放时点提前会不会更低?

我们那次的实测结果是回收率反而略有上升,从27.0%到29.4%。原因不难理解:第21天的人对这个产品的记忆和情绪都比第60天强,愿意说两句的比例更高。但这个结果不保证在别处复现,你的产品如果需要更长时间才见效,提前发放会收到大量“还说不好”,那反而没用。判断标准是产品的效果显现周期和流失中位数哪个更早。效果周期更早就提前发,流失中位数更早就必须在流失前抓一次,哪怕问到的是半成品答案。两个都很早的话,做两次,第一次问用得顺不顺,第二次问效果,别把两件事塞进同一份问卷里。

在退订页加一道题,会不会让本来犹豫的人更坚定地走掉?

这个担心我们内部也有,实测下来影响可以忽略:加问之前退订流程完成率97.8%,加问之后97.6%,差0.2个百分点,落在正常波动里。原因是点到退订确认页的人,绝大多数早就想好了,那一屏改变不了什么。真正会影响完成率的是把问题设成必答,或者选项写得像挽留话术。所以三条硬规矩:必须可跳过,选项按客观描述写而不是按内部分类写,不要在选完之后弹优惠券。最后一条最容易犯,一旦弹券,那道题就从收集信息变成了挽留手段,收上来的数据也就没法用了。

应用商店评分弹窗那个7天触发条件,该改成几天?

先说清楚这道门和满意度问卷不是一回事。评分弹窗的目标本来就是拿高分,商店排名吃的也是这个,把它改成全量触发会直接伤到获客,我不建议动。正确的做法是别把它当成用户满意度的证据。它是一个营销指标,就放在营销指标里看,不要出现在任何讨论产品效果的场合。如果一定要从它身上取信息,可以看两个衍生量:触发后的关闭率,以及低分评价里被折叠的比例。这两个数比平均分诚实得多。真要量满意度,还是老老实实用覆盖率高的那份问卷,两套数据各归各的用途,别互相顶替。

覆盖率到底多少算够,有没有一个可以直接抄的门槛?

没有,而且我建议你别去找。任何一个门槛数字都会立刻变成一条被优化的指标,然后有人会想办法让覆盖率刚好越过线,比如把分母偷偷换成更小的那个。覆盖率的正确用法是配对使用:把它和这个数字要撑起的结论摆在一起看。同样是7.4%,用来判断“要不要再多问一轮”完全够用,用来写在首屏上就不够。我自己在用的是三档粗分:低于两成只做内部参考,两成到五成可以进对外材料但必须带口径,五成以上才可以单独成句。这三档没有理论依据,是从几次实操里凑出来的经验值,你完全可以定自己的。

评价插件的过滤规则不是我们设的,出了问题算谁的?

从责任角度看,页面挂在谁的域名下,谁就得对上面呈现出来的印象负责,“这是插件的默认设置”不构成抗辩。美国那条规则里被认定有问题的4500多家商户,绝大多数应该也不知道自己开着自动只发布高分评价这个功能。实操上就三步:把插件后台所有跟评价显示相关的开关截图存档,逐条问这个开关在决定显示与否时需不需要先看分数,然后把需要看分数的那些关掉。第三步做完之后你的评价区平均分一定会掉,这是必然的,提前跟需要看这个数的人打好招呼。顺带说一句,插件升级会重置部分默认值,这件事值得设个季度提醒。

老板要一个能对外说的满意度数字,覆盖率这套怎么跟他讲?

别从方法论讲起,从风险和收益讲。我用过的开场是这样:现在这个数覆盖了7.4%的买家,如果有人问起口径,我们答不上来;把覆盖率做到四成以上,数字会掉大概二十个点,但这个数从此可以放进任何材料里不用提心吊胆。然后给他看两个数字之间的转化率差,我们那次是3.4个百分点的相对损失。把它说成一笔可以算清楚的支出,比说成一件应该做的正确的事有效得多。另外准备好第二个方案备用:数字先不动,但把口径写进指标名字里,这一步零成本零风险,多数情况下会被当场批准。

历史数据还能用吗,要不要全部重算一遍?

不用全部重算,重算的成本通常远高于收益,而且很多历史数据的取数逻辑早就找不回来了。我的做法是分三类处理:正在对外使用的数字必须重算或者下架,这一类通常不超过五个;正在被用于内部决策的数字加一行口径说明,不重算但要标清楚它覆盖了谁;剩下的历史数据打上一个标记,说明它产生于口径调整之前,仅供趋势参考。第三类最重要的是别删。删掉之后趋势线会断,而断掉的趋势线以后一定会被人重新接起来,接的人未必知道当年的口径不一样,那就等于把这个坑又埋了一遍。

权威参考资料

分享到
标签
版权声明

本文标题:《满意度调查那个92%只覆盖了7.4%的买家,两个数都没算错》

本文链接:https://zhangwenbao.com/satisfaction-survey-denominator-gates.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交