小语种稿子被判成难读,可那把尺子的刻度当年是拿英语量出来的
本文目录
- 那个可读性分数到底是怎么算出来的?
- 公式只有两个输入
- 为什么它能流行八十年
- 它测的其实是句子和词的长度
- 公式里的常数为什么只对英语成立?
- 德语的长词不等于难词
- 屈折语的句子也拆不动
- 同一段话翻成另一门语言,分数一定会变
- 哪些语言根本没有公式需要的那两个计数单位?
- 没有空格的语言先卡在数词上
- 音节这个单位不是哪都有
- 日语有自己的一套,但基于完全不同的特征
- 换常数不等于换公式
- 各语言自己那套公式,能不能直接拿来用?
- 先看它标定在什么材料上
- 分数不能跨语言比较
- 阿拉伯语那套还要面对元音标记的问题
- 什么时候这些变体是有用的
- 把分数当发布闸口,编辑会做出哪些动作
- 只有两个杠杆可以拉
- 换词换掉的正好是术语
- 被删掉的还有限定成分
- 母语审校为什么拦不住
- 这些动作在小语种上具体伤到了什么?
- 关键词匹配度
- 专业感和信任
- 被引用的可能性
- 句长分布被压平了
- 那到底该用什么代替这个分数?
- 把代理指标换回本体
- 看句长分布,不看句长均值
- 用术语一致性代替词长
- 母语者朗读是最便宜的一次检验
- 一份不依赖分数的可读性验收办法
- 三个数加一次朗读
- 怎么设定各语言的阈值
- 把它写进上线清单
- 这套验收该由谁来跑
- 哪些不归语言层,要交出去?
- 排版和版式那一半交给前端
- 机器翻译质量那一半单独走
- 分词器怎么选,是工程层的事
- 常见问题解答
- 写作插件给的可读性建议,是不是该全部关掉?
- 老板要一个能看的数字,总不能什么都不给吧?
- 阅读时长这个指标能不能替代可读性分数?
- 用AI生成的小语种内容,可读性分数会不会天然更好看?
- 必留术语表该由谁来列,列多少个合适?
- 分数很低但转化一直不错的页面,要不要动?
- 多语言站的验收标准要不要统一?
- 权威参考资料
摘要:内容平台和写作插件给出的可读性分数,公式里的三个常数是在1940年代的英语材料上拟合出来的。换一门语言,输入的两个计数单位可能根本不存在,常数也不再对应任何东西。更麻烦的是,把分数当成发布闸口之后,编辑唯一能动的杠杆恰好是把精确术语换成口语词,而术语正是用户在搜索框里打的那个词。
那个可读性分数到底是怎么算出来的?
公式只有两个输入
最常见的那套可读性公式只看两个数:每个句子平均多少个词,每个词平均多少个音节。
两个数各乘一个系数,再从一个基数里减掉,得出一个零到一百的分数,越高表示越好读。
公式的全部智慧就在这三个常数上:一个基数,两个权重。它们不是推导出来的,是拟合出来的。
拟合用的材料是1940年代的英语文本,配合当时的读者理解度测试,回归出一组让预测最接近实测的数字。
这套做法在当时非常先进,它第一次把一个模糊的判断变成了可以计算的数值。
需要记住的是这三个数字的出身:它们是某一批英语材料上的经验值,不是语言的普遍规律。常数一旦是拟合出来的,它的适用范围就等于拟合它的那批语料的范围,超出这个范围,公式还在,意义没了。
值得注意的是,这个公式当年针对的是纸质材料的整篇文章,句子完整、段落连贯、没有列表也没有表格。今天它被拿去测的对象是网页,而网页上大量文本是短语、按钮、标签、参数行。把这些一并当成句子来数,得出的每句词数本身就没有意义,公式还没开始算就已经错了。
为什么它能流行八十年
因为它便宜。数句子、数词、数音节,三样都能靠规则完成,不需要任何语义理解。
在计算机还很贵的年代,这是唯一算得动的文本质量指标,于是它被写进了排版软件、办公软件、教材评级体系。
后来它又被写进了内容管理系统的插件,写进了写作辅助工具,写进了内容团队的验收标准。
每往下传一层,关于它出身的说明就少一点,到最后只剩下一个绿灯红灯。
今天很多编辑看到的,是一个只显示颜色的进度条,连分数是多少都不一定看得到。
这是一条很常见的传播路径:一个带前提的研究结论,在工具化的过程中把前提丢掉了。丢掉前提不是谁的恶意,只是每一层传播都要简化,而前提总是最先被简化掉的那部分。
还有一个推波助澜的因素:它给出的是一个单一数字,而单一数字特别适合放进后台仪表盘和月度汇报。任何一个能被画成折线的指标,都会自动获得比它应得的更多的权重。这跟指标本身好不好没关系,是组织的运作方式决定的。
它测的其实是句子和词的长度
把公式拆开看,它不测语义,不测逻辑,不测信息密度,也不测结构。
它只测两件事:句子有多长,词有多长。这两件事在英语上跟理解难度确实相关,相关性还不低。
相关不等于因果。词长和难度的相关,来自英语里长词多半是拉丁语源的学术词汇这一历史事实。
这个事实是英语特有的,因为英语在历史上吸收了大量拉丁语和法语词汇,形成了日常词短、学术词长的双层词汇结构。
换一门没有这段历史的语言,词长和难度的关系就可能完全不同,甚至反过来。
相关性还有一个容易被忽略的前提:它是在一个特定的读者群上测出来的。当年的实测对象是英语母语者,而今天你的德语页面的读者里可能有相当一部分是把德语当第二语言的人。对这批读者来说,难点根本不在词长,而在惯用搭配和文化背景,公式对此完全无感。
顺带说一句,词长和难度在有些语言上甚至是反向的。芬兰语里最长的那些词往往是把一句话压成一个词的日常表达,母语者读起来毫不费力;而真正难懂的常常是那些短小的功能词组合。公式在这类语言上不只是不准,方向都可能是错的。
公式里的常数为什么只对英语成立?
德语的长词不等于难词
德语靠复合词构词,日常生活里最普通的东西也可能写成一个很长的词。
手套、垃圾桶、洗碗机这类词,在德语里都是几个词根粘在一起,音节数轻松超过英语的对应词。
公式看到的是音节数偏高,于是判定它难读,而这些词恰恰是德语儿童最早学会的一批。
更麻烦的是,复合词在德语里是不能拆的,拆开就是另一个意思或者干脆不成词。
换句话说,公式指出的那个问题,在这门语言里根本没有对应的修改动作。
德语复合词在选词层面的处理办法在德语复合词与变音符号的选词方法里讲过,那边关心的是关键词表怎么建,这里关心的是同一个语言事实怎么把一个通用分数变成噪音。
还有一层更实际的麻烦:德语的复合词在搜索里往往是一个整体查询词,用户就是这么打的。为了降低音节数把它拆成几个词写,等于把页面上那个能精确匹配的词形拿掉了,检索侧的损失是实打实的,而可读性的收益只存在于那个分数里。
屈折语的句子也拆不动
芬兰语、波兰语、俄语这类语言靠词形变化表达语法关系,一个长句里的成分靠格标记互相照应。
把长句拆成两句,照应关系就断了,读者需要自己在两句之间重建联系,实际读起来更费劲。
所以在这几门语言里,句子变短不一定更好读,有时候正相反。
公式里那个句长权重的符号,在这些语言上未必还应该是负的。
而工具不会告诉你这一点,它照样按英语的权重扣分。
芬兰语十五个格带来的形态爆炸在芬兰语十五个格与辅音交替的选词处理里有完整拆解,那套形态系统正是句子拆不动的根本原因。
这里有一个可以直接搬走的自检:拿这门语言的一段真实文本,人工把长句拆成短句,然后请母语者比较两版哪个更好懂。如果多数人选原版,那这门语言上的句长权重就该被质疑。这个实验一小时能做完,比查任何文献都快,也更有说服力。
同一段话翻成另一门语言,分数一定会变
拿一段英文原文和它的德语译文各算一次分数,德语版几乎总是低一大截。
这不是译得差,是德语的构词方式决定了音节数天然更高。
意大利语、西班牙语也偏低,因为它们的词尾变化会额外增加音节。
如果团队用同一个分数线要求所有语言版本,那结果是可以预见的:英语版轻松过关,德语版永远不达标。
更荒谬的是,为了让德语版过关,译者只能刻意避开那些最自然、最常用的复合词。
这就是所谓的量纲错误:把两把刻度不同的尺子量出来的数字放进同一个表格,然后比较大小。这个错误的隐蔽之处在于两个数字都叫可读性分数,看起来完全可比。
反过来的例子也存在:把同一段话翻成印尼语或者越南语,分数常常比英语原文还高,因为这两门语言的词普遍短。如果团队按分数评判译文质量,就会得出印尼语译得比德语译得好的结论,而实际上两版可能出自同一个流程、同一批人、同样的质量。
哪些语言根本没有公式需要的那两个计数单位?
没有空格的语言先卡在数词上
公式要数词数,前提是能切出词的边界。英语靠空格,代价几乎为零。
泰语、日语、中文没有词间空格,切词要靠算法或者词典,切法不同结果就不同。
切法本身就是一个有争议的问题,同一句话在不同分词器下的词数可以差三成。
词数一变,公式的第一个输入就变了,分数跟着变,而这个变化跟文本本身毫无关系。
换句话说,在这些语言上,分数首先测的是你用了哪个分词器。
泰语里空格与语义单元的关系在泰语没有空格时词边界由谁说了算里讲得最细,那篇给出的那把尺子在这里同样适用:先问这门语言里空格的数量跟语义单元的数量是什么关系,再决定要不要用依赖词数的指标。
更棘手的是,很多工具在遇到没有空格的语言时不会报错,它会按空格切,切出来整段只有一两个词,于是每句词数低得离谱,分数反而漂亮。Unicode标准附件29关于文本分段的规定明确说明了词边界判定在这类语言上必须依赖额外的词典,而多数可读性工具并没有做这一步。
音节这个单位不是哪都有
公式要数音节,而音节这个概念在不同语言里的定义并不统一。
日语的计数单位是拍,跟音节不完全重合;汉语的音节数等于字数,测出来永远是一,没有区分度。
韩语的音节可以直接从字形数出来,但那个数字跟阅读难度的关系跟英语完全不同。
更实际的问题是,音节切分在多数语言里依赖词典,而词典对专有名词、外来词、新词的覆盖很差。
常见的音节切分库依赖的是拼写检查用的连字符词典,词典缺词的时候就只能按规则猜。
这意味着分数在处理品牌名、型号、专业术语密集的商品页时,误差会比处理普通散文时大得多,而商品页恰恰是最需要判断的那一类。
音节切分的实现细节也值得看一眼:常用的库依赖的是排版用的连字符词典,而连字符规则关心的是断行位置好不好看,不完全等于语音上的音节划分。Pyphen这个连字符切分库的文档里就写明了它的数据来源,本质上是排版规则被当成了语音规则用。
词典的覆盖差异也值得看一眼:Hunspell拼写检查引擎的各语言词典由不同的社区维护,活跃度差别很大,有些语言的词典多年没更新。你的分数准不准,某种意义上取决于某个志愿者最近有没有空,这个事实本身就说明它不该当闸口。
日语有自己的一套,但基于完全不同的特征
日语的可读性研究不数音节,它看的是字种比例、词汇难度等级、句子长度这几类特征。
汉字比例高的文本通常更正式也更难,这条在日语里成立,在任何字母语言里都没有对应物。
日语文本可读性测定门户jReadability就是按这一套做的,它给出的等级对应日语学习者的水平划分,跟英语那个零到一百的分数没有任何换算关系。
这说明一件事:真正靠谱的可读性工具都是为单一语言单独做的,而不是一个公式套所有语言。
凡是宣称支持几十门语言的通用可读性打分,多半是把同一个公式换了几个常数。
日语这套方案还有一个值得借鉴的地方:它的输出是等级而不是连续分数。等级天然抗过度优化,因为你没法为了从中级挪到中上级去做一堆微调,它只对结构性的改动有反应。凡是容易被小动作刷动的指标,最后都会被小动作刷动,这是指标设计里的一条铁律。
换常数不等于换公式
确实有一批为特定语言标定的变体:德语、西班牙语、意大利语、阿拉伯语都有各自的版本。
开源库里把它们并列成一个个函数,看起来像是一套完整的多语言方案。
textstat这个可读性计算库的接口列表就是最直观的例子,各语言的专用公式一个挨一个排着。
但这些变体的输出量纲各不相同:有的是零到一百的分数,有的直接是学制年级数,有的是另一套自定义刻度。
把它们放进同一张报表里做横向对比,得到的结论没有任何意义,虽然表格看起来非常专业。
还有一个判断办法:看这个工具支持多少门语言。如果它宣称支持上百门,那几乎可以肯定它用的是同一套骨架加一组常数;如果它只支持三五门,反而更可能每门都单独做过标定。覆盖广度和标定深度在这类工具上通常是反向关系,选型时可以直接拿这条当筛子。
各语言自己那套公式,能不能直接拿来用?
先看它标定在什么材料上
每套变体都有自己的标定语料,可能是教科书,可能是报刊,可能是学术论文。
标定语料决定了这套公式在什么文体上准,商品页和落地页几乎从来不在标定语料里。
商品页的文本形态很特殊:短语堆叠、参数罗列、缺少完整句子,跟任何一种标定材料都不像;同一批特征还会带来另一个麻烦,文本一短,机器连这页是什么语言都可能判错,而判错之后连该用哪套公式都无从谈起。
拿一个在教科书上标定的公式去测商品页,结果的可信度非常低。
这不是语言的问题,是文体的问题,英语站上其实也存在,只是英语站很少有人认真看这个分数。
所以在小语种上做这件事之前,先问一句这套公式当年是拿什么材料标的,答不上来就别把它当闸口。
还有一个更少被提起的前提:这些公式当年是为了给学校挑教材、给政府文书定标准而做的,服务对象是要把材料读完的人。而网页读者是扫读的,他们要的是快速定位而不是通读理解。服务对象一变,整套评估目标就该跟着变,而不只是换几个常数。
还有一个提问可以直接甩给工具供应商:这套公式在我们这门语言上的标定材料是什么、样本量多大、标定年份是哪一年。三个问题里只要有一个答不上来,就说明它是拿常数拼出来的。这三问不需要你懂统计,只需要对方能不能拿出来。
分数不能跨语言比较
德语常用的那套公式,输出的是一个大致对应学制年级的数字,越低越好读。
瑞典语常用的那套输出的是一个自定义指数,四十以上算难。
英语那套是零到一百,越高越好读。三套的方向和量纲全都不同。
报表里把它们并成一列叫可读性,然后按大小排序,这个动作本身就是错的。
要横向比只有一种正确做法:每门语言各自设定自己的目标区间,只看有没有落在区间内。
这跟做跨语言的任何比率对比是同一条原则:先建立本语言的基线,再看相对位置,绝对值永远不可比。
报表层面有个很实际的补救:把这一列的名字改掉。别叫可读性分数,叫成本语言可读性指数并注明公式名,人们看到不同的列名就不会本能地去比较大小。改名这个动作听起来很敷衍,实际拦住的误用比写三页说明还多,因为多数人不看说明只看列名。
阿拉伯语那套还要面对元音标记的问题
阿拉伯语的标准书写通常不写元音标记,音节切分因此高度依赖上下文。
同一串辅音在不同语境下读法不同,音节数也不同,而文本上看不出来。
这让任何依赖音节计数的公式在阿拉伯语上都带着一层结构性的不确定。
希伯来语有同样的问题,未标元音的书写方式让一个词形对应多个读法。
这类语言更适合用词汇难度等级这类不依赖语音的特征来评估。
阿拉伯语还有一层:书面语和口语差异巨大,同一批读者对两种语体的理解速度完全不同。而公式只看形式特征,分辨不出这段是标准书面语还是接近口语的写法。这门语言上真正影响可读性的那个变量,恰恰是公式完全看不见的那个。
什么时候这些变体是有用的
它们在同语言纵向对比时是有用的:同一门语言、同一类页面、同一个团队,看这个月比上个月是更长还是更短。
这时候公式的绝对值不重要,重要的是它稳定,能反映趋势。
用途从判断好坏变成了监控波动,这个转变让它重新变得可靠。
比如某次改版之后分数突然掉了一大截,那通常意味着模板改了、句子被自动截断了、或者有人把说明文字换成了参数罗列。
当成告警指标用,它挺好用;当成验收闸口用,它会伤到内容。
当成告警用的时候,还有个技巧:只看变化幅度,不设绝对阈值。设定一条规则,比如某类页面的分数在一次发布后变动超过一定幅度就提醒人工看一眼。这样它既发挥了自动化的长处,又不会驱动任何有害的优化动作,因为没人能通过写作来预判自己会不会触发告警。
把分数当发布闸口,编辑会做出哪些动作
只有两个杠杆可以拉
分数由句长和词长决定,所以要提分只有两条路:把句子拆短,或者把词换短。
没有第三条路。改逻辑、补例子、加小标题这些真正提升可读性的动作,对分数没有任何影响。
这是闸口类指标最典型的毛病:它奖励的动作集合,跟真正有价值的动作集合几乎不重叠。
编辑在截止日期前面对一个不达标的红灯,会挑最省事的那条路。
最省事的永远是换词,因为换词是局部改动,拆句子要重写上下文。
于是这个闸口的实际效果,是系统性地推动编辑把长词换成短词,而不管那个长词是不是必须的。
还有一个隐性的第三条路,但很少有人用:把长句改写成列表。列表项通常不被当成完整句子,句长统计立刻下降,而信息一个都没少。这条路之所以少见,是因为它需要重新组织内容,成本比换词高得多,而在截止日期面前,成本决定一切。
还有一个组织层面的观察:这个闸口通常是内容团队自己给自己加的,初衷是防止外包稿件太差。防低质的动机完全正当,但用错了工具,结果是把最懂行的那批作者伤得最重,因为他们写的术语最多、限定条件最全,分数天然最低。
换词换掉的正好是术语
一段商品说明里最长的词是什么?通常是专业术语、材质名、工艺名、规格名。
拿咖啡器具站举例,德语里那些描述研磨度、萃取方式、锥形刀盘的词,个个又长又硬。
把它们换成口语说法,分数立刻好看,页面也确实读着轻松一点。
问题是用户在搜索框里打的正是那些术语,因为他要找的就是那个具体的东西。
换掉术语,等于把这一页从那批高意图查询里摘了出来。
在小语种上,提升可读性分数和维持关键词匹配是直接对立的两件事,而在英语上它们冲突得没这么厉害,因为英语的术语常常有一个同样常用的短同义词。
更麻烦的是这个动作不可逆。术语被换掉之后,除非有人保留了原稿并逐词对照,否则几个月后没人记得这里原来写的是什么。Yoast关于可读性分析的功能说明里其实列清了它检查的每一项,把这份清单跟你的术语表比一比,就能提前知道哪些词会被它盯上。
被删掉的还有限定成分
为了缩短句子,最容易删的是定语从句、插入语、括注。
这些成分承载的往往是限定条件:适用型号、尺寸范围、例外情况、注意事项。
删掉之后句子确实短了,信息也确实少了,而少掉的那部分正是用户下单前最需要确认的。
退货率上升和可读性分数上升,有时候是同一次改稿造成的,只是没人把这两件事联系起来。
更隐蔽的是,删掉限定成分之后,剩下的句子往往变成了一个更绝对的断言。
绝对断言在合规上是有风险的,尤其在食品、化妆品、电器这几类品类上,某些市场对宣称有明确的法规约束。
这里有一条可以写进规范的边界:凡是承载条件、范围、例外的成分,一律不许为了缩短句子而删除,只能换位置。换位置指的是把它从句中挪到独立的一行、一个列表项或者一张小表里,信息保留,句子也短了。这个动作对分数同样有效,只是需要多花五分钟。
删限定成分还有一个连锁反应:结构化数据里的字段跟着变空。适用范围、材质、规格这些原本写在句子里的信息,如果标记是从正文里抽取生成的,正文一删标记就跟着没了,而这一层通常没有任何人会去复查。
母语审校为什么拦不住
母语审校看的是这句话读着自不自然,而换完短词的句子读着确实自然。
他们通常不知道哪些词是关键词,也不负责检索表现,这不在他们的验收范围里。
所以这类损失会顺利通过所有人工环节,因为每一环各自看都没问题。
破解办法是在审校清单里加一条:术语一致性检查,列出必须保留原样的词。
这份清单的做法在小语种内容的母语审校验收清单里有现成的表格,加一列必留术语即可。
还有一个组织层面的原因:审校通常是流程的最后一环,而分数不达标的修改往往发生在审校之后。也就是说,那批为了提分而做的改动,压根没有经过任何母语者的眼睛就上线了。把提分改动放在审校之前,是零成本却能拦住大半问题的流程调整。
这些动作在小语种上具体伤到了什么?
关键词匹配度
用户打的是术语,页面上写的是口语说法,两者对不上,匹配度下降。
在屈折语上这个损失会被放大,因为术语本身还有多种词形,而口语说法未必有对应的形态。
结果是原本能覆盖十几种词形变体的一个词,被换成了一个覆盖面小得多的说法。
这类损失在后台看是展现量缓慢下滑,没有任何一次断崖,很难归因到某一次改稿。
要发现它,只能在改稿前后各导一份词形覆盖清单做对比。
这类损失还有一个特点:它在英语站上几乎不存在,所以从英语站积累的经验完全没有预警作用。总部拿着英语站的历史数据说这个改动没风险,而风险恰恰只在小语种上出现,这也是这类问题在跨国团队里特别难说清楚的原因。
专业感和信任
把所有术语都换成大白话,页面读起来会有一种奇怪的业余感。
在高客单价品类上,这种业余感直接影响转化,用户会觉得这家不太懂行。
本地用户对这一点尤其敏感,因为他们能分辨出哪些是行内说法、哪些是外行转述。
做本地化做得越到位,读者的期待就越高,这类落差反而越明显。
这跟越本地化越容易暴露适用范围错配是同一类现象:质量上去了,容错反而变小了。
专业感这件事还能被更直接地测出来:把两版文案给五个本地同行看,问哪一版更像本地专业商家写的。这个问题不需要他们懂SEO,答案往往非常一致。定性方法在这里比任何定量分数都可靠,因为你要测的本来就是一种主观感受。
还有一个可量化的信号:本地同行页面上的术语密度。把三家同行的商品描述采下来,数一数每百字里出现多少个行内术语,这个数字就是这个市场对专业感的期待值。你的页面明显低于它,读者的第一印象就是这家不专业,而这跟你写得顺不顺没关系。
被引用的可能性
生成式回答在挑来源时更偏好信息密度高、表述明确的段落。
被删掉限定成分的句子,看着更流畅,但可提取的事实变少了。
换句话说,为了迎合一个测长度的指标,你把内容里最可能被引用的那部分削掉了。
小语种的问答长尾本来就没多少家在认真写,这一削等于把自己的优势让了出去。
这一层的价值判断在小语种问答长尾在AI时代的内容价值里算过账,那笔账的前提正是内容里有足够多可被摘出来的完整事实。
还有一个具体的操作建议:把最值得被引用的那几个事实单独写成完整的短句,句中带上限定条件,不要拆散在几句话里。这样的句子往往长度中等、信息完整,既不会被分数惩罚,也最容易被整段摘走,属于一次同时满足两边的写法。
句长分布被压平了
好的文章句长是有节奏的:长句铺陈,短句收结,长短交错。
按均值优化的结果是所有句子被压到同一个长度,节奏没了,读起来反而更累。
这一点在任何语言上都成立,只是小语种上没人回头检查,因为分数已经绿了。
用分布代替均值就能看出这个问题:把句长画成一张直方图,压平的分布一眼就能认出来。
这也是本文推荐的替代指标之一,成本比算分数还低。
直方图这个办法还有一个额外好处:它能看出文本是不是机器生成的。人写的文本句长分布通常有明显的长尾,模型生成的文本分布集中得多。这条经验在做内容质检时很好用,比任何检测工具都直观,而且不需要额外的成本。
还要留意一种伪长句:把好几件事用顿号串在一起的罗列句。它在统计上很长,读起来却不难,因为结构是并列的。改这类句子对理解毫无帮助,纯属为分数服务,所以在人工复核的时候要先把这一类挑出去,别浪费时间。
那到底该用什么代替这个分数?
把代理指标换回本体
可读性分数是一个代理,它替信息能不能被理解说话,而这件事本来是可以直接测的。
直接测的办法是任务完成度:给五个母语者一个具体任务,看他们能不能在页面上找到答案、多久找到。
五个人、每人十分钟,成本比很多人想象的低,而结论比任何分数都硬。
这类测试还能顺带发现导航、版式、信息层级的问题,而分数对这些一无所知。
凡是能直接测的东西,就别用代理指标去替,这是所有指标设计里最根本的一条。
英文经验值搬到小语种失效这件事,之前在图片替代文本的字符数上限上出现过一次,处理办法完全一样:非拉丁字母站点的图片替代文本写法里那条把字符数换成信息单元的思路,在这里换成把分数换成任务完成度。
做任务完成度测试还有一个技巧:任务要选真实的购买决策问题,比如这个型号能不能装在我家那款机器上、退货运费谁承担。用真问题测出来的结果才有指导意义,用找一下页面上有没有提到某某这种伪任务测出来的,只能证明搜索功能好不好用。
看句长分布,不看句长均值
把一页里所有句子的长度列出来,画成分布,看两件事:最长的几句有多长,长句集中在哪一段。
真正伤害理解的是个别超长句,而不是平均值偏高,均值会把这个信息完全掩盖掉。
处理动作也更明确:只改那几句超长的,其余一个字不动。
这比按均值全篇压缩省事得多,也不会伤到节奏。
这个指标不需要任何语言学知识,也不需要分词器,数标点就能算。
这个指标还有一个便宜的扩展:统计一下超长句集中在哪些区块。如果它们集中在产品描述的开头,那多半是从供应商资料直接搬过来的;集中在结尾,多半是免责声明。知道来源之后,改的就不是句子而是流程,一次能解决一批页面。
阈值这件事还有一个偷懒但有效的做法:直接拿本站表现最好的那几页的句长分布当标准。它们已经被市场验证过了,比任何外部参考值都贴合你的读者。这个办法的前提是你确实有几页表现明显更好,多数站都有,只是没人从这个角度用过这批页面。
用术语一致性代替词长
词长这个输入应该被彻底放弃,换成一份术语表加一致性检查。
术语表列出这个品类里必须保留的原样词,检查脚本核对页面上有没有被换掉。
这份表同时服务于选词、翻译、审校三个环节,做一次多处受益。
表的规模通常不大,一个品类几十个词,由懂行的母语者列一遍即可。
有了它,编辑就知道哪些词不能碰,也就不会为了凑分数去动它们。
术语表还要标一个东西:这个术语在本语言里有几种词形。屈折语里一个术语可能有十几个形态,页面上出现哪一个都算保留。检查脚本要按词干匹配而不是按字符串完全相等,否则会把正常的词形变化误报成术语被换掉了,误报几次之后就没人再看这个报告了;顺带还要注意大小写折叠这一步,转成小写在土耳其语和德语上会改坏词形,术语核对脚本本身就可能是误报的来源。
母语者朗读是最便宜的一次检验
让一个母语者出声读一遍页面,记录他卡壳、回读、重音放错的位置。
这些位置就是真正难读的地方,通常跟分数指出的位置完全不重合。
朗读能暴露的问题包括:断句歧义、指代不清、词序别扭、译文腔。
这些都是公式测不到的,而它们才是本地读者真正会感觉到的东西。
一页文字读一遍不超过五分钟,是整套办法里性价比最高的一项。
朗读还有一个变体值得试:让母语者读完之后,合上页面复述一遍页面讲了什么。复述不出来的部分,就是信息结构有问题的部分,跟句子长短通常没关系。这个方法测的是信息组织而不是文字表面,而信息组织恰恰是所有可读性公式的盲区。
朗读还能顺带发现一类纯技术问题:数字、单位、缩写读不出来。比如格式写错的日期、缺少空格的单位、只有缩写没有全称的规格,母语者读到这里会停顿或者猜。这几处往往同时也是Unicode通用地区数据仓库里有明确本地格式规定的地方,改起来只是配置问题。
一份不依赖分数的可读性验收办法
三个数加一次朗读
三个数是:最长句的长度、超过某个阈值的句子占比、必留术语的保留率。
阈值按语言各自定,方法是从这门语言的本地头部同行页面上采一批句子,取它们的分布当参照。
用同行当对照组的好处是它自动包含了这门语言的构词特点,不需要你自己去研究语言学。
三个数加上一次母语者朗读,就构成了一套完整的验收,用时不超过半小时。
整套办法不依赖任何工具,不依赖分词器,也不会因为换了插件而失效。
这三个数还有一个共同的优点:它们都不依赖任何第三方服务。插件会下线、接口会收费、模型会换代,而数标点、比词表、听朗读这三件事十年后还是一样做法。验收办法的寿命应该比工具的寿命长,这是选指标时很少被提起、但长期看最重要的一条。
怎么设定各语言的阈值
挑三家本地头部同行,每家采二十个句子,算出句长分布。
取他们分布的高位当作你的上限,超过这个长度的句子就标出来人工看。
三家同行必须是本地的、同品类的,不能拿英文站翻译过来的页面当参照。
这套对照组还有一个附带好处:模型和工具换代的时候,你和对照组一起平移,相对位置仍然可比。
阈值每年复核一次就够,语言的写作习惯变化很慢。
采样的时候注意别只挑头部大站。头部大站的文案往往经过多轮打磨,长度偏保守,用它们当上限会把你的标准定得过严。更好的做法是采三家里包含一家中型的本地商家,它的写法更接近这个市场的常态,也更接近你的读者习惯的阅读节奏。
采样还有一个操作细节:只采商品描述和分类说明,别采博客文章。两类文体的句长分布差别很大,混在一起算出来的阈值对谁都不合适。文体这个变量比语言变量还大,这也是很多团队照搬外部标准之后发现完全不适用的根本原因。
把它写进上线清单
验收办法只有写进清单才会真的被执行,否则它只是一次演示。
清单上写三行:最长句是否超阈值、必留术语保留率是否达标、朗读有没有卡点。
三行都过才算通过,任何一行不过就退回修改,不接受用分数抵消。
同时把原来那个分数从验收标准里删掉,只保留在监控看板上当波动告警。
这个动作要在流程上明确宣布,否则编辑会继续按旧标准自我审查。
清单落地还有一个细节:把不通过的处理方式也写清楚,是退回重写还是允许带条件放行。没写清楚的清单最后都会变成走过场,因为第一次遇到赶工期的时候,没人知道该按什么规矩办,而临时决定的先例会立刻变成永久惯例。
这套验收该由谁来跑
三个数可以由脚本自动算,跑在发布前的检查环节里,不占人工。
朗读这一步必须是人,而且必须是母语者,最好是没参与写作的那个人。
写作者自己朗读会自动跳过卡点,因为他知道自己想表达什么,眼睛会替他补上。
如果团队里没有母语者,可以把这一步外包,一页的成本很低,通常比一次改稿还便宜。
排期上建议放在译文定稿之后、结构化数据生成之前,这个位置改动成本最低。
还有一个容易被忽略的角色:负责关键词的人要在术语表这一环签字。术语该不该保留,只有他知道用户到底打的是哪一个词,而这件事既不属于写作也不属于审校,如果不明确指定,它就会一直悬着没人管。
还有一件事要在排期上说清楚:这套验收第一次跑会比后面慢很多,因为术语表和阈值都要从零建。第一次可能要两三天,之后每篇只要半小时。把这个差别提前讲明白,能避免团队在第一次之后就得出这套办法太重的结论,那是本可以避免的误判。
还有一个人选问题值得提前想:跑这套验收的人最好不是写稿的人,也不是决定排期的人。前者会自动为自己辩护,后者会在赶工期时倾向于放行。找一个跟这两件事都没有直接利益关系的角色,验收才会真的发生,而不是变成一次自我确认。
哪些不归语言层,要交出去?
排版和版式那一半交给前端
行长、行距、字号、对比度对阅读体验的影响,跟语言无关,也不该混进这个话题。
它们有各自成熟的规范和检查工具,按那套走就行。
唯一跟语言相关的是每行字符数:不同书写系统的舒适行长不同,这一条要按语言单独定。
把两件事分开的好处是责任清楚,不会出现前端和内容互相等对方先动的僵局。
本篇只管文字本身,不管文字怎么排在屏幕上。
行长这一条还可以再具体一点:拉丁字母语言的舒适行长通常按字符数算,而中日韩按字数算,两套单位不能混。多语言站如果用同一个容器宽度,某几门语言的行长一定会偏离舒适区间,这是版式层面最容易被漏掉、也最容易修的一处。
机器翻译质量那一半单独走
译文腔和可读性是两个问题,虽然它们经常同时出现。
译文腔靠的是母语审校和风格指南来解决,跟句长词长没有关系。
把两者混在一起谈,会让审校环节背上一个它解决不了的指标。
机器翻译直接上线的风险边界在机器翻译直接发布的搜索风险与质量线里划过,那条线跟可读性阈值是两套独立的标准。
两套标准都要过,但不要互相替代,也不要合并成一个总分。
还有一个交界地带要点名:术语表既服务于翻译质量,也服务于本文这套验收,两边都要用它。这种共享资产最好指定一个所有者,否则会出现两份内容不一致的术语表在两个团队里各自演化,最后谁也不知道该信哪一份。
分词器怎么选,是工程层的事
没有空格的语言要不要上分词器、上哪一个,属于工程选型,不该由内容团队来定。
内容团队要做的是提出需求:站内搜索要能匹配、结构化数据要能生成、统计口径要稳定。
选型的结果会反过来影响一批指标的可比性,所以换分词器的时候要通知内容团队重置基线。
这一层的取舍跟本文的主题相交但不重合,交出去比硬塞进来更清楚。
本篇的立场很简单:任何依赖分词结果的指标,在换分词器之后都要重新标定,不然趋势图是假的。
最后补一条关于沟通的经验:跟工程团队讨论这件事的时候,别从语言学讲起,直接给一个具体的失败样例。一段德语文案被判成难读、编辑照着改完之后关键词没了,这个故事三十秒讲完,比解释三个常数的来历有效得多,也更容易换来排期。
还有一个更省事的说服路径:拿一段本地同行的文案去测一遍。如果同行那段也不达标,而他们在这个市场做得比你好,这个事实本身就足够有力,不需要再讲任何原理。用竞品当反例,是所有指标讨论里最快结束争论的办法。
常见问题解答
写作插件给的可读性建议,是不是该全部关掉?
不用全关,但要把它从闸口降级成提示。这类插件里有一部分建议是跟语言无关的通用写作常识,比如提醒你连续三段都用了同一个开头词、提醒你某一段特别长,这些留着有好处。真正要关掉的是那个总分和它对应的红绿灯,因为它会驱动编辑去做有害的动作。如果插件不支持只关分数,那就在流程上明确宣布分数不作为验收依据,并且把它从任何汇报模板里删掉——只要它还出现在周报里,就一定会有人去优化它。
老板要一个能看的数字,总不能什么都不给吧?
给三个:最长句长度、超阈值句子占比、必留术语保留率。这三个数都能自动算,都能画成趋势,而且都有明确的改进动作对应。比一个笼统的可读性分数更好汇报的地方在于,当某个数字变差时,你能直接说出该改哪几句话,而不是只能说文章变难读了。如果一定要一个总分,可以把三个数各自归一化之后加权,但要在报表上注明这是本站自定义指标,别叫可读性分数,免得几个月后又被人当成行业通用值去横向比较。
阅读时长这个指标能不能替代可读性分数?
不能直接替代,因为它测的是另一件事,而且干扰因素太多。读得久可能是因为内容有价值,也可能是因为读者一直在找答案没找到;读得短可能是因为写得清楚,也可能是因为一眼看出不对就走了。把它跟任务完成度放在一起看才有意义:能完成任务且用时短的才是好,能完成但用时长的说明信息藏得太深,完不成的那批才是真正要改的对象。单看时长会得出完全相反的结论,这类代理指标的通病都是这样。
用AI生成的小语种内容,可读性分数会不会天然更好看?
通常会,而且这恰恰是个警告信号。生成模型倾向于产出句长均匀、词汇常见、结构规整的文本,这套特征正好是可读性公式喜欢的。分数好看不代表内容好,它可能只说明这段文字很平庸:没有具体数字、没有限定条件、没有行内术语。用本文那三个数去测,你会发现必留术语保留率往往偏低,句长分布也被压得很平。所以在AI辅助写作的场景下,可读性分数的误导性比人工写作时更强,而不是更弱。
必留术语表该由谁来列,列多少个合适?
由懂这个品类的母语者列,最好是同时了解用户怎么搜的那个人,通常是本地运营或者本地渠道经理,纯译者列出来的往往偏书面。数量上一个品类几十个就够,别追求穷尽,先覆盖出现频率最高、也最容易被换掉的那一批。列的时候标三列:术语原形、允许的变体形态、绝对不能替换成的口语说法。第三列最有用,因为它把模糊的不要乱改变成了一条可执行的检查规则。
分数很低但转化一直不错的页面,要不要动?
别动,去研究它为什么好。分数低而转化好,说明这一页的信息密度和术语准确度撑住了用户的决策,这正是可读性公式测不到的价值。更值得做的是把它当成本语言的内部对照组:它的句长分布是什么样、术语密度多高、限定条件怎么写的,把这些特征提取出来,反过来当作同类页面的参照标准。用自己站上表现最好的页面当基线,比任何外部阈值都可靠。
多语言站的验收标准要不要统一?
框架统一,数值不统一。三个指标的定义、测法、验收流程要全站一致,这样才能沉淀成规范、才能培训新人、才能自动化。但每门语言的阈值必须各自标定,因为构词方式决定了句长和词长的自然区间。硬要统一数值的结果,一定是某几门语言永远不达标,团队要么给它们开永久豁免,要么逼着译者写出不像本地话的句子,两种结果都不好。框架统一数值分开,这一条在多语言站的很多指标上都适用。
权威参考资料
本文标题:《小语种稿子被判成难读,可那把尺子的刻度当年是拿英语量出来的》
本文链接:https://zhangwenbao.com/minor-language-readability-score-english-calibrated-formula.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0