小语种AI稿里读着最顺的那一段,恰恰是模型顺手编出来的本地规矩

小语种AI稿里读着最顺的那一段,恰恰是模型顺手编出来的本地规矩
张文保 更新 36 分钟阅读 3,771 阅读
本文目录
  1. 机器翻译错的和大模型错的,为什么不是同一类错?
  2. 机翻错在说法上,一眼看得出
  3. 大模型错在事实上,读着毫无破绽
  4. 审校最信任的那个信号,正好失效了
  5. 两类错误要配两套验收
  6. 低资源语言为什么更容易出这种事?
  7. 语料占比的真实数字
  8. 缺语料的时候,模型在做什么
  9. 迁移过来的不只是语法
  10. 编出来的东西,为什么总带着英语的影子?
  11. 退货期那个数字
  12. 免运费门槛与货币
  13. 支付方式的推荐
  14. 这四类错有个统一的名字
  15. 幻觉在小语种内容里,一共有几种形态?
  16. 第一类:本地法规与标准编号
  17. 第二类:本地服务商与平台名
  18. 第三类:计量单位与格式
  19. 第四类:称谓、地址与联系方式
  20. 不懂那门语言,怎么把这些错查出来?
  21. 先把可证伪的句子挑出来
  22. 数字、编号、专有名词三类优先
  23. 用本地官方来源核对
  24. 十条清单跑一遍要多久
  25. 复核强度该按什么分档?
  26. 按语言的语料丰度分三档
  27. 按内容的责任等级再加一层
  28. 两个维度叠出来的矩阵
  29. 为什么错误率这个指标会骗人?
  30. 同样的错误率,后果不一样
  31. 可发现性才是关键变量
  32. 投诉链路的语言决定了可发现性
  33. 提示词能不能把幻觉压下去?
  34. 能压一部分,压不住哪一部分
  35. 把本地事实当输入,而不是让它回忆
  36. 不知道就说不知道这句话的实际效果
  37. 生成式结果引用了错的内容会怎样?
  38. 错误会被搬到结果页上
  39. 撤回的路径比发布长得多
  40. 官方自己也演示过这个问题
  41. 这套流程怎么排进现有的内容生产?
  42. 三个卡点插在哪
  43. 成本大概是多少
  44. 常见问题解答
  45. 大模型生成的小语种内容,错误跟机器翻译有什么不同?
  46. 为什么低资源语言更容易出这种错?
  47. 英语默认值泄漏具体表现成什么样?
  48. 不懂那门语言,能不能自己查出这些错?
  49. 复核力度要不要所有语言一视同仁?
  50. 为什么说错误率这个指标会骗人?
  51. 提示词写得足够严格,能不能不做核对?
  52. 权威参考资料

摘要:机器翻译出的错读着别扭,母语审校一眼就能挑出来。大模型生成的小语种内容不一样,它的句子极其自然,错的是里面那些本地事实:退货期、门槛金额、支付方式、标准编号。审校最信任的信号是流畅度,而流畅度恰恰是这类内容最不缺的东西,于是这批错就这么过去了。

机器翻译错的和大模型错的,为什么不是同一类错?

机翻错在说法上,一眼看得出

机器翻译直接发上线这件事,我们几年前就算过一笔账。那时候错误的形态很好认。

典型症状是词序别扭、搭配不对、专业术语被译成日常词,读起来像外国人写的。

这类错误有个好处:它自己会举手。任何一个母语者扫一眼就知道这段不是本地人写的。

所以机器翻译直发的那道审校虽然贵,但它的检出率很高,因为要找的东西摆在表面。

审校的工作方式也是围着这个特点设计的:通读一遍,凭语感标出别扭的地方。

这套方法在机翻时代是够用的,检出率能到八九成。

关键在于,这套方法的有效性完全建立在一个假设上:错误的内容读起来会不自然。这个假设在机翻时代成立得如此稳固,以至于没人把它当成一个假设写下来,它就成了审校流程里一条隐含的地基。而地基一旦被抽掉,整套流程会在没人察觉的情况下失效。

大模型错在事实上,读着毫无破绽

现在的生成内容是另一回事。句子流畅、搭配地道、语域也对。

你把它交给一个母语者,对方读完可能会说写得挺好,比我们上一版强。

问题出在那些具体的、可以被查证的细节上。一个日期、一个金额、一个机构名、一个标准编号。

这些细节不影响句子的通顺程度,所以通读的时候不会有任何异样感。

换句话说,错误从表层沉到了里层,而检查方法还留在表层。

这就是本文要讲的整件事:不是内容质量变差了,是错误改变了藏身的位置。

形象一点说,机翻时代的问题像是衣服穿反了,站远了都看得见;现在的问题像是衣服里缝错了一颗扣子的尺码,穿上去挺合身,出问题要等到某个具体场合。前一种靠看,后一种只能靠量。

这类错误还有一个让人难受的性质:它跟内容的整体水平不相关。同一篇稿子里,论述部分可能写得相当有见地,偏偏配送时效那一句是错的。所以不能用抽样通读来判断一批内容的可靠性,抽到的那几篇读着没问题,说明不了任何事,因为问题从来不是均匀分布在文字质量里的。

审校最信任的那个信号,正好失效了

母语审校在判断一段内容好不好时,最先用的信号就是流畅度。

这不是懒惰,是经验:过去二十年里,流畅度跟内容可靠性的相关性一直很强。

写得顺的内容,通常是懂行的人写的,懂行的人不太会把退货期写错。

现在这个相关性断了。流畅度变成了一件成本极低的事,任何人都能批量拿到。

而事实准确性的成本一点没降,它仍然需要有人去查、去核对。

两条曲线一个塌到地板一个纹丝不动,中间的关系自然就断了。

这条推论可以推广:任何一个曾经被当成质量代理的信号,一旦生产它的成本大幅下降,它就不再是代理了。流畅度是这一轮里最先失效的那个,后面还会有别的。在母语者读着自然不能当验收判据那篇里我们已经提过一次,当时讲的是审校流程的形式问题,现在这个问题的严重程度又上了一档。

两类错误要配两套验收

结论很直接:验收不能只有一道,得有两道,而且两道的执行者可以不是同一个人。

第一道还是母语审校,看语言层面:语域、语气、术语、可读性。

第二道是事实核对,看内容层面:数字、日期、机构、编号、金额、单位。

第二道的关键在于,做这道工序的人不需要懂那门语言。

他要做的是把可证伪的句子挑出来,逐条对照官方来源。这件事跨语言是可执行的。

把两道工序分开还有个副作用是好的:责任划得清楚,出了事知道是哪一道漏的。

成本上这也是合算的。母语审校按小时计费,事实核对可以由内部的人做,而且随着核对清单的积累,速度会越来越快。一门语言做到第三批内容的时候,核对清单基本稳定,单篇耗时会降到二十分钟以内。

两道工序的先后不能颠倒。事实核对必须排在母语审校前面,因为审校在润色的时候有可能把一个具体数字改成一个笼统说法,或者把一句可核查的陈述改写成一句听着更顺的场面话。一旦具体信息被润掉,后面就再也没有东西可核对了,这一篇的事实风险等于被藏了起来。

低资源语言为什么更容易出这种事?

语料占比的真实数字

先看一组公开数字。大规模网页抓取语料的语言分布统计里,英语一门就占了四成以上。

排在前十的语言加起来能占到八成左右,剩下几百门语言分剩下那两成。

具体到单门语言,排在二十名开外的通常只有千分之几,再往后是万分之几。

这个分布跟网页内容语言份额的另一套统计互相印证,形状是一样的。

模型见到某门语言的次数,大体上跟这个比例成正比。

见得少不等于不会说,但见得少一定意味着关于这门语言所在社会的具体事实,模型知道得少。

这里有个容易混淆的地方要说清:语言能力和事实知识是两码事。模型说一门语言说得流利,靠的是这门语言的语法和常用搭配,这些东西在几百万句语料里就能学得不错;而某个国家的退货期是几天、哪家支付公司在当地占主流,这些是稀疏的事实,需要的语料量完全是另一个量级。流利度先饱和,事实密度后饱和,中间那段就是幻觉高发区

缺语料的时候,模型在做什么

模型不会因为没见过就拒绝回答,它会用别的语言里学到的模式来补。

这个补的动作有个正式名字叫跨语言迁移,它本身是个了不起的能力。

正是靠它,多语言模型才能铺到七十多种语言,让小语种享受到本来不该享受到的处理质量。

但迁移是有代价的。语法结构可以迁移,词汇对应可以迁移,事实不该迁移。

事实是绑定在具体社会上的:法律条文、商业惯例、生活习惯,换个国家就变了。

模型分不清哪些该迁移哪些不该,它只知道这里需要填一个数字,而它见过的数字是三十。

学界对这件事有过量化。有研究专门测了同一条事实用不同语言问的时候模型答案的一致性,结论是一致性远低于直觉,而且低资源语言那一侧掉得更明显。也就是说同一个模型,你用英语问和用某门小语种问,得到的可能是两个互相矛盾的答案,它自己并不觉得有什么问题。

迁移过来的不只是语法

如果迁移只发生在语法层,那是纯粹的好事。麻烦在于它连带把语境也搬过来了。

模型学到的商业写作模式,绝大部分来自英语世界的电商内容。

那些内容里反复出现的数字、机构、流程,成了它心目中的默认值。

生成小语种内容的时候,语言换了,默认值没换。

于是你会看到一段地道的德语,讲着一套美国的退货规矩。

这个组合的欺骗性极强,因为语言那一层做得越好,内容那一层的错就越不容易被怀疑。

分词这一层也在放大这个问题。研究发现同一段内容在不同语言上被切成的片段数量差距可以达到好几倍,低资源语言普遍被切得更碎。切得越碎,模型在这门语言上能利用的上下文就越少,越倾向于回到它最熟悉的那套默认模式上去。

编出来的东西,为什么总带着英语的影子?

退货期那个数字

最典型的一个例子是退货期。英语电商内容里最常出现的数字是三十天。

这个数字不是法律规定的,它是美国零售业的商业惯例。

欧盟这边完全不同。消费者权利指令给的是十四天的无理由撤回权,这是法定下限。

落到德国,民法典里那一条把撤回权的期限写得明明白白,同样是十四天。

如果模型给你生成的德语页面上写着三十天,句子毫无问题,事实错得离谱。

更糟的是这个错误方向对你不利:写多了就是承诺,客户拿着页面来主张权利,你得认。

我在一个婴童推车项目里见过接近的情况,页面上的退换说明和后台的实际政策对不上,差的正好是这类默认值。发现它的不是审校,是一个客服在处理投诉时觉得不对劲,往回查了一遍页面。从内容上线到被发现,中间隔了将近五个月。

免运费门槛与货币

第二类是金额。免运费门槛在英语内容里常见的表述是几十美元。

生成小语种内容时,货币符号往往被正确替换了,数字却原样保留。

于是四十九美元变成了四十九欧元,看着很自然,实际是两个不同的门槛。

更隐蔽的是数字格式本身。小数分隔符、千位分组、货币符号的位置,各语言各不相同。

这些在区域数据的数字与货币格式定义里都有标准答案,但模型经常按英语习惯写。

格式错误不影响理解,却会让本地读者立刻察觉这段话不是本地人写的。

金额类错误还有个特点:它同时出现在正文、结构化数据和商品字段里,而三处的生成路径可能不同,改了一处另外两处还留着。结构化数据里那些不可见字段正是最容易被漏掉的一处,因为它错了没有任何人会投诉。

还有一个容易被漏的地方是税费的呈现方式。有些市场习惯标含税价,有些市场习惯标不含税价再另行计算,模型按训练语料里的多数写法来,跟你实际的结算逻辑未必一致。这一项跟门槛金额一样,属于用户会拿计算器验算的那类信息,错了会被立刻发现,而且发现的时机通常是在结算页。

支付方式的推荐

第三类是服务商名字。英语内容里出现频率最高的支付方式,在很多市场根本不是主流。

模型生成荷兰语内容时如果没提当地最常用的那个支付方式,而是推荐了一个国际品牌,读者的信任感立刻打折。

更糟的情况是它提到了一个在当地并不提供服务的品牌,那就是硬伤了。

这类错误的检出成本极低:把内容里出现的所有服务商名字列出来,逐个查它在当地有没有业务。

十分钟能查完,但前提是有人想到要查。

这件事跟落地页上那批被当成装饰的信任元素是同一批对象,只不过那时候的问题是没写,现在的问题是写错了。

两者的危害程度不一样。没写只是少接住一批高意图查询,写错了是主动给出错误承诺,用户按着做发现行不通,损失的是信任而不只是流量。所以这一类在核对清单里应该排在前面。

物流服务商也是同一类。模型很容易写出一个在当地并不派送、或者只做企业件不做个人件的承运商名字。这一项跟支付方式合在一起查最省事,因为它们通常出现在同一个段落里,都属于用户在下单前会确认的条件。查完一次记进事实卡,后面所有内容都能直接复用这两行。

这四类错有个统一的名字

把前面三类加上格式类归拢起来,它们有一个共同的结构。

模型在需要一个本地值的地方,填入了英语世界的默认值。

我把这个现象叫作英语默认值泄漏。名字不重要,重要的是它把一批看似无关的错误归到了一个成因下。

归到一个成因下的好处是,检查动作可以统一:凡是可能存在本地差异的值,全部标记待核。

而不是分别去记退货期要查、货币要查、支付方式要查这样一长串。

这份可能存在本地差异的值的清单,一门语言写一次,之后所有内容通用。

这个视角还能预测新的错误类型。任何一个你还没遇到过、但确实存在本地差异的字段,都可以提前放进清单,不必等它出事。发票要求、保修期限、年龄限制、包装标识,凡是各国规矩不同的,全都是候选。按成因归类比按症状归类的优势,就在于它能覆盖还没发生的那部分

幻觉在小语种内容里,一共有几种形态?

第一类:本地法规与标准编号

这一类风险最高,因为它同时涉及合规和责任。

常见形态是文中引用了一个标准编号、一条法律条款、一个监管机构的名字。

编号这种东西模型特别容易生成,因为它见过成千上万个类似格式的编号。

格式对了,编号本身可能指向另一个完全不相干的标准,或者根本不存在。

婴童品类是重灾区,因为这个品类的安全标准多、编号密、消费者又特别在意。

核对方法是去标准化机构的官方目录里查这个编号,看它对应的标题是不是文中说的那件事。

顺带说一个可以定期看的公开来源:欧盟那个危险产品快速预警系统的公开通报,能看到哪些品类近期因为哪些标准被通报。做婴童、玩具、小家电这些品类的团队,把它当成月度例行阅读,既能核对标准编号,也能提前知道自己的品类正在被盯什么。

第二类:本地服务商与平台名

这一类包括支付公司、物流公司、电商平台、评价平台、行业协会。

错误形态有三种:名字拼错、这家公司在当地不提供服务、这家公司已经改名或退出。

第三种最阴险,因为它曾经是对的,模型学到的是几年前的事实。

这一类跟模型的训练时间点直接相关,也是训练截止时间造成的信息滞后在内容侧的具体表现。

核对方法是打开这家公司的官网,看它的服务地区列表里有没有你的目标市场。

三分钟一家,一篇内容里通常不超过五家。

有一个偷懒但有效的做法:把这类名字全部换成描述性说法,比如写当地主流的即时转账方式而不写具体品牌名。这样既避开了核对成本,也避开了品牌变动的风险。代价是内容的具体感下降一点,但在拿不准的时候,模糊比错误安全得多。

第三类:计量单位与格式

这一类包括尺寸单位、重量单位、温度单位、纸张规格、电压与插头标准。

英语世界的默认值在这里格外顽固,因为美制单位在训练语料里出现得太频繁。

一段德语的产品描述里冒出英寸,或者一段法语的说明里出现华氏度,都是常见情况。

格式那一半前面说过了,数字分隔符、日期顺序、地址行的排列都算。

这一类的检出最容易自动化:写一组正则,扫出所有单位符号和数字格式,人工只看扫出来的部分。

一个脚本能覆盖所有语言,写一次长期用。

自动化的时候要注意一个细节:不要只扫符号,还要扫数值的合理范围。一辆婴童推车的重量写成七点五磅还是七点五公斤,符号都对,数值差了一倍多。范围校验只要给每个字段配一个上下限,就能把这类换算错误一次性挡住。

纸张与包装规格是这一类里最不起眼的一项,却经常出现在说明书和使用指引类内容里。同一件商品的包装尺寸标准,在不同市场的表述惯例不一样,模型混用之后,读者按文中的数字去比对实物会对不上。这类错误不会引发投诉,但会悄悄削掉一部分对内容的信任。

第四类:称谓、地址与联系方式

这一类看着最不起眼,却直接影响转化。

称谓涉及正式程度和性别形式,各语言规则不同,写错了读者会觉得被冒犯。

地址格式各国排列顺序不一样,邮编在前还是在后,门牌号在前还是在后,都不一样。

联系方式的坑在电话号码格式和区号,以及客服时间用的是哪个时区。

还有一类是隐私相关的告知义务,欧盟市场对此有明确要求。

比如数据收集时应当告知用户哪些事项是有条文规定的,生成内容里那段隐私说明不能靠模型自由发挥。

法国的监管机构还给了一份面向企业的合规入门指引,这类官方发布的入门材料是核对隐私文案时最省事的对照物,比找律师快,也比问模型可靠。

称谓这一项还有个跟检索直接相关的后果。有些语言的正式称谓和日常称谓在字面上差别很大,页面上用了一种,用户搜的是另一种,两边对不上。这跟内容准确其实是两个问题,但它们经常同时被模型的默认倾向带偏,所以放在一张清单上一起检查更省事。

不懂那门语言,怎么把这些错查出来?

先把可证伪的句子挑出来

整篇内容里,绝大部分句子是不可证伪的:观点、描述、建议、修辞。

可证伪的句子有个明显特征:它包含一个具体的、有唯一答案的信息。

一个数字、一个日期、一个专有名词、一个编号、一个百分比。

把这类句子挑出来,一篇三千字的内容通常只有十五到二十五句。

这个挑选动作不需要懂那门语言,因为数字和专有名词在任何书写系统里都是可识别的。

挑完之后交给翻译工具逐句译成中文或英文,再逐条核对。

学界给这套工作方式起了名字并做成了评测集,细粒度事实核查基准做的就是把一段文本拆成可核查的原子断言再逐条判定。原理跟这里说的完全一样,只是他们做得更细。做内容的人不必做到那个粒度,挑出带具体信息的句子就够。

挑句子的时候有个简单的操作口诀:看句子里有没有可以被另一个人独立查证的东西。有就挑出来,没有就跳过。按这个口诀,一段抒情的品牌介绍可能一句都挑不出来,而一段配送说明可能整段都要挑。挑出来的密度本身也是个有用的信号,密度越高的段落,风险等级就越高。

数字、编号、专有名词三类优先

时间有限的时候,按这个顺序查。数字最优先,因为它错得最频繁且后果最直接。

编号第二,因为它一旦错就是硬伤,而且检出成本很低。

专有名词第三,包括机构名、公司名、平台名、标准组织名。

剩下的那些不可证伪的句子,交给母语审校去看语言质量,两条线并行。

这个分工的好处是两边都在做自己擅长的事,没有重叠也没有空白。

实际操作下来,事实核对那条线花的时间通常只有母语审校的三分之一。

还有一个优先级判据可以叠加:这句话如果错了,会不会构成一个对外承诺。构成承诺的排在最前面,因为这一类的代价不是被搜索引擎判低质,是真金白银赔出去。退货期、保修期、免运费门槛、配送时效都属于这一类。

百分比要单独说一句。它看着像数字,其实经常是模型自己算出来或者凭印象给的,而且很难核对到确切来源。做法上建议直接删掉那些无法追溯来源的百分比,改成定性表述。一个查不到出处的精确数字,比一句模糊的定性判断更危险,因为前者会让读者以为背后有数据支撑。

用本地官方来源核对

核对的时候,来源等级要卡住。第一等是政府和监管机构的官网。

第二等是行业标准组织和法定登记机构。第三等是相关企业的官网。

不要用问答社区、不要用聚合网站、更不要用另一个模型来核对。

用模型核对模型这件事听着省事,实际上两边可能共享同一批默认值,一起错还互相确认。

官方来源的另一个好处是它可以被引用。核对完之后把链接留在文档里,将来有争议时拿得出依据。

德国那边法律条文全文在线可查,欧盟层面的指令也有官方页面,这类来源找起来并不费劲。

把核对来源整理成一张按市场分组的表,是这件事里回报最高的一次性投入。一个市场大概八到十二个链接:消费者保护、隐私、标准、税务、支付监管各一两条。表建好之后,后续每一篇内容的核对都是查表,不是重新搜索。核对的成本主要在找来源,不在读来源,所以固化来源清单能把单篇耗时压掉一大半。

十条清单跑一遍要多久

把前面的东西压缩成一张十条的清单,逐条过:退货与撤回期限、免运费门槛与货币、支付方式、物流服务商、标准与法规编号、计量单位、数字与日期格式、地址与电话格式、隐私告知、客服时间与时区。

一篇三千字的内容,熟练之后二十分钟能过完。

第一篇会慢,可能要一个半小时,因为你在同时建那张来源表。

到第五篇左右速度就稳定了,因为大部分来源已经在表里。

这个时间成本相对于内容生成节省下来的时间,占比很小。

换句话说,生成式工具省下的时间,拿出一小部分回来做核对,剩下的仍然是净赚。

需要提醒的是这十条不是通用清单,它是按电商内容的常见风险排的。做别的内容类型要重排:技术文档的风险集中在版本号和参数,医疗健康类集中在剂量和适应症,金融类集中在费率和资格条件。清单的条数保持在十条左右就好,太长了没人会真的逐条过。

复核强度该按什么分档?

按语言的语料丰度分三档

不是所有语言都需要同样的复核力度,把力气平均分配是浪费。

第一档是高资源语言:德语、法语、西班牙语、日语这一类,语料充足,事实密度高。

第二档是中等资源语言:北欧几门、中东欧几门、东南亚几门,语料有但不厚。

第三档是低资源语言:使用者不少但网络语料稀薄的那一批,非洲和南亚有不少。

三档对应的抽检比例可以定成一成、三成、全量。低资源那一档必须逐篇过。

怎么判断一门语言在哪一档?看前面那份语料分布统计里它的百分比,超过百分之一算第一档,千分之一到百分之一算第二档,以下算第三档。

学界的跨语言评测也支持这个分法。一项横跨多语言多任务的模型评测发现模型表现随语言资源量下降的曲线不是线性的,到了低资源那一段会陡然下滑。这意味着分档比按连续比例调整更实用,因为真实的质量差异本来就是阶梯状的。

分档时有个细节要注意:判断依据是这门语言在网络语料里的占比,不是它的使用人口。有些语言使用者上亿,网络书面语料却很稀薄,因为使用者主要在口语场景里用它。这两个数字可以差出一个数量级,按人口分档会把一批高风险语言错误地放进低风险档,正好放松了最该收紧的地方。

按内容的责任等级再加一层

光按语言分档还不够,同一门语言里不同类型的内容风险差别很大。

责任等级最高的是那些构成对外承诺的内容:退换政策、保修条款、配送时效、价格说明。

其次是涉及安全和合规的内容:产品标准、使用限制、年龄限制、成分说明。

再次是可能影响购买决策但不构成承诺的:选购建议、对比、使用技巧。

最低的是纯描述性内容:品牌故事、场景介绍、氛围性文案。

四个等级对应四种处理:逐句核对、清单核对、抽样核对、只做语言审校。

责任等级这个维度还有一个好处:它跟语言无关,所以判定规则全站通用,写一次就能给所有语言版本用。定规则的时候把它挂到页面模板上,某个模板产出的内容天然属于哪一级,不用每篇重新判断。

责任等级的判定不需要每篇讨论,把它绑到内容类型上就行。政策类、条款类、参数类的模板天然是高责任,导购类、场景类的模板天然是低责任。绑定之后,一篇内容属于哪一级在选题的时候就确定了,不用等写完再评估,也就不会出现赶工期时临时降级的情况。

两个维度叠出来的矩阵

把语料丰度三档和责任等级四级叠起来,得到一个十二格的矩阵。

右上角那几格是低资源语言加高责任内容,这是唯一必须百分之百人工逐句核对的区域。

左下角那几格是高资源语言加低责任内容,可以直接发,抽样都可以省。

中间那些格子按比例抽检,比例从三成到八成不等。

这张矩阵的价值不在于精确,在于它把一个模糊的要谨慎变成了可以排进工时表的数字。

而且它能拿去跟上级谈资源:右上角有多少篇内容,就需要多少小时的核对工时。

矩阵填好之后会发现一件事:真正需要重投入的格子通常只占内容总量的一到两成。剩下八成可以走轻流程。这个结论对推动流程落地很关键,因为如果听起来是所有内容都要加一道工序,反对的声音会很大;说清楚只有两成需要加,阻力立刻小很多。

为什么错误率这个指标会骗人?

同样的错误率,后果不一样

假设两批内容的事实错误率都是百分之三,一批是英语,一批是某门小语种。

直觉上这两批的风险相等。实际上差得很远。

英语那批内容的读者多、渠道多、反馈路径畅通,错误很快会被指出来。

小语种那批的读者少,而且他们发现问题之后未必会告诉你。

于是同样的错误率,英语那批的错误寿命可能是两周,小语种那批可能是两年。

用错误率衡量风险,等于假设所有错误的寿命一样长,这个假设显然不成立。

翻译研究里也有类似的观察。一项针对多语言翻译模型幻觉的系统研究指出,低资源方向上的幻觉不但更频繁,而且形态更隐蔽,输出跟输入几乎没有语义关联却读着完全通顺。检测这类输出需要专门的方法,靠常规质量指标是发现不了的。

可发现性才是关键变量

把风险重新定义一下:风险等于错误率乘以错误寿命。

错误寿命由可发现性决定,而可发现性跟语言、渠道、用户构成都有关。

这个改写带来一个直接的操作结论:应该在可发现性最低的地方投入最多的事前检查。

而可发现性最低的地方,恰好是低资源语言加低流量市场,也就是最容易被忽略的那一批。

常规的资源分配逻辑是按流量分,流量大的多投入。这跟风险逻辑正好相反。

两套逻辑打架的时候,正确做法不是二选一,是分开算:内容生产按流量分配,质量检查按可发现性分配。

这个思路可以推广到别的地方。凡是反馈回路弱的环节,都要靠事前检查来补,因为事后没人会告诉你出了问题。结构化数据是全站唯一写错了没人会投诉的地方那条老结论,讲的是同一件事的另一个版本。

可发现性还可以进一步拆成三个因子:读者数量、读者反馈意愿、反馈渠道的可达性。三个因子在小语种市场上通常同时偏低,所以它们是相乘而不是相加的关系,掉下来的速度比直觉快得多。理解这一点之后就不难接受一个结论:小语种内容的事前检查标准,应该比英语内容更严而不是更松。

投诉链路的语言决定了可发现性

还有一层结构性原因容易被忽略:投诉链路本身是有语言的。

很多出海团队的客服系统、工单系统、反馈表单,界面和处理流程都是英语的。

一个只会说本地语言的用户,看到页面上的错误,要跨过一道语言门槛才能告诉你。

大部分人不会跨这道门槛,他们的做法是关掉页面去别家买。

所以你收到的投诉量,反映的不是错误的多少,是你的投诉链路对哪种语言友好。

这也解释了一个常见的错觉:小语种版本的投诉最少,团队因此认为它质量最好。

要打破这个错觉,有个成本很低的办法:在小语种版本上放一个用本地语言写的、一句话就能提交的反馈入口,不要求填邮箱不要求登录。开三个月看看数量。多数团队第一次做这件事的时候,收到的问题数量会超出预期,而且其中相当一部分是内容错误而不是功能问题。

提示词能不能把幻觉压下去?

能压一部分,压不住哪一部分

提示词工程在这件事上确实有用,但作用范围有限,要说清楚边界在哪。

它能压住的是风格层面的偏移:语域太美式、句式太英语、举例都是美国场景。

这些通过明确指令加上几个示例,改善很明显。

它压不住的是模型压根不知道的事实。你要它写某个小市场的退货规则,它不知道就是不知道。

要求它准确并不能让它变得准确,只能让它更自信地说出一个错误答案。

这一点跟人不一样:人不知道会犹豫,会加限定词,模型不会。

有研究专门测过多语言场景下的这类问题,模型在非英语语境下的行为一致性明显低于英语,同一套约束在英语上生效、换一门语言就未必生效。这意味着你在英语上调好的提示词模板,直接搬到小语种上要重新验证,不能默认继承。

把本地事实当输入,而不是让它回忆

真正有效的做法是改变信息的来源方向。

不要问模型退货期是多少天,而是把退货期是十四天这句话作为输入给它,让它写进内容。

这个转换把模型的角色从知识来源变成了语言工具,而后者才是它真正可靠的部分。

具体做法是给每个市场维护一份事实卡:退货期、门槛、支付方式、物流商、客服时间、法规要点。

生成内容时把这张卡片连同指令一起送进去,并明确要求所有本地信息只能来自卡片。

这张卡片一个市场维护一份,每季度核一次,成本很低。

事实卡还有个衍生用途:它天然就是核对清单。生成完之后,把内容里所有本地信息跟卡片比对一遍,不在卡片上的信息就是模型自己加的,全部标红待查。这一步可以完全自动化,因为卡片是结构化的。把事实前置成输入,等于同时解决了生成和验收两个环节

不知道就说不知道这句话的实际效果

在指令里加一句不确定的地方就说不确定,效果比想象中弱。

模型对自己知道多少的判断本来就不准,尤其在低资源语言上更不准。

它可能对一个编错的编号很有把握,对一个正确的日期反而加了限定词。

所以这句话可以加,但不能因为加了就放松核对。

更有用的一个技巧是要求它把所有本地事实单独列在文末,用一个清单的形式。

这样核对的对象从一整篇内容变成了一份短清单,工作量直接降一大截。

这个技巧还有个副产品:如果清单里的某一条在正文里找不到对应位置,或者正文里有本地事实没进清单,说明生成过程本身出了偏差,这一篇建议重新生成而不是修补。把它当成一个廉价的自检信号,比通读全文快得多。

还有一种写法值得一试:要求模型在每个本地事实后面标注它的来源类型,是来自输入的卡片还是它自己补的。标注未必百分之百准确,但它会显著提高标出自己补的这一类的比例,因为这个要求把判断动作显式化了。标出来的那几条重点查,没标的抽查,核对效率能再提一截。

生成式结果引用了错的内容会怎样?

错误会被搬到结果页上

这一层是今年才变得要紧的。以前内容里的错误只影响看到这个页面的人。

现在结果页上那段生成的回答会从若干个页面里取材,你的错误可能被搬上去。

被搬上去之后,看到这个错误的人数量级不同了,而且它不再显示在你的页面上。

用户看到的是一个综合过的回答,未必会点进来核实。

对小语种市场来说这个放大效应尤其明显,因为这些语言里可选的来源本来就少,而哪几门语言已经被覆盖、哪几门还没轮到,本身就有一份可查的时间轴。

来源少意味着你被取材的概率高,也意味着一旦错了没有别的来源来对冲。

这跟供给稀缺让小语种内容更容易被引用是同一个机制的两面:稀缺带来更高的被引用概率,也带来更高的错误传播概率。同一个杠杆,两个方向都放大。

还有一个方向的影响也要考虑到:被搬上去的如果是正确内容,收益同样会被放大。所以这件事不是单纯的风险,是一个双向放大器。真正要避免的是在放大器接通之后才想起来检查内容,那时候被放大的是什么,你已经决定不了了。接通放大器之前把内容校准,是这件事唯一有效的顺序

撤回的路径比发布长得多

发布一篇内容是几分钟的事,让一个已经被引用的错误消失要经过好几道。

第一步是改页面,这是你能控制的,当天就能做完。

第二步是等重新抓取,小语种站的抓取频率通常不高,可能要几周。

第三步是等生成侧更新它的取材,这一步的时间完全不可控。

三步加起来,一个错误从改正到彻底消失,几个月是常态。

所以这件事上事前成本和事后成本的比例极其悬殊,二十分钟的核对对几个月的清理。

加快第二步有个实际办法:改完之后主动推送这个页面的更新,别等自然抓取。面向生成式结果的那套落地流程里主动通知这一环,在纠错场景下的价值比在新增内容场景下还高,因为纠错是有时效压力的。

这三步里最容易被低估的是第二步。团队通常按自己站上主要语言的抓取频率来估时间,而小语种版本的实际抓取间隔可能是主语言的好几倍。改完之后隔两天去看还是老内容,很多人会以为是缓存问题,其实只是还没被重新抓取,这中间的等待期要提前跟业务方讲清楚。

官方自己也演示过这个问题

今年五月那次生成式结果在美国大规模上线之后,出现了一批被广泛传播的错误答案。

产品方随后专门发文说明了那批错误的成因与后续措施,其中提到的一类是系统误读了网上本来就存在的低质内容。

这件事对内容方的启示很直接:结果页上的错误,源头未必在生成侧,可能就在某个页面上。

换句话说,你写下的每一个本地事实,都可能成为别人看到的那个答案。

这个责任在英语市场被几十个来源分摊,在小语种市场可能就落在你一家头上。

这不是要吓唬谁,而是说明为什么在小语种上做事实核对的边际收益比在英语上高。

顺带一提,那次风波之后能明显感觉到一个趋势:对来源质量的要求在提高,而事实准确是质量里最硬的一条。把核对做扎实,短期是避险,中期反而是竞争优势,尤其在一门可选来源只有个位数的语言里。

这件事还有个侧面值得注意:公开说明里提到的那批错误,绝大多数发生在英语内容上,而英语正是来源最密集、纠错最快的那一门语言。同样的机制换到来源只有个位数的语言上,暴露程度只会更高。把英语市场发生的事当成小语种市场的下限而不是上限,这个预期设定更接近实际。

这套流程怎么排进现有的内容生产?

三个卡点插在哪

第一个卡点在生成之前:确认这个市场的事实卡是最新的,超过一个季度没核就先核。

第二个卡点在生成之后、母语审校之前:跑事实核对清单,把可证伪的句子逐条过。

顺序很重要,事实核对要在母语审校之前,因为审校可能会顺手润色掉某些具体信息。

第三个卡点在上线之后一周:抽查线上页面,确认改动都生效了,结构化数据里的字段也一起改了。

三个卡点分别由不同角色负责,互相不覆盖,也就不会出现都以为对方查过的情况。

把这三步写进内容生产的检查表里,比开会强调十次有用。

第三个卡点最容易被砍掉,因为它发生在大家心理上已经完成的时刻。但它抓到的问题往往是最尴尬的那种,比如正文改了商品字段没改、桌面端改了移动端模板没改。给它排一个固定的周会时间,五分钟,就能保住。

三个卡点还需要一条兜底规则:任何一次事实卡的更新,都要触发一次已发内容的回刷。否则卡片改了,之前按旧卡片生成的那批内容仍然停在旧数值上。回刷不必全量,按事实卡里哪一行改了,回刷引用了那一行的内容即可,前提是生成时记录过每篇用了卡片里的哪几行。

成本大概是多少

按一篇三千字的内容算,事实核对熟练之后二十到三十分钟。

事实卡的季度维护,一个市场一到两小时。

来源表的初次搭建,一个市场半天,之后基本不动。

把这些加起来,对一个同时做六个小语种市场的团队来说,大概是每月两到三个人日。

相对于生成式工具在内容生产上省下来的时间,这个投入占比很小。

保哥的说法是,这笔钱不花在事前,就得花在事后,而事后的价格是按月计的。

最后提醒一句排期上的现实:这套流程最好在开始大规模生成之前就建好。等到已经发了几百篇再回头补,你要面对的是一个存量清理项目,而存量清理从来没有人愿意批预算。趁着量还小的时候把工序钉进去,是成本最低的时机。

还有一笔账要算进来:这套流程会顺带提升内容的可复用性。事实卡一旦建好,它不只服务生成式内容,也能给客服话术、广告文案、商品字段当统一口径。一份被三个部门共用的事实卡,维护成本会自然被分摊掉,这时候它就不再是内容团队单独承担的开销了。

常见问题解答

大模型生成的小语种内容,错误跟机器翻译有什么不同?

机器翻译错在说法上,词序别扭、搭配不对,母语者扫一眼就能挑出来,所以通读式的审校检出率很高。大模型生成的内容句子极其自然,语域也对,错的是里面那些具体可查的本地事实:退货期、门槛金额、支付方式、标准编号。这些不影响通顺,所以通读时毫无异样感。错误从表层沉到了里层,而检查方法还留在表层,这是问题的全部要害。

为什么低资源语言更容易出这种错?

因为语言能力和事实知识的饱和速度不一样。几百万句语料就够模型把一门语言说流利,而某个国家的退货期是几天、哪家支付公司在当地占主流这类稀疏事实,需要的语料量是另一个量级。中间那段就是幻觉高发区。缺语料的时候模型会用跨语言迁移来补,语法可以迁移,事实不该迁移,但模型分不清,于是把英语世界的默认值填了进去。

英语默认值泄漏具体表现成什么样?

主要四类。退货期写成三十天,那是美国零售业的商业惯例,而欧盟法定的无理由撤回期是十四天。免运费门槛的货币符号换了、数字没换,四十九美元变成四十九欧元。推荐的支付方式是国际品牌而不是当地主流,甚至可能是在当地没有业务的品牌。还有数字与日期格式按英语习惯写。四类的共同结构是:需要一个本地值的地方,填入了英语世界的默认值。

不懂那门语言,能不能自己查出这些错?

能,而且比想象中容易。先把可证伪的句子挑出来,特征是包含一个有唯一答案的具体信息,数字、日期、专有名词、编号、百分比。这类句子在一篇三千字内容里通常只有十五到二十五句,挑选动作不需要懂那门语言,因为数字和专有名词在任何书写系统里都可识别。挑完逐句机器翻译,再拿政府、标准组织、企业官网这三等来源核对,二十分钟能过完一篇。

复核力度要不要所有语言一视同仁?

不要,平均分配是浪费。按语料丰度分三档,抽检比例定成一成、三成、全量;再叠一层内容责任等级,构成对外承诺的最高,涉及安全合规的次之,影响决策但不构成承诺的再次,纯描述性最低。两个维度叠成十二格矩阵,低资源加高责任那几格必须逐句核对,高资源加低责任那几格可以直接发。实际填下来,需要重投入的通常只占内容总量的一到两成。

为什么说错误率这个指标会骗人?

因为它假设所有错误的寿命一样长。同样百分之三的错误率,英语内容的读者多、反馈路径畅通,错误可能两周内就被指出;小语种内容的读者少,而且投诉链路本身往往是英语的,用户要跨一道语言门槛才能告诉你,多数人不会跨,直接关页面去别家。所以风险应该定义成错误率乘以错误寿命,而事前检查的投入要按可发现性分配,不能按流量分配。

提示词写得足够严格,能不能不做核对?

不能。提示词能压住风格层面的偏移,压不住模型压根不知道的事实,要求它准确只会让它更自信地说出错误答案。有效的做法是改变信息方向:给每个市场维护一份事实卡,把退货期、门槛、支付方式、法规要点写在卡片上,生成时连同指令一起送进去,并规定所有本地信息只能来自卡片。这样模型的角色从知识来源变成语言工具,而后者才是它可靠的部分。

权威参考资料

分享到
标签
版权声明

本文标题:《小语种AI稿里读着最顺的那一段,恰恰是模型顺手编出来的本地规矩》

本文链接:https://zhangwenbao.com/low-resource-language-ai-hallucination-rate-content-risk.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交