同一个问题问十种语言给出十个结论,先别急着统一口径,其中一类改了就是改错
本文目录
- 能提问的语言翻了一倍,出错的面为什么也跟着翻倍?
- 今年二月那次扩语把可提问语言推到了近百门
- 语言数一涨,同一个事实的说法数就跟着涨
- 为什么这件事在纯英语站上看不见
- 不一致长得一模一样,可它其实有三种?
- 第一类:各地规则确实不同的真分歧
- 第二类:同一事实的新旧版本造成的伪分歧
- 第三类:本地来源为零时的幻觉分歧
- 三类的表面症状完全一致
- 语言不等于国家,这句话在哪儿真正咬人?
- 西班牙语跨二十个国家,法条各不相同
- 德语只跨三个国家,法定期限照样不同
- 答案对语言,错在读者所在的国家
- 用语言标签去猜辖区的失败率
- 怎么把三类分歧自动分开?
- 跨语言事实矩阵的行与列
- 每格必须放的那三样东西
- 三条判别规则
- 矩阵跑一遍要多久
- 真分歧该修的不是口径,那该修什么?
- 统一口径会把对的那一类改错
- 适用范围要写在能被摘取的位置
- 条件句在不同语序里的位置
- 伪分歧为什么最容易越积越多?
- 多语言站的更新永远不同步
- 谁负责第二语言的版本对齐
- 三个能自动发现落后版本的信号
- 幻觉分歧不是你的错,为什么还要你来修?
- 池子空着的时候模型必须填
- 你放进去的第一条本地来源
- 跟低资源语言幻觉那一层的分工
- 哪些事实字段必须逐语言核,哪些不用?
- 可判定字段与不可判定字段
- 必核清单:期限、金额、资质、安全
- 可以只维护一份的字段
- 乐器与音响这类品类的特殊项
- 报给老板的时候怎么讲才不会拿到错指令?
- 一个数字会引出统一口径
- 三个数字会引出三种动作
- 汇报模板与责任边界
- 这套做法在什么情况下不值得做
- 什么时候可以先不做
- 会失效的两种情形
- 常见问题解答
- 三类分歧里,哪一类最该优先处理?
- 没有本地母语者,这套矩阵还能跑吗?
- 真分歧那一类加了限定条件,会不会影响可读性和转化?
- 矩阵里的值应该从答案里取还是从自己的页面上取?
- 如果两个市场的规则确实不同,但用户是同一批人怎么办?
- 模型换代之后,之前跑出来的矩阵还作数吗?
- 这套东西跟传统的多语言内容质检有什么区别?
- 权威参考资料
摘要:同一个问题用德语、西语、日语各问一遍,退货期限给出三个不同的天数。多数人的第一反应是模型不稳定,得赶紧统一口径。可这三个数字里有一个是对的、有一个是过期的、还有一个是编的,三种毛病长得一模一样,修法却完全相反。这篇给出把三类分歧自动分开的事实矩阵,以及为什么统一口径这个指令会把唯一正确的那一类改错。
能提问的语言翻了一倍,出错的面为什么也跟着翻倍?
今年二月那次扩语把可提问语言推到了近百门
先把这件事的量级说清楚。
今年二月中旬,谷歌一次性给AI Mode加进了53门新语言。
加完之后累计支持的语言数逼近100,覆盖的国家和地区超过200。
这是这项功能上线以来单次幅度最大的一回扩容。
官方给出的口径是这批新语言的使用者合计超过10亿人。
对做跨境的人来说,这意味着你的商品信息可以被将近100种语言问出来。
但语言数从40多跳到接近100,同时也意味着关于你的同一件事,现在有将近100个版本在被生成。过去你只需要关心那几门主力语言的答案说得对不对,现在这个检查面翻了一倍多。更棘手的是新加进来的这批语言恰恰是本地内容最稀薄的那批,也就是最容易出岔子的那批。这跟官方公布的是国家数、你要的是语言数那篇的量纲问题一脉相承,只是这一次两个数字终于都给了。
拿去年五月的口径对照一下,落差更明显。两百多个国家、四十多门语言那份扩容公告是上一个里程碑,从那时到现在语言数翻了一倍多,而国家数几乎没动。两个数字的增速差别本身就说明了问题:地理覆盖早就到顶了,接下来的扩张全发生在语言这一维上。
语言数一涨,同一个事实的说法数就跟着涨
把机制讲透。
模型生成答案时,依据的是当下检索到的那批文档。
不同语言检索到的文档不是同一批,这在前面几篇里已经拆过。
文档不同,答案里的具体数字自然可能不同。
所以语言每多一门,同一个事实就多一个可能被说错的机会。
这不是概率上的小幅上升,是线性增长。
而你能投入的核查资源不会跟着线性增长,多数团队的多语言质检资源这两年是持平甚至收缩的。供给增长、核查能力不变,缺口只会越拉越大。所以从今年开始,靠人力逐语言读答案这条路已经走不通了,必须换成一种能自动把问题分类的机制,只把需要人判断的那一小部分挑出来。这篇后面给的事实矩阵,做的就是这件筛选的活儿。
为什么新加进来的语言更容易出岔子,看一眼全网内容的语言分布就懂了。Common Crawl按语言统计的文档分布里,排在前十之后的语言文档量断崖式下跌,尾部几门跟头部差着好几个数量级。语言支持列表是线性延长的,可支撑这些语言的内容供给不是线性的,两者之间的缺口就是错误滋生的地方。
为什么这件事在纯英语站上看不见
这一节解释它为什么是语言层的问题。
只做英语的站,答案也会出错,但错的形态不一样。
那种错通常是模型理解偏了,或者引用了一个过时的页面。
它是单点的,查出来改掉就完了。
多语言场景下的错是分叉的:同一件事同时存在几个互相矛盾的版本。
而这几个版本各自都有来源支撑,各自看都不像是错的。
换句话说,单语言环境下你面对的是对错问题,多语言环境下你面对的是一致性问题,后者需要的工具完全不同。对错问题靠事实核查,一致性问题靠比对;前者需要知道正确答案,后者只需要发现两个答案不一样。这个区别很关键,因为比对可以自动化,事实核查很难自动化。把工作量从后者挪到前者,是这一层唯一能规模化的路径。
还有一层区别在发现机制上。单语言站的错答案,用户看到了会来问客服,客服反馈给内容团队,链路虽然长但存在。多语言场景下,看到错答案的是另一个国家的用户,他大概率不会用你听得懂的语言来投诉,多半直接放弃下单。反馈链路断了,问题就不会浮上来,只会体现在一条永远解释不清的转化率曲线上。
不一致长得一模一样,可它其实有三种?
第一类:各地规则确实不同的真分歧
先说最容易被误伤的那一类。
德语答案说退货期限是十四天,这是德国民法典写死的。
美国那边没有联邦层面的统一强制退货期,多数商家自己定。
两个答案都对,因为它们回答的是两个不同司法辖区的问题。
保修也一样,欧盟的法定符合性保证下限是两年。
而西班牙在2022年把本国的期限从两年延长到了三年。
于是同一门西班牙语,在西班牙给出三年、在拉美几个国家给出各自不同的年限,这几个数字全都是对的。把它们统一成一个数,等于给其中至少两个市场的用户发了错误信息,而且是有法律后果的那种错误信息。这类分歧不是缺陷,是现实世界本来的样子被如实反映了出来。俄语读者散在十几个国家那篇提出的语言资产与市场资产分离,在这里以最硬的形式出现了一次:法条绑的是国家,答案绑的是语言。
真分歧的范围比多数人预估的宽。除了退货与保修,还有增值税是否含在标价里、发票的法定要素、个人数据的保存期限、七天冷静期是否适用于线上定制商品,每一项在不同法域下都有不同答案。共同点是它们全部由当地法规决定,而不是由你的经营策略决定,所以你连统一的余地都没有。
第二类:同一事实的新旧版本造成的伪分歧
第二类才是你真正的错。
你的德语页面去年改过一次,配送时效从五天改成三天。
法语页面没人动,还写着五天。
模型分别检索到两个页面,忠实地给出两个答案。
两个答案都有你自己的官网当来源,看着都很权威。
用户拿着法语那个答案来问客服,客服说不对,用户就困惑了。
这类分歧的特征非常明确:两个矛盾的答案指向的是同一个来源主体,只是版本不同。识别它不需要任何领域知识,只需要比对来源的最后更新时间。而它的修法也极其明确:把落后的那个版本更新掉。麻烦在于多语言站的更新几乎从来不同步,主语言改完之后其余语言排队等,队伍越排越长。机翻直接上线省下的那道审校最后拿收录和排名分期还那篇算的是初次发布的账,版本漂移是这笔账的续集。
伪分歧还有一个更隐蔽的来源:同一份内容在不同渠道上的副本。官网改了,帮助中心没改;帮助中心改了,商城平台上的店铺介绍没改。这几处都是你自己的地盘,都会被当成权威来源检索到。排查时别只盯官网,把所有你能控制的对外页面列个清单,逐个核一遍数值,通常能发现两三处遗漏。
第三类:本地来源为零时的幻觉分歧
第三类最不好办。
某门语言里关于你这个品类根本没有本地内容。
模型被问到一个具体问题,它必须给出一个答案。
于是它拿高资源语言里的事实往这边套,或者直接填一个看着合理的数字。
填出来的东西格式完整、语气笃定,读着比真答案还顺。
这一类跟小语种AI稿里读着最顺的那一段恰恰是模型编出来的那篇讲的是同一个现象。
识别它的特征是:这个答案给出了具体数值,却挂不出任何本地来源,或者挂的来源点进去根本没有这个数值。后一种情况尤其常见,来源存在、可点击、看着可信,但你去页面上搜那个数字,一次都搜不到。这是三类里唯一一类你没有任何过错的,可它对用户的伤害最直接,因为编出来的往往正是期限、费用这类会引发纠纷的字段。
各语言之间的能力差距虽然在缩小,但缩小的速度极不均匀。斯坦福人工智能指数年度报告逐年跟踪的多语言评测数据显示,进步主要集中在使用人口多的那批语言上,长尾那一段改善有限。这意味着幻觉分歧不会随着时间自动均匀消退,它会先在大语种上消失,在小语种上继续存在很久。
三类的表面症状完全一致
把这一节的结论钉死。
三类分歧在报表上呈现出来的样子一模一样。
都是同一个问题在不同语言下给出了不同的值。
都能挂出看着可信的来源。
都不会触发任何告警,因为没有任何一侧是明显错误的。
而它们各自需要的动作,一个是加限定条件,一个是同步版本,一个是补本地内容。
三个动作分属三个不同的团队:法务与内容、多语言运营、市场与本地化,没有任何一个团队能独立处理完三类。这解释了为什么这个问题在组织里特别难推进——它跨了三个部门,而报表上它只有一行。把这一行拆成三行,是推动这件事最关键的一步,比任何工具选型都重要。人机分工与事实核查清单那篇给的分工原则在这里要再叠一层语言维度。
症状一致还带来一个副作用:不同的人看同一份数据会得出不同的结论,而且都能自圆其说。法务看到的是合规风险,运营看到的是翻译没跟上,市场看到的是内容覆盖不足。三种解读各有道理,各自都能推动一批工作,最后三批工作互不相干地跑起来,谁也没解决全部问题。分类先行的价值,就是让三方在同一张表上对齐。
语言不等于国家,这句话在哪儿真正咬人?
西班牙语跨二十个国家,法条各不相同
拿分布最广的语言先说。
西班牙语的官方地位覆盖二十来个国家。
这些国家的消费者保护法各自独立,期限、举证责任、适用范围都不同。
一个用西班牙语提出的退货问题,正确答案取决于用户在哪个国家下单。
而问句里通常不含国家信息,模型也不会主动问。
于是它只能给一个答案,而那个答案默认了某一个国家。
默认哪个国家,取决于检索到的文档主要来自哪里,而这又取决于哪个国家的西语内容更多。结果是内容产出最多的那个市场的规则,被当成了整门语言的默认规则。这跟西语地区变体在AI问答里被怎么分那篇讲的检索侧分歧是同一个机制的两个后果:那边影响的是词,这边影响的是事实。
同一门语言内部的词汇差异,学界已经有量化研究。Digital Linguistic Bias in Spanish这项研究覆盖了20来个西语国家、900多个词项的地理分布,发现模型的输出明显偏向其中几个变体。词汇上的偏向和事实上的偏向是同一个成因的两个表现:谁的内容多,谁就成了默认。
德语只跨三个国家,法定期限照样不同
再看一个覆盖面小得多的例子。
德语的主要市场是德国、奥地利、瑞士三个。
三国里两个在欧盟,一个不在。
瑞士不受欧盟消费者权利指令约束,撤回权的规则完全另算。
所以德语答案里的十四天,对瑞士用户是不成立的。
三个国家已经能造出分歧,二十个国家可想而知。
这说明分歧的成因不是语言覆盖面大,而是语言边界与法律边界不重合,哪怕只错开一个国家也足够。把这条推到极端:即使一门语言只在一个国家使用,它的答案也可能因为州、省一级的规则差异而出错。语言这个维度天生就不是用来切法律的,用它当默认分组,出错只是早晚的事。
答案对语言,错在读者所在的国家
把这句话说透。
模型交付的是一段语言正确的文本。
它在语言这一层没有任何毛病,语法漂亮,措辞地道。
出问题的是这段文本隐含的适用范围。
读者读到自己的母语,天然会假定这段话是说给自己听的。
而实际上它说的是另一个国家的规则。
语言的熟悉感,在这里恰好成了误导的载体。
这是本篇最想强调的一个反直觉之处:越是把答案本地化得地道,读者对它的信任度越高,而适用范围错配造成的伤害也就越大。一个磕磕巴巴的翻译版本,读者会保持警惕;一个流畅自然的本地语言答案,读者会直接照做。质量和风险在这里是同向的,这跟大多数场景下的直觉正相反。
信任感和市场规模还不是一回事,这一点在做优先级时容易搞混。一个市场的用户可能很少,但只要那门语言是他的母语,他对答案的信任度就跟大市场用户一样高。西班牙的数字生态年度报告这类国别数据能告诉你规模,但告诉不了你风险,风险是按人头算的,不是按市场大小算的。
用语言标签去猜辖区的失败率
顺便否掉一个常见的技术方案。
有人想用语言标签的地区段来解决这个问题。
把内容标成某个具体的地区变体,指望系统按这个匹配用户。
这个思路在传统搜索里部分有效,在AI问答这一层几乎失效。
因为问句里没有地区,而标签是页面属性不是查询属性。
标了不亏,但不能指望它替你解决适用范围的问题。
真正有效的做法是把适用范围写进正文,写成模型能摘取的句子,而不是写进机器字段。一句在德国境内订购的商品适用十四天撤回权,比任何标签都管用,因为它就在答案能引用的那段文字里。正文越本地化越好、结构化数据里却要反着写回国际格式那篇讲的两层分工在这里再次生效:机器字段管归档,正文管被引用。
标签本身仍然值得配好,只是别指望它承担这个职责。RFC 5646语言标签规范定义的语言加地区两段式写法,能让你的内容管理系统和数据分析准确地把页面归到市场上去,这对内部运营很有价值。它只是不会在一次问答里被当成过滤条件,这两件事不冲突。
怎么把三类分歧自动分开?
跨语言事实矩阵的行与列
核心工具就是一张表。
行是可判定的事实字段:退货天数、保修年限、运费门槛、是否包税。
列是你在做的语言,一门语言一列。
每个格子里放三样东西,缺一不可。
第一样是答案里给出的那个值。
第二样是这个值挂出来的来源链接。
第三样是这条来源的最后更新时间,能取到就取,取不到就标记为未知。这三样凑齐之后,三类分歧的判别就完全变成了机械操作,不需要任何人做判断。矩阵本身的规模也不大:二十个字段乘十门语言是两百格,一次抓取就能填满,之后每次重跑只需要看哪些格子的值变了。这套结构的好处是它同时是检查表和历史档案,跑三次之后就能看出哪些字段一直在飘。
行的挑选有个实用原则:只放那些用户真的会问的字段。矩阵不是产品数据库的镜像,它是问答风险的清单。判断标准很朴素——过去半年客服工单里出现过这个字段吗,出现过就进表,从没人问过就先不进。按这个筛,多数品类的行数会落在二十上下,正好是一屏能看完的规模。
每格必须放的那三样东西
解释为什么是这三样。
只有值,你能发现不一致,但分不出是哪一类。
加上来源,你能区分出有据可依和凭空生成。
再加上更新时间,你能区分出真分歧和版本漂移。
三样凑齐,三类才互相排他。
少任何一样,就会有两类混在一起分不开。
实践中最容易被省掉的是第三样,因为更新时间不好取,很多页面根本不给。取不到的时候不要留空,标记成未知,让它作为一个独立的状态存在。未知本身是有信息量的:一个连更新时间都拿不到的来源,可信度天然低一档。把未知混进空值里,你会在分析时把它们当成缺失数据丢掉,而那批恰恰是最该关注的。
格子里其实还可以放第四样:这一轮抓取的日期。有了它,矩阵就从快照变成了时间序列,你能看出某个字段是长期不一致还是最近才开始飘。长期不一致多半是真分歧,最近才飘的多半是有人改了什么。这一列成本为零,却能省掉大量的回溯排查,建议从第一次跑就加上。
三条判别规则
规则可以直接写成代码。
规则一,值不同、各自有本地来源、来源指向不同的主体,判为真分歧。
规则二,值不同、来源指向同一个主体、更新时间不同,判为伪分歧。
规则三,值不同、某一侧挂不出来源或者来源里搜不到该值,判为幻觉分歧。
三条规则覆盖不了的落进待定,交给人看。
实测下来待定的比例通常在一成到两成之间。
规则三里那个来源里搜不到该值的检查,是整套流程里性价比最高的一步:抓一遍来源页面的正文,在里面搜一下那个数字,搜不到就是红灯。这个检查完全自动化,成本接近零,却能抓出绝大多数编造。做过的人普遍反馈第一次跑完会有点惊讶,因为红灯的数量比预期多。共识层那几个信号要成立,前提是那些来源真的说过那句话,这一步就是在验证这个前提。
有人会想直接让模型来做这个分类,省掉规则。不建议,How Reliable is Multilingual LLM-as-a-Judge这项研究发现模型担任评判者时在不同语言上的判断并不一致,你用它来判跨语言的一致性,等于让一个本身带语言偏差的裁判去裁语言偏差。三条硬规则虽然笨,但它对所有语言一视同仁。
矩阵跑一遍要多久
把成本说清楚。
字段清单一次性整理,半天。
问题设计与本地化重写,每门语言一小时。
抓取与填表,自动化之后一次两三个小时。
判别规则跑完,剩下的待定项人工看,一门语言半小时。
首次搭建大约一周,之后每季度重跑一天。
跟前一篇讲的可见度监控相比,这套东西的频率可以低很多,因为事实字段的变化远慢于可见度指标。法条修订以年为单位,你自己的政策调整也不会每周变。真正需要提高频率的时机只有两个:你刚改过某个政策,以及某个市场刚有法规变动。这两个时机之外,季度节奏完全够用。跨语言可见度监控那篇给的月度节奏不用照搬到这里。
还有一笔容易被低估的时间开销:把字段清单从各个部门收集齐。法务手上有合规字段,客服手上有高频问题,运营手上有政策变更历史,三边的清单合并起来才完整。这个协调过程往往比技术实现更耗时,建议在项目启动时就把它当成第一个里程碑,而不是等到要填表了才去要数据。
真分歧该修的不是口径,那该修什么?
统一口径会把对的那一类改错
这是全文的第二个核心结论。
一旦你把三类混着报上去,得到的指令几乎必然是统一口径。
这个指令对伪分歧是对的,对幻觉分歧无效,对真分歧是有害的。
因为真分歧的三个数字本来就该不同。
把它们统一成一个,等于主动制造一批错误信息。
而且这批错误信息是你亲手写进官网的,法律责任跑不掉。
更麻烦的是统一之后一切看起来都变好了:报表上不一致的行数归零,汇报时数字很漂亮。问题被藏进了一个没人再检查的地方,直到某个市场的用户拿着你的官网页面去投诉。指标一旦可以通过做坏事来改善,它就会被通过做坏事来改善,这条规律在任何组织里都成立。所以拆成三行不只是为了准确,也是为了不给团队一条走捷径的路。
适用范围要写在能被摘取的位置
真分歧的正确修法在这里。
不改数值,改的是数值旁边的限定条件。
把适用的国家、适用的条件写成一个完整的短句。
放在数值出现的那一句里面,不要放在页脚,不要放在另一段。
模型摘取时是按段落取的,跨段的限定条件会被丢掉。
写成十四天这三个字的前后紧挨着国家名,才有可能一起被摘走。
这条要求听起来简单,实际执行时最大的阻力来自文案:加了限定条件的句子读起来啰嗦,会被改回去。解决办法是把它写进内容规范并说明原因,否则每次改版都会被优化掉一次。可以给文案一个替代方案:用一个短表格代替长句子,表格的行是国家、列是期限,同样能被完整摘取,读起来还更清爽。把旧内容改造成AI可信来源那篇给的改写清单里,这一项值得单独列出来。
数值本身的写法也影响能不能被正确摘取。日期、金额、期限这些量在不同地区有不同的书写惯例,Unicode地区数据标记语言规范把这些格式按地区做了完整定义。正文里按当地惯例写,机器字段里按标准格式写,两边都齐了,摘取时才不会因为格式歧义而取错数量级。
条件句在不同语序里的位置
这里有一个语言层的坑。
限定条件在中文和英语里习惯放句首或句尾。
德语这类框型结构的语言,主要动词会被甩到从句末尾。
日语和韩语的谓语与否定成分都压在句子最后。
如果答案被截断,这些语言里被砍掉的恰好是最关键的成分。
所以同一条限定条件,在不同语言里该放的位置并不相同。
可靠的做法是让本地文案在保证语义完整的前提下把限定条件尽量前置,并且用一个完整的短句承载它,不要写成从句。短句无论怎么截断都能保住主干,从句一截就废。这条经验跟一段话能不能被摘去当答案跟这门语言把谓语放在哪儿有关那篇的首句自足性检查是同一套方法,只是这次要检查的不是首句,是带限定条件的那一句。
语序这件事有现成的类型学数据可查。世界语言结构地图集里的基本语序分布把各语言按主谓宾的排列方式分了类,你只要查一下目标语言落在哪一类,就知道截断风险高不高。谓语在后的语言要格外小心,那类语言里句子的后三分之一往往承载着成立与否的关键成分。
伪分歧为什么最容易越积越多?
多语言站的更新永远不同步
先讲成因。
内容改动总是从主语言开始。
改完之后其余语言进翻译队列,队列有排期。
紧急的插队,不紧急的往后放,往后放的经常就没了下文。
一次两次不明显,三年下来次要语言能落后几十处。
而这些落后处平时完全看不见,因为没人会把两种语言的页面并排读。
过去这种落后只影响那些直接访问该语言页面的用户,规模有限;现在它会被模型当成有效来源检索出来,影响面扩大了不止一个数量级。换句话说,多语言站的版本债在这一层被重新定价了,以前的低息负债变成了高息负债。这是这两年多语言运营里最值得重新算的一笔账,而多数团队还没意识到利率变了。
谁负责第二语言的版本对齐
组织问题往往比技术问题难。
主语言的内容有明确的负责人。
翻译有供应商或者本地团队。
但版本对齐这件事通常没有人负责。
它不属于内容团队,因为内容已经交付;也不属于翻译方,因为没人下单。
结果是它落在缝里,谁都不管,直到出事。
解法不复杂但需要有人拍板:把版本对齐做成一个定期任务,绑在内容团队的交付定义里。具体说就是主语言内容改动的工单,只有在所有目标语言同步完成之后才算关闭。这个改动会让工单关闭得慢一些,看起来效率下降,实际是把隐性负债显性化了。愿不愿意接受这个显性化,基本决定了这个问题能不能解决。
还有一个更轻的过渡方案:不改工单流程,只加一条发布前的检查项。主语言内容发布时,系统自动在其余语言的对应页面上打一个待复核标记,标记不清除不影响上线,但会出现在每周的清单里。这个做法阻力小得多,因为它不卡任何人的交付,只是把欠账记在明面上。
三个能自动发现落后版本的信号
给三个不用人工比对的办法。
第一个是页面最后修改时间的跨语言差值,差得越久越可疑。
第二个是关键数值的跨语言比对,也就是前面那张矩阵。
第三个是页面长度的跨语言比值,长度突然偏离历史比值说明有一侧改过。
三个信号都很粗糙,但都能自动跑。
它们的作用不是判定,是把人的注意力引到该看的那几页上。
第三个信号最容易被忽略,可它对那种只加了一段话的改动特别敏感,而只加一段话恰恰是最常见的政策更新形态。建立这个信号需要先攒几个月的历史比值当基准,所以越早开始越好。三个信号一起跑,覆盖面能到八九成,剩下的靠季度矩阵兜底,这套组合在成本和效果之间比较平衡。
三个信号之外还可以加一个更直接的:给关键数值加上统一的标记,让它们在页面源码里可以被程序精确定位。这样跨语言比对就不再依赖文本解析,而是直接读结构化的字段。改造成本视系统而定,但一旦做完,前面那三个粗糙信号可以全部退休,误报率也会降到接近零。
幻觉分歧不是你的错,为什么还要你来修?
池子空着的时候模型必须填
先说清楚责任归属。
某门语言里没有关于你这个品类的本地内容。
用户问了一个具体问题,系统必须返回点什么。
返回不知道在产品体验上是不可接受的,所以它会尽量给答案。
给不出有据可依的答案时,它会用别的语言的事实来近似。
近似的结果有时对,有时错,而错的时候没有任何标记。
这个机制不是缺陷,是产品设计上的取舍,而且这个取舍短期内不会变,因为返回不知道的体验代价太高。指望它自己变好,等于指望产品团队接受一个更差的体验指标。所以对做内容的人来说,正确的心态是把它当成一个稳定存在的环境条件,然后问一句:在这个条件下,我能改变的是什么。答案是池子里的东西,那是唯一在你手上的变量。
你放进去的第一条本地来源
这是这一类里最划算的动作。
池子空的时候,第一条进去的内容影响力极大。
它不是众多候选中的一个,它可能是唯一一个。
一篇写清楚本地规则的页面,能直接改掉那门语言下的答案。
投入是一篇内容,产出是一个市场的答案正确性。
这个杠杆比在拥挤语言里做同样的事高出一两个数量级。
而且这类内容不需要写得多华丽,它需要的是把具体数值、适用条件、生效日期写清楚,格式规整到能被机器读懂。信息密度比文采重要得多。小语种问答长尾那篇算过这笔供给侧的账,这里可以再加一条:在幻觉分歧高发的字段上做内容,收益比在普通话题上做内容高,因为你不只是多了一个候选,你是在替换掉一个错误答案。
写这类内容还有一个容易被忽略的收益:它同时是你自己团队的事实来源。多语言站里经常出现的情况是没人说得清某个市场的规则到底是什么,各处写法不一是因为源头就没有唯一版本。写一篇本地语言的规则说明,等于顺手把内部口径也统一了,这份收益跟外部曝光无关,但它才是版本漂移的根治办法。
跟低资源语言幻觉那一层的分工
把两篇的边界划清。
幻觉率那一篇讲的是模型在低资源语言下整体的编造倾向。
它关心的是这门语言下所有内容的可靠性。
本篇关心的是同一件事在多门语言下的一致性。
前者是纵向的,看一门语言深不深;后者是横向的,看多门语言齐不齐。
两者会在同一批数据里同时出现,但要分开处理。
操作上的区别是:纵向问题靠提升那门语言的整体内容质量解决,横向问题靠比对和对齐解决,后者不需要你成为那门语言的专家。这一点很重要,因为它意味着横向这套活儿可以由不懂那门语言的人来做,只要有矩阵和规则。能不能由不懂语言的人来做,直接决定了这件事能不能在你的团队里规模化。
哪些事实字段必须逐语言核,哪些不用?
可判定字段与不可判定字段
先划一条线。
可判定字段是那些有唯一正确答案的:天数、金额、年限、编号。
不可判定字段是那些本来就见仁见智的:好不好用、适不适合新手。
矩阵只处理可判定字段,不可判定的不进表。
原因很实际:不可判定字段没法自动比对,进表只会制造噪声。
而且它们出错的后果通常也小得多。
划这条线的标准可以简化成一句话:如果两个人拿着同一份资料会得出同一个值,它就是可判定的。按这个标准过一遍,你会发现真正需要跨语言核对的字段比想象中少,通常一个品类下二三十个就到头了。数量少是好事,它让这件事从一个无边界的质检工作,变成了一张有限的清单。有限的清单才有可能被真正执行。
还有一类介于两者之间的字段值得单独说:那些有唯一答案但答案会随时间变的,比如某项认证的有效期、某个促销的截止日。它们是可判定的,但判定结果有保质期。建议进表但单独标记,比对时不看值是否一致,只看是否已经过期,两种检查的逻辑完全不同。
必核清单:期限、金额、资质、安全
给一份可以直接抄的清单。
期限类:退货期、保修期、配送时效、订单取消窗口。
金额类:运费门槛、关税与增值税口径、退货运费由谁承担。
资质类:认证编号、许可证、适用标准的版本号。
安全类:使用限制、年龄限制、材料与成分的合规声明。
这四类的共同点是错了会引发投诉、退款甚至监管问询。
四类里资质类最容易被漏掉,因为它看起来最静态,一旦标注就没人再看。可标准是会改版的,认证是会过期的,而过期的认证编号在答案里被引用出来,比没有编号更糟。建议给资质类字段单独加一个有效期列,到期前自动提醒。这一项跟AI投毒那篇讲的防御思路相通:你自己发出去的过期信息,效果跟被别人投毒差不多。
四类之外还有一类值得加进去:跟人身安全或者健康相关的说明,哪怕它不属于强制合规范畴。这类内容一旦在某门语言里被说错,后果不是退款能解决的,而且它往往是模型最爱自由发挥的地方,因为公开资料里同类表述很多、口径又不统一。宁可把清单加长两行,也别在这一类上留空白。
可以只维护一份的字段
反过来说哪些不用逐语言核。
物理属性:尺寸、重量、材质、功率。
技术参数:接口类型、协议版本、兼容型号。
这些跨国一致,一份数据多语言复用完全没问题。
唯一要注意的是单位换算和数字格式,那属于呈现层不属于事实层。
把这批字段从必核清单里剔出去,工作量能减掉一大半。
要小心的是那些看着像物理属性、实际带着地区限制的字段,电源电压是最典型的一个。同一款音箱在欧洲市场是二百三十伏、在北美是一百二十伏,参数表上它长得跟别的物理参数一模一样,可它是随市场变的。这类混进物理属性堆里的地区相关字段,是必核清单里最常见的漏网之鱼,整理清单时值得专门找一遍。
单位与格式虽然属于呈现层,但它出错的后果一点不轻。Unicode地区数据规范里定义的小数点与千位分隔符在欧洲和北美是相反的,同一串数字在两种惯例下相差一千倍。这类错误在人工阅读时很容易发现,在机器摘取时反而容易被原样搬运,所以呈现层的规范化不能省。
乐器与音响这类品类的特殊项
拿保哥今年接触的一个做乐器与音响配件的客户举例。
他们的必核清单里有两项是别的品类没有的。
一项是电源电压与插头制式,跨市场必须分别标。
另一项是特定木材的进出口管制,涉及濒危物种公约的品种需要证明文件。
第二项在不同国家的执行细节不同,答案给错会直接导致清关失败。
他们第一次跑矩阵时,这一项在三门语言下给出了三个互相矛盾的说法。
三个说法里一个是对的、一个引用了已经修订过的旧版本、还有一个完全找不到来源,正好三类各占一个,是这套分类法最干净的一次实证。处理方式也完全不同:真分歧那一条加了国家限定,伪分歧那一条更新了德语页面,幻觉分歧那一条则是新写了一篇本地语言的说明。三个动作分属三个人,花了三周,之后那一项再没出过问题。
这个客户后来还加了第三项:不同市场对特定电池与电子元件的运输限制。带锂电池的无线设备在跨境寄送时各国规则不同,这一项在他们的答案里也曾经给出过互相矛盾的说法。共同点是这三项都不是产品本身的属性,而是产品跨过某条边界时才产生的属性,这类字段最容易在参数表里被当成静态数据处理。
报给老板的时候怎么讲才不会拿到错指令?
一个数字会引出统一口径
再把汇报这一环说透。
报一条不一致率,管理者的第一反应是把它降下去。
降它最快的办法就是统一口径。
而统一口径会伤害真分歧那一类。
所以这个指令是指标形态直接诱导出来的,不是管理者的判断失误。
换句话说,是你的报表设计出的这个错。
这一条可以推广到所有跨部门汇报:当一个指标只有一种降低方式,而那种方式有害时,问题出在指标不在人。检查办法很简单——自己想三种能让这个数字变好看的做法,如果其中有一种是有害的而且是最省事的,那这个指标就不能用。这个自检花五分钟,能挡下大半年的返工。
三个数字会引出三种动作
正确的形态在这里。
把不一致拆成真分歧、伪分歧、幻觉分歧三行。
真分歧那一行报的不是数量,是有多少条已经加了适用范围。
伪分歧那一行报的是版本落后的页面数和平均落后天数。
幻觉分歧那一行报的是有多少个字段在某门语言下完全没有本地来源。
三行三个动作,各自有明确的负责人和明确的完成定义。
关键在于真分歧那一行的数字应该越大越好,因为它统计的是覆盖度而不是缺陷数,这一点必须在报表上写清楚。不写清楚的话,读表的人会本能地希望所有数字都往下走,于是又绕回了统一口径。指标的方向性在跨部门汇报里是最容易被误读的一件事,宁可在表头上多写一行说明,也别指望大家默认理解。
三行之外建议再加一行趋势:本季度新出现的不一致条数减去本季度解决的条数。这个净值是正的说明欠账在扩大,是负的说明在收敛。管理者对存量数字往往不敏感,对方向却很敏感,一个持续为正的净值比任何绝对数字都更能推动资源投入。
汇报模板与责任边界
给一个可以照抄的结构。
第一屏:三行分类计数,各自配一句这行代表什么。
第二屏:按语言展开,看哪几门语言问题集中。
第三屏:本季度处理了哪些,剩下哪些,卡在谁那里。
三屏之外的所有明细放附件,不进正文。
责任边界写在第三屏,具体到人不到部门。
另外建议在模板里固定一句话:这套数据不能回答用户是否因此产生了投诉,那需要另一套客服侧的数据来对照。把边界写在明面上,可以避免这份报表被拿去解释它解释不了的事情。跨语言事实一致性是一个内容质量指标,不是一个业务结果指标,两者之间隔着相当长的链路。这一点前一篇讲监控时也强调过,在这里同样成立。
这套做法在什么情况下不值得做
什么时候可以先不做
坦白讲它不是所有人都需要。
只做一个国家、一门语言的站,完全不需要。
两门语言且都在同一个法域内的,收益也有限。
品类本身没有可判定字段的,比如纯内容型站点,做了也没什么可比的。
真正需要的是三门以上语言、跨多个法域、且商品带期限与合规属性的。
这个条件筛下来,多数跨境电商和独立站是符合的,纯内容站多半不符合。
还有一种情况是你还在很早期,内容量本身就不够,这时候更该做的是先把主力语言的内容写扎实。矩阵检查的是一致性,而一致性只有在有东西可比的时候才有意义。三门语言各只有五个页面,比出来的不一致更多反映的是覆盖不全而不是版本漂移。先积累再对齐,顺序反了会浪费很多力气。
会失效的两种情形
最后说两种边界。
第一种是你的商品信息本身在各市场就没有统一的真值。
比如价格随促销实时变动,那这个字段不适合进矩阵。
矩阵要的是相对稳定的事实,高频变动的字段用别的机制管。
第二种是那门语言的答案压根没有引用你,全部来自第三方。
这时候你能改的只有第三方页面上的信息,路径完全不同。
第二种情形其实很常见,尤其在你还没进入某个市场的时候,那里关于你的一切说法都来自评测站、论坛和竞品对比页。处理它需要的是站外内容治理那一套,跟本篇讲的站内对齐是两条线。判断自己落在哪条线上,看矩阵里来源那一列有多少指向你自己的域名——低于一半,就该先做站外那条线。
常见问题解答
三类分歧里,哪一类最该优先处理?
按风险排是幻觉分歧优先,按成本效益排是伪分歧优先。幻觉分歧给出的是完全编造的具体数值,一旦涉及期限或者合规,后果最重;但它的修法是新写本地内容,周期长。伪分歧只需要更新已有页面,一两周就能清一批,而且清完立竿见影。实际排期建议两条并行:伪分歧当季清完,幻觉分歧按市场重要性排队慢慢补,真分歧那一类作为内容规范嵌进日常流程。
没有本地母语者,这套矩阵还能跑吗?
能跑大部分。填表、比对、三条判别规则都不需要懂那门语言,因为比的是数值不是文本。需要母语者的只有两个环节:本地化重写测试问题,以及处理判别规则覆盖不了的待定项。前者一门语言一小时,后者一门语言每季度半小时,找兼职或者当地合作方都能解决。这也是横向一致性检查比纵向质量提升更容易规模化的原因。
真分歧那一类加了限定条件,会不会影响可读性和转化?
会有轻微影响,但可以设计。最省事的形态是用一张小表格代替长句子,行是国家、列是期限,既完整又清爽,还比长句更容易被完整摘取。要避免的是把限定条件塞进括号或者脚注,那两个位置在摘取时被丢掉的概率最高。至于转化,实测下来把适用范围写清楚通常不降反升,因为跨境用户对规则不清晰这件事本来就很敏感。
矩阵里的值应该从答案里取还是从自己的页面上取?
两边都要取,而且要分成两列。从答案里取的是外界看到的版本,从自己页面上取的是你以为的版本,两者的差值本身就是一个重要信号。只取答案,你不知道是自己写错了还是被误读了;只取页面,你不知道外界到底看到了什么。两列并排,问题的定位速度会快很多,多加一列的成本几乎为零。
如果两个市场的规则确实不同,但用户是同一批人怎么办?
这种情况在跨境场景里不少见,比如住在一国、下单寄往另一国。处理办法是把限定条件从国家改成更准确的触发条件,通常是收货地址所在国或者下单时的配送目的地。写成收货地址在某国的订单适用某规则,比写成某国用户准确得多,也更容易被模型正确摘取。这一改还顺带解决了语言与国家不重合带来的一部分问题。
模型换代之后,之前跑出来的矩阵还作数吗?
结论作数,具体数值要重跑。三类分歧的分类框架跟模型无关,它反映的是现实世界和你自己内容的状态。但每一格的值来自当次生成,换代之后可能全变,所以模型有大版本更新时建议加跑一次。好消息是重跑的边际成本很低,流程和规则都是现成的,主要开销是抓取时间。这跟可见度类指标不同,那一类换代之后连基线都要重算。
这套东西跟传统的多语言内容质检有什么区别?
传统质检检查的是每一份内容自身对不对、通不通顺,是纵向的、逐份的。这套矩阵检查的是多份内容之间一不一致,是横向的、成组的。两者抓到的问题几乎不重叠:一份翻译得很漂亮、语法完美的页面,完全可能带着一个三年前的数值。质检那一关它能过,横向比对这一关它过不了。所以这套东西不是替代质检,是在质检之外补一个维度。
权威参考资料
本文标题:《同一个问题问十种语言给出十个结论,先别急着统一口径,其中一类改了就是改错》
本文链接:https://zhangwenbao.com/multilingual-ai-answer-divergence-three-types-fact-matrix.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0