机器翻译发上线省下的那道审校,最后是拿收录和排名分期还的

机器翻译发上线省下的那道审校,最后是拿收录和排名分期还的
张文保 更新 36 分钟阅读 1,660 阅读
本文目录
  1. 指南禁的到底是机器翻译,还是少了那道工序?
  2. 那句话的重心落在没有人工审校这半句上
  3. 读成用了就违规会带来什么后果
  4. 留下审校痕迹为什么是唯一能自证的方式
  5. 机器翻译在屈折语上第一步就会错在哪?
  6. 短语在句子里对,摘出来当标题就错
  7. 格与数的形态被译文随机挑了一种
  8. 性数一致会让形容词跟着错一片
  9. 屈折语的错误为什么在标题位置最致命
  10. 术语一致性漂移怎么变成关键词蚕食?
  11. 同一个属性词能被译出六种说法
  12. 六种说法变成六组互相压的页面
  13. 术语表为什么必须在翻译前就建好
  14. 语域和句式失控会损失什么?
  15. 祈使句被译成正式书面语
  16. 按钮文案不像按钮
  17. 有些语言的祈使句还分性别形式
  18. 数字、单位和日期为什么最容易被漏检?
  19. 小数点与千分位的两套习惯
  20. 日期顺序与月份名的本地化
  21. 格式错会连带打坏结构化数据
  22. 编码层的问题机翻会不会带进来?
  23. 变音符号的两种规范化形式
  24. 复合词该粘的没粘、该断的断了
  25. 品牌名和型号被当普通词翻掉
  26. 质量红线该用什么指标定,不该用什么?
  27. 自动评分是给系统比对用的,不是给单页放行用的
  28. 形态丰富的语言用字符级指标更敏感
  29. 术语命中率是可执行的第一道闸
  30. 关键词命中率是搜索这一侧独有的那道闸
  31. 四档处理策略怎么按页面类型分?
  32. 两个轴决定档位:要不要排名、错了会不会出事
  33. 四档各自的操作定义
  34. 抽检比例与放行门槛怎么定
  35. 后果链具体是怎么一环扣一环的?
  36. 从术语漂移到内部蚕食
  37. 从语域错到品牌层信号
  38. 从模板加机翻到目标语内部近重复
  39. 最容易被忽略的那一条:差异化被译没了
  40. 神经机器翻译改变了什么,又没改变什么?
  41. 流畅度上去了,错得更像话
  42. 形态、术语、语域三类错一个都没解决
  43. 语料越少的语言,风险越集中
  44. 常见问题解答
  45. 用机器翻译加人工审校,算不算违规
  46. 只审校标题不审校正文,风险有多大
  47. 怎么判断某个语种的机翻质量够不够用
  48. 术语表该做多大,两百词够不够
  49. 数字和日期真的不该走翻译流程吗
  50. 模板生成的页面用机翻,还有别的办法吗
  51. 如果预算只够做一件事,该做哪一件
  52. 权威参考资料

摘要:指南里那条被引用了无数次的条款,禁的从来不是机器翻译这个工具,而是没有人工审校或整理就发布。重心在后半句。可这条规则被普遍读成用了就违规,于是团队要么偷偷用、要么彻底不用,两条路都走偏了。真正该做的是搞清楚机翻在小语种上具体坏在哪几个语言学环节,再给每个环节配一道能执行的检查。

指南禁的到底是机器翻译,还是少了那道工序?

那句话的重心落在没有人工审校这半句上

条款的原文写的是:未经人工审校或整理就发布的机器翻译文本。

这句话由两部分组成,前半句说的是工具,后半句说的是流程缺失。

被判定为问题的是两者相加,不是前半句单独成立。

换句话说,用不用机翻不是判据,用完之后有没有人管才是判据。

这个区分不是文字游戏,它直接决定了工作流该怎么设计。

读对了这半句,机翻就从一个禁忌变成了一道可管理的工序。

这条区分还能解释一个常见的困惑:为什么有些站明显用了机翻却排得很好。因为它们把机翻放在了初稿位置,后面接了完整的审校和改写,最终发布的文本已经不是机翻输出了,机翻只是把译者从零开始写降级成了改稿,这在流程上完全合规。

所以第一步该做的不是决定用不用机翻,是决定审校这道工序放在哪、由谁做、按什么标准验收。

把审校当工序还有一个管理上的好处:它能被排期、被计价、被验收。禁忌是没法管理的,工序是可以管理的。多语言内容本地化的生产线怎么搭那篇讲的就是把这类环节工程化的整套做法,本篇只补语言层的那部分细节。

读成用了就违规会带来什么后果

最直接的后果是团队开始隐藏这件事。

机翻照用,但不留记录,不进流程,不做验收。

没有记录就没有质量标准,没有标准就没人知道输出好不好。

于是一批质量分布完全未知的页面被发上线。

另一个方向的后果是过度保守,小语种市场干脆不做。

放弃一个市场的代价,比做一个中等质量版本的代价大得多。

保哥接过一个做牙科与实验室耗材的客户,团队因为怕违规,坚持所有小语种页面必须由母语译者从零写,结果两年只铺出三种语言,而竞品用机翻加审校的方式铺了十一种,等到发现差距时,那些语种的头部位置已经被占满了。

合规和产能不是对立的,把审校这道工序标准化之后,两者可以同时成立,卡住的往往是对规则的误读而不是资源。

隐藏这件事还有一个连带损害:数据断了。因为不留记录,你永远不知道哪一批页面是机翻的、哪一批是人工的,等到某个语种的表现出问题想回头查原因,连查的依据都没有。这比机翻本身的质量问题更难补救。

留下审校痕迹为什么是唯一能自证的方式

文本本身看不出它有没有被审校过。

一段机翻输出和一段经过审校的机翻输出,可能只差十几个字。

所以自证不能靠文本,只能靠过程记录。

需要记的有四项:译文版本、审校人、审校日期、改动率。

其中改动率这一项最有说服力,它是可量化的。

改动率长期偏低的语种,说明那里的审校只是走了个流程。

改动率还能当作定价依据。给审校者按改动率的区间结算,而不是按字数结算,能把激励对准质量。低改动率不一定是审校不认真,也可能是机翻本来就好,但这两种情况都需要抽检来区分,而抽检的对象正好可以按改动率排序挑出来。

这套记录一旦跑起来,还有一个附带价值:它能告诉你哪个语种的机翻质量最差,那正是最该优先换成人工翻译的语种。

审校记录还有一个用途是应对人员流动。小语种审校者的更替相当频繁,新人接手时如果能看到前任的改动记录,就知道这个语种历史上反复出错的是哪几类问题,上手速度完全不同。没有记录的项目,每换一个人都要从头踩一遍同样的坑。

机器翻译在屈折语上第一步就会错在哪?

短语在句子里对,摘出来当标题就错

机器翻译处理的单位是句子,它把整句译得通顺。

但页面上很多文本不是句子,是短语。

标题、分类名、属性值、按钮文案,全是脱离句子的片段。

屈折语里,词的形态由它在句子里的角色决定。

译文里那个词带着某个具体的格尾,因为它在原句里当了宾语。

把它摘出来单独用,形态就错了,用户搜的是另一种形态。

这类错误的隐蔽性在于它读起来一点都不别扭。母语者看到带格尾的词也认得,只会觉得措辞有点怪,不会当成错误报回来。真正暴露问题的是搜索表现报告:那个页面的核心词几乎没有展现,因为用户搜的是词典原形,而页面上写的是宾格。

处理办法是把标题、分类名、属性值这几类文本从机翻流程里单独拆出来,用词表映射而不是用翻译,词表里存的就是词典原形。

格与数的形态被译文随机挑了一种

一个名词在屈折语里能变出十几种形态。

机翻输出的是其中一种,具体哪一种取决于上下文。

同一个词在十个页面上可能出现三四种不同形态。

这三四种里只有一种是用户在搜的那个。

芬兰语的十五个格还叠加词干交替,形态数量比这更多。

匈牙利语十八个格的情况类似,机翻的随机性也更明显。

形态选择的随机性不是机翻的缺陷,是它的正常工作方式。翻译系统的目标是让整句读起来对,它没有理由知道你希望标题里出现词典原形。指望调提示词或者换模型解决这件事是走不通的,问题出在把翻译任务和选词任务混成了一件事。

波兰语七个格那篇讲的变体覆盖方法,正好是这个问题的正解:先定原形,再按需要铺变体,两件事分开做。

有个简单的自检办法能立刻看出这个问题的严重程度:把某个核心品类词在全站目标语页面上的所有写法抓出来去重。屈折语的站上这个去重结果常常有五六种形态,而其中只有一种是词典原形。这个数字比任何理论解释都直观。

性数一致会让形容词跟着错一片

很多语言的形容词要跟名词在性和数上保持一致。

名词的形态一变,前后的形容词、冠词、代词全都跟着变。

机翻在句子内部处理这件事没问题。

问题出在替换环节:模板里换掉一个名词,周围的词不会跟着改。

结果是一整批模板生成的页面,形容词全都跟名词不一致。

这类错误对母语用户来说是明显的低质量信号。

模板加机翻这个组合最容易撞上这个坑。翻译的时候模板里放的是占位符或者示例词,译者看到的是一个具体的例子,译出来的搭配只对那一个例子成立,等到批量替换成两千个不同的商品名,一致性全线崩掉。这也是模板类页面必须在替换之后再抽检的原因。

规避办法是让模板的槽位周围避开需要一致的成分,或者干脆按性别分几套模板,后者更笨但更可靠。

屈折语的错误为什么在标题位置最致命

标题是搜索结果里最主要的匹配对象和展示文本。

标题里的词形态错了,等于核心关键词没写上去。

正文里同样的错误影响小得多,因为正文有大量的近似表达。

所以有限的审校资源应该优先投在标题和分类名上。

这两处的字数占全站文本的比例极低,杠杆却最高。

把审校范围按位置的杠杆排序,比按页面重要性排序更有效。

这条判据在东南亚三国的语言层横向对比里也用过一次,那边是因为审校人才稀缺不得不收窄范围,这边是因为机翻的错误集中在特定位置所以主动收窄,出发点不同但落点一致。

先把全站的标题和分类名过一遍,再考虑正文,这个顺序在任何形态复杂的语言上都成立。

标题这一处还有一个附带的好处:它的错误可以被自动发现。把标题里的核心词跟关键词表的原形做字符串比对,不匹配的挑出来人工看,这个检查不需要懂目标语言就能跑。正文里的错误就没有这种便利,只能靠人读。

术语一致性漂移怎么变成关键词蚕食?

同一个属性词能被译出六种说法

机器翻译不保证同一个词每次都译成同一个词。

上下文不同,输出的措辞就可能不同。

一个属性词在两千个商品页上出现,可能有五六种译法。

这几种译法都不算错,只是不一致。

不一致在自然语言里无所谓,在关键词体系里是硬伤。

因为每一种译法都在争抢同一批用户的同一个查询意图。

术语漂移在同一批次的翻译里就会发生,不需要等到跨批次。同一天送出去的一千个商品描述,因为分成了几个文件、上下文各不相同,回来的译文里那个核心属性词就已经有三种说法了,这跟译者是人还是机器无关,跟有没有术语表有关。

所以术语表不是给译者看的参考资料,是给流程用的强制约束,它必须在翻译之前存在,而不是翻译之后拿来核对。

六种说法变成六组互相压的页面

每一种译法都会被写进对应那批页面的标题和正文。

于是同一个意图被分散到六组页面上。

搜索引擎要在这六组里挑一个来展示。

它挑哪个不由你决定,而且可能反复换。

这是标准的关键词蚕食形态,只不过起因是翻译而不是选题。

关键词蚕食的确认和处置那套方法可以直接拿来用。

由翻译引起的蚕食比由选题引起的更难诊断。选题重复的时候,两个页面的主题肉眼可见地重合;术语漂移引起的重复,页面看起来各写各的商品,只有把标题里的属性词抽出来做词频统计才能看出来同一个概念有六个名字。

诊断方法是把全站标题里的属性词抽出来聚类,同一个概念对应多个词的,就是漂移点,这个检查一年做一次就够,但必须做。

蚕食的代价还不只是排名不稳。六组页面把内链权重也分散了,每一组拿到的都不够,本来集中在一页上能进前十的主题,分散之后六页全在二三页徘徊。这一层损失在报表上看不出来,因为每一页都有一点流量,加起来的总量也不算难看。

术语表为什么必须在翻译前就建好

翻译之后再统一术语,等于把所有页面重写一遍。

翻译之前建好,成本只是整理一份两百词的表格。

这份表格的内容包括源词、目标语标准译法、禁用的近义译法。

禁用列这一项最容易被省掉,也最有用。

因为漂移往往漂到那几个特定的近义词上,把它们列出来就能挡住。

表格建好之后,机翻输出可以自动检查命中率,不需要人工逐条看。

早年拿词典逐词换关键词留下的长期损失那篇讲的是同一件事的另一个版本:那时候的问题是译得不像当地说法,现在的问题是译得不一致,两者的根治办法都是先建词表再动手。

术语表的建立成本一次性投入,收益覆盖后面所有批次,这是整条流程里投入产出比最高的一项。

语域和句式失控会损失什么?

祈使句被译成正式书面语

电商页面上有大量祈使句:加入购物车、立即购买、查看详情。

这些短句在英语里语气中性,在很多语言里必须选一个正式度。

机翻默认倾向选较正式的那一种。

结果是按钮文案读起来像公文,跟界面的语气完全不搭。

用户不会因为这个投诉,但会因为这个觉得站不专业。

这类损失落在转化率上,不落在排名上,但两者最终会连起来。

正式度这件事的麻烦在于没有正确答案,只有市场惯例。同一句加入购物车,在德语市场偏正式是对的,在印尼市场偏正式就显得生硬。这只能靠看当地主流电商站的实际写法来定,看三五家就能得出结论,比讨论语法规则有效得多。

把界面文案和商品文案分成两套语域规范,界面那套一次性定好由母语者写死,商品那套才走翻译流程。

语域这件事在小语种上还多一层麻烦:你很难判断母语审校者给的意见代表的是市场惯例还是个人偏好。两个审校者对同一句按钮文案给出相反建议是常见的。破解办法是拿当地主流电商站的实际写法当仲裁依据,讨论就从谁对谁错变成了惯例是什么。

按钮文案不像按钮

按钮文案有长度限制,机翻不管这个。

译出来的短语可能比原文长一倍,界面直接被撑坏。

有些语言表达同一个动作天然更长,这不是翻译质量问题。

处理方式是给界面文案单独设长度上限,超了就重写不重译。

重写的人需要知道这个按钮在界面上占多宽,译者通常不知道。

所以界面文案这一类应该整块交给本地化人员,不走翻译流水线。

被撑坏的界面比语法错误更伤,因为它在每一个页面上都出现,而且用手机的用户看得最清楚。这类问题在验收环节最容易漏掉,因为验收通常看的是文本文件而不是渲染后的页面,而文本文件里看不出长度会不会溢出。

验收环节必须包含真机截图,尤其是窄屏,这一条在任何多语言项目里都值得写进流程。

有些语言的祈使句还分性别形式

希伯来语和阿拉伯语的动词祈使形式区分男女。

你不知道点按钮的人是谁,所以两种形式都不合适。

机翻会挑一种,通常是阳性形式。

结果是一半用户看到的界面文案在语法上不是对他们说的。

希伯来语的无元音书写与词根三辅音那篇给过这个问题的解法。

解法是把祈使句改写成动作名词,绕开性别形式的选择。

这个坑说明了机翻的一个根本局限:它只能在语法上做选择,不能在业务上做选择。改写成动作名词是个业务决策,需要知道这个按钮会被两类用户看到,而这个信息不在待译文本里。凡是需要业务上下文才能决定的措辞,都不该交给翻译环节。

把这类需要业务判断的文案清单列出来,通常不超过五十条,一次性处理干净能省掉后面无数次返工。

性别形式这一类还有它的同类:敬语层级、单复数称呼、以及第二人称的正式与非正式形式。这几样都属于必须知道用户是谁才能选对的东西,而这个信息永远不在待译文本里。凡是遇到这种情况,正确的动作都是改写句式绕过选择,而不是替系统猜一个。

数字、单位和日期为什么最容易被漏检?

小数点与千分位的两套习惯

一部分语言用逗号做小数点,用点或空格做千分位。

机翻处理正文里的数字有时会转换,有时不会。

不确定性本身就是问题,因为你没法靠抽检覆盖。

价格数字转换错了,用户读到的是差一千倍的价格。

正文里的规格数字转换错了,用户会买错型号。

这类错误在耗材、器械、零配件这些品类里后果最严重。

正解是数字根本不该进翻译流程。价格、规格、尺寸这些数值应该从结构化字段里取,按目标语的区域设置格式化输出,而不是作为文本的一部分被翻译。这样格式化规则集中在一处,改一次全站生效,也不存在被翻译环节改坏的可能。

检查方法很简单:随机抽二十个页面,把页面上的数字跟数据库里的原始值对一遍,对不上的就是流程里有环节在改数字。

日期顺序与月份名的本地化

日期的顺序、分隔符、月份名的写法各语言都不同。

有些语言的月份名首字母不大写,前端库经常给它大写了。

有些语言的日期里月份要用属格形式。

机翻遇到日期字符串多半原样留下,因为它看起来不像自然语言。

于是页面上留着源语言的日期格式,用户读起来要换算。

促销页、物流时效、保质期这几类内容受影响最直接。

日期这件事还有一层容易漏的:星期名的起点。有些语言里星期名是按序数命名的而且起点是周日,第二天这个词对应的是周一,直接按数字对应会全部错开一天。物流时效的表述里一旦出现星期名,这个错就会传导到用户对到货时间的预期上。

日期和星期一律走区域设置输出,不走文本翻译,这跟数字是同一条原则。

日期本地化还有一处极易漏掉的位置:结构化数据以外的那些人写的日期。促销文案里写的截止日期、物流说明里写的工作日范围、售后条款里写的期限,这些都是文本,不走字段,机翻会照原样搬过去。这几处要单独列进检查清单。

格式错会连带打坏结构化数据

结构化数据里的价格、货币、日期字段有格式要求。

格式不合要求的字段会被校验器判为错误。

严重的错误会让整个结构化数据块失效。

失效的直接后果是富媒体展现拿不到。

这条损失是可见的,也是最容易被归因到别处的。

因为团队通常不会想到是翻译流程改坏了结构化数据。

排查这个问题有个快捷方式:把结构化数据的校验错误按语言分组统计。如果错误集中在某几种语言上,而那几种语言正好是走机翻的,问题基本就定位了。如果各语言均匀分布,那才是模板本身的问题。

结构化数据的生成也应该独立于翻译流程,从字段直接输出,永远别让它经过任何翻译环节。

结构化数据这条线还有个更早的暴露点:那些校验错误其实在上线当天就存在了,只是没人看。把校验器接进发布流程,让它在页面上线前跑一遍,能把这类问题拦在源头。这个改动的成本很低,但它把一类事后排查变成了事前拦截。

编码层的问题机翻会不会带进来?

变音符号的两种规范化形式

带变音符号的字符在编码上有两种表示方式。

预组合的单一码位,或者基字母加上组合记号。

翻译接口返回哪一种不确定,可能跟你库里的不一致。

不一致的后果是同一个词在库里有两套字节序列。

去重去不掉,站内搜索匹配不上,统计口径也不对。

解法是在接口返回值入库前做一道统一规范化。

这个坑跟越南语那一路遇到的是同一个,只是来源不同。越南语的不一致来自用户的输入法,这里的不一致来自翻译接口,但表现完全一样:肉眼看不出差别,程序判定为两个不同的字符串。所以规范化这道工序应该设在所有文本入口上,不只是用户输入那个入口。

接口回来的文本先规范化再入库,这一行代码能省掉后面一整轮的数据清理。

复合词该粘的没粘、该断的断了

德语这类语言把多个词粘成一个长词。

机翻有时粘对了,有时输出两个分开的词。

粘不粘决定了用户能不能搜到这个页面。

德语复合词把关键词拼成一个长单词那篇讲过这个机制。

反方向的问题出在无空格语言上,该连写的地方被插了空格。

两个方向的错误都会直接改变可被检索的字符串。

复合词的对错有个特点:它不影响可读性。分写的德语复合词母语者一眼就能看懂,只是觉得写法不地道,所以审校时很容易被放过。但从检索角度看,分写和合写是两个完全不同的字符串,命中的查询集合几乎不重叠,这是纯粹的技术性损失。

复合词的处理应该靠词表而不是靠译文,把核心品类的复合词形式固定下来写进术语表的强制列。

复合词这件事在无空格语言那一侧的表现更隐蔽。越南语按音节分写的规则跟机翻的输出习惯不一定一致,同一个概念可能被译成分写两段或者合写一段,两种写法命中的查询完全不同,而母语者看两种都认得。

品牌名和型号被当普通词翻掉

品牌名如果本身是个普通词,机翻会把它当普通词处理。

型号里的字母数字组合有时会被改写或者加空格。

这两类改动都会让页面失去品牌词和型号词的匹配能力。

品牌词的搜索量通常是全站最高的那一批。

品牌名在小语种里到底该写成什么那篇讲的是主动选择写法,这里是被动被改写。

解法是在送翻译之前把品牌名和型号替换成占位符,回来再换回去。

占位符这个办法还有个附带好处:它能顺便统计出品牌名在待译文本里出现了多少次,这个数字本身就是个有用的指标。品牌名出现频次过低的页面,往往也是品牌词覆盖不足的页面,两件事可以一起处理。

不可翻译清单是每个多语言项目都该有的东西,里面至少包括品牌名、型号、专有技术名词、以及法定名称。

质量红线该用什么指标定,不该用什么?

自动评分是给系统比对用的,不是给单页放行用的

机器翻译领域有一套成熟的自动评分指标。

这些指标的设计目的是比较两个翻译系统的整体表现。

它们在语料级别上有意义,在单句级别上噪声很大。

拿一个语料级指标去判断某一页能不能发布,是用错了工具。

而且计算这类指标需要参考译文,而你要发的那页本来就没有参考译文。

所以这条路在生产环境里根本走不通,不只是不准确的问题。

这个误用相当常见,原因是这类指标名字听起来很权威,报告里写一个分数也显得专业。真正在评测机器翻译的会议上,自动指标本身还要拿人工评分去校验相关性,也就是说自动指标的可信度需要人工评分来担保,用它替代人工评分是把担保关系搞反了。

单页放行只能靠抽样人工判断,自动指标的正确用法是选系统和监控整体趋势。

还有一个更实际的理由让这条路走不通:自动指标算出来的分数没有绝对含义。三十几分是好还是坏,只有跟另一个系统在同一批数据上的分数比较才知道。拿一个孤立的分数去定放行门槛,等于拿一个没有刻度的尺子量东西。

形态丰富的语言用字符级指标更敏感

如果确实要算自动分数,指标的选择有讲究。

基于词的指标在形态丰富的语言上失灵得很快。

因为词形一变就算完全不匹配,即使意思完全对。

基于字符片段的指标对这种情况敏感得多。

屈折语和黏着语的评测都该用后者。

这个选择对判断某个语种的机翻能不能用,影响很大。

这里有个实用的推论:如果你用的是词级指标,那么屈折语的分数会系统性偏低,你可能因此错判某个语种的机翻质量太差不能用;反过来,如果分数意外地高,也要怀疑是不是测试集里的句子形态太单一。指标的选择会改变结论,不只是改变小数点后两位。

选指标这件事只需要做一次决定,但做错了会让后面所有语种的比较都失真。

术语命中率是可执行的第一道闸

术语命中率的定义很简单:术语表里的词有多少比例在译文里正确出现。

这个指标可以完全自动计算,不需要参考译文。

它直接对应一个真实的业务风险,也就是术语漂移。

阈值可以按品类定,重点品类要求更高。

低于阈值的批次直接退回,不进人工审校环节。

这道闸能挡掉相当大比例的问题批次,成本几乎为零。

命中率这个指标还能反过来优化术语表。长期命中率极低的那几个词,可能是术语表里定的译法本身不自然,翻译系统怎么都不往那个方向走,这时候该改的是术语表而不是译文。术语表也要迭代,不是定了就不动。

把这道闸做成自动化的,放在译文回来之后、人工审校之前,是整条流程里最划算的一处投入。

这道闸的实现比听起来简单:把术语表读进来,在译文里逐条做字符串查找,统计命中比例。屈折语需要多做一步,把词根形式也算命中,否则带格尾的正确写法会被判成没命中。这个脚本一两百行就够,跑一批译文只需要几秒。

关键词命中率是搜索这一侧独有的那道闸

机器翻译评测圈完全不看这个指标,因为它跟翻译质量无关。

但它对搜索表现是决定性的。

定义是:译文里有没有出现该市场真正在搜的那个词。

一段译文可以完全正确、非常通顺,同时一个关键词都没命中。

因为当地人搜的词跟词典里的标准译法不是一个词。

出海关键词本地化的翻译陷阱与人审步骤那篇讲的正是这一层。

这道闸的检查方式是拿关键词表去比对译文,看核心词的覆盖情况。跟术语命中率不同的是,这里比对的对象是用户实际在搜的词,而术语表比对的是你希望统一的说法,两份清单可能有相当大的差别,尤其是在口语词流行的市场。

两道闸都要设,术语闸管一致性,关键词闸管可被搜到,缺任何一道都会漏掉一整类问题。

四档处理策略怎么按页面类型分?

两个轴决定档位:要不要排名、错了会不会出事

第一个轴是这一页要不要承接搜索流量。

第二个轴是内容错了会不会造成实际损害。

两个轴各分高低,组合出四种情形。

高风险的一律不走机翻,不管要不要排名。

要排名且低风险的走机翻加关键字段审校。

不要排名且低风险的可以放宽,比如帮助中心的边缘条目。

把这两个轴画成表比在会上争论要不要用机翻有效得多。争论通常卡在立场上,画表之后大家发现分歧其实是对某几类页面的风险判断不一致,而那是可以查证的具体问题,不是原则问题。

表格画出来之后要落成规则写进流程文档,否则每来一批新页面又要重新讨论一遍。

四档各自的操作定义

零档是完全不用机翻,从头人工翻译并审校。

适用于规格页、合规声明、安全说明这类内容。

一档是机翻加全文母语审校,适用于主要的钱页。

二档是机翻加关键字段审校,正文只做轻度顺句。

关键字段指标题、分类名、属性值、页面描述这几项。

三档是机翻但不发布,只用于内部理解竞品和调研。

三档这一项经常被忘掉,但它是机翻最没有争议的用法。用机翻读竞品的目标语页面、读当地论坛的讨论、读用户评论,产出的是团队的理解而不是发布的内容,完全不涉及任何规则问题,而且这类用途的信息价值往往比铺页面更高。

四档的划分要写进内容排产表,让每一批页面在立项时就带着档位标签,而不是等译文回来了再讨论怎么处理。

四档之间还需要一条升降级规则。某个页面从长尾变成了钱页,档位要往上提;某个品类的机翻质量测出来比预期好,档位可以往下降一档。没有升降级规则的分档表用半年就会跟实际脱节,最后变成谁都不看的一份文档。

抽检比例与放行门槛怎么定

零档和一档不需要抽检,因为它们是全审的。

二档需要抽检,比例按品类的营收贡献排。

重点品类抽三成,中间品类抽一成,长尾抽两个点。

抽检的判据是关键字段有没有错,不是正文读起来怎么样。

抽检不合格的批次整批退回,不做局部修补。

整批退回听起来严厉,但它是唯一能让上游认真对待的机制。

抽检结果要记录成时间序列,看的是趋势而不是单次结果。某个语种的合格率连续三个批次下滑,说明上游的什么东西变了,可能是换了译者、换了机翻引擎、也可能是新品类的术语表没跟上,这三种原因的排查方向完全不同,只有连续记录才能分辨。

门槛定得低一点但严格执行,比定得高但经常破例有用,这条在任何质量流程里都成立。

后果链具体是怎么一环扣一环的?

从术语漂移到内部蚕食

术语漂移产生多种说法,多种说法分散到不同页面。

同一个意图对应多个页面,页面之间开始互相压。

搜索引擎在这几个页面之间反复切换展示对象。

排名波动被误读成算法更新的影响。

于是团队去调整跟这件事完全无关的因素。

诊断错了方向,问题会一直存在。

这条链最阴的地方是它的时间差。翻译发生在第一季度,蚕食的表现要等到页面被充分收录之后才显现,可能是第三季度,那时候没人会把排名波动跟半年前的翻译批次联系起来,排查方向自然就跑偏了。

要打断这条链,最经济的办法是在翻译环节就守住术语一致性,而不是在排名波动之后去做页面合并。

从语域错到品牌层信号

语域不对会影响用户对站点专业度的判断。

判断的结果落在停留时间、跳出、加购这些行为上。

行为数据的变化会进一步影响品牌层面的信号。

品牌力作为隐性排名信号那篇讲的机制在这里生效。

这条链比术语漂移那条更慢,也更难量化。

但它的影响面更宽,因为它作用在整个语种版本上。

更麻烦的是这条链有惯性。一旦某个语种版本给用户留下了不专业的印象,后面把文本改好了,行为数据的恢复也要滞后相当长时间,因为回访的用户带着上一次的预期。所以语域这件事的正确处理时点是上线之前,而不是数据难看之后。

钱页的语域必须由母语者定,这笔钱在整个预算里占比很小,但它决定了整个语种版本的印象基线。

语域这条链还有一个可以早期发现的信号:母语审校者的自发反馈。如果审校者在改稿之外主动写了一句这批文案读着不像本地站会写的东西,那就是语域问题的第一手报告,比等行为数据变化要早几个月。这类反馈值得单独收集起来。质量评估员手册怎么读那篇里的自查清单也能借来用。

从模板加机翻到目标语内部近重复

模板本身在源语言里是有变化的,因为槽位不同。

翻译之后,模板的固定部分在每个页面上完全一样。

如果槽位内容占比小,整页的相似度会非常高。

目标语版本的近重复程度比源语言版本严重得多。

后果是收录不完整,一部分页面进不了索引。

熊猫算法对批量低质内容的处理那篇的逻辑在这里同样适用。

这个问题在源语言里往往看不出来,因为源语言的模板经过了人工打磨,固定部分有几种变体轮换。机翻会把这几种变体译成同一种说法,多样性在翻译环节就被抹平了。检查方式是统计目标语页面之间的文本相似度,跟源语言的相似度对比,差距明显就说明多样性丢在翻译上了。

处理办法是给模板准备多套目标语的固定段落,或者干脆提高槽位内容的占比,两者都比事后合并页面便宜。

最容易被忽略的那一条:差异化被译没了

你的源语言内容跟竞品的源语言内容差别可能很大。

两边都用机翻译成同一种小语种之后,差别会显著缩小。

因为翻译系统倾向输出最常见的表达方式。

最常见的表达方式对所有人都一样。

结果是目标语市场里,你和竞品的页面文本高度相似。

你在源语言上建立的内容优势,在翻译环节被抹平了。

这一条几乎没人检查,但它可能是机翻最大的隐性代价。可以自己验一下:拿你的目标语页面和竞品的目标语页面做文本相似度对比,再拿两边的源语言页面做一次同样的对比,如果目标语那一侧的相似度明显更高,差异化就是在翻译这一步丢的。

保住差异化的唯一办法是让那些真正体现差异的段落走人工改写而不是翻译,通常整页里只有两三段属于这一类,识别出来单独处理成本可控。

神经机器翻译改变了什么,又没改变什么?

流畅度上去了,错得更像话

神经机器翻译在产品级别上线之后,译文的流畅度明显提升。

这是真实的进步,读起来的自然程度跟以前不是一个量级。

但流畅度提升带来了一个反向效果。

以前的机翻一眼能看出是机器译的,审校者会警惕。

现在的机翻读起来通顺,审校者容易一路划过去。

错误还在,只是更难被发现了,这可以叫流畅度陷阱。

这个陷阱对审校流程的设计有直接影响:审校不能只靠通读,必须配清单。通读能发现的是不通顺,而机翻现在最主要的问题恰恰不是不通顺,是形态选错、术语不一致、关键词没命中这几类清单式检查才能发现的问题。

把审校从读一遍改成过一份清单,这个改动看起来很小,实际是应对神经机翻最关键的一处流程调整。

流畅度陷阱还有一个放大器:审校者本身对目标市场的电商语境不熟。译文语法都对、读起来也顺,一个只做语言审校不懂业务的人很难判断这句话在商品页上合不合适。搜索侧的同义词理解能力虽然在不断变强,但它理解的是查询和内容的对应关系,不会替你把不合语境的文案改对。

形态、术语、语域三类错一个都没解决

流畅度改善的是句子内部的连贯性。

形态选择的问题源于任务边界,不是模型能力。

术语一致性的问题源于缺少约束,不是模型能力。

语域选择的问题源于缺少业务上下文,不是模型能力。

这三件事换任何模型都不会自动变好。

它们只能靠流程和词表解决,这一点值得反复说。

分清哪些问题会随模型进步而缓解、哪些不会,能省下大量等待的时间。可读性、语法正确性、长句处理这几类会随模型改善;而凡是需要外部信息才能做对的决策,也就是需要知道你的术语表、你的关键词表、你的界面宽度、你的用户构成的那些决策,模型再强也无从下手,因为信息不在它手上。

把机翻当成一个流畅度很好但完全不了解你业务的译者来用,预期就对了。

语料越少的语言,风险越集中

翻译质量跟训练语料的规模正相关。

小语种正好是语料最少的那一批。

所以机翻风险最高的地方,恰恰是最需要靠机翻铺量的地方。

这个矛盾没有办法绕开,只能靠分档策略缓解。

语料越少的语种,档位应该定得越严,抽检比例越高。

而不是反过来因为找不到审校者就放宽标准。

低资源语言的机翻还有一个特点:它的错误分布更极端。多数句子译得不错,少数句子错得离谱,中间态很少。这跟高资源语言的均匀小错完全不同,意味着抽检的作用更大——只要抽中一个离谱的,就说明这一批需要全查,而均匀小错的批次抽检结果反而不好判断。

把语种按语料规模排个序,档位和抽检比例都按这个序调整,比按市场大小调整合理得多。

常见问题解答

用机器翻译加人工审校,算不算违规

不算,前提是审校真的做了而且留下了记录。条款禁的是未经人工审校或整理就发布的机器翻译文本,重心在没有人工介入这一点上,不在用了机器翻译这一点上。判断自己合不合规,可以问三个问题:有没有明确的审校环节写进流程、有没有具体的人对每一批译文负责、有没有可以调出来的改动记录。三个都有就没问题。反过来,如果只是让人快速通读一遍不做任何改动就发布,那实质上跟没审校区别不大,改动率长期接近零的记录本身就是个坏信号。还有一点值得说清楚:合规是底线,不是目标。达到合规之后,内容能不能被目标市场的用户搜到、读懂、信任,那是另一套更高的要求,也是真正决定这批页面有没有价值的部分。

只审校标题不审校正文,风险有多大

比想象中小,但不能长期这么做。标题和分类名承担着关键词匹配和展示的主要功能,把审校资源集中在这里,能用最少的成本挡住最大比例的可见损失。正文的错误主要影响可读性和信任度,这两项的损失是渐进的,短期内不会导致排名问题。所以在铺量阶段,先只审校关键字段是个合理的取舍。风险主要在两处:一是正文里可能藏着规格数字、单位、日期这类错了会出事的内容,这些必须单独检查,不能因为不审正文就跳过;二是长期不审正文会让整个语种版本的质量基线一直很低,等到想往上提的时候,要改的页面量已经大到没法处理了。可行的做法是关键字段全审、正文按品类分批补审,把补审排进后续季度的计划里而不是无限推迟。

怎么判断某个语种的机翻质量够不够用

拿自己的真实文本测,别看通用评测的分数。做法是从站内挑三十段代表性文本,覆盖标题、属性描述、正文段落、界面文案四类,送去机翻,再请母语者按四个维度打分:意思对不对、术语一致不一致、语域合不合适、核心关键词有没有出现。四个维度分开打,因为它们的处理方式完全不同。测完之后你会得到一张具体的短板清单,比一个总分有用得多。常见的结果是意思和语域两项还行,术语和关键词两项很差,那说明这个语种可以用机翻打底但必须配术语表和关键词表。如果连意思都经常错,那这个语种就只能走人工翻译。这套测试成本很低,一个语种半天能测完,而它决定的是接下来可能几十万字的处理方式。

术语表该做多大,两百词够不够

起步两百词足够,但要挑对。优先收三类词:核心品类词、高频属性词、以及所有品牌相关的专有名词。这三类加起来通常一两百个,覆盖的是绝大多数页面上反复出现的那批词,也就是漂移代价最高的那批。不必一开始就求全,收得太多反而没人维护。表格结构建议四列:源词、标准译法、禁用译法、备注。禁用译法这一列最容易被省掉但作用很大,因为漂移往往固定漂向那几个近义词,把它们列出来自动检查就能挡住。后续扩充的依据是命中率检查的结果,反复出问题的词加进表里,长期没争议的词可以不管。术语表要按语种分开维护,同一个源词在不同语种的标准译法各有各的争议点,混在一张表里会很难用。

数字和日期真的不该走翻译流程吗

真的不该,而且这是整篇里最容易执行也最容易被忽略的一条。价格、规格、尺寸、日期、时间这些值都应该以结构化字段的形式存在,输出时按目标语的区域设置格式化,而不是作为文本的一部分送去翻译。这样做有三个好处:格式化规则集中在一处,改一次全站生效;不存在被翻译环节改坏的可能;结构化数据可以直接从同一批字段生成,格式天然合规。实际操作中的阻力通常来自历史遗留,早期的商品描述里把规格数字直接写在文本里了,要抽出来做成字段需要一轮数据整理。这轮整理值得做,因为它解决的不只是翻译风险,还包括筛选器能不能用、比较功能能不能做、结构化数据能不能生成这几件事,收益远超一次性成本。

模板生成的页面用机翻,还有别的办法吗

有,而且比逐页处理便宜。模板类页面的文本可以拆成三部分:完全固定的段落、按槽位变化的短语、以及纯数值字段。固定段落的数量有限,通常几十段,值得请母语者直接写而不是翻译,写好之后所有页面复用,单位成本极低。槽位短语走词表映射,把可能出现的取值列出来一次性译好并审校,也是一次性成本。纯数值字段走格式化输出。这样拆完之后,机翻在模板类页面上的用量可以降到接近于零,质量还比逐页机翻高得多。要注意的是固定段落最好准备两三套轮换,否则目标语版本的页面相似度会过高,这一点在源语言版本里通常已经处理过了,翻译时容易忘记同步。

如果预算只够做一件事,该做哪一件

建术语表,并且把它做成自动检查。理由是这一件事的杠杆最高:成本是整理一两百个词,收益覆盖后面所有批次、所有页面、所有语种。它同时解决了三个问题——术语漂移引起的内部蚕食、品牌名和型号被误译、以及复合词该粘不粘。而且它是唯一一件可以完全自动化验证的事,检查脚本写一次能长期跑,不依赖人力。如果预算能再多一点,第二件事是把数字和日期从文本里抽出来做成字段。第三件才是审校资源的投入,因为在没有术语表的情况下投审校,审校者每次都要重新判断一遍术语该用哪个说法,效率低而且结果还不一致。顺序很重要,先建约束再投人力,反过来做会浪费掉相当一部分审校预算。

权威参考资料

分享到
标签
版权声明

本文标题:《机器翻译发上线省下的那道审校,最后是拿收录和排名分期还的》

本文链接:https://zhangwenbao.com/machine-translation-direct-publish-search-risk-quality-line.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交