小语种内容找母语者审校,一句读着自然不能当成验收通过的判据

小语种内容找母语者审校,一句读着自然不能当成验收通过的判据
张文保 更新 34 分钟阅读 4,479 阅读
本文目录
  1. 母语者说读着自然,为什么不能算验收通过?
  2. 自然度是主观判断,落到验收单上什么都不是
  3. 审校员最爱改的那几个词,正好是搜索量最高的那几个
  4. 渔具站那次改稿:读顺了,词也没了
  5. 一份小语种译文到底要验哪几层?
  6. 语言正确性:拼写、语法、术语一致
  7. 检索一致性:关键词位置、词形、密度
  8. 本地惯例:数字、日期、货币、地址、称呼
  9. 页面结构:标题层级、锚文本、alt、meta也审了吗?
  10. MQM的错误类型学,搬过来还差一类
  11. MQM把错误分成哪几类,SEO要哪几类
  12. 加一类MQM里没有的:检索项被改动
  13. 每类错误配一个严重度,严重度决定放不放行
  14. 不许动的词该怎么在稿子里标出来?
  15. 术语锁定表:词形、位置、出现次数
  16. 标记方式:注释、色块,还是单独一张表
  17. 屈折语的“不许动”要写成变体集,不是写成一个词
  18. 不懂这门语言,怎么自己先验一遍?
  19. 关键词位置校验:标题、H1、首段、URL各查一次
  20. 回译比对怎么用才不被机器翻译带偏
  21. 词形变体集检查:拿词干工具跑一遍
  22. 三个方法各能抓住什么、抓不住什么
  23. 审校员怎么挑,母语者这三个字够不够?
  24. 母语者、目标市场居住者、行业从业者是三件事
  25. 五道题的试稿:能筛掉大半
  26. 长期合作比单次外包便宜在哪
  27. 审校简报写不清楚,返工的账最后记在你头上
  28. 目标读者与页面用途要写在最前面
  29. 不许动的清单与可改的边界
  30. 交付格式:改在哪、怎么标、争议怎么记
  31. 全部审一遍还是抽样审?抽多少才够?
  32. 分层抽样:按页面类型和流量价值分层
  33. 错误密度阈值怎么定
  34. 抽样不过关就退回全量,退回规则要写死
  35. 第一批全量、后面转抽样的过渡节奏
  36. 审校意见跟检索要求打架时听谁的?
  37. 三档裁决规则:位置优先于词形,词形优先于行文
  38. 哪些情况必须让步给审校员
  39. 争议记录会变成下一版的术语表
  40. 这套验收清单怎么接进现有的内容管线?
  41. 卡在哪个环节:翻译后、上线前,还是上线后
  42. 谁签字,返工算谁的
  43. 六步落地路线
  44. 常见问题解答
  45. 只有一位母语者可用,语言正确性和检索一致性都靠他行不行?
  46. 关键词表里的词在译文里怎么放都别扭,是不是必须硬塞进去?
  47. 审校员能不能顺便把meta描述和图片alt也审了?
  48. 回译比对用免费的机器翻译够不够?
  49. 词干工具对我要做的那门语言支持很差,还有别的办法吗?
  50. 抽样比例定多少才算合理?
  51. 这套流程会不会把审校员逼走?
  52. 权威参考资料

摘要:母语审校最常见的交付物是一句“读起来很自然”,而这句话在验收单上什么都不是。小语种内容真正要验的是两层:语言正确性由母语者判,检索一致性由数据判,两层的结论经常互相打架。本文给出一张按错误类型分级的验收表、一份写明“哪些词不许动”的审校简报模板、三个不懂那门语言也能自己先跑一遍的自检方法,以及抽样比例与放行阈值的定法。

母语者说读着自然,为什么不能算验收通过?

自然度是主观判断,落到验收单上什么都不是

把译文发给一位母语者,隔两天收到回复:读起来很自然,没什么问题。这句话听着让人放心,可它不是验收结论。

验收结论必须能被复述、能被追溯、能被下一个人重跑一遍。自然不自然,换一个人来读可能就换一个说法。

更麻烦的是,这句话没有回答任何一个你真正关心的问题:关键词还在不在标题里,术语前后一致没有,价格写法符不符合当地习惯。

审校员没有回答,是因为你没有问。你交给他的是一段文字,他就按读者的身份读了一遍。

他不知道这个页面是拿来接搜索流量的,也不知道标题里那个词是花了两周才选出来的。

验收清单存在的意义,就是把这些没说出口的期待,变成一条条能打勾的判据。

这里有个容易被忽略的连锁反应:当验收结论只有“自然”两个字时,返工的责任也就没法界定。译文上线三个月后发现某个核心词从来没出现在标题里,你回头去找审校记录,只能找到那句“读起来很自然”,谁也说不清是翻译漏了、审校放行了,还是需求本来就没提。这种账最后多半记在SEO这一侧,因为只有你在盯排名。

审校员最爱改的那几个词,正好是搜索量最高的那几个

母语审校有个稳定的行为模式:他们会把重复出现的词换成同义词。

在写作训练里这是对的,同一个词连着出现五次,读感确实差。但在搜索这一侧,那五次重复往往是刻意留的。

更常见的是术语替换。审校员觉得某个词太口语、太生硬、太像翻译腔,于是换成一个他更喜欢的表达。

换掉的那个词,可能正是当地用户在搜索框里真实打出来的那个。用户的输入习惯和母语者的书面审美,本来就不是一回事。

俄语这类屈折语更容易出事,因为审校员改的常常不是词本身,而是词形。他把主格换成了间接格,读起来更顺,可这个词形和你关键词表里的那一行对不上了。

词形变化在俄语关键词研究里本来就是个老问题,审校环节又给它加了一层不确定性。

保哥经手过一个卖路亚竿和渔线轮的独立站,德语站上线前请了位在慕尼黑做过多年钓具零售的母语者审稿。他把产品页里反复出现的那个品类词改成了三个不同的说法,理由是原稿读着像目录不像人话。他说得没错,可这三个说法里只有一个有真实搜索量,另外两个加起来每月不到十次。改完之后页面确实好读了,两个月后那个词的排名从第七掉到第二十四。

渔具站那次改稿:读顺了,词也没了

那次事故后来复盘,问题不在审校员,在简报。

发稿的时候只写了一句“请帮忙润色,让它读起来像本地人写的”。审校员完全按这句话执行了,执行得还很好。

没有人告诉他哪些词不能动,也没有人告诉他这个页面是靠搜索进来的。

他甚至不知道有关键词表这回事,在他的认知里,这就是一份写得有点生硬的商品介绍。

返工的成本不算高,把三处改回去、重新提交索引,两周后排名慢慢回来了。真正的成本是那两个月的流量。

从那以后,交给审校员的稿子前面一律加一页说明,写清楚这个页面要接哪些搜索词、哪几个词的哪几种形态不许动。

这件事最值得记住的一点是:审校员改坏的地方,恰恰是他专业能力最强的地方。他对语言的敏感度越高,越会去修那些重复、生硬、不地道的表达,而搜索优化留下的痕迹在他眼里正好全是这三样。你不能指望靠提高审校员的水平来避免这个冲突,只能靠事先划出边界。

一份小语种译文到底要验哪几层?

语言正确性:拼写、语法、术语一致

这一层是母语者的主场,也是唯一一层你没法替代他的。

拼写和语法不用多说,值得单独拎出来的是术语一致性:同一个部件在整站是不是用同一个词。

小语种站最容易在这里出问题,因为不同批次的翻译常常来自不同的人,而跨市场的关键词调研本来就会产出好几套并行的说法。

产品页叫一个名字,博客文章叫另一个名字,帮助中心又是第三个,用户和搜索引擎都会被绕晕。

术语一致性的检查不需要通读全文,导出全站的术语出现情况列一张表,肉眼扫一遍就能发现分叉。

这一层的验收判据可以写得很硬:术语表里的每个词,全站只允许一种主形态。

需要提醒的是,术语一致并不等于全文只能出现同一个词。屈折语里同一个术语必然会以多种词形出现,这是语法要求,不是错误。要求一致的是词干和词根那一层,不是字面串那一层——这个区别在后面讲变体集检查时还会再出现一次,它几乎是所有屈折语验收环节的分水岭。

检索一致性:关键词位置、词形、密度

这一层母语者判不了,因为它跟语言好坏无关,跟数据有关。

要查的东西很具体:核心词在不在标题里,在不在H1里,首段前一百个字符里出现没有。

还要查词形。屈折语和黏着语里,同一个词在标题里可能以主格出现,在正文里以其他格出现,这本身没问题,但主格至少要出现一次。

密度不必卡死,只要没有出现“整篇文章里核心词一次都没有”这种极端情况就行。

这些检查全都可以脚本化,不需要懂这门语言,只要有一张关键词表和一份译文。

把它做成上线前的自动检查,比请第二位母语者复审便宜得多,也稳定得多。

检索一致性检查的另一个价值是它能反过来暴露关键词表本身的问题。如果某个词在译文里怎么都塞不进去,读起来总是别扭,多半不是译者的问题,而是这个词根本不是当地人的说法,是从英文逐词换过来的。这时候该改的是词表不是稿子,回到关键词本地化那几个典型陷阱里对一遍就知道问题出在哪一步。

本地惯例:数字、日期、货币、地址、称呼

这一层介于两者之间,母语者能判,脚本也能判一部分。

数字的千分位和小数点,德语和英语正好相反;日期的日月顺序,欧洲大陆和美国也不一样。

货币符号放前面还是后面,中间有没有空格,各个市场的习惯都不同。

地址格式的差别更大,邮编在城市名前还是后,门牌号在街名前还是后,写反了当地用户一眼就看出这是外国站。

称呼方式也算这一层:德语要不要用敬称,俄语商品页用第几人称,直接影响信任感。

这些细节单看每一条都不致命,堆在一起就是“这个站不像本地的”,转化率会给出答案。

本地惯例这一层还有个容易被漏掉的分支:页面上给用户看的那些格式要彻底本地化,但结构化数据、表单校验、数据库里存的值必须保持国际标准格式。这两件事的方向正好相反,很多团队把它们混成一件事做,结果要么用户看到一串机器格式,要么标记里的价格和日期解析失败。

页面结构:标题层级、锚文本、alt、meta也审了吗?

大多数审校流程只审正文,这是最常见的漏洞。

meta描述、图片alt、面包屑文字、按钮文案、表单提示,这些地方的译文往往来自另一个批次,质量最不稳定。

标题层级也要看:有些译者会把H2改写得很长,长到超出一个标题该有的长度。

锚文本更值得单独查一遍,屈折语里锚文本会跟着句子变形,这个问题复杂到需要单开一篇讲。

还有一类容易漏的是图片里的文字。小语种站的横幅图常常直接沿用英文版,上面的促销语一个字都没翻。

把这些位置列成一张清单交给审校员,比让他“通读全文”有效得多。

审校范围这件事最好在报价阶段就谈清楚。按字数计费的审校,默认只算正文字数,meta和alt这些零碎文本加起来可能只有几百字,却分布在几十个位置,工作量远超字数。谈的时候按页面数计费往往更合适,双方都不会在交付的时候扯皮。

MQM的错误类型学,搬过来还差一类

MQM把错误分成哪几类,SEO要哪几类

翻译质量这件事,语言服务行业已经有了成熟的框架,不必从零发明。

其中流传最广的是MQM的错误类型学,它把译文错误分成准确性、流畅性、术语、风格、本地惯例等几个大类,每类下面再细分。

准确性管的是意思有没有传达对,漏译、误译、加译都在这一类。

流畅性管的是译文本身作为一段文字是否通顺,拼写、语法、标点都算。

术语类管的是专有名词和行业词是否符合约定,本地惯例类管的就是前面说的数字日期货币格式。

这套分类的好处是它已经把“读起来不舒服”拆成了可归档的条目,审校员报错误的时候有地方可填。

直接照搬过来做SEO验收表,能覆盖大概八成的需求,剩下两成是这套框架没有考虑的——它的设计目标是评估翻译质量,而不是评估一个页面在搜索里的表现,所以它不关心某个特定的词有没有被保留在特定的位置上。

加一类MQM里没有的:检索项被改动

缺的那一类,可以叫检索项被改动。

它跟准确性无关,也跟流畅性无关:审校员把一个词换成同义词,两个词意思一样,读感更好,语言质量甚至提高了。

可对搜索来说,这是一次实质性的改动,因为词表里那一行没有跟着变。

所以这一类错误的判据不是语言学的,是清单式的:改动的位置在不在锁定表里。

它有三个子类:核心词被替换、核心词的位置被移动、核心词的词形被改成变体集之外的形态。

把它加进错误类型表,审校员回报问题的时候就有了统一口径,你也能统计出这类改动一共发生了几次。

这一类的严重度定级要跟其他类分开考虑。语言类错误的严重度通常按“是否影响理解”来判,而检索项改动完全不影响理解,按传统标准会被判成轻微甚至不算错误。实际影响却可能是整个页面失去排名,所以它在验收表里应该单列一档,判据是二元的:动了就是不通过,没动就是通过,没有中间态。

每类错误配一个严重度,严重度决定放不放行

有了类型还不够,还得有严重度,否则拼写错一个字母和整段漏译会被记成同一件事。

常见的做法是分三档:严重、中等、轻微,各自给一个权重。

严重的定义要写具体:意思反了、价格写错了、法律相关表述有问题,这些都属于必须返工。

中等的是影响体验但不影响交易,比如某处术语不一致、某个句子拗口。

轻微的是不影响任何事的洁癖项,比如两个空格、标点风格不统一。

放行判据由严重度加权后的错误密度决定,而不是由错误总数决定

严重度的定级最好由两边共同确认一次,而不是检索这一侧单方面写死。审校员对哪类错误在当地读者眼里更刺眼是有直觉的,把这份直觉吸收进权重表,后面他报错误的时候才不会觉得这套标准是外行拍出来的。

错误类型谁来判严重度上限放行判据
准确性(漏译误译)母语者严重零严重项
流畅性(语法拼写)母语者中等密度低于阈值
术语一致母语者+脚本中等术语表零分叉
本地惯例(数字日期货币)母语者+脚本中等零严重项
风格与语气母语者轻微不卡放行
检索项被改动脚本单列零改动,二元判定

不许动的词该怎么在稿子里标出来?

术语锁定表:词形、位置、出现次数

锁定表是整套验收清单里最该先做的一张,它把“哪些词不许动”从口头约定变成文件。

每一行至少要有四个字段:词、允许的词形、必须出现的位置、最少出现次数。

词形这一列在屈折语里不能只填一个词,要填一组,后面会专门讲怎么生成这一组。

位置这一列填的是标题、H1、首段、图片alt这类槽位名,不填具体行号,因为稿子改动之后行号就废了。

次数这一列填最小值就够,不必设上限,上限交给审校员的语感去把握。

这张表同时也是交给翻译的输入,翻译和审校拿到的是同一份,两边不会打架。

锁定表的行数要克制。见过一张锁进去四十多个词的表,审校员看完直接回复说这样没法改,因为句子里几乎每个实词都被锁了。合理的量级是每个页面三到五个词,全站共用的品牌词和品类词另算。锁得越多,审校员越倾向于整体放弃修改,最后拿回来的是一份没人改过的稿子。

标记方式:注释、色块,还是单独一张表

标记方式看着是小事,实际决定了审校员会不会真的照做。

直接在正文里加高亮色块最直观,但会干扰阅读,审校员判断流畅度的时候会受影响。

用文档批注的方式标,好处是不动正文,坏处是批注多了以后视线来回跳。

单独给一张表,正文保持干净,审校员改完之后自己对照一遍,这种方式在实践中返工率最低。

如果内容管线本身就在CMS里跑,还可以在编辑器里做成锁定字段,物理上禁止修改。

不管用哪种,都要在简报第一段写清楚锁定表在哪里,别让人翻半天找不到。

还有一种低成本做法值得一提:把锁定词的清单放在译文文件的最顶端,用一段醒目的说明包起来,审校员打开文件的第一眼就能看见。听着简陋,可它的执行率比藏在共享盘另一个目录里的精美表格高出一大截。工具再好,也敌不过“打开就在眼前”。

屈折语的“不许动”要写成变体集,不是写成一个词

这一条是小语种特有的,英文站根本不会遇到。

你锁定了一个俄语名词的主格形态,审校员在句子里把它改成了间接格,这是语法要求,他没得选。

如果锁定表只写了主格,你会判他违规;如果他为了不违规而保留主格,句子就成了病句。

正确的写法是把这个词的全部合法词形列出来,作为一个集合去锁。

集合可以用词干工具生成,也可以让翻译在交稿时顺手列出来,成本都不高。

锁定的语义因此变成:这个词的任意合法形态都算通过,换成另一个词才算违规。

生成变体集有个偷懒但有效的办法:拿Snowball的词干算法把稿子和词表都跑一遍,比对词干而不是比对原词。词干相同就认为是同一个词的不同形态,词干不同就是被换了词。这个方法对词干本身也会变的芬兰语不够可靠,但对俄语德语这类词干相对稳定的语言足够用了。

不懂这门语言,怎么自己先验一遍?

关键词位置校验:标题、H1、首段、URL各查一次

这是三个方法里最简单也最该先做的一个,不需要任何语言能力。

把关键词表里的词逐个在译文的指定位置里查一遍,命中就打勾,没命中就标红。

标题和H1必须命中,首段建议命中,URL看情况,正文至少命中一次。

查的时候要注意大小写和变音符号,很多语言的字母有多套码位写法,字符串比对会漏。

做这件事的正确姿势是写个小脚本,把结果输出成一张表,每次交稿跑一遍。

它抓不住的是用词好不好,抓得住的是词有没有丢,而丢词恰恰是审校环节最常见的事故。

这个检查还有个附带好处:它会顺手抓出译者的一类习惯性失误——把标题翻译得太自由。译者写标题的时候容易发挥,尤其是原文标题本身就带修辞的时候。原文那个精心挑过的核心词,翻完之后经常就不见了,取而代之的是一个更漂亮但没人搜的说法。

回译比对怎么用才不被机器翻译带偏

回译就是把译文再翻回中文或英文,看看跟原文差多少。

它的正确用法是找差异,不是判质量。回译读着别扭不代表译文有问题,机器翻译本身就会带来失真。

要看的是意思层面的偏移:数字变了没有,否定词丢了没有,条件从句的范围有没有扩大。

这些是回译能可靠暴露的,因为它们在任何语言里都是硬信息,不依赖语感。

要避免的用法是拿回译的流畅度去质疑审校员,那会迅速毁掉合作关系。

把回译结果和原文并排放,只标出数字与否定词的差异,其余不看,效率最高。

机器翻译的质量本身也是可以量化的,业内用WMT的质量评估任务这类公开评测来横向比较不同系统的表现。你不需要读懂论文里的方法,但知道有这么一条基线有个实际用处:当你用来做回译的那个引擎在某个语向上表现本来就差,回译出来的偏差有多少是译文的、有多少是引擎的,心里得有数。这也是机器翻译能不能直接发布那条线的判断依据之一。

词形变体集检查:拿词干工具跑一遍

第三个方法专治屈折语和黏着语,是前两个方法都覆盖不到的盲区。

做法是把译文分词后逐个取词干,再跟关键词表的词干比对。

比对结果分三种:词干命中且形态在集合内、词干命中但形态在集合外、词干未命中。

第二种要人工看一眼,多半是语法需要,属于正常;第三种基本可以判定为换词。

词干工具对不同语言的支持度差别很大,俄语德语成熟,芬兰语匈牙利语这类要打折扣。

支持度不够的语言,退而求其次用前缀比对,取词的前若干个字符做粗匹配也能抓到大部分情况。

这里有个反直觉的地方:词干比对的假阳性比假阴性更值得容忍。宁可让脚本多报几个疑似换词、你再人工看一眼,也不要为了减少噪音把阈值调松。审校环节的换词一旦漏过去就直接上线了,而多看几行的成本只是几分钟。

三个方法各能抓住什么、抓不住什么

三个方法互补,谁也替代不了谁,用之前得知道各自的边界。

位置校验抓词有没有丢,抓不住词用得对不对,也抓不住句子通不通。

回译抓意思偏移,抓不住风格和语气,对成语和双关基本无效。

词形检查抓换词,抓不住整句改写,因为改写之后词干可能还在。

三个都通过的稿子,仍然可能是一份读起来很生硬的译文,语言质量还得靠人。

反过来,母语者说好的稿子,这三项也可能全挂,所以两边都要跑。

这三项自检真正的价值不在于替代人,而在于把不确定性收进一个可控的范围。跑完之后你能确定的是词没丢、意思没跑偏、没被换成同义词,剩下的模糊地带就只有语言质量这一块,正好是母语者唯一不可替代的那部分。

自检方法能抓住抓不住要什么工具
关键词位置校验核心词丢失、位置缺失用词是否地道关键词表+文本查找
回译比对数字、否定、范围偏移风格语气、修辞任一机器翻译引擎
词形变体集检查同义词替换、词干改动整句改写词干算法或前缀匹配

审校员怎么挑,母语者这三个字够不够?

母语者、目标市场居住者、行业从业者是三件事

招审校员的时候,“母语者”这三个字被当成了唯一门槛,这是个很粗的筛子。

一个在国外生活了十五年的母语者,母语能力没问题,但他对当地当下的说法可能已经脱节。

用词是会变的,尤其是电商品类词和网络用语,五年不在当地就足以掉队。

行业熟悉度是第三个维度。钓具、母婴、工业耗材,每个行业都有一套外人不用的词。

三个维度都满足的人不好找,也不便宜,所以要按页面类型分配:产品页优先给懂行的,博客文章可以放宽。

如果只能满足两个,优先保住“在当地生活”和“懂这个行业”,纯语言能力可以靠工具补一部分。

三个维度的优先级还跟品类有关。标准化程度高的品类,行业词就那么几十个,术语表补得住,权重可以给到在当地生活这一项;参数复杂的工业品或者医疗相关品类反过来,行业熟悉度要往上提,因为一个参数词译错的代价远大于读感生硬。

维度缺了会怎样能不能靠工具补
母语能力语法拼写出错、读感生硬部分可补(拼写检查)
在目标市场生活用词过时、不知当下说法难补
熟悉这个行业专业词乱译、参数写错可用术语表部分补

五道题的试稿:能筛掉大半

面试聊不出什么,发一份试稿最有效,而且不必长,五道题就够。

第一题给一段带明显术语错误的译文,看他能不能挑出来。

第二题给一段读着顺但漏了一个否定词的译文,测的是他会不会对着原文核。

第三题给一句锁定了核心词的句子,看他会不会去改那个词,这一题筛掉的人最多。

第四题给一段数字日期格式全按英文写法的文本,看他有没有本地惯例的敏感度。

第五题直接问:如果你觉得某个不许动的词很别扭,你会怎么处理?答“直接改掉”的直接淘汰,答“改周围的句子让它自然”的就是要找的人。

第五题的答案分布很能说明问题。大部分候选人会说“我会先改了再跟你说”,少数会说“我会在批注里提出来但不动”,极少数会说“我会改周围的句子让这个词嵌得自然一些”。第三种人最难得,因为他已经理解了约束的存在意义,而不只是服从约束。

长期合作比单次外包便宜在哪

审校这件事的边际成本随合作次数下降得很快,比大多数外包环节都快。

第一次要解释产品、解释术语、解释哪些词不能动,沟通成本比审校本身还高。

第三次之后,他自己就知道你的品类词是哪几个,主动会问某个新词该怎么定。

他还会开始反过来提建议,比如某个词当地已经没人用了,该换成什么。

这类信息买不到,只有长期合作的审校员会主动给。

所以哪怕单次报价贵一点,也尽量固定同一个人,这笔账两三次就能算回来。

固定审校员还有个隐性收益:术语表会自己长出来。每次争议、每次他提的建议、每次你解释为什么某个词必须保留,这些都能沉淀成表里的一行。半年之后这张表的价值远超它的制作成本,新来的翻译看一遍就能上手,这本身就是本地化生产线能跑起来的前提。

审校简报写不清楚,返工的账最后记在你头上

目标读者与页面用途要写在最前面

简报第一段回答一个问题:这个页面是给谁看的,看了要干什么。

是给已经知道品牌的人看的,还是给刚开始比价的人看的,语气完全不同。

是要促成下单,还是要建立信任,用词的分寸也不一样。

把这句话写清楚,审校员的很多判断就不用你逐条交代了。

顺带写上这个页面的流量来源以搜索为主,他就知道有些重复不是失误。

这一段不用长,三五句话,但它决定了后面所有细则会不会被正确理解。

页面用途这件事还影响一个具体判断:允不允许审校员调整段落顺序和拆分句子。信息型的长文可以放开,让他按当地读者的阅读习惯重组;而结构固定的产品页最好锁死结构,因为那些位置往往对应着模板字段,改了会导致上线时对不上号。

不许动的清单与可改的边界

清单前面已经说过,这里要补的是另一半:哪些地方欢迎他大改。

只说不许动,审校员会保守到什么都不敢改,那你请他来就没意义了。

明确告诉他:除了锁定表里的词,其余表达全部可以按当地习惯重写。

句子结构、段落顺序、语气分寸,这些都归他,而且改得越多越好。

这样划清边界之后,他的专业能力才有发挥空间,你也拿到了真正本地化的文字。

一份好的简报读完给人的感觉应该是:限制很少,但那几条很硬。

这里有个实际的分寸问题:可改边界给得太宽,收回来的稿子可能面目全非,跟原文结构对不上,上线时要重新排版。所以放开行文的同时,最好把段落数量和小标题位置固定住,让他在每个段落内部自由发挥。结构不变、内容随便改,这个组合最省事。

交付格式:改在哪、怎么标、争议怎么记

交付格式定不清楚,收回来的东西五花八门,合并的时候要人命。

统一要求:直接在原文件上修改,开启修订记录,不要另存新文件。

凡是他觉得该改但被锁定表挡住的地方,用批注写下来,不动正文。

这些批注是最有价值的部分,它们会变成下一版术语表的候选条目。

再要求他在文件末尾写三五句总结:整体感觉、最大的问题、最不确定的地方。

这段总结比任何评分表都能反映稿子的真实状况,也是判断这位审校员靠不靠谱的依据。

批注的价值经常被低估。审校员写下的每一条被锁定表挡住的意见,都是当地读者视角的第一手反馈,而且是免费的。见过一份稿子的批注里提到某个品类词在当地更多指向二手市场,这条信息后来直接改变了那个页面的选词方向,价值远超那次审校的费用。

全部审一遍还是抽样审?抽多少才够?

分层抽样:按页面类型和流量价值分层

全站审一遍最保险,也最烧钱,页面上千之后基本不现实。

分层抽样的思路是:不同页面的出错代价不一样,抽样比例就该不一样。

交易相关的页面出错代价最高,价格写错、退换货条款译反了都是真金白银。

这一层建议全量审,哪怕它只占全站页面的一小部分。

流量最高的那批内容页排第二层,按较高比例抽,因为它们的错误影响面最大。

长尾内容页是第三层,比例可以压得很低,出了问题再补审也来得及。

分层的依据要用真实数据,不要用页面模板类型。有些看起来是长尾内容的页面实际上贡献了相当比例的自然流量,也有些产品页从上线起就没什么访问。按流量和转化数据分层、每个季度重新划一次,比按模板一刀切准确得多。

页面层级典型页面抽样比例不通过怎么办
交易层结算、条款、退换货、价格全量逐条返工,不放行
核心流量层热门品类页、主力产品页较高比例整批退回重审
长尾层长尾内容、旧文章低比例抽中的改,其余排期

错误密度阈值怎么定

抽样之后要有判据,否则抽了也不知道算不算通过。

常用的判据是错误密度:加权错误分数除以字数,得到一个可比的数字。

阈值不必参考行业标准,用自己的历史数据定更实际。

做法是把前三批审校结果的密度算出来,取中位数当基线,比基线差一截的就是不合格。

第一次没有历史数据的时候,可以先定一个宽松值跑起来,两三批之后再收紧。

重要的是这个数字要写进合同或者协作约定里,让双方事先知道判据。

阈值还要按语言分别设定,不能全站一个数。译入语和源语言的距离越远,同样水平的译者产生的错误密度天然越高。拿德语的基线去卡芬兰语或者土耳其语,会得到一堆假不合格;反过来拿最难那门语言的基线去卡全站,等于对简单语向没有要求。

抽样不过关就退回全量,退回规则要写死

抽样的意义在于它有一条明确的失败路径,否则抽样就成了走过场。

规则很简单:抽中的样本不通过,这一整批全部退回重审。

这条规则要在派活之前就讲明白,让承接方知道糊弄的代价。

它的威慑力比事后扣钱大得多,因为返工的是他自己的时间。

同时也要给一次申诉机会:如果他认为判定有误,可以逐条说明。

争议条目单独拎出来,请第三个人看,这种情况一年不会有几次。

退回规则要写死到什么程度?连“这一批”的边界都得事先定义:是按交付批次算,按页面类型算,还是按提交时间窗算。定义模糊的时候,承接方会自然而然地把不合格样本单独摘出来,说这一个是特例、其余没问题。批次边界写清楚,这条路就堵上了。

第一批全量、后面转抽样的过渡节奏

新合作的第一批不要抽样,全量审,这笔钱省不得。

第一批的作用不只是把稿子改对,更是校准双方对质量的理解。

第二批可以降到较高比例的抽样,同时观察错误密度有没有下降。

连续两批达标之后,转到常规抽样比例,进入稳定状态。

如果中途换人或者换了内容类型,节奏要重新走一遍,别嫌麻烦。

这套节奏跟新供应商的磨合周期是一回事,把它写成流程,谁来接手都不会乱。

过渡节奏里最容易被跳过的是观察错误密度有没有下降这一步。第一批全量审出的问题如果在第二批原样重现,说明反馈没有回流到翻译那一侧,这时候不该继续往抽样走,而该回头看流程:审校意见有没有真的传回给译者,术语表有没有更新。

审校意见跟检索要求打架时听谁的?

三档裁决规则:位置优先于词形,词形优先于行文

冲突一定会发生,事先定好谁优先,比每次现场吵架效率高。

第一档是位置:核心词必须出现在标题和H1里,这一条不让步。

第二档是词形:允许在变体集内变化,超出集合要走申报。

第三档是行文:句子怎么组织、段落怎么排,全部让给审校员。

三档从上到下,上面的赢下面的,规则简单到不需要讨论。

写进简报,双方各留一份,执行起来几乎不产生争议。

三档规则能落地的前提是第一档划得足够窄。如果把核心词必须出现扩大到正文每个小标题、每张图的alt,第一档就变成一张长长的清单,审校员会觉得手脚被绑住。真正不能让步的位置其实只有标题和H1两处,其余全部下放,规则才有人执行。

档位管什么冲突时例外通道
第一档 位置核心词在标题、H1的出现检索要求赢
第二档 词形变体集内的形态变化审校员可自主超集合需申报
第三档 行文句式、段落、语气审校员赢

哪些情况必须让步给审校员

有三种情况,检索这一侧应该主动认输。

第一种是锁定的词在当地已经带有负面含义或者歧义,硬留下去伤的是品牌。

第二种是保留那个词会让句子在语法上无法成立,尤其是格与介词搭配冲突的时候。

第三种是法律或者行业合规要求必须用某个特定表述,这没得商量。

遇到这三种,正确做法是改词表不是改稿子,让搜索这一侧去找替代词。

能识别这三种情况的审校员,本身就值得长期合作。

还有一种边缘情况值得单说:审校员坚持某个说法本地没人用,而工具里那个词确实有搜索量。这时两边可能都对——有量的那个词也许来自邻国市场或者海外侨民,本地人真的不这么说。工具数据在小语种里本来就不可靠,遇到这种分歧,把两个词都保留在不同页面上跑一段时间,让数据说话。

争议记录会变成下一版的术语表

每次冲突都记下来,三个月之后这份记录的价值会超出预期。

记录只要三列:争议的词、双方理由、最终决定。

翻一遍就知道哪些类型的冲突反复出现,那些多半是词表本身的问题。

把结论固化进术语表,同类争议就不会再来第二次。

新审校员入职的时候,这份记录比任何培训文档都管用。

它也是向内部解释“为什么这个词必须这么写”的最好材料。

记录的形式越简单越可能被坚持下来。一张共享表格,每次审校完顺手补三五行,比要求填写结构化的争议报告有效得多。半年后回头看,这张表里最有价值的往往不是结论本身,而是审校员写下的那句理由,它经常指向一个你根本不知道的当地使用习惯。

这套验收清单怎么接进现有的内容管线?

卡在哪个环节:翻译后、上线前,还是上线后

验收环节放的位置不同,成本差好几倍。

放在翻译交付之后、进CMS之前,改动成本最低,只动文本文件。

放在进了CMS之后、上线之前,成本中等,要在后台逐个页面改。

放在上线之后,成本最高,因为还要重新提交索引、等待重新抓取。

所以默认位置是第一个,只有那些必须在真实页面上才能看出的问题才留到第二道。

第三道只做抽查,用来发现流程漏洞,不承担把关职责。

把三道关的职责分清楚有个附带效果:谁都不用做重复劳动。第一道管文本,第二道管页面上的呈现(截断、换行、按钮文字放不下),第三道管上线后的真实表现。见过团队把三道关都做成“通读一遍”,结果同一份稿子被三个人各读了一遍,还是漏掉了按钮文字被截断这种只有在真实页面上才看得见的问题。

谁签字,返工算谁的

流程里最容易含糊的就是签字权,含糊的结果是出了事没人负责。

建议把签字权拆成两个:语言质量由审校员签,检索一致性由SEO这一侧签。

两个签字都齐了才算通过,缺一个就不上线。

返工责任跟着签字走:语言问题算审校,词丢了算SEO没查出来。

这么分看着严格,实际是在保护双方,因为责任边界清楚了就没人背黑锅。

推行的时候阻力主要来自内容团队,觉得多了一道手续,跑两轮之后没人再提。

两个签字权分开还有一个副作用要提前想到:两边意见不一致、稿子卡住的时候,得有人拍板。这个角色不该是签字的任何一方,而应该是对这个市场整体结果负责的那个人。把升级路径写进流程,卡住的稿子才不会在两个人之间来回传三天。

六步落地路线

把前面的东西压成一条可以直接执行的路线,六步。

第一步,把每个页面的核心词整理成锁定表,写清词形集合与必须出现的位置。

第二步,写一页审校简报模板,包含目标读者、锁定表位置、可改边界、交付格式。

第三步,写三个自检脚本:位置校验、词干比对、格式检查,接进交稿流程。

第四步,用五道题的试稿筛审校员,选定后先跑一批全量。

第五步,跑满两批之后定错误密度基线,转入分层抽样。

第六步,把争议记录每季度并进术语表,同时回头修一次关键词表。

六步跑完大概需要一个季度,前两步最费时间也最值得投入。真正的分水岭在第三步:自检脚本一旦跑起来,你对译文质量的判断就从“感觉还行”变成了一组可比的数字,后面所有决策都建立在这组数字上。没有它,剩下三步都只是把主观判断包装得更正式一点而已。

常见问题解答

只有一位母语者可用,语言正确性和检索一致性都靠他行不行?

可以,但要把两件事分两次做,不要混在一遍里。第一遍请他纯粹按读者身份读,只提语言问题,不给他看关键词表;第二遍再给他锁定表,让他核对指定的词有没有被自己改掉。混在一起做的时候,人会不自觉地被约束带偏,语言判断的独立性就没了。两遍之间隔一天效果更好。

关键词表里的词在译文里怎么放都别扭,是不是必须硬塞进去?

不必。别扭到审校员反复提意见的词,多半不是当地人的真实说法,而是从英文直译或者工具里抓来的低质量候选。正确的处理是回到关键词研究那一步,找当地人真正会打出来的表达重新验证一次搜索量。硬塞进去的结果通常是两头落空:读者觉得生硬,搜索这边也没换来多少流量。

审校员能不能顺便把meta描述和图片alt也审了?

应该审,而且要在派活的时候就明确列进范围。这些字段的译文往往来自不同批次,质量最不稳定,却直接影响搜索结果里的呈现。麻烦在于它们零散地分布在几十个位置,按字数计费会让审校员觉得亏,所以这部分建议单独按页面数计价,或者干脆打包进页面单价里,双方都省心。

回译比对用免费的机器翻译够不够?

够用,因为回译的目标是找数字、否定词、条件范围这类硬信息的偏移,不是判断文笔。免费引擎在这些硬信息上的还原度已经足够。要注意的是别用同一家引擎既做翻译又做回译,那样引擎自己的系统性偏差会被抵消掉,看起来一切正常。换一家引擎做回译,暴露问题的能力明显更强

词干工具对我要做的那门语言支持很差,还有别的办法吗?

有两个退路。一是前缀匹配,取词的前若干个字符做粗比对,对大多数屈折语能抓到七八成的换词情况;二是让翻译在交稿时顺手把每个锁定词实际用到的形态列一张表,成本很低,还顺便留下了变体集。两个办法可以叠加用。真正需要精确词干的场景其实不多,绝大多数时候你只是想知道“这个词还在不在”。

抽样比例定多少才算合理?

没有放之四海的数字,但有个可操作的定法:从一个偏保守的比例起步,连续跑两三批,观察抽中样本的错误密度。如果每批都远低于阈值,说明比例可以往下调;如果时不时踩线,就维持不动。比例本身是结果不是前提,用数据反推比拍脑袋定一个数字可靠得多。交易相关的页面永远是例外,不参与这个计算,一律全量。

这套流程会不会把审校员逼走?

会不会取决于限制的密度。锁定三五个词、说清楚其余全部放开,绝大多数审校员不会有意见,反而觉得需求清晰好干活。真正会把人逼走的是另一种做法:锁了几十个词,还要求逐条说明修改理由,那等于让他做校对不做审校,专业的人不愿意接这种活。规则要硬,但要少。

权威参考资料

分享到
标签
版权声明

本文标题:《小语种内容找母语者审校,一句读着自然不能当成验收通过的判据》

本文链接:https://zhangwenbao.com/minor-language-native-review-acceptance-checklist.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交