那支视频的自动字幕把品牌名听成了另一个词,然后这行字被当成正文抓走了

那支视频的自动字幕把品牌名听成了另一个词,然后这行字被当成正文抓走了
张文保 35 分钟阅读 1,450 阅读
本文目录
  1. 你的文字要先被机器听懂,这条链上多了哪一步?
  2. 一家汽车用品站的越南语安装视频,字幕里没有一次品牌名
  3. 别的内容是写出来的,这一类是听出来的
  4. 听这一步在哪些地方替你做了决定
  5. 这跟人眼看到的和机器取到的不一致是同一族问题
  6. 同一套模型,为什么在你这门语言上错得特别多?
  7. 错误率这个指标是怎么算的
  8. 公开评测里各语言的差距有多大
  9. 差距的来源不是模型偏心,是训练音频的分布
  10. 怎么二十分钟测出自己这门语言在哪一档
  11. 自动字幕吐出来的那串字,缺了哪几样东西?
  12. 缺标点,于是没有句子边界
  13. 缺大小写,于是专名认不出来
  14. 缺变音符号与声调记号
  15. 数字、单位与型号会被写成另一种形态
  16. 缺的这几样正好是检索最依赖的那几样
  17. 品牌名和型号在字幕里会变成什么?
  18. 模型只会输出它词表里有的词
  19. 三种典型的错法
  20. 为什么越是新品牌越容易被听错
  21. 有没有办法把词喂进去
  22. 没有空格的语言,字幕是按什么切行的?
  23. 切行跟切词是两件事
  24. 无空格语言与音节分写语言的两种坏法
  25. 字幕文件里的时间轴会把句子再切一次
  26. 自动翻译的字幕,是不是又走了一次中转?
  27. 翻译字幕的输入是识别结果不是原声
  28. 两次损失是怎么叠加的
  29. 这跟稿件走英语中转是同一条链
  30. 什么时候宁可不给翻译字幕
  31. 错的字幕进了索引,会在哪几个地方结算?
  32. 字幕是可索引文本,这一点常被低估
  33. 错字幕对页面语言证据的影响
  34. 被摘去当答案的那一段可能是错的那一段
  35. 报表上会表现成什么样
  36. 哪些语言必须人工校,这条线怎么划?
  37. 三档划分:能用、要校、别用
  38. 按内容类型再切一刀
  39. 校对的成本怎么估
  40. 校对该校哪几处,哪些可以放过
  41. 一份两天能跑完的字幕语言体检
  42. 第一天:抽样与错误分类
  43. 第二天:术语表与优先级
  44. 上线之后盯哪几个数
  45. 哪些归视频那一层,本篇交出去
  46. 交给视频与前端那一侧
  47. 交给内容与检索那一侧
  48. 常见问题解答
  49. 我们的视频只传到视频平台,没放在自己站上,还需要管字幕吗?
  50. 公开评测里的错误率数字,能直接拿来做决策吗?
  51. 把术语表喂给识别服务,具体能提升多少?
  52. 能不能干脆先写好讲稿,直接拿讲稿当字幕?
  53. 越南语这类带声调的语言,字幕的声调符号该怎么处理?
  54. 自动字幕的错误,会不会被判成低质量内容?
  55. 这件事跟我们已经在做的多语言内容工程是什么关系?
  56. 权威参考资料

摘要:站上的内容都是写出来的,只有一类例外:视频里那段话是说出来的,要先被机器听成文字才有机会被检索。这一步在英语上足够可靠,于是没人把它当成一个环节。可公开评测里同一套模型在大语种上是个位数错误率,到长尾语种能翻到几十个百分点。更麻烦的是识别结果缺的正好是检索最依赖的几样:句末标点、专名大写、声调与变音记号、数字与型号写法。品牌名会被听成别的词,而那行字以字幕文件的形式进了索引。本文给出错误率的读法、四类典型错法、三档校对判据与两天能跑完的体检。

你的文字要先被机器听懂,这条链上多了哪一步?

一家汽车用品站的越南语安装视频,字幕里没有一次品牌名

有个客户做汽车用品,行车记录仪、座套、车载支架、后视镜这些。

这个品类的内容形态天然偏视频,因为用户最关心的是装不装得上、怎么装。

团队做了一批安装演示视频,越南语和波兰语两个市场各配了本地讲解。

视频挂在商品页上,也传了一份到视频平台,转录文本也按建议放进了页面正文。

三个月后复盘,越南语那批视频的搜索表现远低于波兰语那批,而两边的制作水准是一样的。

保哥把越南语视频的自动字幕全文导下来读了一遍,读到第三条就停住了:整支七分钟的视频里,品牌名一次都没有正确出现过,每次都被识别成一个发音相近的普通词。用户搜品牌名加安装两个词,这批视频一条都接不住,而页面上那份转录文本原样抄的就是这份字幕。

别的内容是写出来的,这一类是听出来的

这件事值得单独拎出来说,因为它是本站讲了几十篇之后第一次出现的一种链路。

页面上的正文是写的,商品数据是填的,标题是拼的。

这几类内容不管中间经过多少道手,起点都是有人敲进去的一串字符。

视频里的那段话不一样,它的起点是一段声音。

要变成可被检索的文本,中间必须有一步把声音转成字,而这一步是机器做的。

换句话说,这是全站唯一一类你的文字要先被机器听懂,才有机会被读到的资产。这一步之前的所有努力——讲稿写得多好、术语用得多准、口音多标准——都要通过这个漏斗才能留下来。

听这一步在哪些地方替你做了决定

把这一步拆开,它替你做的决定比想象中多。

第一,它决定了哪些词进入文本,词表里没有的词会被替换成有的词。

第二,它决定了句子在哪儿断开,因为标点是它加的,不是你说的。

第三,它决定了数字写成阿拉伯数字还是写成词。

第四,它决定了同音的两个词里选哪一个,而这个选择基于它的语言模型而不是你的商品。

四个决定里没有一个征求过你的意见,而它们合起来基本决定了这段文本的检索价值。这是本篇跟其它篇最大的区别:别的篇里出问题的是你或者你的供应商,这一篇里出问题的是一段你既没参与也看不到的推理过程。

如果视频里不止一个人说话,还要多一步说话人分离。这一步的错误会以另一种形态出现:内容没错,但被归到了错的人头上,两个人的话被拼成一句。访谈类和客户证言类视频最容易踩,而这两类内容的价值恰恰建立在谁说的这件事上。判断办法是看字幕里有没有语义上明显衔接不上的相邻两句。

这跟人眼看到的和机器取到的不一致是同一族问题

本站讲过一种资产,人眼看到的字和机器取到的字可以完全无关。

视频字幕是这一族里的第二种,机制不同但症状同源。

那页规格书在屏幕上是好好的泰语,机器复制走的是另一串字符讲的是映射表填错,人这一侧完美无缺。

字幕这一类的方向正好相反:人这一侧是耳朵听得清清楚楚,机器那一侧才出错。

共同点是两者都产出一串看起来像文本的东西,而那串东西的内容跟原意可能没有关系。

还有一个更实际的共同点:两者的错都不会报错。字幕生成成功了,文件是有的,时间轴是对的,格式是合法的,任何自动检查都会给绿灯。要发现它错了,唯一的办法是有一个懂这门语言的人真的读一遍。

同一套模型,为什么在你这门语言上错得特别多?

错误率这个指标是怎么算的

先把指标说清楚,否则后面的数字读不懂。

语音识别的通用指标是词错误率,把识别结果跟人工转录的标准答案对齐。

把替换、删除、插入三类错误的个数加起来,除以标准答案的总词数。

百分之十的意思是每十个词里有一个不对,这个数看着不高,读起来其实已经很吃力。

对不分词的语言,行业里改用字错误率,把单位从词换成字符,两个指标不能直接比。

这里已经埋着第一个坑:同一门语言用两种口径算出来的数字可以差出好几倍,而各家发布的评测表并不总是标清楚用的是哪一种。看到一个漂亮的数字先看它的单位,这跟本站讲可读性分数时的提醒是同一条——那把尺子的刻度当年是拿英语量出来的

公开评测里各语言的差距有多大

好在这件事不用猜,有公开数据可查。

目前被引用最多的一份是大规模弱监督语音识别那篇的附录,它按语言列出了同一套模型的错误率。

那份表里的分布极不均匀:几门主要欧洲语言落在个位数,一批中等语言在十几到二十几,长尾语言能到四十以上甚至更高。

同一套模型、同一份评测集、同一个口径,差距完全来自语言本身。

另一份专门为多语言评测建的语音数据集覆盖了一百多门语言,可以拿来做交叉核对。

这两份材料放在一起,大规模弱监督语音识别给的是同一模型的横向对比,FLEURS多语言语音数据集给的是评测集本身的语言覆盖。做出海内容规划时,先去这两份里查一下自己那几门语言的位置,比任何供应商的承诺都实在。

这些数字要换算成体感才有用。词错误率百分之五左右,读起来基本顺畅,偶尔一个词要停顿一下。到百分之十五,每七八个词错一个,读的人要不断回头猜;到百分之三十,文本已经不能称为转录,它只是一堆跟原意有关的词。做决策时按这三个刻度分档,比记住具体小数点后几位有用得多。

差距的来源不是模型偏心,是训练音频的分布

为什么会有这么大的差距,原因说穿了很朴素。

这类模型靠大量的音频加文本配对训练出来。

网上能拿到的音频,语言分布极度倾斜,英语一门就能占掉一大半。

排到几十位之后的语言,能拿到的小时数可能只有英语的千分之一。

音频数据比文本数据更难得,因为它还要配上准确的转录。

这跟多语言模型铺到七十多种语言那天,受益最多的不是字母最像英语的那几门那篇讲的文本侧格局是同一个形状,只是音频这一侧的倾斜更陡。文本还能从网页上大批量爬,音频要么靠公开语料项目一句一句众包,要么靠有字幕的视频,两条路的产量都低得多。

怎么二十分钟测出自己这门语言在哪一档

公开评测毕竟是通用领域,你的品类词能不能识别是另一回事,得自己测。

准备工作只要一样东西:一段三到五分钟、由母语者念的、含你核心术语的音频。

第一步,把它交给你实际在用的那条链路,拿到自动字幕。

第二步,请母语者按听到的内容手写一份标准答案。

第三步,把两份并排,只数三样:品牌名错了几次、型号错了几次、品类核心词错了几次。

不必去算标准的词错误率,那个数对决策没什么帮助。真正决定这批内容值不值钱的是这三类词的准确率,而它们在通用评测里恰好一个都不会被单独统计。保哥的经验是这三类词的错误率往往比整体错误率高出一大截,因为它们全是低频词。

测完之后如果结果不理想,先别急着加预算,拍摄环节有三件几乎零成本的事可以先做。第一是语速放慢一档,尤其在念型号和参数的那几句;第二是关掉背景音乐,或者至少在口播段落把它压到很低;第三是用领夹麦而不是机身麦,这一条对识别准确率的影响往往比换一个更贵的模型还大。

还有一个容易被忽略的变量是说话人的口音。同一门语言的不同地区口音,在识别上的差距可以跟两门不同语言一样大,而训练数据里覆盖的多半是标准音。如果你的讲解人带明显地方口音,测出来的数字会比公开评测差一大截,这不是模型的问题,是样本分布的问题。

自动字幕吐出来的那串字,缺了哪几样东西?

缺标点,于是没有句子边界

识别结果最直观的特征是它长得不像正常文本。

多数链路吐出来的是一长串词,标点要么没有,要么靠一个单独的模型补上去。

补标点这个模型的准确率通常比识别本身还低,尤其在小语种上。

结果是这段文本要么完全没有句号,要么句号落在莫名其妙的位置。

而检索这些年已经把最小单位降到了一句话。

抓答案那一步,为什么先要知道一句话到哪儿结束那篇讲的是标点本身在不同语言里的兼职问题,字幕这一层更狠:不是标点有歧义,是压根没有标点。那篇里所有依赖标点的判断方法,到这里全部失效。

缺大小写,于是专名认不出来

第二样缺的是大小写,这在拉丁字母的语言里代价很高。

识别结果默认全小写,专名的首字母大写要靠后处理补。

德语更惨,德语所有名词都要大写,缺了大小写等于整段文本的词性线索全丢。

而专名恰好是品牌名、型号、地名的载体。

一个全小写的品牌名在字符串匹配里未必出问题,可它在实体识别那一层的信号强度会明显下降。

这条跟转成小写这一步在英文站上从来不出事,到了土耳其语站它把词改成了另一个词那篇是一枚硬币的两面:那篇讲的是主动折叠大小写造成的损失,这篇讲的是根本没拿到大小写。

缺变音符号与声调记号

第三样缺的东西按语言分布,而且分布得很不公平。

越南语的声调符号是词义的一部分,缺了就是另一个词或者不是词。

捷克语、波兰语、土耳其语的变音字母同理。

有些链路会输出不带符号的写法,有些会输出带符号但标错位置的写法。

后者更糟,因为它看起来是完整的,人眼扫过去不容易察觉。

越南语这一侧本来就有一套两轨策略:越南语SEO要接的是两拨人,一半打声调符号,另一半从来不打。字幕给你的可能是第三种形态——符号打了但打错了,这一种既接不住带符号的查询,也接不住不带符号的查询。

数字、单位与型号会被写成另一种形态

第四样是形态转换,这一类最容易被忽略。

你在视频里念的是十二伏,识别结果可能写成阿拉伯数字加单位,也可能写成词。

型号里的字母数字混排最容易出事,念出来的那一串在文本里可能被拆成几段。

尺寸、容量、功率这些参数词是这个品类用户最常搜的部分。

而它们在文本里到底长什么样,完全由这条链路决定。

这跟本站讲缩略语与型号写法那一篇是同一族:同一个组织在五门语言里有五个缩略语,你的词表收了几个。区别是词表那件事你可以主动补,而字幕这一层你连它会选哪种写法都不知道,只能事后查。

缺的这几样正好是检索最依赖的那几样

把上面四样并排看,会发现一个很不巧的重合。

句子边界决定段落能不能被整段摘走。

大小写决定专名能不能被识别成实体。

变音符号决定字符串能不能匹配上查询。

数字与型号的写法决定参数类长尾能不能被接住。

这四样恰好就是检索侧最依赖的四样,而它们全部由一个你没有参与的推理过程决定。这不是巧合:它们全都是低频、高信息量的成分,而低频高信息量正是统计模型最容易出错的地方。

品牌名和型号在字幕里会变成什么?

模型只会输出它词表里有的词

回到开头那个案例,解释一下品牌名为什么一次都没对。

识别模型的输出受限于它的词表和语言模型。

一个它没见过的品牌名,不在词表里,它不可能凭空造出来。

它会做的是选一个发音接近、在这门语言里合理的词填进去。

填进去的那个词语法通顺、拼写正确、上下文说得过去。

这个行为模式跟小语种AI稿里读着最顺的那一段,恰恰是模型顺手编出来的本地规矩那篇讲的是同一件事:模型不允许自己留空,必须给一个确定的输出,而给出来的东西完整、合法、自信。区别是那篇里编出来的是事实,这篇里编出来的是你的品牌名。

三种典型的错法

实测下来,品牌名的错法基本就三种。

第一种是整词替换,换成一个发音相近的常见词,这一种最常见也最难发现。

第二种是被拆开,一个品牌名被切成两个短词,各自都是合法的词。

第三种是被同化进上下文,跟前后的词粘成一个更长的词。

三种的共同点是结果读起来都很顺,没有任何一处看起来像识别错误。

顺便说一句,第一种在越南语上尤其高发,因为越南语是音节分写的,几乎每个音节都是一个合法的词,模型永远能找到一个说得通的替换。这跟泰语的标题里找不到一个空格那篇讲的分词困境是反向的:那边是切不开,这边是随便切都对。

为什么越是新品牌越容易被听错

这条规律很残酷,但很好理解。

一个品牌名进入模型词表的前提,是它在训练语料里出现得够多。

出现得够多的前提,是它已经在这门语言的公开内容里被大量提及。

而这恰恰是新品牌最缺的东西。

所以最需要靠内容打开市场的品牌,恰恰是这条链路最不认识的品牌。

更别扭的是它有滞后性:等到你的品牌被提及够多、模型也更新过之后,识别才会变准,而那时候你早就不缺这点流量了。这跟做小语种SEO,品牌名叫什么不由你定,由当地用户的输入法定那篇的结论叠在一起就是:品牌名在这门语言里长什么样,用户的输入法说了一半,识别模型说了另一半,都不是你说了算。

有没有办法把词喂进去

有,但要看你用的是哪一条链路。

视频平台的自动字幕基本没有这个入口,你只能事后改。

自己跑的识别服务多数支持自定义词表或者提示词,把品牌名、型号、专业术语提前喂进去。

这一步的收益极高:三类关键词的准确率通常能从很难看的水平拉到可接受的水平。

操作成本是准备一份术语表,几十到几百条,一次准备长期复用。

这份术语表跟本地化项目里的不可翻译词清单高度重合,可以直接借过来当种子。小语种内容找母语者审校,一句读着自然不能当成验收通过的判据那篇讲过怎么把不许动的词在稿子里标出来,同一份清单在这里换个用途就是喂给识别的词表。

把词喂进去具体有三档做法,成本差得很远。最轻的一档是在调用时附一段提示文本,把品牌名和术语写进去,改一行参数就行;中间一档是维护一份自定义词表并设置权重,适合术语量大的品类;最重的一档是拿自己的音频做微调,只有在内容量极大且语言足够冷门时才划算。九成场景第一档就够,而多数团队连第一档都没开。

音频这一侧也有几条硬门槛:采样率别低于常见的语音标准,尽量单声道录人声,避免多人同时说话的重叠段。这几条不是精益求精,而是低于门槛之后识别质量会断崖下跌,喂再多术语也救不回来。花几百块换一支麦克风带来的准确率提升,通常大于换一个更贵的识别服务。

没有空格的语言,字幕是按什么切行的?

切行跟切词是两件事

字幕多了一个别的文本形态没有的约束:它必须按时间切成一行一行。

每一行要在屏幕上停留一两秒,长度受屏幕宽度限制。

切在哪儿由时间轴决定,而时间轴对应的是说话的停顿。

说话的停顿跟句法边界只是大致相关,不是一回事。

于是一句完整的话被切成两三行,每一行都不是完整的语法单位。

这一层损失在英语上也存在,只是英语有空格,切在哪儿至少不会切坏一个词。到了没有空格或者按音节分写的语言,切行有机会把一个词从中间劈开,而劈开之后的两半在文本里是两个独立的字符串。

字幕行长本身也有一套约定:每行的字符数上限和每条字幕的最短显示时长。这套约定按语言不同,汉字、假名这类信息密度高的文字每行放的字符数明显少于拉丁字母,因为读者需要的是同样的阅读时间而不是同样的字符数。自动生成的字幕多数按一个固定字符数切,对信息密度高的语言就会切得过长,读者跟不上。

无空格语言与音节分写语言的两种坏法

这两类语言的坏法方向相反,值得分开记。

无空格的语言里,识别结果本身就要靠模型去切词,切错了整行都错。

音节分写的语言里,每个音节之间本来就有空格,切行不会劈开音节,但会把一个多音节词切成两半。

前一种的错误是不可见的,因为切出来的词看起来都是词。

后一种的错误是半可见的,一个词只剩前半截,母语者一眼看得出。

韩语这一侧还有第三种坏法,韩语的空格到底跟着什么走那篇讲过词与助词的分写规则,识别结果里助词的分写经常跟规范不一致,而站内搜索按字符串匹配时这一点直接决定能不能命中。

字幕文件里的时间轴会把句子再切一次

还有一层是文件格式带来的。

字幕文件的基本单位是一个时间段加一段文字。

抓取方读这份文件时,拿到的是一段一段的碎片。

如果直接把碎片拼起来,句子边界的信息就彻底没有了。

如果按碎片处理,每个碎片都太短,短到不足以构成一个可被摘走的段落。

正解是不要指望字幕文件本身承担正文的功能,而是另外准备一份完整的、有标点有分段的转录文本放在页面上。这一步在视频优化里早有共识,本篇要补的是:那份转录文本不能直接从自动字幕导出来改改就用,它需要按正常文章的标准重新组织,否则前面讲的四样缺失会原样搬到页面正文里。

字幕文件格式本身也值得挑一下。老的那种格式只有序号、时间和文本三样,新的那种可以带语言标记、样式和元数据,也支持在文件头写注释。挂在页面上的字幕轨应该用后者,并且把语言标记填对,因为这个标记是抓取方判断这一轨属于哪门语言的直接依据。

挂轨的时候还有一个字段必须填对:轨道元素上的语言属性。多语言字幕轨如果全部不填或者填成同一个值,抓取方就无法区分哪一轨是哪门语言,几轨内容会被当成同一门语言的重复文本处理。这个字段填一次的成本是几秒钟,漏了的代价是整批多语言字幕白挂。

视频章节标记跟字幕是两份独立的数据,但它们该对齐。章节标题是你自己写的,可以写得规范、带核心词;字幕是机器生成的,质量不可控。如果章节划分跟内容的实际结构对得上,抓取方就多了一条可靠的结构线索,可以在字幕不可靠时兜住一部分。这是少数几处你能主动补强这条链路的位置。

自动翻译的字幕,是不是又走了一次中转?

翻译字幕的输入是识别结果不是原声

视频平台普遍提供把字幕自动翻译成其它语言的功能,这里有个链路细节要说清楚。

翻译的输入不是原始音频,是上一步的识别结果。

也就是说,识别错的地方会被原样翻译过去。

被听成别的词的品牌名,会被当成那个词认真翻译一遍。

缺标点的长串文本,翻译时还要先自己猜一遍句子边界。

官方帮助里对视频与字幕的翻译写得很清楚,这条链的顺序不难查,只是多数人默认它是从声音直接到目标语言的。

两次损失是怎么叠加的

把两步的损失叠起来看,形状很有意思。

第一步的损失是随机的:低频词被换成高频词。

第二步的损失是系统的:翻译会按目标语言的规则重新组织。

两步叠加之后,错误不但保留了,还被翻译的流畅度掩盖了。

一个被听错的品牌名,翻译成目标语言之后变成一个更普通的词,读起来更顺了。

这是整条链上最坏的一个性质:每多经过一道工序,错误就变得更不像错误。到了第二步的输出上,已经没有任何线索能提示读者这里原本是个专名。

这跟稿件走英语中转是同一条链

本站讲过内容先做成英语再分发的那条链路。

稿子翻成波兰语之前先在英语站停了一趟,卸下去的那些东西没人清点讲的是语法维度在中转站被卸掉。

字幕这条链的中转站换成了识别这一步,卸掉的东西也换了:不是语法维度,是低频词。

两者的结构完全一样:一次有损压缩接一次必须给出确定值的解压。

两者的检查工具也同样失效,回译在那边帮倒忙,在这边也一样——把翻译字幕再翻回原语言,得到的是一个跟识别结果高度一致的版本。

要判断这条链有没有出问题,唯一可靠的参照物是原始音频,不是链上任何一个中间产物。这条判据很硬,也很不方便,因为它意味着检查这件事必须有人真的把视频听一遍。

什么时候宁可不给翻译字幕

结论跟平台自动翻译商品页那件事是同一个形状。

纯演示、口播少、术语少的视频可以开,翻错的面小。

含操作步骤、安全提示、参数说明的视频应该关,或者只给人工校对过的语言。

涉及安装、用电、承重这类会出事的内容必须关。

判据还是那一句:这段话里有没有一个词,翻错了会让用户做错事。

汽车用品这个品类里这条判据咬得特别紧,因为安装类视频几乎每一支都有一句关于扭矩、电压或者固定方式的话,而那一句恰好是全片信息密度最高、也最容易被听错的一句。

错的字幕进了索引,会在哪几个地方结算?

字幕是可索引文本,这一点常被低估

先确认这件事有没有实际后果。

字幕文件是文本,挂在页面上的字幕轨可以被抓取方读到。

视频平台内部的搜索会把字幕纳入匹配。

页面上的转录文本更是普通正文,跟别的段落没有区别。

所以这批文字不是只给听障用户看的辅助内容,它是一份实实在在的检索资产。

结构化数据里也有专门的字段承载它,transcript属性就是标记这份文本的位置。既然是资产,它错了就有代价,而不只是不好看。

错字幕对页面语言证据的影响

第一笔代价落在语言判定上。

识别结果里混着被替换成别的词的专名、缺变音符号的写法、来源不明的英文词。

这批文本如果占了页面文本的一大块,判定的稳定性会下降。

而视频页往往正文很短,字幕反而是最长的一块文本。

这就跟站上字最少的那几类页面最赚钱,也最容易被机器认成另一门语言那篇接上了。

要补的是一个新情形:那篇讲的是页面上文字太少所以证据不足,这里是文字不少但质量不可控,证据的方向可能被带偏。两种情形要用不同的办法救,前者靠补文字,后者靠换文字来源。

视频平台自己也要判定一支视频是什么语言,判定依据同样包括音频和字幕。如果自动字幕质量差,平台可能把这支视频归到错的语言下,后果是它在目标语言的推荐和搜索里出现得更少。这一层跟页面侧的语言判定是两套独立的系统,但踩的是同一个坑,而且平台侧你连排查工具都没有。

被摘去当答案的那一段可能是错的那一段

第二笔代价更直接。

段落级的抽取会从页面上挑一段最贴合问题的文字。

视频页上信息密度最高的那几段,往往正是讲操作步骤和参数的那几段。

而那几段恰好是数字、型号、专名最密集的地方,也就是识别最容易出错的地方。

被摘走的那一段一旦带着错的参数,后果不是流量损失,是用户按着错的数字去操作。

这一条把问题的性质从检索问题变成了责任问题。AI用你的语言把答案说得挺顺,底下挂的来源却是一水儿的英文页面那篇担心的是本地语言内容不被引用,这里的担心反过来了:被引用了,可引用的是错的那一版。

报表上会表现成什么样

最后说一下这件事在数据上的样子,因为它很难被归因。

视频页的展现量不一定低,因为它靠标题和页面正文也能拿到展现。

点击率可能正常,因为标题是你自己写的。

真正低的是那些应该由字幕内容承接的长尾查询,而它们分散在几百个词上,单个都看不出来。

汇总起来看的话,表现为这批页面的查询覆盖面明显窄于同类页面。

所以这件事的正确检查方式不是看整体指标,是拿一批视频页的查询词列表跟一批图文页做对比,看两边的查询词数量级差多少。差距超过一个数量级,基本可以确定字幕这一层没接住东西。

做这个对比时有个口径要统一:只比自然搜索带来的查询词,不要把站内搜索和推荐流量混进去。另外样本量要够,每边至少二十个页面,因为单个视频页的查询词数量波动本来就大。比出来的比值如果视频页只有图文页的十分之一以下,基本可以断定字幕这一层没在工作,而不是视频这种形态天生查询词就少。

哪些语言必须人工校,这条线怎么划?

三档划分:能用、要校、别用

给一套可以直接拿去开会的分档。

第一档能用:公开评测里错误率个位数、你自测的三类关键词准确率也不错的语言,自动字幕可以直接用,抽检即可。

第二档要校:错误率十几到二十几的语言,自动字幕当初稿,必须人工过一遍。

第三档别用:错误率更高的语言,自动字幕的修改成本高于重新听写,直接找人做转录更划算。

分档的依据要用你自测的那三个数,而不是公开评测的总分。

因为公开评测测的是通用领域的朗读语音,跟你的讲解视频在语速、口音、术语密度上都不一样。通用评测只用来定一个大致的档位,最终落在哪一档要靠自己那五分钟的样本。

还有一个变量会让一门语言在这三档之间移动:内容里的专有名词密度。同一门语言,讲品牌故事的视频可能落在第一档,讲型号参数的视频要掉到第二档甚至第三档。所以分档的单位不该是语言,而该是语言加内容类型的组合,这也是下一节要把两个维度交叉起来的原因。

按内容类型再切一刀

同一门语言里,不同类型的视频也该分开处理。

品牌宣传片、开箱视频这类,口播少、信息密度低,错了代价小。

安装教程、参数讲解、故障排查这类,每一句都可能带一个不能错的数字。

客户证言类比较特殊,它的价值在真实感,而识别错误会直接毁掉真实感。

两个维度交叉之后得到一张表,语言在一个轴,内容类型在另一个轴。

这张表比单纯按语言划线实用得多,因为它能让预算落在真正要紧的格子上,而不是把一门语言的所有视频一刀切地全校或者全不校。

直播和实时字幕要单独归一档。实时场景下模型只能看到已经说过的部分,没有全句上下文可用,准确率会比事后转录明显低。如果直播回放会被留档并且用来做长期内容,正确做法是回放之后重新跑一次离线转录,用离线的那一份替换掉实时生成的那一份,而不是把实时字幕原样存下来。

校对的成本怎么估

给几个可以拿去做预算的经验值。

校对一分钟视频的字幕,熟练的母语者大约要花三到五分钟。

从零听写一分钟视频,通常要六到十分钟。

所以自动字幕只有在错误率低到修改量小于三分之一的时候才真的省时间。

这也是第三档存在的理由:错误率高过某个点之后,改比重写更慢,因为改的人要不断在两份文本之间来回比对。

把这笔账算给决策者听,比讲错误率有效得多。多数人对百分之三十这个数没有感觉,但对每支视频多花两小时这个数很敏感。

校对该校哪几处,哪些可以放过

校对也要有优先级,不能逐字抠。

必须校的第一类:品牌名、型号、参数数字,这三类错了直接产生业务后果。

必须校的第二类:句末标点与分段,因为它决定这段文本能不能被整段摘走。

应该校的第三类:变音符号与声调记号,它决定字符串能不能匹配。

可以放过的:语气词、口头禅、重复的词、轻微的语序偏差,这些不影响检索也不影响理解。

把这份优先级写进给校对方的简报里,能把校对时间压掉三分之一以上。多数校对人员在没有指引的情况下会平均用力,把大量时间花在那些一点关系都没有的语气词上。

一份两天能跑完的字幕语言体检

第一天:抽样与错误分类

上午挑样本,每门语言挑三支视频,覆盖不同的内容类型。

把这几支视频的自动字幕全文导出来,纯文本形态,不要带时间轴。

下午请母语者读一遍,只做一件事:把错的地方圈出来并归类。

归类用前面那四类,专名、标点、变音符号、数字与型号。

统计每一类的错误次数,以及这几类词在全文里的总出现次数。

做完这一步你会拿到一张按语言、按错误类型的分布表,而这张表就是后面所有决策的依据。它比任何供应商的宣传材料都可靠,因为它测的是你自己的内容。

抽样时顺手记一下每支视频的音频条件:有没有背景音乐、录音设备、说话人数量、语速。做完分类会发现错误率跟这几个变量的相关性很强,有时候比语言本身的相关性还强。这份对照能直接指导下一批视频的拍摄规范,而拍摄规范的改动是一次性成本,比每支视频都请人校对便宜得多。

分类时建议把错误按位置也标一遍:出现在开头三十秒的错误比出现在结尾的更值钱,因为开头那段被摘去当摘要的概率最高,也是用户判断要不要看下去的那一段。同样数量的错误,集中在开头和散在中段,对结果的影响不是一个量级。

第二天:术语表与优先级

上午整理术语表,把所有被听错的专名、型号、术语收进去。

顺手把还没被念错但迟早会被念错的核心词也加进去,一并喂给识别服务。

下午定优先级:按视频的实际流量和内容类型排序,决定哪一批先人工校。

同时把页面上那份转录文本的处理方式定下来,是重新组织还是直接删掉。

直接删掉在有些情况下是对的:一份错误密集的转录文本对页面的伤害大于它带来的收益,尤其在语言判定这一层。这句话跟通行的建议正好相反,通行建议是转录文本一定要放,那条建议成立的前提是转录文本是准的。

如果决定保留页面上的转录文本,组织方式要按文章的标准来,不能按字幕的标准。具体做法是按视频章节分段,每段加一个小标题,把口语里的重复和语气词删掉,把参数和型号按规范写法统一一遍。这样处理过的转录文本才是一篇可读的正文,而不是一段被时间轴切碎的文字流。

处理时有一条要守住:别为了可读性把口播里的具体数字改成约数,也别把用户实际会搜的口语说法改成书面术语。转录文本最大的价值恰恰在于它保留了真人讲话时用的那些说法,而那些说法往往就是用户在搜索框里打的词。

上线之后盯哪几个数

体检做完,日常跟踪盯三个数就够。

第一个是视频页的查询词数量,跟同期图文页做比值,这个比值稳定下来之后就是基线。

第二个是品牌名相关查询在视频页上的展现,喂了术语表之后这个数应该有明显变化。

第三个是新增视频的抽检合格率,每月抽两支,防止链路悄悄换版本。

第三个数最容易被忽略,可它是唯一能发现供应商换了模型或者平台改了默认设置的手段。这类变更通常不会通知你,而它对小语种的影响往往比对大语种大得多。

还有一件事值得排进季度节奏:把当初那份术语表拿出来重新跑一遍抽检。品牌名和型号会变,新品会带来新的术语,而识别链路那一侧也在更新。术语表如果三年没动过,它保护的是三年前那批词。一次复核半小时,把新品词补进去,比事后逐支视频改字幕便宜得多。

哪些归视频那一层,本篇交出去

交给视频与前端那一侧

有一整块内容跟本篇挨着,但不归语言层。

视频放自托管还是放平台、结构化数据怎么标、缩略图怎么选、关键时刻怎么配,这些是视频优化本身的功课。

字幕轨怎么挂、用哪种格式、多语言字幕怎么组织,这些是前端实现问题,标准写得很清楚。

视频SEO在AI搜索时代怎么做把这一层讲透了,本篇不重复;格式细节看WebVTT规范track元素文档就够。

本篇只处理一件事:当那段话是用一门不是英语的语言说出来的时候,从声音到文本这一步会额外丢掉什么。把这条线划清楚的好处是,视频那一层的改动多数是一次性的配置工作,而语言这一层是持续的内容工作,两者的排期方式完全不同。

交给内容与检索那一侧

反过来也有几件事不该指望字幕解决。

视频页的正文该写什么、标题怎么起、跟商品页怎么互链,这是内容侧的活儿。

术语表里该收哪些词、用哪个形态,这跟关键词表是同一份功课,只是用途不同。

界面上那些没被抽出来的英文按钮是另一条线,翻译报价单上那四万字里,页面上真正被人读的那几十个词一个都没有那篇讲的是页面文本的另一半缺口。

平台那一侧的商品文案又是另一套规则,平台给每个卖家的搜索词字段一样长,可日语卖家能塞进去的词只有英语的三分之一算过那笔字节账。

三条线加起来才是一个小语种站完整的文本供给:写出来的、填出来的、听出来的。多数团队在前两条上投了九成的精力,而第三条往往一分钱都没投过,尽管它的产出正在被同一套检索系统读。

最后补一条排期上的经验:这条供给线的投入产出比在内容量上有个拐点。视频数量少的时候,逐支人工校对最省事;数量上去之后,喂术语表加抽检的组合才划算;再往上,才值得考虑把整条识别链路换成自己可控的服务。多数团队卡在第一档不动,一直用人工校对硬扛,直到视频数量涨到没人愿意校为止。

常见问题解答

我们的视频只传到视频平台,没放在自己站上,还需要管字幕吗?

需要,而且理由不只是平台内部的搜索。视频平台的字幕会被平台自己的推荐与搜索使用,也会成为外部检索理解这支视频的主要依据。更实际的一点是:平台上那支视频的标题、描述和字幕,在很多品类里是用户搜品牌名时看到的第一批结果之一。字幕里的品牌名如果一次都没对,等于放弃了这个入口。至于要不要同时在自己站上放一份转录文本,那要看那份文本的质量,错误密集的话不放反而更好。

公开评测里的错误率数字,能直接拿来做决策吗?

只能用来定一个大致的档位,不能当结论。原因有三层:公开评测多数用的是朗读语音,语速稳定、口音标准、几乎没有专业术语,跟真实的讲解视频差得远;不同评测的口径不一样,词错误率和字错误率不能直接比;而且模型在更新,一份两年前的表跟现在的实际表现可能差不少。正确的用法是拿它排出一个语言的相对顺序,然后用你自己那五分钟的样本去定最终的档位。

把术语表喂给识别服务,具体能提升多少?

看词的性质。完全没在训练数据里出现过的生造品牌名,提升最明显,从基本听不对到基本能对。跟常见词发音接近的品牌名提升次之,因为模型仍然会在两个候选之间摇摆。型号这类字母数字混排的串提升有限,因为它的问题不在词表而在切分方式。所以喂词表不是万能的,它主要救的是第一类。第二类还要靠在视频里念得慢一点、清楚一点,这是拍摄环节能解决的事。

能不能干脆先写好讲稿,直接拿讲稿当字幕?

这是最省事也最靠谱的一条路,前提是拍摄时确实按稿念。实际操作中主播总会即兴发挥,讲稿和实际内容会有偏差,字幕对不上口型比字幕有错更影响观感。折中办法是拍完之后拿讲稿去跟自动字幕做对齐,只修改偏差的部分,这比从零校对快得多。这条路对小语种特别划算,因为它把最贵的那一步——听写——整个跳过了。

越南语这类带声调的语言,字幕的声调符号该怎么处理?

页面上呈现的那份必须带全声调符号,这是正确性和可读性的底线,缺了母语者一眼看得出。匹配这一侧要两轨都覆盖,因为很大一部分用户在搜索时不打声调符号。具体做法是页面文本用规范写法,站内搜索的同义词表把不带符号的写法映射过去。要特别小心的是符号标错位置的情形,它比不标符号更糟,因为它看起来是完整的,人工抽检时很容易漏过去。

自动字幕的错误,会不会被判成低质量内容?

直接因为字幕错被判低质的情况不常见,真正的代价在别处:这批文本接不住它本该接住的长尾查询,可能把页面的语言判定带偏,被摘去当答案时可能带着错的参数。三笔账里最该担心的是第三笔,因为它影响的不是排名而是用户会不会按着错的数字去操作。所以判断要不要投入校对,应该看内容类型而不是看会不会被降权。

这件事跟我们已经在做的多语言内容工程是什么关系?

是同一件事的第三条供给线。一个小语种站的文本来源一共三类:写出来的正文、填出来的商品数据与界面文案、听出来的视频文本。三类都要经过同一套检索系统,可多数团队只在前两类上有流程,第三类连负责人都没有。补这条线的成本其实不高——一份术语表加一次抽样体检就能覆盖大半,难的是先承认它是一条独立的供给线,而不是视频制作的一个附属步骤。

权威参考资料

分享到
标签
版权声明

本文标题:《那支视频的自动字幕把品牌名听成了另一个词,然后这行字被当成正文抓走了》

本文链接:https://zhangwenbao.com/minor-language-auto-caption-asr-error-rate.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交