越南语SEO要接的是两拨人,一半打声调符号,另一半从来不打
本文目录
- 越南语的声调符号到底有几层?
- 声调符号该标在哪个元音上,为什么同一个词会出现两种标法?
- 这两套标法在实操上怎么处理?
- 为什么会有那么多人不打声调符号?
- 不带符号的查询占比大概是多少?
- 那我的页面该写带符号还是不带符号的?
- 匹配层双轨具体怎么做?
- 越南语的输入法有几套,这会影响你拿到的数据吗?
- 越南语字母表里没有的那几个拉丁字母怎么办?
- 全大写的标题里,记号该怎么处理?
- 字母排序规则跟英语差在哪?
- 搜索引擎的拼写纠错能不能替你兜底?
- 关键词表要不要也做两份?
- 这跟希腊语那种拉丁转写是同一回事吗?
- 那越南语的难点在哪里?
- 音节分写会造成什么实际问题?
- 跟韩语的分写法是同一个问题吗?
- 词的边界怎么在技术上处理?
- 短语查询要不要加引号约束?
- 编码上有哪个坑会让匹配率直接归零?
- 这个编码坑具体怎么解决?
- 越南语用过哪些旧编码,会不会遇到历史数据?
- 标题里该写带符号还是不带符号的形态?
- 标题长度上要注意什么?
- URL用带符号的形态还是转写?
- 内链锚文本要用哪种形态?
- 越南语有没有格变化或者复杂词形?
- 那越南语的词表规模会不会很小?
- 本族词和借词该怎么分工?
- 南北方言差异需要单独处理吗?
- 数字、日期和货币格式怎么写?
- 字符集与字体上要注意什么?
- 关键词工具在越南语上能用到什么程度?
- 本地引擎和平台生态要单独做吗?
- 越南语的星期表达为什么容易差一位?
- 人名和称呼会影响哪些字段?
- 地址字段和行政区划该怎么设计?
- 南北口音会不会影响语音搜索?
- 越南语内容的语气和信任元素有什么讲究?
- 越南语的搜索长尾能做到多深?
- 母语审校要盯哪几件事?
- 上线之后先看哪几个指标?
- 一份可以照着走的越南语启动清单
- 常见问题解答
- 用户不打声调符号,是不是可以把页面也写成不带符号的?
- 同一个词为什么会有两种合法的声调标法?
- 越南语的音节分写跟韩语的分写法是同一个问题吗?
- 那个能让匹配率归零的编码坑到底是什么?
- 搜索引擎自己的拼写纠错能不能替我兜底?
- 越南语没有词形变化,是不是词表工作会很轻松?
- 价格和数字格式为什么要单独列进检查清单?
- 权威参考资料
摘要:越南语的每个音节最多能带一个元音变体和一个声调符号,写全了信息密度极高。但真实的搜索行为里,有相当一批用户从来不打这些符号——手机输入法要多按几下,图省事就不打了。于是同一个词在搜索框里分成两拨字符串:带调的和不带调的,两拨都是真实需求。这篇讲清两拨人各占多少、词表该怎么双轨收、音节分写为什么会让复合概念散架、编码上那个能让匹配率归零的隐形坑,以及标题里该写哪一种。
做户外运动装备的一个客户,主力是骑行头盔和公路车配件,东南亚第一站选了越南。理由很直接:骑行人口在涨,客单价扛得住,本地供给以低端为主,中高端有空档。
越南语内容外包给了本地团队,交付很规范,声调符号一个不落,读起来专业。上线三个月,产品页收录正常,站内搜索的匹配率却低得不像话。
日志一翻就明白了。用户搜进来的字符串,绝大多数一个声调符号都没有。而页面上写的每一个都带着符号。两边在语义上是同一个词,在字节层面完全对不上。
更麻烦的是,这不是用户偷懒的个别现象。日志里不带符号的查询占了将近一半,而且集中在移动端。
越南语这门语言的搜索侧,天然被劈成了两拨人。你的页面只服务了其中一拨。
越南语的声调符号到底有几层?
要分开数,因为它们是两套不同的东西,经常被混为一谈。
第一层是元音字母本身的变体。有几个元音字母带着固定的附加记号,这些记号不表示声调,它们参与构成一个独立的字母——去掉记号就是另一个字母,读音完全不同。
第二层才是声调符号,加在音节的主元音上,标记这个音节的调值。越南语有六个声调,其中一个不标符号,剩下五个各有一个记号。
所以一个音节最多能同时带两个记号:一个属于字母本身,一个属于声调。写全了字符很密,去掉之后就变成一个光秃秃的拉丁音节。
声调符号该标在哪个元音上,为什么同一个词会出现两种标法?
这是越南语里一个真实存在、却几乎没人跟外国团队讲清楚的分歧点,而它会直接产出两个不同的字符串。
当一个音节里有两个元音字母时,声调记号标在前一个还是后一个,有两套并行的规范。一套是较早的传统标法,倾向标在靠前的那个元音上;另一套是后来的标法,按音节结构规则决定落点,结果往往落在靠后的元音上。
两套都在用。教科书和一部分出版机构用其中一套,另一批媒体和大量民间写作用另一套,而输入法的默认设置也分两派。
后果是:一个完全规范书写的词,仍然可能有两种合法的字节序列。这跟打不打记号是两个独立的问题,叠加起来,同一个概念在搜索侧最多能分出四种形态。
这两套标法在实操上怎么处理?
展示层选定一套,全站统一,别混着来。选哪一套取决于你的目标人群偏正式还是偏日常,拿不准就跟着本地主流媒体走。
匹配层要把两套都收。做法跟处理不打记号一样:给索引再加一个归一字段,把两种标法折叠到同一个键上。
关键词表也要按这个逻辑扩一列。查量时两种标法都查,量相加。这一步经常被漏掉,因为两种写法在肉眼看来差别极小,很容易被当成同一个词。
顺带说一句,这类分歧只影响一部分音节结构,不是所有词都有两种标法。实际会受影响的词大概占品类表的一到两成,但它们往往正好是那些高频的双元音品类词。
为什么会有那么多人不打声调符号?
三个原因叠在一起。
输入成本。越南语的输入法通常要在字母后面追加一到两个按键来生成带记号的字符。搜一个三音节的词,可能要多按四五下。在手机上,这就是明显的摩擦。
习惯迁移。即时通讯和社交平台上不打符号早就是常态,年轻人打字快、上下文足,不打也读得懂。这个习惯直接带进了搜索框。
容错预期。用户知道搜索引擎大概率能懂,那就更没有动力去打全了。
这三条合起来,造成的结果是:不带符号的查询不是错误输入,是一种稳定的、成规模的、和带符号并行存在的搜索行为。你不能把它当成拼写错误来处理。
这个现象在带变音符号的语言里普遍存在,法语的重音符号打不打那篇讲的是同一件事的温和版本。但两边的量级完全不同:法语的重音符号只出现在一部分词上,去掉之后大多数词还是原样;越南语这边,几乎每一个音节都可能带记号,全部去掉之后整篇文本的面貌都变了。
更关键的差别是规模。法语市场不打重音的查询是少数派,越南语这边接近一半,你没法把它当成边缘情况处理掉。
不带符号的查询占比大概是多少?
没有一个放之四海的数字,但可以给几条实测出来的规律。
移动端明显高于桌面端。桌面有实体键盘,输入摩擦小,打全的比例更高。
年轻用户高于年长用户。年长用户的输入习惯更接近书面规范。
短查询高于长查询。搜两个音节的词大家还愿意打全,搜一整句话时符号往往就全省了。
品类上也有分化:越接近日常口语的品类,不带符号的比例越高;越专业、越书面的品类,比例越低。骑行装备属于中间偏口语一侧。
那我的页面该写带符号还是不带符号的?
页面正文必须写带符号的完整形态,这一条没有商量余地。
理由不是SEO,是专业度。不打符号在聊天窗口里是随意,出现在一个卖东西的商业页面上就是不专业,越南用户对这一点的判断非常快。
而且不带符号的文本存在真正的歧义。同一串裸拉丁字母去掉记号之后,可能对应好几个完全不同的词,读一句话没问题,读一整页会很累。
所以答案是:展示层写全,匹配层双轨。这是这篇文章最核心的一条结论,后面所有技术动作都是围绕它展开的。
匹配层双轨具体怎么做?
核心动作是在索引时给每条记录额外生成一份去记号的形态,和原形态一起存进索引。
查询进来时同样做一次去记号处理,然后两个字段都查:带符号的查带符号字段,去了符号的查去记号字段。
这样带符号的用户和不带符号的用户都能命中,而且带符号的匹配精度更高,可以给它更高的权重,让精确输入的用户拿到更准的结果。
去记号的处理不要自己写字符映射表,用标准的字符分解形式来做——先把组合形态拆开,再把记号类的字符滤掉,剩下的就是基本拉丁字母。字符规范化的标准文档里定义了这几种分解与合成形式,照着用比手写映射稳。
越南语的输入法有几套,这会影响你拿到的数据吗?
会,而且影响的方式很隐蔽。
越南语常用的输入方案有三套,各自的按键约定完全不同:一套用普通字母做修饰键追加在后面,一套用数字键指定声调,还有一套用标点符号做记号。三套的键位逻辑互不相通。
对做SEO的实际影响主要在两处。
第一处是你的本地团队交付的文本。不同输入法在少数边缘字符上的产出可能落在不同的编码形式上,几个人协作时文本里就混进了两种字节序列,而肉眼完全看不出来。
第二处是用户的输入错误模式。用数字键指定声调那一套,误触数字会产出一个带错误声调的合法词;用字母做修饰键那一套,误触会产出一个多了字母的非词。两类错误在站内搜索里要用不同的容错策略处理——前者要靠同义词和相似度,后者靠编辑距离就够。
越南语字母表里没有的那几个拉丁字母怎么办?
越南语的字母表里没有四个常见的拉丁字母,它们不出现在本族词里。但你的页面上一定会有它们——品牌名、型号、单位、技术缩写,全靠这几个字母。
这会在三个地方产生摩擦。
字符白名单如果按越南语字母表配置,这四个字母会被当成异常字符过滤掉,型号直接被吃。这个坑很常见,因为按语言字母表配白名单听起来很合理。
排序和索引里,这几个字母的位置在越南语的排序规则下没有明确定义,不同实现的处理不一致,品牌索引页可能出现莫名其妙的排列。
用户输入端,越南语键盘布局下打这几个字母没有障碍,但在某些输入方案里它们本身就是修饰键,用户想打字母却触发了记号。这类查询在日志里表现为一批看不懂的字符串,别急着当成垃圾流量丢掉。
全大写的标题里,记号该怎么处理?
照常保留,一个都不能省,这一点跟希腊语正好相反。
越南语的大写形态里,元音的附加记号和声调记号都保留,只是字母本身变成大写。整套大写形态在字体里是完整存在的,不需要做任何降级。
会出问题的是排版。大写字母本身更高,上面还要叠一到两层记号,行高不够的话记号会被上一行压住或者被容器裁掉。这个在导航栏、按钮、促销条幅这些行高卡得紧的位置最容易翻车。
还有一个技术细节:大小写转换函数要确认它对带记号的字符处理正确。有些实现只处理基本拉丁字母,带记号的字符原样返回,产出一个大小写混杂的标题。转换之后抽样看一眼,成本很低。
字母排序规则跟英语差在哪?
差在两处,都会让直接套用默认排序的品牌索引页出错。
第一处是带附加记号的元音字母。它们在越南语的字母表里是独立字母,有自己的排序位置,紧跟在对应的基本字母之后,而不是被当成基本字母的变体。
第二处是声调。同一个字母的不同声调形态之间也有固定的先后顺序,这一层排序在基本字母比较完之后才生效。
结果是越南语的排序是一个多层比较:先比基本字母,再比字母变体,最后比声调。默认的通用排序规则只做第一层,排出来的顺序在越南用户看来是乱的。
解决办法跟其他语言一样,在数据库或查询层指定越南语的排序规则。语言环境排序规则的规范文档里有越南语的排序表定义,配置之前对着确认一遍比试错快。
搜索引擎的拼写纠错能不能替你兜底?
能兜一部分,但不能当成方案,理由有三条。
第一,纠错发生在引擎那一侧,它决定给不带记号的查询匹配哪些结果,这个过程你无法干预也无法预测。押注在一个黑盒上不是策略。
第二,纠错在竞争激烈的词上帮不了你。当同一个查询有一批页面都能匹配时,排序看的是其他因素,而你的页面如果只有一种形态,在相关性上就是弱势的一方。
第三也是最实际的:站内搜索没有人替你兜底。用户在你自己的搜索框里敲不带记号的词,如果你没做双轨,就是实打实的零结果,跟外部引擎的能力毫无关系。而站内搜索的零结果直接对应流失。
所以正确的心态是:外部引擎的容错当成额外收益,自己该做的一样不能少。
关键词表要不要也做两份?
不做两份表,做一份表两列。
结构上和处理其他一词多形语言的思路一致:一行一个概念,第一列是带符号的规范形态,第二列是去记号形态,第三列可以放这两种形态各自的搜索量。
查量的时候两列都要查。工具通常把它们当成两个不同的词,各给一个数字,你要做的是把两个数字加起来看真实需求。
这个动作会明显改变品类的优先级排序。有些词单看带符号的量平平无奇,加上不带符号的那一半之后会跳好几位。
这跟希腊语那种拉丁转写是同一回事吗?
不是,区别很重要,混淆了会用错方法。
希腊语用拉丁字母打本族词那种情况,是换了一套字母系统——用户拿拉丁字母去近似希腊字母的读音,映射关系不唯一,同一个希腊词能转出好几种拉丁写法,得靠转写规则去穷举。
越南语这边不换字母系统。越南语本来就用拉丁字母,不打符号只是把附加记号删掉,字母序列一个不变。去记号的结果是唯一的、可计算的、可逆推的。
这个差别决定了技术方案完全不同:希腊语那边需要一张转写映射表加人工筛选,越南语这边一个标准的字符分解函数就够了。越南语的问题比它看起来简单。
那越南语的难点在哪里?
在音节分写,以及由它带来的边界模糊。
越南语的书写单位是音节,音节之间一律用空格分开。一个双音节的词,写出来是两个被空格隔开的部分。
所以从字符串的角度看,越南语的词和词组之间没有形式上的分界——都是若干个空格分隔的音节,你看不出哪两个音节属于同一个词。
这跟中文读者的直觉正好相反。中文是不分词但字紧挨着,越南语是分音节而且音节之间必须有空格。结果是同一个概念在越南语里看起来像好几个独立的词。
音节分写会造成什么实际问题?
四个,按严重程度排。
词组匹配失准。搜索引擎按空格切分之后,一个双音节词变成两个token,跟另一个词的某个音节碰巧组合起来也能匹配,产出不相关的结果。
标题截断难看。截断按字符数走,很容易正好切在一个词的两个音节之间,剩下半个词——而半个音节在越南语里往往是另一个有意义的词,读起来很怪。
URL转写变长。每个音节转写出来都要一个连字符,一个四音节的品类词在URL里就是四段,路径迅速变长。
关键词工具误判。工具按空格算词数,一个越南语的双音节词被算成两个词的短语,长尾判定和竞争度估算都会偏。
跟韩语的分写法是同一个问题吗?
形式相似,性质不同,这一点值得说清楚。
韩语的分写法是按词分的:空格落在词与词之间,规则复杂但目标明确——把词分开。分写规则出错会改变句子的意思,所以它是一个正确性问题。
越南语的空格是按音节分的:不管两个音节属不属于同一个词,中间都有空格。这不是规则复杂,这是根本没有词级的形式边界。
后果的方向也不同。韩语的坑是空格打错等于换了词;越南语的坑是空格永远是对的,但它不告诉你词到哪儿结束。
前者要解决的是准确率,后者要解决的是切分。两套问题两套办法,别把韩语那套分写规则搬过来。
词的边界怎么在技术上处理?
靠词典,不靠规则。
越南语的分词组件本质上是在做词典匹配加消歧:拿一张多音节词的词典去扫描音节序列,把能组成词的相邻音节合并起来,遇到多种切法时按频率或上下文选一种。
对做电商内容的团队来说,不需要自己实现这套东西。需要做的是把自己的品类词典喂进去——你的商品名、品类名、属性值里有大量通用词典没有的多音节词,不喂进去就会被切碎。
这份自定义词典的价值远超它的制作成本。两三百个词条,一天能整理完,站内搜索的准确率能上一个台阶。
短语查询要不要加引号约束?
在站内搜索的实现层要加等价的约束,在面向用户的界面上不要教用户加引号。
原因是越南语用户搜多音节词时不会加任何标记,就是几个音节直接敲进去。你的搜索实现要能理解“这几个相邻音节很可能是一个词”,而不是要求用户来标注。
实现上的常见做法是给相邻token的组合加一个位置约束,让顺序相邻的匹配得分显著高于分散匹配。这样即便切分不完美,排序也能把正确结果推上来。
这个调整对越南语站的站内搜索体验提升是所有优化里最明显的一个,而且不需要引入额外的组件。
编码上有哪个坑会让匹配率直接归零?
有,而且它很隐蔽:同一个带记号的字符,在编码上可能是一个码位,也可能是基本字母加一个组合记号,共两三个码位。
屏幕上看起来完全一样,字节层面完全不同。字符串比较、索引匹配、数据库唯一约束,全都会把它们当成两个不同的东西。
越南语是这个问题的重灾区,因为它的字符大量落在需要组合的那一类上,而不同来源的数据用的形式往往不一样——本地团队用的输入法产出一种,你从供应商拿的数据表是另一种,用户浏览器提交上来的可能是第三种。
症状很典型:肉眼核对一模一样的两个词,程序判定不相等,然后你开始怀疑人生。
这个编码坑具体怎么解决?
一句话:在所有入口做统一的规范化,选定一种形式,全站只用这一种。
入口包括:数据导入、表单提交、接口接收、爬取的外部数据、以及内容编辑器的保存动作。任何一个入口漏掉,都会往库里放进另一种形式的数据。
选哪一种形式取决于你的技术栈,两种都能工作,关键是别混。合成形式的字符串更短,比较更快,是更常见的选择。
已经有历史数据的话,先跑一遍全量扫描统计混杂比例。这个数字通常比预期的高,因为它从来不会在页面上表现出来,只会表现为一个说不清原因的低匹配率。
越南语用过哪些旧编码,会不会遇到历史数据?
会,尤其是接手老站或者从本地合作方拿存量数据的时候。
在统一编码普及之前,越南语有过好几套互不兼容的本地编码方案,各自用不同的方式把带记号的字符塞进有限的码位空间里。当年为越南语制定的编码约定就是其中一套的正式文档,从里面能看出这些方案是怎么处理记号叠加的。
这些旧编码的数据如果不做转换直接入库,页面上会是一片乱码,这个反而好发现。
难发现的是转换做了但做得不完整——大部分字符对了,某几个记号组合错了。这类数据在抽查时很容易漏,建议转换后跑一次字符白名单扫描,把不在预期集合里的码位全部列出来人工过一遍。
这套排查动作跟希伯来语那边处理元音标记的思路是一样的:非拉丁或带组合记号的语言,数据入库前必须先扫一遍字符构成,不能等页面出问题了再回头查。
区别在于扫描的目标。希伯来语那边是要把不该有的标记剥掉,因为用户搜的是不带标记的形态;越南语这边是要把记号统一成同一种编码形式保留下来,因为记号本身是词的一部分,剥掉就变成另一个词了。方向相反,动作相似。
标题里该写带符号还是不带符号的形态?
写带符号的,一个都不能省。
标题是最能体现专业度的位置,也是用户判断这个站靠不靠谱的第一眼。不带符号的标题在越南用户看来就是随手打的。
至于怎么接住不带符号的查询,靠的是匹配层的双轨,不是靠在标题里写不规范的形态。这两件事必须分开。
更不要在标题里同时写两种形态。那既不通顺又像在堆词,属于两头不讨好的做法。
标题长度上要注意什么?
音节分写会让越南语标题的字符数比中文长很多,一个概念动辄四五个音节加空格。
再加上记号占的字符位置,同样信息量的越南语标题在字符数上是相当膨胀的。
实际做法是把截断位置控制在音节边界上,也就是空格处,别按固定字符数硬切。切在音节中间产出的残片,在越南语里可能恰好是另一个词,效果比截断本身更糟。
还有一个小细节:越南语的品类词经常以一个通用音节开头,几个不同品类的标题前几个字符完全一样。排在搜索结果里会显得雷同,把区分度高的词往前挪一挪很有必要。
URL用带符号的形态还是转写?
用去掉记号的拉丁转写,这个基本没有争议。
越南语的URL如果保留记号,编码之后是一长串转义序列,分享到即时通讯里非常难看,而越南市场的分享行为高度集中在即时通讯上。
去记号之后是干净的基本拉丁字母,音节之间用连字符连接,可读性好,也和用户不打符号的输入习惯天然一致。
要注意的是路径长度。四五个音节加连字符,再加上品牌和型号,URL很容易过长。建议在品类词层面就做取舍,只保留区分度最高的那几个音节,别把完整商品名塞进路径。
内链锚文本要用哪种形态?
用带符号的规范形态,跟正文保持一致。
锚文本是给人读的,也是给搜索引擎理解目标页主题用的,两个用途都要求规范书写。
不带符号的形态只活在两个地方:URL路径和匹配层的索引字段。这两个地方用户都不直接阅读,所以不影响观感。
把这条界线画清楚,团队里就不会再有人纠结哪里该打哪里不该打——凡是给人看的地方全打,凡是给机器匹配的地方双轨。
越南语有没有格变化或者复杂词形?
没有,这是这门语言最省心的地方。
越南语是分析型语言,词本身不变形,没有格、没有性、没有数的屈折,动词也不按时态变位。语法关系靠语序和虚词表达。
所以做过俄语、波兰语、芬兰语那种一个名词几十种形态的市场之后,来做越南语会觉得词表工作轻松得不真实——因为它确实轻松,一个词就是一个形态。
省下来的力气正好用在别的地方:符号双轨、音节切分、编码统一,这三件事才是越南语的成本所在。
那越南语的词表规模会不会很小?
词形数量小,但概念数量不小,而且有一个别的语言没有的膨胀源:同一个概念常常有一个本族说法和一个外来说法并存。
越南语历史上从汉语借入了大量词汇,近代又从法语和英语借入了一批,很多概念因此有两三个可用的词。
这几个词的语体色彩不同:借自汉语的往往更书面、更正式,本族词更口语,近代外来词多用于技术和时尚领域。
而用户在搜索时选哪一个,取决于场景。查规格参数时倾向用正式词,描述使用需求时倾向用口语词。两个都要收,而且要判断哪个放标题、哪个放正文。
本族词和借词该怎么分工?
一条经验规则:标题和分类名用识别度最高的那一个,正文里两个都自然出现。
识别度最高的通常不是最正式的那个,而是市场上流通最广的那个。判断方法还是看本地大型电商的分类树——它们的命名是被流量反复验证过的。
还有一个信号是本地内容社区。用户在论坛和问答里自发使用哪个词,那就是需求侧的真实表达,做长尾内容时优先用它。
两个词都收进站内搜索的同义词表,这个成本极低,但能挡掉一批零结果。
南北方言差异需要单独处理吗?
需要留意,但优先级低于符号和切分这两件事。
越南南北在发音上差异明显,在书写上差异小得多,标准书面语是统一的。所以对文字内容的影响远不如口语层面大。
真正有影响的是一小批日常词汇的地区偏好,比如某些食物、容器、日常用品的叫法南北不同。这类词如果正好落在你的品类里,需要单独处理。
骑行装备这类现代品类受影响很小,大部分词是全国通用的技术词或外来词。但如果做的是食品、家居、母婴这类高度生活化的品类,就要认真做一遍地区词表。
数字、日期和货币格式怎么写?
数字用点做千位分隔符、逗号做小数点,跟中文习惯正好相反,这是最容易被前端配置错的一处。
日期是日月年顺序。
货币的写法有个特点:单位数值很大,价格数字通常有六到七位,展示时几乎一定要加千位分隔符,否则完全没法读。而分隔符用错了会让价格看起来差一千倍。
这一条我建议单独列进上线检查清单。价格显示错误是所有本地化事故里后果最直接的一类,用户不会给你解释的机会。
字符集与字体上要注意什么?
越南语的字符分布在几个不同的码位区块里,基本拉丁字母之外,带记号的组合字符集中在两个扩展区。其中一个扩展区专门收双记号叠加的形态,做字符白名单时要把这几个区块都覆盖到,只放基本拉丁字母进白名单是最常见的漏配。
字体上要实测。不是所有字体都完整覆盖越南语的字符集,尤其是那些同时带元音记号和声调记号的字符,缺字形的话页面上会出现空白方框。
测试方法很简单:造一个包含所有六个声调乘以所有带记号元音的样例串,在目标字体下渲染一遍,肉眼过一遍有没有方框。这个动作十分钟,能避免上线后的尴尬。
还有一个细节:有些字体虽然有字形,但双记号叠加时的排版很挤,记号会碰在一起。这个在小字号下尤其明显,正文字号定下来之后要在真机上看一眼。
关键词工具在越南语上能用到什么程度?
比大多数小语种好用,因为越南的互联网人口基数大,长尾词返回零的情况没有欧洲小语种那么普遍。
但要注意两件事。第一是前面说的双形态问题,工具不会替你合并带符号和不带符号的量,得自己加。
第二是音节分写导致的词数误判。工具按空格数判断这是一个词还是一个短语,越南语的双音节词会被算成两个词,于是本来是核心词的东西被归到长尾里,竞争度估算也偏低。
用法上的调整是:别看工具给的词数分类,自己按概念数来判断长尾深度。一个概念就是一个词,不管它写出来占几个音节。
本地引擎和平台生态要单独做吗?
搜索引擎层面不需要。越南的搜索市场集中度高,不存在需要单独适配的体量级本土引擎,引擎层的打法差异属于另一个话题范畴,这篇不展开。
但有一件事必须提:越南的商业流量高度集中在几个本地电商平台和社交平台上,站外的存在感比欧洲市场重要得多。
这属于渠道策略,不影响语言层的结论,但它会影响你的资源分配——在越南做独立站,语言层做对了只是拿到入场券,流量结构和欧洲市场很不一样。
语言层的工作在这些渠道上同样有用:平台上的商品标题一样面临符号双轨和音节切分的问题,一份词表可以两边共用。
越南语的星期表达为什么容易差一位?
因为越南语的星期名是按序数命名的,而起点不是星期一。
星期日是一周的第一天,星期一因此是“第二天”,星期二是“第三天”,依此类推到星期六。也就是说,星期名里的那个数字,永远比中文习惯的星期数大一。
这个偏移会在几个地方咬人:配送时效的说明、营业时间表、活动倒计时、订单状态的预计送达日。翻译时如果译者按数字对应,或者你用了机翻,很容易整体错开一天。
更麻烦的是它错得很自然——译文语法完全正确,读起来也通顺,只有懂的人才看得出日期错了。建议把所有含星期的文案单独抽出来做一轮专项校对,别指望在通读全文时能发现。
顺带说一句,星期六和星期日的叫法不走这个序数规律,它们各有专名,所以自动化处理时更容易出错,因为规律在末尾断了。
人名和称呼会影响哪些字段?
影响三处:表单字段、客服文案、以及邮件与推送的称呼。
越南人名的书写顺序是姓在前、名在后,中间常有一个中间名。而日常称呼用的是最后那个字,也就是名,不是姓——这跟中文的习惯正好相反。
后果是,如果你的邮件模板按国际惯例取姓来称呼,越南用户收到的是一个相当疏远甚至有点怪的叫法。正确做法是取名字的最后一段。
表单这边,把姓名拆成姓和名两个字段在越南是可行的,但中间名的处理要留余地,字段长度别卡太紧。更省事的做法是给一个完整姓名字段,另外单独存一个用于称呼的短字段,让用户自己填。
还有一层:越南语的称呼词按辈分和年龄区分,用错了会显得失礼。这一层交给本地文案处理,别自己发挥,也别用机翻。
地址字段和行政区划该怎么设计?
越南的行政层级和邮编体系跟欧洲市场差异明显,套用通用模板会在结账页丢单。
地址由省级、区级、坊级三层加街道门牌组成,用户填写时的习惯顺序是从小到大——先门牌街道,再往上走,跟中文习惯一致,跟欧美表单的常见顺序相反。
所以省市区的下拉选择器要按本地顺序排布,而且三级要联动。用户在一个乱序的地址表单前的耐心非常有限。
邮编在越南的使用率不如欧洲高,很多用户不记得自己的邮编,所以别把它设成必填,或者提供按行政区自动带出的能力。
还有一条实际经验:地址字段里必然出现带记号的地名,字符白名单和后端存储的字符集都要覆盖到,否则地址存进去是乱码,配送标签打出来就是废纸。
南北口音会不会影响语音搜索?
会,而且这是南北差异真正有杀伤力的地方——比文字层面大得多。
前面说过南北的书写差异小,但发音差异明显,某些声调在南方口音里合并了,某些辅音的读法完全不同。
对语音识别的后果是:同一句话,南方用户说出来和北方用户说出来,识别结果可能落到不同的文字上。而识别错的那部分,你的页面再怎么优化也接不住。
这件事在内容层没法解决,但它会影响你的判断——如果你的品类里语音搜索占比高,就该在同义词表里把因口音混淆而产生的近似形态也收进去,站内搜索至少能接住一部分。
另外,做视频和音频内容时要选口音。选哪一种取决于你的主要市场在南还是在北,两地用户对对方口音的接受度不错,但对配音里出现的口音是有感知的。
越南语内容的语气和信任元素有什么讲究?
语气上比欧洲市场热络一些,但比想象的克制。夸张的绝对化表述在这个市场同样会降低可信度,尤其在客单价偏高的品类上。
信任元素这边有几条本地特征。用户对“能不能货到付款”的关注度很高,即便最终选了线上支付,页面上有没有这个选项也会影响信任判断。
其次是真人可联系的程度。本地用户习惯在下单前跟卖家确认,客服入口的可见度和响应速度对转化的影响比欧洲市场大。
第三是社会证明。评价、实拍图、使用视频在越南市场的权重高于欧洲,产品页上有没有这些内容,直接决定用户停留还是离开。
这几条都不是语言问题,但它们决定了你的越南语内容该写什么。把力气全花在词形和切分上、却不管内容里说了什么,是本地化最常见的一种走偏。
越南语的搜索长尾能做到多深?
比大多数小语种深,因为互联网人口基数大,但深度分布跟欧洲市场不一样。
需求侧的长尾主要集中在两类:使用场景与适配问题(这个装备配我这辆车行不行、这个尺寸适合我这个身高吗),以及真伪与质量(怎么辨别正品、这个价格合不合理)。
第二类在越南市场的量特别大,原因是市场上仿品流通较多,用户在下单前的验证需求比欧洲市场强烈得多。
这对内容策略是个明确的机会:做正品辨别、参数解读、避坑指南这类内容,在越南能拿到相当可观的自然流量,而且这批流量的转化意图很强——会花时间查真伪的人是准备买的人。
操作上把这类内容放在品类页的下游,用内链把流量导向具体产品页,转化路径比直接堆产品页短。
母语审校要盯哪几件事?
五条,前三条是越南语特有的。
符号完整性:所有展示文本的记号有没有打全,有没有漏掉某个音节的声调。这一条用程序辅助更高效——扫描全站文本,找出完全不带任何记号的越南语句子。
音节切分:品类词有没有被换行或截断切在音节中间。
词的选择:本族词、汉语借词、近代外来词有没有用在合适的语体位置上。
后两条是通用的:价格与数字格式是否正确、整体读起来像不像机器翻译。
上线之后先看哪几个指标?
三个,都能在两个月内给出明确信号。
站内搜索的零结果率,并且要按“查询是否带记号”分组看。如果不带记号那一组的零结果率明显更高,说明双轨匹配没配好,这是最优先要修的。
移动端与桌面端的搜索行为差异。移动端不带记号的比例应该显著更高,如果两边差不多,多半是你的日志采集把记号吃掉了,数据本身不可信。
价格页与规格页的跳出。这个指标暴露的是格式配置错误,尤其是千位分隔符。
保哥的经验是,越南语项目八成的问题都能被第一个指标照出来,而且修复动作明确——补索引字段,不需要改内容。
一份可以照着走的越南语启动清单
准备阶段做三件事:词表按概念组织,每行同时记带记号形态与去记号形态;整理一份两三百条的自定义品类词典准备喂给分词;把本族词与借词的语体分工标注清楚。
技术阶段做四件事:全部入口做统一的字符规范化并选定一种形式;索引层给每条记录额外存一份去记号形态;查询时双字段匹配并给带记号形态更高权重;字符白名单覆盖全部相关码位区块,字体缺字形先实测。
内容阶段守两条:所有给人看的地方一律写全记号,URL和索引字段用去记号形态;截断一律落在音节边界上。
格式阶段单独核一遍价格显示,千位分隔符和小数点跟中文习惯相反,这是最容易出大事故的一处。
最后一句提醒。越南语的词形几乎不变,这让它在小语种里显得格外友好,但省下来的力气必须投到符号双轨和音节切分上去。把这两件事做扎实,剩下的部分确实比大多数小语种轻松。
常见问题解答
用户不打声调符号,是不是可以把页面也写成不带符号的?
绝对不行,这是最常见也最致命的误解。页面正文必须写带符号的完整形态,理由不是SEO而是专业度——不打符号在聊天窗口里是随意,出现在商业页面上就是不专业,越南用户对这一点的判断非常快,而且不带符号的长文本存在真正的歧义,同一串裸拉丁字母可能对应好几个不同的词,读一句话没问题读一整页会很累。正确的结构是展示层写全、匹配层双轨:索引时给每条记录额外生成一份去记号的形态和原形态一起存进索引,查询进来时同样做一次去记号处理,然后两个字段都查,带符号的匹配给更高权重,让精确输入的用户拿到更准的结果。这样两拨用户都能命中,而页面本身保持规范。去记号的处理不要自己写字符映射表,用标准的字符分解形式做——先把组合形态拆开再滤掉记号类字符,剩下的就是基本拉丁字母,照标准来比手写映射稳得多。
同一个词为什么会有两种合法的声调标法?
因为当一个音节里有两个元音字母时,声调记号标在前一个还是后一个存在两套并行的规范。一套是较早的传统标法,倾向标在靠前的元音上;另一套按音节结构规则决定落点,往往落在靠后的元音上。两套都在用,教科书和一部分出版机构用其中一套,另一批媒体和大量民间写作用另一套,输入法的默认设置也分两派。后果是一个完全规范书写的词仍然可能有两种合法的字节序列,这跟打不打记号是两个独立的问题,叠加起来同一个概念在搜索侧最多能分出四种形态。实操上展示层选定一套全站统一,拿不准就跟本地主流媒体走;匹配层把两套都收,给索引加一个归一字段折叠到同一个键上;关键词表扩一列,两种标法都查量并相加。这一步经常被漏掉,因为两种写法肉眼差别极小很容易被当成同一个词。实际受影响的词大概占品类表的一到两成,但往往正好是高频的双元音品类词。
越南语的音节分写跟韩语的分写法是同一个问题吗?
形式相似性质完全不同。韩语的分写法是按词分的,空格落在词与词之间,规则复杂但目标明确就是把词分开,分写规则出错会改变句子意思,所以那是一个正确性问题。越南语的空格是按音节分的,不管两个音节属不属于同一个词中间都有空格,这不是规则复杂,是根本没有词级的形式边界。后果的方向也不同:韩语的坑是空格打错等于换了词,越南语的坑是空格永远是对的但它不告诉你词到哪儿结束。前者要解决准确率,后者要解决切分,两套问题两套办法,别把韩语那套分写规则搬过来。越南语的实际影响有四个:词组匹配失准、标题截断切在音节中间产出半个词、URL转写变长、关键词工具按空格算词数导致长尾判定和竞争度估算全偏。解决靠词典而不是规则,而且不用自己实现分词,只要把自己的品类词典喂进现成组件里就够,两三百个词条一天能整理完。
那个能让匹配率归零的编码坑到底是什么?
同一个带记号的字符,在编码上可能是一个码位,也可能是基本字母加一个组合记号共两三个码位。屏幕上看起来完全一样,字节层面完全不同,字符串比较、索引匹配、数据库唯一约束全都会把它们当成两个不同的东西。越南语是这个问题的重灾区,因为它的字符大量落在需要组合的那一类上,而不同来源的数据用的形式往往不一样:本地团队的输入法产出一种,供应商数据表是另一种,用户浏览器提交的可能是第三种。症状很典型,肉眼核对一模一样的两个词程序判定不相等。解决办法只有一句话:在所有入口做统一的规范化,选定一种形式全站只用这一种。入口包括数据导入、表单提交、接口接收、外部抓取和编辑器保存,漏掉任何一个都会往库里放进另一种形式。已有历史数据的先跑全量扫描统计混杂比例,这个数字通常比预期高,因为它从来不在页面上表现出来,只表现为一个说不清原因的低匹配率。
搜索引擎自己的拼写纠错能不能替我兜底?
能兜一部分但不能当成方案,理由有三条。第一,纠错发生在引擎那一侧,它决定给不带记号的查询匹配哪些结果,这个过程你无法干预也无法预测,押注在一个黑盒上不是策略。第二,纠错在竞争激烈的词上帮不了你,当同一个查询有一批页面都能匹配时排序看的是其他因素,而你的页面如果只有一种形态,在相关性上就是弱势的一方。第三也是最实际的:站内搜索没有人替你兜底,用户在你自己的搜索框里敲不带记号的词,如果没做双轨就是实打实的零结果,跟外部引擎的能力毫无关系,而站内搜索的零结果直接对应流失。所以正确的心态是把外部引擎的容错当成额外收益,自己该做的一样不能少。还要补一句:三种输入方案带来的用户错误模式不同,用数字键指定声调那一套误触会产出带错误声调的合法词,用字母做修饰键那一套误触会产出多了字母的非词,前者要靠同义词和相似度处理,后者靠编辑距离就够。
越南语没有词形变化,是不是词表工作会很轻松?
词形数量确实小,越南语是分析型语言,词本身不变形,没有格、没有性、没有数的屈折,动词也不按时态变位,语法关系靠语序和虚词表达,所以做过俄语波兰语芬兰语那种一个名词几十种形态的市场之后来做越南语会觉得轻松得不真实。但概念数量不小,而且有一个别的语言没有的膨胀源:同一个概念常常有一个本族说法和一个外来说法并存。越南语历史上从汉语借入了大量词汇,近代又从法语和英语借入一批,很多概念因此有两三个可用的词,语体色彩不同——借自汉语的往往更书面正式,本族词更口语,近代外来词多用于技术和时尚领域。用户搜索时选哪一个取决于场景,查规格参数时倾向正式词,描述使用需求时倾向口语词。分工规则是标题和分类名用识别度最高的那一个,正文里两个都自然出现,全部收进站内搜索同义词表。识别度最高的通常不是最正式的,判断方法是看本地大型电商的分类树。
价格和数字格式为什么要单独列进检查清单?
因为它是所有本地化事故里后果最直接的一类,而且越南语这边特别容易出事。数字格式用点做千位分隔符、逗号做小数点,跟中文习惯正好相反,这是前端配置最容易搞错的一处。更要命的是越南的货币单位数值很大,价格数字通常有六到七位,展示时几乎一定要加千位分隔符否则完全没法读,而分隔符用错了会让价格看起来差一千倍——用户看到一个离谱的价格不会给你解释的机会,直接关页面。日期是日月年顺序这一条相对不容易出事,但也要核。建议的做法是把价格显示单独列一条上线检查项,在真机上用真实商品数据看一遍,尤其是那些价格位数不同的商品,六位数和七位数的显示都要看到。另外促销页上的折扣计算、满额门槛这类衍生数字也要一起核,它们经常走的是另一套格式化逻辑。
权威参考资料
本文标题:《越南语SEO要接的是两拨人,一半打声调符号,另一半从来不打》
本文链接:https://zhangwenbao.com/vietnamese-seo-tone-marks-syllable-spacing-keyword.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0