在非洲选语种别先看人口,先看有没有人拿这门语言写价格和退货政策
本文目录
- 非洲的语种表为什么不能按使用人口从上往下勾?
- 人口排名表的诱惑
- 三种人口不是同一批人
- 三张表错位的实际后果
- 判断一门语言能不能承载页面,该看什么?
- 把问题换成一句朴素的话
- 四个可以查的信号
- 斯瓦希里语的答案很干脆
- 豪萨语与阿姆哈拉语要分开看
- 承载度三档具体怎么分工?
- 第一档:整站承载
- 第二档:只做词表与内容层
- 第三档:整块交给殖民语
- 斯瓦希里语凭什么排在最前面?
- 它同时是国语和区域工作语言
- 书写标准稳定,审校资源找得到
- 它的边界在哪里
- 豪萨语的正字法为什么在键盘上打不出来?
- 四个带钩字母是标准的一部分
- 连字体都不一定有这几个字形
- 用户实际打的是退化拼法
- 跟希腊语那个案例正好反过来
- 法语区的法语,跟你写的那种法语是同一种吗?
- 词汇差异比想象中系统
- 价格与支付的表述差别最大
- 什么时候需要单独的非洲法语版本
- 语言边界、货币边界和物流边界为什么不重合?
- 同一个名字的货币其实是两种
- 域名与站点结构该按哪条线切
- 物流按承运商的覆盖切
- 三线错位表怎么画
- 移动端和流量成本会怎么改写语言决策?
- 页面重量在这里是硬约束
- 字体子集要单独算一笔
- 语言版本数量本身就是成本
- 内容做出来之后,谁来审、外链去哪里找?
- 审校资源的分布跟语言地位一致
- 本地目录与媒体是可用的
- 社群渠道要按平台分开看
- 怎么排期,怎么定试水期?
- 三个月试水期只做词表
- 三条不依赖语言能力的检查
- 升档与退档的条件
- 常见问题解答
- 非洲市场应该先做哪一门语言?
- 豪萨语的关键词表到底该用哪种拼法?
- 法语区能不能直接复用欧洲的法语站?
- 非洲市场的语种数量做多少合适?
- 阿姆哈拉语值不值得投入?
- 怎么判断本地用户到底用哪门语言搜索?
- 页面上的方框字是怎么回事,怎么避免?
- 权威参考资料
摘要:非洲的语种选择通常是从一张使用人口排名表开始的,从上往下勾几门看着够大的语言。这张表回答不了真正的问题。真正该问的是:有没有人拿这门语言写价格、写退货政策、写客服话术。有,它就能承载一整个站点;没有,它只能承载关键词和内容,剩下的交给殖民语。
非洲的语种表为什么不能按使用人口从上往下勾?
人口排名表的诱惑
做非洲市场的第一份材料,通常是一张语言使用人口排名表。
表上的数字都很大,几千万起步,最上面几门过亿。
照着这张表勾三门语言,方案看起来立刻就有了依据。
问题在于,这张表统计的是会说这门语言的人,跟买东西的人是两回事。
会说和会写是两回事,会写和会拿它上网购物又是两回事。
中间每一道折损都不小,叠起来能差出一个数量级。
非洲是全球语言密度最高的地区之一,光是尼日利亚一国境内的语言数量就是几百这个量级,在这样的地方按人口排名做决策,等于把一个多层筛选问题压扁成了一次排序,而被压掉的那几层恰好是决定成败的部分。
这张表还有一个隐蔽的问题,它把一门语言在不同国家的地位抹平了。同一门语言,在甲国是国语、在乙国只是家庭用语,表上却只有一个合计数。做区域方案的时候,这个合计数会诱导你把两个国家放进同一个桶,而它们的落地做法可能完全相反。看排名表时,最该先做的动作是把每一行按国家再拆开一次。
三种人口不是同一批人
把这件事拆细一点,需要区分三个数。
第一个是使用人口,也就是会说这门语言的人。
第二个是检索人口,会用这门语言在搜索框里打字的人。
第三个是购买人口,会用这门语言完成一次线上支付的人。
这三个数从左到右逐层缩小,缩小的比例每门语言都不一样。
斯瓦希里语三个数之间的落差相对温和,豪萨语的落差就很陡。
落差为什么会陡,答案不在语言本身,而在这门语言有没有被用于书面商业场景,这也是下一节要展开的判据。按母语人口排优先级那篇讲的是同一件事的通用版本,非洲把这个问题放大到了极端。
三个数之间的落差还可以拿来做一个粗略的判断:落差越陡,这门语言越适合停在词表层。落差平缓说明书面使用与口语使用接近同步,页面写出来有人读;落差陡说明大量使用者在需要写字的场合会切换到另一门语言,页面写出来也接不住人。这个判断不需要精确数字,量级对得上就够用。
三张表错位的实际后果
错位不是理论问题,它会具体地表现出来。
典型症状是页面上线之后收录正常,流量接近于零。
不是排名不好,是根本没有人用这门语言搜这批词。
另一种症状是流量有,咨询全部换成另一门语言进来。
用户看得懂你的页面,但他要问问题的时候会自动切回英语或法语。
这两种症状都说明语言层选错了,跟内容质量没有关系。
我们给一家做太阳能灯与家用小电器的客户排过一次非洲的语种优先级,第一版按人口排,豪萨语排在斯瓦希里语前面;三个月后豪萨语页面的自然流量是个位数,而同一批商品的英语页面在同一个国家跑得好好的,问题不在页面,在于那批用户搜索时用的根本不是这门语言。
还有第三种症状更隐蔽:流量和咨询都正常,但复购极低。这通常意味着首次购买是靠广告推来的,用户并没有把这个站当成可以再来的地方。语言只是其中一个原因,但它是最容易验证的那个,把客服对话按语言分组统计一遍复购率,两个小时就能得出结论。
判断一门语言能不能承载页面,该看什么?
把问题换成一句朴素的话
判据可以压缩成一个特别不学术的问题。
问:这门语言里,有没有人拿它写过价格、退货政策和客服话术?
注意问的不是有没有人说,也不是有没有文学作品。
问的是有没有成规模的书面商业语域。
商业语域的存在,意味着有一套现成的措辞、格式和惯例可以借用。
不存在,意味着你得从头发明一套,而用户没有义务看懂你发明的东西。
这个判据的好处是它可查、可证伪,而且不需要任何语言学知识,一个不懂这门语言的项目经理花两小时就能得出结论,比拿着人口表开三次会靠谱得多。
这个判据还能挡住一类常见的情绪化论证。做本地化的人常会说,用母语才是尊重用户。这句话本身没错,但它默认了母语等于书面商业语言,而在非洲的多数地区这两者并不重合。用一门当地人自己都不用来谈钱的语言写价格页,不叫尊重,叫误判使用场景。
四个可以查的信号
怎么查,看四个信号就够。
第一,本地主流媒体有没有这门语言的商业与财经版面。
第二,政府和监管机构的公开文书用不用它。
第三,当地电商平台和支付应用的界面提不提供这门语言。
第四,本地品牌的广告投放里有没有这门语言的文案。
四个信号里满足三个,基本可以判定商业语域成立。
第三个信号权重最高,因为平台愿意做一门语言的界面,说明它算过账,而这笔账跟你要算的那笔几乎是同一笔,免费借用别人已经做完的市场调研,是这个判据最实惠的地方。
四个信号还有一个使用顺序上的讲究:先查第三个,再查其余三个。因为平台界面的语言选择是可以在几分钟内自己验证的,打开当地最大的电商应用或支付应用看一眼语言列表就有答案。前两个信号需要翻文档,第四个需要看广告投放,都比它慢。全网站点的内容语言分布统计可以当第五个辅助信号,看这门语言在真实网页里的占比量级。
斯瓦希里语的答案很干脆
拿这四个信号去量斯瓦希里语。
它是坦桑尼亚和肯尼亚的官方语言之一,政府文书大量使用。
区域组织把它列为工作语言,联合国教科文组织在2021年设立了专门的国际日。
本地媒体有完整的商业报道,广播电视的覆盖面很大。
更关键的是,它有一个国家级的语言规范机构长期维护书写标准。
这意味着拼写稳定、术语有据可查、审校资源找得到。
四个信号全中,所以它是整个东非唯一一门可以承载完整站点的本土语言,这门语言的国际地位与设立缘由写得很清楚,拿它做内部立项材料比任何二手统计都硬。
还有一个容易被忽略的加分项:它在东非几个国家之间是通用的。也就是说,这一份内容可以同时服务多个市场,而多数本土语言只能服务一个国家。可跨国复用的语言资产,摊薄成本的能力是不可跨国复用语言的好几倍,这一条在算投入产出比的时候权重应该给得很高。
豪萨语与阿姆哈拉语要分开看
另外两门经常被一起提起的语言,答案不一样。
豪萨语的媒体覆盖很强,国际广播机构做了几十年的豪萨语频道。
但商业书面语域薄,本地电商和支付界面几乎不提供这门语言。
阿姆哈拉语的情况又不同,它有独立的书写系统和长期的书面传统。
可它的使用范围高度集中在一个国家,而那个市场的跨境电商基础设施尚在早期。
两门语言的结论都是不承载整站,但原因完全不同,一个是语域问题,一个是市场基础设施问题。
把结论相同、原因不同的两门语言混在一起讲,是很多非洲方案里最含糊的一段,而原因不同意味着未来的解锁条件也不同:豪萨语要等电商界面本地化,阿姆哈拉语要等支付与物流跑通,豪萨语的谱系与分布条目能帮你把这两条线分开记。
顺带说一句它们的共同点:这两门语言的媒体内容都很丰富,所以拿媒体覆盖当判据会得出错误结论。广播和新闻属于单向传播,它对语言的要求是能听懂;商业交易属于双向确认,它对语言的要求是能白纸黑字写清楚责任。两种场景的门槛差得很远,用前者的繁荣推断后者的可行性,是这类方案里最常见的一次跳跃。
承载度三档具体怎么分工?
第一档:整站承载
第一档的意思是这门语言可以撑起一个完整站点。
从商品标题、详情、政策页到客服模板,全部用它写。
语言标签、站内搜索、邮件模板也一起换过去。
进入这一档的门槛很高,非洲本土语言里目前只有斯瓦希里语稳稳站住。
南非的几门本土语言接近门槛,但当地英语的强势地位削弱了必要性。
判断标准仍然是前面那四个信号,不是使用人口。
这一档的投入大约等于新增一个完整市场,工期按季度算,所以决定进这一档之前,最好先用第二档跑三个月试水,用真实数据确认需求存在,而不是拿一份人口表说服自己。
进入第一档还有一项容易漏算的义务:这门语言的内容需要跟主站保持同步更新。促销、政策、商品变更每次都要多一份。如果团队没有稳定的排期能力,第一档的内容会在半年后变成一堆过期信息,而过期的本地语页面比没有本地语页面更伤信任,因为用户会按上面写的时效和价格来要求你。
第二档:只做词表与内容层
第二档是绝大多数语言的正确落点。
做法是关键词表收录这门语言的高频购买词,内容层出几篇针对性的问答。
商品页、结算流程、政策页仍然用殖民语。
用户搜本土语的词进来,落到一个用英语或法语写的页面上。
这在当地是完全自然的体验,因为他们本来就习惯两门语言并存。
成本极低,通常是一个人两周的工作量。
这一档最容易被跳过,因为它既不像做完整本地化那样有汇报价值,又不像完全不做那样省事,但它的投入产出比在所有档位里最高,关键词工具没数据时的补数办法正好是这一档需要的全部方法论。
第二档的具体交付物可以定得很死:一份带频次的本土语关键词表、三到五组用这门语言写的问答、以及站内搜索的同义词映射配置。三样东西加起来不超过十页纸,却能让整个市场的检索覆盖上一个台阶。把交付物定死的好处是它可验收,不会滑向做一半的本地化。
第三档:整块交给殖民语
第三档是不做这门语言的任何内容。这跟菲律宾那种嵌套双语市场的处理逻辑相通,用户本来就在两门语言之间自由切换,页面分叉并不能给他更多东西。
适用于书面商业语域几乎不存在、且使用者高度双语的情形。
西非法语区的多数本土语言属于这一档。
不做不等于不管,要做的是把殖民语那一侧写得更贴近当地。
也就是把预算从语种数量转向单一语种的本地化深度。
这个转向在汇报材料里不好看,做的语言数量从五门缩到一门。
但它带来的实际收益通常更高,因为一门写得地道的法语页面,胜过五门谁也不会用来搜索的本土语页面,语种数量是最容易被拿来当业绩的指标,也是最容易脱离真实需求的指标。
第三档里还有一个反直觉的动作值得做:在殖民语页面里适当保留几个本土语的高频词。比如商品名旁边加一个当地叫法,或者在问答里引用用户的原话。这几个词不影响页面的主体语言,却能接住那批用本土语搜索的查询,成本几乎为零,属于第三档里唯一值得做的语言层动作。
斯瓦希里语凭什么排在最前面?
它同时是国语和区域工作语言
斯瓦希里语的特殊地位来自两个层面。
一个是国家层面,坦桑尼亚把它当国语,教育和行政全面使用。
另一个是区域层面,东非区域组织把它列为工作语言。
2022年初,非洲大陆层面的组织也把它纳入工作语言。
这意味着它的使用场景不断从口语向正式书面场景扩张。
对做内容的人来说,正式场景越多,可参照的措辞就越多。
这一点可以直接验证:非洲联盟官网的斯瓦希里语版本是完整维护的,一个大陆级组织愿意长期维护一门语言的全站内容,说明这门语言的书面表达能力足以承载政策、财务和法务这些最挑剔的文体。
工作语言这个身份还有一个连带效果:大量政策与法律文本会被正式译成这门语言并公开发布。这些文本对做内容的人来说是极好的语料,因为它们提供了正式文体的措辞样本,写退货政策和服务条款时可以直接参照。多数小语种最缺的恰恰就是这类正式文体的参照物。
书写标准稳定,审校资源找得到
第二个优势是工程上的。
它用拉丁字母书写,没有额外的附加符号,键盘直接打得出。
没有变音符号意味着不存在拼写变体爆炸的问题。
国家级的语言委员会长期发布术语标准,新词有官方译法可查。
这在小语种里是难得的待遇,多数语言的新技术词全靠民间约定。
审校人才也相对好找,两国有成熟的翻译与媒体行业。
拼写稳定这件事的价值,做过带附加符号语言的人最清楚:不用维护三套变体、不用担心搜索匹配漏掉一半、不用给字体额外加子集,国家斯瓦希里语委员会的术语工作相当于免费提供了一份持续更新的术语库。
还有一个工程上的便利经常被忽略:没有附加符号意味着URL可以直接用本土语词,不需要转写也不会产生百分号编码长串。本站讨论过本地字母与拉丁转写的取舍,那套权衡在这门语言上根本不存在,这是它相对其他非拉丁或带符号语言的一项隐性优势,省掉的是一整类问题而不是一个参数。
它的边界在哪里
优势说完,边界也要说清楚。
在肯尼亚,城市中产的线上购物语言大量是英语。
斯瓦希里语在那里更多用于日常口语与本地服务。
所以同一门语言在两个国家的商业权重是不同的。
坦桑尼亚一侧的本土语权重明显更高,肯尼亚一侧要跟英语分账。
做区域方案时,这两个国家不能填同一个数字。
更细一层的差别是品类相关的,快消与本地服务偏斯瓦希里语,电子与跨境商品偏英语,该国2022年的数字生态数据里的平台使用与设备结构可以帮你判断自己的品类落在哪一侧。
两国的差别还体现在正式程度上。坦桑尼亚一侧的书面标准更严格,用词更规范;肯尼亚一侧的日常表达里混入英语词的比例明显更高。这意味着同一份内容在两国的自然度不一样,理想做法是主体共用、把混用度高的那几处做成地区变体,而不是硬凑一个两边都不太像的中间版本。
豪萨语的正字法为什么在键盘上打不出来?
四个带钩字母是标准的一部分
豪萨语的书写有一处很特别的地方。
它的标准正字法里有四个带钩的字母,用来表示内爆音和喉化音。
这四个字母不是装饰,它们区分词义,去掉之后会产生歧义。
也就是说,按标准写和按简化写,是两种不同的字符串。
关键词匹配是按字符串做的,两种写法在系统看来毫不相干。
这跟带变音符号的欧洲语言是同一类问题,但严重程度高一档。
严重在哪里:欧洲语言的变音符号至少在多数键盘布局上有输入方案,而这四个字母在通用输入法里几乎没有位置,豪萨语的字母表与拼写体系里能看到它们的标准形态,看完你就会明白为什么普通用户不会去打它们。
这四个字母还有一个连带影响,它们会让自动化的语言识别出错。带钩写法和退化写法在模型看来相似度很低,同一批内容可能被识别成两门语言,从而在报表里被拆成两行。做数据统计之前,先把这几个字母做一次归一化映射,否则你看到的所有分语言数字都是偏的。
连字体都不一定有这几个字形
还有一层更底层的问题。
这几个字母散落在拉丁扩展区和国际音标扩展区,不在基本拉丁区。
很多覆盖面很广的字体并不包含这几个字形。
我们在给这一批文章做配图素材时实测过一次,一套覆盖了中日韩全部汉字与欧洲拉丁扩展的大字体,这四个字母一个都没有,渲染出来全是方框。
字形缺失的后果是,即使用户想打,页面上也可能显示不出来。
而方框比拼写错误更劝退,用户会直接判定这个站有问题。
这条约束把语言选择跟前端资源直接绑在了一起,网页字体字形集那篇里算的那笔首屏成本账在这里要再加一项:你可能得为四个字母单独引一套字体,而这四个字母出现的频率并不低。
字形缺失还有一个很实际的排查难点:它在开发者的机器上往往不复现。开发机装了大量字体,系统会自动回退到某一款包含该字形的字体,页面看起来一切正常。而用户的手机上没有那一款字体,方框就出来了。所以这类问题必须在干净环境里验,不能靠本地目测。
用户实际打的是退化拼法
那用户到底打什么。
答案是用基本拉丁字母的对应字母替代,钩全部去掉。
这种写法在当地网络文本里占绝对多数,没有人觉得它不对。
所以关键词表的主键必须是这种退化拼法,标准写法只能当别名。
页面正文可以按标准写,标题和关键词覆盖必须按退化写法来。
这个分工跟正文与词表分离的做法一致,只是这次两边的差别落在字符层。
如果只能记住一句话,就记这句:凡是设备打不出来的正字法,它在关键词表里就不是主键,无论它在语言学上多么正确。判断一个字母能不能打出来,看它的码位落在哪个区块最快,基本拉丁区之外的都要额外验证一遍。
退化拼法当主键还有一个副作用要提前接受:它会跟别的词产生同形冲突。去掉区别性符号之后,原本不同的两个词可能变成同一串字符。处理办法不是恢复符号,而是在关键词表里给这类词加上语境修饰词,用组合来消歧。这跟希伯来语那种辅音写法的处理思路是一样的。
跟希腊语那个案例正好反过来
这里有一处值得玩味的对照。
希腊语市场的问题是用户用拉丁字母打希腊语词,标准写法仍然是主流。
豪萨语市场的问题是标准写法根本进不了输入环节。
前者是两套字母并存,主次分明;后者是一套字母的完整版与残缺版并存,残缺版占多数。
所以前者的解法是让标准写法当主键、转写形态做覆盖。
后者的解法必须倒过来,退化写法当主键、标准写法做补充。
同一套方法论在两个市场给出相反的排序,判断依据只有一条:希腊语那篇讲的覆盖顺序成立的前提是标准写法打得出来,这个前提一旦不成立,整个排序就要翻过来重排。
把这两个案例并排放着,还能提炼出一条更通用的判据:决定主键的不是语言标准,是输入链路。用户从键盘到搜索框这条链路上能稳定产出的形态,就是主键;链路上产不出来的形态,无论多标准都只能当别名。正字法归语言委员会管,主键归输入法管,这两件事从来不是同一件。
法语区的法语,跟你写的那种法语是同一种吗?
词汇差异比想象中系统
西非和中非有一大片法语区市场。
很多团队直接把欧洲法语站复制过去,认为语言相同就够了。
实际上非洲法语有一批稳定的本地用法,尤其在日常商品和服务领域。
这些词不是俚语,它们出现在正规的媒体和广告里。
用欧洲法语的说法,不算错,但接不住用本地说法搜索的那批人。
这跟魁北克那一侧的情况结构相同,只是词表内容完全不同。
法语的地区变体问题在本站讲过一次,法语重音符号与魁北克变体那篇给的判据在这里同样适用:先查本地媒体怎么写,再决定词表收哪一个形态,别拿词典当依据。
核对本地用法的时候有一个偷懒的办法:看当地大型零售商的官网和促销页。他们的文案是花钱投放过、被市场验证过的,用词比任何词典都贴近真实。把三五家的商品分类名抄下来做成对照表,一个下午就能得到一份可用的本地词汇基线,比找译者从头造词可靠得多。
价格与支付的表述差别最大
差异最集中的地方不是商品名,是交易相关的表述。
货币单位、分期方式、移动支付的说法,各地都有自己的习惯。
移动钱包在这一带是主流支付方式,它的说法直接进搜索词。
配送与自提点的名称也高度本地化,跟欧洲的物流词汇几乎不重合。
这批词的购买意图极强,漏掉它们等于漏掉最下游的那批查询。
做法很直接,把交易环节的每一个名词都拿到本地媒体里核对一遍。
这件事的工作量小得惊人,通常半天就能列完,但它的收益比重写十篇商品文案都高,因为它命中的是已经决定要买、只差最后一步的那批人。
交易表述里还有一处最容易翻车:分期与赊购的说法。这一带的分期形态跟欧洲的信用卡分期不是一回事,很多是基于移动钱包或者本地小额信贷的产品,名字也完全不同。照搬欧洲说法的页面,用户读完不知道你到底支不支持他惯用的那种付款方式,于是直接离开。
还有一个跟支付说法紧密相连的字段是手续费归属。这一带的移动支付里,手续费由谁承担各家规则不同,用户对这一项非常敏感。页面上不写清楚,客服就要一条条解释,而这批问题在工单里的占比常年排前三。
什么时候需要单独的非洲法语版本
要不要为非洲法语做独立版本,看两个条件。
第一,交易环节的词汇差异是否已经导致明显的漏词。
第二,价格、税费、配送政策是否跟欧洲那一侧根本不同。
第二个条件通常成立,因为货币和法规都不一样。
所以多数情况下需要的是独立的地区版本,而不是独立的语言版本。
也就是说,语言标签换地区码,内容做局部替换,而不是重写。
局部替换的范围可以控制在两成以内,主要是交易表述、政策条款和几十个本地词,其余内容整段复用,这一点跟本站讲同语言多地区那套方法一致,只是这里的地区差异比欧洲内部大得多。
还有一个判断条件常被忽略:客服的排班时区。如果这批市场跟欧洲总部有明显时差,且客服无法覆盖,那么内容做得再地道也会卡在响应速度上。这条跟语言无关,但它经常是决定要不要开一个地区版本的真实约束,写方案时最好把它跟语言条件并列写出来,免得后面被当成意外。
语言边界、货币边界和物流边界为什么不重合?
同一个名字的货币其实是两种
先说一个很多人不知道的细节。
西非和中非各有一种名字相同的法郎,代号却是两个。
两者的面值挂钩相同,但它们不是同一种货币,跨区不能直接流通。
也就是说,两个都说法语的国家,可能属于两个不同的货币区。
结算、定价、退款流程按货币区走,不按语言走。
把它们放进同一个价格模板,账会在某一天对不上。
两个货币区各有自己的中央银行与监管框架,西非货币联盟央行的职责说明里能查到成员国名单,做定价方案之前把这份名单跟你的语言分组叠一遍,会发现两张图长得完全不一样。
货币这条线还牵着定价策略。两个货币区的汇率安排与通胀水平并不完全同步,同一个商品在两边用同一个数字标价,实际购买力差别可能很大。所以价格不能只做一次换算,要在每个货币区单独定一次锚点价,这件事属于商业决策,但它的执行落在页面模板上,得提前留好字段。
域名与站点结构该按哪条线切
三条线不重合,站点结构就得选一条来切。
按语言切,同一个语言目录下会混进多个货币和多套政策。
按国家切,站点数量会膨胀到难以维护。
可行的折中是语言做目录、国家做地区变体、货币和政策做数据字段。
也就是让最不稳定的那几项别写死在页面里。
这样新增一个国家只是加一行配置,而不是复制一整套内容。
国家域名的管理政策差别也不小,注册资格和本地实体要求各国不同,该国国家域名的委派信息里有管理机构与政策链接,选域名结构之前应该先看它,而不是先看哪个后缀更好记。
还有一个结构选择要一并定下来:语言目录与国家参数谁在前。放在路径前段的那个维度,天然获得更强的聚合信号;放在后面或者放进参数的那个维度,会被稀释。hreflang与多语言站结构那篇里讲的标注方法在这里仍然适用,只是需要标注的组合数量因为货币线的存在而多出一倍。
物流按承运商的覆盖切
第三条线又是另一个画法。
物流覆盖跟着承运商的网络走,跨国网络往往覆盖多个语言区。
同一家承运商可能同时服务英语国家和法语国家。
所以配送时效和自提点信息的维护单元,既不是语言也不是货币。
这就是第三条互不重合的边界。
页面上要写的时效数字,得按这条线取值。
三条线各画各的,最后落到页面上的每一个字段都要指明它跟着哪条线走,这张对照表一旦画出来,团队里关于要建几个站的争论通常十分钟内就能结束。
物流线还有一个内容层的影响:自提点的名称和位置说明必须用当地人认得的地名,而不是行政区划的官方名。同一个地点,官方名和民间叫法可能完全不同,用户按民间叫法搜索,也按民间叫法判断远近。这批地名同时是一批可观的本地长尾词,写对了顺带就把词覆盖了。
三线错位表怎么画
画法很简单,一张三列表就够。
行是你要进的市场,列是语言、货币、物流网络。
把每个市场在三列里的取值填进去。
然后看哪几行的三个取值组合是唯一的,那就是必须独立维护的单元。
取值完全相同的几行可以合并成一个单元。
通常十个市场能合并成四到五个维护单元。
这张表还有一个副作用,它能挡掉一类很常见的提议:既然都说法语,就合成一个站吧。表一摆出来,提议的人自己就会发现货币那一列填不下去,把隐性冲突变成表格里填不满的格子,比在会上争论有效得多。
表画完之后建议再加一列:内容语言。因为维护单元是按三条线的组合切出来的,而每个单元用哪门语言写,是另一个独立决定。有的单元语言相同货币不同,有的单元货币相同语言不同。把内容语言单列一列,能避免把维护单元数量和语言版本数量这两个概念混起来算。
移动端和流量成本会怎么改写语言决策?
页面重量在这里是硬约束
非洲多数市场的上网方式以移动端为主。
数据资费在收入中的占比明显高于其他地区。
用户对页面加载失败的容忍度很低,因为那等于白花了流量。
所以页面重量在这里不是体验指标,是转化指标。
多做一门语言,往往意味着多一套字体、多一批图片、多几个脚本。
这些代价在预算表里从来不出现,因为它们记在前端而不是内容。
网络与设备的基础数据可以在国际电信联盟的统计栏目里查到,看一眼移动宽带渗透率与资费占收入比例这两个数,你对页面重量的容忍度会立刻降下来。
页面重量的账还要算上重试成本。弱网环境下一次加载失败,用户往往会再刷新一两次,这几次重试消耗的流量都记在他的账单上。所以一个偏重的页面在这些市场的真实代价,不是它的字节数,而是字节数乘以平均重试次数,这个乘数在网络条件差的区域可以到两倍以上。
还有一个容易被忽视的重量来源是第三方脚本。统计、客服插件、评价组件这些东西在总部看来是标配,在弱网市场却可能占到首屏体积的一半。做区域方案时应该给这些脚本单独列一张表,按市场决定装哪几个,而不是全站一套配置走天下。
字体子集要单独算一笔
字体这一笔特别值得单列。
拉丁字母的基本区很小,任何字体都覆盖。
豪萨语那四个字母、约鲁巴语的附加符号字母都在扩展区。
要正确显示它们,就得引入包含这些字形的字体或者做子集合并。
阿姆哈拉语更极端,它是一整套独立的书写系统,字形数量以百计。
这几笔加起来,可能比内容翻译本身还贵。
算这笔账的方法本站写过,把字形集当成一项独立的首屏成本来估,而不是等前端上线之后才发现首屏多了两百KB,语种选择在多数团队里是内容部门做的决定,可它的账单有一半开给了前端。
字体这一项还有一个折中方案值得考虑:本土语内容用系统字体,不引自定义字体。牺牲一点排版一致性,换来零字体开销和零方框风险。多数本土语页面的角色是承接检索而不是塑造品牌形象,这个交换在第二档语言上几乎总是划算的,只有第一档语言才值得为字形付出首屏预算。
语言版本数量本身就是成本
还有一项隐性成本经常被忽略。
每多一个语言版本,回归测试、内容同步、审校排期都要多一份。
这份成本不随内容量变化,只随版本数量变化。
三门语言和六门语言的差别,不是内容量翻倍,是协调复杂度翻几倍。
所以砍掉一门低效语言的收益,远大于它对应的那点翻译费。
这也是承载度三档的意义所在,它让多数语言停在第二档,只做词表。
第二档的语言不产生版本,只产生词条,而词条的维护成本几乎为零,这个区别是整套方法里最省钱的一处设计,也是最容易在汇报时被误解为不够重视某个市场的一处。
版本数量的成本还有一个滞后特征:它不在上线时显现,而在第一次大改版时集中爆发。改一次导航、换一次模板、加一个法务提示,都要乘以版本数量。所以评估要不要新增一个版本,正确的问法不是这次做它要多少钱,而是未来两年每一次改版都要多付多少钱。
版本数量还会影响一件很少被提起的事:内部知识的稀释。版本越多,每个版本得到的注意力越少,最后所有版本都停留在能用但不出彩的水平。集中做少数几个版本,反而更容易做出一个真正地道、能被当地用户认出来的站点。
内容做出来之后,谁来审、外链去哪里找?
审校资源的分布跟语言地位一致
审校这一环在非洲市场差别极大。
斯瓦希里语有成熟的翻译与媒体行业,找人不难。
豪萨语的审校者多集中在广播与新闻背景,商业文案经验偏少。
法语区反而最容易,因为法语的专业服务市场很成熟。
选语种时把审校可得性当成一个显性条件,能省掉后面很多麻烦。
找不到稳定审校的语言,本身就不适合进第一档。
验收口径也要提前定死,要的是可执行的问题清单而不是改好的稿子,母语审校验收清单那篇里那套判据在这里一字不用改,唯一要加的是让审校者标注哪些词是他自己也拿不准的新词。
审校资源还可以换一个找法:不找翻译公司,找当地做客服或者做电商运营的人。他们每天都在用这门语言跟买家沟通,对措辞的判断比科班译者更贴近真实场景。代价是他们不擅长处理长文本的一致性,所以适合审校商品页和问答,不适合审校法务条款,两类内容要分开找人。
本地目录与媒体是可用的
外链渠道的形态跟欧美完全不同。
行业目录数量少,但本地商会与协会的名录质量不错。
本地新闻网站对本地商家的报道意愿比欧美高得多。
大学与技术社区的站点也是可用的渠道。
把英文手册里那份渠道清单搬过来,大概率一条都对不上。
找渠道的正确顺序是先看本地人在哪里聚集,再看那里能不能放链接。
这套方法本站讲过,小语种外链渠道那篇的结论在非洲更极端:能用的渠道几乎全部在当地人的社群里,而不在任何一份可以购买的目录数据库里。
本地媒体这条渠道还有一个特点:报道的门槛低但要求真实。当地媒体乐于报道给本地创造就业或者解决具体问题的商家,套模板的品牌稿反而没人接。豪萨语的国际广播频道这类媒体的内容形态可以拿来参考,看看当地读者关心的角度是什么,再决定拿什么故事去接触本地媒体。
社群渠道要按平台分开看
社群这一层要再拆一次。
不同国家的主流社交平台差别很大,不能按一个模板做。
即时通讯群组在这一带的商业作用远超多数市场。
很多交易实际上是在群里完成的,网站只承担展示和收录。
这意味着内容的传播路径可能绕过搜索,直接进群转发。
所以页面要考虑被转发时的呈现,标题和首屏摘要要能独立成立。
本地互联网基础设施与网络运营者的分布也值得看一眼,非洲地区的互联网号码资源注册管理机构的会员与统计数据能帮你判断某个市场的本地托管与访问条件,这一层直接影响你要不要把站点资源放到更近的节点上。
群组传播还带来一个技术要求:分享卡片的抓取必须稳定。链接被转发进群时,如果标题和摘要抓不出来,只剩一串地址,点击率会掉一大截。这件事跟语言无关,但在以群组转发为主要传播路径的市场里,它的权重比很多所谓的排名因素都高,值得单独排一次检查。
怎么排期,怎么定试水期?
三个月试水期只做词表
排期的核心是先做便宜的那一档。
第一个月做语言判定,四个信号逐门语言核对。
第二个月做词表,本土语高频购买词并进现有关键词表。
第三个月做内容层,每门候选语言出三到五组问答。
三个月结束看数据,再决定要不要有语言升到第一档。
整个试水期的投入通常不超过一个人力月。
试水期的关键纪律是不要中途加码,一旦有人提议顺便把商品页也翻了,试水就变成了小型本地化项目,三个月后你将无法判断到底是词表起了作用还是页面起了作用。
试水期还要提前定好数据口径,尤其是怎么把本土语查询从日志里识别出来。最简单可靠的办法是准备一份本土语高频功能词清单,按词过滤,比任何语言识别模型都稳。口径要在试水开始前定好并写进文档,否则三个月后不同的人用不同的口径统计,会得出互相矛盾的结论。
试水期结束时还要做一件事:把三个月里积累的原始查询样本存档。这份样本是后面所有决策的基线,半年后想验证某个判断有没有变化,只有跟原始样本比才有意义。很多团队做完试水就把中间数据丢了,下一次决策又得从头采样。
三条不依赖语言能力的检查
验收同样需要机械判据。
第一条:查关键词表里本土语词条的占比,低于一成说明采样不足。
第二条:查这批词带来的落地页是否至少有一个本地支付方式名的文字出现。
第三条:抽查五个页面在窄屏低带宽下的首屏加载,看有没有出现方框字。
第三条尤其重要,它是字形缺失的唯一可见症状。
三条都不需要懂这门语言,任何人都能执行。
方框字这个检查还有一个变体做法:把页面在关闭自定义字体的环境里打开一次,如果本土语词条大面积变方框,说明你的字体方案对这门语言不成立,而这件事在正常环境里永远看不出来。
三条检查之外还可以加一条成本检查:统计本土语页面的首屏字节数,跟主语言页面比。如果因为额外字体而高出三成以上,说明这门语言的前端方案需要重做。这条检查同样不需要语言能力,但它能在项目早期就把一个隐性预算问题摆到桌面上,而不是等上线后再发现。
升档与退档的条件
最后是两个方向的判据。
升档条件:本土语查询占该市场自然流量两成以上,且转化率不低于殖民语页面。
两个条件必须同时满足,只有流量没有转化通常说明用户只是看看。
退档条件:连续两个季度本土语查询占比低于百分之五。
退档不是失败,是把预算还给更有效的那一侧。
把退档写进方案,能让升档的决定做得更果断。
保哥做这类区域方案时有个习惯,先把退出条件写在立项文档的第一页,因为没有退出条件的语言项目最后都会变成没人敢关掉的存量负担,而非洲市场的语言数量足够多,这种负担积攒起来的速度也比别处快。
升档与退档之外还有第三种状态值得写进方案:暂停。指的是内容保留、索引保留,但不再投入新增和更新。适用于数据介于两条线之间、暂时判断不了的语言。暂停的维护成本几乎为零,而且随时可以重新激活,比直接退档更适合那些基础设施正在快速变化的市场。
常见问题解答
非洲市场应该先做哪一门语言?
如果只能选一门本土语言,答案通常是斯瓦希里语,因为它是唯一在四个信号上全部成立的本土语言:政府文书使用、区域组织列为工作语言、本地媒体有完整商业版面、书写标准由国家级机构长期维护。但先做本土语这个前提本身要成立才行。多数出海团队的正确第一步其实是把英语或法语那一侧写得更贴近当地,包括支付方式、配送时效和本地地名,这一步的收益比新增任何一门语言都快。
豪萨语的关键词表到底该用哪种拼法?
主键用去掉钩的退化拼法,标准正字法作为别名收录。理由是设备与输入法的现实约束:那四个带钩字母在通用键盘上几乎打不出来,很多字体也不包含对应字形。页面正文可以按标准写,标题标签与关键词覆盖必须按退化写法来。这个顺序跟带变音符号的欧洲语言正好相反,那些语言的标准写法至少是打得出来的,而这里的前提不成立。
法语区能不能直接复用欧洲的法语站?
内容主体可以复用,交易相关的部分不能。要替换的是三类:货币与价格表述、支付与配送方式的本地名称、政策与税费条款。这三类加起来通常不超过内容量的两成,但它们承载了绝大多数的购买意图查询。做法是复用内容、新增地区版本,而不是新建一门语言,语言标签换地区码即可,这比重写整站便宜一个数量级。
非洲市场的语种数量做多少合适?
按维护单元数量算,不按语言数量算。把目标市场按语言、货币、物流网络三个维度填一张表,取值组合相同的市场合并成一个维护单元,通常十个市场能合并成四到五个单元。每个单元一套内容,这个数字就是你实际要维护的份数。本土语言绝大多数停在只做词表这一档,不产生新的维护单元,所以它们的数量可以放宽,真正要控制的是完整版本的数量。
阿姆哈拉语值不值得投入?
目前多数跨境电商团队的答案是不值得做完整站点,但值得做词表覆盖。它有独立的书写系统和悠久的书面传统,语言本身完全能承载商业内容,制约因素在市场侧:跨境支付与物流的成熟度还在早期,字形集的前端代价也明显高于拉丁字母语言。如果你的业务恰好在当地有本地仓与本地收款能力,那这个结论会反过来,判据始终是市场基础设施而不是语言本身。
怎么判断本地用户到底用哪门语言搜索?
最可靠的三个来源依次是:自己站点的搜索日志、客服对话记录、当地电商平台的搜索建议。三者都不需要花钱,两周就能攒出一份可用的样本。关键词工具在这一带的数据密度很低,返回零是常态,而更危险的是它对殖民语返回一个看着健康的数字,那个数字统计的是全球该语言的搜索量,跟当地需求分布关系不大。永远拿一手样本校准工具数据,不要反过来。
页面上的方框字是怎么回事,怎么避免?
那是字体里缺少对应字形的表现。非洲多门语言用到基本拉丁区之外的字母,常见字体不一定包含它们。避免方法有三步:先确认这门语言用到的所有字母的码位落在哪些区块,再挑一款覆盖这些区块的字体或做子集合并,最后在关闭自定义字体的环境里实测一遍。第三步最容易被跳过,而它恰好模拟的是弱网下字体没加载完的真实场景,那正是这批市场最常见的浏览状态。
权威参考资料
本文标题:《在非洲选语种别先看人口,先看有没有人拿这门语言写价格和退货政策》
本文链接:https://zhangwenbao.com/africa-market-language-selection-swahili-hausa-francophone.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0