僧伽罗语的搜索需求比缅甸语健康得多,斯里兰卡20家大公司的网站上一个僧伽罗字都没有
本文目录
- 需求在这门语言里,供给在另一门语言里
- 先说结论,因为它反直觉
- 这两种问题的解法完全相反
- 本文谈什么、不谈什么
- 先量需求侧:僧伽罗语在搜索里到底活不活?
- 24个概念,分三组
- 五门语言并排看
- 0.86这个数意味着什么
- 那3个零建议的词是哪三个
- 顺带一提,条目数这把尺子在这里会骗人
- 再量供给侧:20家公司的网站上有多少个僧伽罗字?
- 名单是怎么选的
- 56比113222
- 电商、电信、银行、超市,一个都不例外
- 这个0.00%该怎么读
- 顺带一提,抓不下来的那几个站本身也是数据
- 会不会是斯里兰卡人上网本来就不用僧伽罗文?
- 这个排除项为什么必须做
- 新闻站那一侧的数字
- 泰米尔语那一侧同样成立
- 所以分界线在场景,不在语言
- 那些满出来的搜索建议,装的是什么内容?
- 把手机那个词的十条建议全打出来
- 电脑和电视也是同一个形状
- 对照组:老挝语那边全是品牌名
- 一条因果链:教育用这门语言,商业用另一门
- 有一个词是反例,而它恰好指出了解法
- 连“我有僧伽罗语版本”这件事都没说出口
- 40个站里只有1个把语言声明写成僧伽罗语
- 那20家商业站的跨语言声明
- 那家国有银行把僧伽罗语写成了非洲的一门语言
- 一个字母的代价
- 两位语言代码为什么这么容易撞
- 这三层塌陷是叠加的
- 真要写僧伽罗语,该写哪一套?
- 这门语言的书面体和口语体差得比想象中远
- 七个新闻站的书面口语比
- 这个36%说明什么
- 不懂这门语言也能判断一段字是哪一套
- 词那一层:条数赢的和意图赢的不是同一个
- 这跟泰米尔语那篇分的不是同一条轴
- 完整查询两套都拉不出来,这一次测量是失败的
- 五组查询,书面一条、口语一条
- 失败本身说明了什么
- 为什么要把失败写出来
- 那长尾怎么办
- 这个缺口值多少钱?
- 竞争密度实际上是零
- 但天花板也要老实算
- 三种入场姿势
- 这个缺口还能存在多久
- 最小验证怎么做
- 什么时候该判断这事不成立
- 上线之前,哪几项能自己跑完?
- 供给侧三项,一个下午
- 需求侧两项,半天
- 声明层两项,十分钟
- 哪些相邻的问题不归这一层管
- 开头那家储能站后来怎么做的
- 常见问题解答
- 本地头部公司都不做本地语言,是不是说明他们试过没效果?
- 需求侧的搜索建议里全是学生作文题,这样的查询池还有商业价值吗?
- 交易存活率这个比值,能不能拿去跟英语或者中文比?
- 书面体和口语体要不要做成两套页面?
- 怎么判断母语者给的词是书面体还是口语体?
- 斯里兰卡还有泰米尔语,两门语言要不要一起做?
- 语言代码这种低级错误,有没有能自动查出来的办法?
- 权威参考资料
摘要:僧伽罗语在搜索里是活的——24个电商概念查下来189条建议,交易动作词的存活率0.86,跟泰语几乎持平,比缅甸语健康将近三倍。可是把斯里兰卡20家最大的电商、电信、银行、超市的网站抓下来数字符,僧伽罗文合计56个,拉丁字母113222个,14家是绝对零。需求在本地语言里,供给全在英语里。本文给出两侧的完整数字、那家把语言代码写成非洲某门语言的国有银行、以及这个缺口该怎么算账、怎么入场。
有个做家用储能的独立站,去年想进斯里兰卡。那个市场的逻辑很硬——长期电力紧张,家庭对储能和逆变器的需求是真实的,不需要教育市场。
团队开会讨论要不要做僧伽罗语版本,讨论了两轮,结论是不做。理由听着挺专业:把当地几家最大的同行网站打开看了一圈,全是英文,一个本地文字都没有;既然本地头部玩家都不做,说明这个市场的线上消费人群本来就用英语。
这个推理有一个致命的漏洞。他们只看了供给侧。
需求在这门语言里,供给在另一门语言里
先说结论,因为它反直觉
这两侧的数字后面会逐个摊开,这里先把结果放在最前面:僧伽罗语的搜索需求是健康的,而斯里兰卡商业网站上的僧伽罗语内容接近于不存在。
这跟做小语种时最常遇到的那个问题正好是反的。多数小语种的麻烦是需求太薄——你写了,没人搜。这里的麻烦是需求好好的在那儿,没人写。
这两种问题的解法完全相反
需求薄的市场,正确动作是收缩:砍掉导购内容,只做品类页,把预算挪去别的语言。同一批实验里的老挝语就是这一档,那门语言的交易动作词八个里七个是零建议,具体数据在老挝语的关键词表为什么会在第九个词上断掉那一篇里。
供给薄的市场,正确动作是相反的:加大投入,因为你面对的是一片没人占的位置。判断自己落在哪一边,只需要把两侧各量一次,一个下午就够。
把两者搞混的代价很实在。开头那家储能站按“同行都不做”推出“市场不需要”,等于把一个几乎无人竞争的入口主动让了出去。
本文谈什么、不谈什么
本文谈僧伽罗语这一门语言在需求与供给两侧的错位,以及由它推出来的入场判断。不谈这套文字里那些把辅音连成一体的组合机制——那跟本站写过的几门南亚文字是同一类问题,字素簇怎么数、字段长度怎么算,都在孟加拉语关键词表与字素簇那一篇里量过了。
也不谈斯里兰卡的泰米尔语那一半。那是另一门语言、另一个社群、另一套词表,本文只在需要做对照的时候提一句。
先量需求侧:僧伽罗语在搜索里到底活不活?
24个概念,分三组
需求侧用的尺子是搜索建议,不是关键词工具——主流工具在这几门语言上要么没有条目,要么给出一个明显插值出来的数,这类数据陷阱本站在小语种关键词工具查不到数据时的几种替代做法里拆过。词表取24个电商场景绕不开的概念,平均分成三组:实体品类词(电话、摩托车、衣服、冰箱、电脑、鞋、电视、手表)、交易动作词(网购、下单、送货、退货、付款、保修、折扣、批发)、抽象概念词(价格、质量、评测、对比、怎么选、最好的、资料、服务)。
分组这一步不能省。如果只是随手抓一把词去查,得到的会是一个笼统的“数量偏少”,而分组之后才看得出零落在哪一列——这个差别,在下一节的对照表里会变得非常直观。
五门语言并排看
只查一门语言说明不了什么,所以同一批概念在僧伽罗语、泰语、缅甸语、高棉语、老挝语上各按本族说法写一遍,逐个查建议。这几门语言各自的使用人口与地理分布,可以在Ethnologue的斯里兰卡语言构成页这类档案里核对。泰语是参照系,它是这一带数据最全的语言。
| 语言 | 实体8词 | 交易8词 | 抽象8词 | 合计 | 零建议词 | 交易÷实体 |
|---|---|---|---|---|---|---|
| 泰语 | 80 | 71 | 80 | 231 | 0/24 | 0.89 |
| 僧伽罗语 | 66 | 57 | 66 | 189 | 3/24 | 0.86 |
| 缅甸语 | 70 | 22 | 28 | 120 | 11/24 | 0.31 |
| 高棉语 | 61 | 6 | 34 | 101 | 11/24 | 0.10 |
| 老挝语 | 43 | 1 | 16 | 60 | 13/24 | 0.02 |
僧伽罗语这一行的形状很平整:66、57、66。三列的量级差不多,没有哪一列塌下去。
0.86这个数意味着什么
最后那一列是交易词除以实体词。这个比值不受语言体量影响,分子分母同时缩放,所以能横向比。
僧伽罗语0.86,泰语0.89,两者基本持平。这意味着这门语言能承接完整的购买漏斗——用户不只用它搜“冰箱”,也用它搜“折扣”“保修”“批发”。而缅甸语0.31、高棉语0.10、老挝语0.02,这三门语言的用户在漏斗下半截会切走。
再看零建议词那一列:僧伽罗语只有3个词拉不出建议,而缅甸语和高棉语各11个、老挝语13个。这门语言在搜索侧的完整度,跟它的人口规模完全不成比例。
那3个零建议的词是哪三个
零建议只有3个,但具体是哪三个比数量更有信息量。实测下来是:网购、退货、怎么选。
这三个词落在一起不是巧合。它们共同的特点是都描述“在网上完成一整套动作”这件事,而这恰恰是斯里兰卡线上零售还没长成的那一块——跨境支付受外汇管制、平台化退货流程不普及、比价决策更多发生在线下门店里。
反过来说,另外五个交易动作词全是活的:下单9条、送货8条、付款10条、保修10条、折扣10条、批发10条。用户会用僧伽罗语搜“怎么付款”“保修多久”“批发价”,只是不会搜“怎么在网上买”。
这个分布对内容规划有直接用处:保修条款、配送时效、批发起订量这三类内容值得单独做页面,而“网购指南”“退货流程”这类页面在这门语言里没有入口。
顺带一提,条目数这把尺子在这里会骗人
衡量一门语言值不值得做,常见做法是量它的内容总量。拿一个公开可复现的量对一下——各语言维基百科的条目数:
| 语言 | 维基条目数 | 活跃编辑 | 交易÷实体 |
|---|---|---|---|
| 泰语 | 185785 | 2828 | 0.89 |
| 缅甸语 | 111538 | 300 | 0.31 |
| 僧伽罗语 | 25614 | 159 | 0.86 |
| 高棉语 | 12155 | 137 | 0.10 |
| 老挝语 | 5594 | 61 | 0.02 |
按内容总量排,缅甸语第二、僧伽罗语第三,缅甸语的条目数是僧伽罗语的4.4倍。按交易存活率排,两者掉了个位置,僧伽罗语是缅甸语的2.8倍。僧伽罗语用不到缅甸语四分之一的内容量,换到了将近三倍的交易词覆盖,两把尺子给出的语言优先级排序是冲突的。
原因不难理解:内容总量量的是“这门语言里有多少字被写出来”,交易存活率量的是“这门语言被用来干什么”。做电商的人要的是后者。这一层的成本估算框架本站在小语种优先级该怎么算这笔账里给过,本文这个比值可以当它的一个新输入项,专门补上“需求类型”这一格。
再量供给侧:20家公司的网站上有多少个僧伽罗字?
名单是怎么选的
供给侧要量的不是“斯里兰卡有没有僧伽罗语网页”,而是“做生意的那批网站上有没有”。所以名单按行业凑,避开媒体:电商与零售、电信运营商、银行与保险、超市与家电连锁,24个域名,能返回200的20个。
统计口径跟前面一致,只数正文容器里的字符——p、li、td、h1到h3这几个标签,不数导航和页脚;僧伽罗文字符按Unicode僧伽罗文块U+0D80到U+0DFF这段区间判定。这一条是必须的:只看首页标题会得出完全相反的结论。
56比113222
20个站的正文里,僧伽罗文字符合计56个,拉丁字母合计113222个。僧伽罗文占0.00%。
不是“比例低”,是逐站看下来大面积的绝对零:
- 僧伽罗文字符恰好为0的:14个站,包括斯里兰卡最大的家电连锁、最大的家具品牌、三家超市连锁、三家电信运营商、两家大银行
- 个位数的:某电商1家12个、某银行5个、某电信5个、某超市3个、某保险2个
- 最多的一家是某跨境电商平台,29个
29个字符是什么概念——大概是一句话。这是20家里表现最好的。
电商、电信、银行、超市,一个都不例外
本来预期至少某几类会不一样。比如超市连锁面向的是最广泛的普通家庭,银行要承担公共服务职能,电信运营商的用户覆盖到县乡——这三类怎么也该有本地语言版本。
实测下来没有例外。四个行业、20家公司,把僧伽罗语放进正文的一家都没有,最高的那家是29个字符。行业之间的差异小到可以忽略,这说明它不是某个公司的疏忽,是整个商业互联网的默认状态。
这个0.00%该怎么读
先说它不意味着什么。它不意味着这些公司没有僧伽罗语的服务——它们的门店、客服、纸质单据几乎肯定是僧伽罗语的。它只意味着这些内容没有出现在网页正文里。
再说它意味着什么。搜索引擎能索引的只有网页上的字。一个用僧伽罗语搜索的用户,无论他离这家公司的门店多近,都不会在结果里遇到这家公司用他的语言写的任何一句话。
把它跟前一节的0.86放在一起看:需求侧一整条漏斗都在这门语言里,供给侧一句话都不在。这中间的落差,就是这篇文章的全部内容。
顺带一提,抓不下来的那几个站本身也是数据
24个域名里有4个没抓成。两个是域名解析失败,两个返回了拒绝访问。这个比例在成熟市场里不常见,它侧面说明这批站的运维投入不高。
运维投入不高这件事跟本文的主题是连着的。一个公司如果连站点可用性都没人盯,那它不太可能有人在考虑“要不要出一个本地语言版本”。这两件事背后是同一个原因——网站在这些公司里不是一条被认真经营的渠道,是一个必须有的门面。
这对入场的人反而是好消息:你要超越的不是一群认真做SEO的对手,是一批没人管的门面站。
会不会是斯里兰卡人上网本来就不用僧伽罗文?
这个排除项为什么必须做
看到商业站全是英文,最容易得出的解释是:能上网、能网购的那批人本来就受过英语教育,他们上网就是用英语的,所以商业站用英语没错。
这个解释如果成立,前面那个落差就不存在了——需求侧的搜索建议可能只是少数人贡献的,代表不了有购买力的那群人。所以这一步必须验,而且要用同一套方法验,不能靠推理。
新闻站那一侧的数字
验法很简单:把同一批工具指向斯里兰卡的僧伽罗语新闻媒体,看它们的正文用什么文字。
| 站点类型 | 僧伽罗文占正文比例 |
|---|---|
| 某综合新闻门户僧伽罗版 | 91% |
| 某主流日报 | 87% |
| 另一家主流日报 | 81% |
| 某电视台新闻站 | 94% |
| 另一家电视台新闻站 | 94% |
| 某国营电视台新闻站 | 96% |
| 某新兴新闻站 | 69% |
七个新闻站,僧伽罗文占正文的比例在69%到96%之间。这些站每天都在生产僧伽罗语内容,而且有人读——如果没人读,它们撑不到今天。
泰米尔语那一侧同样成立
再验一次另一门语言。同一家新闻门户的泰米尔语版本,泰米尔文占正文89%。
也就是说,斯里兰卡的两门本地语言在媒体这个场景里都是活的,而且都写在网页正文里、都可以被索引。这条对照把“本地语言不适合上网”这个解释彻底排除掉了。
所以分界线在场景,不在语言
把三组数字并排:媒体站69%到96%的僧伽罗文,商业站0.00%的僧伽罗文,搜索侧0.86的交易词存活率。
结论只能是:斯里兰卡人用僧伽罗语读新闻、用僧伽罗语搜东西,但斯里兰卡的公司用英语做网站。分界线不划在语言上,划在场景上——同一批人在不同场景里用不同的语言,而商业这个场景整体归了英语。
这跟同一个国家里两门语言分工的那种情形不一样。那种情形里两门语言各自对应一批人,本站在乌克兰语市场里两种语言都看得懂的用户怎么分内容那一篇里拆过。这里是同一批人在不同场景里切换,切换点不在人身上,在事情的类型上。
那些满出来的搜索建议,装的是什么内容?
把手机那个词的十条建议全打出来
需求侧0.86这个数是按条数算的。条数够不等于内容对,所以下一步是把建议的原文逐条读一遍。
僧伽罗语的“手机”这个词拉满10条建议,逐条译过来是这样的:关于手机的作文、手机是谁发明的、二年级关于手机的作文、关于手机的详细介绍、三年级关于手机的作文、给手机打电话、自己做一个手机、手机成瘾、九年级关于手机的作文、十年级关于手机的作文。
十条里六条是学生作文题。一条价格没有,一条品牌没有,一条购买意图都没有。
电脑和电视也是同一个形状
不是孤例。“电脑”那10条:电脑简介的PDF、电脑之父、电脑的组成部件、电脑是谁发明的、什么是电脑、关于电脑的诗、电脑的历史、电脑部件的PDF、关于电脑的作文、电脑的基本组成。
“电视”那10条里有六条是不同年级的作文题——五年级、九年级、二年级、四年级各一条,另有电视是谁发明的、电视的历史。
把这三个词的30条建议里出现的拉丁字母统计一遍,只有四种:english出现3次、pdf出现3次、meaning出现2次、online出现1次。一个品牌名都没有。
对照组:老挝语那边全是品牌名
同一套统计放到老挝语上,结果正好相反。老挝语实体品类词的43条建议里有40条含拉丁字母,而那些拉丁字母几乎全是商品品牌:wave出现9次,samsung 3次,oppo 2次,nike 2次,然后是iphone、vivo、infinix、huawei、tecno、honor、honda、toshiba、adidas各1次。
两门语言的建议池,一个塞满了品牌型号,一个塞满了作文题和PDF。而它们的条数是接近的。
一条因果链:教育用这门语言,商业用另一门
把前面所有的数字串起来,能拼出一条完整的因果链。
斯里兰卡的中小学教育是用僧伽罗语的,学生要用僧伽罗语写作文、查资料、找PDF,所以这门语言的查询池被教育需求撑得满满的。而商业——公司网站、产品说明、电商页面——整体归了英语,于是商业类的查询在这门语言里根本没长出来,能长出来的只有“价格”这种同时属于两个场景的词。
一门语言可以在某些场景里满、在另一些场景里空,决定它的不是语言本身,是这个国家哪些事情用哪门语言办。这一条比“语言体量决定数据量”解释力强得多,因为它能同时解释僧伽罗语的高条数和低商业浓度。
需要说清楚的是,这条因果链是解释,不是实测。实测的部分是建议内容的分布,把它归因到教育体系那一步用的是常识推理。写在这里是因为它有落地价值,读者可以用自己市场的数据去验,但别把它当成本文测出来的结论。
有一个词是反例,而它恰好指出了解法
不是所有实体词都被作文题占了。“鞋”这个词的10条建议是:鞋的种类、女式鞋的种类、男式鞋的种类和价格、鞋的设计、男式鞋的设计、鞋码、鞋的价格,另有几条关于一种同名的花。
种类、男女式、价格、设计、尺码——这是一串标准的电商查询。同一门语言、同一个实验、同一个接口,为什么这个词的结果完全不同?
差别在词本身。手机、电脑、电视这三个词是用梵语构词法造出来的正式词,它们进入僧伽罗语的路径是学校和公文;而“鞋”是这门语言里本来就有的日常老词,谁都会说,不需要上学才学。用正式构词法造出来的词,它的查询池归学校;日常老词的查询池才归市场。
这条判据比它看上去有用,因为它是可操作的:拿到一个候选词,先问它是不是这门语言里本来就有的说法。是,就大概率有商业查询;不是,那多半只能拉出查词义的流量。
顺带划一条界:这跟本站写过的泰米尔语那一篇形状相似但轴不一样,那边分的是官方造词与音译借词,两个词都可能是新的;这边分的是老词与正式构词,判据落在词的年龄和它的进入路径上。两篇的落地动作不同,下一节还会再碰一次这条界。
连“我有僧伽罗语版本”这件事都没说出口
40个站里只有1个把语言声明写成僧伽罗语
抓站的时候顺手记了每个页面的语言声明。这一项本来不在实验计划里,结果它自己跳出来,而且比正文那组数字还难看。
把前面所有抓过的斯里兰卡站点合起来算——政府机构、新闻媒体、商业公司总共40个可用页面,把lang写成si或者si-LK的,1个。
那唯一的一个是某国营电视台的新闻站。其余39个:23个写en、5个写en-US、3个写en-GB、1个写en-LK、1个写泰米尔语、6个干脆没写。
注意那批僧伽罗语新闻站——正文里96%是僧伽罗文,语言声明写的却是en。整站的字都是僧伽罗文,而它对机器说自己是英语的。
那20家商业站的跨语言声明
再看一层。如果一家公司确实做了僧伽罗语版本,它至少该按Google关于本地化版本与跨语言声明的规范告诉搜索引擎“另一个版本在这里”。20家商业站里带这类声明的有4家。
| 公司类型 | 声明的语言版本 | 写得对不对 |
|---|---|---|
| 某分类信息平台 | 英语、僧伽罗语、泰米尔语、默认版本 | 写全了 |
| 某电信运营商 | 英语、僧伽罗语、泰米尔语 | 写全了 |
| 某保险公司 | 英语、僧伽罗语、泰米尔语,都带地区后缀 | 写全了 |
| 某国有银行 | 英语、sn、泰米尔语、默认版本 | 中间那个不是僧伽罗语 |
剩下16家一条都没有。
那家国有银行把僧伽罗语写成了非洲的一门语言
第四行值得单独说。这家银行是斯里兰卡的国有银行之一,网点覆盖全国,它的跨语言声明写的是英语、sn、泰米尔语。
僧伽罗语的代码是si,三位代码写作sin。而sn是绍纳语,三位代码sna,津巴布韦和赞比亚一带使用的一门班图语系语言,跟斯里兰卡隔着大半个地球,两门语言之间没有任何关系。
这两个代码只差一个字母,都是两位小写字母,都在同一份注册表里,肉眼扫过去几乎分辨不出。而后果是:这家银行确实做了僧伽罗语版本、确实写了声明想告诉搜索引擎,结果它告诉搜索引擎的是“我这个版本是给说绍纳语的人看的”。
这类错误最难被发现的地方在于,它填了、格式也对、验证工具不会报错——错的只是那个值指向了另一门真实存在的语言。
一个字母的代价
值得算一下这一个字母值多少钱。这家银行为僧伽罗语版本付出的成本包括:翻译整站内容、维护两套页面、培训编辑、测试字体渲染。这笔钱已经花掉了。
而它换来的搜索侧收益,因为那个字母,接近于零——搜索引擎不会把这个版本推给僧伽罗语用户,因为它按声明理解,这是给绍纳语用户准备的。
这一层该怎么写才对,本站在小语种结构化数据里的语言与地区字段该怎么写里给过规范,那边讲的是自己站怎么写对。这里补一条验收动作:写完之后不要只检查格式,要把每一个语言代码拿去注册表里反查一遍,确认它对应的是你想的那门语言。两位代码的重码率比想象中高。
两位语言代码为什么这么容易撞
这类错误不是偶然,它有结构性原因。两位语言代码那一套标准总共只有一百八十来个坑位,要塞下全世界的主要语言,重码压力很大,于是大量代码是拿语言名字的头两个字母凑的。
结果就是一堆看着像的组合:僧伽罗语si对绍纳语sn,老挝语lo对拉丁语la,斯洛伐克语sk对斯洛文尼亚语sl,挪威语no对荷兰语nl。它们的共同点是——写错之后仍然是一个合法的语言代码,指向另一门真实存在的语言,所以任何格式校验都拦不住。
三位代码那一套坑位多得多,重码压力小,僧伽罗语是sin、绍纳语是sna,一眼能分开。可惜网页上通行的是两位那一套。
保哥的做法是在上线清单里固定加一条:所有语言代码提取出来,逐个丢进IANA语言子标签注册表,把查到的语言全名打印出来,人工扫一眼。这一步几秒钟,但它是唯一能拦住这类错误的动作。
这三层塌陷是叠加的
把这一节和上一节合起来看,斯里兰卡的商业互联网在僧伽罗语这件事上塌了三层,而且是逐层叠加的:
- 第一层:正文里没有僧伽罗语内容,20家里14家是绝对零
- 第二层:极少数做了内容的,语言声明写成英语,40个页面里只有1个写对
- 第三层:极少数写了跨语言声明的,其中还有一家把代码写成了另一门语言
三层任何一层做对,都能拿到一点搜索侧的收益。三层全塌,等于这门语言在商业搜索里完全没有供给。
真要写僧伽罗语,该写哪一套?
这门语言的书面体和口语体差得比想象中远
决定要写之后,马上会撞上第二个问题:僧伽罗语的书面体和口语体不是文白之别那么简单,它们的动词形态是两套不同的系统。
书面体的动词要跟主语在人称和数上保持一致,口语体完全没有这一层——同一个动作,书面写一个形态,嘴里说另一个形态,两者的词尾长得完全不一样。这不是风格差异,是语法差异,而搜索是按字符串匹配的。
这跟本站写过的另外两种情形都不同轴。北欧那几个市场里挪威语的两套官方书面标准是并列关系,两套各自有正式地位、各自有拥护者;阿拉伯语那种一套书面语配多种地区方言的格局有明确的地理维度,按方言区能切成几大块。僧伽罗语这边两样都不是——没有地理维度,也不是两套都有官方地位,是同一批人在同一个地方,正式场合用一套、日常用另一套。
七个新闻站的书面口语比
供给侧这一层也量了一次。取六个书面体动词标记和六个口语体动词标记,在那七个僧伽罗语新闻站的正文里逐个数。
原本以为新闻正文会是压倒性的书面体,预期是九成以上。实测下来是书面351次、口语198次,口语体占36%,跟预期差了一大截。
而且逐站差异极大:最正式的那家新闻门户口语只占7.1%,另一家电视台新闻站29.4%,两家主流日报分别是32.5%和36.2%,某新兴新闻站45.8%,而其中一家老牌日报是57.3%——口语体反而过半。
这个36%说明什么
它说明僧伽罗语的网页写作不存在一个统一的语体标准。同一个国家的七家主流媒体,语体分布从7%铺到57%,中间没有明显的聚集点。
对做内容的人来说,这既是坏消息也是好消息。坏消息是没有现成的标准可抄,你得自己定。好消息是这个市场对语体的容忍度显然很宽——57%口语的日报活得好好的,说明读者不会因为语体不够正式就不看。
务实的做法是分层:产品参数、规格表、条款这类用书面体,因为它们要显得可靠;标题、导购正文、按钮文案用偏口语的一档,因为那是用户实际会打进搜索框的形态。
不懂这门语言也能判断一段字是哪一套
做这个统计的时候用的是词尾标记,而这套办法不需要懂僧伽罗语就能用。口语体的现在时动词有一个固定后缀,书面体则用另外几个固定词尾,两边的字符串完全不重叠。
把这次的逐标记计数摆出来,能看出两套系统各自的骨干:书面这边是系词139次、“有/已经”138次、过去式“是”65次、三单“做”11次;口语那边是不定式与祈使后缀114次、现在时后缀64次、否定11次、“要”6次。
用法很直接:拿一段目标语言的文本,把这十来个字符串各数一遍,两边的比值就是这段文本的语体位置。你不需要读懂一个字,就能判断一份译稿交上来的是书面体还是口语体。
这一招的适用范围比僧伽罗语宽。任何一门书面体和口语体在形态上分家的语言,都能找到类似的几个高频标记,做一次统计脚本长期可用。要注意的是标记得选那些不会出现在别的词里的字符串,否则会大量误计——这次那六个书面标记里有一个几乎没命中,就是因为它太短,被并进了别的词。
词那一层:条数赢的和意图赢的不是同一个
词汇上也有同样的分叉,而且这一层有个陷阱。取10组“书面词对口语词”做对照——比如“手机”这个概念,书面用一个梵语构词法造出来的正式词,口语直接用英语借词的本地转写。
按建议条数算,书面词81条、口语词50条,书面赢6组、口语赢1组、打平3组。光看条数,你会选书面词,而那是错的。
因为前面已经看过了:书面词拉出来的是作文题和PDF,口语词拉出来的是“手机 价格”“手机壳”“便宜的电脑”“电脑课程”。条数在书面词那边,购买意图在口语词那边。
这跟泰米尔语那篇分的不是同一条轴
这里要主动划一条界。本站写过泰米尔语的本族造词和音译词哪个该进词表,结论里也有“某一类词只能拉出查词义流量”这样的形状。两篇看着像,分的轴不一样。
泰米尔语那一篇分的是造词与借词——一个词是不是规范机构新造出来的,决定它有没有商业意图,判据是这个词是老词还是新造的。僧伽罗语这边分的是语域——两个词都是老词,都不是谁造出来的,分叉线是正式场合用哪个、日常用哪个。
两条轴会在结论上短暂重合,但落地动作不同:那边的动作是查这个词的年龄,这边的动作是查这个词属于哪个语域。想看另一条轴怎么走的,去泰米尔语的本族造词与音译词该收哪一个那一篇,本文这一层就到这里。
完整查询两套都拉不出来,这一次测量是失败的
五组查询,书面一条、口语一条
词级的对照做完,下一步本来是句级——把书面体和口语体各造一句完整的商业查询,看谁能拉出建议。设计了五组:手机多少钱、哪个最好、在哪买、怎么用、有没有货,每组两个版本。
跑完的结果是:书面体五句加起来1条,口语体五句加起来1条。而且那两条都不是想要的东西——书面那条是关于信用卡怎么用的,口语那条后面跟着“英文意思是什么”。
十句里八句是零。这一轮什么也没测出来。
失败本身说明了什么
先排除一个可能:不是尺子坏了。同一个接口在词级上给僧伽罗语返回了189条建议,工作得很正常。
那就是查询本身的问题。最可能的解释有两个。一是这几句的措辞不是母语者真会打的说法——虽然语法都对,但真实查询的措辞往往更短、更省略;二是这门语言的长查询本身就少,用户习惯打两三个词而不是一整句。
这两个解释都合理,而本文没有办法区分它们。所以这一轮的正确结论是:这次测量失败了,在僧伽罗语上能可靠测到的只有词级,句级需要换一套完全不同的方法。
为什么要把失败写出来
因为省略它会给读者一个错误印象——好像这套方法什么都能测。实际上它有明确的适用边界,而边界只有在撞上去的时候才看得见。
还有一个更实际的理由。如果你照着本文的方法去做自己的市场,句级那一轮大概率也会拿到一堆零。提前知道这是方法的边界而不是市场的结论,能省下一整轮返工。
那长尾怎么办
词级测不到句级,不代表长尾没法做,只是数据源要换。三个替代来源,按可靠性排:
- 自己站的站内搜索日志——只要有一点自然流量,用户在你站内打的完整句子就是最真实的样本,而且不经过任何第三方口径
- 本地社群里用户的原话,尤其是求推荐和抱怨类的帖子,那里的措辞最接近真实查询
- 把词级已经验活的那批词两两组合,做成短语去试,比自己造整句的命中率高得多
小语种的长尾门槛本来就跟英语市场不是一套算法,这一层本站在小语种长尾内容在AI时代还值不值得做里单独算过账,可以对照着看。
这个缺口值多少钱?
竞争密度实际上是零
先说这个缺口最诱人的一面。20家本地头部公司,僧伽罗语正文合计56个字符。这意味着任何一个认真写僧伽罗语内容的站,在这门语言的商业查询上没有本地对手。
不是“对手很弱”,是“对手不在场”。这种局面在成熟市场里几乎见不到,通常只出现在一门语言刚刚开始上网的阶段——而僧伽罗语显然不是,它的搜索侧已经很成熟了。
但天花板也要老实算
诱人归诱人,账要算完。这个市场的天花板由三件事决定,每一件都不大:人口规模两千多万、人均线上消费能力有限、跨境支付与物流的可用性受外汇管制影响。
所以正确的预期不是“找到一个金矿”,是“找到一个没人抢的小矿”。保哥的看法是它值得做,但不值得为它调整整个出海排期的优先级——这类语言该摆在投入、观察还是冻结哪一档,本站在小语种优先级重排那一年的复盘里有一份现成的分档表可以套。竞争为零最大的价值不是流量总量,是获客成本——同样的排名,在这里要花的力气可能只有成熟市场的十分之一。
三种入场姿势
按投入从小到大排:
- 最小的一种:只把品类页和产品页做僧伽罗语版本,其余全部保留英语。成本是一份词表加一批页面翻译,两三周能上线
- 中等的一种:品类页加一批解决具体问题的内容页,选题从那些能拉出建议的口语词里挑,避开作文题那一类
- 最大的一种:整站双语,配上正确的跨语言声明和语言切换入口。只有当前两种已经跑出数据、证明这门语言真能带来转化之后才做
多数团队应该停在第一种或第二种。第三种的边际收益在这个规模的市场里通常撑不起维护成本,而且双语站的长期负担——两份内容日历、两份审校排期、两份客服话术——不出现在首次投入的账里。
这个缺口还能存在多久
做决策前值得问一句:这个位置会不会很快被本地公司自己补上。
从数据看,短期内不太会。20家里14家是绝对零,说明这不是某几家落后,是整个行业的默认做法;而默认做法的改变通常需要一个外部触发——某家公司先做了并且拿到了明显收益,同行才会跟。
更实际的一层是组织原因。这些公司的市场部工作语言是英语,建站外包给的开发商也在英语环境里,做本地语言版本意味着要新增一条内容生产线和一批审校,这件事在预算表上没有对应的科目。这不是一个技术难题,是一个没人提案的问题,而没人提案的问题可以存在很多年。
当然也要留个观察点:如果哪天本地某家头部电商开始铺本地语言内容,那这个窗口的关闭会很快,因为它有品牌和流量的双重优势。所以入场的话别拖太久,也别把这当成一个永久红利。
最小验证怎么做
不要一上来铺全站。选三到五个页面做僧伽罗语版本,上线之后观察三件事:有没有被收录、有没有僧伽罗语查询带来的展现、展现之后的点击率跟英语版本比是高还是低。
观察周期给三个月。这个市场的抓取频率不高,一个月的数据不足以判断。
验证期间有个细节容易被忽略:确认语言声明写对了,否则你观察到的“没有效果”可能只是搜索引擎不知道这几个页面是给谁看的。前面那家国有银行就是这么把整套投入浪费掉的。
什么时候该判断这事不成立
三个月之后,如果这三到五个页面收录正常、语言声明也确认写对了,但僧伽罗语查询带来的展现依然接近零,那就该停。
停下来的时候要区分两种情况。一种是这门语言在你这个品类上确实没有商业查询——那就把僧伽罗语的投入砍掉,专心做英语版本。另一种是你选的词全落在了作文题那一类上——那就换一批词再试一轮,别急着否定整个市场。
区分它们的办法是回到词级:把你实际用的那批词逐个查一遍建议,看拉出来的是价格和品牌,还是作文和PDF。选词错了和市场不成立,在流量数据上长得一模一样,只有回到词级才分得开。
上线之前,哪几项能自己跑完?
供给侧三项,一个下午
第一项,列出目标市场十到二十家本地头部公司的网站,抓正文,数本地文字的字符占比。这一项回答“有没有人在这门语言上跟我竞争”。
第二项,同样的方法抓五到十家本地新闻媒体。这一项是排除项,回答“这门语言在网上到底活不活”。缺了它,第一项的零会被误读成“这门语言没人用”。
第三项,把这两批站的语言声明记下来。这一项通常会顺手捡到一批可以直接超越同行的地方。
需求侧两项,半天
第一项,24个概念分三组查建议,算交易除以实体的比值。高于0.8按正常市场做,0.3到0.8只做还活着的那几个交易词,低于0.1只做品类页。
第二项,把建议的原文逐条读一遍,看里面有没有品牌名、价格、型号。这一项比第一项更重要,因为条数可以是满的而内容全是查词义——僧伽罗语这次就是这样。
声明层两项,十分钟
一是打开自己站的目标语言页面,确认语言声明不是空的、不是建站模板留下的英语默认值、也不是把国家代码填成了语言代码。
二是把用到的每一个语言代码拿去注册表里反查一遍。两位小写代码的重码率高得吓人,一个字母之差就会指到另一门真实存在的语言上去。
哪些相邻的问题不归这一层管
做僧伽罗语时会一起冒出来但解法不在本文这一层的,主要有四类:
- 辅音连写与字素簇导致的字段长度算错——那是字符层的问题,跟你写什么词无关
- 字体加载与行高——僧伽罗文的字形高度和拉丁文差得远,属于前端排版问题
- 斯里兰卡的泰米尔语那一半怎么办——那是另一门语言的完整决策,要单独走一遍本文的两侧测量
- 这门语言的内容能不能被AI答案引用到——那是低资源语言在生成式检索里的通病,本站在AI检索里的语言偏向与来源审计里单独测过,跟商业词有没有量是两条线
开头那家储能站后来怎么做的
他们重新跑了一遍两侧测量,一个下午。看到需求侧0.86和供给侧56个字符这两个数并排放在一起,会议纪要上“不做僧伽罗语”那一行当场改掉了。
实际动作走的是最小的那一种:把四个主力产品页和两个品类页做了僧伽罗语版本,词表从能拉出建议的那批口语词里选,语言声明和跨语言声明按规范写全,其余页面保持英语不动。总投入不到两周。
三个月之后的数据不算惊艳,展现量在整站里的占比是个位数。但那批词的排名位置几乎全在首屏,而这在英语那一侧是这家公司花了一年半也没拿到的。同样的钱,买到的位置差了一个量级——这就是竞争为零的实际含义。
常见问题解答
本地头部公司都不做本地语言,是不是说明他们试过没效果?
大概率不是。这类默认状态更常见的成因是路径依赖:网站最初由英语环境里的开发商搭起来,管理层和市场部的工作语言是英语,对外沟通材料也是英语,于是网站自然就是英语的,从来没有人正式提案过要不要做本地语言版本。判断是“试过没效果”还是“从没试过”,有个便宜的办法——看这些站有没有语言切换入口的残留、有没有本地语言的旧页面还挂在子目录里。如果连痕迹都没有,那基本可以确定是没试过。真正试过又撤掉的站,通常会留下断链或者重定向。
需求侧的搜索建议里全是学生作文题,这样的查询池还有商业价值吗?
有,但要挑着看。作文题那一批确实没有商业价值,问题在于它们集中出现在某一类词上——那些用正式构词法造出来的书面词。换成日常口语里在用的说法,同一个概念拉出来的建议就变成了价格、型号、配件、便宜的某某。所以正确的动作不是放弃这门语言,是换一批词。本文里“鞋”这个词就是个好例子,它是日常老词而不是正式构词,拉出来的建议是种类、男式女式、价格、尺码、设计,全是商业意图。判断一个词属于哪一类,最快的办法就是把它的建议打出来读一遍。
交易存活率这个比值,能不能拿去跟英语或者中文比?
可以比,但要知道比的是什么。这个比值衡量的是一门语言在搜索里能承接的任务范围,不是它的流量规模。英语和中文的比值必然接近1,因为这两门语言什么场景都覆盖,比出来只会得到“它们是完整的”这个已知结论。真正有用的比较发生在小语种之间,或者同一门语言的不同时间点之间——后者尤其值得做,如果一门语言的这个比值在两年里从0.3涨到0.6,说明它的电商生态正在成型,那是个很强的入场信号。
书面体和口语体要不要做成两套页面?
不要。两套页面会带来重复内容判定的风险,而且维护成本翻倍,收益却很有限——因为这两套形态是同一门语言,搜索引擎在语义层面能把它们关联起来。务实的做法是一套页面里分层:标题和小标题用偏口语的形态,因为那是用户打进搜索框的样子;正文的说明性段落、参数表、条款用书面体,因为那是读者期待的正式度。另外把口语形态的几个关键说法自然地放进正文出现一次,让页面在两种形态上都有覆盖,这比做两套页面划算得多。
怎么判断母语者给的词是书面体还是口语体?
不要问“这个词对不对”,母语者会说对,因为书面词确实是对的。要换个问法:如果你在手机上给朋友发消息说这件事,你会打哪个词。这个问法能把书面体过滤掉,因为没有人在聊天里用正式书面形态。第二个办法是直接看数据,把两个候选词各查一遍建议,读一读拉出来的内容,有价格和品牌的那个就是用户在打的那个。两个办法配合用最稳,母语者负责给候选,数据负责裁决。
斯里兰卡还有泰米尔语,两门语言要不要一起做?
先做一门,跑出数据再说。两门语言对应的是两个不同的社群、两套词表、两批审校,边际成本并不比做两个国家低多少。选哪一门取决于你的品类和目标客群的分布,不是取决于人口比例。另外要提醒的是,泰米尔语不只在斯里兰卡使用,它跨着好几个国家,而不同国家的用词分叉相当明显,所以做泰米尔语这个决定的复杂度比做僧伽罗语高一档——僧伽罗语只有一个市场,这反而是它的优点,词表做一次就够了。
语言代码这种低级错误,有没有能自动查出来的办法?
有,而且很简单。把站上所有出现的语言代码提取出来去重,逐个丢进语言子标签注册表查一遍,把查到的语言名字打印出来人工扫一眼。这个脚本十几行就能写完,跑一次几秒钟。关键在于最后那一步必须是人看语言名字,而不是程序判断代码格式是否合法——那家国有银行写的sn格式完全合法,任何格式校验都会放行,只有把“绍纳语”三个字打印出来才会有人发现不对。这个检查建议加进上线前的固定清单,成本几乎为零。
权威参考资料
本文标题:《僧伽罗语的搜索需求比缅甸语健康得多,斯里兰卡20家大公司的网站上一个僧伽罗字都没有》
本文链接:https://zhangwenbao.com/sinhala-seo-demand-supply-language-gap.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0