老挝语的关键词表在第九个词上断掉,那8个购物动作词一共只拉回来一条建议
本文目录
- 老挝语的关键词表,为什么会在第九个词上断掉?
- 先把问题拆成两半
- 24个概念,分三类,五门语言各查一遍
- 为什么不用关键词工具的搜索量
- 本文谈什么、不谈什么
- 供给侧先排除掉:老挝的网站干净得出乎意料
- 开工前的预期是怎么写下的
- 28个站抓到15个可用
- 48821个老挝文字符里,泰文只有1个
- 这个0.00%该怎么读
- 顺带记一个坑:编码探测的顺序
- 但另一件事塌了:这些站没告诉搜索引擎自己是老挝语的
- 24个词查下来,零落在哪一列?
- 三列的数字
- 唯一活下来的那条长什么样
- 抽象概念词那一列同样惨
- 实体品类词后面跟着的是拉丁字母
- 这是老挝语独有的,还是所有小语种都这样?
- 加四门语言进来
- 交易存活率这个比值
- 曲线的形状:不是整体变薄,是分层塌陷
- 缅甸语和高棉语落在中间那一档
- 这条曲线能拿来做什么
- 内容总量这把尺子,为什么会给出错误排序?
- 五门语言的条目数
- 缅甸语条目多四倍,存活率只有三分之一
- 那内容供给密度这把尺子还要不要用
- 自己跑一遍要多久
- 尺子失效了两次,换出来的东西比原计划硬
- 第一次:整条判定看不见的那个泰文词
- 第二次:地区参数根本没生效
- 所以“老挝人改用泰语搜”这句话保哥不能说
- 换尺子之后能回答的问题变了
- 老挝文和泰文的码点,其实是逐位对齐的
- 两个块并排放
- 128个偏移位的对账
- 真实语料位移之后,96.14%落得下去
- 位移出来的串长什么样
- 一个反向陷阱:码位对齐了,音值没对齐
- 那这套位移,能拿来做什么、不能做什么?
- 能做的:拿泰语的数据反推候选词
- 具体怎么跑
- 不能做的:直接当泰文词用,或者直接当老挝文词发出去
- 交易词在老挝语里没长出来,那内容到底该怎么写?
- 漏斗上半截用老挝语,下半截怎么办
- 品牌名那一格要留出来
- 别去硬造那些不存在的词
- 站内搜索和结构化数据这两块要单独处理
- 排期上这门语言该排在哪一档
- 上线之前,哪几项能自己跑完?
- 词类分组测试,半小时
- 语言标签自查,五分钟
- 位移覆盖率自查,一小时
- 哪些相邻的问题不归这一层管
- 开头那家电动工具站后来改了什么
- 常见问题解答
- 交易存活率低于0.1的语言,是不是就完全不该做?
- 搜索建议返回零条,是不是就等于这个词没有搜索量?
- 把泰语关键词位移过来生成老挝语候选词,会不会有版权或者数据合规问题?
- 老挝语和泰语这么像,能不能只做泰语版本去接老挝的流量?
- 那五个位移会塌的字符,为什么泰文里没有对应的位置?
- 这套词类分组的办法,能不能用在非东南亚的语言上?
- 做这门语言,母语者要请几个、请什么样的?
- 权威参考资料
摘要:把24个电商概念分成实体品类、交易动作、抽象概念三组,用同一套说法在五门东南亚语言上各查一遍搜索建议,老挝语这一列的塌法很特别——手机、摩托车、鞋能拉满10条,而下单、送货、退货、付款、保修、批发这些购物动作8个词加起来只回来1条。小语种在搜索里不是整体变薄,是按词类分层往下塌,交易动作词最先倒。本文给出五门语言的对照数字、一个五分钟能自己跑一遍的比值,以及老挝文和泰文那两个码点块96.14%逐位对齐这件事能拿来做什么、不能拿来做什么。
去年有个做电动工具的外贸站找过来,问题描述得很干脆:老挝语版本上线快三个月,收录正常,也确实有自然流量,可进来的词全挤在一个地方——全是品类名加型号,没有一条带着购买动作。
团队的第一反应是内容写得不够,于是补了一批导购型的文章,标题都是“怎么挑”“哪款好”“买之前要看什么”这类。又过了两个月,那批页面收录了,展现量接近于零。
后来发现问题不在页面上。是那些词在这门语言的搜索里,压根就没有。
老挝语的关键词表,为什么会在第九个词上断掉?
先把问题拆成两半
“这门语言没数据”是个太笼统的说法,笼统到没法排期。真要动手,第一步是把它拆成互不重叠的两半:是供给侧的问题——本地没人写这门语言的网页;还是需求侧的问题——本地人不用这门语言搜这类东西。
这两半的解法完全相反。供给侧稀薄意味着机会,你去写就能占位;需求侧稀薄意味着陷阱,你写得再好也没人搜。把两者混成一句“老挝语不好做”,排期表上就只能填一个模糊的低优先级,什么也决定不了。
所以这次的测量顺序是先排除供给侧,再去量需求侧。这个顺序不能反过来,因为需求侧的数据更难解释,先把供给侧的答案握在手里,解释起来才有参照。
24个概念,分三类,五门语言各查一遍
需求侧那把尺子用的是搜索建议。选它有三个理由:它是免费的、实时的、按地区取的;它反映的是真实被打进搜索框的串而不是工具的估算模型;最要紧的是,它在关键词工具完全没有数据的语言上依然会返回东西。
词表这样搭:取24个电商场景里绕不开的概念,平均分成三组。分组这一步是整个实验的关键,如果只是随便抓一把词去查,得到的会是一个笼统的“数量偏少”,而分组之后才能看出零落在哪一列。
- 实体品类词——电话、摩托车、衣服、冰箱、电脑、鞋、电视、手表,也就是用户想买的东西本身
- 交易动作词——网购、下单、送货、退货、付款、保修、折扣、批发,也就是购买流程里的那些动作
- 抽象概念词——价格、质量、评测、对比、怎么选、最好的、资料、服务,也就是决策阶段的修饰语
然后把这24个概念在老挝语、泰语、高棉语、缅甸语、僧伽罗语上各写一遍本族说法,逐个查建议,记录每个词返回多少条。泰语放进来是当参照系用的——它是这一带体量最大、数据最全的那门语言,如果连泰语都出现大面积零,那说明是尺子有问题而不是语言有问题。
为什么不用关键词工具的搜索量
主流工具在这几门语言上要么没有条目,要么给出一个明显是插值出来的数。更麻烦的是它们经常把整门语言的量合并报给一个更大的语言代码,看上去有数,实际上那个数不属于这门语言。这一类数据陷阱本站在小语种关键词工具查不到数据时的几种替代做法里拆过一遍,这里不重复。
搜索建议的短板同样要说清楚:它给不出绝对量,只能回答“这个词在这门语言的查询池里有没有存在感”。但这次要回答的恰好就是这个问题,所以它够用。
本文谈什么、不谈什么
本文谈的是老挝语这一门语言在搜索侧的词类分布,以及由它推出来的内容取舍。不谈老挝文没有词间空格该怎么分词——那件事跟泰语、高棉语、缅甸语共用同一套机制,本站已经在泰语没有空格该怎么切词那一篇里连词典型断词器的工作方式一起讲完了,老挝语这边只是换了个语言名字,机制一模一样。
也不谈引擎那半边。老挝市场的搜索入口结构、本地平台的份额,这些属于平台层,跟语言本身无关。
供给侧先排除掉:老挝的网站干净得出乎意料
开工前的预期是怎么写下的
动手之前,保哥先把预期写进了一个文件。这一步是从上一批开始养成的习惯,理由很实在——不写下来,跑完之后人会自动把结论改成“我早就知道”,那样就学不到任何东西。
关于供给侧,写下的是:老挝的新闻站正文里会混进可观的泰文,占比超过5%。理由听起来很硬——老挝和泰国之间的媒体渗透是几十年的事,老挝人普遍能读泰文,本地媒体转载泰国内容的成本几乎是零,那么直接把泰文段落贴进页面是最省事的做法。
28个站抓到15个可用
站点清单按三类凑:政府与机构、新闻媒体、商业与电商。总共28个域名,实际能返回200的15个,其中文字量够统计的13个。掉线的那13个里,多数是域名解析失败或者证书过期——这本身就是这个市场的一个侧写。
统计的时候只数正文容器里的字符,也就是p、li、td、h1到h3这几个标签里的内容,不数导航和页脚。这一条是上一批用血换来的:查一个页面到底用什么文字,只看首页标题会得出完全相反的结论,必须抽正文段落。
48821个老挝文字符里,泰文只有1个
结果是这样的:13个站的正文里,老挝文字符合计48821个,泰文字符合计1个。占比0.00%。
逐站看也一样干净。老挝日报7627个老挝文字符、0个泰文;国家通讯社4242个、0个;Lao Phattana 10402个、0个;财政部3821个、0个。唯一那1个泰文字符出现在工贸部站上,孤零零一个,大概率是复制粘贴带进来的。
预期错了,而且错得很彻底。老挝的网站不但没有大面积混排泰文,它们比多数小语种市场的站点都要纯。
这个0.00%该怎么读
第一层意思是:老挝语的网页内容是真实存在的,有人在持续生产,而且生产者没有偷懒去贴邻国的现成内容。这一点很重要,它把“这门语言在网上没人用”这个假设直接排除掉了。
第二层意思更要紧:既然供给侧没问题,那么后面如果量出需求侧的异常,那个异常就是真的,不能再用“因为没人写所以没人搜”来解释。先排除一半,剩下那一半的结论才站得住。
顺带说一句,这个干净程度也意味着老挝语的语料是可以直接拿来用的。你抓20个本地站做词频统计,不需要先做语言过滤,抓到什么就是什么。多数小语种市场没这个待遇。
顺带记一个坑:编码探测的顺序
抓非拉丁语种的站有个反复咬人的坑,这次是提前防住的。常见的写法是让请求库去自动猜编码,猜完再解码。问题在于自动猜编码这件事在单字节和多字节之间会翻车,它可能把一段正常的UTF-8猜成某种单字节编码,然后解出一串看着很有规律的乱码。
规律性乱码最危险的地方在于,它不像乱码。它看上去像另一门语言的字符,而你会信。上一批就差点因为这个得出“某地的网站用的是另一套字母”这种完全说得通、但完全错误的结论。
正确的顺序是写死的:先看HTTP响应头里的charset,没有再看HTML里的meta声明,再没有就试UTF-8解一遍看会不会报错,四步都不行才轮到自动猜。解完之后按码点判断每个字符属于哪套书写系统,判据用的是Unicode的书写系统属性定义,自己写统计脚本照它来就行。这次15个可用站全部在第一步就拿到了正确编码,一次都没走到猜那一步。
但另一件事塌了:这些站没告诉搜索引擎自己是老挝语的
抓站的时候顺手记了每个页面的语言声明,这是本来没打算测的一项,结果它自己跳了出来。15个可用站里,把lang写成lo或者lo-LA的只有6个。
| 声明值 | 站数 | 这个值是什么意思 |
|---|---|---|
lo / lo-LA | 6 | 正确,老挝语 |
en / en-US | 6 | 声明成了英语,其中包括国家电视台和老挝日报 |
zxx | 1 | 财政部。这个代码的含义是“无语言内容” |
la | 1 | BCEL银行。la是拉丁语,老挝语是lo |
| 缺失 | 1 | 万象时报 |
财政部那个zxx值得单独说两句。这三个值都能在IANA语言子标签注册表里逐个查到:lo是老挝语、la是拉丁语、zxx的含义是无语言内容。最后这个代码在标准里是留给那些确实没有语言内容的资源用的,比如纯乐器音频、纯符号图表。一个整站都是老挝文公文的财政部网站声明自己“无语言内容”,这大概率是某个建站模板的默认值没人改过。
BCEL那个la更典型,它是把国家代码当成语言代码填了。老挝的国家代码是LA,语言代码是lo,两个字母都对,组合起来完全错。这类错误的特点是它不报错,页面照常显示,只有机器在读的时候才知道你说自己是什么语言。本站在小语种结构化数据里的语言与地区字段该怎么写里讲过这一层的写法规范,那边讲的是自己的站怎么写对,这里看到的是一整个市场普遍写错的样子。
24个词查下来,零落在哪一列?
三列的数字
供给侧排除掉之后,需求侧的数字就可以直接读了。老挝语这24个概念查完,三列的建议总数是这样的:
| 组别 | 8个词的建议总数 | 平均每词 | 一条建议都没有的词 |
|---|---|---|---|
| 实体品类词 | 43 | 5.4 | 1个 |
| 交易动作词 | 1 | 0.1 | 7个 |
| 抽象概念词 | 16 | 2.0 | 5个 |
第一眼看过去,实体那一列是活的。电话拉满10条,摩托车10条,衣服10条,鞋9条。这已经足够支撑一批品类落地页了。
第二列是1。八个概念——网购、下单、送货、退货、付款、保修、折扣、批发——加起来返回1条建议。
唯一活下来的那条长什么样
那一条是折扣拉出来的,内容是折扣加一个外卖平台的名字。也就是说,老挝语的交易动作词里,唯一有查询量的那个用法,指向的是一个外国公司在当地运营的App的优惠活动。
剩下七个词是硬零。不是“数据很少”,是接口返回了一个空列表。同样这八个概念换成泰语去查,返回71条,一个零都没有。
这里要说清楚一件事:零建议不等于零搜索量。搜索建议是有门槛的,一个词得被搜到某个量级才会进补全库。所以这组数据的准确读法是——这八个动作在老挝语里的查询量,全部低于建议库的收录门槛。它可能是零,也可能是很小的一个数,但无论如何,小到你没法围绕它做内容规划。
抽象概念词那一列同样惨
第三列16条,看着比第二列好,其实结构很畸形。这16条里有10条来自“价格”一个词,剩下6条分给“资料”和“服务”。而评测、对比、怎么选、最好的、质量这五个词,全是零。
这五个词恰好就是导购内容的骨架。开头那家电动工具站补的那批“怎么挑”“哪款好”的文章,标题里的核心词就落在这五个零上面。他们不是没写好,是写了一批在这门语言里不存在的查询。
而“价格”那10条也不是给电商用的。逐条看下来,全部围绕黄金价格和油价——“今日金价2026”“今日金价2025”“1巴的金价”“今日油价2026”。这是一个把价格这个词垄断掉的强势话题,任何品类想在这个词上分一杯羹都很难。
实体品类词后面跟着的是拉丁字母
把实体那一列的43条建议全部打出来看,会看到另一个形状:43条里有40条含拉丁字母,而且那些拉丁字母几乎全是品牌名。
统计一下出现频次:wave出现9次,samsung 3次,oppo 2次,nike 2次,然后是iphone、vivo、infinix、huawei、tecno、honor、honda、ford、toshiba、adidas、polo各1次。
所以老挝语在这些查询里承担的角色非常清楚:它出现在品类词那一格,紧挨着它的是拉丁字母写的品牌名和型号。用老挝文写“摩托车”,后面跟着的是wave 110、wave 100这些本田车型的编号。用老挝文写“电话”,后面跟着oppo、samsung、iphone。
这个形状本身是有用的。它告诉你老挝语页面上的标题该怎么组:本地文字的品类词加拉丁原文的品牌型号,中间不要试图翻译。品牌名转写这件事在多数市场都要权衡,本站在小语种市场里品牌名该转写还是保留原文里给过判断框架,而老挝语这边的数据把答案直接摆出来了——用户就是在打拉丁字母。
这是老挝语独有的,还是所有小语种都这样?
加四门语言进来
一门语言的数据说明不了什么。同一批24个概念,按各自的本族说法在泰语、高棉语、缅甸语、僧伽罗语上重跑一遍,五门语言并排放,形状才出得来。
| 语言 | 实体8词 | 交易8词 | 抽象8词 | 合计 | 零建议词 | 交易÷实体 |
|---|---|---|---|---|---|---|
| 泰语 | 80 | 71 | 80 | 231 | 0/24 | 0.89 |
| 僧伽罗语 | 66 | 57 | 66 | 189 | 3/24 | 0.86 |
| 缅甸语 | 70 | 22 | 28 | 120 | 11/24 | 0.31 |
| 高棉语 | 61 | 6 | 34 | 101 | 11/24 | 0.10 |
| 老挝语 | 43 | 1 | 16 | 60 | 13/24 | 0.02 |
竖着看合计那一列,是一条从231掉到60的下坡,符合直觉——语言体量越小,数据越少。
横着看才有意思。实体那一列从80掉到43,掉了不到一半。交易那一列从71掉到1,掉了98%。两列的衰减速度差了一个数量级。
交易存活率这个比值
上表最后那一列就是交易除以实体的比值。这个比值不受语言体量影响,因为分子分母同时缩放,所以它能横向比。翻译成人话是这样的:
- 泰语0.89、僧伽罗语0.86——这门语言能承接整条购买漏斗
- 缅甸语0.31——上半截可以,下半截要打折
- 高棉语0.10——基本只剩漏斗顶端
- 老挝语0.02——只有品类词那一格
五个数字排出来是一条很陡的曲线,而且中间有个明显的断层:泰语和僧伽罗语挤在0.86到0.89,然后直接掉到缅甸语的0.31,中间是空的。
曲线的形状:不是整体变薄,是分层塌陷
这条曲线否掉了一个很流行的心智模型。多数人对小语种的想象是“数据按比例变少”——大语种一个词1000的量,小语种同一个词可能是10,但结构是一样的,你按比例缩小预期就行。
实测出来不是这样。小语种是按词类分层往下塌的,交易动作词最先倒,抽象概念词其次,实体品类词最后倒。塌到老挝语这个位置,你手上剩下的不是一个缩小版的关键词表,是一个只有名词、没有动词的关键词表。
这个区别在排期上是致命的。按比例缩小的心智模型会得出“老挝语值得做一批小规模内容”的结论;分层塌陷的模型会得出“老挝语只能做品类页,导购内容一篇都别写”的结论。后者才对。
缅甸语和高棉语落在中间那一档
中间两档反而是最需要判断力的。缅甸语0.31,意味着八个交易动作里大概有两三个还活着——实测下来是送货和保修各10条、批发2条,其余归零。高棉语0.10,活着的只有保修6条。
落在中间档的语言,正确做法不是一刀切,是把那几个还活着的词挑出来单独做。缅甸语的“送货”有10条建议,那就值得为配送时效单独做一个页面;“评测”是零,那就别做评测页。这个比值的用法不是给语言打分,是给这门语言画出一条“做到哪里为止”的线。
顺带一提,缅甸语那边还有一层独立的历史包袱要先处理干净,跟这条曲线无关但会先撞上——那门语言在过去十来年换过一整套字节编码,旧内容和新内容互相打不开,细节在缅甸语网页的编码迁移与字节裂缝那一篇里。
这条曲线能拿来做什么
最直接的用法是替代拍脑袋的语言优先级。给一门新语言排期之前,花半小时把24个词查一遍,算出这个比值,你得到的是一条比人口数、比GDP、比“这个市场热不热”都更贴近实际的判据。
第二个用法是给客户看。“这门语言不值得做导购内容”这句话说出来像是偷懒,把八个词全是零的截图摆上去,就不用再解释了。这条曲线最值钱的地方不是它的精度,是它便宜到你可以在提案阶段就跑一遍。
内容总量这把尺子,为什么会给出错误排序?
五门语言的条目数
衡量一门语言值不值得做,最常见的做法是量它的内容供给密度——本地有多少网页、有多少人在写。这个思路本站在小语种优先级该怎么算这笔账里给过手工估算的办法,也一直好用。这次顺手拿同一批语言验了一下,结果不太好看。
选一个公开、可复现、任何人五分钟能自己查到的量:维基百科各语言版本的条目数与活跃编辑人数清单。
| 语言 | 维基条目数 | 活跃编辑 | 交易存活率 |
|---|---|---|---|
| 泰语 | 185785 | 2828 | 0.89 |
| 缅甸语 | 111538 | 300 | 0.31 |
| 僧伽罗语 | 25614 | 159 | 0.86 |
| 高棉语 | 12155 | 137 | 0.10 |
| 老挝语 | 5594 | 61 | 0.02 |
缅甸语条目多四倍,存活率只有三分之一
把两列的排序并排看,第二名和第三名换了位置,而且换得很凶。
按内容总量排,缅甸语第二、僧伽罗语第三,缅甸语的条目数是僧伽罗语的4.4倍。按交易存活率排,僧伽罗语0.86排第二、缅甸语0.31排第三,僧伽罗语是缅甸语的2.8倍。僧伽罗语用不到缅甸语四分之一的内容量,换到了将近三倍的交易词覆盖。
这不是测量误差能解释的差距。两把尺子量的根本是不同的东西:内容总量量的是“这门语言里有多少字被写出来”,交易存活率量的是“这门语言被用来完成什么类型的任务”。
缅甸语有一亿多字被写出来,可写的大多不是商业内容;僧伽罗语字少,但用它的人会用它买东西。做电商SEO,你要的是后者。
那内容供给密度这把尺子还要不要用
要,只是要知道它回答的是哪个问题。内容供给密度回答的是“我进去之后有没有竞争对手、我的内容能不能被看见”;交易存活率回答的是“我做的这类内容有没有人搜”。
两个问题都得回答,而且答案组合起来才有意义:
- 供给低、存活率高——最好的格子,有需求没竞争,先做
- 供给高、存活率高——正常市场,按常规打法算投产比
- 供给低、存活率低——最容易被误判成机会的格子,实际上是没人搜也没人写,老挝语的交易词就落在这里
- 供给高、存活率低——通常意味着这门语言在网上做的是别的事,比如新闻和教育,不是买卖
第三格是这次最想提醒的。看到“竞争对手少”就冲进去,是小语种最常见的翻车方式。竞争少和需求少,在数据上长得几乎一样,区分它们的唯一办法是把需求单独量一次。
自己跑一遍要多久
这套测量不需要任何付费工具。找一个母语者或者一份靠谱的双语词表,把24个概念翻成目标语言,逐个丢进搜索框看下拉补全出来几条,记在表格里。一个人手工做完24个词大概20分钟,五门语言并排做一遍不到两小时。
有三个细节会影响结果,值得先说:第一,一定要用目标语言的界面语言参数,不然补全库会切到别的语言;第二,同一个词多查一次会有缓存,最好换个时间再验一遍;第三,词一定要是母语者真会打的说法,不能拿词典里的正式对应词硬填,这一条下面还要专门说。
尺子失效了两次,换出来的东西比原计划硬
第一次:整条判定看不见的那个泰文词
开工时还有另一个假设——既然老挝人普遍能读泰文,那么老挝语的搜索建议里应该会混进泰文的查询。这个假设设的阈值是20%。
第一版的判定逻辑是:把每条建议整体判一次,看它主要由哪套文字构成,然后数有多少条被判成泰文。跑完的结果是0条。43条建议,一条泰文都没有。
看上去假设被否掉了。但把43条原文逐条读一遍的时候,有一条不对劲:
ລາຄາຄໍາ ມື້ນີ້ 2025 ล่าสุด
前面是老挝文的“今日金价2025”,最后那个词是泰文,意思是“最新”。这条查询是老挝文和泰文混着打的,可因为老挝文字符占绝大多数,整条判定把它归成了老挝语。尺子没坏,是刻度太粗——按整条判,词级的混入永远看不见。
换成逐字符检测之后,这条立刻浮出来了。虽然只有一条,但它证明了这类混合查询是真实存在的,只是量小到用整条判定的方式抓不住。
第二次:地区参数根本没生效
第二把尺子失效得更彻底。为了验证“老挝人是不是改用泰语搜”,保哥在老挝地区参数下,用泰文和英文分别查了那八个交易动作词。结果很漂亮:泰文71条、英文80条,一个零都没有,而老挝文是1条。
差点就写成结论了。幸好多看了一眼建议的内容。
泰文那一组返回的是“从泰国寄东西到新加坡”“从新加坡寄回泰国”“某电商平台退货”这类——全是泰国本地用户的查询。英文那一组返回的是几家新加坡餐饮品牌、新加坡电信公司、新加坡的一部支付服务法案——全是新加坡的。
没有一条跟老挝有关。地区参数在这里完全没起作用,接口返回的是这门语言的主市场建议,跟指定的国家无关。这已经是这个参数第二次在小语种上失效了,上一次是它分不出同一门语言的四个使用国。
所以“老挝人改用泰语搜”这句话保哥不能说
这是本文最想说清楚的一条方法学:这套测量测不出用户在某个国家用什么语言搜,它只能测出某个词在某门语言的查询池里有没有存在感。
两者听起来很近,其实差得很远。前者是关于人的行为,后者是关于语言的数据分布。手上的证据只支持后者,那就只说后者。至于老挝用户在搜不到老挝语的“退货”时到底切去了哪门语言,没有证据,那一段就不写。
诚实地留个洞,比填一个说得通的猜测要好。因为那个猜测太顺了,读者会信,然后拿去做决策。
换尺子之后能回答的问题变了
有意思的是,尺子失效之后剩下的那个问题,反而比原来的问题更有用。
原来的问题是“老挝人用什么语言搜”,就算答出来,落地动作也很模糊——难道要建一个泰语版本去接老挝流量?地区定位、货币、配送全都对不上。
换出来的问题是“老挝语的查询池里哪些词是活的”,这个问题的落地动作极其明确:活的词做页面,死的词一个字都别写。这一条不依赖任何关于用户行为的推测,纯粹是数据分布。
上一批也是尺子失效之后换出了更硬的结论。连着两次之后,基本可以把它当成一条经验:尺子失效不是坏消息,是换尺子的信号,而换出来的那把往往比原计划的更贴题。原因大概是,第一把尺子通常是照着你的假设设计的,它一失效,你就被迫去看数据本身长什么样。
老挝文和泰文的码点,其实是逐位对齐的
两个块并排放
既然泰语的数据这么全、老挝语这么空,一个很自然的念头是:能不能拿泰语那边的关键词数据反推老挝语的候选词。
这个念头能不能落地,取决于两套文字之间有没有可计算的对应关系。答案有点出人意料。
泰文在Unicode里占U+0E00到U+0E7F这一段,老挝文紧接着占U+0E80到U+0EFF。两个块相邻,各128个码位。当年编码这两套文字的时候,是照着两边字母表的对应关系逐位排的,也就是说理论上偏移恒定,都是0x80。
原本的预期是这个对应关系已经被历史磨得七零八落——老挝语在20世纪做过拼写简化,字母比泰文少,中间应该到处是缺口。
128个偏移位的对账
128个偏移位逐位算了一遍,四种情形的分布是这样的:
- 两边都有字符的76个——这些位可以互相位移
- 只有泰文有的11个——老挝文这边是空洞
- 只有老挝文有的7个——泰文那边是空洞
- 两边都空的34个——不影响
泰文块已分配87个码位,老挝文块83个,两边都有的76个。对齐率87.4%,比预期高出一大截。
只有泰文有的那11个里,有几个是泰语自己废弃的古字母,有几个是泰语专用的符号,还有一个是泰铢的货币符号。也就是说,缺口不是随机分布的,它们集中在“泰语有而老挝语确实不需要”的位置上。
真实语料位移之后,96.14%落得下去
码表对齐是一回事,真实文本能不能位移是另一回事。把前面抓下来的那48835个老挝文字符逐个减0x80,看落点是不是泰文的已分配码位:
- 落在泰文已分配位的:46948个,占96.14%
- 落进空洞的:1887个,占3.86%
而且塌陷不是均匀分布的。1887个失败里,5个字符占了99%,其中光是那个叫MAI KON的元音符号就占了六成:
| 字符 | 码位 | 出现次数 | 占全部塌陷的比例 |
|---|---|---|---|
| ົ | U+0EBB | 1169 | 62% |
| ຽ | U+0EBD | 354 | 19% |
| ໜ | U+0EDC | 147 | 8% |
| ຼ | U+0EBC | 110 | 6% |
| ໝ | U+0EDD | 107 | 6% |
单独给这5个字符写一张映射表,位移的覆盖率就能从96.14%推到接近100%。这是一天之内能做完的工作量,而它换来的是整套泰语关键词数据的可用性。
位移出来的串长什么样
抽几条真实的老挝语搜索建议做位移,看结果:
| 老挝文原串 | 位移之后 | 结果如何 |
|---|---|---|
| ເສື້ອໄຫມລາວ | เสื้อไหมลาว | 完全合法的泰文,意思是老挝丝绸衬衫 |
| ໂທລະສັບ | โทละสับ | 泰语的电话是 โทรศัพท์,音近但拼法不同 |
| ຕູ້ເຢັນ | ตู้เยัน | 泰语的冰箱是 ตู้เย็น,只差一个符号 |
| ສ່ວນຫຼຸດ | ส่วนห□ุด | 中间那个字符落进空洞,塌了 |
第一条最有意思——位移之后一个字符都没塌,而且转出来的是泰文里真实存在的短语。第二条和第三条属于“看得出是同一个词,但拼法对不上”。第四条是空洞塌陷的样子。
一个反向陷阱:码位对齐了,音值没对齐
到这里为止都是好消息,接下来是那个必须知道的陷阱。
把两边都已分配的那76个码位的字母名字逐个比对,同一个偏移位上两边字母名首段相同的只有11个。名称一致率14%。
最能说明问题的一对:泰文U+0E23是 ร,读r音;对位的老挝文U+0EA3是 ຣ,而Unicode给它的正式名字里写着LO——那是l音的字母名。位移到这个码位上,你以为拿到了同一个辅音,实际上音值已经变了。
还有一批更隐蔽的。老挝文块里有十几个码位的字母名带着“巴利语”和“梵语”前缀,它们是为了写佛经里的外来音专门编进去的,现代老挝语一个都不用。真实语料验证了这一点:老挝文块83个已分配码位里,48835个字符实际只用到了53个,有30个已分配码位在真实网页上一次都没出现过。
这批为外来音补的字母跟泰米尔文里那批借用字母是同一个机制,只是老挝这批编码进Unicode的时间晚得多、日常用得更少。词表里要不要收这类字母,本站在泰米尔语的本族造词与音译词该收哪一个里按另一条轴讨论过,这里就不展开了。
那这套位移,能拿来做什么、不能做什么?
能做的:拿泰语的数据反推候选词
用法是这样的:先在泰语那边把某个品类的长尾词跑全——泰语数据丰富,这一步很便宜。然后把这批泰语词整体加0x80位移到老挝文,得到一批候选串。这批串多数不是老挝语的正确拼写,但它们的作用不是直接用,是当种子。
拿这批种子逐个丢进搜索建议,能返回东西的就是活的、拼法也对得上的;返回空的,交给母语者看一眼,通常他能立刻说出正确写法是什么。这个流程把“从零想词”变成了“从一份现成清单里挑和改”,母语者的工时能省掉七八成。
具体怎么跑
五个步骤,一天之内能跑完一个品类:
- 在泰语那边导出目标品类的长尾词,控制在200到500条
- 逐字符加0x80,遇到落进老挝文空洞的位置先标红不处理
- 把标红的那批按前面那张5字符表做人工替换
- 全部丢进搜索建议跑一遍,分成“有建议”“无建议”两堆
- 把两堆一起交给母语者,让他标出“写对了”“写错了但意思对”“完全不是这个词”三类
最后那一步的产出比词表本身值钱。母语者标出来的“写错了但意思对”那一批,会暴露出老挝语和泰语之间系统性的拼写差异,攒够几十条就是一张对照规则表,下次跑别的品类可以直接套。
不能做的:直接当泰文词用,或者直接当老挝文词发出去
两个方向都不行,理由不一样。
位移出来的串不能当泰文词用,因为它多数不是泰语的正确拼写。前面那个例子,老挝语的电话位移过去是 โทละสับ,泰语真正的写法是 โทรศัพท์,拿前者去泰语市场查量会得到零。
反过来,泰语词位移到老挝文之后,更不能直接发到页面上。它会是一串老挝人认得出但觉得写错了的字。拼错的本地文字比英文原文伤害更大——英文原文至少显得你是个外国品牌,拼错的本地文字显得你根本没人校对。
这套位移的定位就是一个候选词生成器,它的输出必须过母语者那一关才能进词表。这一层的验收该问哪些问题,本站在小语种母语审校的验收清单怎么列里整理过一份,直接拿来用就行。
交易词在老挝语里没长出来,那内容到底该怎么写?
漏斗上半截用老挝语,下半截怎么办
数据给的答案很直接:品类页用老挝语做,导购和交易环节的内容不做。
但“不做”不等于“页面上没有”。用户点进品类页之后,配送、退换、保修这些信息还是得写,只是它们的定位从“获客内容”变成了“转化内容”。获客内容按搜索量决定要不要做,转化内容按用户看不看得懂决定,两者不能用同一套标准。
落地上就是:退货政策这一页照写老挝语,但不为它做关键词优化、不给它做外链、不指望它带流量。它的KPI是让点进来的人下单,不是让人搜进来。
品牌名那一格要留出来
前面那40条含拉丁字母的建议给了一个很明确的模板:品类词用老挝文写,品牌和型号用拉丁原文,中间不翻译。
这条落到标题模板上就是一句话——别把型号本地化。摩托车的型号wave 110在老挝语的查询里就是这么打的,你要是转写成老挝文,那个词的搜索量是零。这一条跟多数市场的处理是一致的,只是老挝语这边的证据格外干净。
别去硬造那些不存在的词
看到“退货”在老挝语里零建议,有个很自然的冲动是:那我来造。写一批内容把这个词做起来,等于占了一个没人要的关键词,将来一定升值。
这个想法在别的场景成立,在这里不成立。原因是那八个词不是“还没人写所以没量”,是这门语言的使用者在处理这类事情时用的根本不是搜索。老挝的线上零售规模、支付渗透、物流覆盖决定了“网上退货”这件事本身发生得很少,词自然长不出来。你造得出词,造不出行为。
更划算的做法是把这笔预算放到实体品类词那一列——那43条建议是真实需求,而且竞争极其稀薄。
站内搜索和结构化数据这两块要单独处理
站内搜索这一块跟外部搜索是两回事。用户在你站内搜索框里打的词,跟他在搜索引擎里打的不是同一批,站内更容易出现完整的口语句子。老挝语的站内搜索还有个额外的坑:这门语言不写词间空格,切词要靠词典,而这类词典的维护状况本站在小语种的开源词典是谁在维护里逐格盘过,老挝语那一格的情况可以直接查。
结构化数据那边只要记住一件事:语言字段写lo,别写la,别留空。前面那15个站里有9个把这一格写错了,你写对就已经比本地同行做得好。
排期上这门语言该排在哪一档
把前面的数据合起来看,老挝语的画像是这样的:供给侧干净、竞争稀薄、实体品类词有真实需求、交易和决策类查询整体缺席、语言基础设施可用但要自己动手补。
这画像对应的排期结论是:值得做,但只做窄的一层,投入按“一批品类页加一份词表”估,不要按“一个完整的本地化站点”估。差别可能是三倍以上的预算。
如果同一批预算要在几个东南亚市场里分配,前面那张交易存活率表可以直接当分配依据。这类跨市场的取舍框架,本站在东南亚三个市场的语言层怎么分里给过一套,本文这张表可以当它的一个新输入项。
上线之前,哪几项能自己跑完?
词类分组测试,半小时
这是本文唯一一项必须做的检查,也是最便宜的一项。把24个概念按实体、交易、抽象三组翻成目标语言,逐个查建议,算出交易除以实体这个比值。
做的时候有三个容易出错的地方。第一,词一定要请母语者给,不能查词典——词典给的是正式对应词,那批词恰恰是最容易在搜索里没有量的。第二,界面语言参数一定要设成目标语言,不设的话补全库会切走。第三,别只做一门语言,至少拉一门数据健全的邻居进来当参照,不然你分不清是语言的问题还是尺子的问题。
比值出来之后怎么用:高于0.8按正常市场做;0.3到0.8之间,把还活着的那几个交易词单独挑出来做,其余不碰;低于0.1,只做品类页。
语言标签自查,五分钟
打开自己站的目标语言页面,看html标签上的语言声明。要确认的是三件事:值不是空的、值是语言代码不是国家代码、值没有被建站模板留成默认的英语。
顺手也可以把竞争对手的站扫一遍。前面那15个老挝站里有9个写错,这个比例在小语种市场很常见。如果整个市场的语言声明都是坏的,那你把这一格写对,成本几乎为零,收益是让机器第一时间知道这个页面是给谁看的。
位移覆盖率自查,一小时
只有做老挝语才需要这一项。抓10到20个本地站的正文,把老挝文字符逐个减0x80,统计落进空洞的比例和具体是哪几个字符。
这次跑出来是3.86%、集中在5个字符上。你的语料如果偏向某个特定领域,塌陷的分布可能不一样,那就按自己的数据建映射表。这一步的产出是一张十几行的对照表,一次做完长期可用。
哪些相邻的问题不归这一层管
有四类问题会在做老挝语时一起冒出来,但它们的解法不在本文这一层:
- 没有词间空格导致的切词问题——跟泰语共用同一套机制,去看泰语那一篇
- 页面被自动识别成别的语言——那是短文本识别的问题,跟你写什么词无关
- 字体和字形加载——老挝文的字形集不大,多数系统字体覆盖得了,属于前端问题
- 老挝语内容被AI答案引用不到——那是低资源语言在生成式检索里的通病,跟这门语言的商业词有没有量是两条线,本站在AI检索里的语言偏向与来源审计里专门测过,老挝语在那篇里也被点到了
开头那家电动工具站后来改了什么
三件事。第一,把那批“怎么挑”“哪款好”的导购文章全部取消索引,不是删,是让它们不再消耗抓取预算——内容留着给点进来的用户看。
第二,把品类页的标题模板改成“老挝文品类词加拉丁原文型号”,型号一律不转写。这一改之后进来的词开始出现型号级的长尾。
第三,把原本要投给导购内容的那部分预算挪去补品类页的深度——参数、配件兼容、维修点信息。这些内容不靠搜索量进来,靠的是用户点进品类页之后往下看。
半年之后的情况是自然流量涨了,但结构没变——依然全是品类词加型号。这次不同的是,团队不再把它当成问题了。这门语言在搜索里能给的就是这一格,把这一格吃满,就是这个市场的天花板。
常见问题解答
交易存活率低于0.1的语言,是不是就完全不该做?
不是,是不该按完整本地化去做。老挝语0.02,但实体品类词那一列有43条建议,这些是真实需求,而且几乎没有竞争。正确的做法是把投入压缩到品类页和产品页这一层,砍掉导购、评测、对比这类内容,然后按这个缩小后的范围重新算投产比。很多时候砍完之后这个市场反而变得划算了,因为分母小了一大截。真正该放弃的信号不是比值低,是连实体品类词那一列也塌了——那说明这门语言的使用者根本不在网上买这类东西。
搜索建议返回零条,是不是就等于这个词没有搜索量?
不等于。搜索建议有收录门槛,一个词得达到某个查询量级才会进补全库,所以零建议的准确含义是“低于门槛”而不是“等于零”。但对做内容规划的人来说,这个区别不重要。低于建议库门槛的词,意味着你就算排到第一名也拿不到有意义的流量。反过来要小心的是另一个方向:有建议不等于有商业价值,得看建议的内容是什么。本文里老挝语的“价格”能拉满10条,可十条全是金价和油价,对卖电动工具的站来说等同于零。
把泰语关键词位移过来生成老挝语候选词,会不会有版权或者数据合规问题?
位移这个动作本身处理的是字符编码,不涉及内容复制,产出的是一批候选字符串而不是文章。真正要留意的是上游那批泰语词的来源——如果是从付费工具导出来的,那份数据的使用条款通常会限制再分发,自己内部用没问题,做成产品对外提供就要看合同。另外提醒一句,位移出来的串必须过母语者审核才能上页面,这一步不只是质量把关,也是避免把一批拼错的文字发出去伤害品牌。
老挝语和泰语这么像,能不能只做泰语版本去接老挝的流量?
不建议,理由不在语言层而在运营层。就算老挝用户能读懂泰文页面,你的价格、货币、配送时效、支付方式、售后地址全都是按泰国市场设置的,用户读完之后发现每一项都不适用,转化会很难看。语言能读懂只解决了理解问题,解决不了适用问题。如果预算实在只够做一套,更务实的做法是做泰语版本主攻泰国市场,把老挝当成溢出流量顺手接一接,但别为它单独投入,也别指望它的转化率。
那五个位移会塌的字符,为什么泰文里没有对应的位置?
因为它们是老挝文自己的东西。其中出现最多的那个是一个元音符号,老挝语的拼写系统里用得极频繁,泰语的元音体系不需要它;另外两个是把两个辅音合写成一个字形的合体字母,这是老挝文独有的写法。剩下两个是半元音符号。它们不是泰文“漏掉了”,是当年编码的时候两套文字本来就不完全对应。处理办法是给这五个字符各定一个泰文侧的近似写法,通常是拆成两个字符或者换一个音近的符号,具体怎么定要请懂两门语言的人拍板。
这套词类分组的办法,能不能用在非东南亚的语言上?
能,分组的逻辑跟语系无关。只要是做电商,实体品类、交易动作、决策修饰这三类词就一直存在。要调整的是具体词的选择:不同市场的高频交易动作不完全一样,比如货到付款渗透率高的市场,付款相关的词会比预付市场活跃得多;再比如某些市场的“比价”是强需求,另一些市场几乎不存在。所以搬这套方法的时候,三组各八个词的骨架保留,具体选哪八个要按目标市场的电商习惯换一遍。
做这门语言,母语者要请几个、请什么样的?
一个人就够,但要请对。三条标准:母语者、长期生活在当地、接触过电商或者你所在的品类。第三条最容易被省掉,也最要命——本文这套方法的关键一步是让母语者判断某个词“是不是人们真会打的说法”,没有电商经验的人会按书面标准去判,把一批真实在用的口语说法判成写错了。交付物除了词表本身,一定要额外要一份问题清单,标出每处修改的原因,这份清单攒起来就是下一个品类的规则表。
权威参考资料
本文标题:《老挝语的关键词表在第九个词上断掉,那8个购物动作词一共只拉回来一条建议》
本文链接:https://zhangwenbao.com/lao-seo-transactional-keyword-collapse.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0