小语种内容都在追新词,洗衣机这种词写了19年,21门语言里只有10门写过
本文目录
- 做小语种内容排期,第一批词是怎么挑出来的?
- 清单通常从哪儿来
- 缺口这个词在这里指什么
- 这次量了什么
- 为什么用维基百科的数据
- 本文不谈的两件事
- 二十年过去,洗衣机这种词在几门语言里还是空的?
- 先看两头的对照
- 洗衣机缺在哪11门语言里
- 与之对照的新东西
- 把两组数摆在一张表上
- 缺口的分布不是均匀的
- 阿姆哈拉语的例外说明了什么
- 这批数据里有一把尺子中途失效了,是哪一把?
- 手表这一行不对劲
- 这条判据可以直接用
- 还有一把尺子在同一批数据上失效了
- 换成不受删失影响的口径
- 尺子失效之后剩下什么
- 为什么最普通的词反而最晚有人写?
- 写条目的动机不是需求
- 商业内容的动机也是偏的
- 翻译为什么没有自动补上
- 这个解释能不能证伪
- 这个机制在别的地方也见过
- 逐语言看,缺口集中在哪一档语言上?
- 22门语言的缺口分布
- 这张表分成三段,不是连续的
- 缅甸语和老挝语的一个反常
- 缺口正在被填,速度能测出来
- 就算有条目,它有多旧、有多薄?
- 有没有只是第一层
- 静默月数:多久没人动过
- 陈旧率:超过两年没人动的占多少
- 字节数:条目有多厚
- 三个数怎么合起来读
- 缺口的形状变了,选题清单该怎么改?
- 先把品类词单独拉一张清单
- 逐个查的方法
- 查完之后怎么排优先级
- 内容该怎么写才占得住
- 这套做法的时间成本
- 品类词的位置,凭什么认为你能占住?
- 占住的意思不是排第一
- 三类竞争者各自会怎么动
- 一个反向的风险
- 什么时候该放弃这门语言
- 做完之后怎么判断有没有效
- 哪些相邻的问题不归这一层管?
- 需求侧那半边
- 语言本身的机制那半边
- 引擎收录那半边
- 维基百科代替不了商业内容的调研
- 这套方法的边界在哪
- 常见问题解答
- 维基百科上没有的东西,就等于这门语言的互联网上没有吗?
- 为什么手表那一行不算数,洗衣机那一行就算数?
- 覆盖率低的语言,是不是干脆不该做?
- 这些空格子会不会很快被别人填上?
- 用什么词去查,用英语还是本地语言?
- 条目字节数这个指标可靠吗,会不会被模板撑大?
- 这套缺口分析,中文市场用得上吗?
- 权威参考资料
摘要:拿29个跟做生意有关的概念在22门语言上逐个查条目,量的是三件事——有没有、有多旧、有多薄。结果跟做内容的直觉是反的:全球品牌那一格早填满了,微软21门、谷歌20门、新冠20门;而洗衣机这种词英文写了19年,21门语言里只有10门有人写过,雨伞缺8门,冰箱缺7门,缺的名单里没有一门成熟语言。已有的那些还很旧,约鲁巴语60%、阿姆哈拉语57%的条目超过两年没人动,阿姆哈拉语的条目字节只有英语的1.4%。本文给出完整覆盖表、一把在中途失效的尺子,以及一份把选题从追新词改成占品类词的清单。
去年做一份东南亚市场的内容排期,第一批词的清单是从竞品的热门页面里扒出来的。清单交上去,本地同事看了一遍,问了一句:为什么全是新东西。
清单上确实全是新东西。直播带货、跨境支付、某个平台的运营方法。理由也说得通——新东西竞争少,做得早能占位置。
那位同事说,这些词在我们这儿也确实少人写,但更少人写的是另一批。他举了个例子,你们要不要查一下,我们语言里有没有一篇正经讲洗衣机怎么挑的东西。
查完之后我把那份清单重做了。这篇写的就是重做的依据。
做小语种内容排期,第一批词是怎么挑出来的?
清单通常从哪儿来
做一门新语言的第一批内容,选词的路子来来回回就三条:翻译英语站的现有清单、扒本地竞品的热门页、从关键词工具里按搜索量排序取前几十。
三条路各有各的毛病——拿词典逐词换出来的词表是其中一种——但它们有一个共同的毛病:都在照着已经存在的东西选。翻译照的是英语市场已经存在的,扒竞品照的是本地已经存在的,看搜索量照的是工具已经记录的。
已经存在的东西会有偏向。它偏向热闹的、新的、有人在讨论的,因为只有这些东西才会留下足够多的痕迹让你扒到。
缺口按定义就是没有痕迹的地方。用照着已有的东西选词的办法,找不到缺口。
缺口这个词在这里指什么
先把定义收窄。这里说的缺口不是这个词没有搜索量,也不是这个词竞争度低。它指的是这门语言的公共知识里,关于这个东西还没有一份说得过去的中文之外的表述。
为什么盯这个而不是盯搜索量?因为搜索量在小语种上本来就测不准,工具返回的零有一半是数据缺口。而公共知识里有没有这份东西,可以直接数出来。
更实际的理由是:当有人要在这门语言里回答一个问题——不管是搜索引擎、答案系统,还是一个记者、一个学生——它会去公共知识里找。找不到的时候,你那份就是唯一的一份。
所以缺口的价值不在于竞争少,在于你写的那份会成为默认答案。这两件事在英语市场是一回事,在小语种市场不是。
这次量了什么
29个概念,22门语言,逐个查有没有对应条目、条目什么时候建的、最后一次修改是什么时候、现在有多大。
概念分三组。老的一组是1990年代以前就存在的东西:咖啡、鞋、洗衣机、自行车、冰箱、手表、雨伞、信息技术,加上微软和IBM两个老牌子。
中间一组是2000年之后长出来的:智能手机、电子商务、搜索引擎优化、比特币、Instagram、云计算、二维码、网上购物、加密货币、机器学习、播客,加上谷歌。
新的一组是最近这些年的:TikTok、新冠、5G、通用数据保护条例、充电站、无人机、电动汽车。
为什么用维基百科的数据
这套数据的来源是维基百科各语言版本的条目和它们的完整修订史。选它有一个很实际的理由:它是唯一一个在所有语言上用同一套规则、且把每次修改的时间都公开的地方。
它当然不等于这门语言的商业内容。但它是这门语言公共知识里组织得最好的那一块,用它做出来的结论是个上界。它都空着,商业内容只会更空。
另外它有一个别的来源给不了的性质:可以回溯。所有数字都能截到某一个时点重算,不受今天的状态影响。用同一套数据算写内容的人有几个用的是这批数据的另一列。
本文的所有统计截止到2022年6月30日。
本文不谈的两件事
第一件是这些词有没有搜索量。缺口和需求是两条独立的轴,一个词可以缺而且没人搜,那种词不该做。怎么判断需求那一侧,工具返回零的时候怎么补数据写过。
第二件是写出来之后怎么让引擎收录。那是另一层的事,跟这门语言里有没有人写过没有关系。
本文只回答一个问题:这门语言的公共知识里,哪一格是空的。
二十年过去,洗衣机这种词在几门语言里还是空的?
先看两头的对照
把29个概念按覆盖门数排一遍,最上面和最下面的差距大到不像同一批数据。
最上面:微软21门语言全有,谷歌20门,新冠20门,咖啡18门,自行车17门,鞋16门,Instagram16门,TikTok16门。
最下面:充电站3门,手表7门,网上购物7门,机器学习9门,洗衣机10门,播客10门。
把这两列并排看,一个很别扭的事实浮出来:一门语言里可能有关于TikTok的条目,却没有关于洗衣机的条目。
洗衣机缺在哪11门语言里
洗衣机的英文条目建于2003年1月,到观测点已经19.4年。这19年里,21门非英语语言中有10门写了对应条目,11门没有。
没有的那11门是:缅甸语、高棉语、僧伽罗语、老挝语、蒙古语、尼泊尔语、阿姆哈拉语、斯瓦希里语、豪萨语、约鲁巴语、乌兹别克语。
这11门语言的使用者加起来超过五亿人,其中好几门在印度十一门语言那份预算表里被单独讨论过。这五亿人里想在自己的语言里读一篇关于洗衣机的介绍,公共知识里一份都没有。
雨伞的情况类似,缺8门;冰箱缺7门。这三个都是家家户户都有的东西,也是电商大类里最常见的品类。
与之对照的新东西
新冠的英文条目建于2020年1月,到观测点2.4年。这2.4年里,21门语言中有20门写了对应条目,只有宿务语没有。
TikTok的英文条目建于2018年3月,4.3年时间覆盖了16门。5G十三年覆盖11门。
把新冠那个数摊开算:平均每年有8.35门语言补上这个条目。洗衣机19年才补上10门,平均每年0.51门。差16倍。
当然新冠是极端案例,全球性事件。但即使拿掉新冠和TikTok,剩下的新东西也没有出现洗衣机这种量级的空缺。
把两组数摆在一张表上
| 概念 | 英文条目年龄 | 覆盖门数 | 平均每年补几门 |
|---|---|---|---|
| 新冠 | 2.4年 | 20/21 | 8.35 |
| TikTok | 4.3年 | 16/21 | 3.70 |
| 11.2年 | 16/21 | 1.43 | |
| 谷歌 | 17.7年 | 20/21 | 1.13 |
| 微软 | 20.7年 | 21/21 | 1.02 |
| 咖啡 | 18.2年 | 18/21 | 0.99 |
| 自行车 | 20.9年 | 17/21 | 0.81 |
| 冰箱 | 17.7年 | 14/21 | 0.79 |
| 雨伞 | 18.6年 | 13/21 | 0.70 |
| 洗衣机 | 19.4年 | 10/21 | 0.51 |
| 播客 | 17.7年 | 10/21 | 0.56 |
| 充电站 | 15.2年 | 3/21 | 0.20 |
最上面五行有一个共同点:它们要么是全球品牌,要么是全球事件。最下面几行也有一个共同点:它们是没有主人的普通东西。
缺口的分布不是均匀的
如果一门语言只是内容少,缺口应该均匀地散在各个话题上。实测下来不是这样。
约鲁巴语在这29个概念上缺了24个,剩下的5个是:微软、谷歌、Instagram、二维码、新冠。三个全球品牌、一个技术标准、一个全球性事件,日常品类一个都没有。
豪萨语剩7个:微软、谷歌、Instagram、TikTok、新冠,加上自行车和冰箱。高棉语剩8个,里面有微软、谷歌、TikTok、新冠,加上咖啡、信息技术、电子商务、二维码。
规律很清楚:一门语言的公共知识薄到只剩几条的时候,留下来的几乎全是全球专名和全球事件。它们能留下来不是因为重要,是因为全世界都在说同一个名字,翻译成本最低。
阿姆哈拉语的例外说明了什么
阿姆哈拉语剩下的7条里有一条不符合上面那个规律:咖啡。除了微软、谷歌、新冠这三条全球款,它还有咖啡、鞋、自行车、冰箱。
咖啡出现在这个名单上一点都不奇怪——埃塞俄比亚是咖啡的原产地,这是这个社群的核心话题之一。有人愿意花时间把它写好。
这条例外把规律补完整了。决定一个词在这门语言里有没有人写,不是它新不新,也不是它常不常用,是它跟这个社群有没有特殊关系。
要么是全世界都在说的名字,要么是本地特别在意的东西。两头不沾的普通品类词,就一直空着。洗衣机在任何一个社群里都不是话题,所以在11门语言里没人写。
这批数据里有一把尺子中途失效了,是哪一把?
手表这一行不对劲
覆盖表排出来之后,最低的那几行里有一个数看着别扭:手表只有7门语言有条目。而缺它的名单里出现了瑞典语、希腊语、匈牙利语。
这三门语言在其他所有指标上都属于健康档,它们的维基百科各有几十万到上百万个条目,编辑人数上千。这样的语言不会没有关于手表的内容。
点开看了一下就明白了。这三门语言把手表和钟写在了同一个条目里,一个条目讲计时器具,手表是其中一节。而我用来对齐概念的那个数据库把这个条目链到了钟那一边。
所以手表那一行的7不是真实缺失,是概念切分粒度在语言之间不一致。同样的问题也出现在网上购物那一行——瑞典语和匈牙利语把它并进了电子商务。
这条判据可以直接用
发现这个问题之后,我给整张表加了一道自查:看每个概念的缺失名单里有没有出现成熟语言。
如果缺失名单里出现了瑞典语、希腊语、匈牙利语、波斯语、印尼语这一档,那多半是概念切分问题,不是真实缺失。只有缺失名单全部落在小语种上,才是真信号。
拿这条筛一遍,手表和网上购物两行被标为不可用。而洗衣机、雨伞、冰箱三行全部通过——缺它们的11门、8门、7门语言里,没有一门属于成熟档。
这道自查花了大概二十分钟,救下来的是整篇文章的主结论。如果不做,我会拿手表那个7当成最强的证据,而它是假的。
还有一把尺子在同一批数据上失效了
最开始的分析口径不是覆盖率,是滞后天数——一个概念在英语里有了条目之后,各语言平均隔多久补上。
按这个口径算出来:老概念中位滞后2015天,中间那组1755天,新概念只有1218天。看起来新东西进得更快,正好是我想要的结论。
但这个数是错的,错在观测窗口。新概念的英文条目本身就只有几年历史,它的滞后天数在数学上不可能超过这个年限。老概念有二十年可以慢慢拖,新概念最多只能拖六年。
这叫右删失,是个很基本的统计陷阱,而它在这里伪装得特别好——因为算出来的方向刚好符合直觉,让人不想再查。
换成不受删失影响的口径
补救办法是把所有概念截到同一个观测年限。取英文条目建立后的头六年,数这六年里有几门语言补上了。
结果反过来了:老概念头六年平均覆盖8.2门,中间组8.0门,新概念4.2门。在同样长的窗口里,新东西铺开得反而更慢。
这个口径也不是完美的。老概念的头六年正好是2001到2010年,那是各语言维基百科的扩张期;新概念的头六年是2016到2022,各语言版本早已进入平台期。时代背景在动。
所以两个口径都有偏。真正干净、两边都不受影响的证据只有一条:绝对覆盖数。手表二十年七门、洗衣机十九年十门、充电站十五年三门,这些数不需要任何换算就能说明问题。
尺子失效之后剩下什么
两把尺子倒下之后,主张需要重写。原来想说的是新东西进得快、老东西进得慢;实测支持不了这个说法。
能站住的是另一句:覆盖率跟这个词是不是全球专名强相关,跟它新不新、常不常用都不相关。这句话每一个口径都支持。
顺带说一句,这已经是本站第五次记录到尺子在小语种数据上失效。前几次分别是地区参数不生效、整条判定看不见混合语言、工具对某语言返回的零是数据缺口。
每一次的处理都一样:不是修尺子,是换一把。换出来的那把通常比原计划更硬,因为它绕开了原来那个假设。
为什么最普通的词反而最晚有人写?
写条目的动机不是需求
要解释这个分布,得先想清楚谁在写这些东西,为什么写。写维基条目的人不拿钱,他们写的理由通常是三种之一:这件事我懂、这件事最近很热、这件事跟我们有关。
三种理由都跟这个东西常不常用没有关系。洗衣机每家都有,但它不属于任何一个人的专业,最近也没有新闻,跟任何一个社群都没有特殊关系。
所以它在选题的时候永远排在后面。这不是懒惰,是资源分配——一个只有三十个活跃编辑的社群,先写什么后写什么是有优先级的。
而全球专名不一样。微软、谷歌这类词有现成的英文条目可以对照翻译,事实清楚、结构固定、争议少,是最容易上手的选题。
商业内容的动机也是偏的
那商业内容会不会把这个缺口补上?理论上应该会,因为品类词才是有转化的那批词。实际情况没那么乐观。
做本地内容的团队面临的是同一批约束的另一个版本:预算有限,先做什么后做什么要看回报。而回报最好算的是品牌词和热点词,因为它们的搜索量能测出来。
品类词在小语种上的搜索量恰恰是最测不准的那一批,工具返回的经常是零。于是它在排期上又排到了后面,两个市场的意图差异那一层的判断也就跟着落空。
两批人各有各的理由,避开了同一批词。结果就是这批词在这门语言的互联网上长期是空的。
翻译为什么没有自动补上
还有一个显而易见的候选解释:既然英文条目都在,翻译一遍不就完了。这件事确实一直在发生,但它有自己的偏向。
翻译的优先级通常跟着源语言的重要性走。英文维基里被认为重要的条目、被列进基础条目清单的条目,被翻译的概率更高。
而那些清单本身是按知识体系的重要性排的,不是按商业价值排的。跨语言那份每个语言版本都该有的条目清单也是同一个逻辑,一千条里绝大多数是国家、人物、学科、事件。洗衣机在知识体系里的位置不高,在电商品类里的位置很高,两个排序不是一回事。
这一层的错位是结构性的,不会自己消失。你不做,它就一直空着。
这个解释能不能证伪
上面那套解释听着顺,但顺不等于对。能拿来检验它的一条预测是:如果动机是全球专名和本地话题两头,那么本地特有的东西应该覆盖得很好。
阿姆哈拉语的咖啡就是一个正例。反过来找反例的话,可以查这些语言里本地的传统服饰、本地菜、本地节日有没有条目——按这套解释应该有。
这次没有跑这一组,因为本地特有概念在Wikidata里的对齐质量很差,跨语言比较做不干净。这是一个坦白的缺口,不是结论。
所以上面那套因果讲的是一个说得通的机制,不是被验证过的结论。真正被验证的只有分布本身:全球专名覆盖高,普通品类覆盖低。
这个机制在别的地方也见过
这套结构其实不新鲜。任何靠志愿投入的内容体系都会往同一个方向偏:有争议的、有话题的、有人格化对象的东西被反复写,无聊而必要的东西没人碰。
英文维基百科自己也有这个问题,他们专门有个常设项目在处理这件事。区别在于英语的分母足够大,偏向之后剩下的绝对量还是很可观。
小语种的分母只有几十个人,同样比例的偏向会让整个品类彻底消失。偏向的比例可能一样,后果差了一个数量级。
这也是为什么这套观察不能直接从英语市场的经验里推出来。在英语市场,你从来不会遇到一个品类完全没有人写过的情况。
逐语言看,缺口集中在哪一档语言上?
22门语言的缺口分布
前面按概念看,现在换个方向按语言看:每门语言在老、中、新三组概念上各缺几个。三组的总数分别是10、12、7。
| 语言 | 老概念缺几个 | 中期概念缺几个 | 新概念缺几个 |
|---|---|---|---|
| 印尼语 | 0/10 | 0/12 | 0/7 |
| 波斯语 | 0/10 | 0/12 | 0/7 |
| 瑞典语 | 1/10 | 1/12 | 0/7 |
| 泰语 | 0/10 | 0/12 | 1/7 |
| 越南语 | 0/10 | 0/12 | 1/7 |
| 希腊语 | 1/10 | 0/12 | 1/7 |
| 匈牙利语 | 1/10 | 1/12 | 1/7 |
| 泰米尔语 | 0/10 | 1/12 | 2/7 |
| 孟加拉语 | 0/10 | 1/12 | 2/7 |
| 乌兹别克语 | 3/10 | 6/12 | 3/7 |
| 蒙古语 | 3/10 | 4/12 | 4/7 |
| 僧伽罗语 | 3/10 | 5/12 | 5/7 |
| 斯瓦希里语 | 2/10 | 5/12 | 5/7 |
| 尼泊尔语 | 3/10 | 6/12 | 5/7 |
| 缅甸语 | 5/10 | 7/12 | 3/7 |
| 老挝语 | 6/10 | 9/12 | 4/7 |
| 高棉语 | 7/10 | 9/12 | 5/7 |
| 豪萨语 | 7/10 | 10/12 | 5/7 |
| 阿姆哈拉语 | 5/10 | 11/12 | 6/7 |
| 约鲁巴语 | 9/10 | 9/12 | 6/7 |
这张表分成三段,不是连续的
上面九门语言几乎全绿,缺口加起来不超过三个。这一档做内容跟做英语市场没有本质区别,缺口地图对它们没什么用。
中间六门在三到六之间,是缺口地图最值得跑的一档。有一半的格子空着,另一半有内容可以参照,投入产出比最好。
最下面五门缺了大半,属于公共知识整体薄的状态。这一档要先回答另一个问题——这门语言的商业活动是不是整体用另一门语言在办,答完再决定要不要做。
三段之间的分界不在语言的使用人口上。豪萨语和斯瓦希里语的使用者都以千万计,孟加拉语两亿多,泰米尔语八千万,它们分散在三段里。
缅甸语和老挝语的一个反常
看最下面那一档会发现一件怪事:缅甸语在老概念上缺5个、中期概念缺7个,可新概念只缺3个。老挝语也是,老概念缺6个、中期缺9个,新概念只缺4个。
按比例算,这两门语言在新概念上的覆盖率反而比老概念高。这跟英语的直觉正好相反。
能想到的解释是:新概念大多带着一个全球通行的名字进来,翻译成本低、参照现成;而老概念要用本地词从头写,工作量大得多。前面阿姆哈拉语那条例外说的是同一件事。
不管解释对不对,落到动作上很清楚:在最薄的那几门语言里,你以为最安全的基础品类词,恰恰是最空的那一批。
缺口正在被填,速度能测出来
还有一组数值得记下来:在观测点之后才建起来的条目。这批条目今天存在,但在2022年6月30日那一刻还没有。
乌兹别克语7条,豪萨语4条,蒙古语3条,缅甸语、高棉语、僧伽罗语、斯瓦希里语各2条,越南语、泰米尔语、孟加拉语、老挝语、阿姆哈拉语各1条。
把这个数除以时间跨度,就是这门语言填补缺口的速度。乌兹别克语明显快于其他几门,它同期的编辑人数也在涨,两个信号是一致的。
这个数的用法是估窗口期。如果一门语言每年填两三个格子,而你的品类清单里有十个空格,那你大概有三到五年时间;如果它每年填七八个,就得抓紧。
就算有条目,它有多旧、有多薄?
有没有只是第一层
覆盖率回答的是有没有。但一个存在的条目可能只有两句话,也可能六年没人碰过。对做内容的人来说,这三层是叠加的。
所以同一批条目又量了两件事:最后一次修改距离观测点多久,以及现在有多少字节。第一个是新鲜度,第二个是分量。维基媒体自己有个叫条目深度的口径,做的也是把数量和分量分开这件事。
这两个数跟覆盖率不完全相关。有些语言覆盖率不低,但条目普遍很旧很薄;也有覆盖率低但剩下那几条维护得很勤的。
三个数一起看,才能判断这门语言的这个格子到底是空的、旧的,还是活的。
静默月数:多久没人动过
把每门语言的条目按最后修改时间排,取中位数,得到的是这门语言的内容平均沉睡了多久。
最久的是阿姆哈拉语,60.2个月,五年。然后是约鲁巴语29.6个月、尼泊尔语18.3个月、僧伽罗语17.8个月、蒙古语15.3个月、高棉语10.3个月。
另一头,波斯语0.9个月、越南语1.8个月、印尼语2.1个月、希腊语2.5个月。这些语言的条目几乎每个月都有人碰。
老挝语是7.3个月,缅甸语8.7个月,都在中间。这跟它们的编辑人数对得上——人少但那几个人在动。
陈旧率:超过两年没人动的占多少
中位数会被少数活跃条目拉偏,所以另外算了一个比例:有多少比例的条目超过24个月没人改过。
约鲁巴语60%,阿姆哈拉语57%,老挝语40%,僧伽罗语38%,斯瓦希里语35%,蒙古语33%,高棉语29%,泰米尔语19%。
另一头是一批零:瑞典语、宿务语、泰语、越南语、希腊语、匈牙利语、孟加拉语、豪萨语、乌兹别克语的24个月陈旧率都是0,英语也是0。
这里有个反常值得记下来:豪萨语的24个月陈旧率是0,但它超过6个月没动的比例是71%。它的条目全都在半年到两年之间被碰过一次,一次都没有更久的。这说明它有一个活跃度不高但没断的维护节奏。
字节数:条目有多厚
第三个数是条目大小的中位数,跟英语的中位数比。
阿姆哈拉语1.4%,豪萨语2.1%,老挝语2.5%,斯瓦希里语2.7%,乌兹别克语3.1%,宿务语3.6%,约鲁巴语3.7%,尼泊尔语3.9%。
这一档的意思是:英语条目写了一万字的东西,这门语言里对应的那份是一百多字。不是简版,是一句话加一张信息框。
另一头是波斯语25.6%、希腊语17.8%、印尼语17.6%、越南语16.0%、孟加拉语15.4%。这一档是真的在写内容,只是没英语那么全。
三个数怎么合起来读
把覆盖率、陈旧率、字节比三个数放一起,能分出三种完全不同的格子。
第一种是空的:这门语言根本没有这个条目。你写的那份是第一份,没有参照也没有竞争。
第二种是旧的:有条目,但五年没人动、只有一百多字。这种格子表面上被占了,实际上一推就倒。阿姆哈拉语和约鲁巴语的绝大多数格子属于这一种。
第三种是活的:有条目、经常更新、内容成规模。这一档要按正常竞争对待,波斯语和印尼语的多数格子属于这一种。这三档跟学界给世界语言排的资源等级的资源分层大体对得上,只是那份分层看的是语料总量,这里看的是具体某一格。
缺口的形状变了,选题清单该怎么改?
先把品类词单独拉一张清单
动作上最小的改动是:在原来那份从竞品和工具里扒出来的清单之外,另起一张只放品类词的清单。
品类词的定义很朴素:你的商品分类树上的那些节点名。洗衣机、羽绒服、行李箱、跑鞋、蓝牙耳机,就是这些。不要带修饰语,不要带品牌。
这张清单不需要关键词工具,看自己的后台分类就能列出来。三十到五十个,一小时能列完。
列完之后逐个查这门语言的公共知识里有没有对应内容。查法下一节说。
逐个查的方法
最省事的做法是打开这门语言的维基百科,用它的搜索框逐个搜。有条目、条目多长、最后编辑时间,三个信息在一个页面上都能看到。
三十个词手工查大概四十分钟。要是嫌慢,可以用查询接口批量跑,一次请求能查五十个标题。
查的时候注意用这门语言的说法,不是英语的说法。同一个概念在不同语言里对应的条目标题不一定是直译——品牌名的本地写法是最典型的一类——用跨语言链接找过去最稳。
还要注意前面那条判据:如果一个词查不到,先确认它是不是被并进了上位概念的条目里。并进去了不算缺。
查完之后怎么排优先级
三个信号排出三档。完全没有条目的排最前,这是真空地带。
有条目但两年以上没动、且字节数很小的排第二。这一档的机会同样大,而且写的时候有个现成的参照能看出本地人怎么称呼这个东西。
有条目且维护活跃的排最后。这不意味着不做,意味着做的时候要有比现有内容更强的东西,不能只是复述。
另外提醒一句:这个排序是内容缺口的排序,不是收益排序。真正的排期还要乘上这个品类在你这儿的毛利和库存,这一层每家不一样。
内容该怎么写才占得住
占住一个空格子的门槛比想象中低,但有两个条件。第一是内容本身要能独立成立,不能是一段从英语翻过来的介绍加一个购买链接。
第二是要用本地的说法。这个东西在这门语言里叫什么、当地人买它的时候会关心哪几件事、有没有本地特有的规格或标准,这些是翻译带不过来的。结构化数据里的语言与地区字段那一层也要一起处理。
做到这两条,你那份内容在这个格子里就是最好的一份,而且很可能长期是唯一的一份。母语审校那道工序在这种内容上比在营销文案上重要得多。
反过来,如果做不到这两条,最好别做。一份翻译腔的品类介绍占住格子之后,你后面想改的时候要跟自己竞争。
这套做法的时间成本
列清单一小时,查一遍四十分钟,加起来不到两小时就能拿到一门语言的缺口地图。这个成本低到可以在决定要不要做这门语言之前先跑一遍。
跑完能回答两个问题:这门语言的公共知识空到什么程度,以及我手上这批品类里有几个是真空的。第二个数直接决定第一批内容做几篇。
多门语言并行的时候,这套查法可以复用同一份品类清单,换语言参数重跑。二十门语言一天能跑完。
拿到的结果不会过期得很快。公共知识的填补速度是以年计的,一份缺口地图用一年没问题。
品类词的位置,凭什么认为你能占住?
占住的意思不是排第一
先把话说清楚。这里说的占住,不是指某个关键词排到搜索结果第一位。它指的是当有人在这门语言里问这个东西,你那份内容是被找到的那一份。
这两件事在内容稀薄的语言里几乎重合,因为候选本来就没几个。在英语市场它们差得很远,因为候选有几千个,排序才是全部。
所以小语种的品类词有一个英语市场没有的性质:写得好本身就能兑换可见度,不需要额外的推动。这个性质在候选池填满之后会消失。
能占多久,取决于这门语言的内容生产速度。前面那些数据里,编辑人数和新建量的增长率就是这个速度的代理。
三类竞争者各自会怎么动
可能来抢这个格子的有三类。第一类是本地的内容站和媒体,他们最有可能写,但他们的选题同样跟着热点走,品类介绍不是他们的重点。
第二类是全球品牌的本地站。他们有预算也有动机,但他们写的是自己的产品,不是品类,而且从英文模板批量生成落地页这条路他们走得最熟。品类介绍对他们没有直接回报。
第三类是批量生成的内容。这一类的威胁在过去几年里明显上升,因为生成成本降到了几乎为零。机器翻译直接发布那条质量线讲的就是这类内容的边界。
三类里第三类最值得防,也最好防——它的特征太明显,本地读者一眼能认出来,而且它不会去查本地特有的规格和标准。
一个反向的风险
有一种情况会让整套判断失效:这个品类在这门语言的市场里根本不存在。
洗衣机在某些市场的家庭普及率很低,那么这门语言里没有关于洗衣机的内容不是缺口,是没有需求。这时候你写得再好也没有人来。
区分的办法是拿这个品类的本地说法去查搜索建议,看有没有返回,顺手把用户实际打出来的短形式可以一起做掉。有返回说明这个词在查询池里活着;一条都没有说明这一类查询在这门语言里整个不存在。
这一步不能省。缺口和需求是两条独立的轴,只看缺口会把没有需求的格子当成机会。
什么时候该放弃这门语言
把缺口和需求交叉,会得到四种组合,其中两种是明确的信号。
有缺口且有需求,是最好的机会,该抢。没缺口且没需求,说明这个品类在这门语言里既没人写也没人问,直接放弃。
另外两种要具体判断。有缺口但没需求,多半是品类没长起来,可以等;没缺口但有需求,说明这是个正常市场,按常规打法做。
值得注意的是,第一种和第二种在只看内容量的报表上长得完全一样,都是低数字。把它们分开的唯一办法是把需求那一侧单独测一遍。
做完之后怎么判断有没有效
三个月内不要看流量。品类词在这类市场的量本来就小,三个月的数据看不出趋势,容易做出错误的停手决定。
该看的是三个别的信号:有没有被本地站点引用、有没有出现在这门语言的问答里、有没有人拿它当参考。这三个信号出现得比流量早,本地目录与社群里给过一份可以照抄的渠道清单。
更直接的一个检验是过半年再查一次那个格子。如果这半年里没有第二份内容出现,说明这个位置确实空着,继续做;如果突然冒出来三四份,说明有人跟你想到一块儿了,得加快。
这个复查跟第一次的查法完全一样,五分钟。它比看流量报表更接近这件事的本质。
哪些相邻的问题不归这一层管?
需求侧那半边
本文从头到尾量的是供给:有没有人写过。它一次都没有回答有没有人在搜。
这两件事必须分开测。前面说过怎么测需求那一侧,但那只是一个粗筛,真正做决策的时候还需要更细的信号。
把两侧混在一起是这类分析最常见的错误,因为它们的数字长得像——都是低数字。低供给和低需求,动作完全相反。
语言本身的机制那半边
这门语言的词形怎么变、怎么分词、用什么书写系统,跟公共知识里有没有这个条目完全无关。
它们决定的是你做这门语言的技术成本,比如转小写会把土耳其语的词改成另一个词,又比如屈折语站的锚文本报告里精确匹配那一栏是假的,这一层跟缺口地图没有交集。
两张表分开做:缺口地图进选题会,技术成本进预算表。合成一个分数会得到很奇怪的结论。
引擎收录那半边
写出来的东西能不能被抓到、被收录、被排上去,是另一套逻辑。这门语言公共知识空不空,对引擎的收录行为没有直接影响。
实操上建议先确认引擎那一层没问题,再来看缺口。引擎那层如果有毛病,缺口地图做得再准也用不上。
顺序上这是个前置条件,不是并列关系。
维基百科代替不了商业内容的调研
这一条是本文最大的软肋,值得重复。维基百科的内容分布和商业内容的分布不是同一件事,前者受志愿者兴趣驱动,后者受商业回报驱动。
两者的偏向方向其实挺像——都偏热点、偏品牌、避开无聊而必要的东西。这是这套代理指标能成立的基础,但相似不等于相同。
能做的补充验证有一个:把缺口清单里排最前的三五个词,拿去用这门语言直接搜一遍,看返回的前两页里有没有像样的内容。半小时能跑完,能把明显的误判排掉。
这套方法的边界在哪
它在两种情况下不该用。第一是这门语言的公共知识已经很厚,覆盖率普遍在九成以上,这时候缺口地图全是绿的,给不出信息。表里的波斯语、印尼语、越南语、泰语基本属于这一档。
第二是你要做的品类特别细,细到公共知识里本来就不会有对应的条目。这时候要往上找一层,查它的上位品类,属性值本身在这门语言里怎么分格这类问题也要一并考虑。
剩下的情况它是好用的,尤其是你手上有二十个品类、五门语言,要决定先做哪几格的时候。两小时能把明显的空格找出来。
开头那位本地同事的问题,后来查出来的答案是没有。我们那份清单里加了七个品类词,第一批就上了三个。
常见问题解答
维基百科上没有的东西,就等于这门语言的互联网上没有吗?
不等于,它只是一个方向性的信号。维基百科的内容偏向和商业内容的偏向很像但不完全一样,两者都避开无聊的品类介绍,但商业内容会因为转化价值补上一部分。
所以正确的读法是把它当第一道筛子:维基上有的,商业内容大概率也有;维基上没有的,商业内容里可能有一点,但十有八九不成规模。
拿到缺口清单之后花半小时用这门语言实搜前三个词,看前两页的结果,就能把误判排掉。这一步的成本很低,但能让整份清单从推测变成有依据。
为什么手表那一行不算数,洗衣机那一行就算数?
判据是缺失名单的构成。手表的缺失名单里有瑞典语、希腊语、匈牙利语,这三门语言的维基百科各有几十万到上百万条目、上千名编辑,不可能真的没有关于手表的内容。
点开确认之后发现它们把手表和钟写在同一个条目里,是概念切分粒度的差异,不是缺失。洗衣机的缺失名单里一门成熟语言都没有,全部是小语种,所以它是真信号。
这条判据可以直接搬去用在你自己跑的数据上:任何一个概念,如果它的缺失名单里出现了内容量明显充足的语言,先假设是对齐问题,点开验证之后再决定要不要采信。
覆盖率低的语言,是不是干脆不该做?
正好相反,覆盖率低本身是机会信号,但它必须跟需求侧的数据一起看才有意义。
缺口大而有需求,是最值得投的一档;缺口大而没需求,说明这个品类在这个市场还没长出来,可以先记下来等两年。这两种在报表上都表现为低数字,分开它们的唯一办法是单独测一次需求。
另外还要看这门语言的内容有多旧多薄。有条目但五年没人动、只有一百多字的格子,实际难度跟完全空着差不多,机会同样大。
这些空格子会不会很快被别人填上?
速度比想象中慢。公共知识的填补是以年为单位的:洗衣机这个条目在英语里存在了19年,21门语言里才补上10门,平均每年0.51门。
会加速这个过程的因素有两个:一是批量生成内容的成本降到接近零,二是这门语言的编辑人群在增长。第二个因素可以直接查,把新建量和编辑人数的年度趋势拉出来看方向。
保险的做法是做完之后每半年复查一次那几个格子,看有没有第二份内容出现。这个复查跟第一次的查法一样,五分钟,比看流量报表更接近这件事的本质。
用什么词去查,用英语还是本地语言?
用本地语言,而且要用跨语言链接找过去,不要自己翻译。同一个概念在不同语言里的条目标题经常不是直译,自己翻的词很可能查不到已经存在的条目。
做法是先在英文维基上找到这个概念的条目,然后从侧边的语言列表里点到目标语言。这一步同时能拿到这个概念在这门语言里的标准说法,写内容的时候用得上。
要批量跑的话,用概念的实体编号一次拿到它在所有语言的标题,一个请求几十个概念。这比逐个搜快得多,也不会因为翻译不准漏掉。
条目字节数这个指标可靠吗,会不会被模板撑大?
会,这是它最大的问题。信息框、分类标签、参考文献列表都算在字节里,一个只有两句正文的条目可能因为挂了一堆模板而显得不小。
所以字节数只适合做量级判断,不适合做精确比较。1.4%和25.6%的差别是真的,14%和16%的差别不必当真。
要更准的话得把渲染后的正文抽出来单独数,那要多一步抓取。做初筛的时候不值得,做最终决策的时候可以对排在最前面的那几个词单独做一遍。
这套缺口分析,中文市场用得上吗?
整体上用不上,中文的公共知识在覆盖率这一层已经很厚,缺口地图基本全绿。
但换一个粒度就有用了。如果你做的是一个很细的垂直领域,同样可以问:这个领域里的基础概念有没有一份说得过去的公开表述。答案往往是有,但都很旧,或者都是互相抄的。
做法上要换个数据源,中文没有一个像维基那样公开修订史的地方,只能靠实搜和抽样。结论会粗糙一些,但那个提问方式——不问竞争多不多,问最基础的那一份写好了没有——是可以直接搬的。
权威参考资料
本文标题:《小语种内容都在追新词,洗衣机这种词写了19年,21门语言里只有10门写过》
本文链接:https://zhangwenbao.com/minor-language-content-gap-category-words.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0