小语种内容都在追新词,洗衣机这种词写了19年,21门语言里只有10门写过

小语种内容都在追新词,洗衣机这种词写了19年,21门语言里只有10门写过
张文保 34 分钟阅读 1,243 阅读
本文目录
  1. 做小语种内容排期,第一批词是怎么挑出来的?
  2. 清单通常从哪儿来
  3. 缺口这个词在这里指什么
  4. 这次量了什么
  5. 为什么用维基百科的数据
  6. 本文不谈的两件事
  7. 二十年过去,洗衣机这种词在几门语言里还是空的?
  8. 先看两头的对照
  9. 洗衣机缺在哪11门语言里
  10. 与之对照的新东西
  11. 把两组数摆在一张表上
  12. 缺口的分布不是均匀的
  13. 阿姆哈拉语的例外说明了什么
  14. 这批数据里有一把尺子中途失效了,是哪一把?
  15. 手表这一行不对劲
  16. 这条判据可以直接用
  17. 还有一把尺子在同一批数据上失效了
  18. 换成不受删失影响的口径
  19. 尺子失效之后剩下什么
  20. 为什么最普通的词反而最晚有人写?
  21. 写条目的动机不是需求
  22. 商业内容的动机也是偏的
  23. 翻译为什么没有自动补上
  24. 这个解释能不能证伪
  25. 这个机制在别的地方也见过
  26. 逐语言看,缺口集中在哪一档语言上?
  27. 22门语言的缺口分布
  28. 这张表分成三段,不是连续的
  29. 缅甸语和老挝语的一个反常
  30. 缺口正在被填,速度能测出来
  31. 就算有条目,它有多旧、有多薄?
  32. 有没有只是第一层
  33. 静默月数:多久没人动过
  34. 陈旧率:超过两年没人动的占多少
  35. 字节数:条目有多厚
  36. 三个数怎么合起来读
  37. 缺口的形状变了,选题清单该怎么改?
  38. 先把品类词单独拉一张清单
  39. 逐个查的方法
  40. 查完之后怎么排优先级
  41. 内容该怎么写才占得住
  42. 这套做法的时间成本
  43. 品类词的位置,凭什么认为你能占住?
  44. 占住的意思不是排第一
  45. 三类竞争者各自会怎么动
  46. 一个反向的风险
  47. 什么时候该放弃这门语言
  48. 做完之后怎么判断有没有效
  49. 哪些相邻的问题不归这一层管?
  50. 需求侧那半边
  51. 语言本身的机制那半边
  52. 引擎收录那半边
  53. 维基百科代替不了商业内容的调研
  54. 这套方法的边界在哪
  55. 常见问题解答
  56. 维基百科上没有的东西,就等于这门语言的互联网上没有吗?
  57. 为什么手表那一行不算数,洗衣机那一行就算数?
  58. 覆盖率低的语言,是不是干脆不该做?
  59. 这些空格子会不会很快被别人填上?
  60. 用什么词去查,用英语还是本地语言?
  61. 条目字节数这个指标可靠吗,会不会被模板撑大?
  62. 这套缺口分析,中文市场用得上吗?
  63. 权威参考资料

摘要:拿29个跟做生意有关的概念在22门语言上逐个查条目,量的是三件事——有没有、有多旧、有多薄。结果跟做内容的直觉是反的:全球品牌那一格早填满了,微软21门、谷歌20门、新冠20门;而洗衣机这种词英文写了19年,21门语言里只有10门有人写过,雨伞缺8门,冰箱缺7门,缺的名单里没有一门成熟语言。已有的那些还很旧,约鲁巴语60%、阿姆哈拉语57%的条目超过两年没人动,阿姆哈拉语的条目字节只有英语的1.4%。本文给出完整覆盖表、一把在中途失效的尺子,以及一份把选题从追新词改成占品类词的清单。

去年做一份东南亚市场的内容排期,第一批词的清单是从竞品的热门页面里扒出来的。清单交上去,本地同事看了一遍,问了一句:为什么全是新东西。

清单上确实全是新东西。直播带货、跨境支付、某个平台的运营方法。理由也说得通——新东西竞争少,做得早能占位置。

那位同事说,这些词在我们这儿也确实少人写,但更少人写的是另一批。他举了个例子,你们要不要查一下,我们语言里有没有一篇正经讲洗衣机怎么挑的东西。

查完之后我把那份清单重做了。这篇写的就是重做的依据。

做小语种内容排期,第一批词是怎么挑出来的?

清单通常从哪儿来

做一门新语言的第一批内容,选词的路子来来回回就三条:翻译英语站的现有清单、扒本地竞品的热门页、从关键词工具里按搜索量排序取前几十。

三条路各有各的毛病——拿词典逐词换出来的词表是其中一种——但它们有一个共同的毛病:都在照着已经存在的东西选。翻译照的是英语市场已经存在的,扒竞品照的是本地已经存在的,看搜索量照的是工具已经记录的。

已经存在的东西会有偏向。它偏向热闹的、新的、有人在讨论的,因为只有这些东西才会留下足够多的痕迹让你扒到。

缺口按定义就是没有痕迹的地方。用照着已有的东西选词的办法,找不到缺口。

缺口这个词在这里指什么

先把定义收窄。这里说的缺口不是这个词没有搜索量,也不是这个词竞争度低。它指的是这门语言的公共知识里,关于这个东西还没有一份说得过去的中文之外的表述。

为什么盯这个而不是盯搜索量?因为搜索量在小语种上本来就测不准,工具返回的零有一半是数据缺口。而公共知识里有没有这份东西,可以直接数出来。

更实际的理由是:当有人要在这门语言里回答一个问题——不管是搜索引擎、答案系统,还是一个记者、一个学生——它会去公共知识里找。找不到的时候,你那份就是唯一的一份。

所以缺口的价值不在于竞争少,在于你写的那份会成为默认答案。这两件事在英语市场是一回事,在小语种市场不是。

这次量了什么

29个概念,22门语言,逐个查有没有对应条目、条目什么时候建的、最后一次修改是什么时候、现在有多大。

概念分三组。老的一组是1990年代以前就存在的东西:咖啡、鞋、洗衣机、自行车、冰箱、手表、雨伞、信息技术,加上微软和IBM两个老牌子。

中间一组是2000年之后长出来的:智能手机、电子商务、搜索引擎优化、比特币、Instagram、云计算、二维码、网上购物、加密货币、机器学习、播客,加上谷歌。

新的一组是最近这些年的:TikTok、新冠、5G、通用数据保护条例、充电站、无人机、电动汽车。

为什么用维基百科的数据

这套数据的来源是维基百科各语言版本的条目和它们的完整修订史。选它有一个很实际的理由:它是唯一一个在所有语言上用同一套规则、且把每次修改的时间都公开的地方。

它当然不等于这门语言的商业内容。但它是这门语言公共知识里组织得最好的那一块,用它做出来的结论是个上界。它都空着,商业内容只会更空。

另外它有一个别的来源给不了的性质:可以回溯。所有数字都能截到某一个时点重算,不受今天的状态影响。用同一套数据算写内容的人有几个用的是这批数据的另一列。

本文的所有统计截止到2022年6月30日。

本文不谈的两件事

第一件是这些词有没有搜索量。缺口和需求是两条独立的轴,一个词可以缺而且没人搜,那种词不该做。怎么判断需求那一侧,工具返回零的时候怎么补数据写过。

第二件是写出来之后怎么让引擎收录。那是另一层的事,跟这门语言里有没有人写过没有关系。

本文只回答一个问题:这门语言的公共知识里,哪一格是空的。

二十年过去,洗衣机这种词在几门语言里还是空的?

先看两头的对照

把29个概念按覆盖门数排一遍,最上面和最下面的差距大到不像同一批数据。

最上面:微软21门语言全有,谷歌20门,新冠20门,咖啡18门,自行车17门,鞋16门,Instagram16门,TikTok16门。

最下面:充电站3门,手表7门,网上购物7门,机器学习9门,洗衣机10门,播客10门。

把这两列并排看,一个很别扭的事实浮出来:一门语言里可能有关于TikTok的条目,却没有关于洗衣机的条目。

洗衣机缺在哪11门语言里

洗衣机的英文条目建于2003年1月,到观测点已经19.4年。这19年里,21门非英语语言中有10门写了对应条目,11门没有。

没有的那11门是:缅甸语、高棉语、僧伽罗语、老挝语、蒙古语、尼泊尔语、阿姆哈拉语、斯瓦希里语、豪萨语、约鲁巴语、乌兹别克语。

这11门语言的使用者加起来超过五亿人,其中好几门在印度十一门语言那份预算表里被单独讨论过。这五亿人里想在自己的语言里读一篇关于洗衣机的介绍,公共知识里一份都没有。

雨伞的情况类似,缺8门;冰箱缺7门。这三个都是家家户户都有的东西,也是电商大类里最常见的品类。

与之对照的新东西

新冠的英文条目建于2020年1月,到观测点2.4年。这2.4年里,21门语言中有20门写了对应条目,只有宿务语没有。

TikTok的英文条目建于2018年3月,4.3年时间覆盖了16门。5G十三年覆盖11门。

把新冠那个数摊开算:平均每年有8.35门语言补上这个条目。洗衣机19年才补上10门,平均每年0.51门。差16倍。

当然新冠是极端案例,全球性事件。但即使拿掉新冠和TikTok,剩下的新东西也没有出现洗衣机这种量级的空缺。

把两组数摆在一张表上

概念英文条目年龄覆盖门数平均每年补几门
新冠2.4年20/218.35
TikTok4.3年16/213.70
Instagram11.2年16/211.43
谷歌17.7年20/211.13
微软20.7年21/211.02
咖啡18.2年18/210.99
自行车20.9年17/210.81
冰箱17.7年14/210.79
雨伞18.6年13/210.70
洗衣机19.4年10/210.51
播客17.7年10/210.56
充电站15.2年3/210.20

最上面五行有一个共同点:它们要么是全球品牌,要么是全球事件。最下面几行也有一个共同点:它们是没有主人的普通东西。

缺口的分布不是均匀的

如果一门语言只是内容少,缺口应该均匀地散在各个话题上。实测下来不是这样。

约鲁巴语在这29个概念上缺了24个,剩下的5个是:微软、谷歌、Instagram、二维码、新冠。三个全球品牌、一个技术标准、一个全球性事件,日常品类一个都没有。

豪萨语剩7个:微软、谷歌、Instagram、TikTok、新冠,加上自行车和冰箱。高棉语剩8个,里面有微软、谷歌、TikTok、新冠,加上咖啡、信息技术、电子商务、二维码。

规律很清楚:一门语言的公共知识薄到只剩几条的时候,留下来的几乎全是全球专名和全球事件。它们能留下来不是因为重要,是因为全世界都在说同一个名字,翻译成本最低。

阿姆哈拉语的例外说明了什么

阿姆哈拉语剩下的7条里有一条不符合上面那个规律:咖啡。除了微软、谷歌、新冠这三条全球款,它还有咖啡、鞋、自行车、冰箱。

咖啡出现在这个名单上一点都不奇怪——埃塞俄比亚是咖啡的原产地,这是这个社群的核心话题之一。有人愿意花时间把它写好。

这条例外把规律补完整了。决定一个词在这门语言里有没有人写,不是它新不新,也不是它常不常用,是它跟这个社群有没有特殊关系。

要么是全世界都在说的名字,要么是本地特别在意的东西。两头不沾的普通品类词,就一直空着。洗衣机在任何一个社群里都不是话题,所以在11门语言里没人写。

这批数据里有一把尺子中途失效了,是哪一把?

手表这一行不对劲

覆盖表排出来之后,最低的那几行里有一个数看着别扭:手表只有7门语言有条目。而缺它的名单里出现了瑞典语、希腊语、匈牙利语。

这三门语言在其他所有指标上都属于健康档,它们的维基百科各有几十万到上百万个条目,编辑人数上千。这样的语言不会没有关于手表的内容。

点开看了一下就明白了。这三门语言把手表和钟写在了同一个条目里,一个条目讲计时器具,手表是其中一节。而我用来对齐概念的那个数据库把这个条目链到了钟那一边。

所以手表那一行的7不是真实缺失,是概念切分粒度在语言之间不一致。同样的问题也出现在网上购物那一行——瑞典语和匈牙利语把它并进了电子商务。

这条判据可以直接用

发现这个问题之后,我给整张表加了一道自查:看每个概念的缺失名单里有没有出现成熟语言。

如果缺失名单里出现了瑞典语、希腊语、匈牙利语、波斯语、印尼语这一档,那多半是概念切分问题,不是真实缺失。只有缺失名单全部落在小语种上,才是真信号。

拿这条筛一遍,手表和网上购物两行被标为不可用。而洗衣机、雨伞、冰箱三行全部通过——缺它们的11门、8门、7门语言里,没有一门属于成熟档。

这道自查花了大概二十分钟,救下来的是整篇文章的主结论。如果不做,我会拿手表那个7当成最强的证据,而它是假的。

还有一把尺子在同一批数据上失效了

最开始的分析口径不是覆盖率,是滞后天数——一个概念在英语里有了条目之后,各语言平均隔多久补上。

按这个口径算出来:老概念中位滞后2015天,中间那组1755天,新概念只有1218天。看起来新东西进得更快,正好是我想要的结论。

但这个数是错的,错在观测窗口。新概念的英文条目本身就只有几年历史,它的滞后天数在数学上不可能超过这个年限。老概念有二十年可以慢慢拖,新概念最多只能拖六年。

这叫右删失,是个很基本的统计陷阱,而它在这里伪装得特别好——因为算出来的方向刚好符合直觉,让人不想再查。

换成不受删失影响的口径

补救办法是把所有概念截到同一个观测年限。取英文条目建立后的头六年,数这六年里有几门语言补上了。

结果反过来了:老概念头六年平均覆盖8.2门,中间组8.0门,新概念4.2门。在同样长的窗口里,新东西铺开得反而更慢。

这个口径也不是完美的。老概念的头六年正好是2001到2010年,那是各语言维基百科的扩张期;新概念的头六年是2016到2022,各语言版本早已进入平台期。时代背景在动。

所以两个口径都有偏。真正干净、两边都不受影响的证据只有一条:绝对覆盖数。手表二十年七门、洗衣机十九年十门、充电站十五年三门,这些数不需要任何换算就能说明问题。

尺子失效之后剩下什么

两把尺子倒下之后,主张需要重写。原来想说的是新东西进得快、老东西进得慢;实测支持不了这个说法。

能站住的是另一句:覆盖率跟这个词是不是全球专名强相关,跟它新不新、常不常用都不相关。这句话每一个口径都支持。

顺带说一句,这已经是本站第五次记录到尺子在小语种数据上失效。前几次分别是地区参数不生效、整条判定看不见混合语言、工具对某语言返回的零是数据缺口。

每一次的处理都一样:不是修尺子,是换一把。换出来的那把通常比原计划更硬,因为它绕开了原来那个假设。

为什么最普通的词反而最晚有人写?

写条目的动机不是需求

要解释这个分布,得先想清楚谁在写这些东西,为什么写。写维基条目的人不拿钱,他们写的理由通常是三种之一:这件事我懂、这件事最近很热、这件事跟我们有关。

三种理由都跟这个东西常不常用没有关系。洗衣机每家都有,但它不属于任何一个人的专业,最近也没有新闻,跟任何一个社群都没有特殊关系。

所以它在选题的时候永远排在后面。这不是懒惰,是资源分配——一个只有三十个活跃编辑的社群,先写什么后写什么是有优先级的。

而全球专名不一样。微软、谷歌这类词有现成的英文条目可以对照翻译,事实清楚、结构固定、争议少,是最容易上手的选题。

商业内容的动机也是偏的

那商业内容会不会把这个缺口补上?理论上应该会,因为品类词才是有转化的那批词。实际情况没那么乐观。

做本地内容的团队面临的是同一批约束的另一个版本:预算有限,先做什么后做什么要看回报。而回报最好算的是品牌词和热点词,因为它们的搜索量能测出来。

品类词在小语种上的搜索量恰恰是最测不准的那一批,工具返回的经常是零。于是它在排期上又排到了后面,两个市场的意图差异那一层的判断也就跟着落空。

两批人各有各的理由,避开了同一批词。结果就是这批词在这门语言的互联网上长期是空的。

翻译为什么没有自动补上

还有一个显而易见的候选解释:既然英文条目都在,翻译一遍不就完了。这件事确实一直在发生,但它有自己的偏向。

翻译的优先级通常跟着源语言的重要性走。英文维基里被认为重要的条目、被列进基础条目清单的条目,被翻译的概率更高。

而那些清单本身是按知识体系的重要性排的,不是按商业价值排的。跨语言那份每个语言版本都该有的条目清单也是同一个逻辑,一千条里绝大多数是国家、人物、学科、事件。洗衣机在知识体系里的位置不高,在电商品类里的位置很高,两个排序不是一回事。

这一层的错位是结构性的,不会自己消失。你不做,它就一直空着。

这个解释能不能证伪

上面那套解释听着顺,但顺不等于对。能拿来检验它的一条预测是:如果动机是全球专名和本地话题两头,那么本地特有的东西应该覆盖得很好。

阿姆哈拉语的咖啡就是一个正例。反过来找反例的话,可以查这些语言里本地的传统服饰、本地菜、本地节日有没有条目——按这套解释应该有。

这次没有跑这一组,因为本地特有概念在Wikidata里的对齐质量很差,跨语言比较做不干净。这是一个坦白的缺口,不是结论。

所以上面那套因果讲的是一个说得通的机制,不是被验证过的结论。真正被验证的只有分布本身:全球专名覆盖高,普通品类覆盖低。

这个机制在别的地方也见过

这套结构其实不新鲜。任何靠志愿投入的内容体系都会往同一个方向偏:有争议的、有话题的、有人格化对象的东西被反复写,无聊而必要的东西没人碰。

英文维基百科自己也有这个问题,他们专门有个常设项目在处理这件事。区别在于英语的分母足够大,偏向之后剩下的绝对量还是很可观。

小语种的分母只有几十个人,同样比例的偏向会让整个品类彻底消失。偏向的比例可能一样,后果差了一个数量级。

这也是为什么这套观察不能直接从英语市场的经验里推出来。在英语市场,你从来不会遇到一个品类完全没有人写过的情况。

逐语言看,缺口集中在哪一档语言上?

22门语言的缺口分布

前面按概念看,现在换个方向按语言看:每门语言在老、中、新三组概念上各缺几个。三组的总数分别是10、12、7。

语言老概念缺几个中期概念缺几个新概念缺几个
印尼语0/100/120/7
波斯语0/100/120/7
瑞典语1/101/120/7
泰语0/100/121/7
越南语0/100/121/7
希腊语1/100/121/7
匈牙利语1/101/121/7
泰米尔语0/101/122/7
孟加拉语0/101/122/7
乌兹别克语3/106/123/7
蒙古语3/104/124/7
僧伽罗语3/105/125/7
斯瓦希里语2/105/125/7
尼泊尔语3/106/125/7
缅甸语5/107/123/7
老挝语6/109/124/7
高棉语7/109/125/7
豪萨语7/1010/125/7
阿姆哈拉语5/1011/126/7
约鲁巴语9/109/126/7

这张表分成三段,不是连续的

上面九门语言几乎全绿,缺口加起来不超过三个。这一档做内容跟做英语市场没有本质区别,缺口地图对它们没什么用。

中间六门在三到六之间,是缺口地图最值得跑的一档。有一半的格子空着,另一半有内容可以参照,投入产出比最好。

最下面五门缺了大半,属于公共知识整体薄的状态。这一档要先回答另一个问题——这门语言的商业活动是不是整体用另一门语言在办,答完再决定要不要做。

三段之间的分界不在语言的使用人口上。豪萨语和斯瓦希里语的使用者都以千万计,孟加拉语两亿多,泰米尔语八千万,它们分散在三段里。

缅甸语和老挝语的一个反常

看最下面那一档会发现一件怪事:缅甸语在老概念上缺5个、中期概念缺7个,可新概念只缺3个。老挝语也是,老概念缺6个、中期缺9个,新概念只缺4个。

按比例算,这两门语言在新概念上的覆盖率反而比老概念高。这跟英语的直觉正好相反。

能想到的解释是:新概念大多带着一个全球通行的名字进来,翻译成本低、参照现成;而老概念要用本地词从头写,工作量大得多。前面阿姆哈拉语那条例外说的是同一件事。

不管解释对不对,落到动作上很清楚:在最薄的那几门语言里,你以为最安全的基础品类词,恰恰是最空的那一批。

缺口正在被填,速度能测出来

还有一组数值得记下来:在观测点之后才建起来的条目。这批条目今天存在,但在2022年6月30日那一刻还没有。

乌兹别克语7条,豪萨语4条,蒙古语3条,缅甸语、高棉语、僧伽罗语、斯瓦希里语各2条,越南语、泰米尔语、孟加拉语、老挝语、阿姆哈拉语各1条。

把这个数除以时间跨度,就是这门语言填补缺口的速度。乌兹别克语明显快于其他几门,它同期的编辑人数也在涨,两个信号是一致的。

这个数的用法是估窗口期。如果一门语言每年填两三个格子,而你的品类清单里有十个空格,那你大概有三到五年时间;如果它每年填七八个,就得抓紧。

就算有条目,它有多旧、有多薄?

有没有只是第一层

覆盖率回答的是有没有。但一个存在的条目可能只有两句话,也可能六年没人碰过。对做内容的人来说,这三层是叠加的。

所以同一批条目又量了两件事:最后一次修改距离观测点多久,以及现在有多少字节。第一个是新鲜度,第二个是分量。维基媒体自己有个叫条目深度的口径,做的也是把数量和分量分开这件事。

这两个数跟覆盖率不完全相关。有些语言覆盖率不低,但条目普遍很旧很薄;也有覆盖率低但剩下那几条维护得很勤的。

三个数一起看,才能判断这门语言的这个格子到底是空的、旧的,还是活的。

静默月数:多久没人动过

把每门语言的条目按最后修改时间排,取中位数,得到的是这门语言的内容平均沉睡了多久。

最久的是阿姆哈拉语,60.2个月,五年。然后是约鲁巴语29.6个月、尼泊尔语18.3个月、僧伽罗语17.8个月、蒙古语15.3个月、高棉语10.3个月。

另一头,波斯语0.9个月、越南语1.8个月、印尼语2.1个月、希腊语2.5个月。这些语言的条目几乎每个月都有人碰。

老挝语是7.3个月,缅甸语8.7个月,都在中间。这跟它们的编辑人数对得上——人少但那几个人在动。

陈旧率:超过两年没人动的占多少

中位数会被少数活跃条目拉偏,所以另外算了一个比例:有多少比例的条目超过24个月没人改过。

约鲁巴语60%,阿姆哈拉语57%,老挝语40%,僧伽罗语38%,斯瓦希里语35%,蒙古语33%,高棉语29%,泰米尔语19%。

另一头是一批零:瑞典语、宿务语、泰语、越南语、希腊语、匈牙利语、孟加拉语、豪萨语、乌兹别克语的24个月陈旧率都是0,英语也是0。

这里有个反常值得记下来:豪萨语的24个月陈旧率是0,但它超过6个月没动的比例是71%。它的条目全都在半年到两年之间被碰过一次,一次都没有更久的。这说明它有一个活跃度不高但没断的维护节奏。

字节数:条目有多厚

第三个数是条目大小的中位数,跟英语的中位数比。

阿姆哈拉语1.4%,豪萨语2.1%,老挝语2.5%,斯瓦希里语2.7%,乌兹别克语3.1%,宿务语3.6%,约鲁巴语3.7%,尼泊尔语3.9%。

这一档的意思是:英语条目写了一万字的东西,这门语言里对应的那份是一百多字。不是简版,是一句话加一张信息框。

另一头是波斯语25.6%、希腊语17.8%、印尼语17.6%、越南语16.0%、孟加拉语15.4%。这一档是真的在写内容,只是没英语那么全。

三个数怎么合起来读

把覆盖率、陈旧率、字节比三个数放一起,能分出三种完全不同的格子。

第一种是空的:这门语言根本没有这个条目。你写的那份是第一份,没有参照也没有竞争。

第二种是旧的:有条目,但五年没人动、只有一百多字。这种格子表面上被占了,实际上一推就倒。阿姆哈拉语和约鲁巴语的绝大多数格子属于这一种。

第三种是活的:有条目、经常更新、内容成规模。这一档要按正常竞争对待,波斯语和印尼语的多数格子属于这一种。这三档跟学界给世界语言排的资源等级的资源分层大体对得上,只是那份分层看的是语料总量,这里看的是具体某一格。

缺口的形状变了,选题清单该怎么改?

先把品类词单独拉一张清单

动作上最小的改动是:在原来那份从竞品和工具里扒出来的清单之外,另起一张只放品类词的清单。

品类词的定义很朴素:你的商品分类树上的那些节点名。洗衣机、羽绒服、行李箱、跑鞋、蓝牙耳机,就是这些。不要带修饰语,不要带品牌。

这张清单不需要关键词工具,看自己的后台分类就能列出来。三十到五十个,一小时能列完。

列完之后逐个查这门语言的公共知识里有没有对应内容。查法下一节说。

逐个查的方法

最省事的做法是打开这门语言的维基百科,用它的搜索框逐个搜。有条目、条目多长、最后编辑时间,三个信息在一个页面上都能看到。

三十个词手工查大概四十分钟。要是嫌慢,可以用查询接口批量跑,一次请求能查五十个标题。

查的时候注意用这门语言的说法,不是英语的说法。同一个概念在不同语言里对应的条目标题不一定是直译——品牌名的本地写法是最典型的一类——用跨语言链接找过去最稳。

还要注意前面那条判据:如果一个词查不到,先确认它是不是被并进了上位概念的条目里。并进去了不算缺。

查完之后怎么排优先级

三个信号排出三档。完全没有条目的排最前,这是真空地带。

有条目但两年以上没动、且字节数很小的排第二。这一档的机会同样大,而且写的时候有个现成的参照能看出本地人怎么称呼这个东西。

有条目且维护活跃的排最后。这不意味着不做,意味着做的时候要有比现有内容更强的东西,不能只是复述。

另外提醒一句:这个排序是内容缺口的排序,不是收益排序。真正的排期还要乘上这个品类在你这儿的毛利和库存,这一层每家不一样。

内容该怎么写才占得住

占住一个空格子的门槛比想象中低,但有两个条件。第一是内容本身要能独立成立,不能是一段从英语翻过来的介绍加一个购买链接。

第二是要用本地的说法。这个东西在这门语言里叫什么、当地人买它的时候会关心哪几件事、有没有本地特有的规格或标准,这些是翻译带不过来的。结构化数据里的语言与地区字段那一层也要一起处理。

做到这两条,你那份内容在这个格子里就是最好的一份,而且很可能长期是唯一的一份。母语审校那道工序在这种内容上比在营销文案上重要得多。

反过来,如果做不到这两条,最好别做。一份翻译腔的品类介绍占住格子之后,你后面想改的时候要跟自己竞争。

这套做法的时间成本

列清单一小时,查一遍四十分钟,加起来不到两小时就能拿到一门语言的缺口地图。这个成本低到可以在决定要不要做这门语言之前先跑一遍。

跑完能回答两个问题:这门语言的公共知识空到什么程度,以及我手上这批品类里有几个是真空的。第二个数直接决定第一批内容做几篇。

多门语言并行的时候,这套查法可以复用同一份品类清单,换语言参数重跑。二十门语言一天能跑完。

拿到的结果不会过期得很快。公共知识的填补速度是以年计的,一份缺口地图用一年没问题。

品类词的位置,凭什么认为你能占住?

占住的意思不是排第一

先把话说清楚。这里说的占住,不是指某个关键词排到搜索结果第一位。它指的是当有人在这门语言里问这个东西,你那份内容是被找到的那一份。

这两件事在内容稀薄的语言里几乎重合,因为候选本来就没几个。在英语市场它们差得很远,因为候选有几千个,排序才是全部。

所以小语种的品类词有一个英语市场没有的性质:写得好本身就能兑换可见度,不需要额外的推动。这个性质在候选池填满之后会消失。

能占多久,取决于这门语言的内容生产速度。前面那些数据里,编辑人数和新建量的增长率就是这个速度的代理。

三类竞争者各自会怎么动

可能来抢这个格子的有三类。第一类是本地的内容站和媒体,他们最有可能写,但他们的选题同样跟着热点走,品类介绍不是他们的重点。

第二类是全球品牌的本地站。他们有预算也有动机,但他们写的是自己的产品,不是品类,而且从英文模板批量生成落地页这条路他们走得最熟。品类介绍对他们没有直接回报。

第三类是批量生成的内容。这一类的威胁在过去几年里明显上升,因为生成成本降到了几乎为零。机器翻译直接发布那条质量线讲的就是这类内容的边界。

三类里第三类最值得防,也最好防——它的特征太明显,本地读者一眼能认出来,而且它不会去查本地特有的规格和标准。

一个反向的风险

有一种情况会让整套判断失效:这个品类在这门语言的市场里根本不存在。

洗衣机在某些市场的家庭普及率很低,那么这门语言里没有关于洗衣机的内容不是缺口,是没有需求。这时候你写得再好也没有人来。

区分的办法是拿这个品类的本地说法去查搜索建议,看有没有返回,顺手把用户实际打出来的短形式可以一起做掉。有返回说明这个词在查询池里活着;一条都没有说明这一类查询在这门语言里整个不存在。

这一步不能省。缺口和需求是两条独立的轴,只看缺口会把没有需求的格子当成机会。

什么时候该放弃这门语言

把缺口和需求交叉,会得到四种组合,其中两种是明确的信号。

有缺口且有需求,是最好的机会,该抢。没缺口且没需求,说明这个品类在这门语言里既没人写也没人问,直接放弃。

另外两种要具体判断。有缺口但没需求,多半是品类没长起来,可以等;没缺口但有需求,说明这是个正常市场,按常规打法做。

值得注意的是,第一种和第二种在只看内容量的报表上长得完全一样,都是低数字。把它们分开的唯一办法是把需求那一侧单独测一遍。

做完之后怎么判断有没有效

三个月内不要看流量。品类词在这类市场的量本来就小,三个月的数据看不出趋势,容易做出错误的停手决定。

该看的是三个别的信号:有没有被本地站点引用、有没有出现在这门语言的问答里、有没有人拿它当参考。这三个信号出现得比流量早,本地目录与社群里给过一份可以照抄的渠道清单。

更直接的一个检验是过半年再查一次那个格子。如果这半年里没有第二份内容出现,说明这个位置确实空着,继续做;如果突然冒出来三四份,说明有人跟你想到一块儿了,得加快。

这个复查跟第一次的查法完全一样,五分钟。它比看流量报表更接近这件事的本质。

哪些相邻的问题不归这一层管?

需求侧那半边

本文从头到尾量的是供给:有没有人写过。它一次都没有回答有没有人在搜。

这两件事必须分开测。前面说过怎么测需求那一侧,但那只是一个粗筛,真正做决策的时候还需要更细的信号。

把两侧混在一起是这类分析最常见的错误,因为它们的数字长得像——都是低数字。低供给和低需求,动作完全相反。

语言本身的机制那半边

这门语言的词形怎么变、怎么分词、用什么书写系统,跟公共知识里有没有这个条目完全无关。

它们决定的是你做这门语言的技术成本,比如转小写会把土耳其语的词改成另一个词,又比如屈折语站的锚文本报告里精确匹配那一栏是假的,这一层跟缺口地图没有交集。

两张表分开做:缺口地图进选题会,技术成本进预算表。合成一个分数会得到很奇怪的结论。

引擎收录那半边

写出来的东西能不能被抓到、被收录、被排上去,是另一套逻辑。这门语言公共知识空不空,对引擎的收录行为没有直接影响。

实操上建议先确认引擎那一层没问题,再来看缺口。引擎那层如果有毛病,缺口地图做得再准也用不上。

顺序上这是个前置条件,不是并列关系。

维基百科代替不了商业内容的调研

这一条是本文最大的软肋,值得重复。维基百科的内容分布和商业内容的分布不是同一件事,前者受志愿者兴趣驱动,后者受商业回报驱动。

两者的偏向方向其实挺像——都偏热点、偏品牌、避开无聊而必要的东西。这是这套代理指标能成立的基础,但相似不等于相同。

能做的补充验证有一个:把缺口清单里排最前的三五个词,拿去用这门语言直接搜一遍,看返回的前两页里有没有像样的内容。半小时能跑完,能把明显的误判排掉。

这套方法的边界在哪

它在两种情况下不该用。第一是这门语言的公共知识已经很厚,覆盖率普遍在九成以上,这时候缺口地图全是绿的,给不出信息。表里的波斯语、印尼语、越南语、泰语基本属于这一档。

第二是你要做的品类特别细,细到公共知识里本来就不会有对应的条目。这时候要往上找一层,查它的上位品类,属性值本身在这门语言里怎么分格这类问题也要一并考虑。

剩下的情况它是好用的,尤其是你手上有二十个品类、五门语言,要决定先做哪几格的时候。两小时能把明显的空格找出来。

开头那位本地同事的问题,后来查出来的答案是没有。我们那份清单里加了七个品类词,第一批就上了三个。

常见问题解答

维基百科上没有的东西,就等于这门语言的互联网上没有吗?

不等于,它只是一个方向性的信号。维基百科的内容偏向和商业内容的偏向很像但不完全一样,两者都避开无聊的品类介绍,但商业内容会因为转化价值补上一部分。

所以正确的读法是把它当第一道筛子:维基上有的,商业内容大概率也有;维基上没有的,商业内容里可能有一点,但十有八九不成规模。

拿到缺口清单之后花半小时用这门语言实搜前三个词,看前两页的结果,就能把误判排掉。这一步的成本很低,但能让整份清单从推测变成有依据。

为什么手表那一行不算数,洗衣机那一行就算数?

判据是缺失名单的构成。手表的缺失名单里有瑞典语、希腊语、匈牙利语,这三门语言的维基百科各有几十万到上百万条目、上千名编辑,不可能真的没有关于手表的内容。

点开确认之后发现它们把手表和钟写在同一个条目里,是概念切分粒度的差异,不是缺失。洗衣机的缺失名单里一门成熟语言都没有,全部是小语种,所以它是真信号。

这条判据可以直接搬去用在你自己跑的数据上:任何一个概念,如果它的缺失名单里出现了内容量明显充足的语言,先假设是对齐问题,点开验证之后再决定要不要采信。

覆盖率低的语言,是不是干脆不该做?

正好相反,覆盖率低本身是机会信号,但它必须跟需求侧的数据一起看才有意义。

缺口大而有需求,是最值得投的一档;缺口大而没需求,说明这个品类在这个市场还没长出来,可以先记下来等两年。这两种在报表上都表现为低数字,分开它们的唯一办法是单独测一次需求。

另外还要看这门语言的内容有多旧多薄。有条目但五年没人动、只有一百多字的格子,实际难度跟完全空着差不多,机会同样大。

这些空格子会不会很快被别人填上?

速度比想象中慢。公共知识的填补是以年为单位的:洗衣机这个条目在英语里存在了19年,21门语言里才补上10门,平均每年0.51门。

会加速这个过程的因素有两个:一是批量生成内容的成本降到接近零,二是这门语言的编辑人群在增长。第二个因素可以直接查,把新建量和编辑人数的年度趋势拉出来看方向。

保险的做法是做完之后每半年复查一次那几个格子,看有没有第二份内容出现。这个复查跟第一次的查法一样,五分钟,比看流量报表更接近这件事的本质。

用什么词去查,用英语还是本地语言?

用本地语言,而且要用跨语言链接找过去,不要自己翻译。同一个概念在不同语言里的条目标题经常不是直译,自己翻的词很可能查不到已经存在的条目。

做法是先在英文维基上找到这个概念的条目,然后从侧边的语言列表里点到目标语言。这一步同时能拿到这个概念在这门语言里的标准说法,写内容的时候用得上。

要批量跑的话,用概念的实体编号一次拿到它在所有语言的标题,一个请求几十个概念。这比逐个搜快得多,也不会因为翻译不准漏掉。

条目字节数这个指标可靠吗,会不会被模板撑大?

会,这是它最大的问题。信息框、分类标签、参考文献列表都算在字节里,一个只有两句正文的条目可能因为挂了一堆模板而显得不小。

所以字节数只适合做量级判断,不适合做精确比较。1.4%和25.6%的差别是真的,14%和16%的差别不必当真。

要更准的话得把渲染后的正文抽出来单独数,那要多一步抓取。做初筛的时候不值得,做最终决策的时候可以对排在最前面的那几个词单独做一遍。

这套缺口分析,中文市场用得上吗?

整体上用不上,中文的公共知识在覆盖率这一层已经很厚,缺口地图基本全绿。

但换一个粒度就有用了。如果你做的是一个很细的垂直领域,同样可以问:这个领域里的基础概念有没有一份说得过去的公开表述。答案往往是有,但都很旧,或者都是互相抄的。

做法上要换个数据源,中文没有一个像维基那样公开修订史的地方,只能靠实搜和抽样。结论会粗糙一些,但那个提问方式——不问竞争多不多,问最基础的那一份写好了没有——是可以直接搬的。

权威参考资料

分享到
标签
版权声明

本文标题:《小语种内容都在追新词,洗衣机这种词写了19年,21门语言里只有10门写过》

本文链接:https://zhangwenbao.com/minor-language-content-gap-category-words.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交