小语种的竞争强度按内容量算会算反,那批词条历史上只有27个人碰过

小语种的竞争强度按内容量算会算反,那批词条历史上只有27个人碰过
张文保 更新 37 分钟阅读 3,888 阅读
本文目录
  1. 竞品表上那个内容量,为什么不能直接当竞争强度用?
  2. 那张表通常是怎么做出来的
  3. 存量回答的是有没有东西,不是有没有人
  4. 先说清楚这次量了什么
  5. 为什么拿维基百科当代理指标
  6. 本文不谈的两件事
  7. 一个月新建39.7万个页面,当月在写的人有几个?
  8. 2013年8月那个数字
  9. 同一个月,另一门语言也是39万
  10. 英语的峰值月拿来做对照
  11. 把时间轴拉长,曲线的形状
  12. 瑞典语是同一件事的温和版本
  13. 机器人灌过的语言,怎么一眼认出来?
  14. 第一个信号:单月新建量跳变
  15. 第二个信号:编辑人数完全没跟着动
  16. 第三个信号:条目内容长得一模一样
  17. 自己查一遍要几分钟
  18. 认错了会付出什么代价
  19. 换成写内容的人数这把尺子,排序会变成什么样?
  20. 23门语言的完整对照
  21. 老挝语的位置最出人意料
  22. 内容少不等于人少,内容多不等于人多
  23. 这几个数从哪儿拿
  24. 比值多大算异常
  25. 一个词条背后到底站着几个人?
  26. 把镜头从语言拉到单个词条
  27. 人类编辑数的中位数
  28. 头号贡献者占了多少
  29. 四条百分之百意味着什么
  30. 这批词一共只有多少人碰过
  31. 十年过去,哪些语言的写作人群在长、哪些在缩?
  32. 我原本以为是普遍萎缩
  33. 分界线不是语料量
  34. 趋势方向该怎么用
  35. 一条不该忽略的反常
  36. 人少,对你到底是好消息还是坏消息?
  37. 好消息那一面
  38. 坏消息那一面
  39. 决定是哪一面的那个变量
  40. 三档判读怎么落到排期
  41. 一个反例:人多也可能是假的
  42. 这套数怎么变成排期上的一格?
  43. 先算三个数
  44. 三档对应的动作
  45. 报表上加哪一列
  46. 跟母语团队怎么讲这件事
  47. 多久重跑一次
  48. 哪些相邻的问题不归这一层管?
  49. 引擎那半边
  50. 内容质量那半边
  51. 语言本身的机制那半边
  52. 商业站的供给跟维基不是一回事
  53. 这套指标的边界在哪
  54. 八个月后的一次复查
  55. 常见问题解答
  56. 维基百科的编辑人数,跟我要面对的商业竞争对手真的是同一件事吗?
  57. 宿务语那六百万个条目,对搜索引擎来说算不算低质内容?
  58. 页/人这个比值,能不能直接拿去跟老板汇报?
  59. 编辑人数在涨的语言,是不是就该早点进场?
  60. 要是这门语言的维基百科条目太少,样本不够怎么办?
  61. 这套方法在中文市场有没有用?
  62. 这些数据每月都在变,做完的评估表多久就过期了?
  63. 权威参考资料

摘要:把23门语言的维基百科建站以来的逐月新建页面数和逐月活跃编辑数并排放,宿务语累计新建706万个页面,同期月均只有29个中坚编辑,人均24万页;2013年8月那一个月新建39.7万页,当月中坚编辑18人。同一个月,菲律宾另一门语言瓦瑞语也是39万。而老挝语的这个比值是803,只比英语的539高一半。本文给出23门语言的完整对照表、机器人灌注的三个识别信号、单个词条背后到底站着几个人,以及一个把内容量换成写内容的人数的评估口径。

那天下午对着一张竞品调研表发呆。表上第三列写着各语言市场的内容量,一门东南亚语言那格数字是七位数,旁边红色批注写着竞争激烈,建议缓做。

做这张表的同事没做错什么。内容量是最容易拿到的数,也是最容易讲给老板听的数。麻烦在于它回答的问题跟我们想问的那个问题不是同一个。

我们想问的是这门语言里有多少人在跟我抢位置。内容量回答的是这门语言里堆了多少东西。这两件事在英语市场几乎是一回事,在小语种市场经常不是。

那天顺手把那门语言的维基百科拉出来看了一眼编辑名单。七位数的内容量背后,一个月里编辑超过五次的人有三十几个。三十几个人,一间教室坐得下。

竞品表上那个内容量,为什么不能直接当竞争强度用?

那张表通常是怎么做出来的

做市场评估表的时候,语言这一列的数据来源翻来覆去就那么几个:搜索工具给的结果数、维基百科各语言版本的条目数、抓一批本地站点数页面。三个数都好拿,都能填满格子。

问题是这三个数量的是同一件事——存量。存量告诉你这门语言的互联网上现在堆着多少东西,它不告诉你这些东西是谁堆的、什么时候堆的、还有没有人在往上堆。

维基媒体自己其实早就意识到这个问题,专门做了一个叫条目深度的口径来跟条目数区分开。存量在英语市场是个不错的代理指标,因为英语的存量和写作人群大致成正比。一门语言里有一千万篇内容,通常意味着有几十万人在写。这个比例关系是我们默认成立的,默认到没人验过。

而它在小语种上不成立。不成立的原因不是数据不准,是这批内容里有相当一部分不是人写的。

存量回答的是有没有东西,不是有没有人

这个区分听着像抠字眼,落到排期上是两个完全相反的决定。存量高说明这块地已经被占了,该缓做;写作人群小说明这块地没人守,该抢做。同一个市场,两把尺子给出两个反方向的动作。

更麻烦的是这两把尺子在同一份报告里长得一模一样,都是一个数字加一个单位。看报告的人没有任何线索能分辨出你量的是哪一个。

保哥这几年做小语种评估,最后固定下来的做法是两个数一起给,中间画一道杠。内容量除以写内容的人数,这个比值本身就是一条判据。

本文要讲的就是这个比值怎么算、算出来长什么样,以及为什么它在有些语言上会大到不像话。

先说清楚这次量了什么

这次的数据全部来自维基百科的公开接口,一共两套。一套是各语言版本的逐月新建页面数和逐月活跃编辑数,从2005年拉到2021年10月,逐月对齐。

另一套是用修订史接口拉到的逐条目完整修订历史,包含每一次修改的时间和作者。选了29个跟做生意有关的概念,从咖啡、鞋、洗衣机这类日常物件,到电子商务、二维码、云计算这类近二十年的东西。

语言选了23门,覆盖已经写过的那批小语种,另外加进宿务语和瓦瑞语这两门菲律宾语言做对照,再拿英语和瑞典语当基准。越南泰国印尼这三家是这次的重点观察对象之一。

所有统计都截止到2021年10月31日。之后发生的事不在这次的口径里,因为混进新数据会让逐月曲线的解读出问题。

为什么拿维基百科当代理指标

维基百科当然不是商业内容,它的编辑人群跟你在这门语言里的竞争对手不是同一批人。这一点必须先摆在桌面上。

用它有三个理由。第一是它的修订历史全部公开且带时间戳,商业站点没有任何一个能提供这种粒度的数据。第二是它在所有语言上用同一套软件、同一套规则,跨语言比较不需要做口径换算。

第三个理由更实际:维基百科通常是一门语言在互联网上内容质量最好的那一块,拿免费入口给十一门语言排语料量级那一层用的也是同一个道理。它都薄成这样,商业内容只会更薄。这个指标是个上界,不是平均值。

所以下面所有的数字都请这么读:不是这门语言的商业内容就是这个数,而是这门语言的内容生产能力最多到这个数。

本文不谈的两件事

第一件是搜索引擎怎么对待这些内容。引擎的收录逻辑、排名逻辑是另一层的事,跟这门语言里有几个人在写没有直接关系。那半边交给关键词工具在小语种上返回零的那些情况

第二件是这些内容写得好不好。质量评估要看具体内容,要有懂这门语言的人参与,不是数数能解决的。母语审校那道工序该怎么验收已经单独写过。

本文只回答一个问题:这门语言的内容,是多少个人写出来的。

一个月新建39.7万个页面,当月在写的人有几个?

2013年8月那个数字

先看一条最极端的记录。宿务语维基百科在2013年8月新建了397097个页面。同一个月,在这门语言上编辑超过五次的人是18个。

把这两个数摆在一起算一下:人均22061页,一个月。一个人一天要建735个页面,不吃不喝不睡,每两分钟一个。

这显然不是人干的。做这件事的是一个叫Lsjbot的机器人程序,它从公开的生物物种数据库和地名数据库里读记录,按模板生成条目,一条一条往上传。

这件事本身完全合规。维基百科对机器人有一份明确的政策,事先申请、社群批准、按规矩跑,Lsjbot走完了所有流程。它不是偷偷摸摸干的,它是被允许这么干的。

同一个月,另一门语言也是39万

接下来是这次实测里最干净的一条对照。瓦瑞语是菲律宾的另一门地方语言,使用者约三百万。它的维基百科在2013年8月新建了390370个页面。

两门语言,同一个月,一个39.7万,一个39.0万,相差不到2%。这不是巧合,是同一个程序在同一段时间里跑了两遍,换了个语言参数。

这条对照的价值在于它把变量控制住了。两门语言的使用人口、经济水平、上网率都不一样,但它们的内容量在同一个月被同一个原因抬到了同一个位置。

如果你在2014年做一张菲律宾语言市场的评估表,这两门语言在内容量那一列会并列排在前面,前面是英语和他加禄语。这个排名是真的,但它的含义不是你以为的那个。

英语的峰值月拿来做对照

英语维基百科在这段时间里的单月新建峰值出现在2015年3月,643082个页面,比宿务语的峰值还高六成。

差别在分母。那个月英语的中坚编辑是69240人。人均9页,一个月。一个人三天写一页,这个数字看着就像人干的。

9和22061,中间差了2451倍。同样是一个月建几十万个页面,一边是几万人各写几页,一边是一个程序批量吐。

这两种生产方式产出的东西,在任何一张只有内容量的表上都长得一模一样。

把时间轴拉长,曲线的形状

宿务语的逐年新建量是这样的:2012年1241页,2013年142.6万页,2014年45万页,2015年50万页,2016年196.6万页,2017年191.6万页,2018年掉回723页。

五年时间里堆了六百多万个页面,然后一夜之间回到每年几百页的水平。这条曲线的形状不像内容生产,像一次工程施工。

同期的中坚编辑数几乎是一条直线:2012年34.8人,2013年22.3人,2016年24.2人,2018年36.8人。这条直线跟语料量决定一门语言的能力上限那条判据说的是一件事。整整六年,这门语言里认真写东西的人一直在二十到四十之间。

灌注结束之后,这六百万个页面留在那儿,没有人维护,也没有人删。它们会一直出现在每一张统计表的分子上。

瑞典语是同一件事的温和版本

同一个机器人也在瑞典语上跑过。瑞典语维基2013年新建165.3万页,而它的中坚编辑是1482人。人均1115页,同样不是人干的。

区别在于瑞典语有一千多个真人在写,机器人灌进去的那部分被稀释了。宿务语只有二十几个人,机器人灌进去的部分就是全部。

所以这不是一个非黑即白的分类。同一个动作落在不同规模的社群上,后果差得很远。判断的关键从来不是有没有机器人,是机器人产出占了多大比例。

把这条推广开:一门语言的内容量里有多少是批量生成的,取决于这门语言原本有多少人在写。人少的地方,任何一次批量灌注都会成为主体。

机器人灌过的语言,怎么一眼认出来?

第一个信号:单月新建量跳变

正常的内容生产是平缓的。人写东西有节奏,一个月比上个月多两成、少一成,都属于正常波动。英语维基十年里的月度新建量一直在16万到20万之间,从来没有翻过倍。

机器人灌注的特征是跳变。宿务语从2012年12月的几百页跳到2013年1月的六万七千页,一个月涨了一百多倍。这种形状在人工生产里不存在。

识别方法很朴素:把逐月序列拉出来,看有没有某一个月比前一个月高一个数量级。有就是有,没有就是没有,不需要统计检验。

顺带说一句,跳变不一定只发生在小语种上。乌兹别克语2013年5月新建37078页,当月中坚编辑35人,人均1059页,同样是一次灌注。这门语言的使用者有三千多万。

第二个信号:编辑人数完全没跟着动

这是第一个信号的配套检查,也是更可靠的那个。真实的内容爆发通常伴随人群扩张——某个话题火了,一批新人涌进来写,新建量和编辑数一起涨。

机器人灌注只抬新建量,编辑数纹丝不动。宿务语2013年新建量涨了一千多倍,中坚编辑从34.8人跌到22.3人,方向甚至是反的。

为什么会跌?这个现象在几门被灌过的语言上都出现了,一个说得通的解释是原本的编辑看到内容量突然变成天文数字,参与感被稀释了。这只是解释,不是结论。

无论原因是什么,判据是清楚的:新建量涨而编辑数不涨,产出就不是人做的。这一条比看内容本身快得多。

第三个信号:条目内容长得一模一样

前两个信号靠公开的统计接口就能拿到,几分钟能跑完。第三个信号要点开看,但它是最直观的。

机器人从数据库生成的条目有固定句式。物种条目通常是一句拉丁学名加一句分类归属加一句分布地区,换个物种名字其余全一样。地名条目是一句坐标加一句行政归属加一句海拔。

随机点开十个条目,如果七八个的第一句话结构完全相同,只有专有名词在换,那就是模板生成的。这个判断不需要懂这门语言,看句子长度和标点位置就够。

这一步的意义在于确认前两个信号的解释。统计上的跳变有可能来自一次数据迁移或者一次批量导入,点开看能把这些情况排掉。

自己查一遍要几分钟

三个信号跑完大概十分钟。第一步打开维基媒体的统计站,选语言,选新建页面,把时间轴拉到建站至今,看曲线有没有立柱。

第二步在同一个站切到编辑数那一栏,选活跃度五次以上,看同一时段的曲线形状。两条曲线叠起来看,跳变而不同步就是信号。

第三步回到该语言维基的首页,用随机条目功能连点十次,看开头那句话。这三步不需要写代码,也不需要账号。

如果你要做的是一份正式评估,把这三步的截图放进附录,比在报告里写一句内容量七位数有用得多。

认错了会付出什么代价

把灌注过的语言误判成竞争激烈,代价是把一块没人守的地让出去。这块地通常还很便宜,因为别人也在看同一张表,得出同一个结论。

反过来的错误也存在但少见:把正常发展的语言当成被灌过的,然后低估投入。这种错的成本是内容做出来发现打不过,损失是钱和时间。

两个方向的错误比起来,第一种更值得防。它的损失不出现在报表上——你从来没做过那个市场,就永远不知道错过了什么。

这也是为什么保哥建议把这三步放进评估流程里当固定动作,而不是等到觉得数字奇怪的时候才去查。觉得奇怪的时候,多半已经过了决策那一刻。

换成写内容的人数这把尺子,排序会变成什么样?

23门语言的完整对照

下面这张表是建站至2021年10月的累计新建页面数,除以同期的月均中坚编辑数。中坚编辑指一个月里编辑五次以上的人,这个门槛能把偶尔改一个错别字的路人排掉。

语言累计新建页面月均中坚编辑页/人
宿务语706985029.4240546
瓦瑞语203296226.676433
乌兹别克语31690734.59182
缅甸语19174430.66268
越南语3951017652.86053
孟加拉语684335175.93890
印尼语2386827692.43447
泰米尔语395199125.73143
斯瓦希里语10876234.93115
波斯语31512901103.22857
瑞典语40197261480.62715
蒙古语8148440.22025
僧伽罗语6716935.31903
匈牙利语1153072821.51404
高棉语2442723.41045
泰语666952647.61030
尼泊尔语8047180.6998
希腊语466972522.8893
老挝语78509.8803
英语4077223675588.3539

豪萨语、约鲁巴语、阿姆哈拉语的数在2200到2700之间,为了表格不至于太长没有全列进来。

老挝语的位置最出人意料

开工前我给自己写了一份预期,其中一条是老挝语作为内容最薄的语言之一,各项指标应该都在最差那一档。

实测下来老挝语的页/人是803,倒数第二低,只比英语的539高了一半。换句话说,老挝语维基的内容虽然只有七千多页,但这七千多页的人工纯度是全表最高的那一档。

这条把我原来的直觉打翻了。内容少和内容假是两件不同的事,它们甚至可能反向相关——没人来灌的地方,剩下的都是人写的。

落到实操上,这意味着老挝语这样的市场,你的对手虽然只有几个人,但那几个人是真的在写。按人口给小语种排优先级那一层的账里,这个变量原来是缺的。

内容少不等于人少,内容多不等于人多

把表按两列各排一次,前五名没有一个是重合的。按内容量排,前五是英语、瑞典语、越南语、波斯语、印尼语。按中坚编辑数排,前五是英语、瑞典语、波斯语、匈牙利语、印尼语。

看起来还挺接近,是因为大语言两边都强。分歧全部集中在中间那一段:宿务语按内容量排第三,按编辑人数排倒数第五。

这就是这把尺子的全部价值——它在大语言上给不出新信息,在小语种上会把排序整个翻过来,跟品牌名该叫什么由当地输入法决定是同一类修正。而做小语种决策的时候,你要看的正好就是中间那一段。

这是本站第三次记录内容总量这把尺子在小语种上失效。前两次一次是拿条目数当活跃度,一次是拿条目数排语言优先级,都得到了跟真实情况相反的排序。

这几个数从哪儿拿

逐月新建页面和逐月编辑数在维基媒体的统计接口上,一个语言一个请求,返回JSON。不需要密钥,不需要注册。

接口路径里有两个参数要注意。活跃度那个参数决定你数的是哪一档编辑,默认值是全部,会把只改过一次的路人算进来,那一列的数会大三到五倍。

另一个坑是时间戳格式。返回的时间戳带横杠,如果你按位置切前六个字符想拿到年月,切出来的是年加一位月份,所有月份会塌成两组。这个错误我犯过一次,第一版表格里所有的十年趋势都是错的。

整套跑完二十几门语言不到五分钟。数据是每月更新的,任何时候重跑都能拿到最新的一版。

比值多大算异常

英语的539可以当基线,因为它的人工比例最高,几乎没有批量灌注的成分。

500到3000这一档属于正常,说明这门语言的内容量和写作人群大致成比例。表里的大多数语言落在这一档。

3000到10000要看一眼,多半有过一次或几次灌注,但社群规模还撑得住。乌兹别克语和缅甸语在这一档,两门语言都能在逐月曲线上找到明显的立柱。

超过10000基本可以断定内容量的主体不是人写的。这一档目前只有宿务语和瓦瑞语,它们的比值是240546和76433,跟第三名差了一个数量级。

一个词条背后到底站着几个人?

把镜头从语言拉到单个词条

前面那把尺子量的是整门语言。做内容决策的时候真正要问的其实更具体:我要写的这个品类词,这门语言里已经有谁写过。

所以第二组数据换了粒度。29个跟生意有关的概念,逐语言拉出完整修订史,数每条背后有几个不同的人类账号,以及贡献最多的那个人占了多大比例。

机器人账号靠两条规则识别:一是该语言维基授予过机器人权限的账号名单,二是账号名以bot结尾。两条取并集,能覆盖绝大多数。

英语因为修订次数远超采集上限被单独处理,它的数只用最早两千次修订算,所以英语那一行的编辑人数是低估的。这一点在读表的时候要记住。

人类编辑数的中位数

结果按人类编辑数从少到多排:宿务语1人,老挝语3人,豪萨语4人,乌兹别克语4人,高棉语5人,斯瓦希里语5人,蒙古语6人,阿姆哈拉语6人,约鲁巴语6人。

然后是缅甸语7人,僧伽罗语7人,尼泊尔语7人,泰米尔语10人,孟加拉语17人,泰语28人,希腊语45人,越南语52人,匈牙利语57人,印尼语59人。

顶上是瑞典语97人、波斯语108人。英语在保守口径下是947人,真实值只会更高。

把两端放一起:英语的咖啡条目背后至少九百多个人,老挝语的对应条目背后三个人。这不是三百倍的差距,这是两种不同性质的东西。

头号贡献者占了多少

比人数更能说明问题的是集中度。老挝语的中位数是63%,意思是一半以上的词条里,一个人写掉了六成以上的内容。

老挝语63%,僧伽罗语50%,尼泊尔语50%,豪萨语50%,高棉语49%,缅甸语48%,约鲁巴语45%。这一档全部在四成以上。

另一头,印尼语9%,瑞典语9%,波斯语9%,匈牙利语13%,希腊语15%。英语5%。

还有四条是百分之百:僧伽罗语的云计算、宿务语的TikTok、泰语的通用数据保护条例、乌兹别克语的无人机。这四个词条从建立到2021年10月,人类那一侧只有一个账号动过。

四条百分之百意味着什么

先说它不意味着什么。它不意味着这些内容是错的,也不意味着写的人不专业。一个人认真写完一个条目,质量完全可能比十个人吵出来的好。

它意味着的是脆弱。这门语言里关于云计算的公开中文之外的表述,全部来自一个人的理解和一次写作。这个人如果理解偏了,没有第二个人会发现。

对做内容的人来说,这是一个非常具体的机会信号:这个词在这门语言的公共知识里只有一个版本,而那个版本是六年前一个志愿者写的。

顺便说,泰语作为表里的中等资源语言,它的通用数据保护条例条目也是一个人写的六次修订。这说明集中度不是均匀分布在整门语言上的,它按话题分布。

这批词一共只有多少人碰过

最后一个数是去重之后的总人数:这29个概念里该语言有的那几条,历史上一共被多少个不同的人类账号编辑过。

约鲁巴语23人,老挝语27人,豪萨语32人,宿务语35人,高棉语40人,阿姆哈拉语60人,斯瓦希里语61人,尼泊尔语81人,缅甸语93人。

乌兹别克语102人,僧伽罗语113人,蒙古语127人,泰米尔语205人,孟加拉语352人,泰语877人,希腊语1107人,匈牙利语1318人,印尼语1535人。

英语21588人,还是保守口径。老挝语的27人和英语的两万多人放一起,这条差距比内容量那一列的差距更能说明市场的真实形状。

十年过去,哪些语言的写作人群在长、哪些在缩?

我原本以为是普遍萎缩

开工前写下的预期里有一条:各小语种的活跃编辑数十年间在下降,社群在萎缩。这条听起来很顺,网上关于维基百科编辑流失的讨论也支持它。

实测下来这条错得最彻底,而且错得有价值。把2012年全年的月均中坚编辑数跟2021年前十个月的对比,23门语言分成了方向相反的两批。

缩的那批确实存在:阿姆哈拉语跌75%,蒙古语跌61%,约鲁巴语跌58%,高棉语跌53%,老挝语跌53%,瓦瑞语跌45%。

但涨的那批更醒目:孟加拉语涨305%,豪萨语涨254%,越南语涨200%,波斯语涨187%,印尼语涨78%。同期英语跌了10%,瑞典语跌了40%。

分界线不是语料量

第一反应是按资源分档,学界给世界语言排资源等级那套六档分层就是这么切的:大语言在长,小语种在缩。但数字不支持这个解释。豪萨语的编辑人数是两位数,它涨了254%;瑞典语上千人,它跌了40%。

第二个猜测是按地区:非洲和南亚在长,东南亚在缩。这个稍微贴一点,但也有反例——斯瓦希里语只涨了5%,而它跟豪萨语在同一片大陆。

把这批语言逐个看下去,涨得最快的几门有一个共同点:所在市场的智能手机普及和移动网络铺开发生在这十年之内。孟加拉国、尼日利亚、越南、伊朗、印尼都在这个名单上。

缩的那几门,要么是上网人口在这十年之前就基本饱和,要么是国内环境出现过明显变化。这只是观察,因果关系需要更多证据。

趋势方向该怎么用

存量告诉你现在有多少,趋势告诉你三年后会有多少。做内容排期的时候,第二个数往往比第一个数重要,因为你的内容也要三年才能长起来。

具体到动作:编辑人群在涨的语言,竞争会一年比一年重,早进场的红利是真的。编辑人群在缩的语言,你的内容会在更长时间里保持稀缺,但也说明这个市场的整体活跃度在往下走。

后一种情况要多问一句:是内容供给在缩,还是需求也在缩。这两件事分开看,答案完全不同。这个区分在两个市场之间做需求分析那一层展开过。

趋势数据跟存量数据来自同一个接口,多要一个时间范围而已。做评估表的时候把这一列加上,成本几乎为零。

一条不该忽略的反常

缅甸语的曲线值得单独看。它的中坚编辑数十年间涨了10%,看着平平无奇,但它的单月新建峰值出现在2020年12月,50054页,当月中坚编辑92人。

人均544页,一个月。这个数落在灌注那一档,而且发生的时间比宿务语晚了整整七年。

意思是批量灌注不是2013年前后那一波的专属现象,它随时可能在任何一门语言上再发生一次。你去年做的评估,今年可能就不作数了。

所以这套检查的复用价值高于一次性调研。放进季度例行动作,五分钟跑一遍二十几门语言。

人少,对你到底是好消息还是坏消息?

好消息那一面

写的人少意味着位置空着。一门语言里某个品类词只有三个人写过,你写第四个版本,它进入这门语言公共知识的概率非常高。

这个概率在英语市场是不可想象的。英语里任何一个商业词后面站着几百个内容团队,你写第四百零一个版本,能不能被看见取决于外链和品牌,不取决于你写得好不好。

小语种的情况反过来。写得好这件事在这里还能直接兑换成可见度,因为分母足够小。这个窗口是真实存在的,而且不需要预算。

这一点在用户真正打出来的那个短词上体现得尤其明显。另一个好处是被引用的路径更短。当模型或者答案系统要在这门语言里找一个说法,候选池里就那么几份东西,你的那份进池子的机会按比例算是很高的。这跟本地目录与社群里的外链位置那一层的稀缺红利是同一个机制。

坏消息那一面

写的人少也意味着读的人可能同样少。内容供给稀薄不总是因为没人愿意写,也可能是因为这件事在这门语言里本来就没人问。

更麻烦的一种情况是这个市场的商业活动整体用另一门语言在办,落地页上那批信任元素会先失效。本地人上网用本地语言,但买东西、比价、看规格的时候切到英语。这时候你在本地语言里做的内容,写得再好也接不到人。

还有一种坏消息是配套缺失。写的人少通常伴随着词典、分词工具、同义词表这些基础设施同样薄,你的内容做出来之后,站内搜索和筛选器接不住它。词干还原把两个相反的词并到一起就是这一层的典型事故。

所以人少这个信号本身不带方向。它只是说明这块地没人占,不说明这块地值不值钱。

决定是哪一面的那个变量

把好坏两面分开的那个变量是需求侧有没有人在搜。这个数拿不到精确值,但方向能判断出来。

最省事的做法是拿这门语言的常用品类词逐个查搜索建议,看有没有返回,工具返回零的时候里给过一套补数据的路子。有返回说明这个词在这门语言的查询池里活着,没返回说明这一类查询整个不存在。

把这个结果跟供给侧的编辑人数交叉,会得到四种组合。有人搜有人写是正常市场;有人搜没人写是最好的机会;没人搜有人写说明你看到的内容量是灌出来的;没人搜没人写说明这门语言这个品类还没长出来。

四种组合里,第二种最值得投,第四种最该缓。这两种在只看内容量的表上长得完全一样,都是低数字。

三档判读怎么落到排期

把页/人比值和中坚编辑绝对人数两个数一起看,可以粗分成三档。

第一档是比值正常且人数在两百以上,比如泰语、希腊语、匈牙利语。这一档按普通市场做,该有的调研、竞品分析、内容规划一个不省。

第二档是比值正常但人数在几十,比如老挝语、高棉语、僧伽罗语。这一档的策略是少而精:挑最核心的十几个品类词,每个做到能当这门语言里最好的那一份,不铺量。

第三档是比值超过一万,比如宿务语、瓦瑞语。这一档要先把内容量那个数从决策依据里划掉,重新按人数评估,然后多半会发现它其实属于第二档。

一个反例:人多也可能是假的

前面一直在说人少的语言要小心,反过来的情况也有。编辑人数多不等于这些人在写你关心的东西。

波斯语的中坚编辑上千人,看起来是个成熟市场。但如果你要做的是某个细分品类,这上千人里可能一个都没碰过那个话题。整门语言的活跃度和某个具体词的活跃度是两个尺度。

所以完整的做法是两层都查:先用语言级的数判断这门语言值不值得进,再用词条级的数判断具体哪些词有位置。前面那组数五分钟能跑完,后面那组要按词查。

只做第一层就下结论,容易在成熟语言上错过细分机会;只做第二层,容易在被灌注过的语言上被内容量骗过去。

这套数怎么变成排期上的一格?

先算三个数

第一个数是页/人比值,判断这门语言的内容量有多少是真的。超过一万就把内容量这一列作废。

第二个数是中坚编辑的绝对人数,判断这门语言的内容生产能力有多大。几十人和几百人对应完全不同的投入强度。

第三个数是十年趋势的方向,判断三年后会怎样。涨的语言要抢时间,缩的语言可以慢慢做。

三个数都来自同一个接口,一次请求能拿全。做二十几门语言的评估,从写脚本到出表格半天足够。

三档对应的动作

做过一遍分档之后,动作是清楚的。正常档按现有流程走,稀薄档收缩品类清单、提高单篇标准,灌注档先重新评估再决定。

这里有个容易做错的地方:稀薄档的收缩指的是收品类,不是收质量。十个词做到最好,比一百个词做成模板,在这类市场里的回报差得很远。

原因还是分母。一百份模板内容在一门只有三十个人在写的语言里,会立刻成为这门语言里最大的一批低质内容,而且很显眼。

灌注档的重新评估要注意别走另一个极端。内容量是假的不等于这个市场是假的,它只说明你手上那个数没用,得换个数来量。

报表上加哪一列

最小的改动是在原来的内容量那一列右边加一列写内容的人数,再加一列比值。三列并排,看报表的人自己就能看出问题。

比在报告里写结论有效。数字并排放着,不需要你说服任何人,看的人会自己得出结论,而且他会记得更牢。

如果空间只够加一列,加人数那一列,别加比值。人数是原始数据,比值是加工过的,加工过的数容易被质疑口径。

另外建议在表脚注一句数据截止时间。这类数每月变,半年前的表拿出来讨论会引起不必要的争论。

跟母语团队怎么讲这件事

这套数据有个很实际的用途:说服本地团队相信他们的语言值得投入。做小语种的本地同事经常自己也觉得这门语言没什么内容、做了也没用。

把编辑人数那一列给他们看,很多人会意外。他们知道自己的语言内容少,不知道少到只有几十个人在写——也就不知道自己进场之后能占多大比例。

讲的时候别用竞争这个词,用位置。竞争听着像要打仗,位置听着像还有空位,后者更接近事实。

顺带一提,这个数对招人也有用。一门语言里认真写东西的人只有几十个,这几十个人里有一部分是可以找来做兼职审校的,本地作者署名与资历信号那一层也用得上他们。

多久重跑一次

半年一次够了。编辑人数是慢变量,季度级的波动没有意义,看的是年度方向。

触发提前重跑的信号有两个:一是某门语言的内容量在你的定期监测里突然跳了一档,二是要新进一个市场做决策。

第一个信号对应的多半是一次新的灌注,缅甸语2020年那次就是。第二个不解释。

重跑的时候语言清单要保持稳定,别每次换一批。同一批语言连着跑几年,趋势那一列的价值才出得来。

哪些相邻的问题不归这一层管?

引擎那半边

这门语言里有多少人在写,跟搜索引擎怎么处理这门语言是两件事。引擎的分词、收录、排名各有各的逻辑,人多人少不直接影响它们。

实际操作里这两层经常被搅在一起:内容做出来没排名,到底是因为竞争激烈还是因为引擎根本没把这门语言处理好。分开查,第一层看本文这套数,第二层看收录和索引。

顺序建议是先查第二层。引擎那一层如果有问题,第一层的所有结论都用不上。

内容质量那半边

人数这把尺子完全不看内容好坏。一门语言里三十个人写的东西,可能每一篇都很扎实,也可能全是从英文机翻过来的。

判断质量要另外一套方法,要有懂这门语言的人参与,而且是逐篇看。机器翻译直接发布那条线该划在哪里讲的是这一层。

两层的关系是:人数决定你有多大位置,质量决定你能不能占住。位置再大,东西不行也占不住。

语言本身的机制那半边

这门语言的词形变化、书写系统、分词难度,比如转小写这一步在土耳其语上会把词改成另一个词,全都跟写的人有多少无关。它们决定的是你做这门语言的技术成本,不是竞争强度。

两者容易被合并成一个语言难度分。合并之后会出现很奇怪的结果:一门技术上很难但没人写的语言,跟一门技术上很简单但竞争激烈的语言,得分可能一样。

这两个市场该做的动作完全相反,不该出现在同一个分档里。技术成本进预算表,竞争强度进排期表,两张表分开。

商业站的供给跟维基不是一回事

这一条前面说过一次,值得再说一次,因为它是这套方法最大的软肋。维基百科的编辑人群和商业内容的生产者不是同一批人,有些语言里两者的差距可能很大。

能做的补充验证有一个:随机抓这门语言的二三十个商业站点,看它们的正文是不是本地语言、有没有明显的模板痕迹,顺手把结构化数据里的语言字段也查一遍。这个补充要花半天,但能大幅提高结论的可信度。

不做这个补充也不是不能用,只要在报告里把代理指标这四个字写清楚就行。用代理指标不丢人,把代理指标当成真值才丢人。

这套指标的边界在哪

它不适用于两种情况。第一是语言级别的内容量本来就很大且人工比例正常,这时候这把尺子给不出新信息,还是得回到常规的竞品分析。

第二是你要做的品类特别小众,整门语言的活跃度跟这个品类的活跃度关系不大。这种情况要直接跳到词条级的数据。

剩下的绝大多数情况它是好用的,尤其是在你手上只有一张内容量表、要在二十门语言里挑三门的时候。它能把明显的陷阱先排掉。

八个月后的一次复查

这套数写完之后隔了八个月又跑了一遍,主要想验证一件事:前面说的季度复查到底有没有必要。

宿务语的答案很清楚。2021年10月那个月它还在新建93513个页面,到2022年4月只剩76个,2022年6月153个。灌注在这半年里停掉了,而且是断崖式的停。

同期它的中坚编辑数是40到81人之间波动,跟灌注期完全没有区别。内容量在半年里掉了三个数量级,写内容的人一个没少也一个没多。这条正好把前面那个判据反过来验了一遍。

顺带纠正一个可能的误读。如果只取2021年11月到2022年6月这八个月单独算,宿务语的页/人是2317,不再是那个吓人的24万。累计口径量的是历史遗留,近期口径量的是当下产能,两个数都对,回答的不是同一个问题。

做决策的时候两个都要看:累计口径告诉你搜索结果里现在堆着什么,近期口径告诉你未来一年还会多出什么。前者决定你要绕开哪些位置,后者决定你有多少时间。

那张让保哥发呆的竞品调研表后来改了。第三列还是内容量,右边多了两列,红色批注从建议缓做改成了先抓十个品类词。

常见问题解答

维基百科的编辑人数,跟我要面对的商业竞争对手真的是同一件事吗?

不是同一批人,但两者高度相关。一门语言里愿意在网上认真写长篇内容的人,是一个整体上的池子,维基编辑和内容团队都从这个池子里出。池子有多大,两边都受它限制。

更稳妥的用法是把它当上界看:维基百科通常是一门语言里内容组织得最好的地方,它的编辑人数如果只有几十,商业内容的生产者不会多到哪儿去。反过来不成立——维基编辑多不代表商业内容一定繁荣,那还要看这个市场的电商成熟度。

如果决策金额比较大,值得花半天做一次商业站点的抽样验证:随机抓这门语言的二三十个电商或者媒体站,看正文语言、看模板痕迹、看更新频率。两组数据方向一致就可以放心用,不一致就以抽样为准。

宿务语那六百万个条目,对搜索引擎来说算不算低质内容?

这个问题超出了本文的口径,但可以说几点确定的。那些条目是从结构化数据库生成的,事实层面基本准确,不是编造的内容,所以它跟通常说的垃圾内容不是一回事。

对你的实际影响主要在两个地方。一是它们会占据一部分搜索结果的位置,尤其是长尾的物种名和地名查询。二是它们会抬高各种统计口径里这门语言的内容量,让所有基于内容量的判断失真。

第二点才是本文关心的。第一点对做商业内容的人影响有限,因为你要抢的品类词跟物种名地名基本不重叠——这恰恰是关键:六百万个页面里,跟做生意有关的那29个概念只覆盖了4个。

页/人这个比值,能不能直接拿去跟老板汇报?

不建议单独给。这个比值是加工过的数,别人第一反应会问你怎么算的,然后讨论会歪到口径上去。

更有效的做法是把两个原始数并排放:内容量七位数,写内容的人三十几个。这两个数放一起,结论是听的人自己得出来的,不需要你解释比值的定义。

如果一定要给比值,把英语的539一起给出来当参照。有基线的数字才有意义,没基线的比值只是一个陌生的数。

编辑人数在涨的语言,是不是就该早点进场?

方向上对,但要看涨的是什么。编辑人数涨可能来自三种原因:这个市场的上网人口在涨、某个话题引起了一波参与、或者有组织的编辑活动。

第一种是真的市场扩张,值得抢时间。第二种是短期波动,看两三年的曲线能分辨出来。第三种通常集中在特定话题上,跟商业内容关系不大。

判断方法是把曲线拉长看形状:持续多年的缓坡是第一种,一两个月的尖峰是第二种,阶梯状的跳变是第三种或者机器人。三种形状用肉眼就能分开。

要是这门语言的维基百科条目太少,样本不够怎么办?

本文的29个概念在最薄的几门语言上确实只覆盖到四五条,这时候词条级的结论要谨慎,但语言级的结论仍然成立。

语言级的数据来自逐月统计,跟你选了哪些概念无关,样本量是这门语言的全部页面和全部编辑。这一层不受影响。

词条级的数据可以换一批概念重跑,比如换成你自己要做的那些品类词,逐个查这门语言有没有对应条目。查不到本身就是最强的信号——这个概念在这门语言的公共知识里还是空的。

这套方法在中文市场有没有用?

中文不是本文的对象,它的内容量和写作人群都在最高那一档,这把尺子给不出新信息。

但方法本身可以搬。如果你在中文市场里做的是一个很细的垂直领域,同样可以问:这个领域里认真写东西的人有几个。答案往往比想象的少,而这个数比领域内的内容总量更能说明你的机会。

拿到这个数的路径不一样。中文没有一个像维基那样公开修订史的地方,只能靠抽样:找二三十篇这个领域的深度内容,数作者署名,去重。做出来的数粗糙,但方向是对的。

这些数据每月都在变,做完的评估表多久就过期了?

存量和人数是慢变量,一年内的变化通常不会改变分档。真正会让评估作废的是灌注事件,那是跳变,一个月就能把内容量抬一个数量级。

所以监测的重点不是重跑全表,是盯跳变。把二十几门语言的月度新建量做成一个简单的对比,每季度扫一眼有没有立柱,五分钟的事。

发现立柱之后再单独重算那一门语言。没有立柱就沿用上一版,一年做一次全表更新足够。

权威参考资料

分享到
标签
版权声明

本文标题:《小语种的竞争强度按内容量算会算反,那批词条历史上只有27个人碰过》

本文链接:https://zhangwenbao.com/minor-language-content-volume-editor-count.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交