小语种内容里写本地的事占多少?30门语言拆下来乌兹别克语4%,英语53%
本文目录
- 内容量这个数,答不了“这些内容讲的是哪儿的事”
- 你手上那张表只有一列
- 同样十万条,写的可以全是外国
- 这跟内容是不是搬来的不是一回事
- 这件事在英文市场几乎不用问
- 本文量什么、不量什么
- 怎么在外面把“写的是哪儿的事”量出来?
- 先要一批能逐条判出国别的内容
- 抽样:在页面编号空间里随机取
- 截断:先拿编号当水位,再逐页复核
- 判国别:一条属性链,直的和要拐弯的
- 分子和分母来自同一批抽样
- 判不出国别的那一半,是数据缺,还是真的没国别?
- 先看它们都是些什么东西
- 用一个不依赖国别的办法验一遍
- 结果是判不出的那批明显偏本地
- 两个口径都报,别只报好看的那个
- 一门语言的内容里,有多少是能从一张表成批生成的?
- 第一版算出来的结果不对劲
- 这不是内容,是导进来的表格
- 所以先按类型分一刀
- 名录型占比本身就是一个读数
- 跟内容总量正相关,所以大维基的水分更大
- 30门语言的本地题材占比排出来是什么样?
- 最低的那几门
- 最高的那几门
- 中位数落在哪
- 两个口径差得最多的那几门
- 反方向也有
- 内容多的语言,本地那一格是不是更满?
- 跟内容总量的相关是零
- 跟名录型占比的相关是负的
- 跟判定率的相关要单独查
- 成对样本比相关系数更能说明问题
- 写的是哪儿,跟读的是哪儿,对得上吗?
- 读者那一侧怎么取
- 先剔掉读者侧的假数据
- 二十九门里二十六门,读的比写的更本地
- 这个差值怎么用
- 本地题材凭什么是唯一翻不进来的那一块?
- 先看一个数:这条内容有几门语言写过
- 能翻的都在被翻
- 翻不进来的是哪三类
- 竞争强度要按题材重算
- 这个数怎么改你的选题清单?
- 三档判读线
- 低本地率市场先做什么
- 高本地率市场怎么切
- 排期上怎么占位
- 怎么在自己的市场上重做一遍?
- 没有百科数据的时候看哪三处
- 一个下午能跑完的最小版本
- 多久重算一次
- 哪些相邻的问题不归这一层管?
- 内容质量不归这一层
- 内容是谁写的、从哪儿来的,那半边已经写过
- 架构与地区定向那半边归国际化那一层
- 百科数据代替不了商业调研
- 常见问题解答
- 百科上的内容构成,能代表这门语言的整个互联网吗?
- 为什么不直接数带地理坐标的条目,那样不是更简单?
- 判不出国别的那一半会不会把结论整个推翻?
- 本地题材占比低,是不是说明这门语言不值得做?
- 这套方法能不能用在自己的品类上,而不是整个语言上?
- 为什么要把时点截到两年前,用最新数据不是更好?
- 这件事跟内容是不是从别的语言搬来的,是同一个问题吗?
- 权威参考资料
摘要:三十门语言各随机抽两百二十条公共内容,逐条判定它讲的是哪个国家,时点截到2022年6月底。剔掉能从名录成批生成的条目之后,写本地的占比最低是乌兹别克语4.3%,最高是泰米尔语68.6%,英语53.2%,中位数落在27%。这个数跟内容总量的相关系数只有0.100,等于没有关系。最硬的一条是跨语言覆盖:本地题材的条目中位只有2门语言写过,外国题材是24门——你打算翻的那批,别人已经翻了二十几遍;翻不进来的那批,才是你能占住的位置。
内容量这个数,答不了“这些内容讲的是哪儿的事”
你手上那张表只有一列
做小语种排期的时候,几乎每个人手上都有一张表,一列语言,一列内容量。这门语言有多少页、多少条、多少篇,数字一排,看着就有了判断依据。
问题是这一列什么都没说。十万条内容可以是十万条关于本国城市和本国人物的记录,也可以是十万条从别处搬来的通用知识,两者在表里长得一模一样。
而这两种情况对你的意义正好相反。前一种说明当地已经有一批人在认真写自己的事,后一种说明关于这个地方的内容其实还没人写。
更麻烦的是这一列还很容易被当成决策依据。它是唯一一个能横向排序的数字,排完之后看起来像一份优先级清单,实际上它只回答了一个问题:这门语言的页面有多少张。
而这一列背后其实还站着另一个更基本的问题:这些页面到底是几个人写出来的。
同样十万条,写的可以全是外国
这不是假设。抽样量下来,有几门语言的内容池子里,关于本国的条目占比是个位数,剩下的绝大部分讲的是别的国家的人、别的国家的地方、别的国家的作品。
你可以把它想成一间本地图书馆,书架是满的,但架上的书讲的都是别处的事。走进去的本地人想查一件本地的事,多半查不到。
对做内容的人来说,那间图书馆里空着的那一格,就是这门语言里最容易占住的位置。
这件事在预算会上很难讲清楚,因为它没法用一个现成的指标表达。你说这个市场的内容量不小,对方问那竞争激烈吗,你只能说不知道——问题就出在这儿,量和竞争之间隔着一层没人量过的东西。
本站早前量过一次洗衣机这类最普通的品类词在多少门语言里还是空的,那次查的是有没有,这次查的是写的是哪儿。
这跟内容是不是搬来的不是一回事
上一次量的是内容的来路,这次量的是内容的题材,两条轴独立。内容里有多少是从别的语言搬来的那一篇算完之后,留下的正是这个问题:搬进来的和自己写的,讲的是不是同一批东西。
一门语言完全可以自己动手写一大堆关于外国的东西,也可以从外语搬进来一批关于本国的东西。前者在数据里很常见,后者少得多。
所以别指望用来源那个数推出题材这个数,两个都得单独量。
举个具体的例子。一门语言里有一批关于本国节庆的条目,可能是本地人自己写的,也可能是某个国际项目组织人翻译进来的。来源不同,题材相同。反过来,本地人熬夜写出来的一篇欧洲足球俱乐部介绍,来源是本地的,题材是外国的。
这件事在英文市场几乎不用问
英语的内容池子里关于英语国家的部分本来就厚,做英文内容的人不会碰到“关于我这个市场的资料根本没人写”这种局面。
小语种不一样。这门语言的使用者集中在一两个国家,可这门语言的内容池子完全可能不围着那一两个国家转。这个错位是小语种独有的,把语种换成英语就不成立。
所以做英语内容的人给出的方法论,在这一层是不适用的。他们讲的选题技巧默认脚下有一大片现成资料可以站,而你要做的那门语言,那片资料可能压根不存在。
所以按母语人口给语言排优先级那套算法,在这一层上完全使不上劲。
本文量什么、不量什么
量的是公共知识池子的题材构成,一个背景读数。不量内容质量,不量收录排名,不量你那个品类的竞争强度。
用法是开工之前先看一眼刻度,知道自己面对的是一个已经被本地人写满的市场,还是一个连本地的事都还没人写的市场。这两种市场的打法完全不同。
还有一个用法是拿它做说服材料。跟不了解这门语言的人解释“为什么不能照搬英文站的选题清单”,一个具体的百分比比十句形容词管用。
关键词工具在这些语言上返回的那个零是数据缺口不是需求缺口,这一条同样适用于内容量。
怎么在外面把“写的是哪儿的事”量出来?
先要一批能逐条判出国别的内容
这件事听着简单,做起来第一个坎是样本。你没法把一门语言的整个互联网抓下来,也没有哪家工具会告诉你某个站点的内容讲的是哪个国家。
能满足条件的公开语料其实只有一类:条目本身挂着结构化标注的百科型内容。每个条目背后有一个数据项,数据项上写着这东西属于哪个国家、这个人是哪国国籍、这个组织总部在哪。
这批数据的好处是它可以按时间截断,坏处是它只代表百科型内容,不代表整个语言的互联网。后面那条边界我会单独说清楚,先把量法讲完。
退一步说,即使能把整个互联网抓下来,你也没法逐页判断它讲的是哪个国家——那需要读懂内容。结构化标注的价值就在这儿:它把“读懂”这一步变成了查表。
抽样:在页面编号空间里随机取
常见做法是用随机条目接口,但那个接口给的是今天还存在的条目,没法回到某个时点。所以换了另一条路:直接在页面编号的整数空间里随机取。
每个页面在建立的那一刻拿到一个递增的编号,编号一旦分配就不再变。取一个编号区间的随机整数,再问接口这些编号今天对应什么页面,就得到一批不带任何主题偏好的样本。
接口一次能问50个编号,返回里带命名空间、是不是重定向、以及对应的数据项标识。只留正文命名空间、非重定向、并且能对上数据项的那些,其余丢掉。
这么抽会拿到不少空号和非正文页面,因为编号是所有类型的页面共用的,删掉的页面留下空洞。这些全部丢掉,代价是多问几次接口,好处是样本没有任何主题偏好。
接口的具体参数和返回结构可以查页面属性接口的说明,一次最多问五十个编号。
截断:先拿编号当水位,再逐页复核
要把时点定在2022年6月底,得知道那天的编号水位在哪儿。做法是查那天之前的页面创建日志,取一批事件的编号分布。
这里踩了一个坑,值得单独讲。第一版我取的是那批事件里最大的编号,结果老挝语的样本里有26% 落在截断点之后——页面编号并不严格单调,页面移动和批量导入都会打乱它。
改法有两步。水位改取75分位而不是最大值,把绝大多数越界样本挡在门外;然后每门语言抽45条逐页去查首版时间,把这把尺子的误差实测出来,而不是假设它准。这一步的结果后面会报。
复核的结果是:按75分位取水位之后,30门语言的越界样本全部为零,首版时间查询失败也是零。这把尺子在这个用法下是干净的,但前提是不能用最大值。
首版时间要用修订接口按时间正序取第一条,这个参数组合一次只能问一个页面,没有批量写法。
判国别:一条属性链,直的和要拐弯的
拿到条目之后,判它讲的是哪个国家。数据项上能直接给出答案的属性有几个:国家这个属性管地点、机构、作品,国籍这个属性管人物,另外还有原产国、适用管辖区这几个。
直接给不出的,要再拐一道弯。比如一个条目只写了它位于某个行政区,那就再查那个行政区属于哪个国家;一个人只写了出生地,就查那个出生地在哪国。最多拐两跳,拐不到就算判不出。
这条链是自己定的,不是现成的,所以我在文章里把它完整写出来,你可以照着复现,也可以质疑其中某一环。
还有一处细节值得说:同一个地方有时候有两个数据项,比如荷兰王国和荷兰是分开的两条。不把它们并成一个,荷兰语的外部第一名会算成荷兰自己,那显然是错的。这类等价对我逐个合并了,历史上的几个德国也一样。
分子和分母来自同一批抽样
这条是上一批留下的教训。当时分子取一个接口、分母取另一个接口,两个口径差了1.27到2.38倍,越南语的数字因此虚高了一半还多。
所以这次分子分母是同一批条目:分母是抽到的全部条目,分子是其中判定为本地国的那些。中间不换数据源,不换时点,不换筛选条件。
另外报第二个口径:只在判得出国别的条目里算本地占多少。两个数一起看,才知道结论有没有被判不出的那部分带偏。
这条规矩听起来是常识,实际执行时最容易破。因为不同接口给的数据丰俭不一,人总会忍不住去更全的那个接口取分子,取完之后忘了分母还留在原来那个口径上。
判不出国别的那一半,是数据缺,还是真的没国别?
先看它们都是些什么东西
30门语言各抽220条,判得出国别的比例从三成到八成不等,中间那一大块判不出来。这一块不搞清楚,整套数就只是个半成品。
把它们的类型打出来看,第一批是本来就没有国别的:日期页、年份页、消歧义页、生物分类单元、数学概念、学科名。老挝语的样本里光是日期限定词就有20条。
第二批才是问题:本该有国别但数据项是空的。僧伽罗语抽到一条“西方省”,那是斯里兰卡的一个省,数据项上却没写它属于哪国。
这两批混在一起,会让人得出完全相反的判断。把它们统统当成“没有国别”,本地占比会被高估;统统当成“数据缺失”丢掉不算,本地占比会被低估。所以必须先估清楚两批各占多少。
用一个不依赖国别的办法验一遍
要判断第二批偏向哪边,得找一个跟国别无关的信号。我用的是跨语言覆盖数:这条内容一共有几门语言写过。
理由很直接。本地专属的东西别的语言不会写,通用知识则是几十门语言都有。所以覆盖数低的,多半是本地题材。
这个信号的好处是它跟属性链完全独立,属性链判错不会影响它。
这个信号还有一个附带的好处:它不需要我读懂那门语言。一条僧伽罗语条目讲的是什么我看不懂,但它在别的语言里有没有对应页面,接口直接会告诉我。
结果是判不出的那批明显偏本地
合并30门语言的样本,判定为本地的条目跨语言覆盖中位数是 2门,判定为外国的是 24门,判不出国别的是7门。
再看极端两头:本地条目里36.0% 只有这一门语言写过,外国条目里这个比例只有2.6%;反过来,有20门以上语言写过的,外国条目占55.6%,本地条目只占5.4%。
判不出的那批落在两者之间但明显更靠本地那头——只此一门的占27.5%。所以本地题材占比这个数是下限,真实值只会更高。
打开几条看也印证了这一点。僧伽罗语那批里有西方省的区秘书处、有本地寺庙相关的条目;豪萨语那批里有豪萨手工业史、豪萨嘻哈;高棉语那批里有本地寺庙和乡分区。全是外面没人会写的东西。
这跟从页面的壳上认翻译痕迹是同一个思路:正文里量不出来的东西,换一个跟正文无关的信号常常能量出来。
两个口径都报,别只报好看的那个
后面的表里我给两列:一列分母是全部抽样条目,一列分母只算判得出国别的。判定率高的语言两列差得少,判定率低的语言差得多。
看表的时候先扫一眼判定率那一列。低于四成的语言,它的数字要打个折再用。
顺带说一句,判定率低本身也是一个信号,说明这门语言的内容在结构化数据这一层被照顾得少。这跟内容多少无关,跟有没有人去补数据项有关。
一门语言的内容里,有多少是能从一张表成批生成的?
第一版算出来的结果不对劲
按上面的方法算完第一版,外部指向的第一名是这样的:乌兹别克语指向美国,越南语指向法国,缅甸语指向日本。
越南语指向法国还说得通,殖民史摆在那儿。乌兹别克语指向美国就有点怪,缅甸语指向日本更怪。
打开条目一看就明白了。乌兹别克语那批“美国”是Donaldson(阿肯色州)、Ekwok(阿拉斯加州)这类小镇;越南语那批“法国”是清一色的法国市镇;缅甸语那批“日本”是日本的火车站和町村。
当时最危险的地方在于,这三个结论都能编出一套听着很顺的解释。乌兹别克斯坦有大量劳务移民、缅甸和日本有历史往来、越南和法国有殖民史——每一条都说得通,每一条都不是真的。
这不是内容,是导进来的表格
这些条目有一个共同点:它们能从一份现成的名录里成批生成,一行一条,标题连翻译都省了,乌兹别克语版直接写着Saint-Étienne-sur-Usson。
它们在页面总数里跟别的条目一样是一票,可它们的国别只反映一件事——谁家的行政区划表被导进来过,跟这门语言的人关心什么毫无关系。
换句话说,第一版量到的不是“这门语言在写哪个国家”,是“哪个国家的表格被跑过一遍”。
一个很直接的验证办法:看标题有没有被翻译。乌兹别克语版的美国小镇标题原样写着拉丁字母,一个西里尔字母都没有。这说明连搬运的人都没打算让本地读者读它。
所以先按类型分一刀
解法是按条目类型分层:把能成批生成的挑出来单独算。我用的清单包括行政区划与聚落、铁路车站、生物分类单元、天体、河流湖泊山岛、年份与日期、消歧义页与列表页。
这份清单是我定的,不是现成标准,所以我把它原样写在这里,你可以质疑其中任何一项,也可以自己改一版重算。
剩下的那一堆——人物、机构、作品、事件、概念——是需要有人一条条写出来的,我叫它人写内容。
分层这一步不改变任何原始数据,只是把同一批样本按类型拆成两堆分别算。所以两个口径可以并排放,也可以随时换一份清单重算,不需要重新采集。
名录型占比本身就是一个读数
算出来的分布很吓人。越南语的样本里 75.9% 是名录型,其中光是生物分类单元就有137条;瑞典语67.7%、荷兰语67.3%,也是物种;缅甸语57.3%,是聚落。
最离谱的是约鲁巴语:220条样本里 97条是小行星,占44%。这门语言的公共内容里,将近一半是编号小行星。
另一头,豪萨语只有6.8%、高棉语9.1%、蒙古语11.4%、孟加拉语11.8%。这几门语言的内容基本是人一条条写出来的。
这个读数可以直接拿去改“内容量”那一列。一门语言号称有一百万条,名录型占七成,真正有人写的是三十万条——后面这个数才该进你的竞争分析。
这批页面还有一个特征:随机翻开一页几乎没有人读。
跟内容总量正相关,所以大维基的水分更大
名录型占比跟条目总数取对数之后的相关系数是 +0.476。内容规模越大的语言,名录型的比例越高。
这条跟直觉相反:一般人默认内容多的语言更成熟,实际上多出来的那部分里有相当比例是程序跑出来的。
这条也解释了为什么按内容量排出来的语言优先级经常反直觉。排在前面的那几门,多出来的部分有相当比例不是人写的,而排在后面的小语种,剩下的那点内容反而都是真的。
30门语言的本地题材占比排出来是什么样?
最低的那几门
按人写内容口径算,本地题材占比最低的是乌兹别克语 4.3%,然后是格鲁吉亚语7.2%、阿塞拜疆语7.5%、亚美尼亚语7.6%、越南语10.0%。
乌兹别克语这个数值得单独说一句。它的人写内容只剩96条,判得出国别的47条,其中判为乌兹别克斯坦的只有2条。样本小,置信区间宽到1% 到14%,但方向是明确的。
这几门语言的共同点是内容规模不算小,而关于自己国家的那一格几乎是空的。
格鲁吉亚语、阿塞拜疆语、亚美尼亚语这三门挨在一起也不是巧合。它们的内容池子里有一大块是苏联时期和周边国家的条目,本国那一格反而薄。这在前苏联地区的几门语言上是普遍现象。
最高的那几门
最高的是泰米尔语 68.6%,然后是英语53.2%、孟加拉语50.7%、爱沙尼亚语41.8%、豪萨语39.7%、德语38.9%。
泰米尔语这个数有个背景:泰米尔语的使用者主要在印度泰米尔纳德邦和斯里兰卡,我把印度、斯里兰卡、新加坡、马来西亚都算成本地,范围比单国语言宽,所以偏高是合理的。
英语53.2% 才是最值得注意的那一个。做英语内容的人,脚下有一半以上是关于自己这块地的资料;做乌兹别克语的人,脚下只有二十几分之一。
孟加拉语50.7% 同样值得注意。它的名录型占比只有11.8%,也就是说这个数几乎全部来自人写的内容——孟加拉语社群是真的在写自己的事。
泰米尔语和孟加拉语的背景可以对照印度那十一门语言的排期那一篇。
中位数落在哪
30门语言的中位数在27% 上下。也就是说,一门语言的公共内容里,大约四分之一讲的是自己这块地方,其余四分之三讲的是外面。
这个比例听起来不高,但它是中位数——低于它的那一半语言,本地那一格更空。
换个说法可能更有体感:你打开这门语言的公共内容随便翻四页,大概只有一页讲的是本地。剩下三页讲的是别处,而那三页的内容在别的语言里都能找到。
各语言的条目总数取自各语言版本的规模清单,同样截到2022年年中。
两个口径差得最多的那几门
缅甸语是最戏剧性的一个。按全样本算,它的本地题材占比高达78.2%,排第一;剔掉名录型之后掉到 22.2%,排到中下游。
原因是它那220条样本里有104条人类聚居地,绝大多数是缅甸自己的村镇——一份缅甸地名表被导了进来。同样的情况在尼泊尔语(42.3% 掉到25.8%,村发展委员会26条)和高棉语(44.2% 掉到31.1%,乡分区13条)也发生了。
这三门语言看起来“本地内容很足”,实际上足的是地名表,不是内容。这一条是本批最该记住的判读陷阱。
识别这种情况其实不难,看名录型那一列就够了。名录型占比超过四成,本地占比那个数就不能直接用;再看那批名录是本国的还是外国的,方向立刻清楚。
| 语言 | 名录型占比 | 本地题材占比(全样本口径) | 本地题材占比(人写口径) |
|---|---|---|---|
| 乌兹别克语 | 56% | 1.3% | 4.3% |
| 格鲁吉亚语 | 38% | 10.8% | 7.2% |
| 阿塞拜疆语 | 34% | 11.3% | 7.5% |
| 亚美尼亚语 | 37% | 7.5% | 7.6% |
| 越南语 | 76% | 7.8% | 10.0% |
| 阿姆哈拉语 | 27% | 12.9% | 13.1% |
| 蒙古语 | 11% | 13.9% | 14.0% |
| 老挝语 | 18% | 18.9% | 18.8% |
| 约鲁巴语 | 49% | 19.0% | 19.5% |
| 缅甸语 | 57% | 78.2% | 22.2% |
| 泰语 | 14% | 23.9% | 22.8% |
| 尼泊尔语 | 25% | 42.3% | 25.8% |
| 僧伽罗语 | 13% | 33.3% | 27.6% |
| 高棉语 | 9% | 44.2% | 31.1% |
| 斯瓦希里语 | 22% | 33.1% | 34.1% |
| 德语 | 19% | 37.3% | 38.9% |
| 豪萨语 | 7% | 39.2% | 39.7% |
| 孟加拉语 | 12% | 52.1% | 50.7% |
| 英语 | 24% | 50.0% | 53.2% |
| 泰米尔语 | 18% | 73.8% | 68.6% |
反方向也有
爱沙尼亚语和德语反过来:剔掉名录之后本地占比不降反升(37.5% 到41.8%,37.3% 到38.9%)。它们的名录型主要是物种和消歧义页,指向国外或者压根没国别,剔掉之后本地那部分的比重反而显出来。
所以这一步不是单方向的修正,是两个方向都会动。不做这一步,排行榜的前几名和后几名都是错的。
所以我不建议只报一个口径。两个都摆出来,读者能自己看出哪几门语言的数字需要额外小心,这比我替他们做一次修正更可靠。
内容多的语言,本地那一格是不是更满?
跟内容总量的相关是零
把30门语言的条目总数取对数,跟本地题材占比算相关,得到的是 +0.100。四舍五入就是没有关系。
这意味着你没法从“这门语言有多少内容”推出“这些内容里有多少是关于它自己的”。两个数必须分别去量。
拿两组对照最直观:越南语127万条对老挝语4300条,差295倍,本地题材占比是10.0% 对18.8%,内容少的那门反而高一倍。
这跟上一批得到的结论是同一族:现成的规模指标推不出内容的成分。上一批查的是内容从哪来,四个现成指标的相关系数全落在零附近;这一批查的是内容写什么,相关系数是0.100,还是零。
越南泰国印尼这三门的对比,跟把它们放进同一张东南亚预算表那次得到的结论是一致的。
顺便一提,这类内容分布不均的现象有专门的研究方向,公开的知识缺口研究把它拆成了内容、贡献者、读者三层,本文量的是第一层。
跟名录型占比的相关是负的
名录型占比跟本地题材占比的相关是 −0.312,弱负相关。名录灌得越多,本地那一格看起来越小。
但这个相关不能当因果用。缅甸语的名录灌的是本地地名,方向正好反过来。所以正确的做法还是分层算,不是拿这个相关去调整。
这也是为什么我不把名录型占比当成一个修正系数。它跟结果相关,但相关的方向随灌的是本国还是外国而变,用它做统一修正会把一部分语言修得更错。
跟判定率的相关要单独查
判不出国别的比例在各语言之间差得很大(从两成到七成),必须确认它没有把排行榜带偏。两个口径的相关系数是 +0.794:排序大体一致,但不完全一致。
不一致的那几个正是上面说的缅甸语、尼泊尔语、高棉语。所以这个0.794不是“可以放心用其中一个”的意思,是“有几门语言必须看另一个”的意思。
把0.794换成人话:三十门语言里大约有三门,你按其中一个口径读会得到明显错误的印象。麻烦在于你事先不知道是哪三门,所以只能两个都算。
成对样本比相关系数更能说明问题
格鲁吉亚语15.8万条、马其顿语12.8万条,规模差不到三成,本地题材占比7.2% 对27.4%,差3.8倍。
阿塞拜疆语19万条、立陶宛语20.5万条,规模几乎相同,7.5% 对31.8%,差4.2倍。
这两对说明的事情跟相关系数一样,但更硬:规模这个变量被控制住之后,本地题材占比照样可以差四倍。
成对样本还有一个好处,它不需要读者相信我的统计口径。规模差不到三成、结果差四倍,这句话本身就是证据,不依赖任何模型假设。
写的是哪儿,跟读的是哪儿,对得上吗?
读者那一侧怎么取
供给侧量完,还得看需求侧。取2022年上半年每门语言的月度最多阅读排行,把合计阅读量最高的那批条目按同一套属性链判国别。
两侧的判定逻辑完全一样,分母都取判得出国别的条目,所以差值可比。这一层每门语言取阅读量最高的一百条上下,样本比主表小,作用是验证方向而不是给精确值。
另外它天然绕开了名录型那个坑:热门榜上几乎见不到地名表和物种表。那批条目撑起了页面总数,却没有撑起任何阅读量。
选月度榜而不是单日榜是有原因的。单日榜会被当天的突发事件带走,量出来的是那天发生了什么;月度榜连取半年,反映的才是稳定的阅读结构。
阅读排行走的是公开的指标接口,按月取,可以回到任意一个历史月份。
先剔掉读者侧的假数据
这一步差点被跳过。约鲁巴语算出来读本地只有1.5%,跟供给侧的19.5% 反着走,看着像个大发现。
打开榜单一看,前十二名分别是M、D、B、C、F、H、I、V、R、A、J、U——单个拉丁字母的页面,每个两千五百次左右。没有人会一个月里把字母M那一页读两千五百遍。
所以判读者侧的数据之前得先加一道自查:榜首十条里如果有一半是单字符、纯数字、日期这类没人会读的页面,整门语言的读数不能用。按这条约鲁巴语被剔除,其余二十九门通过。
这一条跟内容侧的名录型是同一个道理的两面:内容侧有一批页面是机器写的,流量侧有一批访问是机器发的。两边都得先把机器那部分挑出去,剩下的才是人和人之间的事。
这跟小语种访问量里有一大半不是人那一篇量到的是同一件事,只是这次撞在了内容榜单上。
二十九门里二十六门,读的比写的更本地
僧伽罗语最夸张:写本地占27.6%,热门阅读榜上本地内容占91.3%,差63.7个百分点。
后面依次是印尼语25.6% 对72.1%、尼泊尔语25.8% 对70.8%、波斯语19.1% 对61.0%、缅甸语22.2% 对63.0%、越南语10.0% 对50.6%、泰语22.8% 对63.1%、荷兰语18.3% 对57.0%、斯瓦希里语34.1% 对69.7%。
二十九门的差值中位数是 +27.9个百分点。反过来的只有三门:豪萨语差6.3点、立陶宛语差10.0点、德语差2.2点——前两门本来就是本地题材占比偏高的那一档,供给这一侧已经跟上了。
还有一门波兰语几乎持平,写25.4% 读25.7%,差0.3点。这种持平状态才是内容供给和阅读需求对齐的样子,三十门里只出现了一次。
| 语言 | 写本地(人写口径) | 读本地(热门榜) | 读减写 |
|---|---|---|---|
| 僧伽罗语 | 27.6% | 91.3% | +63.7点 |
| 印尼语 | 25.6% | 72.1% | +46.5点 |
| 尼泊尔语 | 25.8% | 70.8% | +45.0点 |
| 波斯语 | 19.1% | 61.0% | +41.9点 |
| 缅甸语 | 22.2% | 63.0% | +40.8点 |
| 越南语 | 10.0% | 50.6% | +40.6点 |
| 泰语 | 22.8% | 63.1% | +40.3点 |
| 荷兰语 | 18.3% | 57.0% | +38.7点 |
| 斯瓦希里语 | 34.1% | 69.7% | +35.6点 |
| 阿塞拜疆语 | 7.5% | 41.9% | +34.4点 |
| 蒙古语 | 14.0% | 43.1% | +29.2点 |
| 阿姆哈拉语 | 13.1% | 41.0% | +27.9点 |
| 老挝语 | 18.8% | 32.5% | +13.7点 |
| 波兰语 | 25.4% | 25.7% | +0.3点 |
| 德语 | 38.9% | 36.7% | −2.2点 |
| 豪萨语 | 39.7% | 33.3% | −6.3点 |
| 立陶宛语 | 31.8% | 21.8% | −10.0点 |
这个差值怎么用
把它当成缺口读数。差值越大,说明这门语言里本地内容的供需错位越严重,而错位的方向对做内容的人是有利的:需求在,供给没跟上。
差值接近零甚至反过来的语言,说明本地那一格已经被填得差不多,要进去得拼质量而不是拼有没有。
还有一层可以直接抄的:把这套办法搬到自己的站上,就是拿站内搜索日志里带地名的查询占比,去比自己站上带地名的页面占比。两个数一减就是你自己的缺口。
要注意这个差值不能直接换算成流量预期。它说明的是结构性的缺口,不是某个具体关键词的搜索量。缺口大只代表这个方向值得试,具体投多少还得看词。
本地题材凭什么是唯一翻不进来的那一块?
先看一个数:这条内容有几门语言写过
前面为了验证漏判方向,顺手拿到了一列数据,它本身就回答了这个问题。判定为外国的条目,跨语言覆盖中位数是24门;判定为本地的,中位数是2门。
再看两头:外国题材里有20门以上语言写过的占55.6%,本地题材只占5.4%;反过来,本地题材里36.0% 只有这一门语言写过,外国题材只有2.6%。
把这两个数翻译成人话就是:你打算翻的那些内容,另外二十几门语言已经翻过了;而本地那批,根本没有源文可翻。
这个对比之所以硬,是因为它不依赖任何关于“本地”的定义。你可以不同意我把某个条目判成本地,但你没法否认它只有一门语言写过——那是一个客观事实。
能翻的都在被翻
通用知识有一个特点:它在哪门语言里都成立,所以谁都可以把它翻过去。一篇讲某个技术原理的文章,英语有、德语有、越南语也可以有,内容基本一致。
上面那个“中位24门”就是这件事的读数。这类内容的供给是无限的,因为翻译成本一直在往下掉。
你今天花力气把一篇通用指南翻成小语种,明年会有五家做同一件事,而且比你快。你在这一块上的领先只是时间差,不是壁垒。
机器翻译把这件事又推了一步。以前翻一篇通用指南要几天,现在几分钟,于是通用知识那一格的填充速度比任何人的产能都快。你在那一格里的位置随时会被覆盖。
翻不进来的是哪三类
第一类是本地的实体:本地的商家、本地的机构、本地的服务点、本地的展会。这些东西在别的语言里根本不存在,没有源文可翻。
第二类是本地的规矩:本地的税、本地的认证、本地的退货习惯、本地的付款方式。这些在别的语言里有对应概念,但取值完全不同,翻过来就是错的。
第三类是本地的价格与可得性:同一件东西在这个市场卖多少、从哪儿买、多久到。这一类连概念都对得上,就是数字换了,而这个数字只有在当地待过的人写得出来。
这三类有一个共同的成本特征:写它们的边际成本很低,但门槛很高。低在于你已经在这个市场做生意,这些信息本来就在你手上;高在于没在这个市场做过生意的人拿不到。
第一类的采集路径跟本地目录和本地社群那批外链渠道高度重合,可以一趟跑完两件事。
竞争强度要按题材重算
把内容量当竞争强度,得到的是一个平均数。按题材拆开之后你会发现,同一门语言里通用知识那一格已经挤满了,本地题材那一格常常是空的。
所以正确的问法不是“这门语言的内容多不多”,而是“我要写的那一类内容多不多”。这两个问题的答案经常相反。
这也解释了一个常见的困惑:明明数据显示这个市场内容量很大,实际做进去却发现关于本地的具体问题一篇都搜不到。数字没错,只是它统计的不是你要的那一格。
重算的动作也不复杂。把你原来那张内容量的表加两列:名录型占比、本地题材占比。三个数一起看,语言的优先级排序常常会整个翻过来。
这个数怎么改你的选题清单?
三档判读线
本地题材占比在两成以上的,按正常竞争市场对待,当地有一批人在写自己的事,你得拿出真东西才进得去。
一成到两成之间的,通用知识那一格有人占,本地那一格半空,选题优先往本地实体和本地规矩上压。
一成以下的,这门语言的公共内容基本没在写本地的事,本地题材整片空着。这一档反而是最值得投的,前提是先确认有没有人搜。
这三档不是拿统计方法切出来的,是按三十门语言的实际分布和对应动作反推的。分界线附近的语言不用纠结落在哪一档,两档的动作差别本来就不大。
豪萨语和斯瓦希里语这两门可以对照在非洲选语种别先看人口那一篇的判据。
低本地率市场先做什么
先做本地实体页:城市、服务点、合作商家、常见问题里带地名的那些。这批内容没有源文可翻,也没有对手在做。
再做本地规矩页:税费怎么算、认证要哪些、退货能不能寄回去。这批内容的搜索量不高,但转化极硬,而且写完两年不用改。
最后才是通用知识的本地化版本。顺序反过来的话,你会在最挤的那一格上花掉全部预算。
顺序反过来的代价很具体:你会在通用知识那一格里跟一批已经把内容翻好的对手抢位置,而本地那一格空着没人碰,等你回头去做的时候已经晚了半年。
写这批内容的时候,本地作者署名那一层信号值得一起配上,成本很低。
高本地率市场怎么切
本地题材已经被写满的市场,硬碰硬没意义。正确切法是往下一层找:本地的事写完了,但本地视角看外部的事往往还没写。
比如某个进口品类在当地怎么用、当地人买国外产品会踩哪些坑、跨境物流在这个国家的实际时效。这些题材既是本地的,又是当地社群没顾上写的。
另一种切法是往时间上找。本地社群写的多半是已经发生的事,正在发生和即将发生的那部分往往没人管。这一块的时效性强,但正因为时效性强,抄的人跟不上。
切的时候要留意同一门语言在两个市场的意图分叉,别把两个市场的题材混成一份清单。
排期上怎么占位
本地题材的一个好处是它不怕被别人抄。抄的人拿不到你的一手信息,只能改写,而改写出来的东西一眼能看出没去过现场。
所以这批内容值得排在最前面,越早写完越早开始累积。通用知识那一批可以往后放,反正什么时候做成本都差不多。
排期上还有一个实际考虑:本地题材的采集要靠人跑,周期长。越早启动,交付的时间点越可控;压到最后再做,就只能拿通用内容顶上。
怎么在自己的市场上重做一遍?
没有百科数据的时候看哪三处
不是每个品类都有现成的结构化语料,多数时候你得自己看。三处最省力。
第一处是目标语言的结果页。搜你那个品类的核心词,把前二十个结果逐个打开,记下每个页面讲的是本地的事还是通用知识。二十条就能看出比例。
第二处是本地论坛和问答社区。那里的提问天然全是本地的,把高频提问归类之后,你会看到一批本地题材在正规内容里完全没有对应页面。
第三处是本地新闻站的分类导航。新闻站的栏目结构反映的是当地人关心什么,跟你的品类交叉一下,往往能挑出三五个没人写的题材。
三处都看一遍大概两个小时。别指望它们互相印证,多数时候三个结果会有出入,而出入本身就是信息——结果页偏通用、论坛偏本地,说明需求和供给之间有个口子。
一个下午能跑完的最小版本
取三十个词:十个品类词、十个交易词、十个带地名或本地机构名的词。逐个搜,每个词记两件事——前十个结果里有几个是本地站,有几个页面讲的是本地的事。
算两个比例,一个是本地站占比,一个是本地题材占比。前者告诉你竞争对手是谁,后者告诉你内容缺口在哪。两个数经常不一致,而不一致的那部分就是机会。
这套动作不需要任何工具,也不需要懂那门语言——判断一个页面讲的是不是本地的事,看地名、看货币符号、看电话区号就够了。
记录的时候建议留一列原始截图或者链接,因为过两个月你会忘了当时为什么把某一条判成本地。这一列的成本是零,回头复盘的时候很值钱。
多久重算一次
一年一次。这个数变得很慢,因为它反映的是一个社群长期的写作习惯,不是某次算法更新。
会让它明显变化的只有两件事:当地出现了一批新的活跃作者,或者你自己那个品类被某个大平台整体铺了一遍。两件事都不是几个月能发生的。
如果你所在的品类刚好赶上某个大平台进入这个市场,那要单独提前重算一次。平台铺内容的速度不是社群的速度,几个月就能把某一格填满。
哪些相邻的问题不归这一层管?
内容质量不归这一层
这套数只回答一件事:这些内容讲的是哪儿的事。它不看这些内容写得好不好、长不长、有没有人维护。
一个只有两句话的本地地名条目,跟一篇写满的本地历史条目,在这份统计里是一样的一票。想知道内容有多厚多旧,那是另一把尺子。
所以别拿这份数据去论证“这门语言的内容质量差”。它只数了条目,一个字都没读。质量要另外抽样人工看,那是完全独立的一件事。
内容是谁写的、从哪儿来的,那半边已经写过
“这些内容是搬来的还是本地写的”跟“这些内容讲的是哪儿的事”是两条独立的轴,交叉起来是四个格子,不是一条线。
一门语言完全可以自己动手写了一大堆关于外国的内容,也可以从外语搬进来一堆关于本国的内容。前者在数据里很常见,后者比想象中少。
两条轴交叉出来的四个格子里,最值得注意的是“自己写的、写的是外国”那一格。这一格意味着本地社群有产能,但产能没用在本地题材上——这是最容易被撬动的一种局面。
架构与地区定向那半边归国际化那一层
语言标签怎么配、地区版本怎么分、跳转怎么做,这些是架构层的事,跟这门语言本身没关系。把语种换成英语,那些问题一样存在,所以不属于这里讨论的范围。
判据还是那一条:把语种换成英语之后问题还成不成立。语言标签配错这件事英语站一样会犯,所以它不属于这里;而“关于我这个市场的资料没人写”这件事,英语站基本碰不到。
百科数据代替不了商业调研
最后这条最重要。百科型内容的产出动机是志愿投入,商业内容的产出动机是搜索量,两批人关心的东西不一样。
所以这份数据能回答的是“这门语言的公共知识池子偏向哪儿”,它是一个背景读数,不是你那个品类的竞争分析。真要下预算,还得去看目标市场的实际结果页。
更实际的用法是拿它做排序而不是做决策。三十门语言摆在一起,你至少知道该先去实地看哪几门,这比按人口排或者按内容量排都靠谱。
常见问题解答
百科上的内容构成,能代表这门语言的整个互联网吗?
不能,这一点必须说在前面。百科型内容的产出动机是志愿投入,写什么由写的人自己的兴趣决定;商业内容的产出动机是搜索量和转化。两批人关心的东西不一样,产出的地理构成也就不一样。这份数据的正确用法是当背景读数:它告诉你这门语言的公共知识池子整体偏向哪儿,帮你在开工之前调整预期。真要决定某个品类投不投,还得去目标市场的结果页上实地看一遍。
为什么不直接数带地理坐标的条目,那样不是更简单?
因为带坐标的只有地点,人物、机构、作品、事件全都没有坐标,而这几类恰恰是内容池子里的大头。只数坐标会把结论变成“这门语言写了多少地名”,那是另一个问题。所以这里走的是属性链,人物按国籍算、机构按总部算、作品按原产国算,地点才走坐标背后的行政区。代价是判定率下降,收益是覆盖到的内容类型完整得多。
判不出国别的那一半会不会把结论整个推翻?
方向上不会,幅度上会有影响,而且影响的方向是确定的。判不出的那批里,除了本来就没有国别的日期页、年份页、生物分类、数学概念,还有一类是“本该有国别但数据项是空的”,这一类明显偏向本地题材——本地条目更没人去补数据项。所以本地占比这个数是下限,真实值只会更高不会更低。文章里两个口径都报,就是为了让你自己判断这个偏差有多大。
本地题材占比低,是不是说明这门语言不值得做?
正好相反。这个数低意味着这门语言的公共内容里,关于本地的那一块是空的,而那一块恰恰是从英语翻不过来的。翻译能补的是通用知识,补不了本地的商家、本地的规矩、本地的价格。所以低本地率对应的动作是往本地题材上压资源,不是撤退。真正该谨慎的是另一种情况:本地率高、内容也厚,那说明当地已经有一批人在认真写自己的事。
这套方法能不能用在自己的品类上,而不是整个语言上?
能,而且更该这么用。把随机抽样换成你那个品类的关键词,逐条打开结果页,看排在前面的那几个站是本地的还是外来的、内容讲的是本地的事还是通用知识。样本量小很多,但结论直接对着你的预算。整个语言的读数只是给你一个背景刻度,让你知道自己那个品类的数字是偏高还是偏低。
为什么要把时点截到两年前,用最新数据不是更好?
因为这套数的用处是看结构而不是看新闻,而结构的变化以年为单位。截到一个固定时点还有一个好处:同一批语言在同一个截面上比较,不会出现某门语言的数据是上个月的、另一门是去年的这种情况。想看趋势的话,正确做法是隔一年用同样的方法再跑一遍,两个截面相减,而不是把不同时点的数混在一张表里。
这件事跟内容是不是从别的语言搬来的,是同一个问题吗?
不是,它们是两条独立的轴。内容来源问的是这份内容怎么来的,地理构成问的是这份内容讲的是什么。一门语言完全可以自己动手写一大堆关于外国的内容,也可以从外语搬进来一批关于本国的内容。两条轴交叉起来是四个格子,每个格子对应的动作都不一样。想把这两个数一起用,先分别量出来,别指望其中一个能推出另一个。
权威参考资料
本文标题:《小语种内容里写本地的事占多少?30门语言拆下来乌兹别克语4%,英语53%》
本文链接:https://zhangwenbao.com/minor-language-content-local-topic-share.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0