小语种内容体裁拆开看:人物近一半,品类词那格跟内容量无关

小语种内容体裁拆开看:人物近一半,品类词那格跟内容量无关
张文保 39 分钟阅读 4,601 阅读
本文目录
  1. 内容量这个数,能不能告诉你这些内容是什么形状的?
  2. 竞品表上那一列到底是什么
  3. 同样十万条,写的可以全是人
  4. 这跟写的是哪儿的事不是一回事
  5. 本文量什么、不量什么
  6. 怎么把一门语言的内容按体裁拆开?
  7. 先要一批能逐条判出类型的内容
  8. 抽样:在页面编号空间里随机取
  9. 截断:先拿编号当水位,再逐页复核
  10. 判类型:一条属性链往上爬到根
  11. 分子分母来自同一批抽样
  12. 第一版数据为什么整表作废?
  13. 有一格高得不对劲
  14. 打开二十条看一眼
  15. 少写了一个参数
  16. 上一批为什么没撞上
  17. 这条判据可以直接拿去用
  18. 三十门语言的体裁拆下来是什么样?
  19. 先把能成批生成的那一批分出去
  20. 跟上一批的数据对得上吗
  21. 人写口径下的第一大类
  22. 中间那一段的形状
  23. 写人的那一半,为什么小语种反而更少?
  24. 相关系数的方向跟预期反了
  25. 最低的那五门有什么共同点
  26. 约鲁巴语和豪萨语是个例外吗
  27. 写人为什么是最先被写的那一类
  28. 这个解释能不能证伪
  29. 品类和概念那一格,跟内容量有关系吗?
  30. 相关系数是零
  31. 最高的三门不是你以为的那三门
  32. 英语那一格为什么最薄
  33. 占比是形状,不是数量
  34. 两个口径要一起报
  35. 机器连这是个什么都不知道,占多少?
  36. 这一格是怎么冒出来的
  37. 三十门语言排下来
  38. 打开看是些什么东西
  39. 这是本批相关性最强的一条
  40. 这件事跟结构化数据是同一个动作
  41. 这张表怎么改你的选题清单?
  42. 三档判读线
  43. 人物占比高的市场先做什么
  44. 概念那一格薄的市场怎么切
  45. 机器不认率高的市场要加一步
  46. 排期上怎么占位
  47. 半天能跑完的最小版本长什么样?
  48. 三十条就够
  49. 不用爬属性链的简化做法
  50. 加一列会更准
  51. 多久重算一次
  52. 哪些相邻的问题不归这一层管?
  53. 内容质量不归这一层
  54. 写的是哪儿的事那半边已经写过
  55. 谁写的、从哪儿来的那半边也写过
  56. 百科数据代替不了商业调研
  57. 常见问题解答
  58. 公共百科上的体裁分布,能代表这门语言的整个互联网吗?
  59. 为什么不直接数各个分类下有多少条目,那样不是更简单?
  60. 机器判不出类型的那一格里,会不会大部分其实是很小众的东西?
  61. 人物占比高到底是好事还是坏事?
  62. 第一版把重定向当成条目那个错,会不会还有别的地方也踩了?
  63. 三十条的最小版本,误差能有多大?
  64. 这套方法能不能用在自己的品类上,而不是整个语言?
  65. 权威参考资料

摘要:把30门语言的公共内容各抽240条逐条判类型,人物传记在人写口径下从缅甸语的7.5%一直排到约鲁巴语的65.2%,差8.7倍。跟内容总量的关系弱得可以忽略,跟体裁均衡度的关系干脆是零(−0.036)。真正跟内容量强相关的是另一格:机器连这条内容属于哪一类都判不出来的比例,高棉语50.8%、缅甸语44.6%、阿姆哈拉语42.9%,秩相关−0.757。这一格决定的不是你能看到什么,是机器能不能把你的内容归进它的答案里。

内容量这个数,能不能告诉你这些内容是什么形状的?

竞品表上那一列到底是什么

做多语言市场排期,几乎每张表上都有一列叫内容量。它可能来自公共百科的条目数,也可能来自某个抓取工具给的收录量,反正是一个能排序的整数。这个数用起来非常顺手,因为它只有一列。

顺手的代价是它把一堆不同的东西压成了同一个数。十万条内容可以是十万篇产品评测,也可以是十万个人名,也可以是一张行政区划表被导了一遍。三者在这一列里长得一模一样。

保哥这几年反复吃过这个亏。看到一门语言内容量不小就以为竞争激烈,进去才发现能跟自己抢位置的内容一条都没有;也见过反过来的,数字很难看的市场里其实躺着一整片没人写的品类词。

前面几篇把这个数拆过几刀了:按写内容的人数重算一遍按有多少是从别的语言搬来的重算一遍按讲的是哪儿的事重算一遍。这一篇再挖一格:这些内容是什么形状的。

同样十万条,写的可以全是人

形状这个说法有点虚,落到能量的东西上就是体裁。一条内容讲的是一个人、一个地方、一家机构、一件事、一样东西,还是一个概念,这五六档就够把大部分内容分完。

为什么这件事对做内容的人重要?因为你能挂靠的位置只在其中几档里。做独立站的人需要的是品类词、属性词、用法词这一档,而人物传记那一档再多也接不住一个购买意图。

更麻烦的是这两档在内容量这一列里是互相掩护的。人物条目最容易写、最容易批量建、也最容易被翻译过来,于是一门语言的数字可以靠这一档撑得很好看,而你要的那一档一条都没有。

这不是猜测,是这次实测里跨度最大的一条:人物在人写口径下最低的缅甸语是7.5%,最高的约鲁巴语是65.2%。同样是几万到十几万条的量级,一门语言里三分之二在写人,另一门里十四分之一。

这跟写的是哪儿的事不是一回事

上一篇量的是地理成分,答的是这些内容讲的是本地还是外国。这一篇量的是体裁成分,答的是这些内容讲的是什么类型的东西。两者可以任意组合。

举个具体的:一门语言可以有大量本地题材,而这些本地题材全是本地政客的生平;也可以有大量外国题材,而这些外国题材全是外国品牌和产品。地理那一列和体裁这一列谁也推不出谁。

把两列并起来读才有用。本地题材占比高、而体裁又落在概念和品类上,那才是真正值得投入的市场;本地题材占比高但全是人物,那说明这门语言的公共内容在写历史不在写生活。

这次的数据正好支持这个组合读法,因为两篇用的是同一批抽样、同一批条目。参照国那一篇的分母跟本篇完全一致,两张表可以逐行对着看。

本文量什么、不量什么

量的是三样:一门语言的公共内容按体裁怎么分布、剔掉能成批生成的那部分之后分布变成什么样、以及有多大一块连类型都判不出来。

不量内容质量。一条人物传记写得好不好、一条品类条目准不准,这次一个字都不碰。体裁这一层只回答形状,不回答好坏。

也不量商业内容。公共百科不是电商站,它的体裁分布不等于这门语言整个互联网的体裁分布。它能代表的是一件事:这门语言的社群,在没人给钱的时候愿意写什么。

还有一件事这次故意不做:不按体裁给语言排优先级。排序需要把体裁跟需求侧对上,而需求侧那半边在关键词工具没数据那一篇里已经讲过怎么补,两件事分开做更干净。

怎么把一门语言的内容按体裁拆开?

先要一批能逐条判出类型的内容

体裁这件事最怕的是人工判读,三十门语言几千条内容,靠人读一遍既慢又不可复现。所以必须找一个机器可读、跨语言统一的类型标注。

公共百科背后那套结构化数据正好提供了这个东西。每个条目对应一个数据项,数据项上有一个属性专门回答这是什么,官方文档把它叫做实例属性P31,取值是另一个数据项的编号。

好处是这个属性跨语言共享。老挝语的鼠标条目和英语的mouse条目挂在同一个数据项上,类型标注只有一份。所以体裁这一列不受语言影响,量的是同一把尺子。

坏处是它的取值有几千种。这次的样本里出现了1529种不同的P31取值,直接数没有意义,因为乌兹别克语的法国市镇和缅甸语的村在两个不同编号上,讲的却是同一类东西。

抽样:在页面编号空间里随机取

要拿到一批有代表性的条目,最省事的做法是在页面编号的整数空间里随机取。取一个数,问一下这个编号对应哪个页面,不存在就跳过。

这个做法比按分类树遍历干净得多。分类树本身是人整理的,遍历它等于把整理者的偏好一起抽进来;编号空间是页面创建时按顺序发的,跟内容是什么无关。

每门语言取240条有效样本,30门共7200条。样本量决定了能说到多细:240条的样本里,一个占比10%的类别的误差大约在正负4个百分点,所以本文所有结论都只压在差距大于10个百分点的对比上。

随机种子按语言名固定,这样任何人拿同一份脚本能抽到同一批条目。可复现这件事在这类研究里比精度更值钱,因为读者对结论的第一反应通常是想自己验一遍。

截断:先拿编号当水位,再逐页复核

这批数据要能坐在一个具体的时间点上,所以得把抽样截到2022年12月31日。做法是先从页面创建日志里取那个时点附近的编号,当成一条水位线。

上一批在这里踩过坑:页面编号不是严格递增的,页面移动和批量导入都会打乱顺序,拿日志里最大的那个编号当水位,老挝语有26%的样本落在截断点之后。

修法是取75分位而不是最大值,再从每门语言里抽45条逐页去查首版时间,把这把代理尺子的误差实测出来。这次30门语言的越界数全部是0,说明75分位这条线是稳的。

顺带说一句,超大规模的语言查不出创建日志,接口会返回空且要等三十秒。英语这一门是靠二分搜索编号水位定下来的,26次请求定到7261万左右。

判类型:一条属性链往上爬到根

1529种取值要归档,办法是顺着子类属性往上爬。法国市镇的上一级是市镇,市镇的上一级是行政区划实体,爬到这里就归进聚居地与行政区这一档。

爬的深度限制在六跳,每跳最多跟四条分支,依据是官方对实例属性与子类属性的使用指引——两者混用会让链条无限延长。这次一共缓存了6629个编号的父级关系,六跳之后还有极少数爬不到根,单独列出来人工看,不塞进其他这一档蒙混过去。

根类一共设了14档:消歧义与维护页、生物分类单元、天体、时间单位、人物、组织机构、聚居地与行政区、自然地理、建筑与设施、作品、事件、交通与线路、语言与族群、概念与术语。

爬不到根的那批看下来大多是很细的概念,比如正整数、化学元素、政治思想、职位。它们在总量里只占不到2%,不影响任何一条主结论,但把它们单列出来这件事本身是必要的。

分子分母来自同一批抽样

上一批在分母上翻过一次大车:分子从一个接口取、分母从另一个接口取,两个口径差了1.27到2.38倍,越南语因此被算成73.85%,真值只有47.43%。

所以这次从头到尾只有一批抽样。体裁那一列和后面那篇的出处那一列,用的是同一批240条里的同一批编号,任何一个占比的分子和分母都能追到同一次查询。

这条听起来像常识,但它在实际操作里特别容易破功,因为不同的接口给数据的粒度不一样,人总会忍不住去拿那个更全的。判据很简单:分子分母追不到同一次查询就别做除法。

本文所有百分比的分母都写在表头上,不写在正文里。读者要复核的时候,先看分母是240还是70,再看数字。

第一版数据为什么整表作废?

有一格高得不对劲

第一版30门跑完,表格里有一格特别扎眼:没有对应数据项的条目占比,波斯语63.3%、乌兹别克语61.7%、孟加拉语61.2%。小语种缺结构化标注这件事说得通,保哥当时的第一反应是这条正好印证了低资源语言的标注稀薄。

然后看到了英语那一行:59.6%。

英语的公共内容里,六成条目没有对应的结构化数据项,这在任何一个懂这套系统的人看来都不可能。一个能解释所有小语种的漂亮结论,被大语言那一行当场证伪。

这里有一条上一批固化下来的动作救了场:把最集中的那一格里的原始记录打二十条出来看,比多跑三个模型有用。

打开二十条看一眼

打出来的英语条目标题是这样几条:Dharma talks、ISight Camera、Arkansas Highway 7T、F5 Networks Inc、Liverpool Exchange station、Christopher Ernst Friedrich Weyse。

读了三条就明白了。Dharma talks对应的正文页叫Dharma talk,少一个复数s;F5 Networks Inc的正文页叫F5, Inc.;Christopher那条是把名字里的Christoph拼成了Christopher。这些全是重定向,不是条目。

重定向没有对应的数据项,因为需要标注的是它指向的那个页面,不是它自己。所以这一格量到的不是标注稀薄,是我把跳转页当成了内容。

逐条验了一遍:七条抽样全部返回重定向标志为真、数据项为空。英语随机编号空间里将近六成是重定向,这个比例本身合理,因为英语的重定向数量确实比条目数还多。

少写了一个参数

根因是接口参数写少了一个。取页面属性的时候只请求了属性这一项,而页面信息接口的文档写得很清楚,重定向这个标志属于页面信息,不属于页面属性。

于是返回结果里根本没有那个键,我写的判断分支永远走不到,重定向被原样留了下来。这个失败形态特别恶心的地方在于:接口返回200,字段齐全,链路一切正常,只有那一个键悄悄不在。

改法是一行:请求里把页面信息一起要过来。改完之后英语的无数据项从143条掉到0条,30门语言全部归位。

代价是抽样效率掉了一半多,因为要多抽一倍多的编号才能凑够240条有效样本,探测上限从4500提到20000,英语单门耗时从三分半涨到接近四分钟。这个代价必须付,因为省下的那三十秒会污染整张表。

上一批为什么没撞上

这件事最值得记的不是坑本身,是上一批为什么没事。

上一批的抽样条件里有一句:必须有对应的数据项才留作样本。当时加这句是为了后面判国别方便,属于顺手加严。而重定向恰好没有数据项,于是被这句话顺手挡掉了。

这次为了统计有多少条目没有数据项,我必须把这道过滤放开——过滤一放开,它原本顺带挡掉的东西就一起涌进来了。加严的时候是一个理由,挡掉的却是两件事,而只有一件事写在注释里。

由此固化一条判据:一个顺手加严的过滤条件被放开时,要重新验一遍它原本顺带挡掉了什么。这类过滤在数据管线里到处都是,而它们挡掉的东西通常没人记录。

这条判据可以直接拿去用

把这条翻译成做站的场景就很熟悉了。你的抓取脚本里有一句只要状态码200的过滤,它顺带挡掉了重定向、软404和那批返回200的错误页。有一天你为了统计错误页把这句去掉,报表立刻变成另一个样子。

同一族的还有:只要有标题的、只要长度大于500字节的、只要在站点地图里的。每一句都在挡两件以上的东西,而通常只有一件被记下来。

实操上有个成本很低的做法:任何一条过滤规则,写的时候在旁边记一行它挡掉了什么,能记几件记几件。三个月后改这段代码的人会感谢你。

另一个做法是每次改过滤条件都重跑一次总量对账。第一版跟第二版的样本总数是一样的240,但类型分布整个换了一遍——只看总数对不出来,得看分布。

三十门语言的体裁拆下来是什么样?

先把能成批生成的那一批分出去

上一批立过一条规矩:量任何这门语言写什么之前,先把名录型条目剔出去。物种、天体、行政区划、车站、年份、消歧义页,这些都能从一张表成批生成,留在分母里会把结论量成谁家的表格被导过一遍。

这次照做。名录型占比越南语83.3%、荷兰语71.7%、瑞典语65.8%、乌兹别克语61.7%、约鲁巴语53.3%,而最低的豪萨语21.7%、高棉语20.0%、僧伽罗语23.3%、泰语24.2%。

跟内容总量的相关系数是正0.509,秩相关正0.546。规模越大的语言,内容量里的水分越大——这条跟上一批算出来的方向一致。

越南语那83.3%值得单拎出来说一句:其中生物分类单元一档就占了整个样本的65.8%。一门语言的公共内容里三分之二是物种词条,这不是内容池,这是一本分类学手册。

跟上一批的数据对得上吗

这次是完全独立的第二次抽样:不同的截断点、不同的随机种子、不同的归类实现。两批各自算出来的名录型占比放在一起对了一遍。

10门语言的相关系数是正0.954,秩相关正0.939。越南语75.9对83.3、瑞典语67.7对65.8、荷兰语67.3对71.7、约鲁巴语49.1对53.3,高的那几门几乎逐个对上。

低值那几门系统性偏高9到15个点,原因是两批的归类实现不同:上一批列举名录类型,这一批爬属性链归根,后者把更多东西归进了聚居地和物种。绝对值不能跨批直接比,但排序和方向完全一致。

这一步花了不到二十分钟,换来的是整篇的可信度。一个只跑过一次的指标和一个被独立重跑过的指标,读者对它们的信任是两回事。

人写口径下的第一大类

剔掉名录型之后,30门语言里绝大多数的第一大类都是人物。这条倒是符合开工前的预期,也是这次唯一符合预期的体裁类结论。

人物占比的中位数落在34%附近。往上是约鲁巴语65.2%、豪萨语59.6%、波斯语51.5%、德语50.7%、波兰语50.0%、英语46.8%。

往下是缅甸语7.5%、高棉语13.5%、僧伽罗语14.1%、阿姆哈拉语15.6%、泰语22.5%、冰岛语25.6%、马其顿语26.5%。

最高和最低差8.7倍。这个跨度比内容总量本身的跨度还有意思,因为总量差几百倍是显然的,而形状差近九倍是没人事先告诉你的。

中间那一段的形状

把六档并排看,中间那一段的语言长得相当像:人物三成上下,概念与术语一成半到两成,作品一成上下,机构和事件各几个点。表里那一列条目总数全部取自各语言公共百科的同一份统计,同一时点取数,避免各查各的。

下面这张表挑了差异最大的几门,全部是人写口径,也就是剔掉名录型之后的占比。

语言条目总数人物概念与术语作品机构体裁均衡度
约鲁巴语3880265.2%9.8%8.9%3.6%0.50
豪萨语10685059.6%9.0%3.2%10.1%0.57
英语721843546.8%7.8%18.8%11.7%0.69
立陶宛语22641629.2%29.2%8.3%8.3%0.77
泰语18581722.5%20.3%11.0%18.1%0.83
缅甸语1115757.5%4.5%4.5%0.8%0.68

均衡度那一列是把人写口径下八个档位算了一个归一化的分散程度,1代表八档完全平均,0代表全部挤在一档。最均衡的是泰语0.83、冰岛语0.80、高棉语0.80,最不均衡的是约鲁巴语0.50。

写人的那一半,为什么小语种反而更少?

相关系数的方向跟预期反了

开工前保哥的预期写得很直白:小语种里人物传记占比会明显更高,因为写一个人门槛最低,一个村里的老师、一位地方歌手,只要有人认识就能写出三百字。

实测是反的。人物占比跟条目总量的相关系数是正0.448,秩相关正0.495——大语言的人物占比更高,不是更低。

更打脸的是最低的那一头:缅甸语7.5%、高棉语13.5%、僧伽罗语14.1%、阿姆哈拉语15.6%,四门全是这次样本里内容量最小的那一批。写人门槛最低这个直觉,在这四门语言上一点都没兑现。

相关系数只有0.448,说明这不是一条强规律,只能说方向被弄反了。真正有信息量的是最低那四门的共同点。

最低的那五门有什么共同点

把这几门的全样本分布拉出来看,缺的不是写人的意愿,是别的东西把位置占满了。缅甸语的样本里聚居地与行政区占34.6%,而且这一档打开看全是某某村某某镇区这样的条目名。

阿姆哈拉语更极端:时间单位这一档占21.2%,也就是纯年份和日期页。老挝语时间单位占16.7%。这两门语言的公共内容里,五分之一是一个个孤零零的年份页。

高棉语和僧伽罗语的位置被另一样东西占了——后面第七节会专门讲,就是那批连类型都判不出来的条目,两门各占一半左右。

所以最低那几门不是不写人,是分母里塞满了别的。把这几门语言的内容量当成竞争强度看,你以为在跟人比写作,实际在跟一张村庄名录比条数。

约鲁巴语和豪萨语是个例外吗

相关系数说大语言人物占比更高,可最高的两门恰恰是约鲁巴语65.2%和豪萨语59.6%,都是不折不扣的小语种,条目总数三万八和十万七。

打开这两门的人物条目看,形态非常一致:短,几乎全是一两句话。约鲁巴语条目的字节中位数是236,一句话都写不满。

这就把机制说清楚了。人物条目之所以能在这两门语言里占到六成,不是因为社群偏爱写人,是因为一句话就能构成一条人物条目,而一句话构不成一条品类条目。某某是尼日利亚的一位政治家,这句话本身就是完整的;汽车是一种交通工具,这句话谁看了都觉得没写完。

这条解释在非洲市场选语种那一篇里能对上:两门语言的内容量看着不小,能拿来做商业参照的部分极薄。

写人为什么是最先被写的那一类

体裁这件事背后是一条投入曲线。写一个人只需要知道这个人是谁、干过什么;写一个品类需要知道它有几种规格、怎么用、跟别的比差在哪。前者靠记忆,后者靠整理。

公共内容的写作者是志愿者,志愿投入天然偏向靠记忆能完成的那一类。这跟品类词缺口那一篇的结论是同一个机制的两面:那一篇发现最普通的词反而最晚有人写,这一篇发现最容易写的人物条目最先把位置占满。

商业投入的偏向正好相反,商业内容围着可测的搜索量转,人物那一档在电商语境里没有搜索量。两批人各写各的,中间那条品类和概念的带子就一直空着。

这个空带子对做独立站的人是好消息还是坏消息,取决于你打算怎么用它。当参照材料用是坏消息,因为没得参照;当竞争位置看是好消息,因为没人占。

这个解释能不能证伪

能。如果人物占比高真的只是因为一句话能成条,那么人物占比高的语言,它的条目字节中位数应该明显更低。

实测对上了:约鲁巴语字节中位数236、阿姆哈拉语332、老挝语891,这三门的条目短得离谱;而英语4827、孟加拉语7878、泰米尔语5019。

但对不上的地方也得说:豪萨语人物占比59.6%,条目却不算特别短。所以一句话能成条只解释了一部分,另一部分应该跟社群里谁在写有关,那一层在编辑人数那一篇里量过。

一条只能解释一半的机制,比一条能解释一切的机制可信。上一批就吃过这个亏:一个指标把所有数据都解释得服服帖帖,最后发现是它本身有问题。

品类和概念那一格,跟内容量有关系吗?

相关系数是零

概念与术语这一档,是做独立站的人真正能挂靠的那一格。它包含品类词、材料词、用法词、疾病名、技术名这些东西。

它跟内容总量的相关系数是负0.089,秩相关负0.108。又一个零。这已经是这条轴上第四次量出零了——上一批的本地题材占比跟总量是正0.100,上上批的译入率跟总量是正0.010。

零的意思很实在:你没法从内容量这一列推出概念这一格有多满,只能单独去量。这也正是这条轴一直在挖的东西——内容量能回答的问题比大家以为的少得多。

顺带把另一条也量了:体裁均衡度跟内容量的相关是负0.036,秩相关负0.123。大维基并不更均衡,这条预期也错了。

最高的三门不是你以为的那三门

概念与术语占比最高的三门是立陶宛语29.2%、马其顿语25.7%、爱沙尼亚语24.7%。往下是斯瓦希里语21.0%、阿塞拜疆语20.8%、尼泊尔语20.6%、荷兰语20.6%、泰语20.3%。

这个榜单跟任何一份按内容量排的表都不像。立陶宛语条目总数22万,在30门里排中游偏上,可它的概念那一格是全表第一。

成对样本更说明问题:爱沙尼亚语26万条概念占24.7%,立陶宛语22.6万条占29.2%,两门体量几乎一样、结论也一致;而波斯语108万条只有16.4%,德语314万条只有15.1%。体量差十倍,概念那一格反而更薄。

最低的一头是缅甸语4.5%、泰米尔语之外的英语7.8%、豪萨语9.0%、高棉语9.4%、约鲁巴语9.8%。英语出现在这一头,是这次最需要解释的一个数。

英语那一格为什么最薄

英语的概念与术语占比7.8%,在30门里排倒数第三。第一反应当然是这不可能——英语的品类内容显然比任何一门小语种都厚。

把英语那一格的原始记录打出来就懂了:Pecoraite是一种矿物、Ronifibrate是一种药物、10-hydroxytaxane O-acetyltransferase是一种酶、Desoxy是一类化合物。全是极专业的长尾学术词,一个日常品类词都没有。

不是英语缺品类词,是分母太大。英语721万条内容里,日常品类词那几千条在随机抽样里根本碰不到,被几十万条专业术语稀释成了背景噪声。

对照老挝语那一格:鼠标、橡皮、维生素B2、埃博拉、哲学。缅甸语那一格:汽车、F-16、奥林匹克国家公园。小语种的概念这一格里全是最基础的词,因为它们也只写到这一层。

占比是形状,不是数量

这里必须停一下,因为一个百分比在不同规模上不是同一件事。

算一遍绝对量:英语全样本口径下概念占5.0%,乘以721万条大约36万条;老挝语全样本13.8%,乘以5597条大约772条。占比差2.8倍,绝对量差466倍。

所以这张表能回答的是形状问题:这门语言的社群把力气花在哪一档上。它回答不了数量问题:这门语言有多少条概念内容可供参照。

两个口径必须一起报,少一个这张表就会被拿去支持相反的决定。只报占比会得出老挝语的概念内容比英语还厚,只报绝对量会得出小语种一无所有——两个结论都是错的。

两个口径要一起报

实际用法是这样:先看绝对量决定这门语言值不值得当参照源,再看占比决定你的内容该往哪一档挤。

绝对量大的语言,你能从它那里抄到品类结构、属性名、常见问法;绝对量小但占比高的语言,说明这门语言的社群确实在往概念这一档写,只是量还没上来,你进去是跟一群认真的人做邻居而不是跟一台机器抢位置。

绝对量小且占比也低的那几门,比如缅甸语4.5%乘以11万条约5000条,说明这门语言的公共内容基本不覆盖概念层。这时候你写的每一条品类内容都没有本地参照,得从头做原始调研。

这一层跟按成本排语言优先级那一篇能接上:那一篇算的是每门语言要花多少钱,这一篇告诉你这笔钱里有多少要花在没有参照的从零调研上。

机器连这是个什么都不知道,占多少?

这一格是怎么冒出来的

修完重定向那个坑之后,剩下的没有数据项的条目就是真的没有了。同时还有另一批:有数据项,但数据项上没填类型属性。两者合起来是同一件事——机器不知道这条内容属于哪一类。

这一格本来只是个残差项,是那种放在表格最右边、写完就没人再看的列。第一次注意到它,是因为把它跟内容总量做了个相关,出来的数把整张表里别的相关系数都比下去了。

相关系数负0.629,秩相关负0.757。这是本批30门语言、十几个指标里相关性最强的一条,比人物占比的0.448、名录型占比的0.509都强得多。

换句话说:一门语言的内容里有多大一块机器认不出类型,几乎可以从它的内容量直接推出来。而这条推得动的规律,恰好在体裁这张表上是残差项。

三十门语言排下来

最高的是高棉语50.8%、缅甸语44.6%、阿姆哈拉语42.9%、僧伽罗语41.2%。这四门里,机器判不出类型的条目占了整个抽样的四成到五成。

往下断崖式下跌:老挝语17.9%、斯瓦希里语13.8%、冰岛语13.3%、尼泊尔语12.5%、泰米尔语12.5%、乌兹别克语12.1%。

最低的一头是越南语1.2%、瑞典语1.7%、荷兰语2.5%、波兰语3.3%、约鲁巴语3.8%、英语4.2%、德语4.2%。

高棉语和越南语差42倍。两门都是东南亚语言,条目总数差107倍,而这一格差了42倍——这条比内容量本身更能说明两个内容池的差距。

打开看是些什么东西

缅甸语这一格里没有数据项的那67条,全部是某某村加某某镇区的格式。它们是真条目不是重定向,有正文有分类,只是从来没有人在结构化那一侧给它们建过对应的数据项。

另一半是有数据项但没填类型的。这一类更微妙:有人建了数据项,把这个条目跟别的语言的对应条目连了起来,但没有人回答过这是什么这个问题。

高棉语50.8%里的大部分属于后一种。这意味着有人做了跨语言对齐这件相对费事的工作,却没做填一个类型这件几乎不费事的工作。

保哥觉得这个顺序本身就是个信号。跨语言对齐通常是工具自动做的,填类型需要一个人判断这条内容讲的是什么。机器能做的那一半做完了,需要人判断的那一半没做。

这是本批相关性最强的一条

为什么这一格跟内容量的关系比什么都强?因为它量的不是写作,是整理。

写一条内容需要一个懂这门语言的人;给一条内容标类型需要一个懂这套结构化系统的人。后者的人数比前者少得多,而且不随内容量线性增长。内容量小的语言,社群里往往一个这样的人都没有。

这条也解释了为什么它比人物占比更规律。人物占比受社群偏好影响,而社群偏好是文化的,各门语言各不相同;标类型这件事没有文化差异,纯粹看有没有人干。

值得一提的是相关的方向:内容越多这一格越小。所以它不是内容量的副产品,更像是同一件事的另一个侧面——一个内容池的成熟度,写了多少是一个读数,整理了多少是另一个读数,后者更难伪造。

这件事跟结构化数据是同一个动作

做SEO的人对这件事其实很熟,只是换了个场景。你在自己的页面上标一段结构化数据,告诉搜索引擎这是一篇文章、这是一个产品、这是一个组织,做的正是同一个动作:告诉机器这一页是什么类型

差别只在于,你的站上这件事是你自己做的,而一门语言的公共内容池里这件事得有人替所有条目做。没人做的结果是,这门语言的内容对机器来说是一片没有标签的文本。

这在生成式搜索的语境里后果很直接。模型要把一条内容放进答案里,先得判断它讲的是不是问题问的那类东西;类型标注缺失的内容,只能靠正文本身去猜,猜错的概率明显更高。

本站的小语种结构化数据那一篇讲的是你自己页面上该怎么标,这一节讲的是你所在的那个语言环境整体标到什么程度。前者你能控制,后者决定你标了之后有没有对照物。

这张表怎么改你的选题清单?

三档判读线

把三个数合起来读,能给出一条能直接用的分档:人物占比、概念占比、机器不认率。

第一档,人物占比低于35%且概念占比高于20%。这门语言的公共内容确实在往概念层写,你能拿到品类结构和常见问法的参照。立陶宛语、爱沙尼亚语、泰语、马其顿语落在这一档。

第二档,人物占比高于50%。这门语言的内容量主要由人物条目撑起来,做品类内容基本没有本地参照,但也几乎没有竞争。约鲁巴语、豪萨语、波斯语、德语、波兰语落在这一档。

第三档,机器不认率高于30%。这一档最需要单独对待,因为它的问题不在内容多少,在这些内容机器读不明白。高棉语、缅甸语、阿姆哈拉语、僧伽罗语落在这一档。

人物占比高的市场先做什么

第二档市场的第一个动作不是写内容,是先确认一遍你的品类词在这门语言里到底怎么说。因为没有本地概念内容,你连一个可以对照的说法都拿不到。

这时候母语审校那一篇里的验收动作要提前用,不能等内容写完再审。词表定错了,后面所有内容都跟着错。

第二个动作是把品类页做厚。这一档市场里没人写过品类内容,一篇写全了的品类页在很长时间里没有对手。这种位置不常见,遇到了别只发五百字。

第三个动作是别指望内链密度。这门语言里没有可以链过去的概念页,你的站内链结构得自己从头搭一套。

概念那一格薄的市场怎么切

概念占比低于10%的那几门,实操上要把预算结构改一改:调研的比重要往上提,写作的比重相对下调。

原因是没有参照材料的时候,写作本身不慢,慢的是确认。一个属性叫什么、一种规格本地怎么表述、一个用法本地人认不认,这些在有参照的语言里查十分钟,在没参照的语言里得问人。

保哥的经验值是这样:有参照的市场,调研跟写作的时间大概三七开;没参照的市场,六四开都算顺利。把这个比例提前写进排期,比事后解释为什么延期有用得多。

另一件事是把调研成果沉淀成内部词表。这一档市场每查清一个词都是一次性成本,查完不记下来,下一篇还得再查一遍。

机器不认率高的市场要加一步

第三档市场要多做一件事:自己页面上的结构化标注要比别的市场做得更全、更早。

逻辑是这样:整个语言环境里类型标注是缺的,那么你的页面一旦标全,在机器眼里就是这门语言里少数几个能直接判断类型的对象。在一个没人标的环境里标全,收益比在一个人人都标的环境里标全高。

具体做什么并不复杂:产品页标产品、文章页标文章、公司信息标组织、面包屑标层级。这几样在任何一个电商系统里都是现成的,问题只在于小语种站点上线时经常被跳过。

顺带说一句,这一档市场的内容也别指望能靠机器读懂。你要做本地竞品调研的时候,任何依赖类型筛选的工具在这几门语言上都会漏掉一半。

排期上怎么占位

三档市场的排期节奏不一样。第一档能按常规节奏走,因为参照材料齐;第二档要在前面加两周的词表确认;第三档除了词表确认还要加一轮结构化标注的开发排期。

如果同时做多个市场,最忌讳的是按同一个模板同时启动。三档市场用同一个甘特图,最后延期的一定是第三档,而延期的原因会被写成本地团队响应慢。

还有个排序上的建议:先做第一档拿到经验,再做第二档,最后做第三档。第一档市场做出来的品类页结构,在第二档市场能直接复用;第二档的词表确认流程,在第三档能直接复用。

反过来先啃最难的那一档,通常的结果是把整个多语言项目拖成一个所有人都不愿意接手的摊子。

半天能跑完的最小版本长什么样?

三十条就够

不需要240条。要判读一门语言落在哪一档,随机抽30条逐个打开看一眼就够了,因为三档之间的差距大到20个百分点以上,30条的误差撑不破这个间距。

操作也简单:打开那门语言的公共百科,连点30次随机页面,每次记一个字母——人物记P,地方记L,机构记O,作品记W,事件记E,概念记C,看不懂或者一句话说不清的记X。

三十条记完数一下。P超过15条落第二档,C超过6条落第一档,X超过9条落第三档。整个过程二十分钟,比任何一份市场报告都快。

记X那一档特别关键,别嫌它不精确。你作为一个不懂这门语言的人判不出类型,跟机器判不出类型,成因高度重合:都是因为这条内容没提供足够的类型线索。

不用爬属性链的简化做法

如果想稍微正式一点,又不想写爬属性链的代码,有个折中办法:只判五档,而且只看条目开头那句话。

公共百科的条目第一句几乎都是某某是某某这种句式,把是后面那个词翻译一下就知道类型。这一步用任何一个翻译工具都能做,不需要懂那门语言。

这个做法的误差在哪:一句话里同时出现两个类型词的时候会判错,比如某某是一位画家创办的美术馆。实测下来这类情况在10%左右,不影响分档。

还有一种更省事的:直接用数据项那一侧的类型属性,不爬父级,只统计取值本身。这样会得到一堆很细的类别,但只要你关心的是有没有类型这件事,细不细都不影响。

加一列会更准

手上有余力的话,加一列条目字节数。这一列几乎不花成本,却能把两个不同的一档分开。

因为人物占比高有两种成因:一种是社群真的在认真写人物,条目又长又全;另一种是一句话成条,人物只是最容易凑数的那一档。字节中位数一列出来,两者立刻分开。

参考值:这次30门语言的条目字节中位数,最低是约鲁巴语236、阿姆哈拉语332、老挝语891,最高是孟加拉语7878、泰米尔语5019、英语4827。低于1000基本就是一句话条目为主。

再加一列的话就是下一篇要讲的出处密度,那一列回答的是这些内容底下垫没垫东西,跟本篇的形状那一列正好凑成一对。

多久重算一次

体裁分布变得很慢,一年重算一次足够。它反映的是社群的写作偏好,而偏好通常以年为单位变化。

机器不认率那一列变得快一些,因为它受工具影响:某个批量标注工具在某门语言上跑一轮,这个数能一下降十几个点。做第三档市场决策之前建议现算一次,别用一年前的数。

还有一种情况必须重算:这门语言的公共内容池里出现了一次批量导入。这件事在名录型占比那一列上会突然跳一个台阶,而它会把体裁分布整个搅一遍。

识别方法在编辑人数那一篇里写过:单月新建量跳一个数量级而人数没跟着动,就是被灌过了。

哪些相邻的问题不归这一层管?

内容质量不归这一层

体裁只回答形状,不回答好坏。一门语言人物占比高,不代表它的人物条目写得差;概念占比高,也不代表它的概念条目就靠谱。

质量那一层要另外量,而且量法完全不同——本站在机器翻译直接发布那一篇里讨论过质量线该画在哪,那套判据跟体裁没有交集。

把两者混着用会得出很奇怪的结论,比如认为人物占比高的语言内容质量差。实际上这次样本里写得最认真的几条恰恰是人物传记。

唯一能连起来的一点是:体裁分布极度不均衡的语言,通常整体投入也偏低。但这是相关不是因果,别拿去当质量代理。

写的是哪儿的事那半边已经写过

地理成分那一列在上一篇量完了,本地题材占比从乌兹别克语4.3%到泰米尔语68.6%,中位数27%。那一列跟本篇这一列是正交的两个维度。

要一起用的话,最有价值的组合是本地题材占比高加概念占比高:这门语言的社群在用自己的语言写自己身边的东西,而且写的是概念不是人物。这种组合在这次数据里不多。

另一个值得注意的组合是本地题材高加人物高:说明这门语言在写本地的历史人物,属于文化保存型的内容池。做生意的人从这种内容池里拿不到什么,做品牌故事的人反而能。

两列一起看的具体方法在上一篇的落地节里写过,这里不重复。

谁写的、从哪儿来的那半边也写过

内容是谁写的在编辑人数那一篇,内容是不是搬来的在译入率那一篇。这两列跟体裁的关系这次也顺手量了一下。

译入率跟人物占比、跟概念占比都看不出稳定关系。这条其实符合直觉:翻译工具不挑体裁,它把源语言里有什么就搬什么过来。

值得记一句的是翻译痕迹那一篇的结论在这里依然成立:正文层量不出来的东西,壳上能看出来。类型标注就属于壳的那一层。

四列合起来是一套完整的内容池画像:有多少、谁写的、写的是哪儿的、写的是什么形状的。再加下一篇的底下垫没垫东西,就齐了。

百科数据代替不了商业调研

最后这条得说三遍。公共百科反映的是无偿投入的偏好,你的目标客户在电商站上搜什么、在本地论坛上问什么,是另一套完全不同的数据。

本篇这套数能干的事只有一件:在你还没有任何本地资源的时候,快速判断这门语言的公共内容能不能当参照物用。能,就省一大笔调研费;不能,就把这笔钱提前排进预算。

不能干的事包括:估搜索量、判竞争强度、选品、定价。这几件每一件都有专门的做法,硬拿体裁分布去套只会得到听起来很顺但站不住的结论。

上一批的教训还热着:第一版算出来的参照国排名,每一条都能编出一套很顺的解释,打开条目一看全是机器导进来的名录。能编出解释这件事,从来不是结论成立的证据。

常见问题解答

公共百科上的体裁分布,能代表这门语言的整个互联网吗?

不能,而且差得很远。公共百科反映的是无偿投入的偏好,商业站的内容分布跟它几乎没有可比性。这套数据唯一能代表的是:这门语言的社群在没人给钱的时候愿意写什么。把它当参照物可得性的探针用是合适的,当市场画像用就错了。

为什么不直接数各个分类下有多少条目,那样不是更简单?

因为分类树本身是人整理的,遍历它等于把整理者的偏好一起抽进来。更实际的问题是各门语言的分类树深浅完全不同,小语种的分类往往只有一两层,大量条目根本没归进任何分类。在页面编号空间里随机抽,抽到的是页面本身,跟有没有人整理过无关。

机器判不出类型的那一格里,会不会大部分其实是很小众的东西?

不是。打开缅甸语那67条看,全是某某村加某某镇区这种格式,是标准的行政地名,一点都不小众。高棉语那一半更明显,大多是有数据项、跨语言也连上了,就是没人填过类型。这一格量的不是内容有多冷门,是有没有人做过整理这个动作。

人物占比高到底是好事还是坏事?

要看你拿它干什么。当参照材料用是坏事,因为你要的品类结构和属性名在人物条目里一个都没有;当竞争位置看是好事,因为品类这一格空着没人占。实操上建议这样处理:人物占比高的市场,把调研预算提上去、把内容深度做厚,两件事一起做才吃得到那个空位。

第一版把重定向当成条目那个错,会不会还有别的地方也踩了?

同族的风险确实存在,所以这次每个占比都把分母写进了表头,方便逐条复核。更通用的做法是:任何一条过滤规则,在旁边记一行它挡掉了什么。第一版那个错的根源不是写错了参数,是加过滤的时候只记住了一个理由,而那句话实际挡掉了两件事。

三十条的最小版本,误差能有多大?

30条样本下,一个真实占比40%的类别,测出来大概率落在30%到50%之间。这个精度不足以支撑两门语言之间的细微对比,但足以分档,因为三档之间的间距在20个百分点以上。要做语言之间的排序就得把样本量提到200条以上。

这套方法能不能用在自己的品类上,而不是整个语言?

能,而且更好用。把随机抽样换成按品类关键词检索,量同一批指标:这门语言里跟你品类相关的内容,有多少是人物、有多少是概念、有多少连类型都没标。样本会小很多,但因为限定了品类,结论直接可用。唯一要注意的是检索出来的结果带排序偏好,不再是随机样本,所以只能横向比语言、不能纵向比品类。

权威参考资料

分享到
标签
版权声明

本文标题:《小语种内容体裁拆开看:人物近一半,品类词那格跟内容量无关》

本文链接:https://zhangwenbao.com/minor-language-content-genre-composition.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交