小语种内容的参考资料栏,约鲁巴语八成条目有,里面一条都没有
本文目录
- 你引用的那条小语种资料,底下垫着什么?
- 这个动作每个做多语言的人都做过
- 为什么这件事在生成式搜索之后更要紧
- 出处这件事跟内容质量不是一回事
- 本文量什么、不量什么
- 出处这件事怎么在外面量出来?
- 数的是原始文本不是渲染结果
- 抽样跟上一篇完全一致
- 参考栏这个东西不能认模板名
- 三个指标各回答什么
- 三十门语言的带出处率排出来是什么样?
- 两头的跨度是64倍
- 阿姆哈拉语那唯一一条是什么
- 相关系数这次对了
- 下面这张表把三个数放在一起
- 参考资料栏在,栏里为什么是空的?
- 约鲁巴语那一格
- 这是格式学会了动作没做
- 三十门语言的空栏排名
- 空栏这个数怎么用
- 同一个国家的两门语言,为什么差这么远?
- 豪萨语和约鲁巴语摆在一起
- 这条跟别的批次对得上
- 做非洲市场的人该怎么用这一条
- 成对样本比相关系数好用
- 名录型条目是不是真的没有出处?
- 这条预期错得最厉害
- 为什么物种条目引用最全
- 那这个指标还能用吗
- 剩下几档的排名
- 出处密度这个数,为什么不能单独排名?
- 密度榜首是瑞典语
- 这跟别的批次的结论合上了
- 密度这把尺子的正确用法
- 还有一个更朴素的替代指标
- 没人标类型的东西,是不是底下也没垫东西?
- 两条腿在这里合上
- 因为它们是同一个动作的两面
- 对做站的人意味着什么
- 这条能不能证伪
- 这一条怎么改你的内容核查流程?
- 三档核查强度
- 哪几类内容必须走最严的那一档
- 本地资料查不到出处的时候找谁
- 自己站上该反过来做什么
- 自己跑一遍要准备什么?
- 最小版本二十分钟
- 想更准就取原始文本
- 加一列会更有用
- 常见问题解答
- 公共百科的出处密度,能代表这门语言里所有资料的可靠程度吗?
- 为什么不直接看页面底部有没有参考文献列表,那样不是更快?
- 阿姆哈拉语只有1.4%,这个数是不是采集出问题了?
- 名录型条目的出处是自动带来的,那这个指标还有意义吗?
- 出处密度和带出处率不一致的时候,该信哪个?
- 知道了这个数,具体能省下什么?
- 这套方法能不能用在自己的品类上?
- 权威参考资料
摘要:30门语言各抽70条公共内容,逐条数底下有没有可核查的出处。带出处的比例从阿姆哈拉语的1.4%排到英语的90.0%,老挝语14.3%、约鲁巴语15.7%。约鲁巴语更极端的是另一个数:78.6%的条目有参考资料栏,而栏里一条出处都没有,空栏占有栏的87.3%。最硬的对照来自同一个国家的两门语言——尼日利亚的豪萨语带出处67.1%、空栏2.9%,约鲁巴语15.7%、空栏68.6%。
你引用的那条小语种资料,底下垫着什么?
这个动作每个做多语言的人都做过
要写一篇某个小语种市场的内容,第一步通常是去查这门语言里已有的资料。查到一条,读一遍,觉得说得挺清楚,就顺手当成事实用了。
这件事的隐蔽之处在于,出错的那一刻你毫无感觉。一条没有出处的资料读起来跟一条挂着二十个引用的资料没有任何差别,中文读者甚至看不出那门语言的页面上少了一列东西。
这一步在英语环境里风险不大,因为英语资料底下通常挂着一串出处,你不放心可以顺着点进去看。换到小语种,很多人不会去点——一来看不懂,二来默认它跟英语版一样有。
保哥自己踩过一次。当时照着一条本地资料写了某个市场的退货规定,发出去之后被本地同事指出来那个说法早就改了。回头去看那条资料,底下什么都没有,只有一个标着参考资料的空栏。
这一篇就量这件事:30门语言的公共内容里,有多少条底下真的垫着可核查的东西。用的是跟上一篇体裁那一列完全同一批抽样的同一批条目,两列可以逐行对着看。
为什么这件事在生成式搜索之后更要紧
以前这是个人工核查的问题:你信不信一条资料,取决于你愿不愿意花时间去点那几个链接。现在多了一层,因为模型也在读同一批内容。
还有一个方向的影响也值得记:你自己的内容如果挂了出处,在一个普遍没有出处的语言环境里就显得格外突出。这是本篇最后一节要展开的那件事,先在这儿留个引子。
模型读一条内容的时候,不会区分它底下有没有出处。一条有二十个引用的条目和一条一句话加空参考栏的条目,在训练语料里长得一样重。
这条线的底子在多语言模型铺到七十多种语言那一篇里就埋下了:模型在小语种上的表现主要靠跨语言迁移,而迁移过来的不只是语法,还有那门语言语料本身的样子。语料底下没垫东西,迁移过来的也就是一片没垫东西的说法。
要说清楚的是,模型给出答案时挂的是哪门语言的来源,跟这门语言里的内容自己引了谁,是两个不同的问题。前一个问的是检索侧,后一个问的是供给侧。本篇只做后一个,因为它不依赖任何一家产品当时的行为。
出处这件事跟内容质量不是一回事
得先把话说清楚:一条内容有出处不代表它写得对,没出处也不代表它写错了。出处只回答一件事——这条内容能不能被第三方核查。
公共百科自己把这件事写成了核心方针,官方的说法是可供查证优先于真实性:读者要能追到出处,而不是要求写的人保证自己说得对。
这条方针在英语版执行得相当到位,在别的语言版本执行到什么程度,就是本篇要量的东西。同一套规则,30门语言的落实程度差了64倍。
顺带说一句,这跟母语审校验收那一篇里讲的读着自然不能当验收判据是同一族的道理:读着可信和能被核查,是两个不同的东西。
本文量什么、不量什么
量三样:一条内容里有几个脚注引用、有没有一个专门放出处的区块、这个区块里是不是空的。三样都从截断时点的原始文本里数,不看渲染结果。
另外要说清楚的是时间口径。所有数字取的都是2022年12月31日那一版的内容,不是今天的状态。这么做是为了让这批数跟上一篇的抽样落在同一个时点上,代价是它反映不了这之后几个月的变化。
不量出处本身的质量。一条引用挂的是政府公报还是某个博客,这次不区分。这一层只回答有没有,不回答好不好。
也不量商业站。这批数据来自公共百科,它反映的是这门语言的社群在无偿状态下的引用习惯。商业站的引用密度是另一回事,而且通常更低。
还有一件事这次特意不做:不按出处密度给语言打分。原因在第七节——这把尺子在被机器灌过的语言上会给出最好看的分数,单独拿去排名会排出反的顺序。
出处这件事怎么在外面量出来?
数的是原始文本不是渲染结果
公共百科的每条内容底下都有一份可以直接取到的原始文本,脚注在里面是一个成对的标签,长什么样在脚注的官方帮助页上写得很清楚。
还有一个副作用是省了大量流量。原始文本通常只有渲染页面的十分之一大小,三十门语言两千一百次请求下来,总量还不到抓一遍首页的开销。
为什么不数渲染出来的页面?因为渲染会把模板展开,一个引用可能变成好几个节点,也可能因为模板出错整个消失。原始文本里一个引用就是一个标签,数起来干净。
更实际的原因是可截断。要让这批数据坐在2022年12月31日这个时点上,必须取那一天那一版的文本,而渲染结果只有当前版本。
取历史版本这一步是整套采集里最贵的:多个页面加上时间参数会被接口直接拒掉,只能一页一次。30门语言每门70条,两千一百次请求跑了不到二十分钟,但这个上限决定了子样本只能取70条而不是240条。
抽样跟上一篇完全一致
体裁那一列抽了240条,出处这一列取的是其中的前70条。所以两列的样本是嵌套的,任何一门语言的出处数据都能直接对到它的体裁数据上。
为什么不把出处这一列也做满240条?因为取历史版本只能一页一次,240条乘30门是七千二百次请求,时间成本翻三倍而结论一个字都不会变。把省下来的时间花在原文复核上,收益高得多。
这件事的好处在第八节会体现出来:能直接算出各体裁的带出处率,而不用另外抽一批样本再去对齐。
抽样方法沿用上一批:在页面编号的整数空间里随机取,用创建日志的75分位当截断水位,再抽45条逐页复核代理误差。30门语言的越界数全部是0。
70条这个样本量决定了能说到多细。一个真实占比50%的指标,70条样本的误差大约在正负12个百分点,所以本篇所有对比都压在差距20个百分点以上的地方。
参考栏这个东西不能认模板名
第一版直接搜了参考栏最常见的那个模板名,越南语测出来2.9%——而同一批条目里87.1%有脚注引用。一门语言九成条目有引用、却只有百分之三有参考栏,这显然不成立。
打开一看,越南语用的是本地化的模板名,我搜的那个拉丁写法在越南语版里根本不存在。这是这批数据里第二把失效的尺子,而且它失效的方式是安静地给出一个假零。
改法是不认模板名:只看文末那个区块标题下面有没有正文。如果一个区块底下除了一个模板调用之外几乎什么都没有,那它就是一个参考栏的壳,管它叫什么名字。
改完之后越南语94.3%、英语77.1%、约鲁巴语78.6%,数值才互相说得通。由此固化一条:任何跨语言的存在性检测,都不能认某一门语言的模板名。
三个指标各回答什么
带出处率回答的是:随机翻开一条,底下有东西的概率。这个数最直接,也是本篇的主指标。
三个数里最容易被误用的是密度,因为它看起来最专业。汇报的时候如果只能给一个数,给带出处率;如果能给两个,第二个给空参考栏率,别给密度。
出处密度回答的是:有出处的那些条目,出处密不密。它用每千字节几个引用来算,好处是跟条目长短无关,坏处在第七节。
空参考栏率回答的是:格式做了、动作没做的比例。这个数是本篇最有画面感的一个,因为它量的是一种很具体的形态——栏在,里面什么都没有。
三个数要一起看。带出处率低有两种可能:一种是这门语言压根没有引用的习惯,另一种是有习惯但没执行。空参考栏率一出来,两者立刻分开。
三十门语言的带出处率排出来是什么样?
两头的跨度是64倍
最高的一头:英语90.0%、越南语87.1%、孟加拉语80.0%、瑞典语77.1%、缅甸语75.7%、泰米尔语74.3%、尼泊尔语70.0%。
还有一件事从这张排名里看不出来:低的那一头并不都是同一种低法。有的是压根没有引用的习惯,有的是有习惯但没执行,后面第四节的空参考栏率专门把这两者分开。
最低的一头:阿姆哈拉语1.4%、老挝语14.3%、约鲁巴语15.7%、冰岛语22.9%、高棉语27.1%、僧伽罗语31.4%、阿尔巴尼亚语32.9%。
中位数落在50%附近,也就是随机翻开一条,有一半的概率底下什么都没有。这个中位数比开工前的预期低得多,保哥当时写的是小语种大概在30%到50%之间,实测最低那一头直接掉到个位数。
阿姆哈拉语那1.4%的意思是:70条抽样里只有1条带出处。这个数低到得单独验一遍才敢用。
阿姆哈拉语那唯一一条是什么
打开看了。那一条叫淋巴丝虫病,一篇医学词条,4843字节,挂着22条引用。
顺带说一句为什么是医学词条。这一类内容在任何语言里都是被翻译得最勤的一档,因为背后有公共卫生机构在推。所以那22条引用大概率不是本地社群加的,是从别的语言版本一起搬过来的。
而阿姆哈拉语这70条的字节中位数是332。也就是说除了这一条之外,其余69条基本都是三百来字节的短条,一句话到两句话的规模。
这就把结论的性质改了。原来的说法是这门语言的人不写引用,实测的说法应该是:这门语言的内容里,只有个别条目被认真写过,而被认真写过的那一条引用给得非常足。
两个说法的落地动作完全不同。前者意味着这门语言的资料整体不可信;后者意味着你能不能用这门语言的资料,取决于你碰到的是不是那少数几条。而随机碰到的概率是七十分之一。
相关系数这次对了
带出处率跟条目总量的相关系数是正0.658,秩相关正0.593。这是本批唯一一条方向猜对的预期——内容量大的语言,引用规范执行得确实更到位。
顺带把内容池的另外几列也对了一遍:跟名录型占比的相关是正0.255,跟机器判不出类型的比例是负0.392。这两条都不强,但方向都有解释,后面两节各展开一次。
说唯一不是自谦。这一批一共写了12条开工前的预期,最后错了9条。这一条能对,是因为它背后的机制最简单:写的人多,里面就有更多懂规矩的人。
但0.658也不算强,意味着还有大约一半的差异要靠别的东西解释。那个别的东西在下一节。
顺带把两条预期的相关也算了:跟译入率的相关只有正0.285,弱到不能用。翻译工具会不会把源语言的引用带过来,这条假设没被数据支持。
下面这张表把三个数放在一起
挑了跨度最大的几门,全部是70条子样本、截断2022年12月31日。条目总数那一列跟上一篇同源,取自各语言公共百科的同一份统计。
| 语言 | 条目总数 | 带出处 | 出处中位数 | 有参考栏 | 栏里是空的 |
|---|---|---|---|---|---|
| 英语 | 7218435 | 90.0% | 4 | 77.1% | 2.9% |
| 越南语 | 1304103 | 87.1% | 1 | 94.3% | 8.6% |
| 缅甸语 | 111575 | 75.7% | 1 | 47.1% | 12.9% |
| 豪萨语 | 106850 | 67.1% | 1 | 42.9% | 2.9% |
| 乌兹别克语 | 353367 | 44.3% | 0 | 68.6% | 34.3% |
| 斯瓦希里语 | 121657 | 34.3% | 0 | 65.7% | 32.9% |
| 约鲁巴语 | 38802 | 15.7% | 0 | 78.6% | 68.6% |
| 老挝语 | 5597 | 14.3% | 0 | 21.4% | 10.0% |
| 阿姆哈拉语 | 15708 | 1.4% | 0 | 7.1% | 5.7% |
出处中位数那一列有十几门语言是0,意思很朴素:随机翻开一条,最可能的情况是一条引用都没有。
参考资料栏在,栏里为什么是空的?
约鲁巴语那一格
约鲁巴语70条里有55条带参考栏,而带出处的只有11条。48条是有栏没内容,占有栏条目的87.3%。这是全表最极端的一格,也是这次数据里最有画面感的一个发现。
三条打开之前保哥其实做了个预判:以为会看到那种正文很长、只是没人补引用的条目。结果三条的正文加起来还不到一千字节,这个预判错得挺彻底。
按纪律打开了三条原文看,形态完全一样。第一条讲北非,437字节,正文是一个地图模板加一张国家列表,然后一个标着参考资料的小节,小节里只有一个模板调用。
第二条讲铊,313字节,正文就一句话:铊是化学元素,符号Tl,原子序数81。然后同样一个空的参考资料小节。
第三条讲一个地方政府辖区,285字节,正文两句,一句说它在哪个州,一句说首府是哪儿,中间还留着一行写着村庄列表的空标题。然后还是那个空参考栏。
这是格式学会了动作没做
这三条的共同点不是内容少,是内容少却把格式摆得很齐。有分类链接、有信息框模板、有分节标题、有参考资料栏,唯独没有那件真正费事的事。
换个角度看,这也说明模板这套东西的传播效率有多高。一个参考栏模板能在几年里铺满一门语言的大半条目,而给这些条目逐条补出处的工作量,是几万个人时。
保哥觉得这个形态特别值得记,因为它在别的地方也能见到。一个页面上标题层级、结构化数据、面包屑全齐,正文两百字;一份产品页把参数表列得整整齐齐,每一格填的是待补充。
格式是可以复制的,动作不能。一个模板被复制一千次的成本几乎是零,而给一千个条目各找一条出处的成本是一千次。
所以空参考栏率量的其实不是引用习惯,是模板扩散速度和人工投入之间的差额。这个差额越大,这门语言的内容看起来越正规、底子越空。
三十门语言的空栏排名
约鲁巴语68.6%之后是乌兹别克语34.3%、斯瓦希里语32.9%、阿尔巴尼亚语28.6%、尼泊尔语18.6%、格鲁吉亚语17.1%、阿塞拜疆语17.1%、波斯语14.3%。
英语那2.9%也值得说一句:英语版有专门的机器人在巡查空的参考栏并挂上提示模板,所以那个低数字里有一部分是被清理出来的,不完全是自然状态。
最低的一头是德语和荷兰语0.0%、冰岛语1.4%、英语2.9%、豪萨语2.9%、僧伽罗语2.9%、瑞典语2.9%、泰米尔语4.3%。
把空栏占有栏的比例也算了:约鲁巴语87.3%、阿姆哈拉语80.0%、乌兹别克语和斯瓦希里语各50.0%、阿尔巴尼亚语48.8%、老挝语46.7%。这一列超过40%就说明模板铺得比人跑得快。
荷兰语那个0.0%有个特殊原因:荷兰语版几乎不用独立的参考小节,有参考栏的只有1条。所以它的0.0%不是执行得好,是这个形态在那门语言里不流行——分母只有1的比例不能拿去比较,这一条必须写出来。
空栏这个数怎么用
实操上它是一个很好的先看一眼的指标,因为它比带出处率更容易解释给不懂技术的人听。
带出处率50%听起来像个中等成绩;空栏占有栏的比例50%听起来就完全不一样了,它的意思是这门语言里每两个摆出引用架势的条目就有一个是空架子。
判读线可以定得很粗:空栏占有栏低于10%,这门语言的资料可以按常规核查流程走;10%到40%要逐条点开看;超过40%就默认没有出处,把核查成本按从零调研排。
还有一个用法是识别工具痕迹。空栏率突然很高,往往说明有人用工具批量建过条目,而工具会把模板一起复制。这跟编辑人数那一篇里的灌注识别是同一族信号。
同一个国家的两门语言,为什么差这么远?
豪萨语和约鲁巴语摆在一起
这次数据里最干净的一组对照来自尼日利亚。豪萨语和约鲁巴语都是这个国家的主要语言,使用者都以千万计,做非洲市场绕不开这两门。
顺带排除一个常见的解释:这不是宗教或者殖民历史造成的书面传统差异。两门语言的书面标准都是十九世纪定的,用的都是拉丁字母,起点上没有系统性差别。
两门语言的数摆出来是这样:条目总数10.7万对3.9万,带出处67.1%对15.7%,空参考栏2.9%对68.6%。带出处率差4.3倍,空栏率差24倍。
而体裁那一列反过来:人物占比约鲁巴语65.2%比豪萨语59.6%还高一点。所以这不是一门语言写得多另一门写得少的问题,两门写的东西形状差不多。
差的是底下垫没垫。同一个国家、同一个时期、同一套规则,一门执行了,一门只把格式抄了过去。
这条跟别的批次对得上
这个差异不是孤证。编辑人数那一篇量过十年趋势:豪萨语的编辑活动涨了254%,约鲁巴语跌了58%,两门语言的方向完全相反。
体裁那一篇也对得上:约鲁巴语的条目字节中位数是236,全表最低,比阿姆哈拉语的332还短。一句话的条目配一个空参考栏,正好是本节那三个原文样本的形态。
还有更早的一条:页面阅读中位数那一篇把约鲁巴语整门剔了出去,因为它的热门榜前十二名全是单个拉丁字母的页面。
四个批次、四套完全不同的采集方法,指向同一个结论:约鲁巴语的内容池里,人做的那部分明显比机器做的那部分少。这种跨方法的一致性,比任何单一指标都值得信。
做非洲市场的人该怎么用这一条
直接的用法是:这两门语言不能按同一套流程做内容调研。
还有一个实操细节:这两门语言的内容在同一个检索工具里出来的时候长得一样,不点开看不出区别。所以最好在调研清单上直接按语言标好核查等级,别指望现场判断。
豪萨语的公共资料可以当线索用,查到一条觉得有用,底下大概率能点出去核对一遍。约鲁巴语的资料只能当线索的线索,看到什么都得另外找一手来源确认,不要拿它当依据写进正式内容。
这跟非洲选语种那一篇的判据能接上:那一篇说别先看人口,先看有没有人拿这门语言写价格和退货政策。这一篇补一句——还要看写下来的东西底下有没有垫东西。
斯瓦希里语在这次数据里的位置也值得一提:带出处34.3%、空栏32.9%,比约鲁巴语好但明显不如豪萨语,属于要逐条点开看的那一档。
成对样本比相关系数好用
整篇算了四五个相关系数,最强的那个是0.658。它能告诉你方向,说服不了任何人。
而豪萨语对约鲁巴语这一组,两个数摆在一起谁都懂:同一个国家的两门语言,一门六成七有出处,一门六成九是空架子。相关系数负责严谨,成对样本负责被记住。
这一批还找到几组类似的:格鲁吉亚语对亚美尼亚语,条目总数19.8万对33万,带出处40.0%对61.4%;马其顿语对阿尔巴尼亚语,16.3万对10.6万,52.9%对32.9%,空栏12.9%对28.6%。
这些成对样本的共同点是体量接近、地理相邻、结果差一大截。它们能把内容量这个变量按住,剩下的差异只能由别的东西解释。
名录型条目是不是真的没有出处?
这条预期错得最厉害
开工前保哥写的预期里有一条特别笃定:那些能从一张表成批生成的条目,比如物种、行政区划、年份页,肯定一条出处都没有,因为它们本来就是机器导进来的。
实测:名录型条目带出处51.0%,人写的条目带出处54.3%。两者只差3.3个百分点,基本一样。
更打脸的是分体裁的排名。带出处率最高的一档不是人物也不是概念,是生物分类单元,75.5%。天体那一档倒是低,29.4%,但那是另一个原因。
这条错得离谱,但错得有价值,因为它把出处这个指标的性质暴露出来了。
为什么物种条目引用最全
打开看就明白了。物种条目是从分类学数据库导进来的,而分类学数据库里每一条记录本来就带着定名文献——谁在哪一年发表了这个物种。
同一个机制在别的地方也见过。行政区划条目在有普查数据的国家通常带一条人口统计出处,在没有的国家一条都没有——差别不在写的人,在那个国家有没有公开一张能引的表。
导入脚本把这条文献一起带了过来,于是每一条物种条目天然带一个引用。不是有人给它加了出处,是它来的地方本来就带着出处。
天体那一档就没这个待遇,29.4%。因为小行星条目通常只有编号和轨道参数,没有一份对应的定名文献可以自动挂上去。
这两档一高一低,说明的是同一件事:名录型条目有没有出处,取决于导进来的那张表上有没有那一列,跟这门语言的社群一点关系都没有。
那这个指标还能用吗
能用,但要知道它在量什么。带出处率量的是一门语言的内容里有多少能被核查,这个定义本身没问题——一条自动带来的引用也是引用,读者一样能顺着点出去。
更稳的做法是只在人写口径上算这个数,也就是先剔掉名录型条目再算带出处率。这次两个口径都算了,人写口径下的排名跟全样本口径基本一致,说明主结论不靠这道处理撑着。
要小心的是别把它解释成社群的认真程度。名录型占比高的语言,带出处率会被这批自动引用抬上去,看起来比实际的人工投入好。
相关系数也证实了这一点:名录型占比跟带出处率的相关是正0.255。弱,但方向是正的——水分越大的内容池,出处这一列反而更好看。
所以正确的读法是把两列并排放:名录型占比那一列先读,再读带出处率。名录型占比越高,带出处率要打的折越大。
剩下几档的排名
把全部样本按体裁合并算,带出处率从高到低是:生物分类单元75.5%、事件70.5%、组织机构69.0%、建筑与设施66.2%、人物56.2%、作品56.1%、聚居地与行政区54.3%、自然地理50.0%、概念与术语43.2%。
概念与术语这一档43.2%排在最后一档,比人物还低13个百分点。这对做独立站的人不是好消息,因为概念与术语正好是你唯一能挂靠的那一格。
开工前还有一条预期也错了:以为人物条目的出处会明显多于地名条目,因为写人容易被质疑。实测人物56.2%对聚居地54.3%,差2个百分点,没有意义。
最低的三档是天体29.4%、消歧义与维护页14.7%、时间单位11.4%。后两档低是应该的,它们本来就不承载事实,是纯导航页。
出处密度这个数,为什么不能单独排名?
密度榜首是瑞典语
出处密度用每千字节几个引用来算,好处是不受条目长短影响。按这个数排下来,第一名是瑞典语2.14,第二名豪萨语1.26、立陶宛语1.27,英语只有1.20排第四。
这是本批第三次遇到一个太顺的解释。上一批那次更惊险:算出来的参照国排名每一条都能编出理由,打开条目才发现全是机器导进来的名录。太顺这件事本身就该当成一个警报。
瑞典语的引用密度比英语还高八成,这个结果第一眼看上去挺合理——北欧国家嘛,做事严谨。这种解释听起来太顺了,顺到得停下来查一下。
把瑞典语密度最高的六条打出来看:33 Orionis是一颗恒星、Phyllium exsectum是一种竹节虫、Lepidasthenia digueti是一种多毛类、Strombus pugilis是一种海螺、Peruansk basilika是一种植物。
全是机器生成的物种和天体条目,每条两三千字节,带9到16个引用。瑞典语的密度冠军不是社群严谨,是那批被灌进去的条目每条自带一串定名文献。
这跟别的批次的结论合上了
瑞典语被机器灌过这件事,本站量过两次。编辑人数那一篇算出瑞典语的名录型内容主体不是人写的,阅读中位数那一篇算出瑞典语随机一页一年只有6个人打开。
本篇的名录型占比也对得上:瑞典语65.8%,其中生物分类单元一档就占整个样本的50.0%。一门语言的公共内容里一半是物种词条。
所以三个批次的结论叠在一起是:这门语言的内容量一半是机器灌的,灌进来的东西没人读,而正是这批没人读的东西把出处密度这个指标顶到了全表第一。
这是本批第三次遇到同一类现象——爬虫占比那一篇里也是这样:一个看起来在变好的数字,背后是机器那一半在涨。
密度这把尺子的正确用法
密度不能单独排名,但它跟带出处率并排看的时候能分出两种情况。
带出处率高、密度也高:这门语言的内容普遍有引用,而且引得不止一条。英语属于这一档,90.0%配1.20。
带出处率不高、密度却很高:说明有出处的那一小批引用给得特别足,而大多数条目什么都没有。立陶宛语47.1%配1.27、爱沙尼亚语44.3%配1.14,都属于这一档,是典型的两极分化。
带出处率和密度都低:老挝语14.3%配0.10、阿姆哈拉语1.4%配0.06。这一档没什么可解释的,就是没有。
还有一个更朴素的替代指标
如果嫌密度太绕,有个更直接的:出处中位数。随机翻开一条,底下有几个引用。
要注意中位数为0不等于这门语言完全没有带出处的内容,它只说明带出处的条目不到一半。两个数一起给才完整:中位数0加带出处率44.3%,意思是四成多的条目有出处,但不到一半。
这一列有十几门语言是0,包括印尼语、立陶宛语、乌兹别克语、爱沙尼亚语、格鲁吉亚语、蒙古语、斯瓦希里语、阿尔巴尼亚语、僧伽罗语、高棉语、冰岛语、约鲁巴语、老挝语、阿姆哈拉语。
而英语是4、瑞典语6、泰米尔语3、孟加拉语3。这一列比密度那一列好懂:0的意思是随机翻开一条,最可能的情况是什么都没有。
汇报的时候建议用这个数,因为它不需要解释口径。跟不做技术的人讲每千字节1.2个引用,对方多半没反应;讲随机翻开一条底下是空的,对方立刻懂。
没人标类型的东西,是不是底下也没垫东西?
两条腿在这里合上
体裁那一篇最强的一条发现是机器不认率——一门语言的内容里有多大一块,机器连它属于哪一类都判不出来。高棉语50.8%、缅甸语44.6%、阿姆哈拉语42.9%、僧伽罗语41.2%。
把这两列画成散点也能看出来:右下角是空的,也就是几乎没有哪门语言在类型标注很差的同时出处又很好。缅甸语是唯一一个明显的例外,原因在本节最后一段。
把这一列跟带出处率做个相关:负0.392。方向是对的,强度一般。真正说明问题的是条目级的口径。
把所有语言的样本合并,按条目分三堆:机器不认那一堆带出处34.4%,名录型51.0%,人写54.3%。机器不认那一堆比另外两堆低了近20个百分点。
这两件事本来毫无关系——标一个类型是在结构化数据那一侧做的动作,加一条引用是在正文里做的动作,工具不同、界面不同、甚至通常不是同一批人。可它们同进同退。
因为它们是同一个动作的两面
写一条内容需要一个懂这门语言的人;给它标类型、给它找出处,需要一个愿意做整理的人。写作和整理是两件事,而小语种缺的往往是后者。
这条能解释很多之前散着的现象。约鲁巴语的空参考栏、高棉语的无类型条目、阿姆哈拉语那69条三百字节的短条,形态各不相同,背后是同一件事没做。
也能解释为什么这两个指标跟内容量的相关都不算强:内容量量的是写了多少,而这两个指标量的是整理了多少。写的人多不一定整理的人多,这两批人的增长曲线不是一条。
由此得本批的一句话:你看到的内容量,不告诉你这些内容是什么形状的,也不告诉你它底下垫没垫东西——而后两件事是同一批人做的,通常一起缺。
对做站的人意味着什么
第一个后果是核查成本。机器不认率高的市场,你不但要自己核查每一条本地资料,还没法用任何依赖类型筛选的工具去批量过滤。两个成本叠在一起。
第二个后果反而是机会。整理这件事在你自己的站上是完全可控的:结构化数据那一篇讲的标注动作,加上正文里认真挂几条出处,成本不高。
在一个整个语言环境都没人做整理的地方,把整理做全,你的页面在机器眼里就是少数几个能被判断类型、能被追到来源的对象。这个位置在英语市场花钱都买不到。
第三个后果是别指望本地竞品给你打样。这几门语言里的本地站通常也没做这些,你照着抄等于把空白抄一遍。
这条能不能证伪
能。如果整理这件事真的是同一批人做的,那么在同一门语言内部,标了类型的条目应该比没标类型的条目更可能带出处。
合并样本的口径已经验了:机器不认那一堆34.4%,其余两堆51.0%和54.3%。方向对上了。
但有一处对不上,得说出来:缅甸语的机器不认率44.6%排第二高,带出处率却有75.7%排第五高。这一门明显违反这条规律。
翻开缅甸语的样本能看到原因:那批没有数据项的条目全是某某村加某某镇区的格式,而缅甸语版给这批村庄条目配了统一的来源模板,一条条目一条出处。又是一次导入带来的出处,跟社群整理无关——所以这个反例不推翻规律,它推翻的是拿单一指标下结论这件事。
这一条怎么改你的内容核查流程?
三档核查强度
把带出处率和空栏占有栏比例合起来读,能给出一条能直接排进流程的分档。
分档只是起点,实际排期还要看这批内容承担多重的责任。同一门语言里,一篇品牌故事和一页退货政策该按不同的强度核查,后者错一个数字就是真金白银的赔付。
第一档,带出处率高于65%且空栏占有栏低于15%。本地资料可以当依据用,按常规流程核查即可。英语、越南语、孟加拉语、缅甸语、泰米尔语、豪萨语落在这一档。
第二档,带出处率在35%到65%之间。本地资料只能当线索,每条都要点开看底下挂的是什么。波兰语、马其顿语、波斯语、阿塞拜疆语、荷兰语、印尼语、立陶宛语落在这一档。
第三档,带出处率低于35%或者空栏占有栏高于40%。默认这门语言的公共资料没有出处,涉及事实的内容一律另找一手来源。约鲁巴语、老挝语、阿姆哈拉语、冰岛语、高棉语、僧伽罗语、阿尔巴尼亚语、乌兹别克语、斯瓦希里语落在这一档。
哪几类内容必须走最严的那一档
不用所有内容都按最严的来。真正需要严格核查的是可证伪的那几类:数字、编号、日期、法规名、机构名、计量单位。
这几类的共同点是错了以后能被人一眼指出来,而且会连累整页的可信度。相比之下,一段描述性的介绍写得笼统一点,风险小得多。
实操上可以这么做:内容写完之后把这几类信息单独拉一张清单,逐条标注来源。清单上没有来源的那几条,要么去找到来源,要么把那句话删掉。
这个动作跟机器翻译直接发布那一篇里的验收清单是同族的,只是入口不同:那一篇的入口是译文,这一篇的入口是本地公共资料。两者的失败模式一样,都是读着很顺、底下是空的。
本地资料查不到出处的时候找谁
第三档市场最实际的问题是:本地公共资料指望不上,那一手来源去哪找。
顺序上建议这样:政府和监管机构的官方网站排第一,行业协会排第二,本地大型企业的公开文件排第三,本地主流媒体排第四。前两类的问题是更新慢,后两类的问题是有立场。
还有一类经常被忽略:这门语言的英语版官方资料。很多小市场的政府网站有英语版,内容比本地语言版还全。用英语版核对事实、用本地语言写内容,这个组合在第三档市场里最省力。
最后一类是人。第三档市场里,找一个本地从业者问二十分钟,效率高过查两天资料。这笔钱在预算里通常没有一栏,得自己加进去。
自己站上该反过来做什么
知道了整个语言环境的出处密度很低,你自己站上的动作应该是反着来:把出处做得比本地平均水平高一大截。
具体做法不复杂:涉及数字和法规的地方挂一条官方来源链接,产品参数注明依据的标准编号,作者信息写全。这几样加起来的成本不到一篇内容的一成。
收益在于,一个所有条目都没出处的语言环境里,一个有出处的页面是极少数。无论是读者还是抓取内容的模型,都能把这个差别看出来。
本站在本地作者与资历信号那一篇里讲过署名这一层,出处这一层跟它是配套的:署名回答谁写的,出处回答凭什么这么写。
自己跑一遍要准备什么?
最小版本二十分钟
不需要写代码。打开那门语言的公共百科,连点30次随机页面,每次记两个字:底下有没有引用,有没有一个专门的参考栏。
三十条记完,算两个比例。有引用的低于10条就落第三档,有参考栏但没引用的超过12条也落第三档。这两个判据只要中一个就按第三档处理。
不懂那门语言完全不影响,因为脚注在渲染出来的页面上长得都一样:正文里一个上标数字,页面底部一列带编号的条目。看得见那一列就是有,看不见就是没有。
顺带记一下条目长度。三十条里超过一半是两三行就结束的,这门语言的资料基本没有当依据的价值,不用再往下量了。
想更准就取原始文本
要做语言之间的排序,30条不够,得提到70条以上,而且最好取原始文本来数,因为渲染页面上有些引用会被模板吃掉。
取原始文本的接口在版本接口的文档里,加上时间参数就能取到任意时点那一版。要注意的坑是多个页面加时间参数会被直接拒,只能一页一次。
数的时候只认脚注标签本身,别去数参考栏里的条目,因为参考栏的内容是模板展开出来的,原始文本里看不到。脚注标签数出来的是实际挂了几条,这才是你要的数。
参考栏的检测千万别认模板名,本篇第一版就栽在这里。改成看文末区块底下有没有正文,跨语言才可比。各语言版本对格式的要求本来就不统一,引用格式指引里说明的那套写法只是英语版的约定。
加一列会更有用
有余力的话加一列体裁,也就是上一篇那套做法。因为带出处率必须按体裁打折——名录型占比高的语言,这个数会被自动引用抬上去。
再加一列条目字节中位数。这一列几乎零成本,却能把两种低出处率分开:条目普遍很短的语言是没人写,条目不短却没出处的语言是写了没整理。
三列合起来才能给出一个能拿去开会的判断:这门语言的资料能不能用、为什么不能用、要补的是哪一件事。
最后提醒一句复算频率。这个数变得比体裁快,因为一次批量导入或者一个模板改动都能让它跳一大截。做决策之前现算一次,别用一年前的数。
常见问题解答
公共百科的出处密度,能代表这门语言里所有资料的可靠程度吗?
不能。公共百科的引用要求是它自己的方针,商业站、政府站、媒体站各有各的习惯,通常比它更松。这套数能代表的是一个下限判断:连要求最明确的地方都做不到,别的地方大概率更差。把它当作要不要额外安排核查预算的探针用,是合适的。
为什么不直接看页面底部有没有参考文献列表,那样不是更快?
因为参考文献列表是模板展开出来的,摆一个空模板跟真的挂了引用,在页面上都会渲染出一个小节标题。约鲁巴语78.6%有参考栏、只有15.7%有引用,就是这么来的。要判断有没有出处,得看正文里的上标数字,或者直接数原始文本里的脚注标签。
阿姆哈拉语只有1.4%,这个数是不是采集出问题了?
验过了。那70条里带出处的那一条是一篇医学词条,4843字节挂22条引用;其余69条的字节中位数是332,基本都是一两句话。所以不是采集漏了,是这门语言的内容里被认真写过的条目本来就极少。这条也提醒一件事:一门语言的资料能不能用,取决于你随机碰到的是不是那少数几条。
名录型条目的出处是自动带来的,那这个指标还有意义吗?
有,但要打折。带出处率的定义是有多少内容能被核查,一条自动带来的引用也确实能点出去,所以定义没错。要小心的是别把它解释成社群有多认真——名录型占比跟带出处率的相关是正0.255,方向是正的。正确读法是先看名录型占比,再看带出处率,前者越高后者要打的折越大。
出处密度和带出处率不一致的时候,该信哪个?
信带出处率,密度只当补充。因为密度的分母是字节数,会被两类东西扭曲:一是机器灌的短条目自带引用会把密度顶高,二是长条目里引用集中在几段会把密度拉低。带出处率没有这两个问题。要给不做技术的人汇报,用出处中位数最直接,0的意思是随机翻开一条底下什么都没有。
知道了这个数,具体能省下什么?
能省的是把核查成本排错位置的代价。第一档市场按常规流程走,第三档市场要在排期里单独留出找一手来源的时间。最贵的错误是按第一档的流程做第三档的市场:内容写完发上去,本地同事看到之后指出说法过时,改一遍的成本比一开始多留三天高得多。
这套方法能不能用在自己的品类上?
能,而且更值得做。把随机抽样换成按品类关键词检索,取前三十条,量同样两个数。因为限定了品类,结论直接对应你要写的那批内容。要注意的是检索结果带排序偏好,通常比随机样本好看,所以判读线要比本文严一档。
权威参考资料
本文标题:《小语种内容的参考资料栏,约鲁巴语八成条目有,里面一条都没有》
本文链接:https://zhangwenbao.com/minor-language-content-citation-density.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0