ISO 639-3语言代码申请书过半出自同一组织,616份署名逐份拆解
本文目录
- ISO 639-3语言代码清单到底是谁在提交申请?
- 为什么值得花一个下午统计申请人
- 申请人数据从哪来:明细页上缺的那一栏
- 语言代码申请表要求申请人交代哪些内容
- 本文统计范围:量什么、不量什么
- 语言代码申请书为什么过半署着同一个组织的名字?
- 按邮箱域名分类的申请人结果
- 这个田野调查组织日常在做什么
- 受理方和申请方是同一批人,会带来什么后果
- 另一半语言代码申请人是谁
- 申请人数据第一次统计的结果为什么是错的?
- 一条过于漂亮的申请人占比趋势线
- 邮箱从某一年开始做了防爬处理
- 时间序列断裂时先查记录方式
- 同一套证据判据下,不同申请人的通过率为什么差2.7倍?
- 按申请人身份分组的通过率
- 97.4%的最高通过率从何而来
- 大学邮箱申请通过率垫底的原因
- 判据保持中立,表格格式却有门槛
- 首次提交语言代码申请的人,通过率为什么只有27.4%?
- 按提交次数划分的四档申请人
- 84位申请人只提交过一次
- 被驳回后再次申请的人有多少
- 语言代码申请流程的学习成本在哪里
- 首次申请通过率对内容从业者的启示
- 语言代码申请表的哪些栏位人人都填,哪些一多半空着?
- 申请表十一个栏位的填充率
- 第一手知识一栏为何616份全部填写
- 私下沟通一栏为何只有三分之一填写
- 使用人数一栏填了九成,却不影响裁决结果
- 三个信息来源栏反映的举证成本结构
- 关于语言代码申请通过率的哪三条预期被实测推翻?
- 预期一落空:拉人联署没有提高通过率,反而更低
- 预期二落空:申请书写得越长,通过率越低
- 预期三落空:列不列参考文献,跟结果没有关系
- 三条预期落空共同说明的问题
- 语言代码申请涉及最多的国家是中国,为什么没有一份来自中国境内?
- 语言代码申请的国家分布
- 涉及中国的135份申请由谁提交
- 涉及中国的申请集中在哪几年
- 境外申请人主导登记的下游后果
- 其他国家的本国申请情况
- 语言代码申请的本地参与度为什么第一次量出来是假的?
- 巴布亚新几内亚的本地率看起来有65%
- 用顶级域名衡量本地参与度为什么不可靠
- 修正后,澳大利亚那17份的参考价值更高
- 语言代码库的新增产能为什么取决于当年谁在做项目?
- 逐年统计最大提交人的占比
- 占比归零的两个年份,其实是换了提交人
- 语言代码库的产能由人力驱动
- 用这条曲线推导其他结论为什么会出错
- 语言代码申请数据对小语种SEO有什么用?
- 用法一:查一下你的语言最近有没有被变更过
- 用法二:别把语言代码的标准地位当成市场规模的代理指标
- 用法三:如何绕开语言数据同源的问题
- 用法四:把这套读法用到其他注册库
- 用法五:如果你确实要提交一份语言代码申请
- 常见问题解答
- 这616份是全部的语言代码申请吗?
- 为什么截到2022年,不看最近几年?
- 那家机构占比这么高,这份清单可信吗?
- 中国境内的语言,国内有机构在做这件事吗?
- 我做的语言在这个库里查不到任何申请,说明什么?
- 提交一份申请要等多久?
- 权威参考资料
摘要:把ISO语言代码申请库里616份主申请表逐份拆开,统计署名的是谁。56.8%出自同一个组织,其中一个域名单独占了281份。第一次提交申请的人通过率只有27.4%,提交过十份以上的人是73.0%,相差2.7倍。三条预期全被推翻:拉人联署的通过率反而更低,申请书越长通过率越低,列不列参考文献跟结果没有关系。被申请最多的国家是中国,135份,占全库22.4%,这135份里来自中国境内邮箱的是0份。
上一篇文章里有一句话,保哥写完之后一直觉得不踏实。
那句话是:提交申请不需要什么资质,填一份表就行,申请人可以是语言学家、可以是当地的语言委员会,也可以是一个热心的使用者。这句话照着官方的流程说明写,本身没错。
但流程说明规定的是谁有资格来,没有说明谁真的来了。任何一个开放机构里,这两件事都有落差,区别只在落差多大。
这一篇就去数了一遍:那份决定全世界七千多门语言各自叫什么、编号是几的清单,实际上由谁在往里填。
结论先放在前面,方便带着它看后面的数字:这条通道确实对所有人开放,但走过去的人非常少,第一次走的人多半会被拦下来。开放和可用之间有一段距离,这一篇量的就是这段距离有多长。
ISO 639-3语言代码清单到底是谁在提交申请?
为什么值得花一个下午统计申请人
你在页面上写的那串语言代码,来自一份在册表。那份表里的每一行,最初都是有人填了一份表格提交上去的。
这句话听着像常识,推论却有分量:如果填表的人集中在很小的一群人里,那么这份清单反映的就不是世界上有多少门语言,而是这一小群人走到过哪里。
做小语种市场的人每天都在用这份清单的下游产物:语言选择器里的列表、关键词工具的语言维度、翻译供应商的报价单,源头都是它。清单的偏差会一路传到下游,而下游没有任何一个环节能发现它。
举个马上能对上的例子:你在语言切换器里看到的那份列表,有多长、每一门叫什么名字,最上游就是这份在册表。本站量过三家系统的界面语言清单差3.4倍,那是下游的差异;上游那份表本身怎么形成的,一直没人问过。
上一篇量的是这个库怎么判(语言代码申请被驳回,187份裁决书里提到政治的只有1份),这一篇量的是谁在提。判据和提案人是两件事,两篇合起来才是这个库的全貌。
申请人数据从哪来:明细页上缺的那一栏
这个库的申请明细页上,能看到变更类型、状态、生效日期和被修改的属性,唯独看不到申请人。
申请人写在附件里。每一份创建新语言代码的申请,都要附一份单独的表格,文件名是申请编号加上那门语言的代码。表格第一栏就是主申请人的姓名和邮箱。
保哥把这批附件全部抓了下来,一共616份,覆盖346个申请编号,时间从2006年这套体系上线那年一直到2022年。其中通过378份,被驳回238份。
抓下来之后转成文本,逐份提取字段。这份表格的格式在十七年里几乎没变过,字段标记稳定得出人意料,一套正则跑到底,616份全部解析成功。
顺带说一句,这批附件不能靠猜文件名下载。同一批申请里,附件的命名规则前后换过,猜URL会漏掉一部分,而且漏掉时拿到的是一个假文件,不会报错。正确做法是先从申请明细页读出附件的真实文件名,再去下载。
这一步看着琐碎,却决定了这一篇的数据是否完整。官方那几份码表是结构化的,下载就能用;申请附件这一层是散落的文件,只能一个个核对。一手数据的成本通常不在分析环节,而在把数据凑齐的环节。
语言代码申请表要求申请人交代哪些内容
表格一共五节。第一节是名称:这门语言首选叫什么、自称是什么、还有哪些别名、为什么选这个名字、使用者大概多少人。
第二节是时空:它是活语言、濒危、刚灭绝、历史语言还是人造语言,用在哪几个国家、哪几个地区。第三节是谱系:口语还是手语,属于哪个语系,最近的亲属语言是哪门。
第四节是这门语言的处境:有没有书面文献、有没有广播电视、政府是否承认、是否进入学校。第五节标题叫信息来源,最有意思,要求申请人交代三件事:有没有第一手知识、有没有通过私下沟通得到的信息、有没有可以列出的已出版文献。
这张表读起来更像论文的方法论章节,不像工单。这个观察后面会变成一条硬结论:一份看起来对所有人开放的流程,可以靠表格的形状本身完成筛选。
本文统计范围:量什么、不量什么
量三样:主申请人的身份、这个人一共提过几份、他提的申请后来是否通过。
不量申请内容的对错。一份申请该不该通过是语言学问题,保哥没有能力判断,也不打算判断。这一篇只回答谁在提。
也不量这些语言今天的市场价值。在这个库里,标准地位和市场规模几乎正交,上一篇已经用裁决书的词频证明过,这一篇不重复。
也不量2022年之后的部分。那之后的附件在库里还没有铺全,样本不完整的年份宁可不用,免得算出一个假趋势。
还有一点要提前说明:这一篇会反复出现同一个组织的名字,但这篇文章不针对谁。数完之后你会发现,真正值得担心的是没有别人在做,不是有人做得太多。
语言代码申请书为什么过半署着同一个组织的名字?
按邮箱域名分类的申请人结果
把616份表格里主申请人的邮箱按域名归类,结果如下:一家长期做少数语言田野调查的机构及其分支机构合计350份,占56.8%。
其余部分:免费邮箱110份,占17.9%;一个语言学网络社区38份,占6.2%;各类大学邮箱28份,占4.5%;其它非营利组织21份,占3.4%;其它域名58份,占9.4%。
单是一个主域名就出现了281份。这份全球语言清单里,每五份新增语言的申请书,就有两份多从同一个邮箱后缀发出。
这个组织正是这套编号的注册机构。上一篇写过它的角色:受理申请、组织评议、撰写裁决、每年发布更新后的码表。现在还要加上一条:它同时也是最大的申请人。
这个田野调查组织日常在做什么
它的主业是语言调查和识字教育,在全球几十个国家有常驻项目,很多项目一做就是几十年。它自己对语言调查这项工作的描述里写得很清楚:先弄清一个地区实际在说哪些话、彼此能否互通,才谈得上后面的工作。
这项工作跟语言代码申请天然衔接。判断两个村子说的话是不是同一门语言,要做的事跟申请表要求证明的内容完全重合。调查做完,申请表已经填好了一大半。
所以这个占比不是谁挤走了谁:这件事本来就只有一类人能在日常工作中顺手完成。它反映的是空缺,不是垄断。
受理方和申请方是同一批人,会带来什么后果
先说明,这不构成程序问题。这个机构做语言田野调查,它的人常年在偏远地区做语言普查,遇到一门没有代码的语言,顺手提一份申请再自然不过。
从另一面看,如果他们不提,多数情况下也没有别人会提。愿意为一门只有几千人使用的语言填一份英文表格、附上参考文献、再等一年结果的人,本来就不多。
但它确实带来一个后果,对用数据的人影响很实在。上一篇提过:这个机构自己也出版一份全球语言数据库,两套东西的语言划分高度一致,所以没法用那份数据库去交叉验证这份码表。
现在这一点要再往前推一步。除了发布方同源,连申请书也出自同一批人。问题已经超出两家数据对不上,整条链从头到尾只有一家。你手上任何一份关于世界语言数量的数据,追到底大概率都会追到这里。
另一半语言代码申请人是谁
免费邮箱那110份最值得看。用gmail提交申请的人里,有一位在2019年一个人提了31份,而那一年全库总共只有45份。
这类申请人通常是独立研究者:有的是退休的语言学教授,有的是常年整理某个语系资料的爱好者,有的是某门语言的母语者。他们不挂靠机构,用私人邮箱提交。
这一档的存在是好消息,说明这条通道确实对个人开放,不是只有机构才进得来。坏消息出在后面的通过率上。
大学邮箱那28份高度集中,其中17份来自澳大利亚一所研究原住民语言的大学,同一位教授在2013年一次提了15份。
语言学网络社区的38份也是集中提交,主要涉及古代语言、已灭绝语言和人造语言三类。这几类语言不在任何田野调查项目的范围内,所以由这个社区批量补齐。
这个社区是语言学界一个运作了三十多年的公共平台,本身不是研究机构。它在这个库里的角色很特殊:没有人会去田野调查一门古代语言,这批代码只能由这类平台整理现有文献后统一提交。
它的通过率是全库最高的97.4%。原因同样在这里:古代语言的边界早已在学界确定,没有争议,提交本身只是行政手续。
申请人数据第一次统计的结果为什么是错的?
一条过于漂亮的申请人占比趋势线
第一次跑完统计,看到一条很漂亮的趋势:这家机构在申请里的占比,2006到2008年是七成到九成,2009年之后突然归零,此后再没回来。
这个形状太干净了,干净到可以直接写成一节:这家机构在2009年前后退出申请,把位置让给了独立研究者。故事完整,还自带一个时间拐点。
好在这个结论漂亮得不太可信。一个组织的行为很少在某一年整齐切断,通常是逐年衰减。
于是回头看原始文本,看到第一份就明白了原因。
邮箱从某一年开始做了防爬处理
2009年之后的表格里,邮箱不再按正常格式书写,而是把at换成单词、把点也换成单词,中间用空格隔开。这是网页时代常见的防爬虫写法。
616份里有353份是这种写法,占一多半。当时的正则只识别at符号,这353份因此全部被判为没有邮箱,归进了无法分类那一档。
2009年恰好是这个改动开始的年份。一次格式变更,就这样被读成了一次真实的组织行为变化。
这是本工程第十二次遇到测量尺子失效,形态是新的:数据源在时间序列中途改了字段格式,改动的时点看上去像某个事件的拐点。补上还原规则后重跑,这家机构的占比在2006到2022年间始终在三成到九成之间波动,从未归零。
时间序列断裂时先查记录方式
判据可以固定成一句话:任何时间序列在某一年整齐断裂,先问那一年数据的记录方式有没有变,再问事实有没有变。
这条在别处同样成立。之前量一门语言的地区数据自有率时,也是先看到总格数暴涨的曲线,后来才发现涨的是继承标记而非真实数据,那次记录方式的变更发生在某个版本号上(区域数据里到底有多少是这门语言自己的)。
做站的人遇到这种情况的概率不低。分析工具改过一次统计口径、爬虫改过一次归类规则、某个字段从某天起开始带默认值,这些都会在报表上画出一个漂亮的拐点,而拐点背后什么都没发生。
本站踩过同类的坑不止一次。有一次从规格书里提取文本,屏幕上显示的是正常的泰语,程序复制出来的却是另一串字符,因为那份文件的文本层和显示层根本不是一回事(那页规格书机器读到的是另一串字符)。
这些问题的共同点是:数据并没有缺失,只是含义跟你以为的不一样。缺失会报错,含义错了不会。
稳妥的做法是给每条时间序列配一句说明:这条线用什么方法测得,这个方法在哪段时间内保持不变。写不出这句说明的曲线,不拿来做决策。
同一套证据判据下,不同申请人的通过率为什么差2.7倍?
按申请人身份分组的通过率
把616份按主申请人的邮箱类型分组,分别计算通过率,结果差距很大。
语言学网络社区提交38份,通过37份,97.4%。田野调查机构提交350份,通过260份,74.3%。其它非营利组织47.6%。
另一端:免费邮箱110份只通过39份,35.5%。大学邮箱28份只通过9份,32.1%。
最高和最低相差2.7倍,而这套体系的判据只有一条:这两个变体是否互不相通。
97.4%的最高通过率从何而来
先把最高的一档解释清楚,否则会产生误导。97.4%不是因为这个社区特别会写申请,而是因为它提交的38份几乎全是没有争议的登记。
古代语言、已灭绝语言、人造语言,这三类的共同点是:没有在世的使用者社群会对划分提出异议。没有异议,也就没有驳回的理由。
剔除这一档后,真正可比的是田野调查机构的74.3%和独立申请人的35.5%。这两档面对的是同一类语言、同一套判据,差别在提交人。
把最高值单独拎出来解释,是做数据时值得养成的习惯。一张排行榜上最显眼的那个值,十次里有八次是口径问题或样本性质不同,并不代表真的强。量小语种引用密度那一次也是如此:荷兰语的空栏率0.0%看着最好,实际上是因为分母只有1条。
大学邮箱申请通过率垫底的原因
开工前的预期是大学那一档会排在前面,学者提的申请应该最规范、文献支撑最充分、最经得起评议。
实测结果是倒数第一。翻了几份被驳回的大学申请后,原因大致清楚了:学者提申请,常常是为一个学术上有争议的划分背书,而学术争议恰恰是这套体系最不愿意碰的领域。
田野调查机构提的申请多数属于另一类:某个村子里的人说的话跟邻村不通,需要一个新代码来登记。这类申请只涉及事实,没有争议。
因此,通过率的高低不完全取决于申请质量,更多取决于申请动机。登记一门没人管过的语言容易,重划一条已经有人在争的边界难。这跟上一篇按地区算出的驳回率,是同一件事的两个切面。
判据保持中立,表格格式却有门槛
还有一层更实际的解释。这份表格要求填写的内容,包括语系归属、最近亲属语言、可懂度证据、参考文献清单,需要一套专门的知识。
常年做这件事的人知道每一栏该写什么、写到什么程度才够。第一次填的人不知道,会把自己认为重要的内容写进去,而这些内容未必是评议人要看的。
判据本身确实中立,上一篇的数据已经说明:187份裁决书里提到政治的只有1份,绝大多数只谈证据。但能否把证据整理成这套体系认得出的形式,跟你在哪个组织、有没有人教过你,关系很大。
这种结构在别处也常见。一份对所有人开放的申报流程,只要表格足够专业,就会自动完成筛选,筛掉的是不熟练的人,跟诚意无关。
做跨境的人对这种结构应该不陌生。平台的申诉通道、品类的资质备案、某些市场的合规申报,都遵循同一套逻辑:门开着,但得先学会门里的说法。
首次提交语言代码申请的人,通过率为什么只有27.4%?
按提交次数划分的四档申请人
换一种分组方式:不看申请人属于哪个机构,只看这个人在整个库里一共提过几份。
只提过一份的人有84位,合计84份申请,通过23份,通过率27.4%。提过两到三份的155份,通过率61.3%。提过四到九份的118份,60.2%。提过十份以上的259份,通过率73.0%。
首次提交者和常客之间相差2.7倍,差距的大部分出现在第一份和第二份之间。从27.4%到61.3%,只隔着一次经验。
这个结论比按机构分组的那条更可靠。机构可能自带资源,提交次数这个变量里却不含资源,只反映熟练度。
这条数据有局限:提交次数多的人本来就更可能属于那家机构,两个变量并不完全独立。但即使把那家机构的申请全部剔除,只看独立申请人内部,多次提交者的通过率仍明显高于只提过一次的人。熟练度这个因素单独成立,不是机构身份的投影。
84位申请人只提交过一次
整个库里出现过187个不同的申请人名字,其中84位只提过一份,占45%。
另一端,提交量最大的20个人合计提了307份,占全库的49.8%;前50人合计425份,占69.0%。单人最多提了39份。
两组数字放在一起:近一半的人只来过一次,一半的申请由20个人完成。这是典型的长尾分布,但长尾一端的通过率只有头部的三分之一多一点。
这84个人里,被驳回的61位有多少会再来一次?数据给出了答案:全库被反复申请且始终没通过的只有两组。绝大多数人被驳回一次后,就再也没有出现。
被驳回后再次申请的人有多少
上一篇统计过反复申请的情况:反复提交的组合有三分之二最终成功,但成功那一次的主张往往已经改变。
那一篇看的是同一门语言被反复申请,这一篇看的是同一个人。两个角度的答案一致:反复申请本身就很少见。
两条合起来,这个库的实际情况是:一小群熟练的人持续提交,一大群人来过一次就离开,而离开的人也带走了他们那门语言的登记机会。
这不能归咎于谁。填一份英文表格、附上可核查的语言学证据、再等一年,对一个只想让自己母语被登记的人来说,这个成本已经足以让人放弃。
语言代码申请流程的学习成本在哪里
翻看被驳回的首次申请,最常见的问题不在证据不足,而在不知道该提哪一类变更。
有人想把一个变体独立出来,填的是创建新语言;实际上他需要的是拆分,而拆分要求对原代码的整个范围负责。有人想改名字,填的却是创建。类型一旦填错,后面写得再好也过不了。
官方那份提交变更申请的说明页其实把类型划分得很清楚,但它是规则文档,不是操作指南。规则文档能列出有哪几种类型,却没法告诉你自己的情况属于哪一种。
这跟做SEO时遇到的很多事情同构:平台的政策文档写得很全,但要判断自己的具体情况适用哪一条,往往还是得先碰一次壁。
还有个细节,这批被驳回的首次申请里,有相当一部分申请人是那门语言的母语者。他知道自己说的话跟邻近地区不一样,却不知道怎样把这件事写成这套体系认可的证据。这个落差跟内容行业里常见的落差相同:懂业务的人不懂怎样把业务写成机器能识别的格式。
首次申请通过率对内容从业者的启示
如果你所在的市场涉及一门登记信息有问题的语言,比如名字不对、范围不对、该拆没拆,理论上你可以提一份申请。实际上,第一次提交的成功率是27.4%。
更现实的做法是找已经在做这件事的人。这个库的每一份申请都公开署名,可以查到最近几年是谁在处理你关心的语系。
这一步成本很低。翻两页索引,记下最近五年提交过相关语系申请的人名,发一封说明情况的邮件,比自己从头研究表格快得多。
不过实际上,绝大多数做电商的人不需要走到这一步。这条数据更大的用处在反方向:它说明这份清单里的空白处不是没人需要,只是没人有精力去填。
语言代码申请表的哪些栏位人人都填,哪些一多半空着?
申请表十一个栏位的填充率
把616份表格的每个栏位逐一统计是否填写,得到一张填充率表。这张表比任何一份流程说明都更能反映这套体系实际看重什么。
填写日期、主申请人姓名两栏,616份全部填写。邮箱99.5%。使用国家99.4%。使用人数91.6%。
再往下开始下降:有没有书面文献82.5%,政府是否承认、是否进入学校81.7%,其他支持者署名60.2%。
最后是信息来源的三栏。第一手知识616份全部填写,100%。已出版文献66.2%。通过私下沟通得到的信息,只有34.6%填写。
第一手知识一栏为何616份全部填写
一个栏位的填充率达到100%,通常有两种可能:它是必填项,或者它就是这件事的门槛。
这一栏不是必填项,同一节里另外两栏都能留空提交,说明系统没有强制。它被填满,只能是第二种原因。
看这一栏的实际内容就清楚了。典型写法是:某位教授在这门语言上做了十五年研究项目,发表过相关论著;更朴素的写法是申请人自己在那个地区住了多少年、走访过多少个村子。
这一栏回答的都是同一个问题:你凭什么替这门语言说话。这个问题在这套体系里没有替代答案。你可以不列文献,可以没有联署人,但必须说清自己跟这门语言的关系。
私下沟通一栏为何只有三分之一填写
这一栏问的是:你有没有通过跟他人交流得到的信息,请描述。填写的只有34.6%。
这个低填充率值得细看。按理说,做语言调查的人一定会跟当地人交流,为什么有三分之二的人没写。
从内容能推测原因:填写的人多半写的是与当地某个语言组织长期合作,或者与研究这门语言的另一位学者核对过。没填的人不是没有交流,是把这部分内容合并写进了第一手知识那一栏。
这一点适用于任何表格:栏位的填充率既反映事实,也反映填表人如何理解栏位之间的边界。两个栏位语义接近时,靠前的那个会吞掉靠后的那个。
使用人数一栏填了九成,却不影响裁决结果
使用人数的填充率是91.6%,属于填得很满的一档。但上一篇已经统计过:187份裁决书里提到使用人口的只有7份,而且都不是主要依据。
一个栏位填得很满、却几乎不参与判定,这种组合在表格设计里很常见。这类栏位通常服务于后续的数据库,而非评议。
这一栏的内容后来去了哪里?进入了那份全球语言数据库的使用人数字段。你在任何地方看到某门语言有多少人使用,源头可能就是十几年前某位申请人在这一栏里填的一个约数。
这对做语种排期的人是硬伤。拿两门语言的人口数做对比,前提是两个数用同一把尺子测得;而这批数字来自不同年份、不同调查者、不同估算方法,彼此根本不可比。本站在非洲市场选语种那一篇里给过替代方案:不看人口,看有没有人用这门语言写价格和退货政策。
做市场的人应当记下这一点。给语种排优先级时,那一列人口数不是普查数据,而是一批研究者在不同年份、用不同方法估算出来的值,彼此不可比。这跟本站量过的另一件事同构:一个看起来很硬的数字,追到源头往往是某个人在某一年填的一格。
三个信息来源栏反映的举证成本结构
把这三栏放在一起:人人都填的是亲身经历,一多半人填的是文献,三分之一的人填的是交流记录。
这个顺序说明了这套体系收的是什么:它要求有人真的去过现场,资料只是其次。资料可以在图书馆里找,到过现场这件事无法替代。
这也解释了田野调查机构的通过率为什么能到74.3%。他们的人本来就在当地,第一栏对他们来说是现成的。而一位在书房里靠文献研究某门语言的学者,恰恰在这一栏上最弱。
做内容的人可以借用一条判据:当一个体系反复要求你证明亲身经历,它筛掉的是没到过现场的人,而不一定是能力差的人。这条判据这几年在搜索里也越来越明显。
区别只在于,语言登记体系把要求明写在表格里,搜索那一侧则隐含在评估标准里。两边要的东西相同:你到底有没有亲手做过这件事。
关于语言代码申请通过率的哪三条预期被实测推翻?
预期一落空:拉人联署没有提高通过率,反而更低
表格第一节专门留了一栏,填写其他支持者的姓名、单位和邮箱。开工前的预期是这一栏填得越满越好。
实测:有支持者署名的371份,通过率59.3%;只有一人署名的245份,通过率64.5%。联署的那一批反而低5个百分点。
更合理的解释是因果方向反了,联署本身并无害处。争议大的申请才需要拉一批人背书,而争议大本身就是被驳回的高风险因素。联署是争议的症状,解决不了争议。
还有一个细节:有一份申请的支持者栏里填了41个邮箱,那一份被驳回了。在这套体系里,人多不代表有力,只说明这件事有人不同意。
预期二落空:申请书写得越长,通过率越低
把每份表格里几个正文栏位的字数相加,按四分位分档统计通过率。
最短的四分之一,通过率67.5%。偏短一档69.3%。偏长一档58.7%。最长的四分之一,通过率50.0%。四分位数分别是223字符、464字符、989字符。
填得最多的一批,通过率比填得最少的一批低17.5个百分点。这个结果跟多数人的写作直觉相反。
原因跟上一条同源:需要长篇论证的申请,本来就是难判的那些。常规的新语言登记只要写清这门话跟邻村不通、有多少人使用、谁做的调查,两三百字就够了。
可以固定成一条判据:一份材料的长度反映的是争议度,而不是质量。这条在提案、立项书、申诉信上都成立:写了三千字,通常不是因为准备充分,而是因为这件事本来就难以说服人。
预期三落空:列不列参考文献,跟结果没有关系
表格第五节要求列出已出版的文献,包括词典、语法书等。616份里有408份列了,208份完全没列。
通过率:列了文献的60.5%,没列文献的63.0%。基本没有差别,没列的甚至略高。
这一条要格外小心,因为它看起来跟上一篇的结论矛盾。上一篇讲过,这套体系判定两个变体是否属于不同语言时,有一条判据看文献存量,即成熟的标准化加上成规模的文献。
两者的区别在于:那条判据看的是这门语言几十年积累的文献总量,这里统计的是申请人在表格里有没有填那一栏。前者是这门语言的客观状况,后者只是填表动作。填了不代表存量丰富,没填也不代表没有文献。
三条预期落空共同说明的问题
三条结果指向同一个方向:表格上那些看起来像质量信号的东西,包括联署人数、篇幅、文献清单,其实都不是。
真正能预测结果的是两个变量:这个人提过几次,以及这件事有没有人在争。前者是熟练度,后者是争议度。
这个结论比数字本身更值得记住,因为它可以直接用到别的场景。评估一份材料能不能通过,先别看它做得多满,先看提交人是不是熟手、这件事本身有没有分歧。
做内容的人尤其容易掉进第一个坑:以为把能填的都填上就是准备充分。实际上在很多流程里,填得多只是暴露了你不知道哪些才是关键。
页面上也是如此。一个商品页把所有属性格子都填满,表现未必比只填对三格的页面好,因为多出来的格子里装的常常是待补充和不适用。小语种内容里那个空着的参考资料栏是同一形态的极端版本:格式摆得很整齐,真正费事的那件事没有做。
语言代码申请涉及最多的国家是中国,为什么没有一份来自中国境内?
语言代码申请的国家分布
表格第二节要填写这门语言的使用国家。把616份的第一个国名取出来归并,一共覆盖98个国家。
排在最前面的是中国,135份,占22.4%。其后是澳大利亚56份、尼日利亚45份、印度39份、巴布亚新几内亚37份、肯尼亚18份、印度尼西亚17份、墨西哥15份。
中国的领先幅度很大,是第二名的两倍多。原因不难理解:中国境内的语言多样性很高,而这套体系上线的那几年,正好有一批针对中国南方少数民族语言的调查项目在进行。
这批申请的通过率是57.8%,略低于全库平均。
另外,这个国家分布跟商业价值的排序几乎没有重合。跨境电商的重点市场,如德国、日本、法国、巴西,在这个库里的申请量都很小,因为这些国家的语言早已登记完毕。这份清单的活跃区域,恰好是商业地图上最空的那些地方。
涉及中国的135份申请由谁提交
按邮箱域名拆分:田野调查机构100份,gmail31份,yahoo3份,语言学社区1份。
来自中国境内邮箱的是0份。一份都没有:没有.cn域名,也没有国内的邮箱服务。
提交量最大的几位:一位在2007年提了39份,另一位用gmail提了20份,还有几位各提了8到13份。这几个人合计完成了这135份中的绝大部分。
再看具体涉及哪些语言。壮语在这个库里被切成了十几个代码,右江、左江、邕南、砚山、桂北、桂边、柳江、连山这些名字各自成为独立的语言代码。布央语被分成三个,另外还有佤语的一支、阿克乌语、茶洞语、卡卓语、桑孔语,以及图木舒克语这样的历史语言。
涉及中国的申请集中在哪几年
把这135份按年份展开,2006和2007两年占了一多半。2006年那份把壮语拆成五个代码的申请和2007年那份一次拆出九个的申请,两份加起来就是十四个新代码。
打开这两份申请能看到完整附件:每个新代码都有一份单独的表格,填写了这一支的使用地区、人数、最近的亲属语言。填表的是同一批人,日期紧挨着。
这两年之后,涉及中国的申请量迅速回落,最近几年每年只有零星几份。原因是那批项目结束了,剩下的语言并没有全部登记完。
可以拿另一件事对照:中国境内还有大量语言的登记信息停留在二十年前那批调查的结论上,此后没有人系统复核过。你今天在任何国际清单里查到的名字和划分,沿用的仍是当时的口径。
境外申请人主导登记的下游后果
先说明:这些申请在语言学上未必有问题。做这批调查的人很专业,很多划分在学界有共识。
问题不在对错,而在于中国境内的语言在国际标准里被切成什么样、每一块叫什么名字、用哪三个字母表示,全部由境外申请人决定,而且这个过程从未中断。
下游影响很具体。做面向东南亚市场的内容时,如果涉及壮侗语族,你在任何一份国际语言清单里看到的分类和命名,都源自这批申请。那个名字未必是使用者自己的叫法,也未必是国内学界的通行叫法。
再往下一层,这些名字会进入机器翻译的语言列表、模型的语言标签、你所购买的关键词工具的下拉框。一门语言在这些工具里叫什么,决定了工具里有没有它的数据。本站量过低资源语言在模型里的表现,那一层的语言清单同样源自这份表。
这跟一个更普遍的现象相同:一门语言的名字取决于它在历史上被谁命名,而不取决于它自己怎么称呼自己。这一点在语言选择器上的表现(语言切换器该写自称还是英文名)和在标准里的表现,是同一条线的两端。
其他国家的本国申请情况
用同一口径看其他国家:尼日利亚45份,本国实体0份。印度尼西亚17份,0份。肯尼亚18份,0份。墨西哥15份,0份。
印度39份里有7份来自印度域名。澳大利亚56份里有18份来自本国域名,其中17份出自同一所大学。
在申请量最大的十个国家里,只有澳大利亚有本国学术机构在系统地做这件事。
这个对照不需要多解释。语言登记需要有人常年跟进、熟悉这套表格、愿意投入时间,而多数国家没有机构把这件事列入职责。
需要补充一句公道话:没有本国机构参与,不等于本国没有研究。很多国家的语言学界成果丰富,只是这些成果没有走这条国际登记通道。研究和登记是两件事,中间没有自动传递的机制,需要有人专门去做登记。
语言代码申请的本地参与度为什么第一次量出来是假的?
巴布亚新几内亚的本地率看起来有65%
上一节那张表,第一版跑出来时有个异常值:巴布亚新几内亚37份申请里,有24份来自以该国顶级域名结尾的邮箱,本地率64.9%,全表最高。
如果按这个数写下去,结论会是:巴新是本地参与度最高的国家,远超澳大利亚和印度。这个结论还挺有故事性,一个太平洋岛国在语言登记上比发达国家更积极。
随后把这24份的域名逐条打开核对。
24份全部是同一个域名,即那家田野调查机构在巴新注册的分支机构域名,没有一份是真正的本地申请。
用顶级域名衡量本地参与度为什么不可靠
问题出在指标设计上。用邮箱的国家顶级域名判断申请人是否为本地人,前提是本地域名等于本地实体。跨国组织在当地注册分支域名,这个前提就不成立了。
肯尼亚那18份也是同样情况:那里有一个当地注册的组织域名,名字看着像本地机构,实际属于同一体系下的圣经翻译项目网络。
这是本工程第十三次遇到测量尺子失效,形态同样是新的:用地理属性的代理指标衡量组织归属,跨国组织的当地分支会让这个指标整体失真。
修正办法只有一个:逐条核对真实域名,判断域名背后是什么实体。616份不算多,一个下午能看完。凡是依靠后缀、前缀、命名规则自动归类得出的结论,都要抽样打开核对,样本量小时干脆全部核对。
修正后,澳大利亚那17份的参考价值更高
剔除分支机构后,申请量前十的国家里,真正由本国实体提交申请的只剩澳大利亚。
那17份来自澳大利亚北部一所专门研究原住民语言的大学,主申请人是同一位教授,集中在2013年提交。
这个孤例让结论更清楚:本国机构参与语言登记是可行的,条件是有一个把这件事写进职责的学术机构。具备这个条件的国家很少。
也要看到另一面:那位教授提交的15份集中在同一年,之后就没有了。个人驱动的参与和机构驱动的参与,区别在于前者会随着个人项目周期结束而中断。这跟本站量界面语言包完成度时看到的形态一致:最后一次提交的时间戳比完成度百分比更早发出信号,停在几年前的那些,多半是当初负责的人不做了。
这17份的通过率并不高。参与和成功之间,还隔着前面讲过的熟练度门槛。
语言代码库的新增产能为什么取决于当年谁在做项目?
逐年统计最大提交人的占比
把616份按年份拆开,统计每一年提交量最大的那个人占多少。
2007年全年140份,一个人提了39份。2013年全年25份,一个人提了15份。2019年全年45份,一个人提了31份,占当年近七成。2021年26份,一个人11份。2022年21份,一个人9份。
每年参与的人数也很少:2018年只有6个人提过申请,2008年8个人,2013年8个人,2021年8个人。人数最多的是2007年,31个人。
这份决定全世界语言编号的清单,每年的更新量取决于当年有没有一两个人正好在做大项目。
占比归零的两个年份,其实是换了提交人
前面提到,修正尺子之后,那家机构的占比在三成到九成之间波动。波动中有两个低点:2013年和2019年,占比都是0。
这两年并非没人申请。2013年是那位澳大利亚教授一人提了15份,2019年是一位用gmail的独立研究者提了31份。占比归零的原因是当年正好有另一个人在批量提交,把分母撑大了,主力并没有退场。
这提醒的是同一个问题:占比这类相对指标,在分母很小时会剧烈波动,波动原因往往在分母,而不在分子。
做小语种报表的人对这一点应该格外敏感,因为小语种的分母天生就小。一门语言当月的自然流量占比翻倍,多半不是它上涨了,而是其他语言下降了,或者那个月正好有一次活动。按语言拆分指标的好处是能看到细节,代价是每个格子的样本量都不够。
做报表的人对此应该很熟悉。某个渠道的占比突然下降一半,第一反应通常是这个渠道出了问题,实际上常常是另一个渠道当月做了活动。
语言代码库的产能由人力驱动
把逐年申请量画成曲线:2006到2008年是高峰,2007年一年140份;之后一路走低,2018年只有7份;2019年因为那位独立研究者再次抬升;2020年之后每年二十几份。
这条曲线跟世界上还有多少语言没有代码无关,完全对应有多少人在做这件事。它量的是供给,不是需求。
用这条曲线推导其他结论为什么会出错
这条曲线很容易被误读为发现新语言的速度,或世界语言多样性被记录的进度。两种读法都不对。
正确的读法只有一种:它是这几十个人的工作日程表。项目启动,曲线上升;项目结题,曲线下降。某门语言是否存在、是否需要记录,跟曲线形状无关。
凡是由少数人产出的公开数据,其时间曲线首先反映这些人的排期,其次才反映外部世界。本站量小语种内容量跟编辑人数的关系时得到的是同一形态:内容曲线的拐点从来不对应需求变化,而对应那几位活跃编辑的加入和离开。
上一篇提过,这个库已经从新建语言转向修改名称:十八年新建944个代码,前六年占了六成。现在可以补上原因:并不是该建的都建完了,而是集中做这件事的那批项目结束了。
语言代码申请数据对小语种SEO有什么用?
用法一:查一下你的语言最近有没有被变更过
这个库的变更申请索引可以按年份翻阅,每一条都能点进去查看申请人和结果。
操作很简单:搜索你在做的那门语言,看最近十年有没有出现在申请里。如果出现过,说明它的边界或名称近期被改动过,你手上那份词表的口径可能已经过时。
没出现过反而是好消息。这跟上一篇给出的判据一致,只是这次多了一项要看:除了有没有申请,还要看提申请的是谁。如果是那家机构在做例行登记,多半不影响你;如果是本地社群在争取一个独立代码,这门语言的市场边界可能正在变化。
判据还可以更具体:申请人是机构、变更类型是创建,通常属于补登记,跟你无关;申请人是个人或本地组织、变更类型是拆分,就要留意,因为拆分意味着有人认为现有代码覆盖了两群不同的人。
举个具体例子:如果你做的品类涉及某个正在争取独立代码的地区变体,说明当地人认为自己说的不是那门大语言。这种认同差异会直接体现在他们的搜索用词上。
用法二:别把语言代码的标准地位当成市场规模的代理指标
这一条上一篇提过,这一篇的数据从另一个角度支持它。
一门语言有没有代码、代码分得多细,取决于有没有人做过调查,跟这门语言的使用人数和商业价值几乎无关。壮语被切成十几个代码,原因是2007年正好有项目在那一带开展,与商业重要性无关。
反过来,某门语言在这份清单里只有一个笼统的代码,也不代表它内部没有分歧,只代表还没有人去细分。
这一点在做关键词表时最容易吃亏。你按代码建了一套词表,以为覆盖了这门语言的全部使用者,实际上那个代码下面有两三群说法不同的人。同一门语言在不同市场的搜索意图差异那一篇讲的就是这种情况,那一篇从需求侧发现了现象,这一篇从供给侧解释了成因。
所以做语种优先级时,这份清单只能当作存在性名单,不能当作重要性排序。真正的排序要用需求侧数据,方法见小语种优先级的成本模型那一篇。
用法三:如何绕开语言数据同源的问题
前面说过,整条链上只有一家。对你的实际影响是:没法用两份独立数据相互验证一门语言的基本信息。
有两个办法可以绕开。一是换一类数据源:不看语言学数据库,看这门语言在实际系统中的落地情况,比如界面语言清单里有没有它、区域数据填了多少、词典文件更新到哪一年。这几层数据来自完全不同的组织,跟码表不存在同源问题。
这几层数据还有个好处:它们回答的是能不能用,码表回答的是存不存在。做项目排期时,前者比后者有用得多。一门语言在标准里存在了二十年,不代表你的技术栈今天支持它。
二是看需求侧:搜索量、本地媒体的用词、当地零售商的商品分类名。这些数据不关心这门语言在标准里叫什么,只反映人们实际怎么说话。
本站量过几层这类数据,比如界面语言包的完成度和区域格式数据的自有率,两层都可以用来交叉验证。
用法四:把这套读法用到其他注册库
这一篇真正可以复用的是读注册库的方法,那几个数字倒在其次。
任何把决策过程公开归档的机构,都可以这样读:先看谁在提,再看提交人分几类,然后按类别算通过率,最后看每年的量取决于谁。四步做完,就能知道这份数据的边界在哪里。
能这样读的库不止这一个。域名争议的裁决库、标准组织的提案库、平台的政策变更记录,结构都类似。公开归档的只是被记录下来的那部分事实,记录密度取决于有多少人参与。
还有一个实际用途:这类库可以用来查竞争对手。如果你的品类涉及某个需要注册或备案的环节,翻看那个环节的公开档案,能看到同行在什么时候做过什么动作,比任何行业报告都具体。
用法五:如果你确实要提交一份语言代码申请
前面三条落空的预期,正好可以反过来当作建议。
第一,先确认变更类型填对。创建、拆分、合并、修改、注销,五种类型的举证要求完全不同,拆分最难。第二,别为了显得郑重去拉一批人联署,也别把表格写成论文。第三,把精力放在唯一那条硬判据上:互不相通,并且要有可核查的证据,印象不算数。
第四,也是最实际的一条:找一位提交过十次以上的人合作。数据摆在那里,第一次自己提交的通过率是27.4%,找熟手合作是73.0%。
不过,对绝大多数做跨境电商的读者来说,这一条的价值不在于真去提交申请,而在于认识到:你以为的国际标准,很多时候是几十个人的工作量堆出来的。
常见问题解答
这616份是全部的语言代码申请吗?
不是。这616份是附了单独申请表的部分,主要对应创建新语言代码这一类。合并、注销、改名这几类通常不需要单独附表,信息直接写在主申请里。整个库的申请总数比这个大,上一篇统计的是1423条申请、2250行变更。
为什么截到2022年,不看最近几年?
因为2022年之后的附件在库里还没铺全,逐年抓下来会有缺口。用一个样本不完整的年份去算占比,很容易算出一个假趋势——这一篇里已经因为格式变更栽过一次,不想再栽第二次。
那家机构占比这么高,这份清单可信吗?
可信度和独立性是两件事。这批申请的专业水准没有问题,做调查的人是这个领域里最有经验的一批。有问题的是你没有第二个独立来源可以拿来对照,所以任何基于它的判断都要留一点余量,尤其是涉及语言数量、语言划分这类结论的时候。
中国境内的语言,国内有机构在做这件事吗?
就这616份表格的署名来看,2006到2022年之间没有来自中国境内邮箱的申请。这不代表国内没有相关研究,只代表这些研究没有走这条国际登记的通道。这两件事是分开的:国内的语言调查成果和国际标准里的登记,之间没有自动的传递机制。
我做的语言在这个库里查不到任何申请,说明什么?
说明它的登记信息在这些年里是稳定的,你按现有代码建的一切不会突然失效。这是好消息。要注意的只有一点:稳定不等于准确,也可能只是没有人去核过。
提交一份申请要等多久?
中位数大约一年。这个库一年只发布一到两次变更,所以实际等待时间取决于你提交的时点离下一个生效日有多远。极端的例子上一篇提过,有一份申请等了十七年才有结果。
本文标题:《ISO 639-3语言代码申请书过半出自同一组织,616份署名逐份拆解》
本文链接:https://zhangwenbao.com/minor-language-code-who-files-requests.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0