正文里的缩写实测176种:在同一页上解释过的只有三分之一

正文里的缩写实测176种:在同一页上解释过的只有三分之一
张文保 20 分钟阅读 3,858 阅读
本文目录
  1. 为什么核对一个说法,会只拎走一个词?
  2. 怎么判定一个词算不算缩写?
  3. 识别:连续大写字母串
  4. 解释:同一页里有没有展开形式
  5. 三档口径都跑了一遍
  6. 那么实测下来,解释过的有多少?
  7. 覆盖面比密度更值得看
  8. 只出现一次的那84种,问题出在哪儿?
  9. 官方文档做得好在哪,差在哪?
  10. 品牌把自己的名字写成全大写,程序怎么分?
  11. 同一个词换成别的语言,还是同一个词吗?
  12. 三种词的翻译处理完全不同
  13. 还有一类更隐蔽:名字被听错、被拼错
  14. 哪些站一个缩写都不解释?
  15. 这件事对被引用到底有多大影响?
  16. 三类词,三种处理方式
  17. 第一类:全民常识词
  18. 第二类:行业词与认证名
  19. 第三类:自创词与型号名
  20. 一份可以直接用的检查顺序
  21. 怎么快速查一遍自己的站
  22. 这件事什么时候可以放着不管?
  23. 这一趟量下来,尺子在哪儿会歪?
  24. 排除排版词的规则会误伤真缩写
  25. 连字符缩写会被切成两半
  26. 首字母连读的判据会漏判也会误判
  27. 常见问题解答
  28. 三分之二的缩写没解释,是不是意味着要全部补上全称?
  29. 用缩写标签把全称写在标题属性里,算不算解释?
  30. 品牌名全大写到底要不要改?
  31. 为什么要看同一页里有没有解释,跨页算不算?
  32. 只出现一次的缩写占近一半,这算不算正常?
  33. 中文内容有没有同样的问题?
  34. 这份实测能复现吗?
  35. 权威参考资料

摘要:拿124个英文正文页数了一遍里面的缩写:176种、出现753次,其中在同一个页面里能找到展开形式的只有59种,占33.5%;按出现次数算是177次,占23.5%。同一把尺子跑谷歌搜索官方文档的160个页面,是197种3637次、解释过44.2%。更麻烦的是分布:176种缩写里有84种在整批语料里只出现过一次,占47.7%;51个用到缩写的站里,有28个站一个缩写都没在页内解释过,超过一半。另外发现一类容易被漏掉的情况:品牌把自己的名字写成全大写,程序分不清那是个名字还是个缩写。

八月底那份公开的品牌提示词实验记录里,有一组数字一直没被人拿出来讲。模型核对某个说法是不是原文这么写的时候,会把一段文字加上引号去检索;那批记录里一共901个引号串,其中55.4%是2到4个词,而整整33.3%,也就是300条,只有一个词。

一个词。不是一句话,不是一个短语,就是一个词被单独拎出来去问:这个东西是不是真的出自这儿。那份记录把每一条子查询的形态都拆了档,单词那一档是第二大的一档。

那么值得问一句:你正文里那些单拎出来就是一个词的东西——缩写、型号名、自创的产品名——在你这一页上,读得到它是什么意思吗。这件事能自己数,下面这一趟就是照着这个问题设计的。

为什么核对一个说法,会只拎走一个词?

先把那份记录里的分档摆清楚。901个引号串拆下来:2到4个词的499条,多是品牌名、职位名、栏目名;单个词的300条;编号和代码类的78条,包括税号、案卷号、文件名;5个词以上的完整句子只有24条,占2.7%。

单词那一档为什么这么多,原因不难想。一个词如果足够特殊,它本身就是最强的检索条件——型号名、成分名、认证名、自创概念名,这些词在全网出现的次数有限,拿它去检索比拿一整句话更容易命中。反过来,一整句话逐字匹配的成功率很低,写的人稍微改一个标点就断了。

这就带来一个很实际的后果:你内容里最容易被单独拎走的,恰恰是那些最不像人话的词。它们在页面上被使用,却不一定在页面上被解释。

这件事和实体消歧是同一条链路的两端。消歧讲的是同一个名字指向多个对象时怎么分开,本篇讲的是一个名字在你这一页里根本没有对应的解释,连消歧的材料都不给。

怎么判定一个词算不算缩写?

这一步比想象中麻烦,而且直接决定后面所有的数。

识别:连续大写字母串

基础规则是抓2到6位连续大写字母,允许中间带一个连字符或点号,这样OEKO-TEX这种整体识别,不会被切成两半。然后排掉两类明显不是缩写的:星期与月份的英文简写、罗马数字、以及THE、AND、NEW这类被拿来当排版效果的常用词。

解释:同一页里有没有展开形式

判定一个缩写在页内解释过,用三条规则中的任意一条:括号里写着这个缩写、缩写后面紧跟括号、或者页面里存在一串首字母连读正好等于它的大写词组。第三条能抓到最常见的那种写法,也就是先写全称再写缩写。

要注意这条判据管的是同一个页面。跨页解释不算——因为被拎走的时候,对方手上就这一页。

三档口径都跑了一遍

最难的是排除全大写的排版词。品牌文案里大量把普通英文词写成全大写当强调,RISE、FREE、LIVE、HOUR都出现过,它们不是缩写。我试过一条自动规则:如果这个词的小写形式在整个语料里作为独立单词出现过,就判为排版词剔除。结果它连URL、HTML、API、AMP一起剔掉了,因为这些词的小写形式在代码示例里到处都是。

所以三档口径并列跑,把定义的敏感度直接量出来:

口径做法种类出现次数解释过的种类占比解释过的次数占比
全部连续大写串,只排日期与虚词26090825.8%21.1%
再剔除小写形式出现过的17064133.5%25.1%
严口径加技术缩写白名单放回17675333.5%23.5%

种类数从260变到170,差了三分之一;可解释率这一列只在25.8%和33.5%之间动。绝对数对定义极其敏感,比值反而稳。做这类统计的时候,能报比值就别报绝对数。

那么实测下来,解释过的有多少?

按准口径,124个英文正文页里有91个页面出现了缩写,占73.4%。总共176种、753次,页内能找到展开形式的59种、177次。

指标品牌正文页谷歌官方文档
页数124160
缩写种类176197
出现次数7533637
页内解释过的种类33.5%44.2%
页内解释过的次数23.5%27.7%
只出现一次的种类47.7%30.5%

把出现次数排前面又从没解释过的挑出来看,分布很说明问题:

缩写出现次数涉及页数属于哪一类
LED725全民常识词
某汽水品牌名352品牌名写成了全大写
USB294全民常识词
OEKO-TEX213材料认证名
RGB与它的三个变体354行业规格名
某家居连锁名121品牌名写成了全大写
DSLR101行业词
FSC53材料认证名

三分之二的缩写从头到尾没在它出现的那一页上被解释过。注意这不是说读者看不懂——LED、USB这种词绝大多数人都认识,写全称反而啰嗦。真正的问题在另一批词。

覆盖面比密度更值得看

124个页面里91个出现了缩写,占73.4%;官方文档那边160个页面里121个,占75.6%。两边的覆盖面几乎一样,也就是说用不用缩写不是差异点,用了之后管不管才是。这个形态和上一轮量句子时看到的一模一样——被讲得最多的那一项大家做得一样,差距落在没人当指标看的那一项上。

密度差得就远了。品牌页平均每页6次,官方文档平均每页23次。技术文档里缩写本来就密,所以解释率44.2%这个数含金量比看上去高:它是在密度高出近四倍的前提下做到的。反过来,品牌页密度低,逐个补全称的成本其实很小,一页平均也就六个词要过一遍。

只出现一次的那84种,问题出在哪儿?

176种缩写里,84种在整批语料里只出现过一次,占47.7%。官方文档那边是30.5%。

只出现一次,意味着它既不是这个站的核心概念,也没有被复用。这类词有两种来源:一种是顺手提到的行业黑话,另一种是某个具体型号或规格。第二种最麻烦,因为它往往正是能唯一标识这家产品的那个词。

按字母数拆开,分布很集中:

字母数种类占176种典型
2位4425.0%尺码、单位、国家代码
3位9051.1%行业词、认证名、协议名
4位1910.8%规格名、型号前缀
5位及以上2313.1%自创词、复合规格名

三字母那一档占了一半还多。这一档最危险:短到容易和普通英文词撞车,又特殊到足以被单独拎去检索,两头的风险它都占。两位那一档反而不用太担心,多数是尺码和单位,读者和机器都不会误会。

五位以上的23种里,绝大部分是品牌自己造的词或者复合规格名。这一档的解释率最该盯——它们在全网几乎没有别的出处,你这一页要么把话说清楚,要么它就是一条谁也核对不了的孤证。

跨两页以上出现的缩写只有47种。也就是说这批站的缩写使用是高度分散的,每个页面各说各的。这跟建术语库定义页那套做法正好相反,也跟实体权威要靠四阶段慢慢建那条路径对不上——那套做法的前提是先把核心术语收敛成一份清单,而这批站连收敛这一步都没做。

在网页规范这一侧,这件事本来是有工具的。缩写标签就是干这个用的,配合标题属性写上全称;无障碍规范里也把给缩写提供展开形式列成了一条明确技术。实测这批页面里,用上这个标签的极少。

官方文档做得好在哪,差在哪?

对照组的解释率44.2%,比品牌页高10.7个百分点,但这个数本身也不高。翻未解释的清单,最刺眼的一条是某个页面技术的缩写,在14个页面里一共出现214次,从头到尾没有一处写出全称。

排在后面的还有认证组织的简称88次覆盖23页、示例域名用的那个占位词40次、几个协议与格式名。这些词在技术圈是常识,但技术圈的常识边界和读者的边界并不重合。

官方文档赢在另一处:只出现一次的缩写只占30.5%,比品牌页低17.2个百分点。这说明它的术语是收敛的——反复使用的那批词就那么多,新词很少凭空冒出来。术语收敛比逐个解释更根本,因为收敛之后解释一次就够用了。

顺带一提,官方在面向生成式功能的优化指南里专门说过,不必为AI用特定方式重写内容,系统能理解同义表达。这条和本篇不矛盾:同义表达讲的是常见概念的不同说法,而一个只在你这儿出现过的自创词,系统没有别的说法可以对上。

品牌把自己的名字写成全大写,程序怎么分?

这是这一趟顺带发现的,也是最有意思的一条。

未解释清单里出现频次排前几位的,有好几个根本不是缩写,是品牌自己的名字:某汽水品牌35次、某家居连锁12次、某瑜伽服品牌8次、某卫浴品牌8次。它们的共同点是品牌名本身全大写,于是在任何按大写字母识别缩写的程序眼里,它们和USB长得一模一样。

这件事有两层含义。对我这套统计来说,它是噪音,得单列出来说清楚。对品牌自己来说,它是个真实的风险:一个全大写的名字,机器没有办法判断它是一个实体还是一个首字母缩略词。

解法不在文案里,在标记里。在页面的组织实体标记中把名字写成正常大小写,或者用专门的术语定义类型把它声明成一个词条,都能把这件事说死。术语定义这个类型本来就是为自创概念准备的,用的人不多,但它正好对着这个场景。

这一条和17个站把自己写成好几个牌子那件事是同一个毛病的不同表现:名字这件事,写在哪儿、怎么写,从来没有被当成一件正经事对待过。相关的还有用属性共现把模糊品牌喂清楚那套做法,可以配着看。

同一个词换成别的语言,还是同一个词吗?

这一趟只量了英文页面,但缩写这件事在多语言站上会变形,而且变形的方式很固定。

三种词的翻译处理完全不同

认证与标准名基本不译,原样保留大写形式,所以它在任何语言版本里都是同一个可检索的串。行业通用缩写多数也不译,但有些语言会用本地简称,于是同一个东西在两个版本里成了两个词。自创词与型号名最容易出事:有的版本保留原名,有的版本音译,有的版本干脆换成一个描述性短语。

后果是显而易见的。模型拿一个词去核对的时候,它手上那个词是从某一个语言版本上记住的;如果你别的版本里根本没有这个串,那些页面就接不住这次核对。法律已经替你定好这个东西该叫什么那件事讲的是同一个毛病的另一种形态——正确的那个词一次都没进过你的词表。

还有一类更隐蔽:名字被听错、被拼错

品牌名如果是自创词,在语音转文字、自动字幕这些环节上错得特别多,自动字幕把品牌名听成另一个词那次实测量过这件事,而那行错字是会被当成正文抓走的。全大写又没有解释的自创词,在这条链路上几乎没有纠错的机会。

可行的最小动作是保证一件事:不管哪个语言版本,原始的那个串至少在页面上出现一次。译名可以放在前面,原名用括号跟在后面,两边都能被检索到。这个写法顺便也满足了本篇的解释判据。

哪些站一个缩写都不解释?

站级分布比总数更难看。59个站里,51个站的正文里出现过缩写;这51个站当中,有28个站一个缩写都没在页内解释过,占54.9%。

这28个站不是不写全称,是根本没有这个习惯。翻它们的页面能看出一个规律:越是把文案写得轻快、短句多、口语化的站,越容易直接甩一个缩写就往下走。这跟上一轮量句子时的发现对得上——读起来顺和信息完整是两件事,有时候还互相拖后腿。

剩下23个站里,做得最好的那几个有个共同特征:它们的产品本身涉及认证、材料或者技术参数,不写清楚客户就会问。又是业务把这件事逼出来的,不是搜索。

这件事对被引用到底有多大影响?

得说实话:本篇量的是页面上的解释状态,没有做因果实验,所以不能宣称补上全称就会被引用更多。

能确定的是链路上的位置。模型核对一个说法的时候,三分之一的引号串是单个词;如果那个词在你这一页上没有任何解释性的上下文,检索回来的这一页对它来说就是一条孤证——有这个词,但不说明它是什么。这和实体覆盖缺口是一回事,只是尺度更小;标记堆满了但实体之间的关系没人审讲的是同一层的另一面。

另一头也要说清楚,别过度解读。官方明确讲过不必为AI造专用文件、不必把内容切碎、不必换一种写法。把全称写出来不属于这几类,它是一件对人也成立的事:读者第一次见到这个词的时候,也需要知道它是什么。凡是只对机器成立的做法都值得怀疑,凡是对人和机器同时成立的做法基本不会错。

保哥的做法是把它并进现有的发稿检查表,不单独立项,因为单独立项的检查项十有八九会被跳过。

三类词,三种处理方式

照着实测的分布,缩写可以分成三类,处理方式完全不同。

第一类:全民常识词

USB、PDF、LED这一档。不用解释,写全称反而别扭。判断标准很简单:如果它已经进了通用词典,就不必管。实测里这类占了未解释清单的大头,所以三分之二这个数看着吓人,真正需要处理的没那么多。

第二类:行业词与认证名

材料认证、行业标准、协议名这一档。第一次出现时写一次全称,后面全用缩写。成本是一句话,收益是这一页从此自带解释。这一类在实测里的解释率最低,也最值得先改。

第三类:自创词与型号名

最关键的一类,也是最容易被当成常识的一类。规则更严一点:每一个独立页面上第一次出现时都要解释,不能指望读者去别的页面查。如果这个词是一个产品线或者概念名,还该给它一个专门的定义页,并在正文里链过去。

这一类也最该做标记。把自创词写进术语定义类型,或者至少在组织实体标记里写清楚官方名称与常见变体,能让机器不必靠猜。实体主页那套做法解决的正是这个问题的上一层。

一份可以直接用的检查顺序

先抓词,再分类,最后只改第二类和第三类。分类这一步不要交给程序,因为程序分不清全大写的品牌名和缩写,实测里排前几位的未解释词有四个都是品牌名。人工过一遍的成本是几分钟,换来的是后面每一步都不用返工。

改的时候按页面重要度排序,别按词频排序。一个只出现一次但出现在核心产品页上的自创词,比一个出现七十次但全是常识词的LED重要得多。这个排序原则和关于页要怎么写才被认成可信实体那套思路是一致的:位置比频次重要。

怎么快速查一遍自己的站

不用写复杂脚本。把正文复制出来,用正则抓2到6位连续大写字母,去掉常识词,剩下的逐个在同一页里搜一遍有没有全称。二十分钟能查完一批页面。要注意两件事:连字符缩写要整体抓,别切成两半;品牌名如果是全大写,先单独挑出来,它不是缩写。

这件事什么时候可以放着不管?

有三种情况不值得动。

第一种是内容本身就面向极窄的专业读者,比如卖给工程师的技术文档。那个圈子里的缩写是共同语言,写全称反而显得外行。这类页面的读者和机器读到的是同一套词,不存在解释缺口。

第二种是那个缩写在全网已经足够常见,随便一查就有确定答案。判断办法很土:拿这个词单独去搜一下,如果第一屏就能确定它指什么,就不用管。消歧信号那套判据可以拿来做参考,不确定的时候按需要解释处理。

第三种是老文章。已经跑得不错的存量内容不必回头改,把习惯换到新稿上更划算。存量里真正值得单独处理的只有一类:核心产品页上的自创词,那几页值得手工过一遍。

这一趟量下来,尺子在哪儿会歪?

三处,都记下来。

排除排版词的规则会误伤真缩写

这是本篇最大的一次教训。用小写形式是否出现过来剔除排版大写词,逻辑上说得通,实际把URL、HTML、API、AMP这几个高频真缩写一起剔掉了,因为它们的小写形式在代码示例和属性名里大量存在。官方文档那边被这条规则误删的次数高达两千多次,相当于砍掉了语料的一大块。补一份技术缩写白名单放回去之后才对得上。

连字符缩写会被切成两半

第一版正则只抓纯字母串,于是OEKO-TEX被拆成OEKO和TEX两个独立缩写,双双进了未解释清单,凭空多出一种。把连字符和点号纳入整体识别之后修好。同类的还有日期格式那种写法,它不是缩写但长得像。

首字母连读的判据会漏判也会误判

判定解释过的第三条规则是找一串首字母正好连成这个缩写的大写词组。它会漏判那种全称和缩写不完全对应的情况,比如全称里有介词而缩写里没有;也会误判那种碰巧首字母连起来一样的普通词组。抽样看误判很少,漏判更常见,所以实际解释率可能比33.5%略高一点。

还有一条边界:本篇只统计了段落标签里的正文,列表、表格和图片说明里的缩写没有计入。规格表里的缩写密度通常更高,把它们算进来的话总数会明显上升,解释率大概率还会往下走,因为表格里几乎不会写全称。

样本本身也要说清。124个英文正文页来自59个站,每站最多4页,覆盖的是博客、指南、帮助中心和品牌故事这四类,不含商品详情页和分类页。商品页的缩写形态和这四类差别很大,那是另一份工作。

最后是对照组的可比性。谷歌搜索文档站是技术文档,题材本身就更容易出现缩写,所以密度差近四倍这件事不能全算到写作习惯上。可比的是两个比值:解释率和只出现一次的占比,这两项和题材的关系没那么直接,也是本篇真正拿来做对照的两列。

常见问题解答

三分之二的缩写没解释,是不是意味着要全部补上全称?

不是。实测里未解释的那批词有相当一部分是全民常识词,补全称反而让文字变啰嗦。真正该补的是两类:行业认证与标准名,以及品牌自创的概念名和型号名。先把这两类挑出来,量通常只有总数的两三成。

用缩写标签把全称写在标题属性里,算不算解释?

算一半。标题属性对屏幕阅读器和鼠标悬停有用,但它在正文的纯文本里不出现,所以纯文本抽取的通道读不到。稳妥的做法是第一次出现时在正文里把全称写出来,标签只作为补充。本篇的判据也只认正文里的展开形式。

品牌名全大写到底要不要改?

文案上可以不改,视觉风格是品牌自己的事。要改的是机器读的那一层:在组织实体标记里把官方名称写成正常大小写,把常见写法作为别名列出来。这样即便正文里全大写,机器那边也有一条明确的声明可以对上。

为什么要看同一页里有没有解释,跨页算不算?

跨页不算,因为检索和摘引的单位就是这一页。对方拿着你这一页去核对某个词,不会顺着导航去找你的术语表。这也是为什么术语库定义页要在正文里被链到,光有一个页面放在那里,作用有限。

只出现一次的缩写占近一半,这算不算正常?

对照组是30.5%,比品牌页低17.2个百分点,所以47.7%偏高。它反映的不是解释不解释的问题,是术语没有收敛:每篇文章各写各的词,全站没有一份统一的说法。收敛之后解释成本会自然下降。

中文内容有没有同样的问题?

有,而且形态不同。中文里对应的是英文缩写直接嵌在中文句子里,以及行业黑话和自造词。识别要难一些,因为中文没有大小写这个信号。可行的做法是维护一份自己的术语清单,然后在正文里做全文匹配,比自动识别可靠。

这份实测能复现吗?

能。三条规则都写在正文里:识别用2到6位连续大写字母加连字符整体匹配,排除日期虚词与全大写排版词,解释判据用括号写法或首字母连读。三档口径的差异也给出来了,照着跑应该能得到同量级的数。样本是131个品牌站里筛出的英文正文页,换一批站数值会变,但那几条结构性的发现大概率还在。

权威参考资料

分享到
标签
版权声明

本文标题:《正文里的缩写实测176种:在同一页上解释过的只有三分之一》

本文链接:https://zhangwenbao.com/on-page-abbreviation-expansion-audit.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交