德语站的正文早已换成带星号的包容写法,可搜索框里用这种写法的人还是零
本文目录
- 为什么这一批词在正文里已经铺开,搜索量却始终是零?
- 先说清楚这篇文章处理的是哪一层问题
- 正文里的采纳速度和搜索框里的采纳速度完全不同步
- 判别法只有一句:这个变化要不要用户多按一个键
- 这是全站唯一一类有保质期的正字法
- 星号、冒号、中圆点插在词中间,机器会读成什么?
- 非字母字符默认就是词边界
- 切开之后两边的碎片都没有搜索量
- 可见符号和不可见字符的机器后果是一样的
- 官方规范到今天给出的结论是什么?
- 德语正字法委员会的立场
- 各地行政规定的方向并不一致
- 规范状态对关键词工作的实际影响
- 屏幕阅读器读到这些符号会怎么念?
- 不同软件的处理方式不统一
- 使用者调查给出的是分布不是结论
- 把无障碍这笔账单独记
- 四种替代写法里,哪一种同时满足三方要求?
- 三个审阅者各自的最优解不一样
- 四种候选写法各自的表现
- 双写全称为什么是安全的
- 中性名词是最省事的一种
- 德语的现在分词名词化为什么是这一层最好的解?
- 一个已经存在几百年的构词法
- 为什么它在三栏里全部及格
- 它跟屈折变化的关系要单独确认
- 商品数据源和广告平台会不会把这些符号清洗掉?
- 特殊字符在数据管道上的旅程
- 标题字符预算被符号挤占
- 结构化数据里放哪一种形态
- 页面上哪些位置可以用包容写法,哪些位置不能?
- 按位置定规则,比按词定规则好执行
- 标题与锚文本是硬约束区
- 正文和问答区是自由区
- 用户生成内容不受你的规则约束
- 词表在这一类词上要多加一个保质期字段
- 三个字段:概念、当前形态、上次确认时间
- 复核的触发条件写清楚
- 跟母语同事的沟通方式
- 上线后该怎么跟踪这条曲线
- 第一个数:查询里特殊字符的出现率
- 第二个数:指人名词族的整体覆盖
- 第三个数:本地同行的写法分布
- 常见问题解答
- 正文用包容写法会不会直接影响排名?
- 为什么不干脆把所有写法都覆盖一遍?
- 中性名词会不会显得回避问题?
- 这个问题在法语和西班牙语里一样吗?
- 怎么说服团队接受按位置分区的方案?
- 词表里的时间字段具体记什么?
- 用户生成内容里出现特殊字符写法要不要处理?
- 权威参考资料
摘要:德语里指人的名词有一族新写法,用星号、冒号或者下划线把两种词尾并进一个词。这些符号在页面上只占一个字符,在分词器眼里却是一道词边界,于是那个词被切成两半,传统写法和新写法两边的查询都接不住。本文按品牌合规、无障碍、检索三方各自的最优解拆开这一层,指出唯一的交集,并给词表加一个别的词类都不需要的字段。
为什么这一批词在正文里已经铺开,搜索量却始终是零?
先说清楚这篇文章处理的是哪一层问题
德语里指人的名词分阴阳两套形态,顾客、学生、作者都是如此。
要同时指代两种人,传统做法是把两个完整的词都写出来。
近些年出现了几种更紧凑的写法,用一个符号把两套词尾并进一个词。
星号、冒号、下划线、中圆点,各家用的符号不完全一样。
这篇文章不讨论该不该用,只讨论用了之后关键词覆盖会发生什么。
做德国文创礼品那个站的时候,这件事是市场部先提出来的,理由是品牌语气要跟上当地的表达习惯。我们当时觉得这是个纯文案问题,改就改了,直到三个月后做词表复核,才发现有一整批指人的名词在搜索侧彻底不在场。
之所以要先划这条线,是因为这个话题在中文圈的讨论里几乎全是立场之争,而立场之争对做站的人没有任何操作价值。你需要知道的只有一件事:不管最后决定用哪种写法,页面上都必须有一个能被检索系统当成完整词元处理的形态在场,这一条跟立场无关,是工程约束。
正文里的采纳速度和搜索框里的采纳速度完全不同步
这是这一层最核心的一个观察,也是最容易被数据掩盖的一个。
网站、媒体、机构文书里的新写法比例这几年一直在涨。
而搜索框里出现这些符号的比例,几乎一直贴着零。
两条曲线在同一个时间段里,一条上升一条不动。
如果只看内容侧的数据,你会以为这个写法已经成为主流。
DWDS收录的这个动词词条本身就能说明这个话题在德语文本里的活跃程度,用例密度这几年一直在增加。但内容侧的活跃跟查询侧的活跃是两回事,而绝大多数人手里只有内容侧的数据,因为那是自己能数的。
这两条曲线分家还有一个特别容易误判的地方:内容侧的数据是自己能数的,查询侧的数据要么来自第三方工具、要么来自站内日志,多数团队两样都没有认真看过。能数的那个数会自动成为决策依据,哪怕它衡量的根本不是你要的东西,这是所有指标错配的共同起点。
判别法只有一句:这个变化要不要用户多按一个键
不同步这件事听起来像个巧合,其实有一条很硬的规律在后面。
凡是只改变展示效果的规范变化,搜索侧几乎立刻同步。
凡是要求用户改变输入动作的变化,搜索侧永远滞后。
滞后的时长以年计,而且没有任何迹象表明它会自动缩短。
星号和冒号在手机键盘上都要切到符号面板,多按两下。
这条判别法可以推广到任何一次正字法或者书写习惯的变动:先问它落在展示层还是落在输入层。落在展示层的,内容改了搜索也就跟着改了;落在输入层的,内容和搜索会长期分家,而你的关键词表必须同时服务两边。
这条判别法在别的语言现象上也验证过。用户把长词削短是省键,所以搜索侧跑在内容侧前面;变音符号打起来费事,所以不打变音符号的写法在查询里份额一直很高。方向永远是一致的,输入成本低的那一边赢。
这是全站唯一一类有保质期的正字法
正字法这种东西通常几十年不动,改一次是件大事。
这一族写法不一样,它的规范状态每隔一两年就有新的进展。
官方机构的表态在变,各地的行政规定也在变。
于是词表里这一类词的结论,可能一年后就需要重新确认。
别的词类不存在这个问题,德语的复合词规则十年不会动一次。
这条特性直接决定了词表结构:这一类词需要一个别的词类都不需要的字段,用来记录上一次确认的时间。这跟德语复合词那种一次做对就能长期不动的工作完全是两种性质,管理方式也得跟着换。
有保质期这件事还带来一个组织上的后果:这一族词不能一次性交付完就撤人。别的语言层工作做完可以交给流程去维护,这一类必须留一个明确的负责人,哪怕他一年只需要花两个小时。没有负责人的结果不是没人做,是所有人都以为别人在做。
星号、冒号、中圆点插在词中间,机器会读成什么?
非字母字符默认就是词边界
分词是检索链路上最靠前的一步,也是最不透明的一步。
默认规则很简单,遇到不是字母也不是数字的字符就切一刀。
星号插在词中间,那个词就被切成前后两段。
前一段是词干,后一段是阴性词尾,两段单独都不是完整的词。
于是这个页面在传统写法和新写法两边的查询上都不在场。
Unicode的文本分段标准附件定义了默认的词边界判定规则,星号、冒号、下划线在这套规则里的处理各不相同,值得逐个确认而不是凭印象假设。这跟缩略语用冒号接格尾被切开是同一个机制的另一次发作,只不过那一次符号在词尾,这一次符号在词中间。
值得注意的是不同符号在这套规则里的待遇并不相同。有些符号在特定上下文里不构成词边界,有些无条件构成。凭直觉假设所有符号一视同仁,是这一层最常见的一个想当然,正确做法是把你实际用到的那几个符号逐个查一遍规则,十分钟能查完。
切开之后两边的碎片都没有搜索量
被切出来的词干在德语里通常不是一个能独立使用的词。
被切出来的词尾更是如此,它只是一个构词成分。
两个碎片各自的查询量都接近零,加起来还是零。
这跟一个词被拆成两个都有量的词是完全不同的情况。
后者至少还能捞回一部分流量,前者是彻底归零。
这个后果比它看起来更严重,因为指人的名词恰好是购买意图最明确的一类词。顾客、买家、送礼的人、收礼的人,这些词后面往往跟着的是具体需求。整族词一起失效,损失的不是长尾而是中腰部。
这一族词还有一个特点让损失被进一步放大:它们经常出现在页面标题和分类名里,而不是埋在正文中间。标题里的词一旦失效,整个页面在这个概念上的主题信号都会变弱,影响的不只是那一条查询,而是这个页面被判定成关于什么的整体判断。
可见符号和不可见字符的机器后果是一样的
去年我们处理过一次隐形字符导致的标题拆分,机制跟这次一模一样。
区别只有一个,那次插进去的字符肉眼看不见。
这一次插进去的符号明明白白地显示在页面上。
可见与否只影响人的感受,不影响机器怎么切。
所以看得见反而更危险,因为它会让人误以为自己知道发生了什么。
这一条跟为了排版往词里插看不见的字符那次的结论是连着的:只要改动落在字符串本身而不是样式表里,机器就会一起读到。可见性是给人的属性,不是给机器的属性,两者从来不在同一个维度上。
把可见和不可见两类放在一起看,还能得到一条更省事的自检:不管符号看不看得见,只要它出现在会被存进数据库、被写进接口、被拼进链接的那个字符串里,就按会被机器读到来处理。判据是它写在哪儿,不是它长什么样,这一条能省掉大量逐个符号的讨论。
官方规范到今天给出的结论是什么?
德语正字法委员会的立场
德语的正字法有一个跨国的官方机构在负责,德奥瑞三国共同参与。
这个机构在2021年3月给出过一份明确的建议。
建议的核心是这类词内特殊字符暂时不纳入官方规则集。
不纳入不等于禁止,而是继续观察其在实际使用中的发展。
这个表态之后几年,官方规则集里补上了一段专门讲词内特殊字符的条款。
这份建议的原文可以直接读,它同时列出了几种被认为符合规范的替代写法,对做词表的人来说这份清单比结论本身更有用。官方规则集的页面上那段关于词内特殊字符的补充条款则给出了更具体的适用说明。
这份建议里最实用的部分其实是那张替代写法清单。它把哪些写法被认为符合规范列得很清楚,而做词表的人真正需要的正是这张清单,不是那个结论。官方文件里最有用的经常不是它的立场,而是它顺带划出来的那个可选集合。
各地行政规定的方向并不一致
德国是联邦制,行政文书的用语规定由各州自己定。
2024年起有几个州在行政和学校文书里限制了这些写法。
另一些州没有类似规定,机构和企业照旧使用。
企业不受行政文书规定的直接约束,但会受到氛围影响。
法语区的情况类似,官方文书层面有过明确的限制性通函。
这些规定管的是政府和公立机构自己怎么写,跟商业网站没有直接的法律关系。但它们会改变一件事:当官方材料不再使用某种写法时,那种写法在正式语境里的出现频率会下降,进而影响用户对它的熟悉程度和输入意愿。这个传导链条很慢,却是单向的。
各州规定不一致这件事对做站的人有个具体影响:如果你的目标客户里有公立机构或者学校,它们所在州的规定会直接影响采购文书的写法,而采购文书里的用词往往就是采购人员搜索时用的词。面向政企的德语站要单独确认这一层,面向消费者的站基本可以忽略。
规范状态对关键词工作的实际影响
很多人把官方表态当成一个该不该用的信号,其实用处不在这里。
它真正的用处是告诉你哪几种替代写法是被承认的。
被承认的写法可以放心用在正式位置上,不会有人挑毛病。
而这些写法恰好也是分词器能正常处理的那几种。
规范和检索在这一层的结论意外地一致。
这种一致不是巧合。被承认的写法之所以被承认,是因为它们没有引入词内的非字母字符,仍然是合乎构词法的完整词。合乎构词法这件事,同时也是分词器能正确处理的前提,两套评判标准背后是同一条约束。
这条一致性还能反过来当成一个检验工具。当你不确定某个新写法能不能用的时候,先问它是不是一个合乎构词法的完整词。是的话,规范和检索大概率都能接受;不是的话,两边大概率都有问题,不必再分别去查两遍。
屏幕阅读器读到这些符号会怎么念?
不同软件的处理方式不统一
读屏软件遇到词内的星号时,行为并不一致。
有的会把符号名念出来,有的会插入一个短暂的停顿。
有的按用户的标点朗读设置来决定,取决于个人配置。
同一个页面,两个使用者听到的可能是两种东西。
这跟视觉呈现的情况正好相反,视觉上大家看到的完全一样。
面向读屏兼容性的设计指南解释了这类内容为什么难以预测,核心原因是朗读行为同时取决于软件、语音引擎和用户设置三者,页面作者只能影响其中最弱的那一环。
这种不一致带来的实际后果是你无法在验收清单上写出一条可核对的标准。视觉呈现可以截图对比,朗读行为没法截图,只能实机测试,而实机要测几套组合才算数又没有公认答案。凡是无法被写成可核对标准的要求,最终都会退化成个人偏好,除非你把它换成一个能核对的代理条件。
使用者调查给出的是分布不是结论
关于读屏用户实际使用什么软件、什么配置,有持续多年的调查数据。
调查显示主流软件的份额相当分散,没有哪一家占绝对多数。
份额分散意味着你无法针对某一个软件做优化。
只能选择那些在所有软件上表现都可预测的写法。
这个判断标准比追求某个软件上的最佳效果更稳妥。
读屏用户调查的结果页提供了这类分布数据,可以直接拿来当作决策依据。需要注意的是调查样本以英语用户为主,德语用户的软件分布未必相同,但份额分散这个结论在各语言区大体一致。
调查数据的另一个用法是给内部讨论提供一个共同起点。当有人主张某种写法读屏软件处理得很好时,问一句他说的是哪一款软件、什么配置,多数情况下对方给不出答案。把分布数据摆出来之后,讨论会自动从软件表现转到应该选可预测的写法上。
把无障碍这笔账单独记
无障碍和检索在这一层的诉求碰巧接近,但它们不是同一件事。
把两者混着汇报,将来复盘时会分不清收益来自哪一侧。
记账要分开,评估标准也要分开。
无障碍看的是可预测性,检索看的是词元完整性。
两者恰好指向同一批写法,纯属这一层的运气。
正因为是运气,就更不能把它当成通用规律去别处套用。别的场合里这两者经常是打架的,比如把重要信息做成图片对视觉设计有利、对读屏和检索都不利。诉求一致的时候要庆幸,但不能因此假设它们总是一致。
这一条推广开来是:两件事目标一致的时候,仍然要用各自的标准分别验收。合并验收会让其中一项的通过完全依赖另一项,等到某天两者不再一致时,被依附的那一项会毫无征兆地失守,而没有人会立刻发现,因为验收表上根本没有它的位置。
英文世界的大型风格指南也在处理同一类问题,只是英语不需要改动名词本身,所以它们的规则集中在代词和职业称谓上。微软风格指南里关于无偏见表述的一章给出的判断框架可以借用,但它的具体条目搬不到德语上,因为两门语言的问题根本不在同一个语法层次。
四种替代写法里,哪一种同时满足三方要求?
三个审阅者各自的最优解不一样
这一层的特殊之处在于同一个词要同时通过三道审阅。
品牌和合规那一侧希望用最能体现立场的紧凑写法。
无障碍那一侧希望用朗读行为最可预测的写法。
检索那一侧希望用分词器能识别成完整词元的写法。
三方各自的最优解互不相同,这才是真正的难点。
多数关于这个话题的讨论只站在其中一方,所以给出的结论看起来都很确定,实际上都不完整。把三方的要求并排列出来之后,问题就从该选哪个变成了哪一个选项在三栏里都及格,这是一个能被回答的问题。
三方审阅这件事本身也是一个可复用的分析框架。凡是遇到一个字符串同时被多个部门关心的场景,先把每一方的最优解各自写下来,再看有没有交集。有交集就选交集,没有交集才需要谈判。大多数争论其实是因为没人先把三栏并排列出来,各方都以为对方在无理取闹。
四种候选写法各自的表现
第一种是特殊字符写法,紧凑、立场明确,但分词器会切开。
第二种是词内大写写法,不引入符号,但读屏和分词都不稳定。
第三种是双写全称,两个完整的词并列,谁都能正确处理。
第四种是换成中性名词,一个词解决问题,但不是所有概念都有现成的。
四种里只有第三和第四种在三栏里都及格。
把这四种写法列成一张四行三列的表,贴在文案规范的第一页,比写十条规则管用。新同事看一眼就知道边界在哪,不需要理解背后的分词原理,也不会因为不理解而在某个位置擅自换写法。
这张表还要标明每一种写法当前的实际使用比例,因为及格不及格是技术判断,而选哪一个还要看当地惯例。技术上安全但当地几乎没人用的写法,放在标题里同样会显得别扭,只不过这一次别扭的是文案而不是机器。
这张表列完之后还有一步容易被跳过:拿自己站上已经上线的内容做一次实测,看四种写法各自在站内搜索里能不能被找到。理论推演和实际配置经常不一致,你的检索引擎可能做过某些自定义处理,实测五分钟就能知道。
双写全称为什么是安全的
双写全称的写法里,两个词都是完整的、词典里有的词。
分词器切完之后得到两个有效词元,两边的查询都能命中。
读屏软件按普通词朗读,没有任何特殊处理。
唯一的代价是它长,在标题和按钮这类窄位置上装不下。
但正文里长一点几乎没有成本。
DWDS的顾客词条可以看到这个词两种性别形态各自的用例,双写全称本质上就是把这两个已经存在的词并排放。它不创造任何新的字符串,所以不会引入任何新的处理风险,这是它最大的优点。
双写全称还有一个不太被注意的好处,它在语义上是自解释的。搜索引擎和语言模型读到两个并列的词,能直接建立起它们指向同一个群体的关系,而这种关系在特殊字符写法里是靠人的常识补出来的,机器没有这个常识。
双写全称的长度问题也有缓解办法,就是只在第一次出现时用全称,之后段落里改用中性名词或者传统写法。这样既建立了完整的语义关联,又不至于让全文读起来啰嗦,代价只是需要在文案规范里多写一行说明。
中性名词是最省事的一种
德语里有一批集合名词天生不分性别,指的是一个群体。
用集合名词替换指人名词,一个词就把问题解决了。
它短、它是完整词元、它在词典里、读屏毫无障碍。
问题是不是每个概念都有现成的集合名词可用。
有的时候硬找一个,读起来会很生硬。
顾客群体那个集合名词是一个现成可用的例子,它本身就有独立的搜索量,不需要你去创造需求。这一类词值得单独列一张对照表,因为它们是这一层里唯一不需要任何取舍的解法。
找中性名词的时候有个省事的办法,就是去看当地的招聘广告和政府表格。这两类文本因为法律和规范的原因,很早就在系统性地使用中性表述,积累了一批现成的、已经被广泛接受的说法,直接拿来用比自己造一个安全得多。
德语的现在分词名词化为什么是这一层最好的解?
一个已经存在几百年的构词法
德语可以把动词的现在分词直接名词化,用来指做这件事的人。
这种构词法本身不带性别倾向,复数形态天然中性。
它不是为了这个话题新造的,是语言里早就有的东西。
因为早就有,所以词典收录、语料丰富、用户熟悉。
更关键的是它本身就有可观的搜索量。
这类形态里最常见的一个词条能看出它在真实文本里的分布,词典里的规范条目也早就收了它。这意味着你不是在赌一个新写法会不会流行,而是在使用一个已经流行的词。
这类形态在德语里的地位跟意大利语那种每个形容词都要跟名词改性数的情况正好互补:意大利语的问题是形态必须跟着走,德语这一族的价值恰恰在于它把性别这个维度整个拿掉了,剩下的只有数和格两个维度要处理。
这类构词法在别的语言里未必有对应物,这正是这一层没法跨语言复制方案的原因。法语那种一个市场分成两边的情况提醒过一次同样的道理:语言层的解法必须一门一门地找,能借的只有分析问题的框架。
为什么它在三栏里全部及格
它是一个完整的词,分词器毫无问题。
它在词典里,词干还原和同义扩展都能正确处理。
它读起来是一个普通的德语词,读屏软件正常朗读。
它形态中性,品牌和合规那一侧也接受。
四项全过,这在这一层里是独一份的。
唯一的限制是这种构词法只在存在对应动词的时候可用。有一批指人名词背后没有一个自然的动词,硬造一个现在分词会很别扭。所以它是首选而不是通解,实操上大概能覆盖这一族词的三分之一到一半。
四项全过这件事值得强调一下,因为这一层里所有其他方案都是有取舍的。当一个选项在所有评价维度上都不劣于其他选项时,它就不该被当成一个需要讨论的选项,而该被当成默认值,只有在它用不了的时候才进入讨论。
它跟屈折变化的关系要单独确认
这类名词化形态本身还是要跟着格变化的。
它的变化规则跟形容词一致,不跟普通名词一致。
做关键词表的时候这一点必须显式确认,不能想当然。
变化形态的数量不多,但落点位置不同。
面包屑和列表里用哪个形态,跟正文句子里不一样。
这一层的处理方式跟最高级形容词那族词要跟名词性数格对齐是完全一样的,因为它们走的本来就是同一套形容词变化规则。做过那一族的人可以直接把方法搬过来,连表结构都不用改。
这一层有个具体的坑:这类名词化形态在单数和复数上的行为不一样,复数是中性的,单数仍然要选一个性。所以它只在你要指一个群体的时候好用,指一个具体的人时问题依然存在。做词表时要把这两种用法分开,别当成一个词处理。
商品数据源和广告平台会不会把这些符号清洗掉?
特殊字符在数据管道上的旅程
商品标题不只出现在你的页面上,它还会流进好几个下游系统。
购物数据源、广告投放、比价站抓取,每一站都有自己的字符规则。
星号在一些系统里有特殊含义,会被当作通配符或者标记。
清洗行为通常是静默的,不会有任何提示。
你在自己站上看着好好的,下游拿到的可能已经变了样。
这一层的排查方式是逐站取回实际入库的字符串做比对,而不是看自己发出去的那一份。数据管道上的每一次静默改写,都只能在终点被发现,中间任何一个环节的日志都不会主动告诉你它动过手。
这类静默改写还有一个特别难查的变种,就是某个环节把符号替换成了看起来很像的另一个符号。视觉上几乎分辨不出来,字符串却已经不同了,所有的精确匹配都会失效。查这类问题只能逐字符比对码位,肉眼核对是没有用的。
标题字符预算被符号挤占
各个渠道对标题长度都有限制,超出部分直接截断。
特殊字符本身占位,双写全称更是把长度翻倍。
在有限的字符预算里,这一族词会挤掉别的关键词。
所以标题位上的取舍不只是形态问题,还是预算问题。
这也是中性名词最受欢迎的原因,它最短。
把字符预算算清楚是这一步的前提,做法是列出每个渠道的长度上限,然后按最紧的那个来定标题模板。这跟替代文本的字符上限在不同语言里含义不同是同一类问题,字符数这个单位在跨语言时从来不是等价的。
算字符预算的时候还要留意一件事:不同渠道的截断位置不一样,有的按字符数截,有的按显示宽度截。德语的长词本来就容易触发截断,再加上这一族词的额外长度,标题在几个渠道上被截在不同位置,同一个商品在各处显示出来的名字会不一样。
结构化数据里放哪一种形态
结构化数据的字段是给机器读的,不承担任何表达立场的功能。
所以那里应该放最标准、最不会引起歧义的形态。
多数情况下是中性名词或者传统写法。
特殊字符写法不适合出现在这些字段里。
这跟正文的取舍逻辑不同,不要图省事直接复用。
这条跟正文越本地化越好而结构化数据要写回国际格式是同一条原则的再次应用。面向人的位置和面向机器的位置,优化目标不同,写成一样两边都不讨好。
这里还有一个操作细节,结构化数据的别名类字段可以放多个值。把中性名词、传统写法一并放进去,机器侧的覆盖就完整了,而这个位置不影响任何人的阅读体验,是全站最不需要取舍的地方,能放就都放上。
这里还要提醒一句,别名字段虽然能放多个值,但也不宜把所有变体一股脑塞进去。放进去的每一个值都在向机器声明这是同一个东西,塞入不相干或者极少使用的写法,反而会稀释这个声明的可信度。
页面上哪些位置可以用包容写法,哪些位置不能?
按位置定规则,比按词定规则好执行
给执行者一份词级别的清单,他要先判断这个词属于哪一类。
给他一份位置级别的规则,他只需要看自己在改哪个字段。
位置是明确的、有限的、不需要语言知识的。
所以规范应该写成一张位置清单,而不是一张词表。
这条经验在别的语言问题上同样成立。
位置清单大概十来行就能写完:页面标题、一级标题、正文、按钮、面包屑、替代文本、结构化数据、内部链接锚文本、筛选项标签、页脚。每一行标明允许哪几种写法,新同事看一遍就能上手,不需要理解任何分词原理。
位置清单还有一个隐含好处,它让规则的执行可以被审计。一条按位置写的规则可以用脚本自动检查,一条按词写的规则只能靠人读,前者上线之后一直有效,后者取决于当时看的人是否细心,两者的长期可靠性差着一个数量级。
标题与锚文本是硬约束区
页面标题和一级标题是检索权重最集中的位置。
内部链接的锚文本同样直接参与相关性判断。
这几个位置只能用完整词元,没有商量余地。
用了特殊字符写法,等于主动放弃这几个位置的权重。
代价太大,收益只是表达上的一点差别。
锚文本这一层还有额外的复杂度,因为德语的锚文本本来就要跟着句子的格变化走。屈折语站的锚文本报告里精确匹配那一栏的数字本来就是假的,再叠一层特殊字符,这一栏就彻底没法看了。
这几个位置还有一个共同特征,它们都是会被复制到别处去的字符串。页面标题会进搜索结果、进书签、进分享卡片;锚文本会出现在别人的站上。凡是会被复制走的字符串,都要按最保守的写法来,因为你控制不了它在别处会被怎么处理。
这几个位置还有一个共性是它们的修改成本最高。正文改一段是几分钟的事,改标题要考虑已有排名、已有外链和已经被收录的版本,改完还要等重新评估。越是难改的位置,越要在第一次就用最保守的写法。
正文和问答区是自由区
正文段落里用哪种写法,对检索的影响小得多。
因为正文足够长,同一个概念会以多种形态多次出现。
只要传统写法在文中出现过,覆盖就算成立。
问答区同理,那里本来就该用用户的口吻写。
所以表达立场的空间主要在这两个区域。
问答区还有一个额外的好处,它天然允许同一个概念用不同说法反复出现,这在别的位置会显得啰嗦。小语种的问答长尾没多少人搜但认真写的也没几家,在这一族词上这个判断同样成立,而且问答区正好是唯一能把几种写法一起放进去而不别扭的地方。
正文自由不等于随便,还是有一条底线:同一个概念在正文里至少要有一次以完整词元的形态出现。做法是在第一段或者小标题下的第一句用传统写法或中性名词,之后段落里怎么写都行,这条底线的执行成本几乎为零。
用户生成内容不受你的规则约束
评论、问答、评价里的写法由用户自己决定。
他们几乎全部使用传统写法或者中性名词。
这批内容本身就是最好的真实用法样本。
定规则之前先把这批内容统计一遍,比看任何指南都准。
统计成本极低,导出来跑几个正则就有结果。
这份统计还有一个附加价值,它能让内部关于写法的讨论从立场之争变成数据之争。当双方都在引用外部依据的时候,争论不会有进展;把自己用户的真实分布摆出来,讨论会立刻收敛,因为那是双方都承认的事实。
这批内容还能当成一个免费的趋势监测器。每年把用户生成内容里各种写法的比例统计一次,比例的变化会比任何外部调研更早反映真实用法的走向,因为写的人就是你的用户本人,样本天然贴合。
统计的时候要把评价区和问答区分开数,两者的语体不一样。评价更口语、更接近搜索框里的输入;问答更书面一些。如果两个区域的写法分布出现明显差异,那个差异本身就是语体影响输入的直接证据。
词表在这一类词上要多加一个保质期字段
三个字段:概念、当前形态、上次确认时间
概念列写中性描述,不带任何目标语言的写法。
当前形态列写这一轮确定使用的那一种。
上次确认时间列记录最近一次复核规范状态的日期。
三列就够,不必把所有候选写法都塞进表里。
候选写法放在规范文档里,词表只记当前生效的那个。
时间列是这一类词独有的。别的词类不需要它,因为它们的正确答案不会随时间变化。把这一列加上去之后,每年做一次复核就有了明确的对象,不用凭记忆去想哪些词可能过期了。
这三列还有一条使用约定:当前形态那一列只能有一个值,不许写成两个用斜杠隔开。允许写两个的结果是下游取值的时候各取各的,同一个概念在不同位置出现不同形态,而这正是这套表要防止的事情。
复核的触发条件写清楚
不要定成每季度复核一次,那会变成一件没人做的例行公事。
改成事件触发:官方机构有新表态、主要平台改规则、同行集体换写法。
三个触发条件里任何一个发生,就把这张表拉出来过一遍。
平时不用管,一年可能一次都不触发。
触发时的工作量也不大,因为表只有三列。
事件触发比时间触发更适合这类工作,因为它的变化本身就是事件驱动的。定期复核会在没有事情发生的季度产生无意义的工作,几轮之后大家就开始走过场,等到真有事发生的时候,走过场的习惯已经养成了。
事件触发还需要指定谁来监测这三个事件。官方表态和平台规则可以订阅通知,同行写法要靠定期抽查。把监测责任写清楚之后,这套机制才真正跑得起来,否则触发条件写得再明确,也不会有人注意到条件已经满足了。
除了这三个事件,还有一个值得加进监测清单的信号,就是主流本地媒体的写作规范有没有调整。媒体的用词习惯直接塑造读者的熟悉度,它们的变化通常比官方表态更早,也比同行的商业写作更早。
跟母语同事的沟通方式
这个话题在当地是有立场分歧的,问法不当会跑偏。
不要问他觉得该用哪种写法,那是在问立场。
要问他自己在搜索框里会怎么打,那是在问行为。
行为问题几乎人人答得一致,立场问题人人不同。
而你要的恰好是行为数据。
母语者说读着自然不能当验收判据这一条在这里有个新的用法:读着自然反映的是他对书面语的判断,而你需要的是他作为搜索用户的行为,两者在这一族词上恰好分歧最大。把问题换成动作,答案的可靠性会立刻提高一个档次。
这个问法的差别可以再往前推一步:问行为的时候要问最近一次而不是通常。通常会触发对方的自我描述,最近一次触发的是回忆,而回忆比自我描述可靠得多。这一条在做任何用户访谈时都成立,不限于这个话题。
上线后该怎么跟踪这条曲线
第一个数:查询里特殊字符的出现率
从站内搜索日志里统计包含这些符号的查询占比。
这个数在多数站上会是零点几个百分点甚至更低。
关键不是这个数本身,是它的变化趋势。
连续几个季度看,如果它开始明显上升,说明该重新评估了。
在它上升之前,一切按现有规则执行。
这个数是这一层唯一真正需要长期跟踪的指标,因为它直接对应那条滞后曲线。别的指标都是它的下游,它不动,别的也不会动。统计成本几乎为零,一条正则就够。
统计的时候要把几种符号分开数,别合并成一个特殊字符出现率。不同符号的普及程度不一样,合并之后你看到的是一个平均值,而真正有意义的信号往往只出现在其中某一个符号上,合并会把它稀释掉。
统计这个数还要注意排除内部流量和爬虫,这两类流量在站内搜索日志里的占比有时高得离谱,而它们的查询模式跟真实用户完全不同。不排除的话,某个内部同事反复测试的那几条查询会把整个分布带偏。
第二个数:指人名词族的整体覆盖
把这一族词单独拉出来算一次覆盖率。
分母是词表里的概念数,分子是站上有对应落点的概念数。
这个数如果明显低于全站平均,说明这一层还有系统性缺口。
缺口通常集中在筛选项和面包屑这类窄位置上。
补起来不难,难的是意识到它低。
算这个数的时候要按概念而不是按字符串来算,因为同一个概念有好几种写法,按字符串算会得到一个虚高的分母和一个虚低的覆盖率,两头都不准。字符层看不出重复而信息层十份一样那篇讲的是同一个道理的反面,这里是字符层看着有很多行、信息层其实只有几个概念。
这个覆盖率还建议按位置拆开看一次,正文的覆盖率通常很高,窄位置的覆盖率通常很低。整体数字看着还行的时候,拆开看往往会发现问题全部集中在两三类组件上,而那几类组件恰好是模板生成的,改一次全站生效。
覆盖率算出来之后,最好把缺口清单直接生成成一张待办表,每行写清楚哪个概念缺在哪个位置。抽象的覆盖率数字很难推动工作,一张具体到组件的待办表可以直接派给前端,两者的执行率差距非常大。
第三个数:本地同行的写法分布
挑五到八家本地同行,统计它们在标题里用的是哪种写法。
这个分布是当地商业写作惯例最直接的样本。
每年看一次就够,它变化得比想象中慢。
如果分布开始明显偏移,那是比任何官方表态都早的信号。
因为商业写作跟着受众走,比规范文件反应快。
统计的时候要把标题和正文分开数,很多站的做法是正文用包容写法而标题用传统写法,这个内外有别本身就是一个信号,说明他们也遇到了同样的取舍并且做了同样的选择。看到三家以上都这么处理,你基本可以确认自己的方案是当地的主流做法。
看同行的时候还有一个信息容易被忽略,就是他们的改动时间。如果某几家是在同一个季度里集体换的写法,那多半是响应了某个外部事件而不是各自独立判断。找到那个事件,你就找到了这一层真正的驱动因素,比看结果本身有用得多。
还有一个观察角度是看同行有没有在同一个页面上同时使用两种写法。同一页混用通常说明他们也在做位置分区,只是没有对外说明。否定形态那一族词上也出现过类似的混用现象,机制是一样的:正文表达和检索命中被分配到了不同的位置上。
常见问题解答
正文用包容写法会不会直接影响排名?
正文段落里用哪种写法,对排名的直接影响很小,因为正文足够长,同一个概念通常会以多种形态多次出现,只要传统写法或中性名词在文中出现过,相关性判断就能成立。真正有影响的是标题、一级标题、内部链接锚文本这几个权重集中的位置,在那里用特殊字符写法等于主动放弃这几个位置。所以结论不是不能用,而是分位置用。需要补充的是这个结论只适用于长正文页面,商品列表页和筛选页的文字总量很少,同一个概念往往只出现一次,那里的容错空间要小得多,基本要按标题的标准来处理。
为什么不干脆把所有写法都覆盖一遍?
因为特殊字符写法的查询量接近于零,为它建行、找落点、维护变体,投入产出比极低。更重要的是它在被分词器切开之后根本形不成一个可匹配的词元,就算你在页面上写了,也不会因此命中任何查询。覆盖的前提是那个字符串能被检索系统当成一个整体处理,这一族写法恰好不满足这个前提,所以它不是覆不覆盖的问题。换个角度说,覆盖这个动作的前提是那个字符串在检索系统里能被当成一个可匹配的单位,不满足这个前提的写法,写进页面只增加字符数不增加任何命中机会。
中性名词会不会显得回避问题?
这是文案和品牌层面的判断,不在本文的讨论范围内。从检索角度看,中性名词是唯一一种在词元完整性、朗读可预测性和字符长度三方面同时最优的写法,而且多数中性名词本身就有独立的搜索量。实操上常见的做法是标题和结构化数据用中性名词或传统写法,正文和问答区留给品牌自己决定,两边各取所需。另外要说明的是中性名词并不总是可用,有些概念在德语里找不到自然的集合名词或者现在分词形式,硬造一个读起来会很生硬,这时候双写全称才是那个兜底的选项。
这个问题在法语和西班牙语里一样吗?
机制一样,符号不同,成熟度也不同。法语用的是中圆点,西班牙语出现过用字母替换词尾的写法。共同点是都往词内引入了非常规字符,都会被分词器切开,都在搜索框里份额极低。区别在于各语言区的官方立场和普及程度差异较大,所以每个市场都要单独确认一次,不能拿德语的结论直接套用。还有一个值得注意的差别是各语言区的替代方案丰富程度不同,德语因为有现在分词名词化这条现成的路,选择空间明显比其他语言大,别的语言往往只剩双写全称一个安全选项。
怎么说服团队接受按位置分区的方案?
把三方要求列成一张表,让大家看到没有任何一种写法能在所有栏里得满分,问题就从选哪个变成了在哪个位置选哪个。这个转换本身能消掉大部分争论,因为它承认了每一方的诉求都是合理的,只是不能在同一个位置同时满足。再配上自己站内用户生成内容的写法统计,讨论通常在一次会议内就能收敛。如果争论仍然僵持,还有一个办法是把决策颗粒度降到单个位置:先就标题这一个位置达成一致,别的位置暂时不动。范围缩小之后结论容易得多,而标题本身已经解决了大部分的检索损失。
词表里的时间字段具体记什么?
记最近一次确认这个概念当前形态时的日期,以及确认时依据的是什么。依据可以是官方机构的表态、平台规则的更新,或者同行写法的统计。有了这两项,下一次复核时可以直接判断依据有没有变化,不用重新做一遍调研。字段本身很小,价值在于它把一次判断的上下文保存了下来,而不是只保存结论。另外建议把依据的链接也一并存下来,而不只是写一句依据是官方表态。半年后回头核对时,能直接打开原文比重新去搜一遍省事得多,而且能确认那个页面本身有没有被更新过。
用户生成内容里出现特殊字符写法要不要处理?
不要改动用户写的原文,那是真实语料,改了就失去了统计价值。需要做的是在展示层保持原样,同时在建立站内搜索索引时对这些符号做归一化处理,让搜同一个概念的人都能找到相关内容。原始数据保留、派生数据归一化,这条原则在所有涉及字符改写的场景里都成立。还要注意归一化规则要同时作用在索引侧和查询侧,只做一边等于没做。另外原始内容里的写法值得单独存一份统计,它是你手上唯一一份不受任何编辑加工影响的真实用法样本。
权威参考资料
本文标题:《德语站的正文早已换成带星号的包容写法,可搜索框里用这种写法的人还是零》
本文链接:https://zhangwenbao.com/minor-language-gender-inclusive-spelling-keyword-coverage.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0