生成式搜索先铺到了印尼语和韩语,排在德语法语前面的理由不是人口

生成式搜索先铺到了印尼语和韩语,排在德语法语前面的理由不是人口
张文保 更新 36 分钟阅读 3,067 阅读
本文目录
  1. 三次扩语之间隔了多久,先进去的是哪几门语言?
  2. 五月那次公布,能用的只有一种语言
  3. 八月加进来的两门是日语和印地语
  4. 十一月一口气加了四门
  5. 把三次时间点画成一条轴,能看出什么
  6. 为什么先被覆盖的不是德语和法语?
  7. 按母语人口排,跟实际顺序对不上
  8. 按搜索广告收入排,也对不上
  9. 监管确定性这条线,能对上一半
  10. 移动增量市场这条线,能对上另一半
  11. 覆盖顺序透露的是模型能力还是市场决策?
  12. 底层模型的语言覆盖远大于产品的语言覆盖
  13. 产品先上哪门语言,是运营决策不是技术决策
  14. 这个差值决定了你该等多久
  15. 你的语种到底属于哪一种未覆盖?
  16. 三种状态怎么分
  17. 第三种最容易被误读成第二种
  18. 判别只要两个动作
  19. 早期观察为什么只能靠人工抽样?
  20. 那时候没有一份独立的报表
  21. 自动化抓取拿到的结果不稳定
  22. 人工抽样反而更可复现
  23. 抽样口径怎么定才不会一周换一个说法?
  24. 查询清单一旦定下就不要再改
  25. 语种与市场必须拆成两个字段
  26. 时间、设备、登录状态都要记
  27. 记的是出不出,不是好不好
  28. 覆盖之前该先存下哪三条曲线?
  29. 第一条:问答型查询在你站上的占比
  30. 第二条:精选摘要的占有率
  31. 第三条:品牌词与非品牌词的点击结构
  32. 为什么这三条必须在覆盖之前存
  33. 同一门语言在两个市场的显示率为什么不一样?
  34. 西班牙语在西班牙和墨西哥不是一回事
  35. 葡萄牙语的两个市场差别更明显
  36. 语种、市场、查询类型要拆成三个字段
  37. 哪些动作现在做有用,哪些做了会白费?
  38. 现在做有用的三件
  39. 现在做会白费的两件
  40. 排期怎么排
  41. 怎么跟总部解释你这门语言还没轮到?
  42. 别把未覆盖说成落后
  43. 要一个复检日期,不要一个结论
  44. 常见问题解答
  45. 生成式搜索结果目前支持哪些语言?
  46. 我的语言没被覆盖,是不是说明市场不重要?
  47. 没被覆盖的这段时间,最该做的一件事是什么?
  48. 用脚本批量抓结果页来监测可行吗?
  49. 观察记录该怎么设计表头?
  50. 怎么判断自己属于哪种未覆盖状态?
  51. 该怎么跟总部解释这件事?
  52. 权威参考资料

摘要:生成式搜索这一年扩了三次语种,进去的顺序是英语、日语和印地语、然后是西班牙语葡萄牙语韩语印尼语。德语法语意大利语一门都不在里面。母语人口比德语少一半的印尼语排在前面,说明这个队列不按语言大小排,也不按广告收入排。你要判断的不是自己什么时候轮到,而是轮到之前该先把哪三条基线存下来。

三次扩语之间隔了多久,先进去的是哪几门语言?

五月那次公布,能用的只有一种语言

今年五月的开发者大会上,生成式搜索体验第一次露面。它当时挂在实验室里,需要报名排队,能用的地区只有美国。

语言这一栏写的是英语,而且是美国英语。英国英语、澳大利亚英语当时都不在名单上。

同一天发布的还有支撑它的那个大模型,官方材料里写着支持一百多种语言。两个数字放在一起,一边是一百多,一边是一。

做小语种的人第一反应通常是等。等它把语言补齐,再来考虑要不要动内容。

这个反应本身没错,错的是等的过程里什么都不做。因为等待期的长短,决定了你能不能拿到一份干净的对照数据。

保哥当时带的一个办公文具项目正好铺了六门语言,团队问的第一句话就是德语什么时候能用。答案后来证明是:那一年都没轮到。

把这两个数字的差距写清楚很重要:模型能处理的语言数量,跟产品愿意开放的语言数量,从第一天起就不是同一个量级。前者是能力问题,后者是运营决策。你在等的是后面那个数字,可它的变化速度跟前面那个基本无关,所以拿模型的语言列表去推产品的上线时间,推出来的结论一次也没准过。

八月加进来的两门是日语和印地语

八月中旬,生成式搜索第一次走出英语。官方那篇扩到印度和日本的公告里,新增的两个市场分别配了印地语和日语。

这个组合当时让不少人意外。按常规的国际化排期,英语之后接的往往是西欧几门语言。

日语这一门有它的特殊性。日本市场的搜索行为高度移动化,而且长句提问的比例本来就比英语市场高。

印地语更值得看一眼。它的书写系统是天城文,跟拉丁字母毫无关系,属于技术难度更高的那一档。

换句话说,第二批进去的两门语言,一门是非拉丁书写系统,一门是黏着特征明显的语言。都不是最省事的那种选择。

如果你手上做的正好是日语这类多套文字并存的语言,八月这一次就是你能拿到的第一份真实观察窗口。

把印地语放进第二批,还带出另一件事:印度是一个多语言市场,官方语言表里有二十多门,这次进去的只是其中一门。也就是说,扩语这个动作的粒度是语言而不是国家,同一个国家里可能有一门语言能用、另外十门不能用,这跟大多数人脑子里那张按国家点亮的地图完全不是一回事。印度那十一门语言分摊在九套书写系统上的账,在这里又要重算一遍。

十一月一口气加了四门

十一月初的那次扩展动静最大。覆盖的国家和地区数量跳到一百二十以上,语言一次加了四门。

这四门是西班牙语、葡萄牙语、韩语和印尼语。加上原有的英语、日语、印地语,一共七门。

七这个数字值得停一下。全球网页内容里排前十的语言,有三门不在这张表上。

不在表上的那三门是德语、法语和俄语。其中德语和法语在网页内容语言份额统计里常年排在前五。

这就是本文想说的第一件事:内容供给量最大的那几门语言,不一定是被优先服务的那几门。

我拿这张七语列表跟团队的六语站点对了一遍,重合的只有西班牙语和葡萄牙语两门,剩下四门全落空。

三次扩语之间的间隔也值得记下来:五月到八月是三个月,八月到十一月又是三个月。节奏比多数人预期的快,但每一次加进去的语言数量差别很大,第一次是零、第二次是二、第三次是四。这种加速形态说明限制因素不在语言本身,而在配套的评测与安全流程能不能跟上,一旦流程跑顺了,语言就是批量往里灌的。

把三次时间点画成一条轴,能看出什么

把五月、八月、十一月三个点摆在一条轴上,语言数量分别是1、3、7。

这是一条明显的加速曲线,不是匀速。每次的增量在翻倍。

如果这条曲线继续下去,下一个批次的语言数量会落在十几门这一档。

但曲线只能用来估量级,不能用来估具体日期。它告诉你的是不会很久,不是哪一天。

更有用的是另一个读法:曲线的形状意味着你所在语种进入的时间,跟你的语种排第几关系不大。

因为批量灌进去的时候,第八门和第十八门之间可能只差一个星期。排队顺序在批量模式下会失去意义

所以那年秋天保哥给团队的建议是:别再问德语排第几这个问题了,改问一句更有用的,德语版进去的那一周,我们有没有东西可以拿来对照。这个问法把一个无法回答的时间问题,换成了一个当天就能开始做的准备工作,而后者恰好是唯一能提前做的部分。

为什么先被覆盖的不是德语和法语?

按母语人口排,跟实际顺序对不上

先做个最朴素的检验:把七门语言按母语人口从多到少排,看看跟进入顺序对不对得上。

西班牙语母语使用者接近五亿,排在前面没有疑问。印地语和葡萄牙语也都是两亿以上的量级。

问题出在印尼语。它的母语使用者只有四千多万,比德语少了一半还多。

德语的母语使用者接近一亿,法语也在八千万以上。两门都比印尼语的母语盘子大。

如果按母语人口排队,印尼语该排在德语和法语后面。实际情况是它排在前面。

韩语的情况类似。八千万左右的使用者,跟法语差不多,也走到了前面。

有人会说印尼语要算第二语言使用者,加起来接近两亿。这个修正是对的,但它同时也说明第一个判据本身就不牢靠:一门语言的人口数字有母语口径和总使用者口径两种算法,两种算法排出来的名次能差出十几位,而一个能被口径改写名次的指标,本来就不适合当排序依据

再补一个口径上的细节:一门语言的人口数字要看清统计的是哪一类使用者。标准印尼语在语言数据库里的条目把它跟马来语族其他变体分得很细,同一个名字底下的范围可以差出好几倍。拿一个没写清口径的数字去论证优先级,论着论着就会发现两边说的根本不是同一门语言。

按搜索广告收入排,也对不上

第二个朴素检验:按市场的搜索广告价值排。德国和法国都是欧洲最大的几个广告市场。

按这个口径,德语和法语该排在印尼语前面,而且是排得很靠前。

实际顺序又对不上。所以商业价值这条线也不是主导因素。

这里可以顺手排除掉第三条线:技术难度。天城文和谚文都比德语难处理,却都先进去了。

三条最直觉的解释线索全部落空之后,问题才变得有意思起来。

剩下能解释的因素,得往产品之外去找。

把这三条线一起否掉,还有个副产品:它让你在跟总部汇报的时候不用编故事。很多团队在解释自己的语言为什么没被覆盖时,会下意识地找一个听着体面的理由,比如说这门语言的商业价值不够,说着说着自己也信了,结果做出一堆本不该做的收缩决策。承认原因不在你这一侧,是做出正确判断的前提

顺着广告价值这条线还能再验一次。从搜索引擎份额的公开统计看,德国和法国的搜索行为高度集中在单一引擎上,这本该是最容易做产品灰度的环境,结果反而排在后面。集中度这条线也否掉之后,能留在桌面上的解释就更少了。

监管确定性这条线,能对上一半

德国和法国属于欧盟。那一年欧盟关于人工智能的立法程序正在推进,规则的最终形态还没落定。

欧盟人工智能监管框架的官方说明页那时候写的还是提案阶段的内容,条款仍在谈判桌上。

在一个规则未定的市场先上一个生成式的产品,等于给自己埋一个不知深浅的坑。

这不是猜测某家公司的动机,而是一个可观察的相关性:七门语言对应的主要市场里,欧盟成员国的比重明显偏低。

把这条线单独拿出来,能解释德语法语意大利语荷兰语一起缺席这件事。

但它解释不了俄语的缺席,也解释不了为什么韩国比德国先进去。所以只能算解释了一半。

需要说明的是,这条线在实务上有个直接用途:如果你的语种主要市场在欧盟境内,那么把上线时间的预期整体往后推一到两个批次,比按语言排名去估更接近真实。这个推迟不是因为你的语言不重要,而是因为产品方要等的东西根本不在语言这一层。

移动增量市场这条线,能对上另一半

把七门语言对应的主要市场再看一遍:印度、日本、印尼、韩国、巴西、墨西哥、西班牙。

这里面有四个是移动互联网用户增量最大的那一批市场。印尼那年的数字报告里,互联网用户数字仍在两位数增长。

德国和法国的互联网普及率早就接近天花板,增量几乎为零。

一个新产品要拿真实使用数据来调,去增量市场拿的数据密度更高,成本也更低。

把监管确定性和增量密度两条线叠起来,七门语言的名单基本能解释完。

这个解释框架有个好处:它可以直接拿来预判下一批。你只要问哪些语言的主要市场同时满足规则清晰和增量还在,答案就自己浮出来了。

顺带说一句,用这套框架去看东南亚会发现一个有趣的错位:印尼语和马来语的关系一直有争议,但产品这一侧的选择干脆利落,进去的是印尼语,马来语没进去。这说明产品方用的判据跟语言学界用的判据不是一套,前者看的是单一市场的用户规模,后者看的是语言本身的独立性。

覆盖顺序透露的是模型能力还是市场决策?

底层模型的语言覆盖远大于产品的语言覆盖

回到五月那个对比:模型侧写着一百多种语言,产品侧只有一种。

这个差值不是暂时的,它是常态。那一代大模型的官方介绍里,多语言能力被放在很显眼的位置。

模型能不能处理一门语言,跟产品愿不愿意在那门语言上开放,是两个独立的开关。

第一个开关早就开了,第二个开关的钥匙在别人手里。

这个区分对小语种团队很重要,因为它决定了你该盯哪个信号。

盯模型的语言列表没用,那张表早就把你包含进去了。要盯的是产品的可用地区与语言公告。

再往前推一层,模型侧的语言覆盖数字本身也需要打折看。一百多种语言里,训练语料充足的可能只有二三十种,剩下的靠跨语言迁移勉强撑住。所以模型列表里出现你的语言,只说明它见过,不说明它擅长。多语言模型铺到七十多种语言那次已经把这个道理演示过一遍了。

产品先上哪门语言,是运营决策不是技术决策

技术决策的特征是有明确的先后依赖:A做完才能做B。运营决策的特征是可以随时插队。

扩语这件事表现出来的全是运营特征。批量、跳跃、跟难度无关。

意识到这一点之后,很多常见的推测方法就可以扔掉了。

比如按书写系统难度推,按语料规模推,按现有搜索份额推。这些推法在运营决策面前全部失效。

还剩下什么能推?只剩下那些会影响运营风险的因素。

规则确定性、市场增量、以及能不能招到足够多的本地评测人员,这三样是运营真正在算的账。

第三样最容易被忽略。一个生成式产品要在某门语言上开放,需要一支能读这门语言的评测队伍来打分和标注问题,这支队伍的规模决定了上线速度。这也解释了为什么使用者基数小但劳动力供给密集的语言,反而可能比使用者多但评测人力稀缺的语言更早进去。

这个差值决定了你该等多久

把模型覆盖和产品覆盖之间的差值当成一个可以估计的量,事情就好办了。

差值大的时候,等待期长,你有充足时间做准备工作。

差值在收窄的时候,等待期短,准备工作要提前启动。

怎么判断差值在收窄?看批量的大小。一次加四门比一次加两门,说明流程已经跑顺。

按十一月这个批量看,我给团队的判断是:第二年上半年会再来一批,规模在十门以上。

这个判断不需要内部消息,只需要把三个公开的时间点连成线。

更重要的是,这个判断的用途不是让你去猜日期,而是让你知道准备工作的截止线大概在哪。如果你估出来是半年,那么基线数据的采集就该在三个月内启动,留三个月的观测窗口才够画出一条有意义的曲线。准备工作的排期由估计值反推,比由确定日期反推更符合实际

你的语种到底属于哪一种未覆盖?

三种状态怎么分

先把状态定义清楚,否则后面的观察全是糊的。第一种是已覆盖:这门语言在公告的名单里,而且实测能看到生成式结果。

第二种是未覆盖:不在名单里,实测也看不到。

第三种最麻烦:在名单里,但你测的那批查询一条都没触发。

第三种状态的存在,是因为生成式结果本来就不是所有查询都出。它对查询类型有偏好。

信息型和比较型的查询触发率高,导航型和明确的品牌词触发率低。

所以同一门语言,你测二十条品牌词得出的结论,可能跟测二十条怎么选类问句得出的结论完全相反。

这三种状态的实务差别很大。第一种要开始做适配,第二种要继续存基线,第三种要做的是换查询清单再测一遍。把第三种误判成第二种,等于白白晚半年动手,而这半年恰恰是竞争最松的时候。

记录的时候建议给三种状态各配一个记号,而不是写一段描述。文字描述会随着记录人当天的心情变长变短,记号不会。这张表最终要给三个月后的自己看,那时候你只关心哪一格变了,不关心当初用了什么形容词,而形容词恰恰是最容易在交接时被理解偏的东西。

第三种最容易被误读成第二种

误读的原因很朴素:大多数人测的第一批查询,是自己站上排名最好的那批词。

而排名最好的那批词,通常是商业意图明确的词。这类词恰好是触发率最低的一档。

测完一圈没看到,结论就成了这门语言还没开放。

正确的做法是反过来:先用最容易触发的那类查询确认语言状态,再用商业词看覆盖面。

最容易触发的是什么类型?以疑问词开头的、寻求解释的、涉及多个选项对比的。

用这类词做状态判定,一门语言只要测十条就能有结论。

这里有个反直觉的操作细节:状态判定用的查询清单,应该跟你的业务关键词表尽量脱钩。业务词表是按商业价值筛过的,天然偏向低触发的那一端,拿它做判定等于用一把偏心的尺子量东西。判定用的清单可以完全是通用生活问题,只要语言对就行。

判别只要两个动作

第一个动作:拿十条疑问句式的通用查询,在目标语言和目标地区各测一遍。

第二个动作:把结果记成三档,全出、部分出、完全不出。

全出对应已覆盖,完全不出对应未覆盖,部分出对应已覆盖但触发受查询类型限制。

两个动作加起来,一门语言二十分钟能做完。

做完之后要记的不是截图,是日期和查询原文。截图会过期,查询原文可以复测。

这份清单一旦定下来就不要再改。改了之后前后两次的结果就不可比了。

保哥在那个办公文具项目里让团队做了一张极简的表:语言、地区、日期、十条查询各自的三档结果。整张表一页纸,每两周更新一次。后来产品扩到德语那周,团队手上有连续四个月的空白记录做对照,谁都说不出这是巧合还是效果这种话。

早期观察为什么只能靠人工抽样?

那时候没有一份独立的报表

常规的搜索表现报表里,生成式结果带来的曝光和点击并没有单独一栏。它跟其他形态混在一起。

这意味着你在报表里看到的数字变化,无法归因到这个新形态上。

更麻烦的是,生成式结果会把原本在第一屏的自然结果往下推,于是点击率的变化里同时包含了两种效应。

一种是被引用带来的增量,一种是被挤压带来的减量,两者混在同一个数字里。

报表工具解决不了的问题,只能靠人工在结果页上直接看。

这不是倒退,很多新形态刚出现的时候都经历过这个阶段。精选摘要当年也是先有人工统计,后有报表字段。

值得多说一句的是,这个阶段的人工数据后来会变得特别值钱。等报表字段补上之后,你能拿到的历史数据从字段上线那天算起,而字段上线通常晚于形态出现好几个月。那几个月的空白,只有当时手工记过的人补得上。手工记录的价值不在当下,在于它是唯一能跨越工具空窗期的数据

自动化抓取拿到的结果不稳定

有团队会想到用脚本批量抓结果页,这个思路在这个场景下不太灵。

生成式结果的加载方式跟普通结果不一样,它需要等待,而且不是每次请求都出。

同一条查询连续测三次,可能出两次不出一次。抓取脚本很难判断这次没出是真的没出,还是没等到。

再加上地区和登录状态的影响,脚本拿回来的样本噪声大到没法用。

如果你的技术栈本来就在处理前端渲染与抓取的差异,会对这类不稳定性有直观理解。

所以早期阶段不建议投入工程资源做自动化,投入产出比很差。

更现实的做法是把自动化用在别处:让脚本负责生成查询清单、记录时间戳、整理表格,把判断出还是没出这件事留给人。人在这件事上的准确率接近百分之百,而脚本在这件事上的准确率可能只有七成,工序分工比全自动更快也更准。

人工抽样反而更可复现

人工抽样听着土,但它有一个自动化比不了的优点:口径写在纸上,谁来做结果都一样。

十条查询、两个地区、固定的时间段、固定的设备类型,这套口径写成半页纸,交接给任何人都能接着做。

脚本一旦换人维护,参数被改动一次,前后数据就不可比了。

可复现性在这个阶段比数据量重要。你要的不是一万条样本,是一条能持续四个月不变形的曲线。

十条查询每两周测一次,一年下来是二百六十个数据点,画曲线足够了。

而且这份数据是你独有的。竞品要么没做,要么从更晚的时间点才开始做。

这里可以用一个不太严谨但很好用的比喻:这份手工记录相当于给你的语种拍了一张覆盖前的底片。等到某天生成式结果真的铺过来,你手上有底片,别人只有当天的照片,而没有底片的人永远说不清变化是从哪一天开始的

这套做法还有个组织层面的好处:它不需要立项,不需要排期评审,一个人当天就能启动。工程资源一旦介入,事情就得进需求池排队,排到的时候观察窗口早过去了。用低技术含量换启动速度,在窗口期本身就很短的事情上,几乎总是划算的一笔交易。

抽样口径怎么定才不会一周换一个说法?

查询清单一旦定下就不要再改

清单要在第一次测之前定好,条数不用多,十到二十条最合适。

选词的标准只有一条:这些词在未来一年里不会因为你的业务调整而变得无关。

所以不要选当季主推品的词,那类词过两个季度就没人搜了。

选那些品类里最基础、最常青的问法。它们的搜索量可能不是最高的,但足够稳定。

清单里要有意识地混进不同类型:解释型、对比型、操作型、价格型各占一部分。

类型混合的好处是,当某一类的触发率发生变化时,你能看出是整体变化还是局部变化。

清单固定这件事说起来简单,做起来最大的阻力来自内部。每隔一段时间就会有人建议加几条最近很火的词,理由听起来都很正当。这时候要守住的原则是:想加可以,另开一张表,主表一个字不动。两张表并行的成本远低于一张表被改乱的成本

语种与市场必须拆成两个字段

这是记录格式上最要紧的一条。很多团队把它们合成一个字段,比如直接写西班牙。

合成之后你就永远分不清,某个结果是语言带来的还是市场带来的。

西班牙语在西班牙和在墨西哥是两行数据,不是一行。

同理,葡萄牙语在巴西和在葡萄牙也是两行。英语在美国、英国、菲律宾是三行。

这件事在跨国语言的资产盘点里已经吃过一次亏,报表里语言和国家绑死的站,需要决策那天先花两周拆数据。

拆成两个字段的成本是零,合并之后再拆的成本是两周。这个账很好算。

补充一个容易漏的字段:结果页的界面语言。你用哪种界面语言去测,会影响结果的呈现,尤其在多语言市场。把它记成第三个字段,将来复盘时能省掉很多解释不清的波动。

字段该不该拆,有一条通用规则:凡是将来可能各自独立变化的两个属性,就不能合并。语言标签规范里语言子标签与地区子标签的分离正是这个道理的标准写法,它把语言和地区设计成两段可独立取值的结构,而不是一个整体字符串。你的观察表照着这个结构建就不会错。

时间、设备、登录状态都要记

时间要精确到日期和大致时段。同一天上午和晚上的结果可能不同。

设备类型只分手机和桌面两档就够,但必须记。移动端的触发率通常跟桌面端不一样。

登录状态影响很大,测的时候统一用未登录状态,并把这一条写进口径。

地区的模拟方式也要写死。用什么方法模拟目标地区,中途不能换。

这四项加起来就是一条记录的元数据,比结果本身还重要。

没有元数据的观察记录,三个月后你自己都不敢用。

元数据这件事有一个朴素的检验方法:把你的记录交给一个完全没参与过的同事,让他照着重做一遍。如果他需要来问你任何一个问题,说明口径还有洞。这个检验只要做一次,之后的几个月都省心。

实际操作里最常被漏掉的是地区的模拟方式。有人这次用一种办法,下次换另一种,两次结果的差异就被当成了产品变化。把方法名和参数写进口径的第一行,每次记录之前扫一眼,这个错误就再也不会发生,成本是三十秒。

记的是出不出,不是好不好

早期观察最容易跑偏的地方,是把评价内容质量混进来。

生成的那段话写得准不准、有没有引用你的站,这些都是后面才该关心的问题。

第一阶段只记一件事:这条查询在这个语言这个地区,有没有出现生成式结果。

二元记录的好处是判断标准清晰,不同的人记出来的结果一致。

一旦引入好不好的判断,两个人记同一条查询就会出现分歧,数据的一致性立刻崩掉。

等语言正式覆盖之后,再启动第二阶段,那时候才轮到引用来源和内容质量。

阶段划分这件事,本质上是在控制指标的进入顺序。先上二元指标,等它稳定运行两三个月、口径没人再质疑了,再引入需要判断的指标。反过来做的团队,通常在第三周就因为标准打架而放弃了整套观察。

二元记录还有一个副作用是好的:它逼着你把观察和评价分开。不少团队的监测做不长,原因是每次记录都伴随一轮讨论,二十分钟的活干成两小时,两个月后没人愿意接手。只判断出还是没出的时候,讨论没有发生的余地,记完就散,这才跑得下去。

覆盖之前该先存下哪三条曲线?

第一条:问答型查询在你站上的占比

从搜索表现报表里把带疑问词的查询筛出来,算它们在总曝光里的比重。

这个比重就是你这门语言的问答型流量基线。

为什么要它?因为生成式结果对问答型查询的影响最大,它铺过来之后这一块会先动。

如果你没有覆盖前的比重,事后就说不清这一块是被吃掉了还是本来就在缩。

各语言的疑问词不一样,筛选规则要按语言分别写。德语要筛的是几个固定的疑问词开头。

日语的疑问表达跟词序有关,筛选规则会更复杂一点,但也做得出来。

这里有一个跨语言的陷阱要提前避开:有些语言的疑问句不靠疑问词,靠语序或者句末助词。按疑问词做正则筛出来的比重,在这些语言上会系统性偏低。解决办法不是把规则写得更复杂,而是在口径里注明这门语言的筛法是保守估计,前后一致地偏低不影响趋势判断。

问答型查询这个类别不是我们自己划的。学界评测信息寻求型问答时用的那套横跨多种语言类型的基准数据集,收的正是用户真心不知道答案才去问的那一类问题,跟为了找某个已知页面而输入的导航型查询区分得很清楚。按这个界线去筛你自己的报表,口径会稳很多。

第二条:精选摘要的占有率

统计你在这门语言里,有多少条关键词拿到了摘要位置。

这个数字之所以关键,是因为摘要位置和生成式结果的引用来源之间有明显关联。

覆盖之前的摘要占有率,是你判断自己起点高低的唯一依据。

占有率高的站,在覆盖之后被引用的概率通常也高一些。

占有率低的站,则要先补这一块,而这件事在覆盖之前就能做,不用等。

顺带说,八月和九月那两次富结果类型的削减,让FAQ与操作指南类的展示位少了一大块,摘要位置的相对权重反而上升了。

这条曲线还有一个附带用途:它是少数几个在覆盖前后口径完全一致的指标。别的指标都会因为结果页形态变化而失去可比性,摘要占有率不会,因为它统计的是关键词层面的归属,跟页面上摆成什么样无关。所以它天然适合当跨期对照的锚。

第三条:品牌词与非品牌词的点击结构

把这门语言的点击拆成品牌词和非品牌词两块,记下比例。

生成式结果对这两块的影响方向相反。品牌词受影响小,非品牌词受影响大。

如果你没有拆过,事后看到总点击下降,会误以为品牌也在衰减。

拆开之后你会发现,很多时候品牌词纹丝不动,掉的全在非品牌词那一侧。

这个结构对汇报很有用,它能把一个吓人的总数拆成两个可解释的分项。

小语种站的品牌词还有个特殊问题:品牌名在当地可能有好几种写法,筛选规则要把变体都算进去。

拆分的口径要在一开始就写死到具体的匹配规则,包括品牌名的所有本地变体、拼写错误的常见形态、以及带产品线名称的组合词。这份规则表大概二三十行,一次写好之后每个季度补充一两条即可,比事后回头重新定义省力得多。

为什么这三条必须在覆盖之前存

因为覆盖是一次性事件,它没有预告,也不会给你补采数据的机会。

某个周二你的语言突然能用了,从那一刻起,之前的数据就再也拿不到了。

三条曲线都可以从现有报表里导出,工作量是一个人两天。

两天换一份不可再生的对照数据,这个交换在我看来没有犹豫的余地。

而且这三条曲线在没有生成式结果的情况下也有用,它们本来就是内容策略的基础指标。

所以这件事的下行风险是零:最坏的情况是你多了三张有用的报表。

再补一个操作建议:把这三条曲线的导出做成定时任务,每月一号自动跑一次并存成带日期的文件。人工导出总会在某个忙月被跳过,而缺一个月的曲线在画趋势的时候特别碍事。定时任务的搭建成本大概两小时,一次投入长期受益。

还有一个时间上的细节容易被忽略:三条曲线至少要有三个月的历史才能看出趋势,一个月的数据只是一个点。所以启动时间不能踩着预估的覆盖日期算,得再往前推三个月。按这个推法,如果你估计半年之内会轮到,那么本月就该动手,而不是下个季度。

同一门语言在两个市场的显示率为什么不一样?

西班牙语在西班牙和墨西哥不是一回事

十一月那次公告说的是西班牙语进去了,没说是哪个西班牙语市场。

实际测下来,两个市场的表现有差别。这个差别不来自语言本身,来自市场配置。

产品的地区开放是按国家和地区做的,语言开放是按语言做的,两个维度是交叉的。

所以会出现语言在名单里、你的目标国家不在名单里的情况,反过来也一样。

这就是为什么记录必须拆成语种和市场两个字段,合并了就分不清是哪一边的原因。

西班牙人和墨西哥人搜的本来就不是同一个词,现在连结果页形态也可能不同。

这里出现了一个新的组合维度。以前做多市场同语言,要处理的是词汇分叉和落地页分叉,现在多了一层结果页形态的分叉。三层叠在一起,意味着同一门语言的两个市场,从关键词表到落地页到结果页监测,全都得分开跑,共用的部分比过去更少了。

葡萄牙语的两个市场差别更明显

巴西和葡萄牙的差别本来就比西班牙和墨西哥大,人口体量相差一个数量级。

巴西属于移动增量市场那一档,葡萄牙属于成熟市场那一档。

按前面那套解释框架,两个市场的开放节奏本来就该不一样。

如果你的葡语站是按巴西口径做的,那么葡萄牙那边的观察要单独记。

按巴西身材裁的那件衣服穿到葡萄牙身上处处都紧,这条老经验在结果页形态这一层又应验了一次。

两个市场用同一套观察表,得出的会是一个被平均掉的假数字。

平均值在这里的欺骗性特别强,因为它总是落在两个真实值中间,看着很稳定。等你按这个稳定的数字做了决策,才发现两边都不适用。这也是凡是跨市场的指标都要先看分布再看均值这条老规矩,在生成式结果这件事上的又一次生效。

从公开的数字报告看,巴西那一年的互联网用户结构跟葡萄牙完全不在同一个阶段,移动端占比、社交渗透率、每天上网时长三项都差得很远。这些差异会直接改变查询的句式长度和提问方式,进而改变触发概率,所以两地的观察绝不能合并成一行。

语种、市场、查询类型要拆成三个字段

把前面两节的结论合起来,观察记录的主键其实是一个三元组。

语种决定语言层的处理,市场决定地区层的开放,查询类型决定触发概率。

三者任意一个变了,结果就可能不同。合并任意两个,你就丢掉了一层解释力。

所以那张观察表的表头至少是:日期、语种、市场、查询类型、查询原文、结果三档、设备、界面语言。

八列听起来不少,但每次记录只需要填后面四列,前面四列是固定的。

表格建好之后,每两周花二十分钟填一次,一年就是一份别人拿不到的一手材料。

三元组这个说法值得记住,它可以复用到任何一个新形态的观察上。以后再出现什么新的结果页组件,你要问的第一组问题永远是:它按语言开放还是按地区开放,对查询类型有没有偏好,两者是不是交叉的。问清楚这三件事,观察口径就定下来了。

哪些动作现在做有用,哪些做了会白费?

现在做有用的三件

第一件是存基线,也就是前面那三条曲线,这件事只有现在能做。

第二件是把问答型内容的结构理顺,让每一个问题都有一段独立的、能被单独摘出来的回答。

这件事在没有生成式结果的时候也有价值,它本来就利于摘要位置。

第三件是把本地事实核对一遍:价格、配送时间、退换政策、联系方式,确保这些信息在页面上写得清楚且一致。

这三件的共同点是,无论生成式结果什么时候铺过来,它们都不会白做。

用投资的话说,这三件是无悔投入。做了不亏,铺过来的时候还能立刻兑现。

第三件事经常被低估。生成式结果在回答本地问题时特别依赖页面上的结构化事实,而多数小语种站的这类信息散落在四五个不同页面上,写法还不统一。把它们收拢到一处并保持一致,这件事的工作量不大,收益却横跨常规搜索和生成式结果两边。

现在做会白费的两件

第一件是照着英语市场的引用位打法改内容。那套打法是在已经有生成式结果的环境里摸出来的,你的语言还没有那个环境。

更麻烦的是,等你的语言真的开放了,形态可能已经跟英语市场当初不一样了。

第二件是提前做大规模的内容重写。重写的方向依据尚不存在,等于是在猜。

猜错的成本不只是白干,还包括把原本表现不错的页面改坏。

这两件事的共同特征是:它们的收益依赖一个尚未成立的前提。

无悔投入和赌注投入的区别,就在这个前提成不成立上。

顺便提一个更隐蔽的白费:给还没覆盖的语言单独立项、配人、定季度目标。项目一旦立起来就要交东西,交不出东西就会开始做那些看着像在推进的动作,最后产出一堆报告。等真正该动手的时候,团队的耐心和预算都已经用掉一半了。

判断一件事属于无悔投入还是赌注投入,有个很快的问法:假设生成式结果永远不铺到你这门语言,这件事还值得做吗?答案是肯定的就做,答案是否定的就先放着。这个问法比任何优先级矩阵都省事,而且不需要开会,一个人在工位上就能给所有待办分完类。

排期怎么排

把三件有用的事排进未来两个季度,每件配一个具体的人和一个交付物。

存基线的交付物是一份带日期的表格,不是一句已完成。

问答结构的交付物是改造完成的页面清单和数量。

本地事实的交付物是一份核对表,标明每一项在哪个页面、写的是什么。

三件事加起来的投入,大概是一个内容岗位两个月的部分时间,不需要额外预算。

这个规模的投入不用惊动总部,团队内部就能消化掉,这也是它容易落地的原因。

排期上有个小技巧:把观察记录这件事安排在每两周的固定时间,跟例会绑在一起。绑定到既有的节奏上,它就不会因为某个人休假而断掉。独立排期的低频任务,断掉的概率高得出奇。

交付物的定义要写得具体到可以被别人验收。已完成、已梳理、已优化这类说法三个月后没有任何信息量,而一份带日期的表格、一个页面清单、一张核对表,三个月后拿出来仍然能说明问题,也能直接接上下一阶段的工作,不用重新对齐认知。

怎么跟总部解释你这门语言还没轮到?

别把未覆盖说成落后

汇报时最忌讳的一句话是我们这门语言还落后。落后这个词暗示原因在你这一侧。

事实是原因在产品侧,跟你的内容质量、技术实现、团队能力都无关。

正确的说法是:这门语言目前不在产品的开放名单内,名单的扩展节奏是每三个月一批。

这句话把一个模糊的负面印象,换成了一个有节奏、有依据的客观描述。

接下来把三次扩语的时间点和语言数量摆出来,一张图胜过十页解释。

图上要标清楚你的语言不在其中,以及不在其中的语言还有德语和法语。

把德语和法语拉进来当同伴,是这张图里最有说服力的一笔。总部很难认为德国市场也是能力不行,于是原因自然就被归到产品侧去了。这不是话术,是把真实的分组关系呈现出来,只不过多数人不会主动去查这一层。

措辞这件事在跨国团队里尤其要紧,因为你的汇报材料会被转述好几手。第一手写的是暂未列入开放名单,转到第三手可能就成了这个市场不行。把产品方自己发的那份公告链接留在材料里,配一句可核对的原文,能挡住大部分走样。

要一个复检日期,不要一个结论

汇报的目标不是拿到一个决定,而是拿到一个下次再看的时间点。

结论在这个阶段没有意义,因为最关键的输入变量还没落地。

建议的说法是:三个月后按同一套口径复检一次,届时根据实际状态调整。

同时把这三个月里要做的三件无悔投入列出来,说明它们不依赖复检结果。

这样这次汇报就有了明确的产出:一个日期、三件事、一份口径。

保哥后来把这套结构总结成一句话:在信息不足的时候,正确的输出是复检日期加无悔动作,而不是一个假装确定的结论

这个做法还有个隐性好处。三个月后复检的时候,你手上有一份连续记录,而当初问问题的那个人手上什么都没有。讨论的主动权会自然回到有数据的一方,这比任何汇报技巧都管用。

复检日期最好定在扩语节奏的下一个窗口之后一两周,而不是随手定在某个季度末。按每三个月一批的节奏推,窗口大致落在哪个月是估得出来的,把复检排在窗口之后,你才有新东西可讲,否则复检会变成把上次的话原样再说一遍。

常见问题解答

生成式搜索结果目前支持哪些语言?

按公开公告梳理,起点是美国英语,之后加入日语和印地语,再之后一次性加入西班牙语、葡萄牙语、韩语和印尼语,累计七门。德语、法语、意大利语、荷兰语、俄语都还不在名单上。需要注意的是语言开放和地区开放是两个独立维度,语言在名单上不代表你的目标国家一定可用,反过来也成立。判断自己的实际状态,靠公告不如靠十条查询实测二十分钟。

我的语言没被覆盖,是不是说明市场不重要?

不是。把七门语言对应的市场排一遍会发现,它们跟广告价值排名对不上,跟母语人口排名也对不上。印尼语的母语使用者比德语少一半以上,却排在德语前面。更能解释这份名单的是两条线:所在市场的规则确定性,以及移动互联网用户的增量密度。这两条都跟你的内容质量和商业价值无关,所以把未覆盖读成不重要,是一次典型的归因错误。

没被覆盖的这段时间,最该做的一件事是什么?

存基线。具体是三条曲线:问答型查询在总曝光里的占比、精选摘要的占有率、品牌词与非品牌词的点击结构。它们都能从现有报表里导出,一个人两天能做完,而一旦生成式结果铺过来,覆盖前的数据就永远补不上了。这三条曲线在没有生成式结果的情况下也是内容策略的基础指标,所以下行风险是零,最坏的结果是你多了三张有用的报表。

用脚本批量抓结果页来监测可行吗?

早期阶段不建议。生成式结果的加载方式跟普通结果不同,需要等待且不是每次请求都出,同一条查询连测三次可能出两次不出一次,脚本很难区分真的没出和没等到。再叠加地区模拟和登录状态的影响,样本噪声大到没法用。更现实的分工是让脚本负责生成清单、记时间戳、整理表格,把出还是没出的判断交给人,人在这件事上的准确率接近百分之百。

观察记录该怎么设计表头?

主键是语种、市场、查询类型这个三元组,三者任意合并都会丢掉一层解释力。完整表头建议是日期、语种、市场、查询类型、查询原文、结果三档、设备、界面语言,一共八列,其中前四列固定,每次只填后面四列。查询清单定下来之后不要再改,想加新词就另开一张表。二十分钟一次、每两周一次,一年下来就是一份竞品拿不到的一手材料。

怎么判断自己属于哪种未覆盖状态?

状态有三种:不在名单里且测不出、在名单里但你测的查询不触发、在名单里且能测出。第三种和第二种最容易混淆,原因是大多数人第一批测的是自己排名最好的词,而那类词通常商业意图明确,恰好是触发率最低的一档。正确顺序是先用十条通用疑问句确认语言状态,再用商业词看覆盖面。把第二种误判成第一种,等于白等半年。

该怎么跟总部解释这件事?

不要用落后这个词,它暗示原因在你这一侧。改用客观描述:这门语言目前不在产品开放名单内,名单每三个月扩一批。然后把三次扩语的时间点和语言数量画成一条轴,标出德语和法语同样不在其中。汇报的产出不该是一个结论,而是一个复检日期加三件不依赖复检结果的无悔动作。这样三个月后再讨论时,你手上有连续记录,别人手上没有。

权威参考资料

分享到
标签
版权声明

本文标题:《生成式搜索先铺到了印尼语和韩语,排在德语法语前面的理由不是人口》

本文链接:https://zhangwenbao.com/sge-non-english-language-coverage-early-observation.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交