西班牙语的地区差别原来写在hreflang里,到了AI问答只剩用户嘴里那一个词

西班牙语的地区差别原来写在hreflang里,到了AI问答只剩用户嘴里那一个词
张文保 更新 37 分钟阅读 4,559 阅读
本文目录
  1. 为什么地区定向到了AI问答这一层突然没了着落?
  2. hreflang和ccTLD原本是说给谁听的
  3. 一次问答里根本没有地区这个字段
  4. 页面属性退化成了查询属性
  5. 同一个问题用三种西语问,变的到底是什么?
  6. 答案主体几乎一样,来源清单不一样
  7. 分歧发生在检索侧不在生成侧
  8. 这个区分决定你能不能动手
  9. 怎么用十条问题把它测出来
  10. 哪些词才会真的把三个变体分开?
  11. 变体标记词是一小撮不是一大片
  12. 汽车配件品类里的标记词长什么样
  13. 大多数查询里一个标记词都没有
  14. 标记词是可数的,一小时能数完
  15. 分叉率该怎么算,算出来又怎么用?
  16. 分叉率的定义与分母
  17. 三档决策线
  18. 低分叉率品类的正确做法
  19. 高分叉率品类的拆分边界
  20. 西班牙语到底有几个标准,谁说了算?
  21. 学院协会的泛西语规范管到哪一层
  22. 语言子标签给了一个折中
  23. 规范层与输入层的分工
  24. 模型认得出变体吗,现有证据说到哪一步?
  25. 变体识别的公开评测怎么做的
  26. 哪几个变体最容易被认混
  27. 认得出跟用得对不是一回事
  28. 正文里怎么写才能三个变体都命中?
  29. 同义词不是堆词,是写进句子
  30. 首段自足与变体词的位置
  31. FAQ是承载变体分歧最省的位置
  32. 什么时候该拆页面
  33. 技术字段还要不要按变体配?
  34. hreflang依然要配,只是收益变了
  35. 结构化数据里语言字段写到哪一级
  36. URL与slug要不要带地区
  37. 拿什么指标验收,多久看一次?
  38. 来源清单重合度
  39. 变体词覆盖率
  40. 复测频率与噪声
  41. 按这套做法走过一遍之后,哪些预期落空了
  42. 只按西班牙口径写完的那套词表
  43. 把标记词铺进正文之后发生了什么
  44. 常见问题解答
  45. 西班牙语真的需要按国家拆吗,不是同一门语言吗?
  46. 只做西班牙市场,还需要管拉美的说法吗?
  47. 把三个变体的词全堆进关键词标签里行不行?
  48. 怎么确定一个词在某个国家是不是真的常用?
  49. 如果预算只够做一件事,该做哪件?
  50. 模型以后会不会自动处理好变体,让这些工作白做?
  51. 这套方法能直接搬到葡萄牙语或者法语上吗?
  52. 权威参考资料

摘要:西班牙语在AI问答里被当成一门语言处理,可同一件商品在马德里、墨西哥城和布宜诺斯艾利斯是三个词。传统搜索里地区差别有hreflang和ccTLD替你承载,到了这一层它只剩一条通道——用户自己在问句里打出来的那个词。这篇讲清分歧到底出在检索侧还是生成侧、哪些词才真会把三个变体分开、分叉率怎么算,以及什么时候该拆页面、什么时候完全不必。

为什么地区定向到了AI问答这一层突然没了着落?

hreflang和ccTLD原本是说给谁听的

先把旧的那套机制摆清楚,才看得出新的这一层少了什么。

做西班牙语市场的团队,手上一般有三样地区定向的工具。

一是hreflang标注,告诉爬虫哪个URL是给哪个地区的。

二是域名结构,用.es和.mx这样的国家顶级域把市场分开。

三是内容本身,价格、支付方式、配送时效都按当地写。

这三样有一个共同点:它们全是站点属性,是你主动声明出去的,声明完就存在那里,等着引擎来读。

整套地区定向的前提,是有一个地方能把你的声明存下来,并且在排序的时候读一次。传统搜索恰好提供了这个地方:索引库里每个URL都带着一组地区与语言的标记,用户发起一次搜索,引擎手上同时有查询词、用户所在地、用户界面语言三样输入,拿它们去比对索引里的标记。你的声明在这个比对里是有位置的。hreflang那一整套规则之所以复杂到需要单独一篇讲,就是因为它要覆盖这个比对里所有的边界情况。

一次问答里根本没有地区这个字段

换到AI问答,输入的形态变了。

用户打进去的是一整句话,不是几个关键词。

系统拿这句话去做检索,召回一批候选文档,再让模型基于这批文档写答案。

这条链路上,地区信息只可能从两个地方进来。

一个是平台自己掌握的用户位置,一个是问句里的语言线索。

前者平台确实有,但它主要用来决定给你哪个版本的产品界面,不会逐条传给检索器当硬过滤条件。

结果是你精心配好的地区声明,在这一层没有一个明确的读取点。它不是被忽略了,而是这条链路上不存在那个专门读它的环节——检索器拿到的是一段文本,它做的是把这段文本跟文档做语义匹配,匹配过程里没有一个叫作地区的槽位。你的.mx域名和hreflang标注仍然在页面上,仍然被爬虫记录,只是在这一次问答里,它们没有参与任何一个决策。

页面属性退化成了查询属性

这是本文最想让你记住的一句话。

过去你能主动声明这一页是给墨西哥人的。

现在你只能等着墨西哥用户碰巧用墨西哥的词来提问。

主动权从站点这边,整块挪到了用户那边。

换个说法:地区定向从一个你可以配置的字段,变成了一个你只能命中的条件。

这个变化听着抽象,但它直接决定了你该把预算花在哪里——配置类的活儿收益下降,命中类的活儿收益上升。

命中类的活儿只有一种形态:让当地人真正会用的那个词,出现在你的正文里,出现在检索器能匹配到的位置上。不是出现在keywords标签里,不是出现在alt属性里,是出现在句子里,跟商品、场景、问题绑在一起。这跟关键词表可以一字不差、落地页却得拆成两种那篇讲的是同一件事的两个阶段:那时候拆的是页面,现在拆的是句子里的词。

同一个问题用三种西语问,变的到底是什么?

答案主体几乎一样,来源清单不一样

这是实测里最反直觉的一条。

拿一个具体问题跑三遍,问句分别用西班牙、墨西哥、阿根廷的说法。

你会预期拿到三段不同的文字。

实际拿到的三段文字在意思上高度接近,措辞差别不大。

真正明显不同的是底下那份来源清单。

三次问答挂出来的域名重合度经常只有一半,有时候更低。

这说明变体差异在这条链路上生效的位置,比多数人以为的要靠前。它不是在生成那一步影响措辞,而是在检索那一步影响了召回哪一批文档。检索器拿着含有carro这个词的问句去匹配,命中的自然是正文里写carro的页面;换成coche,命中的就换了一批。模型拿到的原料变了,输出的措辞反而因为被规整过而看不出差别。

样本量上有个经验值可以直接抄:每个问题跑三轮取并集,三十条问题就是二百七十次问答,一个人一天能跑完。低于三轮的结果抖动太大,超过五轮的边际信息几乎为零。墨西哥的数字生态年度报告里那组搜索行为数据可以帮你判断该把问题设计成什么形态,那边的移动端占比高得多,问句普遍更短。

分歧发生在检索侧不在生成侧

把位置定下来,事情的性质就完全变了。

如果分歧出在生成侧,那是模型的语体偏好问题。

模型偏好哪种西语,你干预不了,只能等厂商调。

如果分歧出在检索侧,那是候选池的构成问题。

候选池装什么,取决于网上有哪些页面,而你可以往里放页面。

同一个现象,归因到两个不同的环节,得到的行动清单一个是等,一个是干。

这条判据可以推广到所有跟AI问答有关的现象:先问它发生在检索侧还是生成侧,再决定要不要动手。检索侧的问题几乎都能用内容解决,生成侧的问题基本只能绕。回答语言和来源语言是两个独立字段那篇讲的偏差也是检索侧的,所以那篇给出的动作也是往池子里放东西。归错了环节,最典型的后果是团队开始写公关稿,而不是写内容。

这个区分决定你能不能动手

再往下推一层。

检索侧的问题有一个很实用的性质:它是局部的。

你不需要改变整门语言的处境,只需要在你这个品类里被召回。

品类越窄,候选文档越少,你一篇内容占的份额越大。

这跟小语种问答长尾那篇算的是同一笔账。

西班牙语整体不是小语种,但西班牙语加上某个具体品类加上某个地区说法,供给密度可能低得惊人。

把这三个条件叠起来,是西语市场里少数还剩空场的地方。整门语言的头部内容早被大站占满,可一旦你把查询限定到阿根廷人会用的那个词,再限定到一个具体的商品问题,认真写过完整回答的页面往往一只手数得过来。这不是因为需求小,而是因为做内容的人普遍按标准西语写,写完就当整个西语世界都覆盖了。

供给密度这件事有个粗糙但够用的外部参照:全网文档的语言分布本身就极不均匀,而Common Crawl按语言统计的文档分布图只到语种一级,再往下的地区变体连统计口径都没有。也就是说这一层的稀缺程度,连一个能查的数字都不存在,只能靠你自己数结果页。

怎么用十条问题把它测出来

方法很土,但结论可靠。

挑十个你这个品类下真实存在的用户问题。

每个问题写三个版本,只替换变体标记词,其余措辞完全不动。

三个版本各问一遍,把答案和来源清单都存下来。

然后只做一件事:数三份来源清单的域名重合度。

重合度高,说明这个问题上三个变体在这一层是同一门语言;重合度低,说明它们被分开了。

整套测试的关键在于只替换标记词这一条纪律,一旦顺手把整句话改得更地道,你就测不出任何东西了。这是跨语言实测那篇踩过的同一个坑的变体:那边是翻译时手痒改问题,这边是本地化时手痒改语序。变量不干净,跑出来的数字就只是好看,不能拿来做决策。测完记得把三份清单里各自独有的域名单独列一列,那批域名就是这个变体的本地供给方。

哪些词才会真的把三个变体分开?

变体标记词是一小撮不是一大片

很多人对西语变体的印象是差别到处都是。

真去数就会发现,能改变检索结果的词其实相当有限。

语法差别几乎不进关键词,voseo那类人称变化改的是动词形态。

用户提问时用的是名词短语,动词形态影响很小。

发音差别更不用说,打字的时候完全不体现。

真正会分家的是名词,而且集中在少数几类:日常用品、交通工具、身体部位、食物。

换句话说,变体分化是词汇现象而不是语法现象,而词汇现象是有边界、可以穷举的。这跟德语的复合词或者芬兰语的格变化完全不同——那两类是构词规则在起作用,规则能生成无穷多形态,你只能靠算法覆盖;西语的变体标记词是一张有限的清单,人工列一遍就完事。西班牙人和墨西哥人搜的不是一个词那篇当年列的就是这张清单的搜索版本,只是当时它的用途是分ccTLD,现在它的用途变成了铺进正文。

想验证词汇与语法这条分界是不是真的成立,可以翻一遍公开的西语树库标注。Universal Dependencies的西班牙语数据集把词性、句法关系都标了出来,你会发现地区差异集中落在名词与少量动词形态上,句法结构那一层几乎看不出分歧,这正是变体清单能被穷举的原因。

汽车配件品类里的标记词长什么样

拿保哥去年接触的一个做汽车改装件的客户举例。

这家原本只做西班牙市场,后来想把墨西哥和阿根廷一起吃下来。

他们先做的事情是把整个品类词表按三个地区列成对照表。

车本身:coche在西班牙、carro在墨西哥、auto在阿根廷。

轮胎:neumático在西班牙,llanta在墨西哥,两边阿根廷都用。

后备箱:maletero、cajuela、baúl,三个地区三个词,一个都不重样。

但同一张表里,刹车片、机油、火花塞、避震器这几项三地写法完全一致。列到一半就能看出规律:越是专业零件,越倾向于用同一个术语,因为它们进入西语的路径是技术手册而不是日常口语;越是普通人天天挂在嘴边的部件,分化越厉害。这条规律对选品类有直接的指导意义——纯专业件的品类几乎不用管变体,日用件的品类必须管。

专业件与日用件的界线怎么划,有一个不用请教语言学家的办法:看这个词是先进入维修手册还是先进入日常对话。前者的传播路径是印刷品和培训体系,全西语世界共用一份术语;后者的传播路径是口语,走到哪儿变到哪儿。判不准的时候查一下当地维修厂的报价单,报价单上的写法基本就是专业口径。

大多数查询里一个标记词都没有

这是数完之后最让人松一口气的发现。

把一百条真实查询摊开,逐条检查有没有标记词。

那家改装件客户的结果是十七条含标记词,其余八十三条不含。

不含标记词的查询,三个变体在检索这一层就是同一句话。

那八十三条上你不需要做任何变体相关的工作。

预算应该全压在那十七条上,而不是均匀地摊到整个词表。

可惜实际操作里最常见的做法恰恰是均匀摊:整站复制三份,逐字做地区化,成本翻三倍而收益只落在十七分之一的查询上。更麻烦的是复制出来的三份内容在信息层是同一份,正好撞上一个模板生成十种语言、字符层看不出重复而信息层十份一样那篇讲的问题,钱花了,还多背一份重复内容的风险。

那八十三条也不是完全干净,里面还藏着一类更隐蔽的差别:同一个词的拼写习惯与缩写方式。有的地区习惯把复合表达缩成两个字母,有的地区完整拼写;有的地区在数字与单位之间加符号,有的不加。这类差别不改变词本身,但会影响精确匹配,做词表时最好单独开一列记录,别跟变体词混在一起。

标记词是可数的,一小时能数完

把这件事讲成一个可执行的动作。

拿你现有的品类词表,一列一列过。

每个词问一句:西班牙、墨西哥、阿根廷三地是不是同一个说法。

不确定的词标出来,交给本地同事或者查一次美洲西班牙语学院协会的资料。

五百个词的表,两个人一小时能过完一遍。

过完之后你手上就有一个数字:分叉词占全表的百分之多少。

这个数字比任何一份行业报告都更能指导你的决策,因为它是你自己品类的真实数字,不是全行业的平均值。而且它便宜到不像话——一小时的人力,换一个能直接决定几十万预算怎么分的判据。保哥见过的情况是团队为要不要拆西语站开了三次会,每次会两小时,加起来的时间足够把这张表数六遍。会开完还是没定,因为会上讨论的全是原则问题,而原则问题需要数字才能收口。

词表的来源如果一时凑不齐,学界已经有现成的公开数据集可以借。Spanish is not just one这份西语方言识别数据集覆盖了二十来个西语国家的词汇差异条目,可以直接拿来当种子表,再按自己的品类筛一遍。用别人的表当起点,比从零开始列快得多,但最终那一遍筛选必须自己做。

分叉率该怎么算,算出来又怎么用?

分叉率的定义与分母

定义要写死,否则不同人算出来的数不一样。

分子是含有变体标记词的查询条数。

分母是你真正打算覆盖的查询总条数。

注意分母不是词表长度,是查询条数。

同一个标记词可能出现在十条查询里,也可能只出现在一条里。

按词算会高估,按查询算才对得上实际影响面。

更严格一点的做法是给每条查询配上搜索量或者业务价值做加权,得到一个加权分叉率。因为有时候标记词恰好集中在最赚钱的那批查询上,条数占比只有一成,营收占比却过半,这时候按条数算会严重低估。小语种关键词工具返回的零是数据缺口不是需求缺口那篇给的几种无数据估算法,在这里正好可以拿来补搜索量这一列。

三档决策线

数出来之后按三档处理。

分叉率低于百分之十:合成一套内容,把变体词当同义词铺进正文。

百分之十到三十:一套正文,分市场做FAQ和商品详情的局部替换。

高于百分之三十:认真考虑拆成两套或者三套。

三档之间的界线不是精确的,但量级是对的。

关键在于你现在有一个数字可以对着这三条线看,而不是凭感觉拍。

这三档跟北欧三语那篇的资产分层是同一个思路,区别在于那边分层的依据是语言之间的距离,这边分层的依据是你自己品类里的一个可测数字。依据从外部属性换成了内部测量,好处是它随品类变化,同一家公司做汽车配件和做工业轴承,可以得出完全不同的结论,而按语言距离判断的话,两者会被迫用同一套方案。

三档之间还有一种常见的过渡状态:分叉率不高,但分叉的那几个词恰好是品类核心词。这时候按条数算会落进第一档,按业务价值算却接近第三档。处理办法是把核心词单独拎出来做页面级的处理,其余部分按第一档走。西班牙的数字生态年度报告里的品类消费数据可以帮你判断哪些词算核心词。

低分叉率品类的正确做法

百分之十以下这一档,做法最省。

不拆站,不拆页,只在正文里补词。

补的方式不是在句尾堆一串同义词。

而是让不同的变体词各自出现在一个真实的句子里。

比如产品说明里写一遍coche,FAQ的问句里写一遍carro,尺寸表的说明里写一遍auto。

每个词都嵌在完整语境里,检索器能匹配,读者也不觉得别扭。

判断补得对不对,有一个很朴素的标准:把这段读给一个墨西哥人听,他不该觉得这段话是写给西班牙人然后硬塞了几个词进来的。这也是母语审校那篇反复强调的那个判据的变形,只不过验收对象从整篇变成了单个句子。堆词的痕迹母语者一眼能看出来,而读者一旦察觉到你在讨好算法,信任成本比省下的那点检索收益贵得多。

补词还有一条容易被忽略的纪律:同一个变体词在一页里出现的次数要克制。检索器认的是它出现在有信息量的句子里,不是出现了几次;重复过头反而让整段读着像机器写的,母语审校那一关通不过。经验值是一个变体词全页出现两到三次,分布在不同的内容单元里,就已经足够。

高分叉率品类的拆分边界

百分之三十以上这一档,拆是值得的,但要拆得准。

拆的不是整站,是含标记词的那部分页面。

商品详情页、品类页、FAQ,这三类通常要拆。

关于我们、配送政策、支付方式,这几类按国家拆而不是按语言变体拆。

技术文档、安装教程、材料说明,多数情况不用拆。

拆完之后每一套的维护成本是长期的,所以拆之前要把维护责任先定下来。

保哥见过最典型的失败是拆得很积极、维护跟不上,半年后三套内容里有两套停留在初版,只有西班牙那套在更新。这时候局面比不拆还糟:搜索引擎和AI问答系统同时看到三份关于同一件事的不同说法,而其中两份是过时的。要判断你的团队撑不撑得住,一个简单的办法是看这套内容一年要改几次——一年改两次以内,拆得起;一年改十次以上,先别拆。

西班牙语到底有几个标准,谁说了算?

学院协会的泛西语规范管到哪一层

这一节回答一个常被问到的问题。

西班牙语有一套跨国的规范体系,由各国语言学院联合维护。

这套体系的立场是泛西语的,不把任何一国的用法定为唯一正确。

词典里会同时收录coche和carro,并标注各自的通行地区。

也就是说规范层承认多标准,它不替你做选择。

很多团队以为查一次权威词典就能定下用哪个词,实际查完发现两个都对。

规范层管的是哪个说法算合法,不管哪个说法在某地更常用,而后者才是关键词工作真正需要的信息。这个错位跟品牌名叫什么由当地用户的输入法定那篇讲的是一回事:正字法归语言委员会管,主键归使用习惯管。查规范能帮你排除掉真正的错词,但选不出主词。

跨国词典的地区标注该怎么读,也有讲究。标注为某地通用,意思是那里能用而不是那里只用这个;没有标注的词通常是全域通行的。真正有用的信息是同一个概念下并列了几个词条,以及各自挂了哪些地区标签,把这两项抄下来就是一张现成的对照表雏形,比逐词去查释义快得多。

语言子标签给了一个折中

技术侧倒是给了一个折中方案。

语言子标签注册表里有一个专门的地区码代表拉丁美洲。

写成es-419,419是联合国给拉美地区的数字编码。

它的用途是当你不想逐国拆、又想跟欧洲西语分开时。

相当于把二十来个国家打包成一个变体。

对多数中小站来说,es-ES加es-419这两套已经够用了。

但要注意这个折中在语言层是有代价的:拉美内部本身也在分化,墨西哥和阿根廷之间的差别未必比墨西哥和西班牙之间小。llanta和cajuela在墨西哥通行,在阿根廷未必;voseo在阿根廷是日常,在墨西哥听着像外国人。所以es-419只是把成本从三份压到两份,不是把问题解决掉。判断够不够用的标准仍然是你自己那张分叉表——如果表里有大量墨阿两地不一致的词,es-419这一档就撑不住。

要弄清一个地区码到底包含哪些国家,得查区域包含关系的定义表。Unicode CLDR项目维护的区域数据里明确列出了每个地区码下辖的国家清单,配置多语言站点时按它对一遍,能避免把某个国家漏在两个地区码之间的空档里,这类漏配在报表上表现为一批流量永远归不到任何市场。

规范层与输入层的分工

把两层的分工写清楚,日常决策会顺很多。

规范层负责的是稳定形态:URL里的slug、数据库里的排序键、日志里的归一化字段。

这些地方要的是唯一、可逆、不随地区变,用规范写法最合适。

输入层负责的是命中:正文、标题、FAQ、商品名。

这些地方要的是跟用户打出来的字对上,用当地写法最合适。

两层各管各的,互不干扰,也互不替代。

混淆这两层的典型症状是URL里塞满了当地俚语,或者正文里全是词典体的规范说法。前者会让站点结构在改版时寸步难行,后者会让内容在检索里整片失联。URL用本地字母还是拉丁转写那篇讨论的是书写系统层面的同一个分工,西语没有书写系统问题,但分工的逻辑一模一样。

归一化这一步在西语上比在别的语言上省事,但也不是零成本。带重音的字母有组合与预组合两种编码形态,肉眼完全一样,字符串比对却不相等。String.prototype.normalize这个标准方法就是用来把两种形态统一到一种的,做站内搜索和词表去重时必须先走这一步。

模型认得出变体吗,现有证据说到哪一步?

变体识别的公开评测怎么做的

这两年有几项针对西语变体的公开评测,值得看一眼。

做法通常是给模型一段文本,让它判断这段话来自哪个地区。

或者反过来,要求它用某个地区的说法生成一段文本。

评测集会覆盖伊比利亚半岛、墨西哥与中美洲、安第斯、加勒比、南锥体等几大片区。

还有专门为西语及西班牙境内其他语言建的排行榜,把变体当作一等公民来评。

这跟主流评测把西语当成一门语言整体打分,是完全不同的口径。

值得留意的是评测的任务形态跟你的业务场景并不一致:评测问的是模型能不能识别变体,而你关心的是检索器会不会因为一个词而召回不同的文档。前者测的是生成侧的能力,后者是检索侧的行为,两件事之间没有必然联系。所以看评测结论时,把它当作背景知识可以,直接拿来推断你的页面会不会被召回不行,那个还是得自己跑那十条问题。

另一类评测是从社会与文化维度切进去的。SESGO这套面向拉美语境的西语偏见评测框架专门构造了扎根本地文化的题目,而不是把英语题目翻译过来。它的方法论对做内容的人有直接启发:把英语测试直接译成通用西语,会漏掉整整一层地区特征,这跟直接把英文站译成西语站漏掉的东西是同一批。

哪几个变体最容易被认混

评测里有一个结论对做内容的人有用。

不是所有变体被识别的准确度都一样。

伊比利亚、墨西哥与中美洲、拉普拉塔河流域这几片,识别得相对准。

智利变体是公认的难点,模型经常把它归错。

原因不难猜:这几片的语料在网上的量差着好几个数量级。

语料多的变体,模型见过的样本多,边界画得清楚。

把这条结论翻译成业务语言:如果你的目标市场恰好是语料稀薄的那几个,你在正文里放的变体词起到的作用会更大,因为它是为数不多的信号之一。这跟直觉相反——很多人觉得模型识别得越差,做变体优化越没意义。实际正相反:模型识别得好的地方,它不靠你的词也能推断出地区;识别得差的地方,你写进正文的那个词就是它唯一的依据。稀薄反而是杠杆。

语料量的差距不只影响识别精度,还影响这门语言在整个技术栈里的位置。斯坦福人工智能指数年度报告逐年记录的语言覆盖数据显示,模型能力在语种一级扩张得很快,可地区变体这一级几乎没有被单独统计过。没有统计就没有目标,没有目标就不会有专门的优化,这一层短期内不会自己变好。

认得出跟用得对不是一回事

再补一条容易被跳过的区分。

模型能识别一段文本属于哪个变体,是一种判别能力。

模型能持续用某个变体的说法生成整段回答,是一种生成能力。

评测里这两项的分数经常差很多。

判别做得不错的模型,生成时照样会滑回标准西语。

对你的影响是:即使用户用carro提问,答案里也可能出现coche。

这不影响你被召回,但会影响读者读完之后对答案的地域信任感。

能补救的地方在你自己的页面上:确保用户点进来之后,落地页用的是他熟悉的那个词。问答那一层的措辞你管不着,落地页这一层完全归你管,而后者才是转化发生的地方。这条对应落地页上那几个最像装饰的信任元素那篇的结论:本地感是由一堆很具体的小东西堆出来的,词只是其中一个,但它是第一个被读到的。

正文里怎么写才能三个变体都命中?

同义词不是堆词,是写进句子

这一节讲具体写法。

最差的写法是在段末补一句:也叫carro、auto。

这种写法检索器不一定吃,读者一定觉得别扭。

好一点的写法是把不同变体词分配到不同的内容单元里。

产品描述用一个,使用场景段用另一个,FAQ里用第三个。

每个词都在自己的句子里承担真实的语义角色。

再进一步,可以用一句自然的说明把两个词绑在同一句里,比如在讲适配范围时写成某某车型的后备箱在部分市场也叫另一个名字,这类句子本身就是用户会搜的内容。这样做的额外好处是它同时服务了两类查询:既命中了用carro提问的人,也命中了那些在两个词之间犹豫、直接搜两个词有什么区别的人。后一类查询量不大,但意图极其明确,转化率通常高得离谱。

首段自足与变体词的位置

位置比数量重要。

检索器对文档开头的权重通常更高。

模型在摘取答案时也倾向于从靠前的段落里拿。

所以最重要的那个变体词,应该出现在首屏能读到的地方。

但不要三个词全塞进第一段,那会毁掉可读性。

第一段放目标市场最主要的那个,其余两个往后排。

如果你只做一个主市场,那这件事很简单;如果三个市场权重接近,就需要按流量做一次排序,把最大的那个放前面。这个取舍没有巧办法,位置是稀缺资源,稀缺资源就得按价值分配。顺带提醒一句,首段自足这条要求本身是从英语的语序假设里长出来的,在西语这种语序相对灵活的语言里执行起来没有阻力,换成谓语后置的语言就完全是另一回事了。

还有一条跟位置有关的细节:变体词最好落在段落的前半句,别放在长句的尾巴上。摘取答案时经常只取半句,尾巴那部分被砍掉的概率不低。同理,别把变体词放在括号里或者破折号后面的补充成分中,那两个位置在结构上就是可省略的,被丢掉的风险最高。

FAQ是承载变体分歧最省的位置

这是性价比最高的一个位置。

FAQ天然是问句形态,跟AI问答的输入形态最接近。

一条FAQ就是一个完整的问答对,检索器很容易整段召回。

而且FAQ的问句里换一个变体词,几乎不影响整篇的语感。

你可以让七条FAQ的问句分别使用不同地区的说法。

读者不会觉得奇怪,因为FAQ本来就是模拟不同用户的提问。

这一招的效果在窄品类里尤其明显,因为窄品类下认真写过FAQ的页面本来就少,你多覆盖一个变体,就多占一个几乎没人竞争的位置。操作上有个小纪律:问句里换词,答句里要把两个词都提一次,这样无论用户用哪个词提问,召回之后模型都能在答案里找到对应的表述。只在问句里换而答句不呼应,召回率上去了,命中率不一定跟着上去。

FAQ的条数也要控制。七条上下最合适,超过十二条之后单条被完整召回的概率反而下降,因为整块内容太长,检索器倾向于切段,切完就不是完整问答对了。宁可分两页各写七条,也别在一页里堆二十条。这条经验在窄品类里尤其重要,那里本来就没有多少条真问题值得写。

什么时候该拆页面

补一条拆与不拆的具体判据。

如果三地的商品型号、规格、认证都一样,不拆。

如果价格和配送不同但商品一样,通常也不拆,用动态字段处理。

如果三地卖的根本不是同一批SKU,那必须拆,而且拆的理由跟语言无关。

如果三地有各自的法定标注要求,拆。

换句话说,拆的理由优先来自商品和合规,其次才是语言。

把这个顺序搞反是常见错误:先因为语言差异拆了页面,然后发现商品其实一样,三套页面维护成三份内容债。正确的顺序是先看商品和法规,如果它们已经逼你拆了,语言变体顺便处理掉;如果它们没逼你拆,那就只在句子层面处理变体,别动结构。结构性的决策一旦做出来,回退成本远高于内容层面的调整。

技术字段还要不要按变体配?

hreflang依然要配,只是收益变了

这个问题问得很多,答案是要配。

传统搜索的份额仍然巨大,hreflang在那一侧的作用没变。

变的是它在AI问答这一侧几乎不起作用。

所以它从一个双重收益的动作,变成了单重收益的动作。

成本没变,收益少了一半,但仍然远大于零。

结论是继续配,只是别再把预算按老比例往它上面倾斜。

更实际的调整是把原本准备用来精细化hreflang的那部分工时,挪去做正文里的变体词覆盖。两者的性质截然不同:hreflang是配置类工作,做对了就到头,没有边际收益;正文覆盖是内容类工作,每多一条查询被命中就多一份收益。在一个配置读取点正在消失的环境里,把资源从配置挪向内容,是一次方向明确的再分配。

结构化数据里语言字段写到哪一级

这一项有具体写法。

页面的语言字段建议写到地区一级,不要只写语种。

写es-MX比只写es携带的信息多,成本却一样。

如果你走的是拉美打包方案,写es-419。

不要在同一个站里混用两种粒度,否则数据消费方会困惑。

这一条跟AI问答关系不大,主要服务于传统搜索和你自己的数据分析。

值得展开的是正文越本地化越好、结构化数据里却要反着写回国际格式那篇给出的那条原则:可见内容按用户习惯写,机器字段按国际标准写。西语的变体问题正好落在这条原则的两侧——正文里你要写carro,结构化数据里你要写es-MX,两者都不是对方的替代。有团队试过在结构化数据里塞变体词当别名,那是把两层的职责搅在一起,除了让数据变脏没有别的效果。

粒度的选择还牵涉到本地化数据的取值。Unicode地区数据标记语言规范定义了从语言到脚本到地区的完整层级,日期格式、数字分隔符、货币写法这些都按这个层级取值。只写语种会让系统退回默认值,而西语的默认值通常是欧洲口径,小数点和千位分隔符一旦按欧洲写,拉美读者读价格会顿一下。

URL与slug要不要带地区

这一项按站点规模判断。

单站多语言的架构下,URL里通常已经有语言段。

要不要把语言段扩成语言加地区,取决于你是不是真的有多套内容。

只有一套内容却分了三个地区路径,会制造大量重复。

真有三套内容,那地区段是必须的。

slug本身建议一律用规范写法,不要用变体词做slug。

理由是slug是稳定形态,而变体词的通行度会随时间漂移,今天在墨西哥更常用的词,五年后未必还是。把会变的东西固化进URL,等于给未来的自己埋一次迁移工作。规范写法虽然搜索命中率低一些,但slug本来就不承担命中职责,那是正文的活儿。这条分工跟上一节讲的规范层与输入层是同一条线,只是落到了具体字段上。

拿什么指标验收,多久看一次?

来源清单重合度

第一个指标是最能反映本质的。

做法是固定一组问题,三个变体各问一遍。

把三份来源清单的域名取交集与并集。

交集除以并集,得到一个零到一之间的数。

数字接近一,说明三个变体在这一层没被分开。

数字很低,说明分开了,而且你需要在每一侧都有存在感。

这个指标的好处是它不需要你能查到任何后台数据,纯靠观察结果页就能算,属于自己能测的那类稀缺指标。缺点是单次结果有抖动,需要多跑几轮取平均。实践中跑三轮就够看出量级,跑十轮才能看趋势。记录时要把日期和使用的模型版本一起存下来,否则几个月后回看时无法解释数字为什么变了。

变体词覆盖率

第二个指标衡量的是你自己做到了多少。

分子是你的正文里实际出现过的标记词数量。

分母是那张分叉表里的标记词总数。

这个数字应该逐月上升,直到接近满分。

它是一个纯执行指标,跟外部环境无关。

好处是团队能直接为它负责,坏处是它高不代表效果好。

所以这两个指标必须成对看:覆盖率是你的输入,重合度变化是外部的反应,只看前者会陷入自我感觉良好,只看后者会因为归因不清而放弃。把两条线画在同一张图上,横轴是时间,你能很快看出投入和产出之间的时滞有多长。多数品类下这个时滞在四到八周之间,短于四周的观察基本是噪声。

分母还需要定期更新。分叉表不是一次性资产,新品上线会带进新词,市场用语也会缓慢漂移。建议每半年重跑一次,重跑时把上一版的表留着做对比,看看哪些词的地区标注变了。变化本身是有信息量的:一个词从分叉变成统一,往往说明某个平台的界面用语在这几年里统一了本地习惯。

复测频率与噪声

最后说频率。

建议按季度做完整复测,按月做小样本抽查。

完整复测是三十条问题乘三个变体,九十次问答。

抽查是十条问题乘三个变体,三十次。

抽查只看有没有明显异动,不做结论。

频率再高没有意义,因为内容侧的动作本身就是以月为单位见效的。

还有一个容易忽略的噪声源:模型版本更新。厂商换一次底层模型,来源清单可能整体变一遍,这时候你看到的波动跟你的内容毫无关系。所以每次记录都要带上测试日期,遇到大幅异动先去查那段时间有没有平台侧的更新公告,确认没有再去查自己的内容。把这个检查放在归因流程的第一步,能省掉大量的无效排查。

按这套做法走过一遍之后,哪些预期落空了

只按西班牙口径写完的那套词表

回到前面那个汽车改装件的客户。

他们最初的状态是典型的:西语站一套,全按西班牙的说法写。

团队认为西语是一门语言,写一套就够了。

墨西哥和阿根廷的流量确实有,但一直不温不火。

直到有人去查了一次AI问答的表现,才发现墨西哥那边的问题下自家页面一次都没出现。

而西班牙那边的同类问题,出现频率相当正常。

最刺眼的一点是他们的墨西哥站配置一点问题没有:hreflang对、域名对、货币对、配送信息也对。所有能配置的东西都配好了,唯独没人想过正文里那几个词是西班牙说法。这就是本文开头那句话的具体样子——配置类的活儿做满分,命中类的活儿是零分,而这一层只认后者。团队当时的第一反应是怀疑技术出了问题,排查了两周,技术一切正常。

那两周的排查过程也值得记一笔。团队按常规思路依次查了收录状态、结构化数据、爬虫抓取日志、页面速度,全部正常;又怀疑是不是被平台限制了某个地区的曝光,找渠道问了一圈也没有结论。所有排查都在配置这一层打转,因为在他们的认知里,内容那一层已经交付完毕了。

把标记词铺进正文之后发生了什么

后面的动作不复杂。

数出分叉表,十七条含标记词的查询挑出来。

对应的十九个页面逐个改,把墨西哥说法写进产品描述和FAQ。

没有拆站,没有加页面,只改了正文。

大约六周之后,那批问题下开始零星出现自家域名。

再过一个季度,来源清单重合度从很低回到了中等水平。

但有两个预期落空了,值得记下来。一是阿根廷那一侧几乎没有改善,原因是他们当时的分叉表只做了西墨对照,阿根廷的说法压根没进表,等于那一侧一个动作都没做;二是流量的增长远小于问答曝光的增长,因为AI问答里被引用不等于用户会点进来,这中间还隔着一整段转化。AI引用单靠传统SEO够不够那篇讨论的那条边界,在这个案例里以一种很朴素的方式又出现了一次。

常见问题解答

西班牙语真的需要按国家拆吗,不是同一门语言吗?

是同一门语言,但要不要拆不取决于是不是同一门语言,取决于你品类里含变体标记词的查询占比。先数一遍这个数字,低于一成就别拆,只在正文里补词;超过三成再认真考虑拆。绝大多数团队跳过了数数这一步,直接在拆与不拆之间凭感觉选,然后为这个感觉找理由。数一遍只要一小时,比开会便宜得多。

只做西班牙市场,还需要管拉美的说法吗?

取决于你的支付和配送覆盖到哪里。如果只发西班牙境内,不需要管,铺再多拉美词也换不来订单。但要注意西班牙境内有相当规模的拉美裔居民,他们的搜索用词往往保留原籍习惯,这部分人是能下单的。判断办法很直接:翻一遍近半年的站内搜索记录,看看有没有出现拉美说法的词,有就说明这批用户已经在你站上了。

把三个变体的词全堆进关键词标签里行不行?

不行,那个标签早就不参与排序了,在AI问答这一层更是完全读不到。检索器匹配的是正文的语义内容,标签里的词进不了这个匹配。真要覆盖变体词,唯一有效的位置是正文的句子里,其次是标题和FAQ的问句。这一条听起来像老生常谈,但每次做审计都还能碰到把变体词塞满标签然后以为已经覆盖了的站。

怎么确定一个词在某个国家是不是真的常用?

三个来源交叉验证。一是跨国词典的地区标注,它告诉你哪些说法是合法的;二是当地电商平台的商品标题,它告诉你商家实际在用哪个;三是当地社交平台上普通人的说法,它告诉你消费者用哪个。三者一致就可以定,不一致时以第二个为准,因为它离购买意图最近。查词典能排除错词,但选不出主词,这两件事经常被混为一谈。

如果预算只够做一件事,该做哪件?

做那张分叉表。它本身不产生任何流量,但它决定了后面所有动作的方向,而且是三件事里最便宜的。没有这张表,你要么在全站地区化上过度投入,要么完全不投入,两种极端都会错。有了这张表,即使你今年一个页面都不改,明年做规划时也知道钱该往哪儿放。判断类的投入通常比执行类的投入回报更高,就是因为它能防止把大笔执行预算投到错的方向上。

模型以后会不会自动处理好变体,让这些工作白做?

生成侧可能会越来越好,检索侧不会自动变好。生成侧靠模型能力,模型能力在涨;检索侧靠候选池里有什么文档,池子里没有本地说法的内容,模型再强也变不出来。所以这类工作的性质不是补模型的短板,而是往池子里放东西,放进去的东西不会因为模型升级而失效。真正会随时间贬值的是那些依赖当前排序规则的技巧,往池子里放内容不属于那一类。

这套方法能直接搬到葡萄牙语或者法语上吗?

框架能搬,具体清单不能。葡萄牙语的巴西与欧洲分化程度比西语更深,连正字法都动过;法语的加拿大一侧在术语上有官方推动的替换,跟西语那种自然分化不是一个成因。搬过去的时候,分叉率的定义、三档决策线、检索侧与生成侧的区分都成立,但标记词清单必须重新做,三档的界线也要按各自的分化程度重新校准。别把西语的一成三成直接套过去。

权威参考资料

分享到
标签
版权声明

本文标题:《西班牙语的地区差别原来写在hreflang里,到了AI问答只剩用户嘴里那一个词》

本文链接:https://zhangwenbao.com/spanish-regional-variants-ai-answer-source-divergence.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交