小语种SEO两个市场的关键词表可以一字不差,落地页却得拆成两种

小语种SEO两个市场的关键词表可以一字不差,落地页却得拆成两种
张文保 更新 37 分钟阅读 1,718 阅读
本文目录
  1. 同一个词在两个市场,到底哪里不一样?
  2. 先分清是哪一类同词
  3. 意图差异不等于搜索量差异
  4. 跟通用的意图诊断不是一层
  5. 意图在语言里编码在哪几个位置?
  6. 第一个位置:词根的选择
  7. 第二个位置:词的形态
  8. 第三个位置:搭配与词序
  9. 英语那套意图分类法在哪些地方失效?
  10. 靠疑问词筛信息型查询会漏掉一大半
  11. 交易意图词不一定是独立的词
  12. 比较型查询的写法完全不同
  13. 本地化修饰词跟英语不是一套
  14. 同一门语言在两个市场,意图会怎么漂移?
  15. 同一个词指的东西不一样
  16. 同一个词处在不同的成熟度阶段
  17. 本地商业环境改变了意图
  18. 两门不同语言里的同一个词该怎么处理?
  19. 先撞假朋友清单,别急着分析意图
  20. 真同源词的意图错位
  21. 数字与单位带来的意图差异
  22. 怎么从原始查询串里把意图拆出来?
  23. 先拿到没被合并过的原始串
  24. 按形态而不是按词根归类
  25. 用页型比例反推意图
  26. 把结论固化成一张表
  27. 意图信号还能从哪些非查询数据里读出来?
  28. 筛选器的点击顺序会说话
  29. 零结果的搜索串是需求缺口
  30. 客服问题的分布补上了盲区
  31. 落地页要拆到什么颗粒度?
  32. 能合并的先合并
  33. 真要拆的是哪几种情况
  34. 两个市场的页面结构要不要一致
  35. 哪些不属于语言层,要交出去?
  36. 引擎的意图判定归引擎那一层
  37. 地区定位与架构归架构层
  38. 翻译质量本身是另一件事
  39. 这套方法怎么落地到日常流程里?
  40. 新市场开工时的顺序
  41. 已有市场怎么补做
  42. 要定期回看的三个数
  43. 常见问题解答
  44. 没有站内搜索日志,怎么拿到原始查询串
  45. 形态归类需要形态分析工具吗,没有工具能做吗
  46. 怎么判断两个市场的意图差异值不值得单独投入
  47. 意图分析的结论多久会过时
  48. 近亲语言的两个市场,意图分析能不能共用一份
  49. 小语种没有足够的查询数据,样本太小怎么办
  50. 意图分类的标签体系该用几档
  51. 权威参考资料

摘要:英语只能靠加词表达意图,买、价格、评测都得另起一个词。屈折语和黏着语不一样,意图有一部分直接编码在词尾上,还有一部分藏在借词和本土词的分工里。所以两个市场的关键词表可以长得一模一样,背后的诉求却分在两头。

同一个词在两个市场,到底哪里不一样?

先分清是哪一类同词

同一个词跨市场这件事,实际上分成两种完全不同的情形。

第一种是同一门语言在两个国家,比如西班牙和墨西哥,RFC 5646的地区子标签就是为区分这种情形准备的。

第二种是两门不同语言里恰好有一个拼写相同的词。

两种情形的成因不同,处理办法也完全不同。

第一种是同一个词在两地的语义漂移和阶段错位。

第二种是词源巧合,意思可能完全无关,属于假朋友。

把这两类混在一起处理是最常见的起手错误,因为它们在关键词表里长得一样,都是一行词加一个搜索量。区分办法很简单,问一句这两个市场说的是不是同一门语言:是,走语义漂移那条路;不是,先去撞假朋友清单,撞上了就别再往下分析意图了。

这个判断还有第三种情形容易被忽略,就是同一门语言在两个市场里各自借入了同一个外语词,但借入的时间和途径不同,语义落点也不同。这种情形表面上像语义漂移,实际成因跟假朋友更接近,处理时要按假朋友那条路走。

意图差异不等于搜索量差异

报表上最容易看到的差异是搜索量,那个不重要。

搜索量差异只说明市场大小不同,做法可以一样。

真正要盯的是同一个词背后的诉求分布有没有变。

诉求分布变了,落地页的结构就得跟着变,模板都不一样。

这一层从关键词工具的报表里完全看不出来。

工具给的是量,不是意图,意图要自己去搜索结果里读。

判断诉求分布有没有变,最快的办法是拿同一个词在两个市场各跑一次搜索,把首屏结果按页型分类:商品页、分类页、百科页、论坛帖、新闻。两边的页型比例差出两成以上,就说明诉求分布确实变了,这个动作十分钟能做完,比等三个月看数据快得多。

页型统计要注意用目标市场的地区参数去查,否则拿到的是自己所在地的结果,页型比例完全不作数。这一步没设对是最常见的错误,而且错了之后得出的结论看起来完全合理,很难被发现,所以值得在流程文档里单独写一行提醒。

跟通用的意图诊断不是一层

站内已经写过看SERP之后落地页要改成什么样那一套流程。

那一篇讲的是通用方法,跟语种没有关系。

本篇只处理一件事,就是语言这个变量本身带来的意图偏移。

换句话说,把语种换成英语之后还成立的部分,不在这里讲。

这条边界很重要,不划清楚会把两篇写成一篇。

通用方法是骨架,语言变量是骨架上多出来的那几根刺。

具体的分工是这样:通用方法回答的是这个词该配什么页型,语言变量回答的是为什么同一个词在这两个市场配了不同的页型。前者靠读搜索结果得出,后者要靠拆词才能得出,两个动作的输入不同,不能互相替代。

实操上这两层要分两个人做也可以,但顺序不能倒:先做通用诊断把页型定下来,再做语言变量分析看两个市场要不要分开。倒过来做的话,你会为一个还没确定页型的页面去分析语言差异,得出的结论没有落点。

意图在语言里编码在哪几个位置?

第一个位置:词根的选择

很多小语种里,同一个概念同时存在借词和本土词。

用户挑哪一个,本身就透露了他处在什么阶段。

借词通常更口语、更贴近日常,交易类查询里占比更高。

本土词或者官方词更书面,信息类查询里占比更高,德语词典里Rechner的用例能看出这种语域差。

这个规律不是绝对的,在官方为网店专门指定本土说法这种纯洁主义强的市场会反转。

所以要先测一遍,不能直接套别的市场的经验。

测的办法是把这一对词各跑一次搜索,看首屏里商品页和百科页的比例。借词那边商品页多、本土词那边百科页多,说明规律成立;两边都是商品页,说明这一对已经在当地合流了,可以当同义词处理,不必分开做。

借词和本土词的分工还会随时间迁移,教材和媒体在推哪一个,年轻用户的用词就会慢慢往那边靠。所以这一对词的比例每年要重新看一次,不能定一次用五年。看的方法就是重跑一次首屏页型统计,十分钟的事。

第二个位置:词的形态

这是英语用户完全体会不到的一层,也是最容易漏的一层。

在有格变化的语言里,名词的词尾会随句子里的角色变。

用户打出的那个形态,携带了他想做什么的信息。

宾格形态往往出现在带动作的查询里,偏交易。

原形或者主格形态更多出现在纯粹查资料的查询里。

英语没有这套机制,只能靠在词前后加修饰词表达。

这一层的实操价值在于它免费给了你一个意图信号:不需要用户额外打字,词尾自己就说明了问题。代价是关键词工具通常会把所有形态合并统计,这个信号在报表里被抹平了,只有从站内搜索日志或者搜索词报告的原始串里才能看到。

这一层还能反过来用在写作上:知道哪个形态偏交易之后,页面标题就用那个形态,正文里再自然带上其他形态。这样标题接住的是意图最明确的那批查询,而正文覆盖了形态变体,两件事在同一个页面里完成。

第三个位置:搭配与词序

第三层在词与词之间,不在单个词里面。

同样两个词,摆放顺序不同,意图可能完全不同。

有些语言词序自由,靠形态标记角色,顺序不承载意图。

有些语言词序固定,顺序本身就是意图的一部分。

做长尾词组合时,这决定了要不要穷举所有排列。

词序自由的语言要穷举,词序固定的语言穷举纯属浪费。

判断自己面对的是哪一类,看这门语言有没有丰富的格系统。格系统丰富的,词序通常自由,因为角色靠词尾标记;格系统贫乏的,词序承担了标记角色的功能,就相对固定。这条判据一句话就能用,比查语法书快得多。

词序自由的语言还有一个附带麻烦,就是同一个意思的多种排列会被工具算成不同的关键词,搜索量被摊薄。看报表时要先把同义排列合并再排序,不然会误判某个组合的量太小不值得做,而它的真实总量其实相当可观。

英语那套意图分类法在哪些地方失效?

靠疑问词筛信息型查询会漏掉一大半

英语里筛信息型查询的标准做法是找疑问词开头的串。

怎么做、是什么、为什么,这几个前缀一抓一大把。

问题是有些语言的疑问句根本不用疑问词。

它们用一个小品词,或者在动词上加一个后缀。

这个小品词可能就一两个字母,还常常粘在别的词上。

拿英语那套前缀去筛,这批查询会被整块归进导航型或者其他。

受影响的语言比想象中多:土耳其语一个词后面能挂五层后缀,它用一个独立的疑问小品词,芬兰语的词干自己也会变,疑问是在词上加后缀,波兰语有一个句首的疑问助词但口语里经常省略。做这三门语言的意图分类时,必须先补一条按小品词和后缀识别的规则,否则信息型查询的统计会系统性偏低。

补规则的时候要小心误伤,疑问小品词往往就一两个字母,跟普通词的词尾长得一样,简单匹配会把大量陈述句也算成问句。稳妥做法是要求小品词出现在特定位置,或者跟已知的动词形态组合出现,宁可少收一些也别把整个分类污染掉。

交易意图词不一定是独立的词

英语里表示购买意图的词是独立的动词,好抓。

在黏着语里,这个意思可能是动词后面的一个后缀。

后缀跟词根粘成一个词,正则规则抓不到。

要抓它得先做形态切分,把后缀从词里剥出来。

形态切分工具在小语种上的质量参差不齐。

质量不够的话,退而求其次用词尾模式匹配也能凑合。

做过一个母婴洗护客户的土耳其语站,团队按英语经验建的意图规则表里交易词只有几个独立动词,跑完发现能归类的查询不到四成。补上按词尾识别的规则之后,覆盖率一下子到了八成,剩下那两成才是真正的杂项。

词尾模式匹配的规则表建好之后要做一次抽样人工核对,随机抽一百条被归为交易意图的查询,看看有多少确实是交易意图。准确率低于八成就得收紧规则,因为这批词后面要用来决定页面结构,误判会直接导致页型选错。

比较型查询的写法完全不同

英语的比较型查询有个极稳定的写法,两个名词中间夹一个词。

这个模式好抓,工具和规则都能直接命中。

很多语言没有这个固定写法,用的是连词或者介词短语。

更麻烦的是有些语言用形容词的比较级形态来表达。

比较级形态是词形变化,不是加词,规则抓不到。

结果是比较型查询在这些市场的统计量被严重低估。

补这一类要先列出这门语言表达比较的全部手段:夹在中间的连词、比较级词尾、表示对比的介词短语、还有单纯把两个品牌名并排打进去这种最简形式。四种手段都写进规则,比较型查询的量通常会翻一到两倍,比较型词的决策意图与常见坑那一篇里的策略才用得上。

还有一种最容易漏的比较型写法,就是用户只打两个品牌名或者两个型号,中间什么连接词都不加。这种串在规则里几乎不可能被识别成比较意图,只能靠识别出串里含两个已知实体来判断,需要一份品牌与型号的实体表配合。

本地化修饰词跟英语不是一套

英语里表示便宜、最好、正品的修饰词很集中。

换个市场,同一个诉求可能用完全不同的一批词表达。

有些市场用直接的形容词,有些市场习惯用价格区间数字。

有些市场用的是本地特有的商业概念,翻译过来完全不通。

照着英语修饰词表翻译一遍,得到的是一份没人搜的表。

正确做法是从当地的真实查询串里归纳,不是从英语翻译。

归纳的原料有三个来源:站内搜索日志、搜索词报告的原始串、当地大型平台的搜索框补全。三者交叉之后按频次排序,取前面两百个修饰词做人工归类,这份表才是当地的,跟英语那份重合度通常不到三成。这个动作在长尾关键词的十种挖词渠道与意图分类里有更细的流程。

归纳出来的修饰词表还要标注它出现的位置,前置还是后置。有些语言的修饰词习惯放在名词后面,如果按英语习惯把它拼在前面生成长尾词,得到的串在当地读起来不自然,搜索量自然接近零,而这类错误在词表里完全看不出来。

同一门语言在两个市场,意图会怎么漂移?

同一个词指的东西不一样

最直接的漂移是词义本身在两地分了叉。

同一个词在一个市场指某类商品,在另一个市场指另一类。

这种情况在西班牙人和墨西哥人搜的不是一个词巴西和葡萄牙不是一个市场这两种情形里都很常见。

词义分叉之后,两地的搜索意图自然对不上。

你按一边的理解建了落地页,另一边的流量就全是无效的。

报表上看不出来,因为词一样、量也不小、只是转化难看。

识别词义分叉最省事的办法是看图片结果:同一个词在两个市场各搜一次,看返回的图片是不是同一类东西。图片比文字直观得多,五秒钟就能判断,而这个动作不需要懂那门语言,任何人都能做,特别适合放在流程的最前面做粗筛。

图片粗筛之后还要做一次商品集比对,把两个市场首屏商品页里出现的具体商品列出来,看重合度。重合度低于一半就基本确认词义分了叉。这一步比读文字描述可靠,因为商品是硬事实,不受描述用词的影响。

同一个词处在不同的成熟度阶段

第二种漂移更隐蔽,词义没变,市场阶段变了。

某个品类在一个市场已经普及,在另一个市场刚起步。

普及市场里,用户搜这个词是为了比价和下单。

起步市场里,用户搜同一个词是为了搞清楚这是什么。

两边的搜索量甚至可能差不多,意图却在漏斗的两端。

用一套落地页接两端,两边的转化都不会好看。

判断市场阶段有个便宜的信号,看这个词的相关查询里带不带解释类的后缀。起步市场的相关查询里会大量出现是什么、有什么用、值不值得这类串;成熟市场的相关查询里全是型号、参数、价格、哪里买。相关查询的构成比搜索量本身更能说明阶段。

市场阶段不同还会影响内容的深度选择。起步市场需要更多的基础解释和使用场景,成熟市场需要的是参数对比和购买决策辅助。同一份内容搬过去,起步市场会觉得跳步,成熟市场会觉得啰嗦,两边的停留时间都不好看。

本地商业环境改变了意图

第三种漂移的成因不在语言里,在市场结构里。

如果当地有一个占绝对主导的比价平台或者集市。

那么品牌加型号这类词的意图会从了解变成比价。

用户打这个词是去找最低价,不是去找官方介绍。

同样的词在没有强势比价平台的市场,意图完全不同。

这一层不是语言问题,但会跟语言问题混在一起出现。

把这两类原因分开有个实际好处:语言原因造成的意图差异要靠改文案解决,市场结构造成的要靠改页面结构解决,比如加价格对比模块、加库存与配送信息。改错了地方就是白花钱,而分辨方法很简单,看这个差异在同一个市场的其他语言用户身上存不存在。

判断当地有没有强势比价平台,看目标词首屏里第三方平台占了几个位置就知道。占到一半以上说明用户的习惯路径已经绕过品牌站,这时候在自己站上硬做比价内容收益有限,更划算的做法是先把平台内的展示做好,再回来做站。

两门不同语言里的同一个词该怎么处理?

先撞假朋友清单,别急着分析意图

两门语言里拼写相同的词,第一反应应该是警惕。

尤其是近亲语言之间,这类词的密度非常高。

撞上假朋友的话,意图分析的前提就不成立了。

它们压根不是同一个词,只是长得一样。

这时候要做的是分别当成两个词处理,各建各的表。

近亲语言之间要不要分两套内容有专门的判据,克罗地亚语和斯洛文尼亚语那一对的距离怎么量讲的就是这件事。

撞清单这一步要放在流程最前面,因为它的成本最低而收益最大。一份几百条的假朋友清单跑一遍全量词表只要几秒钟,能挡掉后面所有基于错误前提的分析。跳过这一步,你会花几周时间去解释一个根本不存在的意图差异。

清单不必从零建,先从数量词、时间词、家居词、身体部位词这四类入手,近亲语言之间的假朋友高度集中在这四类里。四类覆盖完再往外扩,投入产出比比按字母顺序逐条比对高得多。

真同源词的意图错位

排除假朋友之后,还剩一批真正的同源词。

它们词源相同、意思接近,但语域和常用度不一样。

在一门语言里是日常词,在另一门里是书面词。

日常词接的是宽泛的大众查询,书面词接的是专业查询。

用同一套落地页接,语气和深度必然有一边不合适。

判断语域差异要靠母语者,词典的标注往往滞后。

有个不用找人的替代办法:看这个词在当地新闻媒体和论坛里的出现频次比。媒体高论坛低说明它偏书面,论坛高媒体低说明它偏口语,两边都高说明它是通用词。这个比值用站外搜索的站点限定查询就能粗略估出来,虽然不精确但足够分档。

语域差异还有一个实际后果,就是它决定了页面该用什么语气。承接口语词的页面用书面语气写,用户会觉得距离感强;承接书面词的页面用口语语气写,会显得不够专业。语气这件事没法量化,但它对停留时间的影响相当明显。

数字与单位带来的意图差异

还有一类同词现象出在数字和单位上。

同一个规格数字,在两个市场对应的商品档次不同。

比如同一个尺寸在一个市场是主流款,另一个市场是小众款。

用户打这个数字进来,期待看到的商品列表完全不同。

这不是语言问题,但它会伪装成语言问题出现在词表里。

处理办法是按市场分别做规格分档,数量分档的口径可以参照LDML对数量类别的定义,别两个市场共用一套。

单位本身也会制造这类问题,同一个品类在两个市场习惯用的计量单位不同,用户打进来的数字就不在同一个量纲上。这类查询如果不做单位换算就直接匹配,会返回完全不相干的结果,而且因为数字看着合理,很难在测试时被发现。

规格分档还要考虑本地主流商品的分布,档位边界应该落在商品密度低的地方而不是整数上。按整数切档看起来整齐,但很可能把同一类主流商品切到两个档里去,用户在任何一个档里都看不到完整的选择。

怎么从原始查询串里把意图拆出来?

先拿到没被合并过的原始串

所有分析的前提是拿到用户实际打进去的那一串字符。

关键词工具给的是归一化之后的结果,形态被合并了。

形态一合并,前面说的第二层信号就全没了。

能拿到原始串的地方有三个,都不经过第三方归一化。

站内搜索日志、搜索词报告的原始串、以及站长工具的查询。

三个来源各有偏差,但都保留了用户打字的真实形态。

三个来源的偏差方向不同,正好可以互补:站内搜索日志只包含已经进站的用户,偏向下游;搜索词报告只包含点了广告的,偏向高商业价值;站长工具的查询覆盖面最广但只有获得过展现的。三份数据交叉之后,覆盖面才算完整。

拿到原始串之后先别急着分析,做一次基础清洗:去掉明显的爬虫串、去掉自己团队测试留下的串、去掉带内部关键词的串。这三类在小语种站里占比可能相当高,因为总量本来就小,一点噪声就能把分布带偏。

按形态而不是按词根归类

拿到原始串之后,第一个动作不是去重,是按形态归类。

把同一个词根的所有形态列出来,各自统计频次。

这张形态频次表是整个分析里最有价值的一张。

它告诉你用户偏好哪个形态,也就间接告诉你意图分布。

如果某个形态的占比明显高于预期,那里通常有故事。

去重要在归类之后做,反过来就把信号洗掉了。

做这张表不需要形态分析工具,按词尾聚类就够用:把词尾相同的串归成一组,人工看一眼组名对不对。切分边界本身的判定可以参照UAX #29的词边界规则,屈折语的词尾数量有限,一门语言几十个词尾覆盖绝大多数情况,一次归类完成之后可以长期复用,后面只要往里补新词尾。

后缀表的起点可以直接抄Snowball按语言给出的后缀剥离规则,排的时候要按最长后缀优先,否则短后缀会先命中把长后缀的情况吃掉。这个细节写错的话表面上程序跑得通,结果却是一堆形态被错误归并,而错误的方向很一致,看结果时会误以为某个形态特别高频。

用页型比例反推意图

形态归类给出的是假设,还需要验证。

验证办法是把每一组形态各跑一次搜索,看首屏页型。

商品页占多数的,是交易意图;百科和长文多的,是信息意图。

论坛和问答多的,通常是解决问题类的意图。

把页型比例填进形态频次表,一张意图地图就成型了。

这张图才是拆落地页的依据,比任何工具的意图标签都准。

页型统计不必人工数,把首屏结果的地址抓下来按域名分类就行,几十个词跑完不到一小时。要注意抓的时候要用目标市场的地区参数,不然拿到的是本地结果,页型比例完全不对,这个坑踩过的人不少。

页型分类的粒度不用太细,商品页、分类页、长文、问答、平台页五类就够。分得太细的问题是同一个页面很难归到唯一一类,标注一致率会掉下来,而这个统计要的是趋势不是精度,五类足够看出趋势。

把结论固化成一张表

分析做完,要把结论落成一张能交给别人用的表。

表的列是词根、形态、频次、页型比例、判定意图、目标页型。

每一行都能直接变成一个工单,不需要再解释。

这张表要按市场分别存,不能两个市场共用一份。

共用一份是这类项目里最常见的偷懒方式,代价很大。

表要定期重跑,意图会随市场成熟度慢慢漂移。

重跑的频率按市场阶段定:起步市场半年一次,因为它变得快;成熟市场一年一次就够。判断要不要提前重跑有个信号,如果某一批词的转化率在没做任何改动的情况下持续变化,多半是意图漂了,这时候不该去调页面,该先去重跑这张表。

表里要留一列写判定依据,注明这一行的意图是根据什么判出来的。半年后回看时,有依据的行可以直接复核,没依据的行只能重做。这一列写起来多花不了几分钟,省下的是下一次重跑时的全部返工。

意图信号还能从哪些非查询数据里读出来?

筛选器的点击顺序会说话

查询串不是唯一的意图来源,站内行为也是。

用户进到分类页之后先点哪个筛选器,那就是他最关心的维度。

在小语种市场里这个信号尤其宝贵,因为查询数据太薄。

筛选器的点击顺序在不同市场往往差别明显。

一个市场先点价格,另一个市场先点品牌,诉求就不同。

把这个顺序统计出来,页面上筛选器的排列也该跟着调。

这份数据的另一个用处是补关键词表:用户高频点击的那个筛选维度,对应的修饰词在当地就是高价值修饰词,即使查询数据里量看着不大也值得单独做落地页,因为点击行为证明了这个维度是决策的关键。

零结果的搜索串是需求缺口

站内搜索里返回零结果的那批串,价值被严重低估。

它们代表用户想要但你没提供的东西,是最直接的需求信号。

在小语种站上,零结果串里有很大一部分不是没货。

而是用户用了另一个词,而你的搜索没做同义词映射。

这批串正好就是前面说的形态变体和借词本土词分工。

把它们做成同义词表,站内搜索和关键词表能一起受益。

处理零结果串有个固定顺序:先看是不是形态问题,再看是不是借词与本土词的分叉,最后才考虑是不是真的没有这个商品。前两类占比通常在六七成,都是改配置就能解决的,第三类才需要采购介入,顺序反了会把简单问题当难题上报。

客服问题的分布补上了盲区

还有一个来源是客服记录,特别是售前咨询。

用户来问的问题,说明页面上没把这件事讲清楚。

把咨询问题按主题归类,看哪一类占比最高。

占比高的那一类,往往就是这个市场特有的关注点。

这个关注点在另一个市场可能根本不存在。

它是最便宜的市场差异探测器,成本几乎为零。

客服记录还能给出一个查询数据给不出的东西,就是用户的原话措辞。这些措辞比归一化过的关键词更贴近真实语言习惯,直接拿来当页面文案的用词,比自己想或者从英语翻译过来都更自然,也更容易命中长尾查询。

落地页要拆到什么颗粒度?

能合并的先合并

拆页之前先想清楚哪些可以不拆。

形态不同但意图一致的,全部合并到一个页面。

合并的方式是把各个形态作为同义词接进同一个页面。

页面标题用最高频的那个形态,其余形态在正文里自然出现。

这样既覆盖了全部形态,又不产生一堆薄页面。

能合并的比例通常在七成以上,真要拆的只是少数。

判断能不能合并的标准只有一条:这两批查询的用户,看到同一个页面会不会都满意。会,就合并;有一边明显不满意,才拆。别用形态是否相同、搜索量是否接近这类间接标准,那些跟用户满不满意没有必然关系。

合并之后要验证一件事,就是被合并进来的那些形态还能不能被搜到。做法是拿每个形态在站内搜一遍,再用站外的站点限定查询看这个形态能不能命中这个页面。有形态命中不到,说明它在页面上出现的位置不够显著,要往标题或者小标题里挪。

真要拆的是哪几种情况

第一种是意图确实落在漏斗两端,一个查资料一个要下单。

第二种是同一个词在两地指的东西不一样,商品集不同。

第三种是修饰词带来的诉求足够独立,比如价格区间。

第四种是页型完全不同,一个要商品列表一个要长文。

四种情况之外的差异,大多可以在同一个页面里消化。

拆多了的代价是内容稀释和互相竞争,比不拆更难修。

四种情况里第一种最值得拆,因为漏斗两端对页面的要求是矛盾的:查资料的人要长文和对比,要下单的人要价格和加购按钮。一个页面同时满足两边,结果通常是两边都做得不上不下,这时候拆开的收益最明显。

还有一种边界情况值得单独判断,就是同一个词在两个市场里承接的品类范围宽窄不同。一边指一个大类一边指其中一个小类,这时候拆不拆取决于大类那边的商品数量,数量够就拆成大类页和小类页,不够就只做小类页。

两个市场的页面结构要不要一致

拆完之后会遇到一个新问题,两边的页面数量对不上。

一个市场拆成了五个页,另一个市场只需要三个。

这时候不要为了对称硬造两个页出来。

页面结构本来就该由当地的意图分布决定,不该对称。

硬对称的结果是两个凑数的薄页面,拖累整站质量。

不对称会让后台管理麻烦一点,但那是管理问题不是策略问题。

管理上的麻烦可以用一个办法缓解:给每个页面打上意图标签而不是靠位置对应,这样两个市场的页面就算数量不同也能按标签对齐,做报表和做内链时都能找到对方。位置对应是很多多语言站的默认假设,一旦意图分布不同就会处处别扭。

不对称还会带来一个内链上的问题,某个市场有的页面在另一个市场不存在,跨语言的对应链接就断了一半。处理办法是让这类页面的跨语言链接指向对方市场语义最接近的那一个页面,而不是留空,留空会让整个跨语言链接网看起来残缺。

哪些不属于语言层,要交出去?

引擎的意图判定归引擎那一层

不同搜索引擎对同一个查询的意图判定不完全一样。

这属于引擎的排序机制,跟语言本身没有关系。

各个引擎自己的打法在出海俄语区绕不开的那套搜索生态这类内容里讲,这里不重复。

本篇只关心语言给了你什么额外的意图信号。

引擎怎么用这些信号,是引擎那边的事。

划清这条线能省下大量重复讨论。

需要注意的是这条线在实操里会被反复模糊,因为引擎的结果是你读意图的主要材料。正确的态度是把搜索结果当成观察窗口而不是分析对象:你透过它看用户想要什么,而不是研究引擎为什么这样排,后者是另一个课题。

有一个例外情况需要跨过这条线,就是某个引擎在某门语言上的分词或者形态处理明显不同于其他引擎。这时候语言层和引擎层耦合在一起了,必须一起看,但这种情况的数量很少,遇到时单独记录就行,不用改整套方法。

地区定位与架构归架构层

两个市场的内容怎么放,用什么域名和路径,属于架构层。

URL结构与slug优化的那些细节跟意图分析是并行的,互不干扰。

意图分析告诉你要做几个页面,架构决定它们放在哪。

顺序上先做意图分析,再做架构决策,反过来容易被架构绑住。

常见的错误是先定好了目录结构,再往里塞页面。

结果是意图分布跟目录结构对不上,硬塞出一堆四不像。

正确的顺序还有一个附带好处:意图分析产出的页面清单,本身就是架构决策的输入。你知道要做多少个页、分几类,才能判断目录该怎么分层。倒过来做的话,架构是拍脑袋定的,后面每加一个页都要跟结构打架。

意图分析产出的页面清单交给架构之前,最好先按意图类型分组并给每组估一个页面数量级。架构决策需要的不是精确页数而是量级,知道某一类是十个还是一百个,目录该分几层的答案就出来了。

翻译质量本身是另一件事

最后要交出去的是翻译质量这一块。

翻译准不准是本地化的问题,不是意图分析的问题。

翻译再准,如果意图判断错了,页面照样不解决问题。

反过来意图对了,翻译粗糙一点也能拿到基础流量。

两件事的优先级不一样,意图在前,质量在后。

这个顺序在预算紧张时特别有用,能决定钱先花在哪。

不过这个优先级有个下限,翻译质量低到影响可读性的时候,意图对不对就没意义了。实操上的分界线是:能读懂、术语一致、没有明显错译,达到这个水平之后再加钱提升翻译质量的边际收益,就明显低于花同样的钱做意图分析。

两件事真正会打架的地方在标题上。翻译得最准的标题不一定是用户实际打的那个形态,而承接搜索的标题必须用高频形态。遇到冲突时优先用高频形态,把准确的说法放进正文首段,这个取舍在小语种上出现的频率相当高。

这套方法怎么落地到日常流程里?

新市场开工时的顺序

进入一个新的小语种市场,动作有固定顺序。

第一步是拿到原始查询串,没有它后面全是猜。

第二步撞假朋友清单,把不是同一个词的先剔出去。

第三步做形态归类,产出形态频次表。

第四步跑页型验证,把意图填进表里。

第五步才是拆页面和写内容,前四步都是准备。

前四步加起来通常在两周以内,相对于一个市场半年的内容投入不算什么,但它决定了那半年的内容有没有落在对的页型上。跳过前四步直接写内容,是这类项目里最贵的一种快,返工时连哪些内容该留都判断不了。

前四步里最容易被压缩的是第一步,理由通常是数据要等。正确的做法是把拿数据这件事提前到决定进入这个市场的那一刻就启动,跟其他准备工作并行,这样等到要做分析时数据已经攒了一两个月,不必再等。

已有市场怎么补做

如果市场已经在跑,补做的切入点是转化率异常的页面。

把转化率明显低于同类的页面挑出来,先看它们接的是什么词。

再把这些词按形态归类,跑一遍页型验证。

大概率会发现其中一部分页面接的词意图跟页型对不上。

这批页面就是补做的优先级最高的部分。

改完之后的效果通常在一个月内就能看到。

补做还有个更省事的入口,就是看跳出率高但停留时间也不短的页面。这个组合往往意味着用户读了内容但没找到想要的东西,正是意图错配的典型症状。单看跳出率会把加载慢、版式差的页面也混进来,加上停留时间这个条件之后精确度高很多。

补做时还有一批页面值得优先看,就是有展现但点击率明显偏低的。这类页面通常不是意图错配而是标题里的形态不对,用户在结果列表里没认出这是自己要找的东西。改标题的成本远低于改整个页面,收益却能立刻看到。

要定期回看的三个数

这套分析不是一次性的,要有三个数放在监控里。

第一个是各形态的频次占比,它变了说明用户习惯在变。

第二个是各词的页型比例,它变了说明市场阶段在变。

第三个是两个市场同一批词的意图判定一致率。

第三个数最有意思,它反映两个市场是在趋同还是在分化。

趋同的话可以逐步合并内容,分化的话要继续加投入。

三个数的采集频率可以不同,第一个季度看一次,后两个半年看一次。别把它们塞进日常报表里,那样只会被忽略;正确做法是做成定期的专项复盘,每次半天,看完直接产出下一季度的调整清单。日常报表管的是有没有问题,这三个数管的是方向对不对。

三个数之外还可以留一个定性观察,就是每次复盘时随机读二十条原始查询串。数字告诉你分布变了,读串告诉你为什么变。这个动作看着不严谨,但很多方向性的变化最先是在原始串的措辞里露出来的,报表要滞后一两个月才反映出来。

常见问题解答

没有站内搜索日志,怎么拿到原始查询串

站内搜索日志是最理想的来源,但确实不是每个站都有。没有的话有三个替代路径。第一个是搜索词报告,广告后台里能看到用户实际打的串,这份数据的问题是只覆盖点过广告的用户,商业意图偏高,但对分析交易类查询完全够用,而且它保留完整形态。第二个是站长工具里的查询数据,覆盖面最广,缺点是有采样和截断,长尾部分看不全,不过对做形态频次表来说主流形态能覆盖到就够了。第三个是搜索建议,在搜索框里逐个输入词根前几个字母,把补全出来的串全部记下来,这个办法最笨但对小语种特别有效,因为补全直接反映真实查询且完整保留形态。三个来源建议同时用,交叉之后能互相补上各自的盲区。另外先把站内搜索功能装上,几行代码的事,三个月之后你就有了一份别人都没有的数据。最后提醒一句,无论用哪个来源,都要确认它给的是原始串而不是归一化之后的结果,这一点直接决定了形态信号还在不在。

形态归类需要形态分析工具吗,没有工具能做吗

能做,而且大多数情况下不需要工具。屈折语的词尾数量是有限的,一门语言常用的词尾通常在几十个量级,把它们列出来做后缀匹配就能覆盖绝大部分情况。具体做法是先按最长后缀优先的顺序排一张后缀表,逐个去匹配查询串,剥掉后缀之后剩下的部分当作词根聚类。这个办法的准确率在八成以上,对做频次分布完全够用,而剩下那两成通常是词干本身也会变化的情况,那批词单独挑出来人工看一眼就行。真正需要专业形态分析工具的场景只有两个,一是要做自动化的大规模处理,二是这门语言的词干变化特别复杂,比如词根内部的元音也会变。先用后缀表跑通流程拿到结论,再决定要不要上工具,顺序反过来的话很容易在选工具上耗掉几周还没产出任何结论。还有一个判断要不要上工具的信号:如果后缀表已经改到上百条还在往里加例外,说明这门语言的形态复杂度超过了后缀匹配的能力上限,该换工具了。

怎么判断两个市场的意图差异值不值得单独投入

用一个简单的估算就够了。先算出意图不一致的那批词占总搜索量的比例,再乘以这批词的预估转化价值,得到的就是这个差异每年值多少钱。跟做一套独立内容的成本一比,答案通常很清楚。经验上意图不一致的词占比低于一成的话,不值得单独做,在现有页面里加一段内容消化掉就行;占到三成以上基本必须单独做,因为这部分流量在现有页面上的转化会一直上不去。中间那一段要看品类的客单价,客单价高的门槛低,客单价低的门槛高。还有一个非财务的考量,如果意图不一致的那批词正好是行业里竞争最激烈的头部词,那就算比例不高也值得单独做,因为在头部词上做对意图是拉开差距的少数机会之一。反过来如果不一致的都是长尾杂词,可以放心先放着。算这笔账时记得把返工成本也算进去,如果现在不拆,将来发现必须拆时已经积累的内容和外链都要迁移,那部分成本通常比一开始就拆高一倍以上。

意图分析的结论多久会过时

取决于市场成熟度和品类变化速度,通常起步市场半年、成熟市场一年重跑一次。但比固定周期更可靠的是设几个触发条件。第一个触发条件是某批词的转化率在没做任何页面改动的情况下持续三个月往下走,这往往意味着意图漂了。第二个是搜索结果的页型构成明显变化,比如原来首屏全是商品页现在冒出来一堆长文,说明引擎对这个词的意图判定变了,你的页面也得跟着调整。第三个是品类本身出现了新的产品形态或者新的购买方式,用户的问法会跟着变。三个条件任何一个触发就重跑,不用等到周期。还有一点要提醒,重跑的时候要保留上一次的结论做对比,不要直接覆盖。两次结论之间的差值才是最有信息量的部分,它告诉你市场往哪个方向走,而这个方向判断比某一次的静态结论价值更大。另外别忘了在重跑之前先把上一次的页面改动清单调出来看一遍,有些变化是你自己的改动引起的,误判成市场漂移会让你朝着错误的方向再改一次。

近亲语言的两个市场,意图分析能不能共用一份

不能共用,但可以共用流程和工具,不能共用结论。原因在前面讲过,越是近亲的语言假朋友密度越高,共用结论等于把假朋友当成同一个词来分析,得出的结论从根上就是错的。正确做法是两个市场各跑一遍完整流程,然后把两份结论并排比对,比对本身会产出很有价值的第三份材料,就是那张一致率表。一致率高的部分说明这两个市场在这些词上确实可以共用内容,一致率低的部分就是必须分开做的清单,这份清单比拍脑袋决定分不分开做要可靠得多。至于近亲语言的两个市场整体要不要分两套内容,那是另一个层面的决策,判据包括互通度、非语言字段差异、复用比例等等,意图一致率只是其中一个输入。把这个输入单独拿出来当唯一判据也不对,它只反映查询层面,不反映内容制作层面的成本。共用流程的时候要注意后缀表和修饰词表也得各存一份,这两张表看起来通用,实际上是各自语言的资产,混用会让归类结果互相污染。

小语种没有足够的查询数据,样本太小怎么办

样本小的时候,放弃精确统计,改用结构化的定性判断。具体有三个办法。第一个是把分析单位从单个词提升到词类,不去问某个词的意图分布,而是问这一类词的意图分布,样本量立刻上去了。第二个是借用邻近市场的结构做先验,找一个语言接近、市场结构接近但数据量更大的市场,先假设意图结构类似,再用小样本去验证这个假设成不成立,验证需要的样本量比从零建结论小得多。第三个是直接做用户访谈,小市场的好处是找几个真实用户不难,问他们搜什么、为什么这么搜,十个人的访谈能顶几万条数据的信息量。三个办法可以叠加用。要避免的错误做法是拿大市场的绝对数字按人口比例缩放到小市场,那个数只能用来估量级,不能用来判意图,意图跟市场大小没有比例关系。三个办法用完之后,把得出的结论标上置信度写进表里,低置信度的行别拿去做重投入的决策,等数据攒够了再复核,这比装作有把握要安全。

意图分类的标签体系该用几档

建议从四档起步,交易、比价、信息、导航,先跑通流程再考虑细分。很多团队一上来就设计十几个标签,结果是标注一致率极低,两个人标同一批词能标出两套结果,后面所有分析都建在这堆噪声上。四档的好处是边界清楚,谁来标结果都差不多。跑通之后如果发现某一档里的词明显还能再分,再往下拆,通常最先需要拆的是信息这一档,因为它里面混了搞清楚是什么和搞清楚怎么用两类差别很大的诉求。拆标签的时机判断很简单,某一档下面的落地页开始出现两种明显不同的形态时,就说明该拆了。还有个跟小语种特别相关的提醒,标签体系要按语言各存一份而不是共用一份,因为不同语言能表达的意图区分度不一样,有些语言天然能分出更细的档,有些分不了,强行统一会丢信息。标签体系定下来之后要配一份标注指南,每个标签给两三个正例和一个反例,新人照着标就能和老人保持一致,这份指南比标签本身更决定数据质量。

权威参考资料

分享到
标签
版权声明

本文标题:《小语种SEO两个市场的关键词表可以一字不差,落地页却得拆成两种》

本文链接:https://zhangwenbao.com/minor-language-search-intent-divergence-across-markets.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交