韩语SEO改标题那天只挪了一个空格,后面跟着的助词又把词形变了一次
本文目录
- 韩语的空格到底跟着什么走?
- 同一个品类词,为什么会有带空格和不带空格两种写法?
- 两种写法要不要各做一个页面?
- 助词是怎么把一个词变出十几个字符串的?
- 为什么同一个助词有两种写法?
- 商品标题模板为什么会拼出本地人一眼看错的句子?
- 三种例外要单独打补丁
- 关键词表该以什么为单位建?
- 汉字词、固有词、外来语,一个概念三层词该做哪个?
- 外来语的写法为什么会两派并存?
- NFC和NFD,为什么让同一个词在库里对不上?
- 三个必查的位置
- 编码遗留会在什么地方咬人?
- URL用谚文还是罗马字?
- 罗马化按哪一套来才不会自己打架?
- 站内搜索为什么搜유모차搜不到유모차를?
- 筛选器和分类名里的助词,要不要带?
- 谚文的字母顺序跟你想的一样吗?
- 表单和地址字段该怎么改?
- 韩语的问句型查询长什么样?
- 搜索结果里的标题会被截在哪?
- 文案里的标点要不要跟着改?
- 敬语层级要不要管?
- 界面会被韩语撑坏吗?
- 数字、日期和价格怎么写才像本地的?
- 机器翻译在韩语上最容易犯哪三类错?
- 母语审校该怎么验收才不流于形式?
- 商品属性字典该怎么建才不会拼出病句?
- 属性值的排序也要单独定
- 韩语的量词多到什么程度?
- 品牌名转写成谚文有几种写法?
- 关键词工具给的量为什么跟站内日志对不上?
- 没有本地工具数据怎么办
- 内链的锚文本该带助词吗?
- 上线前的语言层检查清单
- 韩国市场值不值得单独投一套内容?
- 常见问题解答
- 韩语的关键词表,到底该用带助词的形态还是不带的?
- 分写法的两种写法,页面上到底该用哪一个?
- 助词自动拼接的程序,是不是必须懂韩语才能写?
- 站内搜索一定要上形态素分析吗?
- 正规化的问题,怎么快速判断自己的站有没有中招?
- 页面上的可见文本,要不要为了搜索去掉空格?
- 三层同义词都要做页面吗?
- 没有韩语母语同事,怎么控制内容质量?
- 权威参考资料
摘要:韩语难住外来团队的不是生词,是两件小事:空格打在哪,名词后面粘的那个助词是什么。空格挪一位,一个词被切成两个概念;助词换一个,同一件东西在搜索框里就是另一个字符串,而它写成이还是가,取决于前一个字有没有收音。两条叠起来,词表规模翻好几倍,站内搜索匹配率掉到难看的水平,标题模板拼出本地人一眼看出不对劲的句子。这篇按机制拆:分写法的原则与许可、助词的形态分叉、谚文音节怎么用取余判出收音、三层同义词怎么取舍、正规化差异怎么让同一个词在库里对不上。
做母婴用品的一个独立站,主打婴儿车、奶瓶消毒器、背带这几条线,欧美跑通之后想开韩语版本。团队里没有韩语母语的人,翻译外包,页面照着英文版一比一搭出来。
上线三个月,收录正常,品牌词也能搜到,但品类页几乎不进流量。团队怀疑是竞争问题,又加了一批内容,指标没有任何变化。
后来找了个首尔的自由译者做诊断,人家看了不到十分钟就指出来:分类页标题写的是아기 유모차,中间有个空格。而韩国人真正在搜的是유모차,一个词,没空格,前面那个아기(婴儿)纯属多余——婴儿车本来就是给婴儿用的。
更麻烦的是,站内搜索里用户打进来的是유모차를、유모차가、유모차는这一类带尾巴的写法,系统一个都匹配不上,全部返回空结果。用户在页面上找不到东西,转身就走了。
韩语的空格到底跟着什么走?
韩语写句子要打空格,这一点跟中文日文都不一样。规则的核心只有一句:词与词之间分开写,但助词要黏在前一个词后面,中间不留空。
举个最简单的:아기가 유모차를 탄다(婴儿坐婴儿车)。三段之间有两个空格,但가和를这两个助词,是紧贴在名词后面的,它们不算独立的词。
对做搜索的人来说,这条规则的后果很直接:空格是词的边界,而助词不是。用户打进搜索框的每一个查询,都可能自带一条助词尾巴,而那条尾巴会把字符串改掉。
同一个品类词,为什么会有带空格和不带空格两种写法?
因为正字法在复合名词这件事上留了口子。规范里给的原则是分开写,但同时允许连写,两种都不算错。于是现实中同一个概念普遍存在两副面孔。
| 概念 | 分开写 | 连着写 |
|---|---|---|
| 奶瓶消毒器 | 젖병 소독기 | 젖병소독기 |
| 婴儿背带 | 아기 띠 | 아기띠 |
| 婴幼儿用品 | 유아 용품 | 유아용품 |
| 安全座椅 | 카 시트 | 카시트 |
这四组里,右边那一列在真实搜索里的量普遍更大,因为搜索框里的人懒得打空格。但也有反例,词越长越专业,分开写的比例越高。哪一种更常用,只能靠数据判断,不能靠语法推断。
两种写法要不要各做一个页面?
不要。这是最容易走错的一步。两种写法讲的是同一件东西,各做一个页面,等于自己造了一对内容雷同的页面互相争位置,两边都上不去。
正确做法是选一个主写法作为页面标题和主标题,另一种写法在正文里自然出现一到两次,让页面同时能被两种查询理解。至于站点结构上怎么防止同一内容出现在多个地址,那是架构层的活,可以顺着同一门语言在多个地区怎么排布页面这条线单独去解。
助词是怎么把一个词变出十几个字符串的?
助词是韩语的语法零件,管的是这个名词在句子里担任什么角色。它们不像欧洲语言那样改动词根,而是像挂件一样直接粘在后面。
| 助词 | 作用 | 接在유모차后 |
|---|---|---|
| 이/가 | 主语 | 유모차가 |
| 은/는 | 话题 | 유모차는 |
| 을/를 | 宾语 | 유모차를 |
| 의 | 所属 | 유모차의 |
| 에/에서 | 处所 | 유모차에서 |
| 와/과 | 并列 | 유모차와 |
| 도/만 | 也/只 | 유모차만 |
| 부터/까지 | 从/到 | 유모차까지 |
八行还没列全。加上复合助词和口语省略形态,一个普通名词能拉出二十种以上的书面串。它们在人眼里是同一个词,在字符串比对里是二十个互不相等的东西。
为什么同一个助词有两种写法?
因为要看前面那个字有没有收音。收音是韩语音节结构里的尾辅音,谚文写出来就是音节方块底下那一横或那一撇。
유모차的最后一个字是차,底下什么也没有,属于无收音,配的是가、는、를、와、로。젖병的最后一个字是병,底下有个ㅇ,属于有收音,配的是이、은、을、과、으로。
所以同一句话的骨架,套在两个不同品类词上,输出的字符串是不一样的:유모차가和젖병이,유모차를和젖병을。这就是让所有拼接式文案翻车的地方。
商品标题模板为什么会拼出本地人一眼看错的句子?
因为模板是用英语思路写的,它假设助词是个固定字符串,直接往名词后面接。结果就是젖병가、기저귀를这种错配,前者本地人一看就是错的,后者恰好蒙对。
好消息是这件事完全可以程序化,而且判据非常干净。谚文的每一个音节在编码里都不是随便排的,而是按初声、中声、终声三层规律算出来的。
音节区从U+AC00开始,共11172个字,排布公式是:起点加上初声序号乘588,再加中声序号乘28,最后加终声序号。终声序号为0表示没有收音。
反过来推就成了一行判断:把这个字的码位减去起点,除以28取余数,余数为0就是无收音,非0就是有收音。整个逻辑写完不到十行,却能一次性修好全站所有拼接文案。
三种例外要单独打补丁
第一种是以ㄹ收尾的字,接方向助词时用로而不是으로。第二种是数字和外语单词结尾,得按读音判断,比如2岁读두 살,尾音跟着读法走。第三种是型号名,字母数字混排的,习惯上直接不接助词或者用括号隔开。
这三类在母婴品类里都会碰上,尤其是型号,安全座椅和婴儿车的产品线编号一大堆。把它们做成例外表,比试图写一个万能规则实际得多。
关键词表该以什么为单位建?
以去掉助词、并且把空格归一之后的形态为单位建表,把所有变体的量合并到这个单位上。这是本篇最重要的一条操作。
如果按原始字符串逐条排优先级,同一个概念的搜索量会被切成十几份,每一份看起来都不值得投入,你会系统性低估韩国市场的每一个品类。这个错误在预算评审会上特别致命,因为数字看起来很客观,但口径是错的。
输出阶段则反过来:页面标题用的是真实查询里最常见的那个形态,通常是不带助词的裸名词加上一个修饰词,比如유모차 추천(婴儿车推荐)。建表按合并口径,写标题按真实口径,这两件事必须分开做。
汉字词、固有词、外来语,一个概念三层词该做哪个?
韩语的词汇有三个来源,同一个意思常常三层各有一个词,语感和使用场景完全不同。
| 概念 | 汉字词 | 固有词 | 外来语 |
|---|---|---|---|
| 价格 | 가격 | 값 | 프라이스 |
| 婴儿车 | — | — | 유모차/스트롤러 |
| 颜色 | 색상 | 빛깔 | 컬러 |
| 尺寸 | 치수 | 크기 | 사이즈 |
规律大致是:汉字词偏正式和书面,固有词偏日常口语,外来语偏时尚和商品化。电商语境里外来语的存在感明显更强,사이즈的搜索量普遍高过치수,컬러也压过색상。
但这不是绝对的。가격在电商语境里就压过값和프라이스,因为它已经是商品页的标准用词。所以还是那句话,靠数据不靠语感,尤其是当团队里没有母语者的时候。
外来语的写法为什么会两派并存?
因为官方的外来语表记规范和民间的实际写法长期对不齐。规范写초콜릿,很多人写초콜렛;规范写메시지,很多人写메세지;规范写리더십,很多人写리더쉽。
这类分歧在商品词里尤其多,因为新品类的名字往往先在市场上流传,规范才追认。做站的时候两边都不能丢:页面上的可见文本用规范写法,站内搜索的同义词表把民间写法映射过去。
如果某个民间写法的量远大于规范写法,那就得权衡了。保哥的做法是让规范写法出现在标题和主标题,让高频民间写法在正文里自然出现一次,两边都能接住,也不显得页面上错别字连篇。
NFC和NFD,为什么让同一个词在库里对不上?
这是韩语站最隐蔽的一类事故,而且几乎不可能靠肉眼发现。
谚文的一个音节,在编码里有两种合法的存放方式:一种是把整个方块存成一个预组合的码位,另一种是把初声、中声、终声三个字母分开存,那些单独的字母在编码里有自己独立的谚文字母码表。前者叫组合形式,后者叫分解形式,两者显示出来一模一样,字节完全不同。
问题出在不同系统的默认选择不一样。某些桌面系统的文件系统习惯用分解形式,而网页表单和数据库通常拿到的是组合形式。于是同一个商品名,从设计师电脑上传的图片文件名,和运营在后台敲进去的标题,字节层面根本不是一个东西。
三个必查的位置
一是文件名和上传路径,图片按商品名命名的站几乎必中;二是从外部导入的商品数据,尤其是经过多次导出导入的表格;三是用户提交的表单内容,输入法和粘贴来源不同,结果也不同。
处理办法是在入口统一:所有进入数据库和索引的文本,一律先做一次正规化转成同一种形式再存。这一步的成本极低,不做的话,你会花几周时间排查一个明明看起来一样却搜不到的鬼故事。
编码遗留会在什么地方咬人?
韩语早年通用的编码不是统一码,而是一套本地字符集,它在互联网登记里的名字带着1987年的年份标记。老系统、老导出文件、老邮件模板,很多还是那一套。
典型的翻车场景是:从旧系统导出一份商品表,直接喂给新站的导入程序,程序按统一码解读,出来的全是乱码方块。更阴的是半乱码,一部分字对一部分字错,因为两套编码的码位有重叠区。
唯一可靠的办法是在导入环节显式声明源编码,不要让程序猜。凡是猜编码的地方,早晚都会猜错一次,而且往往是在数据量最大的那一次。
URL用谚文还是罗马字?
技术上谚文完全可以进地址,但要经过统一资源标识符规范里定义的百分号编码,一个汉字或谚文字符会展开成九个字符。一个五字的品类名,在地址栏里就是四十五个字符的乱码串,复制粘贴到聊天窗口里没人认得出。
更现实的做法是地址走罗马字,页面上的可见文本用谚文。这样地址短、能读、复制传播不出问题,页面上的语言体验又完全是本地的。
做这件事只要记住一条:地址一旦定下来就别改。为了一点可读性的优化去批量改地址,收益远小于代价,这一条在任何语言上都成立。
罗马化按哪一套来才不会自己打架?
问题在于罗马化不止一套。学术界长期通行一套带附加符号的旧体系,而国家层面在2000年公布过一次修订,两套的结果差别很明显。
| 原词 | 旧体系 | 2000年修订式 |
|---|---|---|
| 부산 | Pusan | Busan |
| 김치 | kimch'i | gimchi |
| 제주 | Cheju | Jeju |
| 대구 | Taegu | Daegu |
人名更乱,因为姓氏的拉丁写法是各家自己定的,同一个姓能写成好几种,护照上是哪种就是哪种,不跟任何标准走。
建站时的原则是:系统内部一律用同一套转换规则,保证地址和标识符可预测;面向用户展示的人名地名,尊重当事人和当地的既有写法。这两条不冲突,但混在一起做就会乱。
站内搜索为什么搜유모차搜不到유모차를?
因为默认的字符串匹配把助词当成了词的一部分。这是韩语站转化率损失最大的一处,而且它不会出现在任何外部工具的报告里,只有站内搜索日志才看得见。
解法按投入从小到大分三层,可以按顺序推进:
| 层级 | 做什么 | 大致投入 | 能解决什么 |
|---|---|---|---|
| 第一层 | 空格归一,查询与索引都去掉所有空格再比对 | 半天 | 分写法两种写法的差异 |
| 第二层 | 助词剥离表,把常见助词从查询尾部切掉 | 两三天 | 绝大多数带尾巴的查询 |
| 第三层 | 接入形态素分析组件 | 一到两周 | 复合词切分与词形还原 |
大多数电商站做完前两层就够用了。第二层要注意一个坑:剥离必须做得保守,比如의是助词,但모의、주의这些词本身就以의结尾,切掉就毁了。安全做法是维护一份不可剥离的白名单,宁可漏切也别切错。
筛选器和分类名里的助词,要不要带?
一律不带。筛选器上的标签、面包屑上的分类名、标签云里的词,全部用裸名词形态,因为它们不是句子成分,加助词反而不自然。
这一条看着琐碎,实际影响不小:这些位置的文本经常被拿去拼页面标题和描述,一旦带了助词,拼出来的就是半截句子。保险做法是在数据层就存裸形态,需要成句的时候再由模板按收音规则补助词。
谚文的字母顺序跟你想的一样吗?
不一样,而且这一条会直接影响索引页和字母导航的体验。
韩语按首字母排序,用的是初声的固有顺序,也就是ㄱ、ㄴ、ㄷ、ㄹ、ㅁ、ㅂ、ㅅ、ㅇ、ㅈ这一串,俗称가나다顺序。数据库如果用默认的二进制排序,出来的结果虽然凑巧接近,但在双辅音和外来语开头的词上会错位。
品牌索引页尤其要注意,韩国用户很习惯按가나다找品牌。这类语言相关的排序规则在国际化标准里有专门定义,配置数据库排序方式前值得先对照一遍,别让它按字节排。
表单和地址字段该怎么改?
照搬英文表单是韩语站最常见的低级错误,几个点必须改。
姓名合并成一个字段,韩国人的名字是姓在前,姓通常一个字,名通常两个字,拆成名和姓两个框会让人不知道怎么填。地址从大到小写,先道市再区洞再门牌,跟英文顺序完全相反。邮编在当时是六位数字,中间带一个连字符。
手机号有固定的三段格式,前缀是固定的那几个号段。验证规则一定要按本地格式写,别用一套国际正则糊弄过去,母婴品类的客户绝大多数是妈妈群体,注册环节任何一点摩擦,流失都是立竿见影的。
韩语的问句型查询长什么样?
韩国用户搜信息类内容有一批高度固定的后缀词,把它们收进词表,就等于拿到了内容选题的地图。
| 后缀词 | 意思 | 典型组合 |
|---|---|---|
| 추천 | 推荐 | 유모차 추천 |
| 후기 | 使用感受 | 아기띠 후기 |
| 비교 | 对比 | 카시트 비교 |
| 가격 | 价格 | 젖병소독기 가격 |
| 순위 | 排行 | 분유 순위 |
| 사용법 | 用法 | 유축기 사용법 |
这几个后缀在韩国的搜索行为里权重很高,尤其是후기。韩国消费者对真实使用体验的依赖程度,比欧美市场高出一截,一篇像样的长评能带来的转化,往往超过三篇参数罗列型的文章。
搜索结果里的标题会被截在哪?
比你以为的早。谚文一个音节占的显示宽度接近两个拉丁字母,所以按字符数算标题长度的那套经验,搬到韩语上会严重高估能显示的信息量。
实际观感是:韩语标题能安稳显示的音节数,大约是英文标题字符数的一半。同样一条按英文习惯写的标题,翻成韩语之后,后半截被切掉的概率高得多。
对策只有一条但很有效:核心品类词放最前面,修饰语、品牌名、促销词一律往后排。母婴品类尤其要注意,很多站习惯把品牌名放在标题开头,结果真正的品类词被挤到显示区外面,等于白写。
还有一个细节:标题里的分隔符占位置。竖线、连字符、括号这些符号在韩语标题里出现得越少越好,能用空格解决的就别用符号。
文案里的标点要不要跟着改?
要,而且这是最容易露馅的地方之一。韩语的行文标点习惯跟中文不一样,逗号句号用的是半角形式,后面跟一个空格;书名和作品名用尖括号形式;括号里的补充说明前面通常不加空格。
直接把中文文案的全角标点搬过去,或者把英文文案的标点原样保留,都会让页面显得不是本地做的。这一层不影响搜索匹配,但影响信任感,母婴品类的用户对页面专业度的敏感度非常高。
省略号、破折号这类符号在韩语里用得比中文少,如果原文里到处都是,多半是翻译腔没清干净。标点这一项也应该进母语审校的检查清单,因为它可以在几秒内判定对错,性价比很高。
敬语层级要不要管?
对选词影响不大,对转化影响很大。
用户在搜索框里打的是最短形式,不带敬语,所以词表这一侧基本不用考虑。但页面上的文案不一样,韩语的语尾分好几个层级,商用文案通常用一种带敬意但不至于生硬的书面体。
用错的后果不是看不懂,而是别扭。语尾太随便,页面显得不专业;太庄重,又像政府公文。母婴这种高度依赖信任感的品类,这一层的分寸值得让母语审校单独过一遍。
界面会被韩语撑坏吗?
韩语的文本长度通常比英语短,所以撑爆按钮的情况不多,反倒是另一个问题更常见:断行。
谚文可以在任意音节处断开,浏览器默认也确实会这么断。于是一个完整的词被拦腰截成两行,读起来要停顿一下才反应过来。品类名和按钮文案上出现这种情况,观感是明显掉档的。
处理方式是给关键短语加上不换行的控制,让它整体折行而不是逐字断开。改动很小,但视觉上的提升非常明显,尤其是在窄屏上。
数字、日期和价格怎么写才像本地的?
货币是원,符号写在数字后面,千分位用逗号。日期习惯写成年月日用点隔开的形式,也常见带汉字单位的写法。
真正要注意的是大数的读法。韩语跟中文一样按万进位,十万写成십만而不是百个千。所以促销文案里出现的整数,尽量落在万的整数倍上,读起来才顺,看起来也才像是本地人定的价。
还有一条容易漏:韩国的商品价格普遍包含消费税,展示价就是最终价。把不含税价往上摆再在结账时加一笔,会被当成套路。
机器翻译在韩语上最容易犯哪三类错?
第一类是助词误用,尤其是主语助词和话题助词的混淆。这两个在语法书上都翻成主语标记,但语感差别很大,一段文字里全用同一个,读起来像机器人在念稿。
第二类是分写法错误,该连的连成一坨,该分的分得七零八落。这一类最伤搜索,因为它直接改掉了字符串。
第三类是敬语层级不统一,同一页里几种语尾混着来,前一句像跟朋友聊天,后一句像在发通告。这三条可以做成一张卡片发给内容团队,验收时对着扫一眼,比逐句读快得多。
机器翻译当初稿工具没有任何问题,问题只出在直接发布。跨语言的内容生产该怎么排流程,可以顺着把多语言内容当生产线而不是翻译任务来管那套方法去搭。
母语审校该怎么验收才不流于形式?
给审校一份带判据的清单,比让人家通读一遍有效得多。清单上应该有:分写法是否与主写法一致、助词是否与前字收音匹配、外来语是否用了规范写法、语尾层级是否全页统一、品类词是否是本地人会用来搜的那个形态。
五条,每条都能在几秒内判定对错,审校的产出立刻从模糊的感觉不太对,变成可执行的修改清单。选词这一环怎么防止翻译腔,独立站关键词本地化的常见翻译陷阱与母语审校做法里那套流程可以直接搬过来用。
商品属性字典该怎么建才不会拼出病句?
母婴品类的属性特别多:适用月龄、承重上限、材质、可否折叠、是否可上飞机,一个婴儿车能挂十几条。这些属性值会被模板反复拼进标题、筛选器、面包屑和商品描述里,一处写法不对,全站几千个页面一起错。
字典的正确建法是把属性值直接存成它在句子里该有的完整形态,模板取用时不再做二次加工。比如适用月龄不要存数字6,要存6개월부터这样的完整片段,否则模板拼出来的就是半截话。
另一个容易出事的是属性名本身。韩语里的属性名习惯用汉字词,比如재질(材质)、용도(用途)、규격(规格),而翻译软件常给出更口语的固有词,两套混在一起,筛选器看起来就很不专业。做一份属性名的标准词表钉死,是投入最小回报最快的一件事。
属性值的排序也要单独定
月龄、体重这类数值属性要按数值排,不能按字符串排,否则会出现6个月排在12个月后面的荒唐结果。颜色、材质这类文字属性按가나다顺序排。这两条在建字典的时候就该定好,交给前端临时处理,各页面的顺序一定会不一致。
韩语的量词多到什么程度?
多到你必须建表。韩语数东西要在数字后面加一个分类词,而分类词跟着物品类别走,跟中文的量词很像但不完全对应。
| 分类词 | 数什么 | 母婴品类里的例子 |
|---|---|---|
| 개 | 通用的个 | 젖병 3개 |
| 장 | 薄片状 | 기저귀 30장 |
| 대 | 机器与车辆 | 유모차 1대 |
| 벌 | 成套衣物 | 배냇저고리 2벌 |
| 켤레 | 成双的鞋袜 | 양말 5켤레 |
| 통 | 罐装桶装 | 분유 2통 |
更绕的是数字本身有两套读法:汉字数词和固有数词,而用哪一套取决于后面跟的是哪个分类词。개用固有数词,개월用汉字数词,所以三个是세 개,三个月是삼 개월。搞混了不影响理解,但一眼就是外国人写的。
落地建议是把分类词绑在商品分类上,一个品类配一个默认分类词,规格文案由模板按这个映射生成。数量在十以内的场合尽量避免把数字拼进句子,改用纯数字加分类词的写法,能绕开两套数词的坑。
品牌名转写成谚文有几种写法?
通常至少两种,多的时候三四种,而且往往不是官方那种赢。外来品牌进韩国市场,名字要转成谚文,转写规则和民间习惯经常打架,母婴这种依赖口碑传播的品类尤其明显——妈妈群里怎么打,市场上就流行哪种写法。
处理这件事的思路跟外来语写法完全一样:官方定一种作为正式写法,用在标题、品牌页和一切正式场合;同时确保流行的民间写法在正文里自然出现过一次;站内搜索把所有变体映射到同一个目标。
如果你要批量生成转写候选,可以借助国际化组件里的文字转换框架,它能按规则把拉丁字母串转成谚文,输出的候选拿去跟搜索量数据比对,比一个一个手工猜快得多。要提醒的是机器转写只能当候选池,最终定哪一个必须看数据。
还有一类特别容易被忽略:品牌名加助词的时候,助词形态取决于品牌名怎么读而不是怎么拼。拉丁字母写的品牌名后面直接接助词,程序按字符判断必然出错,这类必须走例外表。
关键词工具给的量为什么跟站内日志对不上?
因为两边的口径差着三层。第一层是助词,工具通常把带助词的变体单独计数,而你在站内看到的是同一批用户;第二层是分写法,带空格和不带空格在工具那里是两条记录;第三层是三层同义词,汉字词、固有词、外来语各算各的。
三层叠起来,工具报出来的单条数字往往只是真实需求的一小块。不做合并就直接拿工具数字排优先级,是韩语市场评估最常见的系统性错误,也是最容易在预算会上说服所有人做出错误决策的那种错误——因为数字看着很客观。
没有本地工具数据怎么办
三个土办法一直好用。一是拿自己站内搜索日志当第一手数据,哪怕流量不大,它记录的是真实用户在你品类里的真实打字习惯,比任何外部估算都准。二是看本地竞品的标题写法,排在前面的那批用的是什么形态,那大概率就是对的形态。三是找母语者做一轮小规模的说法采集,把同一件商品让十个人各写一遍,重合度最高的那个写法就是主写法。
这三招合起来的成本不到一天,但能把最关键的几十个品类词定死。至于长尾,等站内数据攒起来再说,不用一开始就追求完备。
内链的锚文本该带助词吗?
不带。锚文本用裸名词或者名词加修饰词的短语形态,别把它写成句子的一部分。
原因有两个。一是带助词的锚文本会把目标词的字符串改掉,等于每条内链指向的都是一个略有差异的词,主题信号被摊薄了。二是韩语的句子结构是修饰在前、谓语在后,如果锚文本嵌在句中并带着助词,很容易断在别扭的位置,读起来像被硬塞进去的。
实操上比较顺的写法是把链接短语单独成句或者放在句子的话题位置,比如以유모차 고르는 법这样的短语作锚,前后用逗号隔开。这样既保住了词形,也不至于让句子读起来磕磕绊绊。至于内链本身该怎么织成网,那是站点结构层面的话题,跟语言无关。
上线前的语言层检查清单
把这一篇压缩成可执行的动作,大概是十条:
| 检查项 | 怎么判定 |
|---|---|
| 品类词写法 | 分写与连写两种形态哪个量大,主写法选对了吗 |
| 助词拼接 | 模板是否按收音判定,例外表是否覆盖型号 |
| 词表口径 | 建表是否按合并形态求和,而不是按原始串排序 |
| 三层同义 | 汉字词、固有词、外来语是否都进了同义词表 |
| 正规化 | 入库文本是否统一到同一种形式 |
| 编码 | 导入环节是否显式声明源编码 |
| 地址与标识符 | 罗马化规则是否全站一致 |
| 站内搜索 | 空格归一与助词剥离是否上线,剥离白名单是否配好 |
| 排序 | 索引页是否按가나다顺序而不是字节顺序 |
| 表单 | 姓名、地址、邮编、手机号是否按本地格式 |
这十条里,第二条和第八条的回报最快。前者让页面上的文案不再露怯,后者直接把站内搜索的空结果率压下去,两件事加起来通常一周就能做完。
韩国市场值不值得单独投一套内容?
看你的品类和耐心。韩国网购渗透率高、客单价不低、消费者愿意为使用体验付费,这些都是好消息。难点是本地竞争强,内容形态偏重实拍和长评,纯参数型的页面很难被认真对待。
还有一件事必须说清楚:韩国的搜索生态跟欧美不是一回事,本地的门户型搜索在很多品类上占着入口位置,它的内容偏好和评价逻辑自成一套。那一半功课属于引擎层,本篇不展开,出海韩国怎么做Naver的搜索优化那篇讲得更细。
本篇讲的这一半是语言层,它的特点是做对了不会自动带来排名,但做错了会让后面所有投入归零。词写错了,内容再多也接不住流量;助词拼错了,页面再漂亮也显得不专业。这一层的性价比,在韩语上尤其高。
常见问题解答
韩语的关键词表,到底该用带助词的形态还是不带的?
建表用不带助词的形态,输出用真实查询里最常见的形态,这两件事要分开做。建表阶段必须把所有带助词的变体归到同一个单位下求和,否则同一个概念的量会被切成十几份,每一份看起来都不值得投入,你会系统性低估整个韩国市场。归一的时候顺手把空格也去掉,因为分写法的两种写法在语义上是一回事。输出阶段则要看用户真正在打什么,通常是裸名词加一个后缀词的组合,比如推荐、后记、价格这一类,页面标题就该用那个形态。判断方法最可靠的是自己的站内搜索日志,那份数据比任何外部工具都准,因为它记录的是真实用户在你的品类里的真实打字习惯。没有日志的新站,可以先按合并口径建表,上线一个月后再回头校准。
分写法的两种写法,页面上到底该用哪一个?
选量大的那个当主写法,另一个在正文里自然出现一到两次,绝对不要为两种写法各做一个页面。判断量的方法是把两种写法分别放进关键词工具查一遍,差距通常很明显。经验规律是词越短、越口语,连着写的量越大;词越长越专业,分开写的比例越高。定下主写法之后要全站统一,页面标题、主标题、面包屑、筛选器标签全部用同一种,不要一个页面一个样。还有一个容易被忽略的位置是商品名,运营在后台录入的时候习惯各写各的,最好在录入环节就做一次归一,或者至少在索引层面把空格去掉再比对。全站统一的收益不只是搜索,还有站内搜索的匹配率和数据统计口径的一致性。
助词自动拼接的程序,是不是必须懂韩语才能写?
不需要。判定收音只要一个取余运算,跟懂不懂韩语没有关系。谚文的音节区在编码里是按初声、中声、终声三层规律排布的,把字符的码位减去区块起点,再对28取余,余数为0就是没有收音,非0就是有收音,然后按这个结果在两种助词写法里选一个即可。整个逻辑不到十行代码。要注意三类例外:以流音收尾的字接方向助词时用短形式;数字和外语单词结尾要按读音判断,不能只看字符;产品型号一般不接助词,用括号或空格隔开更自然。把这三类做成一张例外表,比试图写一个万能规则实际得多。做完之后建议造一批测试数据跑一遍,覆盖有收音、无收音、流音收尾、数字结尾、型号这五种情况,一次验完就一劳永逸。
站内搜索一定要上形态素分析吗?
不一定,大多数电商站做完前两层就够了。第一层是空格归一,查询和索引都去掉全部空格再比对,半天工作量,直接解决分写法差异这个最大的匹配缺口。第二层是助词剥离,维护一张常见助词表,把查询尾部的助词切掉再比对,两三天工作量,能覆盖绝大多数带尾巴的查询。第三层才是接入形态素分析组件,它能处理复合词切分和更复杂的词形还原,但配置和调优要花一到两周,而且需要有人能判断切分结果对不对。做第二层的时候必须保守:有些词本身就以助词的字形结尾,无脑切掉会毁掉这些词,所以要维护一份不可剥离的白名单,宁可漏切也别切错。上线后拿站内搜索日志里的空结果查询做抽样,看看还剩哪些没接住,再决定要不要往第三层走。
正规化的问题,怎么快速判断自己的站有没有中招?
做一个最简单的实验:从后台复制一个商品名,粘贴到站内搜索框里搜一次,如果搜不到自己,那基本就是中招了。更系统的排查方法是写一个脚本,把数据库里的文本字段各取一份,分别转换成两种形式再比较,凡是转换前后字节不同的记录就是可疑对象。重点查三个地方:一是图片文件名和上传路径,按商品名命名图片的站几乎必中;二是从外部导入的商品数据,尤其是经过多轮导出导入的表格;三是用户提交的表单内容,不同输入法和不同粘贴来源的结果可能不一样。修复方式是在入口统一,所有进入数据库和索引的文本先做一次正规化转成同一种形式再存,同时把已有数据跑一遍批量转换。这件事的成本极低,不做的话你会花好几周排查一个明明看起来一样却搜不到的怪现象。
页面上的可见文本,要不要为了搜索去掉空格?
不要为了搜索去改可见文本的规范性,但要在数据层做归一。页面上的句子该有空格就有空格,把句子里的空格全删掉会让阅读体验变得很糟,本地人一眼就看出这站不是韩国人做的。真正该动的是三处:一是品类词和标题里的复合名词,按前面说的主写法统一;二是站内搜索的索引与查询,两边都去空格再比对;三是筛选器标签和分类名,用裸名词形态。这三处调整完,既照顾了用户的输入习惯,又没有牺牲页面的可读性。顺带说一句,搜索引擎对韩语分写法差异的容错这些年一直在改善,但它的容错是概率性的,你自己那一侧能控制的部分还是应该控制住,尤其是站内搜索,那是完全由你决定的地方。
三层同义词都要做页面吗?
不要。汉字词、固有词、外来语三层同义,只需要选一个当页面主词,其余两层进同义词表和正文,不要各做一个页面。三个页面讲同一个东西,结果是三个页面互相稀释,一个都排不上去。选哪个当主词看数据,电商语境里外来语的胜率通常更高,因为商品化的词更多来自外来语,但也有反例,价格这个概念上汉字词就明显占优。选定之后,另外两层的处理方式是:站内搜索的同义词表把它们映射到主词;正文里让其中一个自然出现一次,让页面能同时被两种查询理解;筛选器和标签统一用主词。还有一个实操建议:把这份三层对照表做成一张全站共用的词汇表,交给内容团队和翻译,能挡掉大量的用词不统一问题。
没有韩语母语同事,怎么控制内容质量?
用可判定的清单代替语感。给外部审校一份五到八条的检查表,每条都能在几秒内判断对错:分写法是否与主写法一致、助词是否与前字收音匹配、外来语是否用了规范写法、语尾层级是否全页统一、品类词是否是本地人真会用来搜的形态、数字和价格格式是否本地化、表单字段是否符合本地习惯。这样审校的产出就从模糊的读起来怪怪的,变成一份可执行的修改清单。另外强烈建议做一件事:上线后每周导一次站内搜索日志,看用户实际打进来的词形和你词表里的形态差多少。这份数据不需要懂韩语也能看出问题,凡是搜索量高但返回空结果的查询,就是你的词写错了或者搜索没配好,一条一条修过去,三个月下来质量会有肉眼可见的提升。
权威参考资料
本文标题:《韩语SEO改标题那天只挪了一个空格,后面跟着的助词又把词形变了一次》
本文链接:https://zhangwenbao.com/korean-seo-spacing-particles-keyword-research.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0