BERT是什么?Google搜索语言理解模型的原理、分工与写作要求

BERT是什么?Google搜索语言理解模型的原理、分工与写作要求
张文保 更新 15 分钟阅读 2,436 阅读
本文目录
  1. BERT是什么样的语言理解模型?
  2. 户外装备英文页把话写通顺后,长尾流量为什么来了?
  3. BERT何时上线搜索,为什么说它影响约十分之一的查询?
  4. BERT的双向编码比单向语言模型强在哪里?
  5. BERT、RankBrain与神经匹配在Google搜索中如何分工?
  6. BERT与蜂鸟算法、MUM是什么关系?
  7. BERT能否被针对性优化或操纵?
  8. 怎样写内容才对BERT的语义理解友好?
  9. 外贸站与多语言站如何应对BERT的语言理解?
  10. 常见问题解答
  11. BERT是一个排名算法吗?
  12. BERT上线后,我需要重新做关键词研究吗?
  13. BERT只对英文有效吗?
  14. BERT和ChatGPT是一回事吗?
  15. BERT还在用吗,会不会被MUM淘汰?
  16. 我怎么知道自己的页面对BERT友好不友好?
  17. 权威参考资料

摘要:BERT是Google在2019年10月正式用于搜索的自然语言理解模型,它让机器第一次能双向读取一句话,结合介词、语序和上下文判断意思,官方称它影响了大约十分之一的英文搜索。BERT不给页面打分排名,它负责先弄清用户到底在问什么,所以针对它能做的,就是把话写通顺、写得像真人在说。文中还拆了它和RankBrain、神经匹配、蜂鸟、MUM的分工,以及外贸站和多语言站该怎么写。

前阵子有个做户外装备的客户来找我,说他的英文产品详情页怎么都排不上去。我打开页面一看,问题很明显:整页英文是机器翻译后再硬塞关键词拼出来的,读起来像喝多了在说绕口令。他觉得委屈,说该有的词都堆齐了。问题恰恰出在这里:他以为Google在数页面里写了几个词,实际上Google早就在判断这句话读不读得通。负责这件事的,就是本文要讲的BERT。

BERT是什么样的语言理解模型?

BERT是Google 2019年用到搜索里的语言理解模型,全称Bidirectional Encoder Representations from Transformers,中文可以译作基于Transformer的双向编码器。名字很长,核心能力只有一项:读一句话时,它不按从左到右的顺序逐词去猜,而是同时看一个词左右两侧的上下文,再判断这个词在当前句子里的含义。

举个例子,人听别人说话,只听前半句常常会理解偏。对方说“我把苹果放桌上了”,这个苹果是水果还是手机,要等整句甚至下一句说完、结合场景才能确定。BERT做的就是这类判断:它把查询里前后的词拿来互相印证,尤其是以前被搜索引擎当作噪音丢掉的小词,比如of、to、for、no这类介词和否定词。这些词经常决定一句话的意思。

Moz那篇讲 BERT在自然语言处理里到底扮演什么角色的科普文章里有个说法我认同:BERT让机器开始理解语言的细微差别,不再把一句话当成一袋无序的词。以前的搜索更接近关键词配对,现在多了一步:先读懂查询的语法结构,再去找匹配的答案。这一步看起来不大,落到结果上却能差出一大截。

户外装备英文页把话写通顺后,长尾流量为什么来了?

回到开头那个客户。他的旧页面里塞满了waterproof、jacket、best、cheap这类词,语法支离破碎。用户实际会搜的是“can you wear a rain jacket over a puffer”这种带完整语境的问句,关心的是外面套不套得下、怎么搭。旧页面里这些词都有,可是连不成通顺的句子,Google读不出页面在回答哪个具体问题。

我让他做的事很简单:清掉机翻痕迹,请母语者把每段改成正常人会说的英文,补齐该有的介词和连接词,把“防风外套能不能罩在羽绒服外面”这类真实场景逐句写清楚。没有加新词,还删掉了一批堆砌的关键词。三周后,那些长尾问句陆续开始带来流量。他问我是不是偷偷做了外链,我说没有,只是页面终于把话说明白了,BERT能读懂了。这就是我一直强调的写给人看,顺带就喂饱了机器。

改完之后,流量质量也变了。以前靠堆词勉强引来的访客,发现内容和需求对不上,很快就离开;现在进来的都是带着具体问题的人,停留时间长、咨询也更细,转化随之上升。意图匹配对上之后就会出现这样的连锁反应:BERT帮页面过滤掉了无效流量,把合适的用户送到了合适的页面。

BERT何时上线搜索,为什么说它影响约十分之一的查询?

2019年10月,Google搜索副总裁Pandu Nayak在那篇宣布BERT用于搜索的官方博客里说,这是过去五年里最大的一次飞跃,影响大约十分之一的英文查询。到2019年12月,BERT扩展到了七十多种语言。

为什么只影响十分之一,没有覆盖全部?因为短查询和导航类查询本身没有多少语境可读,搜一个品牌名,读不读语序结果都一样。BERT真正起作用的,是那些较长、口语化、带着一堆小词的复杂问句,而这正是用户越来越习惯的自然表达方式。

官方举过一个后来被反复引用的例子:查询“2019 brazil traveler to usa need a visa”。这里的关键是to:到底是巴西人去美国,还是美国人去巴西?以前搜索引擎会忽略这个to,给出方向相反的结果。BERT上线后,系统读懂了to指向的方向,返回的才是巴西公民赴美签证的信息。

另一个常被引用的例子是“do estheticians stand a lot at work”。过去stand会被理解成“忍受”,BERT上线后才明白这里问的是美容师上班是不是要一直站着。一个介词,或者一个多义动词,放在不同语境里意思可能完全不同,双向阅读的价值就体现在这里。

这些例子有个共同点:它们都是口语化的完整问句,不是几个孤立的关键词。这类自然语言搜索越来越普遍,BERT针对的正是这种场景。

BERT的双向编码比单向语言模型强在哪里?

这要从BERT之前的模型说起。过去很多语言模型是单向的,要么从左读到右,要么从右读到左,预测一个词时只能看到一侧的上下文。BERT的原始论文(Devlin等,2018)提出了遮盖语言模型的训练方法:随机遮住句子里的一部分词,让模型根据剩下的左右文猜出被遮住的词。这样训练,模型必须同时理解一个词的前后文,没法只看半边。

论文里还有一个叫“下一句预测”的任务,让模型学会判断两句话能不能前后衔接,这对理解整段逻辑很有帮助。

训练的结果是,同一个词出现在不同句子里,BERT能给出不同的理解。bank在“river bank”和“bank account”里意思不同,靠的就是旁边的词。搜索引擎读懂了这一层,你就不必把每个同义词、每种说法都硬塞进页面,系统能顺着语境把页面和用户的真实意图对上。这也解释了一个常见误区:关键词不必一字不差地出现在页面上,页面照样可能排上这个词,因为机器识别的是意思,不只看字面。

BERT、RankBrain与神经匹配在Google搜索中如何分工?

这三个系统最容易被混为一谈,下面分开说。RankBrain作为Google第一个机器学习排名系统,2015年上线,主要处理系统从没见过的新查询,把陌生词和已知概念关联起来,还会参考用户互动做调整。它负责“词和查询”之间的关联。

神经匹配这套被叫做超级同义词的系统,2018年用于搜索,擅长在词和概念之间做模糊的语义匹配:页面上没写某个词,但表达的是那个意思,它也能匹配上。它负责“词和概念”之间的模糊关联。

BERT负责的是语言本身的结构,也就是语序、介词、上下文这些语法层面的信息。Search Engine Journal那篇 BERT更新的完整拆解专门强调过一点,我常转述给客户:BERT的用途是读懂查询,不负责判断内容好坏,所以根本不存在“BERT优化”。

Google自己也澄清过,这三者之间没有替代关系,它们分工协作,在不同环节各自工作。RankBrain帮助理解陌生查询,神经匹配连接近义表达,BERT读懂句子结构,三者合起来,得到一个更贴近用户真实意图的理解。

BERT与蜂鸟算法、MUM是什么关系?

如果说前面三个系统处在同一层,蜂鸟和MUM就属于不同层级。蜂鸟是2013年那次搜索引擎的整机重写,它为“理解整句意图”搭起了基础框架。BERT没有取代蜂鸟,它是在蜂鸟框架里加装的一层更强的语言理解能力:框架由蜂鸟搭建,BERT是后来装进去的组件。

MUM是Google在2021年推出的下一代模型,支持多任务、跨语言、跨模态,官方称它比BERT强上千倍。可以这样区分:BERT只处理文字,只负责理解;MUM能同时处理文字和图片、跨越语言,还能做多步推理。想了解这四代系统从关键词匹配一路演变到意图理解的全景脉络,把它们串起来看会清楚很多。四者的关系可以这样概括:蜂鸟是框架,RankBrain、神经匹配、BERT是框架里的三种能力,MUM是这些能力的全面升级。

BERT能否被针对性优化或操纵?

很多人最关心这个问题。答案是:操纵不了,也没有可供优化的接口。BERT不像meta标签那样有一个入口可以去迎合,它是嵌在理解环节里的底层能力,你能控制的只有写出来的文字本身。BERT刚上线时,Search Engine Land在 对这次更新的解读里就指出:没法针对BERT做优化,能做的只有把内容写得让人和机器都读得懂。

因此那些老做法全部失效:堆同义词、把关键词硬塞进每一段、为了密度写出不通顺的句子,在BERT看来都会减分。它读取的是意思和结构,文字越别扭、越机械,它越难判断页面在讲什么。反过来,把话写顺,把用户的真实问题逐个正面回答清楚,它自然能把页面匹配到相应的查询上。

这条规律和AI时代的写作要求正好一致:无论是Google的BERT,还是后来的大模型,偏好的都是同一类内容,即清楚、自然、确实在回答问题的内容。

怎样写内容才对BERT的语义理解友好?

我给客户的建议一直是下面三条,做法朴素,但很管用:

  • 把话写通顺。句子读起来不要拗口,不要为了塞词删掉该有的介词和连接词。“wear over jacket rain”和“can you wear this over a rain jacket”,机器读到的意图完全不同。
  • 围绕真实问题组织内容。先想清楚用户会怎么问,把完整的问句和对应的答案写明白,不要只围着一个孤立的关键词打转。
  • 不要回避自然语言的长句。过去大家担心长尾词太细、不值得做,现在情况正好相反:越是口语化的长问句,BERT越能发挥作用,这类词竞争小、意图准,是很好的机会。

下面是我常用的一组对照。差的写法:“Waterproof jacket men outdoor best price buy online”,一串名词堆在一起,机器读不出这是在回答谁的什么问题。好的写法:“男士户外防水外套怎么选?我们按防水等级、透气和预算分了三档,帮你在雨天登山时不至于被浇透。”后者用词更少,却把场景、意图和答案都交代清楚了,BERT一读就知道该把它匹配给哪些查询。

还有一点很多人不知道:BERT不只影响普通的十条蓝色链接,也用于精选摘要的抽取。Google当年宣布时就提到,BERT帮助它在更多国家和语言里挑出更贴切的精选摘要片段。所以,如果某段文字写得准确完整、正面回答一个具体问题,它被抽成摘要、被AI引用的概率也会提高,在今天的AI搜索环境里,这一点的价值只会更高。

用不着专门为BERT优化,别再围着那套过时的关键词游戏写就行。把读者当成真实的人,把他的问题当成真实的问题来回答,BERT这一关自然能过。理解系统在整条搜索流水线里处于哪个环节,可以对照Google搜索中心的搜索工作原理文档看一遍:抓取、索引、理解、排名各管各的事,不必混在一起焦虑。

外贸站与多语言站如何应对BERT的语言理解?

这是外贸从业者最该重视的部分。BERT从2019年底起就扩展到了七十多种语言,它读英文站的方式,和读德语站、西班牙语站的逻辑相同。这里面有两个坑和一个机会。

第一个坑是机器翻译。机翻文案经常语序别扭、介词误用,在BERT看来就是一堆读不通的句子,关键词填得再满也没有用。很多站点栽在这上面:钱花在了引流上,内容却是一眼就能看出来的机翻。第二个坑是按中文思维直译,英文母语者根本不会那样表达,语境一错,意图就对不上。你自己看到一段中式英文都会皱眉,Google也很难把它读顺。

机会在于:大多数同行还在堆词、还在用机翻应付,你只要请母语者把内容写得自然,把目标市场用户的真实问法逐句回答清楚,就已经领先一大截。这件事没有什么黑科技,听起来也不新鲜,却是BERT时代最实在的竞争壁垒。保哥做了二十多年,越来越相信一点:搜索引擎的每一次进化,都在奖励那些踏实做好内容的人。BERT用技术手段把这个道理又重申了一遍。

常见问题解答

BERT是一个排名算法吗?

严格来说不是。BERT是语言理解模型,任务是帮Google弄懂查询和内容的意思,本身不直接给页面打分排序。它作用于“理解”这个环节,理解准确了,匹配和排名才更可靠。如果把它当成排名器,就会陷入“为它优化”的误区。

BERT上线后,我需要重新做关键词研究吗?

关键词研究照常做,但重点要调整。不必再纠结某个词一字不差地塞进去多少次,要去研究用户真实的问法、完整的问句和背后的意图,围绕这些组织内容。工具给出的仍然是词,但做内容时要想的是一个个具体的用户问题。

BERT只对英文有效吗?

不是。BERT在2019年10月先用于英文,同年12月扩展到了七十多种语言。无论做哪种语言的站,只要该语言在覆盖范围内,逻辑都相同:把话写自然。多语言站尤其要警惕机器翻译,这是BERT时代最容易踩的坑。

BERT和ChatGPT是一回事吗?

不是一回事,但有渊源。两者都基于Transformer架构,区别在于BERT是专做理解的编码器模型,用来读懂输入;ChatGPT这类是生成式模型,用来产出文本。前者偏重读,后者偏重写,架构同源,用途不同。

BERT还在用吗,会不会被MUM淘汰?

还在用。MUM是能力更强的下一代,但这不代表BERT已经退役。这些系统通常层层叠加、协同工作,很少简单地一个替换另一个,搜索引擎的底层能力一般是逐步累加,不会推倒重来。今天在自然语言表达上下的功夫,服务的不只是BERT,也包括叠加在它之上的各层理解能力,这份投入长期有效。

我怎么知道自己的页面对BERT友好不友好?

没有专门的检测工具,但有个简单办法:把文案念给一个不懂SEO的普通人听,如果对方听着别扭、不知道你在讲什么,BERT大概率也难以理解。读起来像正常人说的话,就是最好的自查标准。

权威参考资料

分享到
标签
版权声明

本文标题:《BERT是什么?Google搜索语言理解模型的原理、分工与写作要求》

本文链接:https://zhangwenbao.com/google-bert-algorithm-nlp-explained.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交