内容分块优化:AI搜索按块检索的机制与GEO写作方法

内容分块优化:AI搜索按块检索的机制与GEO写作方法
张文保 24 分钟阅读 1,508 阅读
本文目录
  1. AI搜索检索的最小单位为什么是内容块?
  2. 内容分块是什么?它和写作段落有什么区别?
  3. RAG向量检索为什么必须先把内容切块?
  4. 内容分块大小选200还是800 token?
  5. 分块重叠(overlap)应该留多少?
  6. 语义分块与固定分块的召回率差多少?
  7. 内容块脱离上下文为什么会导致检索失败?
  8. 分块检索与Google段落级排名有什么区别?
  9. 外贸独立站如何把内容改成自包含块?
  10. 图表和视频等非文字内容在分块检索中如何处理?
  11. 如何验证内容分块质量?
  12. 中文内容分块比英文多了哪些难点?
  13. 长上下文模型会让内容分块优化过时吗?
  14. 内容分块优化的三个常见误解
  15. 常见问题解答
  16. 内容分块是我自己要在网站上做的操作吗?
  17. 一个块大概多少字最合适?
  18. 分块优化和加FAQ、加结构化数据是一回事吗?
  19. 这和Google的段落级排名有什么区别?
  20. 为什么块“脱离上下文”这么致命?
  21. 长上下文模型普及后,分块还有意义吗?
  22. 权威参考资料

摘要:AI搜索引用你的内容时,不会把整篇文章读一遍。它先把文章切成一个个几百字的“块”(chunk),再用向量检索从成千上万个块里找出最相关的几个。排名单位因此从“页”变成了“块”:一篇结构再好的长文,只要某个段落脱离上下文后说不清自己在讲什么,就会在检索环节被淘汰。本文讲清内容分块的机制、块的大小、重叠的比例、语义分块与固定分块的取舍,以及影响最大的“块脱离上下文”问题,最后给出一套外贸独立站可以直接执行的改造清单。内容分块和Google的段落级排名是两套机制,文中单独做了区分。

AI搜索检索的最小单位为什么是内容块?

很多人还没意识到这一点:ChatGPT、Perplexity或Google AI概览引用你的内容时,读到的并不是“你那篇文章”,而是那篇文章被切碎后的某一小块。

传统SEO里,排名的最小单位是“页面”,一个URL去竞争一个关键词。到了AI搜索这一层,检索系统会先把页面拆成一段段几百字的片段,每段单独转成一串数字向量存进向量库;用户提问时,系统把问题也转成向量,去库里找距离最近的几个片段,拼进上下文交给大模型。最后被引用、被复述、被标上来源链接的,是片段,而非整页。

保哥第一次意识到这个问题的分量,是在帮一个做工业配件出口的客户排查时:他们有篇写得相当扎实的产品选型长文,Google自然排名稳定在前三,但在AI概览和Perplexity里几乎没被引用过。排查下来,问题出在“切法”上,与内容质量无关。文章里最有价值的技术参数对比前面铺垫了三百字背景,切到那一块时只剩半句话加一张表,机器无法判断这块在讲什么。内容本身没问题,只是被切坏了。

内容分块优化(chunk optimization)要解决的就是这个问题。它来自AI检索(尤其是RAG,检索增强生成)的技术架构,是这套架构对内容提出的硬要求。理解分块机制,是做GEO内容工程的基础。

内容分块是什么?它和写作段落有什么区别?

很多人听到“分块”,第一反应是“就是分段”。两者并不完全相同。

写文章时分的“段落”是给人读的,依据语义、节奏和换气。机器分的“块”(chunk)是给检索系统用的,依据token数量、语义边界和切分算法机械地切。一个块可能正好等于一个段落,也可能横跨两三个段落,还可能把一个长段从中间劈开。切分方式由抓取你内容的AI系统的分块策略决定,你决定不了。

常见的切分方式有几类。最简单的是按固定长度切,比如每500个token切一刀,不考虑语义。进一步是“递归字符切分”(recursive character splitting),优先在段落、句子等自然边界处切,找不到边界才硬切。更复杂的是“语义分块”(semantic chunking),用嵌入模型计算相邻句子的语义相似度,在话题转折处断开,让每一块尽量表达一个完整的意思。

需要建立的认知是:你交付的是连续的文章,机器处理的是离散的块。你能控制的,是让内容无论被哪种策略切,切出来的每一块都尽量自洽、带有身份信息、能说清自己在讲什么。分块优化的全部工作都从这里出发。

RAG向量检索为什么必须先把内容切块?

要理解为什么要优化块,先要弄清机器为什么必须把内容切块。

大模型的上下文窗口越来越大,但不可能把全网内容或一个站点的几千篇文章全部塞进去:速度慢、成本高,注意力还会被稀释。所以RAG(检索增强生成)的做法是先“检索”出最相关的一小部分内容,再“增强”到生成环节。检索这一步依靠向量相似度。

系统用嵌入模型(embedding model)把每个块转成一串高维数字(向量),这串数字编码了这块文字的语义。用户的问题同样转成向量。系统在向量空间里计算距离,离问题向量最近的块被判定为最相关。这套机制决定了:块是检索的原子单位。一个块要么整体被召回,要么整体被忽略,不存在“半个块”。

这也是块的“自包含性”影响如此大的原因。向量压缩的是“这一块文字”的整体语义。如果一块里全是“它”“这个方案”“上面提到的方法”这类指代,而被指代的对象在上一块里,这块的向量编码的就是一堆缺少指向的代词,语义模糊,检索自然不准。机器不会像人一样往上翻一段确认上下文,它手里只有这一块。

另外,检索通常不止一轮。成熟的系统采用两阶段检索:先用速度快的双编码器(bi-encoder)粗筛出50到100个候选块,再用更精细的交叉编码器(cross-encoder)重排序(rerank),选出最终进入上下文的几块。这一层和之前介绍过的查询扇出机制相连:一个问题被拆成多路子查询分别检索,每一路都在你的块库里查找,能否命中,直接取决于块切得好不好。

内容分块大小选200还是800 token?

“块切多大合适”是被问得最多的问题,这个问题恰好有可靠的数据可参考。

向量数据库厂商Chroma做过一份系统的分块策略评测,结论与直觉相反:块既不是越大越好,也不是越小越好,块大小直接决定“精度”和“召回”之间的权衡。测试中,200 token的小块精度更高(最高8.0%),但召回偏低;800 token的大块召回达到85.4%,精度却降到1.5%。具体来说,大块更容易被召回(信息多,总能和问题沾上关系),但召回后未必精准(一块里混了几个话题,相关性被稀释)。最优区间在200到400 token之间。

另一份被广泛引用的行业数据给出的结论相近:以递归字符切分、512 token配10%到20%重叠作为大多数内容的起点。换算成中文,512 token大约对应300到400个汉字。一个理想的块,大致相当于一个论点完整、能独立成立的小节,三五百字的篇幅。

这对写作有很具体的指导意义:不要写铺垫五百字才进入正题的段落,也不要把一个完整论点摊成横跨两屏的大段。每隔三五百字,让内容形成一个单独拿出来也能读懂的语义单元。写长文时每隔几段回收一次主题、重述一次关键实体,作用就是帮机器切出干净的块。

分块重叠(overlap)应该留多少?

切块时还有一个容易被忽略的参数:重叠(overlap)。

固定切分最大的风险,是一刀切在一个完整意思的中间:上半句留在这块,下半句进了下一块,两块的信息都不完整。重叠用来降低这个风险:让相邻两块共享一小段内容,像鱼鳞一样叠在一起,保证任何一个完整的句子或论点至少在某一块里是完整的。

经验值是留出块大小的10%到20%作为重叠,比如500 token的块配50到100 token重叠。重叠也不是越多越好。Chroma的测试里有一个需要警惕的发现:OpenAI助手的默认设置是800 token块配400 token重叠(即50%重叠),性能反而相对较差。重叠过多带来大量冗余,块与块的区分度下降,向量检索时大量高度相似的块相互竞争。他们的建议是用更小、甚至无重叠的块来提高效率。

对内容创作者来说,重叠参数属于抓取方,你控制不了,但可以在写作中主动制造“软重叠”:在每个小节开头,用一句话重提上文的关键结论或关键实体,再展开新内容。这样即便机器在段落中间切了一刀,切出来的块开头也有锚点,不会一开头就是“因此”“这种情况下”这类找不到前文的句子。

语义分块与固定分块的召回率差多少?

切分策略之间也有明显差距。Chroma的评测中,不同策略的召回率最多相差9个百分点,这在检索任务里是很大的差距。

固定长度切分最省算力,但最容易切坏语义;递归字符切分会尊重段落和句子边界,参数调好后表现稳定,是性价比最高的默认选项;语义分块(用嵌入模型寻找话题断点)召回最高,评测中基于聚类的语义分块器达到91.3%召回、8.0%精度,基于大模型的语义分块器召回达到91.9%。代价是几乎每个句子都要计算一次嵌入,成本和延迟都更高。

对内容从业者来说,有一个重要推论:你决定不了抓取系统用哪种切分策略,但语义分块的原理是在“话题转折”处断开。如果文章话题切换清晰、每个小节主题单一、转折处有明确的过渡信号(小标题、“接下来谈另一个问题”这类承接句),无论对方用语义分块还是递归分块,都更容易在正确的位置断开,切出来的每一块正好是一个完整话题。反过来,一段里混着三个主题,再好的分块器也切不干净。

所以应对坏切分,最有效的做法是把自己的内容结构写清楚,研究别人的算法反而收益有限。结构清晰的内容天然适合分块。在这一点上,GEO和传统SEO的内容结构化要求是一致的。

内容块脱离上下文为什么会导致检索失败?

接下来是整个分块优化里最关键、也最反直觉的发现。它来自Anthropic的一份研究,重新界定了“好的块”应该是什么样。

问题在于:传统RAG为了便于检索,会把文档切成小块,切碎的同时也切掉了上下文。Anthropic举的例子是,某个块里写着“该公司营收较上季度增长了3%”。这句话本身没错,但单独拿出这一块,机器不知道“该公司”是哪家、“上季度”是哪个季度。向量编码的是一句缺少主语的残句,检索自然不准。

Anthropic的上下文检索(Contextual Retrieval)研究给出的方法是:在给每个块做嵌入之前,先用模型为这块自动生成一段50到100 token的简短说明,把“这块出自哪篇文档、讲的是哪家公司哪个时间段”补在块前面,再做嵌入。这一个改动效果显著:单用上下文嵌入,检索失败率从5.7%降到3.7%(降35%);配合上下文BM25关键词检索,降到2.9%(降49%);再叠加重排序,降到1.9%,累计降低67%。

这项研究对内容创作者的启示比对工程师更大。工程师可以用模型自动补上下文,写作者可以在写作时就把上下文写进每一块。具体做法是少用指代,多用全称。不写“这个工具”,写“Ahrefs的外链分析功能”;不写“上面说的方法”,把方法名重新写出来;每个小节里至少出现一次本节核心实体的全名和所属主题。这样任何一块被单独拿出来,都能说明自己是什么。这是分块优化中投入产出比最高的一项措施。

分块检索与Google段落级排名有什么区别?

这里需要澄清一个常见混淆。有人会问:这和Google早就有的“段落级排名”(passage ranking)是一回事吗?

两者看起来相似,机制完全不同。Google的段落级排名是传统搜索的能力:Google索引整个页面,排名时能识别出页面中某个特别相关的段落,把它单独抽出来参与SERP排序,即使整页主题没那么对口。它的单位仍然挂在“页面”这个URL上,段落只是页面内部的加分项。之前专门拆解过这套机制,想深入了解可以看段落级排名的可抽取块工程。

内容分块面向的是RAG架构:内容被切成块、转成向量、存进向量库,检索时块脱离原页面独立参与竞争。它的单位是“块”本身,原页面的URL在向量检索这一步几乎不参与排序,只在最后引用时被找回来作为来源标注。

两者的区别可以这样概括:段落级排名是“在一个页面内部挑出最好的段落”,分块检索是“在全网所有块里找出最相关的块”。前者优化的是页面结构,后者优化的是每一块单独被检索时的表现。两套机制目前同时在运行,所以两边都要兼顾。好在两者的底层要求高度一致:结构清晰、每段自洽、答案前置。把内容写成一块块能独立成立的小单元,可以同时满足这两套机制。

外贸独立站如何把内容改成自包含块?

下面这份清单可以直接照做,是保哥团队为独立站做GEO改造时专门针对分块优化整理的,外贸站尤其适用。

第一,每个小标题下自成一块。用H2、H3把内容分成主题单一的小节,每节控制在300到500字,正好对应一个理想块的篇幅。小标题用陈述句写出这一节的结论,不要只写一个名词。

第二,答案前置。每个小节的前一两句直接给出结论或定义,后面再展开论证和案例。切块时块前半部分的权重更高,把最需要被检索到的信息放在块的开头,命中率最高。

第三,实体写全称,去掉裸指代。通读全文,把“它”“这个”“上述方案”这类跨段指代尽量换成具体名词的全称。产品名、品牌名、规格型号、专业术语,在每个相关小节里至少完整出现一次。

第四,关键信息不要只放在表格或图片里。向量检索处理的是文字。一段核心参数如果只画在图里,或者全部放进一个大表格,切块时这块就成了“半句话加一张机器读不懂的表”。一定要在表格前后用文字把关键结论复述一遍。

第五,FAQ段落天然适合分块。一问一答的结构,每个问答对就是一个自包含、答案前置、主题单一的块。这也是做GEO的人普遍增加FAQ的原因,这种格式几乎是为分块检索设计的。结构化内容格式那篇文章里对此有详细展开,可以对照着改。

看一个实际的对照:前面提到的工业配件客户,按这份清单把选型长文重排了一遍,把技术参数对比单独提成一个H2小节,开头一句先给选型结论,表格前补一段文字复述关键差异,全篇把“该型号”改成具体型号名。核心观点一个字没改,三周后开始在Perplexity和Google AI概览里被稳定引用,相关长尾问题的引用露出从几乎为零增加到月均十几次。内容质量没变,变的是它更容易被正确切分。

图表和视频等非文字内容在分块检索中如何处理?

还有一类内容在分块环节损失很大,却很少有人注意:非文字内容。

向量检索的嵌入模型主要处理文字。一张信息量很大的对比图、一段讲解透彻的视频、一个能现场计算的交互计算器,在纯文本分块中几乎不可见。切块时,这些内容要么被整体跳过,要么只留下一段简单的alt文本或文件名。你以为交付了大量有效信息,机器实际看到的是一块空白。

这对外贸独立站是一个隐蔽的问题。很多站为了美观,把最核心的产品参数对比、规格差异、选型决策树都做成了精美的信息图。人看着一目了然,机器却一个数字都没读到,这一块在AI检索里等于不存在。最该被引用的硬信息,恰好放在了机器读不到的地方。

解决办法是“图文双轨”,图照样做:每个重要图表、视频的前后,用文字复述它的核心结论和关键数据。图和视频给人看,文字给机器读,两份内容讲同一件事。具体来说,信息图配一段“这张图说明了什么”的文字总结,关键数字直接写进正文;视频配完整的文字转录或要点摘要;alt文本写实际内容(“不锈钢与碳钢法兰在耐腐蚀性上的对比数据”),不要写“图1”“product-image”这类无信息的内容。

多模态嵌入模型确实在进步,将来机器或许能直接理解图片和视频。但就目前而言,把视觉和音频信息转写成文字块,仍是确保它们参与检索的唯一可靠方法。判断标准很简单:能被切成文字块的内容,才有资格进入AI的引用候选池;进不了文字块的内容,做得再精美也是检索盲区。

如何验证内容分块质量?

改完之后需要确认效果。验证分块质量,有几个不需要工程能力的方法。

自己模拟一次分块。把文章每300到400字切一刀,然后逐块阅读:每一块单独看,能不能说清自己在讲什么?有没有一开头就是“因此”“这种情况下”的孤立块?有没有哪块全是代词、找不到主语?单独读不通的块就是检索隐患,回去补上下文。

用目标问题去问AI。把这篇文章想覆盖的真实用户问题,逐个拿去问ChatGPT、Perplexity、Google AI概览,看它们引用了谁、有没有引用你、引用的是哪一段。如果引用了竞品而没有引用你,去读竞品被引用的那一块,它大概率比你的对应内容更自洽、答案更靠前。这是最直接的逆向分析。

关注“被引用的是哪一块”,而不只是“有没有排名”。AI搜索时代的内容诊断,粒度要细化到块。一篇文章里可能某一块频繁被引用,另一块从未被引用。把不被引用的块单独拿出来,按前面的清单改造,比整篇重写效率高得多。

还要注意:即使块切得很好,AI引用也未必马上出现。模型的训练截止时间、RAG索引的更新延迟,都会让“改了内容”到“被AI引用”之间存在时间差。这个滞后机制之前单独分析过,见AI引用滞后的训练截止与RAG索引延迟。不要改完三天没有变化就急着推翻,给它一些时间。

中文内容分块比英文多了哪些难点?

上面引用的评测数据大多基于英文,中文内容做分块优化,会遇到几个英文里没有的问题,外贸独立站做中文站或多语言站时要特别留意。

token和汉字不能等同。分块按token数计算,而在嵌入模型的分词器里,一个汉字常常占1到2个token,远高于英文里一个token约等于0.75个单词的密度。同样切512 token,中文实际只能容纳300到400个汉字,比按“字数”估算的要短不少。结果是中文长段更容易被从中间切断,你以为一个块能装下的完整论点,实际可能被切成了两块。

中文没有空格这一层保障。英文单词之间有空格,递归字符切分天然有“按空格断开”这一底线,无论怎么切都不会把单词劈开。中文是连续的字符流,少了这一层,分块器更依赖标点(句号、分号、问号)来寻找安全的切分点。

如果中文写作习惯是长句一逗到底、三四行不见一个句号,等于把切分点全部藏了起来,分块器只能硬切,切在哪里全凭运气。所以在中文内容里,规范标点除了语文层面的要求,还直接影响分块友好度,该用句号的地方不要用逗号代替。

嵌入模型对中文的支持普遍弱于英文。主流嵌入模型的训练语料以英文为主,对中文语义的编码精度往往稍差。因此中文块的“自包含”标准要定得比英文更高:同样是上下文模糊的块,中文向量比英文更容易检索偏。前面讲的“去掉裸指代、实体写全称”,在中文内容里要执行得更彻底,容错空间更小。

落地建议很直接:中文内容多用短句短段,把长句拆成几句各自成立的话;关键术语用中文全称,必要时在首次出现处附上英文原词,让中英文查询都能命中同一个块;标点保持规范,每个完整意思用句号结束,给分块器留出足够的合法切分点。这些动作单独看都很小,叠加起来能明显降低中文优质内容被切坏的概率。

长上下文模型会让内容分块优化过时吗?

常有人问:模型上下文窗口已经到了几百万token,以后是不是不需要RAG、不需要切块,直接把全文放进去就行,分块优化是不是白学了?

这个担心可以理解,但短期内不成立,原因是成本和效率。把海量内容全部放进上下文,token费用、推理延迟、注意力稀释三方面都承受不了,对需要服务海量查询的搜索产品尤其如此。所以检索层不会消失,反而在向更精细的方向发展,比如代理式RAG,让模型反复检索、反复推理,而非一次检索完毕。块会被检索更多次、参与更多轮推理,块的质量只会更重要。这一演进在代理式RAG与GEO内容重写里有专门讨论。

从更长的时间看,分块优化并非某项具体技术的临时技巧,它对应的是“内容以自包含的最小语义单元被使用”这一趋势。即使将来检索架构再变,“每一段都能独立说清自己”这条原则依然成立。它原本就是好内容的标准,AI把这条标准从建议变成了硬门槛。块怎么被切、怎么被拼进答案,由机器决定;每一块写得扎不扎实,由写作者决定。

内容分块优化的三个常见误解

这个话题受到关注后,市面上的解读质量参差不齐,其中几个误解流传很广,逐一说明。

误解一:把文章拆成超短段就行。实际情况相反。块太小会丢失上下文,前面Chroma的数据也说明了这一点:小块精度虽高但召回偏低,一句话占一段,机器召回的都是缺乏支撑的碎片,无法构成有说服力的回答。分块优化追求的是“自包含的完整论点”,让每一块都能成立、能说清,并非切得越碎越好。把一个完整的意思拆成零散的短句,同样是切坏。

误解二:加一堆小标题就完成了分块优化。小标题确实能帮分块器找到合法的切分点,这一步没有错,但这只是第一步。如果每个小节内部仍然指代混乱、答案放在最后一句、关键实体从头到尾用“它”代替,切出来的块照样不合格。小标题只搭起了骨架,每一块内部说得清楚才算有血肉;只有骨架,机器切出来的块照样读不懂。

误解三:分块是技术团队的事,与写内容的人无关。这个误解危害最大。实际的切块动作确实由抓取方的系统完成,你控制不了块的大小和重叠比例;但切出来的块质量如何,九成取决于内容本身的结构和写法。这是GEO中少数几个内容人员比工程师更能发挥作用的环节:工程师能做的是补充上下文、调整参数,而每一块能否自圆其说,取决于写作者。这部分工作不要让出去。

分块优化考验的并非你是否懂向量、会不会调嵌入模型,而是能否在每一个三五百字的小段落里,把一件事说清楚、说完整,并且不依赖上下文也能成立。这原本就是写作者的基本功,AI搜索让这项基本功第一次直接和流量挂钩。擅长写作的人在这方面已经有先发优势。

常见问题解答

内容分块是我自己要在网站上做的操作吗?

不是。实际的切块动作由抓取你内容的AI系统完成,你无法直接控制对方切多大、留多少重叠。你能做的是“分块优化”:通过内容结构和写作方式,让内容无论被哪种策略切,切出来的每一块都尽量自洽、答案前置、带有上下文。你优化的是内容的“可切性”,切块这个动作本身不由你执行。

一个块大概多少字最合适?

从公开评测数据看,最优区间大致是200到400 token,换算成中文约200到350个汉字,对应一个论点完整的小节。块太小会缺少上下文,块太大会混入多个话题、稀释相关性。实际操作中,按小标题把内容分成每节300到500字、主题单一的小节,基本就落在理想区间内。

分块优化和加FAQ、加结构化数据是一回事吗?

三者相关但不等同。FAQ是分块优化的一个很好的载体,每个问答对天然就是自包含、答案前置的块;结构化数据(schema)帮助机器理解块的语义类型。分块优化是更基础的原则,覆盖全文每一段,不限于FAQ区。可以这样理解:分块优化是地基,FAQ和schema是建在地基上的两种很实用的结构。

这和Google的段落级排名有什么区别?

段落级排名是传统搜索的能力,Google索引整页,排名时抽出页内最相关的段落,单位仍挂在页面URL上。分块检索面向RAG架构,内容被切成块、转成向量后独立参与检索,单位是块本身,原页面URL基本不参与排序。前者优化页面结构,后者优化每一块单独被检索时的表现。两者的底层要求一致:结构清晰、每段自洽、答案前置。

为什么块“脱离上下文”这么致命?

向量检索把每一块整体压缩成一串语义数字,机器手里只有这一块,不会像人一样往前翻看前因后果。如果一块里全是“它”“这个方案”这类指代,而被指代的对象在别的块里,这块的向量编码的就是一堆没有主语的残句,语义模糊,检索不准。Anthropic的研究显示,给每块补上一段简短的上下文说明,能把检索失败率最多降低67%,可见上下文缺失的代价很高。

长上下文模型普及后,分块还有意义吗?

短期内仍然很有意义。把海量内容全部放进上下文,成本、延迟、注意力稀释三方面都承受不了,搜索产品尤其负担不起,所以检索层不会消失,反而在向代理式RAG这类更精细、检索更频繁的方向发展,块的质量只会更重要。从长期看,“每段都能独立说清自己”原本就是好内容的标准,这条原则不会因为上下文窗口变大而失效。

权威参考资料

分享到
标签
版权声明

本文标题:《内容分块优化:AI搜索按块检索的机制与GEO写作方法》

本文链接:https://zhangwenbao.com/chunk-optimization-ai-rag-retrieval-geo.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交