内容分块优化:AI搜索按块检索的机制与GEO写作方法
本文目录
- AI搜索检索的最小单位为什么是内容块?
- 内容分块是什么?它和写作段落有什么区别?
- RAG向量检索为什么必须先把内容切块?
- 内容分块大小选200还是800 token?
- 分块重叠(overlap)应该留多少?
- 语义分块与固定分块的召回率差多少?
- 内容块脱离上下文为什么会导致检索失败?
- 分块检索与Google段落级排名有什么区别?
- 外贸独立站如何把内容改成自包含块?
- 图表和视频等非文字内容在分块检索中如何处理?
- 如何验证内容分块质量?
- 中文内容分块比英文多了哪些难点?
- 长上下文模型会让内容分块优化过时吗?
- 内容分块优化的三个常见误解
- 常见问题解答
- 内容分块是我自己要在网站上做的操作吗?
- 一个块大概多少字最合适?
- 分块优化和加FAQ、加结构化数据是一回事吗?
- 这和Google的段落级排名有什么区别?
- 为什么块“脱离上下文”这么致命?
- 长上下文模型普及后,分块还有意义吗?
- 权威参考资料
摘要:AI搜索引用你的内容时,不会把整篇文章读一遍。它先把文章切成一个个几百字的“块”(chunk),再用向量检索从成千上万个块里找出最相关的几个。排名单位因此从“页”变成了“块”:一篇结构再好的长文,只要某个段落脱离上下文后说不清自己在讲什么,就会在检索环节被淘汰。本文讲清内容分块的机制、块的大小、重叠的比例、语义分块与固定分块的取舍,以及影响最大的“块脱离上下文”问题,最后给出一套外贸独立站可以直接执行的改造清单。内容分块和Google的段落级排名是两套机制,文中单独做了区分。
AI搜索检索的最小单位为什么是内容块?
很多人还没意识到这一点:ChatGPT、Perplexity或Google AI概览引用你的内容时,读到的并不是“你那篇文章”,而是那篇文章被切碎后的某一小块。
传统SEO里,排名的最小单位是“页面”,一个URL去竞争一个关键词。到了AI搜索这一层,检索系统会先把页面拆成一段段几百字的片段,每段单独转成一串数字向量存进向量库;用户提问时,系统把问题也转成向量,去库里找距离最近的几个片段,拼进上下文交给大模型。最后被引用、被复述、被标上来源链接的,是片段,而非整页。
保哥第一次意识到这个问题的分量,是在帮一个做工业配件出口的客户排查时:他们有篇写得相当扎实的产品选型长文,Google自然排名稳定在前三,但在AI概览和Perplexity里几乎没被引用过。排查下来,问题出在“切法”上,与内容质量无关。文章里最有价值的技术参数对比前面铺垫了三百字背景,切到那一块时只剩半句话加一张表,机器无法判断这块在讲什么。内容本身没问题,只是被切坏了。
内容分块优化(chunk optimization)要解决的就是这个问题。它来自AI检索(尤其是RAG,检索增强生成)的技术架构,是这套架构对内容提出的硬要求。理解分块机制,是做GEO内容工程的基础。
内容分块是什么?它和写作段落有什么区别?
很多人听到“分块”,第一反应是“就是分段”。两者并不完全相同。
写文章时分的“段落”是给人读的,依据语义、节奏和换气。机器分的“块”(chunk)是给检索系统用的,依据token数量、语义边界和切分算法机械地切。一个块可能正好等于一个段落,也可能横跨两三个段落,还可能把一个长段从中间劈开。切分方式由抓取你内容的AI系统的分块策略决定,你决定不了。
常见的切分方式有几类。最简单的是按固定长度切,比如每500个token切一刀,不考虑语义。进一步是“递归字符切分”(recursive character splitting),优先在段落、句子等自然边界处切,找不到边界才硬切。更复杂的是“语义分块”(semantic chunking),用嵌入模型计算相邻句子的语义相似度,在话题转折处断开,让每一块尽量表达一个完整的意思。
需要建立的认知是:你交付的是连续的文章,机器处理的是离散的块。你能控制的,是让内容无论被哪种策略切,切出来的每一块都尽量自洽、带有身份信息、能说清自己在讲什么。分块优化的全部工作都从这里出发。
RAG向量检索为什么必须先把内容切块?
要理解为什么要优化块,先要弄清机器为什么必须把内容切块。
大模型的上下文窗口越来越大,但不可能把全网内容或一个站点的几千篇文章全部塞进去:速度慢、成本高,注意力还会被稀释。所以RAG(检索增强生成)的做法是先“检索”出最相关的一小部分内容,再“增强”到生成环节。检索这一步依靠向量相似度。
系统用嵌入模型(embedding model)把每个块转成一串高维数字(向量),这串数字编码了这块文字的语义。用户的问题同样转成向量。系统在向量空间里计算距离,离问题向量最近的块被判定为最相关。这套机制决定了:块是检索的原子单位。一个块要么整体被召回,要么整体被忽略,不存在“半个块”。
这也是块的“自包含性”影响如此大的原因。向量压缩的是“这一块文字”的整体语义。如果一块里全是“它”“这个方案”“上面提到的方法”这类指代,而被指代的对象在上一块里,这块的向量编码的就是一堆缺少指向的代词,语义模糊,检索自然不准。机器不会像人一样往上翻一段确认上下文,它手里只有这一块。
另外,检索通常不止一轮。成熟的系统采用两阶段检索:先用速度快的双编码器(bi-encoder)粗筛出50到100个候选块,再用更精细的交叉编码器(cross-encoder)重排序(rerank),选出最终进入上下文的几块。这一层和之前介绍过的查询扇出机制相连:一个问题被拆成多路子查询分别检索,每一路都在你的块库里查找,能否命中,直接取决于块切得好不好。
内容分块大小选200还是800 token?
“块切多大合适”是被问得最多的问题,这个问题恰好有可靠的数据可参考。
向量数据库厂商Chroma做过一份系统的分块策略评测,结论与直觉相反:块既不是越大越好,也不是越小越好,块大小直接决定“精度”和“召回”之间的权衡。测试中,200 token的小块精度更高(最高8.0%),但召回偏低;800 token的大块召回达到85.4%,精度却降到1.5%。具体来说,大块更容易被召回(信息多,总能和问题沾上关系),但召回后未必精准(一块里混了几个话题,相关性被稀释)。最优区间在200到400 token之间。
另一份被广泛引用的行业数据给出的结论相近:以递归字符切分、512 token配10%到20%重叠作为大多数内容的起点。换算成中文,512 token大约对应300到400个汉字。一个理想的块,大致相当于一个论点完整、能独立成立的小节,三五百字的篇幅。
这对写作有很具体的指导意义:不要写铺垫五百字才进入正题的段落,也不要把一个完整论点摊成横跨两屏的大段。每隔三五百字,让内容形成一个单独拿出来也能读懂的语义单元。写长文时每隔几段回收一次主题、重述一次关键实体,作用就是帮机器切出干净的块。
分块重叠(overlap)应该留多少?
切块时还有一个容易被忽略的参数:重叠(overlap)。
固定切分最大的风险,是一刀切在一个完整意思的中间:上半句留在这块,下半句进了下一块,两块的信息都不完整。重叠用来降低这个风险:让相邻两块共享一小段内容,像鱼鳞一样叠在一起,保证任何一个完整的句子或论点至少在某一块里是完整的。
经验值是留出块大小的10%到20%作为重叠,比如500 token的块配50到100 token重叠。重叠也不是越多越好。Chroma的测试里有一个需要警惕的发现:OpenAI助手的默认设置是800 token块配400 token重叠(即50%重叠),性能反而相对较差。重叠过多带来大量冗余,块与块的区分度下降,向量检索时大量高度相似的块相互竞争。他们的建议是用更小、甚至无重叠的块来提高效率。
对内容创作者来说,重叠参数属于抓取方,你控制不了,但可以在写作中主动制造“软重叠”:在每个小节开头,用一句话重提上文的关键结论或关键实体,再展开新内容。这样即便机器在段落中间切了一刀,切出来的块开头也有锚点,不会一开头就是“因此”“这种情况下”这类找不到前文的句子。
语义分块与固定分块的召回率差多少?
切分策略之间也有明显差距。Chroma的评测中,不同策略的召回率最多相差9个百分点,这在检索任务里是很大的差距。
固定长度切分最省算力,但最容易切坏语义;递归字符切分会尊重段落和句子边界,参数调好后表现稳定,是性价比最高的默认选项;语义分块(用嵌入模型寻找话题断点)召回最高,评测中基于聚类的语义分块器达到91.3%召回、8.0%精度,基于大模型的语义分块器召回达到91.9%。代价是几乎每个句子都要计算一次嵌入,成本和延迟都更高。
对内容从业者来说,有一个重要推论:你决定不了抓取系统用哪种切分策略,但语义分块的原理是在“话题转折”处断开。如果文章话题切换清晰、每个小节主题单一、转折处有明确的过渡信号(小标题、“接下来谈另一个问题”这类承接句),无论对方用语义分块还是递归分块,都更容易在正确的位置断开,切出来的每一块正好是一个完整话题。反过来,一段里混着三个主题,再好的分块器也切不干净。
所以应对坏切分,最有效的做法是把自己的内容结构写清楚,研究别人的算法反而收益有限。结构清晰的内容天然适合分块。在这一点上,GEO和传统SEO的内容结构化要求是一致的。
内容块脱离上下文为什么会导致检索失败?
接下来是整个分块优化里最关键、也最反直觉的发现。它来自Anthropic的一份研究,重新界定了“好的块”应该是什么样。
问题在于:传统RAG为了便于检索,会把文档切成小块,切碎的同时也切掉了上下文。Anthropic举的例子是,某个块里写着“该公司营收较上季度增长了3%”。这句话本身没错,但单独拿出这一块,机器不知道“该公司”是哪家、“上季度”是哪个季度。向量编码的是一句缺少主语的残句,检索自然不准。
Anthropic的上下文检索(Contextual Retrieval)研究给出的方法是:在给每个块做嵌入之前,先用模型为这块自动生成一段50到100 token的简短说明,把“这块出自哪篇文档、讲的是哪家公司哪个时间段”补在块前面,再做嵌入。这一个改动效果显著:单用上下文嵌入,检索失败率从5.7%降到3.7%(降35%);配合上下文BM25关键词检索,降到2.9%(降49%);再叠加重排序,降到1.9%,累计降低67%。
这项研究对内容创作者的启示比对工程师更大。工程师可以用模型自动补上下文,写作者可以在写作时就把上下文写进每一块。具体做法是少用指代,多用全称。不写“这个工具”,写“Ahrefs的外链分析功能”;不写“上面说的方法”,把方法名重新写出来;每个小节里至少出现一次本节核心实体的全名和所属主题。这样任何一块被单独拿出来,都能说明自己是什么。这是分块优化中投入产出比最高的一项措施。
分块检索与Google段落级排名有什么区别?
这里需要澄清一个常见混淆。有人会问:这和Google早就有的“段落级排名”(passage ranking)是一回事吗?
两者看起来相似,机制完全不同。Google的段落级排名是传统搜索的能力:Google索引整个页面,排名时能识别出页面中某个特别相关的段落,把它单独抽出来参与SERP排序,即使整页主题没那么对口。它的单位仍然挂在“页面”这个URL上,段落只是页面内部的加分项。之前专门拆解过这套机制,想深入了解可以看段落级排名的可抽取块工程。
内容分块面向的是RAG架构:内容被切成块、转成向量、存进向量库,检索时块脱离原页面独立参与竞争。它的单位是“块”本身,原页面的URL在向量检索这一步几乎不参与排序,只在最后引用时被找回来作为来源标注。
两者的区别可以这样概括:段落级排名是“在一个页面内部挑出最好的段落”,分块检索是“在全网所有块里找出最相关的块”。前者优化的是页面结构,后者优化的是每一块单独被检索时的表现。两套机制目前同时在运行,所以两边都要兼顾。好在两者的底层要求高度一致:结构清晰、每段自洽、答案前置。把内容写成一块块能独立成立的小单元,可以同时满足这两套机制。
外贸独立站如何把内容改成自包含块?
下面这份清单可以直接照做,是保哥团队为独立站做GEO改造时专门针对分块优化整理的,外贸站尤其适用。
第一,每个小标题下自成一块。用H2、H3把内容分成主题单一的小节,每节控制在300到500字,正好对应一个理想块的篇幅。小标题用陈述句写出这一节的结论,不要只写一个名词。
第二,答案前置。每个小节的前一两句直接给出结论或定义,后面再展开论证和案例。切块时块前半部分的权重更高,把最需要被检索到的信息放在块的开头,命中率最高。
第三,实体写全称,去掉裸指代。通读全文,把“它”“这个”“上述方案”这类跨段指代尽量换成具体名词的全称。产品名、品牌名、规格型号、专业术语,在每个相关小节里至少完整出现一次。
第四,关键信息不要只放在表格或图片里。向量检索处理的是文字。一段核心参数如果只画在图里,或者全部放进一个大表格,切块时这块就成了“半句话加一张机器读不懂的表”。一定要在表格前后用文字把关键结论复述一遍。
第五,FAQ段落天然适合分块。一问一答的结构,每个问答对就是一个自包含、答案前置、主题单一的块。这也是做GEO的人普遍增加FAQ的原因,这种格式几乎是为分块检索设计的。结构化内容格式那篇文章里对此有详细展开,可以对照着改。
看一个实际的对照:前面提到的工业配件客户,按这份清单把选型长文重排了一遍,把技术参数对比单独提成一个H2小节,开头一句先给选型结论,表格前补一段文字复述关键差异,全篇把“该型号”改成具体型号名。核心观点一个字没改,三周后开始在Perplexity和Google AI概览里被稳定引用,相关长尾问题的引用露出从几乎为零增加到月均十几次。内容质量没变,变的是它更容易被正确切分。
图表和视频等非文字内容在分块检索中如何处理?
还有一类内容在分块环节损失很大,却很少有人注意:非文字内容。
向量检索的嵌入模型主要处理文字。一张信息量很大的对比图、一段讲解透彻的视频、一个能现场计算的交互计算器,在纯文本分块中几乎不可见。切块时,这些内容要么被整体跳过,要么只留下一段简单的alt文本或文件名。你以为交付了大量有效信息,机器实际看到的是一块空白。
这对外贸独立站是一个隐蔽的问题。很多站为了美观,把最核心的产品参数对比、规格差异、选型决策树都做成了精美的信息图。人看着一目了然,机器却一个数字都没读到,这一块在AI检索里等于不存在。最该被引用的硬信息,恰好放在了机器读不到的地方。
解决办法是“图文双轨”,图照样做:每个重要图表、视频的前后,用文字复述它的核心结论和关键数据。图和视频给人看,文字给机器读,两份内容讲同一件事。具体来说,信息图配一段“这张图说明了什么”的文字总结,关键数字直接写进正文;视频配完整的文字转录或要点摘要;alt文本写实际内容(“不锈钢与碳钢法兰在耐腐蚀性上的对比数据”),不要写“图1”“product-image”这类无信息的内容。
多模态嵌入模型确实在进步,将来机器或许能直接理解图片和视频。但就目前而言,把视觉和音频信息转写成文字块,仍是确保它们参与检索的唯一可靠方法。判断标准很简单:能被切成文字块的内容,才有资格进入AI的引用候选池;进不了文字块的内容,做得再精美也是检索盲区。
如何验证内容分块质量?
改完之后需要确认效果。验证分块质量,有几个不需要工程能力的方法。
自己模拟一次分块。把文章每300到400字切一刀,然后逐块阅读:每一块单独看,能不能说清自己在讲什么?有没有一开头就是“因此”“这种情况下”的孤立块?有没有哪块全是代词、找不到主语?单独读不通的块就是检索隐患,回去补上下文。
用目标问题去问AI。把这篇文章想覆盖的真实用户问题,逐个拿去问ChatGPT、Perplexity、Google AI概览,看它们引用了谁、有没有引用你、引用的是哪一段。如果引用了竞品而没有引用你,去读竞品被引用的那一块,它大概率比你的对应内容更自洽、答案更靠前。这是最直接的逆向分析。
关注“被引用的是哪一块”,而不只是“有没有排名”。AI搜索时代的内容诊断,粒度要细化到块。一篇文章里可能某一块频繁被引用,另一块从未被引用。把不被引用的块单独拿出来,按前面的清单改造,比整篇重写效率高得多。
还要注意:即使块切得很好,AI引用也未必马上出现。模型的训练截止时间、RAG索引的更新延迟,都会让“改了内容”到“被AI引用”之间存在时间差。这个滞后机制之前单独分析过,见AI引用滞后的训练截止与RAG索引延迟。不要改完三天没有变化就急着推翻,给它一些时间。
中文内容分块比英文多了哪些难点?
上面引用的评测数据大多基于英文,中文内容做分块优化,会遇到几个英文里没有的问题,外贸独立站做中文站或多语言站时要特别留意。
token和汉字不能等同。分块按token数计算,而在嵌入模型的分词器里,一个汉字常常占1到2个token,远高于英文里一个token约等于0.75个单词的密度。同样切512 token,中文实际只能容纳300到400个汉字,比按“字数”估算的要短不少。结果是中文长段更容易被从中间切断,你以为一个块能装下的完整论点,实际可能被切成了两块。
中文没有空格这一层保障。英文单词之间有空格,递归字符切分天然有“按空格断开”这一底线,无论怎么切都不会把单词劈开。中文是连续的字符流,少了这一层,分块器更依赖标点(句号、分号、问号)来寻找安全的切分点。
如果中文写作习惯是长句一逗到底、三四行不见一个句号,等于把切分点全部藏了起来,分块器只能硬切,切在哪里全凭运气。所以在中文内容里,规范标点除了语文层面的要求,还直接影响分块友好度,该用句号的地方不要用逗号代替。
嵌入模型对中文的支持普遍弱于英文。主流嵌入模型的训练语料以英文为主,对中文语义的编码精度往往稍差。因此中文块的“自包含”标准要定得比英文更高:同样是上下文模糊的块,中文向量比英文更容易检索偏。前面讲的“去掉裸指代、实体写全称”,在中文内容里要执行得更彻底,容错空间更小。
落地建议很直接:中文内容多用短句短段,把长句拆成几句各自成立的话;关键术语用中文全称,必要时在首次出现处附上英文原词,让中英文查询都能命中同一个块;标点保持规范,每个完整意思用句号结束,给分块器留出足够的合法切分点。这些动作单独看都很小,叠加起来能明显降低中文优质内容被切坏的概率。
长上下文模型会让内容分块优化过时吗?
常有人问:模型上下文窗口已经到了几百万token,以后是不是不需要RAG、不需要切块,直接把全文放进去就行,分块优化是不是白学了?
这个担心可以理解,但短期内不成立,原因是成本和效率。把海量内容全部放进上下文,token费用、推理延迟、注意力稀释三方面都承受不了,对需要服务海量查询的搜索产品尤其如此。所以检索层不会消失,反而在向更精细的方向发展,比如代理式RAG,让模型反复检索、反复推理,而非一次检索完毕。块会被检索更多次、参与更多轮推理,块的质量只会更重要。这一演进在代理式RAG与GEO内容重写里有专门讨论。
从更长的时间看,分块优化并非某项具体技术的临时技巧,它对应的是“内容以自包含的最小语义单元被使用”这一趋势。即使将来检索架构再变,“每一段都能独立说清自己”这条原则依然成立。它原本就是好内容的标准,AI把这条标准从建议变成了硬门槛。块怎么被切、怎么被拼进答案,由机器决定;每一块写得扎不扎实,由写作者决定。
内容分块优化的三个常见误解
这个话题受到关注后,市面上的解读质量参差不齐,其中几个误解流传很广,逐一说明。
误解一:把文章拆成超短段就行。实际情况相反。块太小会丢失上下文,前面Chroma的数据也说明了这一点:小块精度虽高但召回偏低,一句话占一段,机器召回的都是缺乏支撑的碎片,无法构成有说服力的回答。分块优化追求的是“自包含的完整论点”,让每一块都能成立、能说清,并非切得越碎越好。把一个完整的意思拆成零散的短句,同样是切坏。
误解二:加一堆小标题就完成了分块优化。小标题确实能帮分块器找到合法的切分点,这一步没有错,但这只是第一步。如果每个小节内部仍然指代混乱、答案放在最后一句、关键实体从头到尾用“它”代替,切出来的块照样不合格。小标题只搭起了骨架,每一块内部说得清楚才算有血肉;只有骨架,机器切出来的块照样读不懂。
误解三:分块是技术团队的事,与写内容的人无关。这个误解危害最大。实际的切块动作确实由抓取方的系统完成,你控制不了块的大小和重叠比例;但切出来的块质量如何,九成取决于内容本身的结构和写法。这是GEO中少数几个内容人员比工程师更能发挥作用的环节:工程师能做的是补充上下文、调整参数,而每一块能否自圆其说,取决于写作者。这部分工作不要让出去。
分块优化考验的并非你是否懂向量、会不会调嵌入模型,而是能否在每一个三五百字的小段落里,把一件事说清楚、说完整,并且不依赖上下文也能成立。这原本就是写作者的基本功,AI搜索让这项基本功第一次直接和流量挂钩。擅长写作的人在这方面已经有先发优势。
常见问题解答
内容分块是我自己要在网站上做的操作吗?
不是。实际的切块动作由抓取你内容的AI系统完成,你无法直接控制对方切多大、留多少重叠。你能做的是“分块优化”:通过内容结构和写作方式,让内容无论被哪种策略切,切出来的每一块都尽量自洽、答案前置、带有上下文。你优化的是内容的“可切性”,切块这个动作本身不由你执行。
一个块大概多少字最合适?
从公开评测数据看,最优区间大致是200到400 token,换算成中文约200到350个汉字,对应一个论点完整的小节。块太小会缺少上下文,块太大会混入多个话题、稀释相关性。实际操作中,按小标题把内容分成每节300到500字、主题单一的小节,基本就落在理想区间内。
分块优化和加FAQ、加结构化数据是一回事吗?
三者相关但不等同。FAQ是分块优化的一个很好的载体,每个问答对天然就是自包含、答案前置的块;结构化数据(schema)帮助机器理解块的语义类型。分块优化是更基础的原则,覆盖全文每一段,不限于FAQ区。可以这样理解:分块优化是地基,FAQ和schema是建在地基上的两种很实用的结构。
这和Google的段落级排名有什么区别?
段落级排名是传统搜索的能力,Google索引整页,排名时抽出页内最相关的段落,单位仍挂在页面URL上。分块检索面向RAG架构,内容被切成块、转成向量后独立参与检索,单位是块本身,原页面URL基本不参与排序。前者优化页面结构,后者优化每一块单独被检索时的表现。两者的底层要求一致:结构清晰、每段自洽、答案前置。
为什么块“脱离上下文”这么致命?
向量检索把每一块整体压缩成一串语义数字,机器手里只有这一块,不会像人一样往前翻看前因后果。如果一块里全是“它”“这个方案”这类指代,而被指代的对象在别的块里,这块的向量编码的就是一堆没有主语的残句,语义模糊,检索不准。Anthropic的研究显示,给每块补上一段简短的上下文说明,能把检索失败率最多降低67%,可见上下文缺失的代价很高。
长上下文模型普及后,分块还有意义吗?
短期内仍然很有意义。把海量内容全部放进上下文,成本、延迟、注意力稀释三方面都承受不了,搜索产品尤其负担不起,所以检索层不会消失,反而在向代理式RAG这类更精细、检索更频繁的方向发展,块的质量只会更重要。从长期看,“每段都能独立说清自己”原本就是好内容的标准,这条原则不会因为上下文窗口变大而失效。
权威参考资料
本文标题:《内容分块优化:AI搜索按块检索的机制与GEO写作方法》
本文链接:https://zhangwenbao.com/chunk-optimization-ai-rag-retrieval-geo.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0