RAG 分块预览器

检索单元 · 切断检测 · 自包含评分 · GEO 改写建议
切分策略
多数检索系统的默认做法:按字符数硬切,不管句子有没有说完。
块大小 500
按字符计。常见实现落在 300 到 800 之间。
重叠 50
相邻块重复的字符数,用来缓解硬切造成的语义断裂。
目标查询词
用空格分隔多个词。填了之后会标出哪些块真正覆盖了这些词。

📖 RAG 分块预览器使用说明

AI 搜索引擎回答问题时,并不是把你整篇文章读进去再作答。它先把网页切成一小段一小段,为每段建索引,用户提问时只召回最相关的那几段,然后基于这几段生成答案并标注来源。这个切分动作就叫分块,被召回的那一小段才是真正参与生成的内容。

这件事对内容创作者的含义很直接:你的文章不是作为整体被引用的,被引用的是其中某一块。一段话如果单独拎出来看不明白——开头是"这样一来"、中间提到"上文说的那个方法"、结论依赖前面几段的铺垫——那么即使整篇文章写得很好,这一块被召回后也很难支撑一个完整的回答,AI 大概率会转而引用别人写得更自足的那一段。

这款工具做的就是把这个过程可视化:按几种常见策略把你的内容切开,让你看到每一块长什么样、有没有从句子中间被切断、能不能脱离上下文独立成立。

一、四种切分策略分别对应什么?

1.1 固定长度:最接近真实默认实现

按字符数硬切,数到就切,不管句子说完没有。这是各类检索框架最常见的默认行为,也是最容易切出残句的方式。想知道自己的内容在最粗暴的切法下会变成什么样,就选它。重叠参数用来缓解硬切的伤害:让相邻两块共享一段内容,被切断的句子至少在其中一块里是完整的。

1.2 按段落:接近理想情况

以空行为界切分,每段一块。如果你的段落本身写得短小自足,这种切法效果最好。它也能反过来暴露问题:某一段长到需要被二次切分,说明那段本身就该拆。

1.3 按标题分节:适合结构化长文

以 H2、H3 为界切分,标题会被带进块里作为上下文。这种策略下每一块都自带主题标签,对检索精度帮助很大。也正因为如此,小标题写得具体不具体,会直接影响这一块能不能被正确召回——写"方法二"和写"用重叠窗口缓解语义断裂",检索效果差得远。

1.4 按句子凑块:折中方案

在句子边界处切,凑到接近目标长度就断开。它不会切断句子,块的长度也相对均匀,是质量较好的实现常用的方式。

二、工具检查哪些问题?

每一块会得到一个自包含评分,扣分项包括这几类:

三、怎么把内容改得更容易被引用?

看完分析结果,可以按这几个方向调整:

把答案写在段落开头。一段的第一句就给结论,后面再展开论证。这样即使这一块被单独召回,开头那句话本身就是一个可用的答案。这也是所谓答案前置的实质。

控制段落长度。让单个段落接近但不超过常见的块大小,段落自然就成为一个完整的检索单元。段落太长会被二次切分,太短则信息密度不够。

关键段落里重复主题词。不是堆砌关键词,而是避免整段用"它"、"该方法"这类代词指代主题。每一块都应该能让人看出在讲什么。

小标题写具体。用标题策略切分时,标题就是这一块的身份标签。具体的标题等于给这一块贴了准确的索引。

数据和结论放在同一段。把数字、来源、结论拆到不同段落,被切开后每块都是残缺的:有数据没结论,或者有结论没依据。

四、这款工具做不到什么?

操作步骤

  1. 粘贴内容放入文章正文或HTML,工具会先清掉标签只留文本。
  2. 选切分策略想看最坏情况选固定长度,想看理想情况选按段落或按标题。
  3. 设块大小与重叠常见实现落在300到800字符,重叠50到100。
  4. 填目标查询词用空格分隔,用来检查每块是否真的覆盖了主题词。
  5. 看自包含评分重点看被标红的块:句子切断、开头指代、跨块引用。
  6. 按建议改写答案前置、控制段长、关键块里重复主题词、小标题写具体。

常见问题解答

为什么要关心内容怎么被切块?

AI回答问题时召回的是某一小块而不是整篇文章。一块话如果脱离上文看不明白,即使全文写得好,这块也撑不起一个完整回答,引擎会转而引用别人更自足的段落。

这就是各家AI引擎真实的分块方式吗?

不是。各家的策略、块大小和重叠都不公开且在变。这里模拟的是业界几种常见做法,用来发现内容的结构性问题,不是精确复现某个引擎。

块大小设多少合适?

常见实现落在300到800字符之间。真正该调的不是这个参数,而是让自己的段落长度接近这个区间,这样段落天然就是一个完整的检索单元。

重叠有什么用?

让相邻两块共享一段内容,被硬切断的句子至少在其中一块里是完整的。代价是索引体积变大,重复内容变多。

自包含评分怎么算的?

规则打分:句子被切断、开头是指代词、出现跨块引用、缺主题词、块过短,各自扣分。它靠模式匹配不理解语义,写得自然的指代可能被误判。

token估算准吗?

只是量级参考。按中文约一字一token、英文约四字符一token折算,不同模型的分词器差异不小,精确值要用对应模型的分词器算。

怎么改能提高被引用的概率?

答案写在段落开头、控制段落长度接近块大小、关键段落里避免整段用代词指代主题、小标题写具体、数据和结论放同一段。

它会做向量检索吗?

不会。工具不计算语义相似度,也不预测哪一块会被召回。关键词覆盖用的是字面匹配,只作粗略参考。