AI 搜索引擎回答问题时,并不是把你整篇文章读进去再作答。它先把网页切成一小段一小段,为每段建索引,用户提问时只召回最相关的那几段,然后基于这几段生成答案并标注来源。这个切分动作就叫分块,被召回的那一小段才是真正参与生成的内容。
这件事对内容创作者的含义很直接:你的文章不是作为整体被引用的,被引用的是其中某一块。一段话如果单独拎出来看不明白——开头是"这样一来"、中间提到"上文说的那个方法"、结论依赖前面几段的铺垫——那么即使整篇文章写得很好,这一块被召回后也很难支撑一个完整的回答,AI 大概率会转而引用别人写得更自足的那一段。
这款工具做的就是把这个过程可视化:按几种常见策略把你的内容切开,让你看到每一块长什么样、有没有从句子中间被切断、能不能脱离上下文独立成立。
按字符数硬切,数到就切,不管句子说完没有。这是各类检索框架最常见的默认行为,也是最容易切出残句的方式。想知道自己的内容在最粗暴的切法下会变成什么样,就选它。重叠参数用来缓解硬切的伤害:让相邻两块共享一段内容,被切断的句子至少在其中一块里是完整的。
以空行为界切分,每段一块。如果你的段落本身写得短小自足,这种切法效果最好。它也能反过来暴露问题:某一段长到需要被二次切分,说明那段本身就该拆。
以 H2、H3 为界切分,标题会被带进块里作为上下文。这种策略下每一块都自带主题标签,对检索精度帮助很大。也正因为如此,小标题写得具体不具体,会直接影响这一块能不能被正确召回——写"方法二"和写"用重叠窗口缓解语义断裂",检索效果差得远。
在句子边界处切,凑到接近目标长度就断开。它不会切断句子,块的长度也相对均匀,是质量较好的实现常用的方式。
每一块会得到一个自包含评分,扣分项包括这几类:
看完分析结果,可以按这几个方向调整:
把答案写在段落开头。一段的第一句就给结论,后面再展开论证。这样即使这一块被单独召回,开头那句话本身就是一个可用的答案。这也是所谓答案前置的实质。
控制段落长度。让单个段落接近但不超过常见的块大小,段落自然就成为一个完整的检索单元。段落太长会被二次切分,太短则信息密度不够。
关键段落里重复主题词。不是堆砌关键词,而是避免整段用"它"、"该方法"这类代词指代主题。每一块都应该能让人看出在讲什么。
小标题写具体。用标题策略切分时,标题就是这一块的身份标签。具体的标题等于给这一块贴了准确的索引。
数据和结论放在同一段。把数字、来源、结论拆到不同段落,被切开后每块都是残缺的:有数据没结论,或者有结论没依据。
AI回答问题时召回的是某一小块而不是整篇文章。一块话如果脱离上文看不明白,即使全文写得好,这块也撑不起一个完整回答,引擎会转而引用别人更自足的段落。
不是。各家的策略、块大小和重叠都不公开且在变。这里模拟的是业界几种常见做法,用来发现内容的结构性问题,不是精确复现某个引擎。
常见实现落在300到800字符之间。真正该调的不是这个参数,而是让自己的段落长度接近这个区间,这样段落天然就是一个完整的检索单元。
让相邻两块共享一段内容,被硬切断的句子至少在其中一块里是完整的。代价是索引体积变大,重复内容变多。
规则打分:句子被切断、开头是指代词、出现跨块引用、缺主题词、块过短,各自扣分。它靠模式匹配不理解语义,写得自然的指代可能被误判。
只是量级参考。按中文约一字一token、英文约四字符一token折算,不同模型的分词器差异不小,精确值要用对应模型的分词器算。
答案写在段落开头、控制段落长度接近块大小、关键段落里避免整段用代词指代主题、小标题写具体、数据和结论放同一段。
不会。工具不计算语义相似度,也不预测哪一块会被召回。关键词覆盖用的是字面匹配,只作粗略参考。