GEO效果怎么验证?给那条建议配一个注定无效的对照组
本文目录
- 你手上那几条证据,换一个东西是不是也能凑齐?
- 第一条:爬虫真的来抓了
- 第二条:搜索引擎把它收录了
- 第三条:模型复述出了只写在这个文件里的内容
- 第四条:模型自己说这么做有用
- 这四条为什么排得这么整齐
- 另外还有一条不太常见但杀伤力更大的
- 四条摆在一起,看着像一条完整的链
- 换个说法你可能更容易接受
- 这类材料在方案里通常怎么写
- 什么样的观测才配叫证据?
- 区分力就是把两种情况分开的能力
- 两边都会发生的事,只能证明它自己发生了
- 一个能立刻用的判据
- 把这个判据套在几个熟悉的说法上
- 把证据分成三层,讨论会顺很多
- 为什么这个错误特别难自己发现
- 还有一层更难的:缺的那一半没人替你写
- 一个关于猫的文件为什么四关全过?
- 他发明了一个纯属胡闹的标准
- 然后事情失控了
- 四条证据逐个过关
- 爬虫来抓那一条,其实最容易看穿
- 被收录那一条,混淆的是两件事
- 模型复述那一条,解释起来最没意思
- 模型背书那一条,机制更让人清醒
- 最有说服力的是两周后那次复问
- 这件事对提问方式的直接影响
- 顺便说一件更黑色的细节
- 我把自己站的日志翻了51天,数字对得上吗?
- 实验台的规模
- 被测对象长什么样
- 为什么要拿robots.txt当对照物
- 三个文件放在一起的账
- 这张表里最该盯住的是哪一列
- 逐个爬虫的账更难看
- 三条值得单独拎出来的读数
- 那17次AI客户端请求分别是谁
- 那473次浏览器请求是谁
- 那些分卷文件的账也一并算了
- 把镜头拉远一点看这批爬虫在干什么
- 这个实验你自己做要花多久
- 结论能不能推广到别人的站
- 做这次统计踩过的两个坑
- 顺手把这批AI爬虫的行为也翻了一遍,看到什么?
- 它们的请求有相当一部分是失败的
- 它们最爱抓的页面出乎意料
- 谁在读robots.txt,这份名单也值得看
- 移动端加速页那份副本被抓得比正文还勤
- 它们在跳转上浪费了1450次请求
- 同一个页面被反复抓,说明不了什么
- 抓取量本身波动很大,别拿单日说事
- 同一个文件的请求量,两次统计为什么差17倍?
- 第一次统计给出的数字是11545
- 第二次统计给出的数字是653
- 差额去了哪里
- 这件事的讽刺之处
- 这个坑在别处也会犯,形态一模一样
- 怎么给自己的统计脚本做一次对照
- 还有一种更隐蔽的口径漂移
- 三条通用的收口
- 对照组该怎么选,才不是白做一遍?
- 条件一:对照物必须确定无效
- 条件二:除了那个变量,其他条件要尽量一致
- 条件三:检验的动作两边必须完全相同
- 常见的坏对照长什么样
- 一个30秒就能跑的粗筛
- 对照物的四种现成来源
- 一次完整的对照,流程只有七步
- 七步里最容易被跳过的其实是第一步
- 这套流程跑一次要多久
- 对照做完之后怎么读结果
- 哪些SEO判断天生就做不了对照?
- 样本只有一个的时候
- 时间没法回滚的时候
- 平台不给你反事实的时候
- 没有对照时,三种替代证据的强度排序
- 关于第三方大样本研究,有一点要提醒
- 官方文档能不能当对照的替代品
- 做不了对照的时候,结论要写得软一点
- 软结论并不等于没结论
- 换几个正在流行的GEO说法,这把尺子还量得动吗?
- 在内容里加一段问答区块,能提高被引用的概率
- 在社区平台多留下品牌痕迹,模型会更倾向推荐你
- 更新发布时间能让老内容重新被抓被引
- 把内容拆成更细的小节,模型更容易摘出来
- 把站点内容做成结构化数据,AI会优先采用
- 把品牌词搜索量当成AI可见度的代理指标
- 把被引用次数当成KPI
- 把这七条排个序
- 拿到一份别人的实验报告,先看哪几行?
- 第一行看样本怎么选出来的
- 第二行看有没有对照
- 第三行看口径写清楚了没有
- 第四行看结论的措辞
- 怎么在站上长期挂一个对照物?
- 卡点是一个文件,不是一次实验
- 落地只要四步
- 对照物需要满足的四个属性
- 那张周表该长什么样
- 一个真做过这件事的客户
- 这件事后来的两个后续
- 换个客户看,同一套做法也能反过来用
- 这套做法真正省下的东西
- 把它接进现有流程只需要改三个地方
- 三种团队规模,三种落地版本
- 别把对照物做成一个项目
- 什么时候该主动放弃这套东西
- 最后留一句给正在被催的人
- 常见问题解答
- 那到底还要不要放llms.txt?
- 日志里看到AI爬虫抓了我的页面,这算不算好事?
- 我没有服务器日志,只有建站平台后台,怎么做对照?
- 模型在回答里说出了只有我文件里才有的内容,还不算证据吗?
- 对照组和A/B测试是一回事吗?
- 这套思路除了GEO还能用在哪?
- 我的站太小,AI爬虫来得很少,还能做这种统计吗?
- 为什么不直接问平台方,让他们说清楚到底用不用?
- 对照物会不会被搜索引擎当成垃圾内容?
- 老板要一个明确结论,我拿这套东西怎么汇报?
- 如果哪天真有厂商公布支持了呢?
- 为什么不干脆等行业形成共识再说?
- 这套东西会不会让团队变得太保守?
- 客户或者上级坚持要做,我该怎么办?
- 这篇文章讲的方法,本身经过验证了吗?
- 权威参考资料
摘要:一个SEO或者GEO做法到底有没有用,判断它的那几条观测,往往在这个做法完全无效的时候也会照样发生。本文把自己站点51天、230万条访问日志翻了一遍,用robots.txt当对照物,量出AI爬虫对llms.txt的真实请求量,并给出一套能长期挂在站上的对照组做法。
先说一件让人不太舒服的事。你手里那几条用来证明某个做法有效的观测,很可能在这个做法彻底无效的情况下,长得一模一样。
这不是说那些观测是假的。日志里那一行确实存在,收录确实发生了,模型确实那么回答了。问题出在别处:这些事情在两种世界里都会发生——做法真的起作用的世界,和做法压根不起作用的世界。既然两边都会发生,它就没法帮你判断你在哪一边。
保哥这两年被问得最多的一句话是:这个做法到底有没有用。提问的人手里通常已经攥着三四条证据,语气也挺笃定。难受的地方在于,那几条证据我一条都不能说它是编的,但它们加在一起,确实什么都没证明。
这篇文章要做的事有三件。先把那几条最常被当成证据的观测拆开,看看它们缺了什么;再拿真实日志做一次对照,把一个具体说法量到底;最后给出一套小到不需要立项、又能长期跑下去的做法,让你下次遇到新概念时不必再从头吵一遍。
先提前说清楚一件事,免得后面被误会:本文不打算证明任何一种做法无效。这里要证明的是另一件事——那套被用来支持它的检验,同样会给一个胡编的东西发通过证。这两句话的区别很大,前者是站队,后者是把尺子拿去校准。
你手上那几条证据,换一个东西是不是也能凑齐?
先把话题落到一个具体的例子上。这两年被讨论得最多的站点文件是llms.txt,一份放在网站根目录、用来给大语言模型介绍站点结构的纯文本。支持它的人拿出来的证据,翻来覆去就是四条。
第一条:爬虫真的来抓了
打开服务器日志,能看到GPTBot、ClaudeBot、PerplexityBot一个接一个地请求这个文件。结论顺理成章:既然它们来抓,说明它们在用。
日志到底怎么翻才看得出门道,这份日志分析实操里一步步拆过。
第二条:搜索引擎把它收录了
在搜索框里输入路径,这个文件真的出现在结果里。有人还会补一句:谷歌不会浪费索引资源去收一个没意义的东西。
收录、排名、流量本来就是三件事,这三层怎么分开诊断另说过。
第三条:模型复述出了只写在这个文件里的内容
这一条看上去最硬。文件里写了一句只有你自己知道的话,然后模型在回答里把它说了出来。除了读过这个文件,还能有什么别的解释?
模型什么时候读的、什么时候更新,引用滞后的两层原因里有拆解。
第四条:模型自己说这么做有用
直接问ChatGPT,llms.txt有没有帮助。它回答有,还能给你列出三条理由,措辞专业,条理清楚。这被当成来自当事人的确认。
客户拿模型给的建议来问你,怎么专业地按住这类对话写过一份应对。
这四条为什么排得这么整齐
值得留意的是,这四条不是随便凑的,它们在方案里几乎总是按同一个顺序出现:先技术、再平台、再模型行为、最后模型表态。这个顺序制造了一种从客观到权威的错觉,让人以为证据强度在递增。
让模型做审计之前要满足哪三个前提,这篇讲得比较具体。
真实情况恰好相反。越往后走,人为解释的空间越大,可复核性越低。第一条至少还是一条日志记录,第四条已经是一段可以随时间翻面的对话内容。把最不可靠的那条放在最后当压轴,是这套材料最狡猾的地方——不一定是有意的,但效果就是这样。
另外还有一条不太常见但杀伤力更大的
有时候你会看到第五条:某个大站做了这件事,它的表现很好。这一条同样没有区分力,而且它比前四条更难反驳,因为对方举的是一个真实存在的成功案例。
对手案例该怎么读才不被带偏,竞品研究的深度方法里有一套流程。
破解的方法是问两个问题:这个大站同期还做了多少别的事?跟它同类、没做这件事的站表现如何?前一个问题通常问不出答案,后一个问题通常会得到我没查过。成功案例是最贵的一种无区分力证据,因为它同时消耗你的判断力和你的自信心。
四条摆在一起,看着像一条完整的链
抓了、收了、复述了、当事人承认了。这个顺序读下来有一种递进感,好像证据一层比一层强。真正的问题是,这四条里没有任何一条要求那个做法是有效的——它们对有效和无效同样成立。
官方对这类新名词的态度其实很明确,那份指南叫停了哪五个动作。
换个说法你可能更容易接受
把上面四条里的llms.txt三个字抹掉,换成任何一个你放在公网上的文本文件,四条依然全部成立。放一份购物清单上去,爬虫会抓它,搜索引擎会收它,模型检索到它会复述里面的内容,你问模型购物清单有没有SEO价值,它多半也会给你编三条理由。一套检验如果对文件内容完全不敏感,那它检验的就不是这份文件。
结构化数据对AI到底有没有用,官方说法加实测那篇也做过同样的追问。
这类材料在方案里通常怎么写
| 方案里的原话 | 它实际说了什么 | 该放哪一栏 |
|---|---|---|
| 主流AI爬虫已开始抓取该文件 | 爬虫会取回公网上的文本 | 现象 |
| 该文件已被谷歌收录,说明其被重视 | 这个网址存在且有文字 | 现象 |
| 模型输出中出现了文件内的独有信息 | 模型检索到了一个可访问的网址 | 现象 |
| 经与模型确认,该做法有正面作用 | 网上多数文章这么写 | 现象 |
| 做了之后被引用次数上涨 | 可能有关,需要同期对照 | 待验证 |
| 不做的那批页面同期没有上涨 | 终于有了一个反面 | 证据 |
方案该怎么分层写才落得下去,团队的四层落地框架可以对照。
前四行是这两年SEO与GEO方案里出现频率最高的句式,它们全都停在现象那一栏。只有最后两行凑在一起,才勉强够得上证据的门槛,而多数方案里恰恰没有最后一行。
什么样的观测才配叫证据?
这里需要一个不太常挂在嘴边、但做决定的时候躲不开的概念:区分力。
区分力就是把两种情况分开的能力
一个观测有没有价值,不看它有多显眼,看它能不能把两种可能分开。假设有用,你会看到A;假设没用,你会看到什么?如果答案还是A,那么看到A这件事,对你的判断没有任何贡献。
想把实验做到有统计功效,单因素隔离与最小可检测效应那篇更硬核。
这个道理在别的行业里被写进了操作规程。医院做一批化验,会同时跑阴性对照和阳性对照,目的不是测样本,是测这次化验本身还准不准。SEO这行缺的就是这一步:我们习惯了直接看结果,很少先确认这把尺子今天还量不量得出东西。
说句题外话,这也是为什么同一个圈子里,做过技术运维的人对新概念普遍更冷静。他们的日常工作里天天都有对照——同一段代码在测试环境和生产环境各跑一遍,同一个配置在两台机器上各试一次。这个习惯不是天赋,是被事故教出来的。
两边都会发生的事,只能证明它自己发生了
雨停这件事,在你收伞之后会发生,在你不收伞之后也会发生。所以收伞之后雨停了,不能拿来说明收伞让雨停了。这个例子听着幼稚,但换成SEO术语再讲一遍,很多人就点头了——因为术语让人误以为里面多了一层机制。
外链归因也是同样的困境,哪条外链真撬动了排名写过六步实验设计。
一个能立刻用的判据
把你的假设翻过来,再问一遍同一个问题。假如这个做法完全无效,我今天看到的这些现象,还会不会出现?只要答案是会,这条观测就得从证据栏里划掉,挪到现象栏里去。
把提问侧握在自己手里,提示词级的前后测框架给了一个可抄的做法。
观测不会因为它是真的就变成证据。它得先把两种世界分开,才有资格进入证据这一栏。
把这个判据套在几个熟悉的说法上
| 常见说法 | 假如它无效,会看到什么 | 剩下多少区分力 |
|---|---|---|
| 加了结构化数据之后被收录更快了 | 新页面本来就会被收录,速度受抓取预算影响更大 | 低,除非同期有未加标记的对照批次 |
| 更新时间刷新之后排名回来了 | 排名本来就在波动区间里来回走 | 低,需要看未刷新的同类页面 |
| 发了外链之后关键词进前十 | 同期还上线了内容、改过标题、竞品也在动 | 中,取决于能不能锁住其他变量 |
| 屏蔽了某个爬虫之后服务器负载下降 | 负载不会自己降,这个因果链条很短 | 高,动作与结果之间没有别的解释 |
| 改了标题之后点击率涨了 | 展现量分布变了也会带动点击率 | 中高,能用同期未改的页面做基线 |
九种做法各自的实测排名,这份效果对照可以当参考清单。
这张表最有用的地方不是给每一行打分,而是提醒你:区分力不是一个是非题,是一个从低到高的连续量,你要做的是知道自己站在哪一格。站在低那一格并不可耻,可耻的是站在低那一格却把话说得像站在高那一格。
把证据分成三层,讨论会顺很多
实际工作里不必追求非黑即白,分三层就够用了。第一层是现象:某件事发生过,仅此而已。第二层是相关:两件事在时间上一起动了,但没有排除第三方原因。第三层是因果:有对照、有排除、动作和结果之间的其他解释被压到很低。
指标体系怎么搭才不自欺,从指标到异常诊断那篇有完整脉络。
多数团队的问题不是分不清,是汇报的时候把第一层的材料写成了第三层的口气。改法极简单:在每条结论后面加一个括号,注明这是第几层。做过几次之后你会发现,能写进第三层的东西一年也没几件,而这恰恰是行业的真实状况,不是你团队的问题。
| 层级 | 典型句式 | 能支撑的决策 |
|---|---|---|
| 现象 | 我们观察到X发生了 | 值得继续观察,不值得投预算 |
| 相关 | 做了A之后B同期上升 | 可以小步试,需要限定投入上限 |
| 因果 | 有对照组,A带来了B | 可以规模化,可以写进目标 |
为什么这个错误特别难自己发现
因为犯错的人没有编造任何东西。他截了图、留了日志、写了时间戳,每一步都经得起复核。审核这份材料的人只会去查这些事有没有发生,很少有人去问另外那半边:如果这事没用,这些现象是不是照样出现。缺的那一半从来不在材料里,所以也没人会发现它缺。
目标定得能不能被反驳,可被反驳的流量预测模型说的是同一种自律。
还有一层更难的:缺的那一半没人替你写
失败的检验不会自己站出来。没人会专门写一篇文章说我给站上放了个文件、AI没来读、什么都没发生,这种内容没人点。于是公开可见的材料天然只剩下有事发生的那一半,你读到的全是正面记录,读不到的是分母。你能搜到的东西越是一边倒,越说明另一边的记录被过滤掉了,而不是另一边不存在。
失败的那部分也该被写下来,三个失败案例的复盘就是这么记的。
一个关于猫的文件为什么四关全过?
2026年8月7日,英国SEO从业者Mark Williams-Cook在一篇讲cats.txt实验的文章里,把这套逻辑用一个玩笑拆开了。
他发明了一个纯属胡闹的标准
规则是这样的:在网站根目录放一个cats.txt,正式声明与这个网站有关的猫——名字、职务、品种,还有一个叫PurrLevel的必填字段,用来打分这只猫有多爱蹭人,满分10分。他认真写了一份规范文档,发在自己博客上,又在职场社交平台上发了一篇推介文章,理由是大家都知道模型对那个平台的内容有种说不清的偏爱。
这个文件本身的效果实测,十个站九十天的那次记录给的是另一个角度的答案。
然后事情失控了
另一位技术SEO在自己站上也放了一份cats.txt,成了这个胡闹标准的早期采用者。再往后,有人建了一个专门的规范站点,把这份规范整理得比原作者那版还工整。一个开出来的玩笑,两周之内有了竞品实现,这个待遇多数真标准第一个月都拿不到。
比起单一文件,内容架构该怎么分四层搭是更值得花时间的方向。
四条证据逐个过关
接下来就是把那四条检验一条条套上去。
换个问法结果就变,改写敏感性实测给了一套五步的检验。
| 那条证据 | llms.txt的说法 | cats.txt的实测结果 |
|---|---|---|
| 爬虫来抓了 | 日志里能看到主流AI爬虫请求 | 同样能看到,各家一个不落 |
| 搜索引擎收录了 | 路径能被搜到 | 同样被收录,还能在站长后台认领 |
| 模型复述了独家内容 | 回答里出现了只写在文件里的话 | 模型认真介绍了一只根本不存在的猫的职业 |
| 模型说这么做有用 | 问它,它说有帮助 | 问它,它同样说cats.txt能帮助排名 |
爬虫来抓那一条,其实最容易看穿
取回是爬虫的全部工作内容。它遇到一个可访问的路径就会去拿,拿回来之后进不进模型、被不被采纳、有没有权重,全部发生在你看不见的地方。日志能告诉你的只有一件事:这个请求发生过。门口的快递员碰了一下你家门把手,不代表他认可你家的装修风格。
爬虫身份怎么验、抓取预算怎么读,五千站日志实战里拆得很细。
更要命的是,这条证据有一个天然的正反馈:你发了文章讲这个文件,文章被收录,爬虫顺着链接来抓文件,你在日志里看到抓取,于是更确信它有用,于是再发一篇。整个循环里没有任何一步需要那个文件真的被使用。
被收录那一条,混淆的是两件事
索引的含义是这个网址存在、里面有文字、可以在需要的时候被检索到。它不包含重视、认可、优先这些意思。纯文本文件被收录这件事,比多数人以为的要老得多,搜索引擎收纯文本已经收了二十年。
索引这件事的进出规则,加noindex后多久消失做过六场景实测。
更有意思的是站长后台还会邀请你认领这个文件、查看它的展现与点击数据,界面一本正经。一个声称某只英短猫担任界面优化师、蹭人指数8分的文件,在后台里享受的待遇跟你的商品页一模一样。系统不会因为内容荒唐就区别对待,这正是这条证据没有区分力的原因。
模型复述那一条,解释起来最没意思
模型能说出只写在文件里的内容,是因为它做了一次检索,抓到了一个能被检索到的网址,然后读了这个网址上的文字。你的文件在这个过程里扮演的角色是一个普通网页,不是一份被特别对待的标准。它被读,是因为它被收录了;它被收录,是因为它是一个放在公网上的文本文件。链条到此为止,再往前推就没有依据了。
答案里为什么是别人不是你,训练数据共现这条底层机制解释了大半。
模型背书那一条,机制更让人清醒
你问模型某个做法有没有用,它不会去做实验,也不会去查文档,它给你的是它见过的文字里最常见的那个说法。网上写llms.txt有用的帖子够多,它就把这个共识还给你,语气笃定得像一份结论。cats.txt被推荐,走的是同一条路:等到有人去问的时候,网上关于它的热闹文字已经攒够了。
模型在准确性上的边界在哪,五个维度的边界拆解列得比较清楚。
最有说服力的是两周后那次复问
等到玩笑被公开戳穿、网上关于cats.txt的讨论都改成了这是个梗,再去问同一个模型同一个问题,它会告诉你这是一个SEO从业者编出来讽刺行业的玩笑文件。文件一个字都没改,改的是外面的舆论。所谓当事人确认,其实是一次舆论平均值的读数,它跟着舆论一起翻面。
同一条建议换个平台就失灵,四层架构分歧的实测记录过这种翻面。
模型给你的不是判断,是一次统计。它统计的是别人说过什么,不是这件事是不是真的。
这件事对提问方式的直接影响
如果模型的回答本质上是舆论的平均值,那么向它提问的方式就得改。问某个做法好不好,你拿到的是舆论;问某个做法在什么条件下会失效、有没有人报告过反例、官方文档里的原话是什么,你拿到的至少是一批可以顺着去核对的线索。把提问从要结论改成要线索,是唯一能让模型在这类问题上真正帮到你的改法。
提示词监测的四个常见误区,这篇讲得比较直白。
顺便说一件更黑色的细节
那个玩笑标准火起来之后,原作者在一场行业活动上被问到,他要不要把这个标准的所有权开放给社区或者提交给标准组织。提问的人是搜索引擎那边的工程师,全场都在笑,但笑点其实很扎人——一个从头到尾没有任何技术内容的文件,走到了被认真讨论治理归属的位置。走到这一步,它需要的全部条件只是:有人写了规范、有人转发、有人跟进实现。这三件事,和它有没有用,一点关系都没有。
这些新名词到底是几条路,三步把它们的关系理清可以省掉不少争论。
我把自己站的日志翻了51天,数字对得上吗?
玩笑归玩笑,光靠一个段子还不足以让人改主意。保哥把自己这个站的访问日志从头到尾过了一遍,想看看真实数据长什么样。
实验台的规模
日志区间是2026年6月19日到8月9日,共51天,总计2307924条请求记录,包含完整的用户代理与来源字段。这个站有一份自动生成的llms.txt,还有一份体量更大的llms-full.txt,两份都在根目录挂了很久。
同一批日志还能挖出别的东西,八类用户代理与二十二周账本是更早的一次。
被测对象长什么样
先交代清楚,免得有人怀疑是文件本身没做好。这个站的llms.txt有23311字节,按栏目分好了区块,每条目带标题和一句说明;llms-full.txt有14946字节,是内容更集中的版本。两份都从站点数据自动生成,每次发新文章都会重新生成一次,最近一次更新就在做这次统计的当天上午。它们在根目录,路径最短,返回200,没有任何跳转,也没被robots规则挡住。
这份文件逐字段该怎么填,生成器的填法与部署验证有完整说明。
换句话说,这是一份按照所有公开建议做到位的文件。接下来看到的数字不是因为做得差,是因为读它的人不存在。
为什么要拿robots.txt当对照物
这是整件事的关键一步。单看llms.txt被请求了多少次,这个数字没有意义——它总归大于0。真正要问的是:跟一个确定被使用的同类文件比,它差多远。
这份协议的机制与边界,写废了会发生什么那篇讲得够狠。
robots.txt正合适。它和llms.txt处在同一个位置、同样是根目录下的纯文本、同样面向机器,区别只有一个:robots.txt有各家爬虫的公开文档承认自己会读它,llms.txt没有任何一家模型厂商在文档里承认过。两个文件其他条件几乎全一样,只有这一个变量不同,这就是一组现成的对照。
三个文件放在一起的账
| 文件 | AI客户端请求 | 搜索引擎爬虫 | 浏览器 | 脚本工具 | 其他 | 合计 |
|---|---|---|---|---|---|---|
| robots.txt | 2626 | 13122 | 2787 | 126 | 1253 | 19914 |
| sitemap.xml | 1070 | 996 | 1209 | 59 | 47 | 3381 |
| llms.txt | 17 | 57 | 473 | 65 | 41 | 653 |
| llms-full.txt | 16 | 49 | 431 | 13 | 20 | 529 |
两种屏蔽方式什么时候用哪个,别把它们搞反说清了分工。
这张表里最该盯住的是哪一列
看AI客户端那一列:robots.txt是2626次,两份llms文件加起来33次。同一个站、同一批爬虫、同一个51天,差了将近80倍。
这批爬虫的总量已经很可观,抓取量超过传统爬虫之后该怎么调策略。
再看llms.txt自己那一行的构成:653次请求里,浏览器占473次,也就是72.4%;AI客户端只有17次,占2.6%。你的llms.txt主要是被人打开看的,不是被模型读的。
逐个爬虫的账更难看
| 爬虫 | 51天总请求 | 抓文章页 | 抓robots.txt | 抓sitemap | 抓llms文件 |
|---|---|---|---|---|---|
| ClaudeBot | 19938 | 4797 | 1542 | 969 | 0 |
| Amazonbot | 14541 | 4030 | 59 | 15 | 8 |
| ChatGPT-User | 9843 | 8306 | 0 | 36 | 10 |
| OAI-SearchBot | 6523 | 2358 | 339 | 5 | 2 |
| Applebot | 5939 | 1996 | 164 | 10 | 5 |
| PerplexityBot | 5587 | 2228 | 212 | 9 | 0 |
| GPTBot | 3907 | 1170 | 0 | 161 | 2 |
| Bytespider | 1358 | 677 | 247 | 22 | 4 |
| CCBot | 475 | 165 | 7 | 4 | 0 |
| Claude-User | 463 | 364 | 56 | 1 | 1 |
它们到底偏爱抓什么,从代码逆向出的真实偏好做过八步实操。
三条值得单独拎出来的读数
ClaudeBot在51天里发了19938次请求,抓走近4800个文章页,读了1542次robots.txt,llms文件一次没碰过。它显然不是没时间,也不是不认识这个站的目录结构,它读了sitemap将近1000次。
有时候不是它们不来,是主机在悄悄拦,监控还不报警。
PerplexityBot和CCBot同样是0。GPTBot抓了161次sitemap.xml,llms文件2次。这个比例摆在这儿,很难再讲出一个它在依赖这份文件的故事。
ChatGPT-User比较特殊,它是真人在对话里触发的取回,51天8306次全打在文章页上,llms文件10次。换句话说,真人问问题的时候,模型跑去读的是你的文章,不是你的目录说明。
那17次AI客户端请求分别是谁
数字太小,干脆一条条列出来。ChatGPT-User占5次,Amazonbot占5次,Applebot占3次,还有GPTBot、OAI-SearchBot、一个Claude桌面客户端、一次通过命令行工具发起的Claude请求各1到2次。51天,17次,分散在7个不同的客户端上。
要不要拦、拦到什么程度,三层选型框架给了一个可执行的判据。
这里有个细节值得留意:出现次数最多的ChatGPT-User,是真人在对话里点了链接或者让模型去看某个网址时才会发出的请求。也就是说,连这仅有的十几次里,还有一部分是人主动指过去的,不是模型自己想读。
那473次浏览器请求是谁
顺着来源字段往回查,答案有点好笑:绝大多数是从这个站自己的文章页点过去的。站上有几篇讲llms.txt的文章,读者读到一半想看看这个站自己的长什么样,就点了过去。剩下的一部分来自安全扫描器——有156次的来源字段是一串带着注入测试字符串的搜索网址,还有16次来自一个自称ghost-rider的东西。
校验器亮绿灯也不等于没问题,五条链接可能全是死的那次很典型。
所以这653次请求的真实构成是:读你文章的人、扫你漏洞的机器,以及零星几个AI客户端。如果只看总数,你会以为这个文件很受欢迎。
那些分卷文件的账也一并算了
这个站除了根目录那两份,还按栏目拆了一批分卷放在一个子目录里,比如按建站系统、按投放、按数据分析各一份。51天里这批分卷合计被请求7432次,其中AI客户端563次,占7.6%;浏览器2266次;剩下4603次来自脚本、扫描器与各种叫不出名字的东西。
帮助中心那类内容的索引控制,知识库该怎么工程化单独写过。
7.6%比根目录那两份的2.6%高,但要小心别高兴太早:这批分卷是从站点内容自动生成的,本身就带着大量正文,AI客户端把它当成内容页去取,跟把它当成一份目录说明去读,是两件事。被取回的次数多,只说明它像内容,不说明它像标准。
把镜头拉远一点看这批爬虫在干什么
| 客户端类型 | 51天抓走的文章页数 | 占该类型总请求的位置 |
|---|---|---|
| 浏览器(真人) | 1264828 | 站点流量主体 |
| 搜索引擎爬虫 | 109709 | 谷歌一家就有10万量级 |
| AI类客户端 | 26141 | 已接近传统爬虫的四分之一 |
| 脚本工具 | 3608 | 多为监控与采集 |
抓取、索引、排名三步各管什么,从头捋一遍这条链有助于定位问题。
AI客户端51天抓走26141个文章页,相当于每天500多个。它们对这个站的内容显然是有兴趣的、也是勤快的。正因为它们这么勤快,那33次llms文件请求才更说明问题——不是没来,是来了但不读那份。
这个实验你自己做要花多久
| 步骤 | 动作 | 耗时 |
|---|---|---|
| 拿日志 | 找到站点访问日志,确认里面有用户代理和来源两个字段 | 10分钟 |
| 写分类 | 把客户端分成AI、搜索引擎、浏览器、脚本四类 | 半小时 |
| 数三个文件 | 按路径精确匹配,分别数robots、sitemap和你要测的那个 | 脚本跑完约半分钟 |
| 核对 | 随手挑一条路径用最笨的方法数一遍,跟脚本对上 | 10分钟 |
| 看未归类 | 把没被分进四类的那一堆打印出来扫一眼 | 10分钟 |
全程一个小时出头,不需要任何付费工具。这一个小时能替代的是无数场关于某个文件到底有没有用的会议。如果你的站访问量比这个站小得多,把统计区间拉长到三个月,结论的稳定性反而更好。
唯一需要提前准备的是权限:日志通常在运维手里,第一次要走个流程。把要什么写清楚会顺很多——只要访问日志里的路径、用户代理、来源、状态码四个字段,不需要任何用户隐私数据,这句话能省掉大半沟通成本。
结论能不能推广到别人的站
要分开说。爬虫读不读某个文件,这件事跟你的站是做什么的、体量多大基本无关,它取决于爬虫自己的实现,所以这部分结论有相当的普适性。但每个文件被抓多少次、比例多少,跟站点规模和被引用情况强相关,这部分只能自己量。
换句话说,可以借用的是方法和方向,不能借用的是数字。看到别人的实验结论,正确姿势是照着做一遍,而不是把人家的百分比抄进自己的汇报。
做这次统计踩过的两个坑
第一个坑是用户代理分类。ClaudeBot在日志里有两种写法,一种是标准的紧凑格式,另一种前面挂着一长串浏览器标识、把机器人名字塞在末尾。只匹配前一种会漏掉将近200次robots.txt请求。同理,Bytespider有三种域名后缀写法。分类规则写完必须回头把未归类的那一堆打印出来看一眼,别让它们默默落进其他。
防火墙拦不拦得住、会不会误伤,答案没那么简单。
第二个坑更隐蔽,下一节专门讲,因为它把这套方法本身也坑了一次。
顺手把这批AI爬虫的行为也翻了一遍,看到什么?
既然日志已经摊开了,索性多看几眼。这几项跟本文主线无关,但对做GEO的人有直接价值。
它们的请求有相当一部分是失败的
| 状态码 | 51天次数 | 说明 |
|---|---|---|
| 200 | 63083 | 正常返回 |
| 404 | 1987 | 请求了不存在的路径 |
| 403 | 1828 | 被拦截规则挡下 |
| 301 | 1450 | 跳转,多为带斜杠与不带斜杠之争 |
| 500与502 | 357 | 服务端出错,全部发生在高峰时段 |
| 410与444 | 63 | 已删除内容与直接断连 |
抓取报告里那几类问题网址,按占比排查的顺序可以直接抄。
失败请求合计接近5700次,占AI客户端总请求的8%左右。这个比例值得每个站自己算一遍:如果它显著高于8%,多半不是爬虫的问题,是你站上有一批它们始终够不着的路径。顺着404清单往回查,通常能翻出几年前删掉却还挂在外链里的老网址。
它们最爱抓的页面出乎意料
按抓取次数排,51天里被AI客户端抓得最多的几个页面,是查手机卡资费、查银行卡区别、查免费邮箱、查免税州这一类事实查询型内容,最高的一个被抓了1043次。而站上那些几千字的策略长文,多数只有几十次。
什么样的内容更容易被引,八十多万条数据的统计给过一个分布。
这个分布跟很多人的预期相反。模型在对话里被追问的是具体事实,所以它反复回来核对的也是能给出具体事实的那些页面。如果你的内容全是方法论,被反复取回的机会天然就低——不是内容不好,是它不承担事实核对这个功能。
谁在读robots.txt,这份名单也值得看
| 客户端 | 51天读robots.txt次数 |
|---|---|
| Googlebot | 8485 |
| ClaudeBot | 2805 |
| DotBot | 1677 |
| SemrushBot | 1035 |
| facebookexternalhit | 918 |
| YandexBot | 521 |
| MJ12bot | 399 |
这份文件在建站系统里怎么写,虚拟与物理优先级那篇说了细节。
连社交平台那个抓预览图的机器人,51天都读了918次robots.txt。把这个数字和llms文件的33次放在一起,那份文件在机器眼里的地位就很清楚了:它甚至没有一个预览抓图程序对规则文件的重视程度高。
移动端加速页那份副本被抓得比正文还勤
这个站有一部分老文章保留着移动端加速页版本,路径带一层前缀。翻日志的时候发现,某些页面的加速页版本被取回的次数,跟主版本几乎持平,个别页面还更高。
移动优先索引之后哪些副本还在被读,渲染机制那篇讲过来龙去脉。
这件事对内容团队有实际影响:如果你的加速页版本是几年前生成的、内容早已和主版本对不上,那么在生成式回答里被拿去当依据的,可能是那份没人维护的旧副本。检查方法很简单,在日志里按路径前缀分组数一遍,然后随手打开两个对比一下正文是不是同一版。
它们在跳转上浪费了1450次请求
301那一栏1450次,翻开看多数是同一类问题:目录路径少了末尾斜杠、旧网址还在外部被引用、带追踪参数的网址被跳到干净版本。这些跳转本身没有错,但每一次跳转都是一次额外往返。对抓取预算敏感的站,把外部最常被引用的那二十条旧网址直接改成目标地址,比优化任何页面速度都立竿见影。
抓取预算怎么省,十二项实操里跳转那一节最见效。
同一个页面被反复抓,说明不了什么
被抓最多那个页面51天里被取回1043次,平均每天20次。很容易把这理解成模型特别看重它。更可能的解释是:这个页面回答的是一类高频事实问题,每次有人在对话里问到,模型就重新去核对一遍。高频取回反映的是提问频率,不是页面质量。
顺着这个思路能得到一条实用推论:如果你的某个页面被反复取回,那说明它对应的问题一直有人在问,值得把这个页面的信息做得更准、更新得更勤;反过来,一个从来没被取回过的页面,不必急着改,先确认有没有人问这类问题。
抓取量本身波动很大,别拿单日说事
AI客户端的日请求量在600到2100之间起伏,其中6月25日单日冲到5286次,是平均值的四倍多。如果那天恰好是你上线某个改动的日子,你会看到一条非常漂亮的曲线,并且很难忍住不把它写进汇报。凡是要用抓取量说事,至少取14天滑动平均,单日峰值在这类数据里毫无意义。
用命令查索引数同样会误判,什么场景能信什么场景不能另有说明。
同一个文件的请求量,两次统计为什么差17倍?
这里出了一件事,值得单独讲,因为它把同一个毛病套在了测量工具自己身上。
第一次统计给出的数字是11545
第一版脚本图省事,用网址里包含llms这个字符串来筛选。跑出来的数字是11545次,短文件10806次,完整版739次。看到这个数,第一反应是这个文件被抓得挺勤。
两个来源的收录数打架时信谁,六场景选型与三源校准给了判据。
第二次统计给出的数字是653
第二版把条件改成路径精确等于/llms.txt,数字掉到653。前后差了17.7倍。
后台那八种状态各自意味着什么,状态机制拆解能省掉很多猜测。
差额去了哪里
| 被误算进来的网址 | 51天请求数 | 它其实是什么 |
|---|---|---|
| /llms-txt-guide.html | 687 | 一篇讲llms.txt的文章 |
| /tools/llmstxt-generator.php | 420 | 一个在线生成工具 |
| /llms-txt-ai-content-architecture.html | 269 | 另一篇文章 |
| /chrome-lighthouse-llms-txt-agentic-audit.html | 236 | 又一篇文章 |
| /llms/目录下的分卷文件 | 7432 | 站点自己拆的内容分卷 |
追踪参数一加,统计口径就开始漂,内链加参数的代价写过一次。
这件事的讽刺之处
把总数撑到五位数的,正是这个站自己写的那些讨论llms.txt的文章。一个用来证明llms.txt很受欢迎的数字,绝大部分来自人们在读关于llms.txt的讨论。热闹被算成了效果,这中间隔着的正是那道区分力。
被提及和被引用是两个数,这中间的差距怎么补单独讲过。
尺子本身也需要一次对照。换一个口径重新量,两个数字差出一个数量级,说明你量的从来不是同一件事。
这个坑在别处也会犯,形态一模一样
| 你想量的东西 | 图省事的口径 | 会被混进来的 |
|---|---|---|
| 某个产品页的流量 | 网址包含产品名 | 博客里讲这个产品的文章、标签页、搜索结果页 |
| 品牌词搜索量 | 查询词包含品牌名 | 带负面词的查询、找官网客服的查询、山寨词 |
| AI带来的访问 | 来源字段包含模型名 | 你自己写的那些标题里带模型名的页面 |
| 某类页面的收录数 | 站长后台按目录前缀筛 | 同前缀的分页、筛选参数页 |
| 爬虫抓取量 | 用户代理包含bot | 监控脚本、预览机器人、伪装成爬虫的采集器 |
品牌词和非品牌词混在一起算,为什么必须拆成两件事。
怎么给自己的统计脚本做一次对照
统计脚本本身也需要一次校准,方法跟前面完全一样:造一条你知道答案的输入,看脚本给出的数对不对。
埋点之前先把测量框架想清楚,这个顺序反过来就白干。
具体做法是从日志里随手挑一个不太热闹的路径,用最笨的方式数一遍——直接按整行搜索,人工看几眼,得到一个确定的数字。然后把这个路径丢进你的统计脚本,看两个数字一不一致。不一致,说明脚本的匹配规则或者分组逻辑有问题,这时候修脚本比修结论便宜得多。
这次翻日志就是这样发现问题的:一个路径按整行搜是653,按脚本跑出来是11545,差得太离谱,才回头去看匹配规则。如果两个数只差百分之几,反而更危险——你会以为是正常误差,然后带着一个错误的口径一直用下去。
还有一种更隐蔽的口径漂移
比错误口径更难发现的是中途变过的口径。统计脚本改过一次匹配规则、日志切割周期调整过、某个爬虫改了自己的用户代理写法,任何一件都会让前后两段数据不可比,而图表上不会有任何提示,它会画出一条平滑的曲线。
防这一手的做法是给每次统计留一份口径快照:匹配规则原文、时间区间、脚本版本,跟数据存在一起。三个月后有人质疑这条曲线,你能拿出快照,这条曲线就还活着;拿不出,它就只是一张图。
三条通用的收口
第一,能用精确匹配就别用包含匹配,实在要用包含匹配,先把匹配到的清单打印出来肉眼扫一遍。第二,同一件事至少用两种口径各量一次,两个数差得离谱就说明其中一个错了,而不是取平均。第三,把口径写进结论里——不写清楚按什么口径统计,这个数三个月后没人能复现,包括你自己。
哪些数字只是好看,砍掉虚荣指标只盯真信号做过一次清理。
对照组该怎么选,才不是白做一遍?
说完毛病该说做法。对照这件事听着高级,落到SEO与GEO的日常里其实只有三个条件。
条件一:对照物必须确定无效
选一个你完全确定不起作用的东西。如果你自己都不确定它有没有用,那么两边都出现同一个现象时,你既可以说明这个做法无效,也可以说明对照物碰巧有效——什么都说明不了。cats.txt之所以有力,正因为没人会替它辩护。
固定策略为什么会被时间淘汰,自进化那套思路解释得比较透。
条件二:除了那个变量,其他条件要尽量一致
llms.txt和robots.txt能对照,是因为位置、格式、面向对象都一样,只差有没有官方支持这一条。如果拿一个根目录文本文件去对照一个需要登录才能访问的接口,中间隔着五六个不同的条件,结果出来也说不清是哪一个造成的。
同一招时灵时不灵,内容条件化的六步框架是一个解法。
条件三:检验的动作两边必须完全相同
同一套日志筛选、同一个提问方式、同一个时间窗口。只要一边多做了一步,比如给真的那个多提交了一次收录请求,这次对照就废了。
预测试跑太多会烧钱,用评审模型省掉六成成本那篇有具体做法。
常见的坏对照长什么样
| 坏对照 | 问题出在哪 | 改法 |
|---|---|---|
| 拿上个月的自己比这个月 | 时间不同,中间什么都可能变过 | 同期做两组,别用前后对比 |
| 拿竞品站比自己站 | 不同的域名年龄、外链、品类,变量太多 | 在同一个站内部找两组相似页面 |
| 拿做了的页面比没做的页面 | 做了的那批通常本来就更重要 | 先分组再动手,别挑着做 |
| 对照物是自己也想做的东西 | 你会不自觉地替它找理由 | 选一个你确信是废物的东西 |
样本量不够就会出现假胜利,三个公式先算一遍比事后解释省事。
一个30秒就能跑的粗筛
不用做完整实验也能先摸一次底:造一个你确知无效的对照物,把同一套检验原封不动地套上去,看它过不过。过了,说明这套检验没有区分力,先别急着写结论。这个动作的成本通常是十几分钟,比一份被推翻的季度汇报便宜太多。
同一套方法在别的引擎上怎么表现,那次实测给了三组对照数据。
对照物的四种现成来源
| 要验证的东西 | 可以拿来当对照的 | 为什么它够格 |
|---|---|---|
| 某个面向模型的新文件 | 一个内容无意义的同格式文件 | 位置格式全同,只差内容有没有意义 |
| 某种页面结构改造 | 同模板下没改的那一批页面 | 同一套模板、同一批流量来源 |
| 某个新加的结构化数据类型 | 同期上线但没加标记的新页面 | 年龄相同,内链条件接近 |
| 某个投放渠道的增量 | 暂停投放的同类地区或人群 | 只要业务允许,这是最干净的一种 |
别让本来就会买的人冒领功劳,增量测试说的正是这件事。
第四种最有效也最贵,因为它要求你真的停掉一部分投放。前三种便宜,适合日常用。便宜的对照做十次,比昂贵的对照永远排不上期要强。
一次完整的对照,流程只有七步
| 步骤 | 要做的事 | 最容易在这一步出错的地方 |
|---|---|---|
| 写死问题 | 把要验证的说法写成一句可判真假的话 | 写成这么做有好处,无法判真假 |
| 写死反面 | 先写下假如它无效,我会看到什么 | 跳过这一步,后面全废 |
| 选对照物 | 挑一个确定无效、其余条件相同的东西 | 选了一个自己也想做的东西 |
| 定口径 | 精确匹配规则、时间窗口、剔除项写成文档 | 用包含匹配,或者中途改口径 |
| 同时开跑 | 两边同一时间开始,动作完全一致 | 给被测那边多做了一步 |
| 盲读数据 | 先看对照物,再看被测对象 | 先看被测对象,然后开始找解释 |
| 写结论 | 按三种结局之一写,注明适用边界 | 把没差异写成有微弱正向 |
十二周里跑通了哪几类工作流,这份实测复盘可以照着排期。
第二步和第六步是这套流程里最不起眼、也最容易被跳过的两步,而它们恰好是全部价值所在。先写下反面,你就没法在看到数据之后临时给自己编一个解释;先读对照物,你的判断就不会被被测对象的数字牵着走。
实验设计里最贵的一句话,是在看到数据之前写下的那句:如果它没用,我会看到什么。
七步里最容易被跳过的其实是第一步
把要验证的说法写成一句可判真假的话,听起来简单,实际动笔才发现难。这个做法有帮助,判不了真假;加了这个文件之后AI客户端对它的月请求数超过50次,才判得了。写不出可判真假的那句话,通常说明你自己也没想清楚在测什么,这时候先别急着开跑,回去把问题再磨一遍,比事后重做一次实验便宜。
这套流程跑一次要多久
视对象而定。文件类的对照,从建对照物到出结论一周足够,其中六天是等数据。页面结构类的对照,最少要一个完整的抓取周期,一般是三到四周。投放类的对照最快,两周内就能看出方向,但它要花真金白银。把周期写在方案里,比把预期收益写在方案里更能救你——收益写错只是尴尬,周期写错会让整件事在中途被叫停。
可见性该怎么分层量,三层指标拆解给了一个可落地的口径。
对照做完之后怎么读结果
只有三种结局。对照物没动、被测对象动了,这时候才轮到讨论因果。两个都动了,说明你测的是环境不是动作。两个都没动,说明这次改动在你的观测粒度上什么也没发生——这也是结论,而且是省钱的那种。最怕的是第四种:只看了被测对象,压根没看对照物,然后把它当成了第一种。
实验赢了上线却掉,问题出在那二十六天是个值得记住的教训。
哪些SEO判断天生就做不了对照?
要是把话说到对照万能,那就成了另一种偷懒。有几类情况确实做不了,得认。
样本只有一个的时候
整站改版、换域名、主模板重写,这些动作没法只在一半页面上做。这时候能做的是把改动拆细、分批上线,让每一批之间有时间间隔,至少能看出哪一批带来的波动。
跨年数据能不能直接比,一条趋势线上的三处口径变更说明了风险。
时间没法回滚的时候
算法更新、竞品下架、行业旺季,这些外部变化不会等你。对照只能改成横向的:同一时间窗口内,选一批没动过的页面当基线,看动过的那批相对它有没有偏离。
样本里根本没有那类人,结论却写给了他们,这种越界很常见。
平台不给你反事实的时候
模型引用与推荐这件事,最麻烦的地方在于你看不到没被引用的那次。你只能看到出现过的,看不到没出现的。这时候真正可行的是把提问侧握在自己手里:同一批问题、固定的问法、固定的时间点,长期跑,记录变化。同一时期关于AI可见度该测什么的讨论里也提到同一件事:提示词选错了,后面所有指标都跟着错,因为它是这条链上的第一块骨牌。
平台不给的那部分数据,拆开看有两层今天就能自己测。
没有对照时,三种替代证据的强度排序
| 替代证据 | 强度 | 什么时候用 | 典型陷阱 |
|---|---|---|---|
| 官方文档的明确表述 | 最强 | 凡是涉及机器行为的问题 | 把博客文章当文档,把口头回复当承诺 |
| 大样本第三方研究 | 中等 | 需要判断普遍性时 | 样本站型与你差得远,结论未必适用 |
| 机制推理 | 较弱 | 前两者都没有时的兜底 | 推理链一长,每一环的误差会连乘 |
两万条数据里的引用规律,那五条结论可以当中等强度的旁证。
三种可以叠加使用,但别把三条弱证据加在一起当成一条强证据。证据不是投票,三个都说不清楚的来源凑在一起,得到的还是说不清楚。
关于第三方大样本研究,有一点要提醒
这类研究通常抽的是几万到几十万个域名,覆盖面确实广,但它回答的是平均情况,不是你的情况。你的站可能在长尾里,可能在某个垂直品类里,可能技术栈很特别。拿大样本研究去否定一件事,比拿它去肯定一件事更可靠——如果十万个域名里都看不出效果,那你这一个站看出效果的可能性确实不高;反过来,十万个域名的平均值为正,不代表你能拿到那份平均收益。
三千条数据揭出的认知差,到底该信什么值得先读一遍。
官方文档能不能当对照的替代品
能当半个。像谷歌那份公开的爬虫清单,会写明每个爬虫读什么、遵守哪些令牌,这类白纸黑字的说明可以直接把一批猜测排除掉。反过来,llms.txt那份提案原文本身是很克制的,它写的是一个设想,没有任何一家模型厂商的承诺——把它转述成行业标准的是二手文章,不是原文。遇到争议先回原文读一遍,这个动作的性价比高得不像话。
两家官方最近的表态,五个要点的解读比二手转述可靠。
做不了对照的时候,结论要写得软一点
这是最后一道保险。做不了对照,就别把结论写成因果句。写成我们做了A,之后B涨了,两者之间的因果关系尚未验证,比写成A带来了B诚实得多,也不影响你继续做A。
对未来的判断该信几成,六个预测哪些该打折也是同一种态度。
软结论并不等于没结论
很多人抵触这一步,是担心汇报显得没底气。实际效果通常相反:把不确定的部分明明白白标出来,剩下那部分的可信度会跟着上升,因为对方知道你会区分。一份所有结论都同样斩钉截铁的报告,读的人只能整体打个折;一份自己分了档的报告,对方才愿意分档去信。
把账算全比把话说满重要,经典公式漏掉的三块价值补过一次。
换几个正在流行的GEO说法,这把尺子还量得动吗?
只拿llms.txt开刀不太公平,它这两年被当靶子的次数已经够多了。把同一个判据套在其他几条正在被大量兜售的说法上,结果同样值得看。每一条都问同一个问题:假如它无效,我会看到什么?
在内容里加一段问答区块,能提高被引用的概率
假如无效,你会看到什么?还是会看到这些页面偶尔被引用,因为它们本来就是站上信息密度较高的页面,本来就更容易被检索到。区分力低。想让它变高,做法是同期上线两批同主题页面,一批带问答区块一批不带,然后固定一组问题长期问,看两批的出现频率有没有稳定差异。难点不在于做实验,在于忍住不给自己偏爱的那一批多做点别的优化。
问答段落怎么写才算及格,八步实战给了具体的写法。
在社区平台多留下品牌痕迹,模型会更倾向推荐你
假如无效,你会看到什么?还是会看到品牌被提及次数上升,因为你确实在到处发帖;也会看到模型偶尔提到你,因为它本来就爱引社区内容。区分力中等偏低。这条真要验证,得挑一个你完全没做过投放的产品线,只在社区侧动手,其余一律不动,观察三到六个月。周期长到多数团队做不下来,这是它长期无法被证伪的真实原因。
与其到处刷存在感,先看清推荐机制更省力气。
更新发布时间能让老内容重新被抓被引
假如无效,你会看到什么?照样会看到抓取,因为爬虫本来就会周期性回访;照样可能看到排名波动,因为它一直在波动。这条的区分力低到几乎为零,而它偏偏是执行成本最低、最容易被批量操作的一条。成本越低的动作越需要对照,因为它太容易被大量执行,然后把噪声堆成一条趋势线。
新鲜度到底该怎么维护,五条实战法则区分了真更新和假更新。
把内容拆成更细的小节,模型更容易摘出来
假如无效,你会看到什么?会看到页面可读性变好、跳出率有变化,这些是真的收益,但跟被不被摘出来是两件事。这条的特别之处在于,它即使对模型无效,对人也有效。遇到这种一鱼两吃的做法,正确姿势是按对人有效来立项,别拿模型当理由——理由错了不影响这次,但会污染你下一次的判断。
结构化内容有哪几种形态,七种格式的对比可以直接挑。
把站点内容做成结构化数据,AI会优先采用
假如无效,你会看到什么?会看到富媒体结果,那是搜索侧的既有收益,跟生成式回答是两条路。区分力中等,因为至少动作与结果之间的链条比较短,能通过同期未标记的页面做对照。真做起来的难点是很多站的结构化数据是模板统一输出的,想留一批不带标记的对照页面,得改模板,改模板这件事本身又会引入别的变量。
标记该怎么配合内容落地,这份指南加避坑清单比较完整。
把品牌词搜索量当成AI可见度的代理指标
假如无效,你会看到什么?还是会看到品牌词搜索量随季节、随投放、随新品发布起伏。这条的麻烦在于它看起来很聪明——绕开了平台不给数据的问题,用一个自己能拿到的数去代替。但代理指标的前提是它跟真实目标之间有稳定关系,而这个关系恰恰没人验证过。代理指标不是免费的,它把一个测不到的问题换成了一个测得到但可能无关的问题。要用可以,先花两周确认它跟你能拿到的任何一个真实结果之间存在同向变化。
品牌可见性与搜索排名的关系,六十八次实测加三个案例测过一轮。
把被引用次数当成KPI
假如无效,你会看到什么?被引用次数照样会随着平台改版大起大落。有一家模型厂商在一个月里先减少了回答中展示的来源数量,一个月后又改了回来,期间所有站点的引用数都跟着坐了趟过山车,跟这些站做了什么毫无关系。凡是你完全无法影响、平台一次改版就能翻倍或腰斩的指标,都只适合监控,不适合当考核目标。
可见性该用什么框架衡量,漏斗查询树比单一计数稳得多。
把这七条排个序
| 说法 | 区分力 | 可行的对照方式 | 建议 |
|---|---|---|---|
| 加问答区块 | 低 | 同期双批页面加固定提问 | 可做,成本低,别当主线 |
| 社区留痕 | 中低 | 挑一条干净产品线单独做 | 周期太长,先别写进季度目标 |
| 刷新发布时间 | 接近零 | 几乎无法对照 | 别把它当增长手段 |
| 细拆小节 | 低 | 同上,但对人有效 | 按可读性立项 |
| 结构化数据 | 中 | 同期未标记页面 | 值得做,理由是搜索侧收益 |
| 品牌词当代理指标 | 低 | 先验证代理关系本身 | 别直接拿来汇报 |
| 引用次数当KPI | 不适用 | 无法对照,平台单方面决定 | 只监控,不考核 |
三种策略各自能撬动多少,这份对照给了实测区间。
这张表里没有一条被判死刑。区分力低不等于做法无效,它等于你现在还不知道它有没有效。这两句话的差别,就是一个理性团队和一个赌徒团队的差别:前者会限定投入继续观察,后者会一把梭哈然后把观察结果解释成胜利。
没有证据不等于证明无效。它只是意味着,你现在还不该拿它去要预算。
拿到一份别人的实验报告,先看哪几行?
更多时候你不是自己做实验,是在读别人做的。这时候不需要复现,只要按顺序看四个地方,八成的问题会自己浮出来。
第一行看样本怎么选出来的
是随机分组,还是先做后挑?如果是从已经做过改造的页面里挑出表现好的来展示,那么这份报告展示的是挑选过程,不是改造效果。判断方法很直接:问一句没做改造的那批页面同期表现如何,答不上来就到此为止。
零搜索量词有没有价值,那次实测复盘就栽在样本选择上过一回。
第二行看有没有对照
没有对照组的报告不是不能看,但它的结论只能当线索用,不能当依据。特别要警惕那种用整站同比来充当对照的写法——去年的你和今年的你之间差着一整年的算法更新和竞争格局。
十一种方法放在同一个基准下比,这份对照是少见的完整实验。
第三行看口径写清楚了没有
数字是怎么算出来的,按什么匹配,剔掉了哪些流量,时间窗口多长。这几项只要缺一项,这个数就不可复现。前面那个17.7倍的教训摆在那里:口径差一点,结论能差一个数量级。
参数怎么打才不互相污染,链接构建的规范与避坑写得比较细。
第四行看结论的措辞
写因果句还是相关句,有没有给出适用边界,有没有提到失败的部分。一份连一次失败都没提的实验报告,比一份到处是失败的可疑得多——真做过实验的人,手里一定攒着一堆没成的尝试。
一次投票背后的几层信号,那件事的实测解读给了不同层级的结论。
怎么在站上长期挂一个对照物?
一次性实验做完就散了,下个月来了新说法,还得重来一次。更省事的做法是把对照变成站上一个常驻的东西。
卡点是一个文件,不是一次实验
在根目录长期挂一个你确知无人使用的文本文件,路径固定、内容固定,谁也不推广它。它唯一的用处,是每次有人拿抓取量、收录、模型复述来论证某个新做法时,你先去看一眼这个文件这段时间的读数。它是一把常年归零的尺子,任何一次读数上扬,都在告诉你那套检验又失灵了。
不同类型的页面该怎么配规则,五类页面的差异有一张对照表。
落地只要四步
| 步骤 | 动作 | 耗时 |
|---|---|---|
| 建对照物 | 根目录放一个内容无意义的文本文件,别写进sitemap,别做外链 | 10分钟 |
| 建统计 | 日志按路径精确匹配,按客户端类型分组,别用模糊匹配 | 半小时 |
| 建基线 | 同时统计robots.txt与sitemap.xml,作为已知被使用的参照 | 同上一步一起做 |
| 建周表 | 三个数字并排放一张表,每周自动发一次 | 一次配置 |
自动生成这类文件的做法,免插件方案那篇可以直接参考。
对照物需要满足的四个属性
| 属性 | 为什么必须 | 做不到的后果 |
|---|---|---|
| 无人推广 | 它的读数才代表被动发现的水位 | 被链接一次,数字就失真 |
| 内容中性 | 不能因为内容有趣被额外取回 | 变成一个真的有人读的页面 |
| 格式同类 | 要跟被测对象处在同一条比较线上 | 比不出来,只能各说各话 |
| 长期不动 | 改一次就断了历史可比性 | 只剩下一段孤立的数字 |
哪些页面该被屏蔽掉,电商站的七类清单可以对着核一遍。
第四条最容易被违反。总有人手痒想往里面加点东西,比如顺手写两句站点介绍。一旦动过,它就从对照物退化成了另一个被测对象。正确做法是建的时候就在文件第一行写上这是对照文件请勿修改,然后在代码仓库里给它加个保护。
那张周表该长什么样
三列就够:对照物的请求数、robots.txt的请求数、你正在评估的那个新文件的请求数,全都只数AI客户端。第一列是地板,第二列是天花板,第三列落在哪儿,一眼就知道。这张表的判断门槛极低,低到不需要懂技术的人也能看,这正是它能长期活下去的原因。
想按内容类型看表现,内容分组怎么配是最省事的一步。
一个真做过这件事的客户
保哥手上有个做宠物智能硬件的站,主打自动喂食器和智能猫砂盆,市场在北美和澳洲,团队11个人。去年年底他们的内容负责人在会上提了一个方案,核心动作是给站点补一套面向模型的目录文件,预算不小,理由是同行都在做,而且他们试跑的那两周日志里确实看到了AI爬虫的请求。
工具栈该怎么搭才不重复投入,十二款的真实测评列过一张清单。
技术那边的同事没直接反对,只做了一件事:在根目录另外放了一个文件,内容是一段毫无意义的产品编号列表,不做任何推广。两周后把两个文件的日志拉出来并排看,AI客户端对新文件的请求是个位数,对那个废物文件的请求也是个位数,两边差不出统计意义。方案没有被否掉,但预算从一个季度的重点项目降成了两天的顺手活。
顺带一提,他们后来给那个废物文件起名叫litter.txt,理由是既然做猫砂盆,垃圾文件就该叫这个名。这个玩笑现在还挂在他们服务器上。
这件事后来的两个后续
第一个后续是他们把这个对照物固定了下来。每个月的内容会上,那张表最上面一行就是这个文件的读数,谁提新方案,先看这一行。半年下来这行数字一直在个位数,团队对各种新概念的兴奋度明显降了一档,但真正做的事情反而多了——省下来的时间去补了产品页的实拍图和参数表。
技术体检该覆盖哪几层,四十二步清单可以当年度盘点用。
第二个后续有点意外。有一次那行数字忽然跳到了三位数,大家紧张了一下,查下来是他们自己一个同事写了篇内部分享、把这个文件的路径贴了出去,然后被外部抓取工具顺着链接来了一轮。虚警本身也是收获:它证明这套监测确实在工作,而且证明了任何一个数字都可能被无关的事情推高。
换个客户看,同一套做法也能反过来用
另一个做户外咖啡器具的客户情况相反。他们本来对所有新概念都不感兴趣,理由是没有证据。装了对照物之后反倒动起来了:因为有了地板和天花板这两条线,一个新做法值不值得试,从一场辩论变成了一次读数。对照组不是用来否定新东西的,它是用来把要不要做这个问题的成本降下来的。降下来之后,团队敢试的东西反而更多。
小团队怎么把流量系统搭起来,五步搭精准获客更贴近这种规模。
这套做法真正省下的东西
不是省下那笔预算,是省下每次新概念出现时的那一轮争论。有了常驻对照物,讨论会从这个做法有没有用,变成这个做法的读数跟对照物差多少,后面这个问题有答案,前面那个没有。
五个月十一个项目踩了哪些坑,这份真实复盘值得读完。
把它接进现有流程只需要改三个地方
| 环节 | 加一句什么 | 谁来把关 |
|---|---|---|
| 方案评审 | 这条结论的对照物是什么 | 评审人,一句话就能问出来 |
| 数据看板 | 对照物读数与被测对象并排一列 | 做看板的人,一次性配置 |
| 复盘会 | 先念对照物这段时间动没动 | 主持人,30秒 |
内容要不要分两层做,五板块的落地手册给了一个结构。
三处加起来不到十分钟的额外成本,换来的是所有人共享同一个判断标准。流程里最贵的从来不是执行,是每次都要重新说服一遍。
三种团队规模,三种落地版本
| 团队情况 | 最小可行版本 | 维护成本 |
|---|---|---|
| 一个人做整站 | 根目录一个废物文件,每月手动数一次日志 | 每月10分钟 |
| 三到十人,有技术支持 | 加一个按客户端类型分组的周报,三列并排 | 一次配置,之后为零 |
| 十人以上,有数据看板 | 把对照物读数做成看板固定项,跟核心指标同屏 | 看板改一次 |
不同规模的团队选型不一样,五类工具的真实路线图可以对号入座。
三种版本的核心是同一件事:让那条地板线出现在人们每周都会看到的地方。放在需要主动去查的位置,三个月之后就没人查了;放在他们本来就要看的那张表上,它会自己起作用。
顺序上也有讲究:先把数字弄出来,再谈解读。见过团队反过来做,先花两周讨论这个指标该叫什么名字、该归谁管,结果数字一直没跑起来。一个粗糙但每周都在更新的数字,胜过一个定义完美却从没生成过的指标。
别把对照物做成一个项目
见过团队把这件事做成一个季度专项,配了负责人、排了里程碑、写了需求文档,然后在第二个月因为优先级调整被砍掉。这套东西的价值在于它足够小、小到不需要立项。一个文件加一列数字,能活三年;一个专项,通常活不过一次组织调整。
把爬虫成本也算进账,同一套规范能管两头是个不错的思路。
什么时候该主动放弃这套东西
有一种情况下别较真:动作成本极低、失败代价接近零、而且不占用别的资源。生成一份文本文件放在根目录属于这类,加两行元信息也属于这类。这种时候花半天做对照,本身就不划算。对照组是用来挡住昂贵决定的,不是用来挡住便宜动作的。把它用在十分钟就能做完的事情上,只会让团队觉得这套方法很烦人,然后在真正需要它的时候把它扔掉。
什么时候传统做法就够用,什么时候才需要补新的有一条分界线。
最后留一句给正在被催的人
做SEO和GEO的人这两年普遍有一种被追着跑的感觉:每个月都有新说法,每个说法都配着截图和日志,不跟就显得落后。这种压力是真实的,但它逼出来的动作往往是最没把握的那种。
自然流量被切走之后的生存策略,这份实战指南可以接着往下看。
对照组的价值不在于它多科学,在于它给了你一个可以当众说出口的理由。不做这件事,不是因为我保守,是因为它现在跟一个废物文件的读数一样。这句话比任何辩论都好用,因为它可复核、可复现,而且下个月还能再念一遍。
你不需要证明每一个新说法是错的。你只需要一条随时能查的地板线,让那些还没站上地板的说法,暂时排在预算队伍的后面。
常见问题解答
那到底还要不要放llms.txt?
放,只要成本低就放。生成一份文件花不了多少时间,万一哪天真有厂商在文档里承认使用,你已经准备好了。但别把它当成已经验证过的增长手段写进方案,也别为它排期做大改造。判据很简单:它值不值一小时,值;值不值一个季度,不值。
日志里看到AI爬虫抓了我的页面,这算不算好事?
算,但它证明的是你的页面能被取到,不是你的内容被采纳了。抓取是必要条件不是充分条件。真正该盯的是取回之后有没有出现在回答里,这需要你自己固定一批问题长期去问,平台不会替你记录。
我没有服务器日志,只有建站平台后台,怎么做对照?
多数托管平台都能导出访问记录或者开启原始日志,问一句客服通常就有。实在拿不到,退一步的做法是用一个能拿到日志的小站做对照实验,结论对同类站基本通用,因为爬虫的行为跟你的业务无关。
模型在回答里说出了只有我文件里才有的内容,还不算证据吗?
不算,因为这件事在文件只是被当作普通网页读取时也会发生。要让它变成证据,得再加一个条件:把这段内容同时放在一个不可被检索的位置,看模型还能不能说出来。能,才轮到讨论特殊对待。
对照组和A/B测试是一回事吗?
不是。A/B测试要求随机分流和足够样本,多数SEO场景做不到。这里说的对照更基础,只要求你在做判断之前,先想清楚假设不成立时会看到什么。它不给你显著性,只帮你把明显无效的检验筛掉,成本也低得多。
这套思路除了GEO还能用在哪?
凡是结论建立在观察上、又没有反事实的地方都能用。外链效果、结构化数据收益、内容更新频率的作用,套的都是同一个问题:如果这件事没用,我今天看到的现象会不会照样出现。
我的站太小,AI爬虫来得很少,还能做这种统计吗?
能,而且小站反而更容易看清楚。请求量少意味着你可以把每一条都列出来肉眼看,不用做抽样,也不会被大数掩盖异常。真正的门槛不是流量大小,是你能不能拿到带用户代理和来源字段的原始日志。
为什么不直接问平台方,让他们说清楚到底用不用?
问了也基本得不到承诺性回答,各家在这类问题上的表述都很谨慎,通常只说会尊重站点的抓取偏好设置,不会说明具体读哪些文件、怎么加权。与其等一个不会来的答复,不如自己在日志里量一遍——日志不会公关。
对照物会不会被搜索引擎当成垃圾内容?
把它做成一个不被链接、不进站点地图、内容中性的小文本文件就没问题。别放关键词、别做成页面、别加到导航里。它的存在感越低越好,反正读它的只有你和那些四处乱抓的机器。
老板要一个明确结论,我拿这套东西怎么汇报?
把三个数并排放在一页上:对照物的读数、已知有效那个文件的读数、正在评估的那个东西的读数。然后说一句这个新做法目前落在地板线附近,建议按十分之一的投入先跑一个季度。这个说法给了明确建议、给了投入上限、也给了复查时间点,比任何一个含糊的有价值都更容易被通过。
如果哪天真有厂商公布支持了呢?
那就是这套方法最好的一天。对照物的读数会跟着一起变,或者不变——这两种结果都很有价值。方法的意义从来不是押注某个结论,是无论结论往哪边翻,你都能第一时间知道,而不是等着别人在社交平台上告诉你。
为什么不干脆等行业形成共识再说?
因为共识本身就是被那四条无区分力的证据堆出来的。你看到的热闹越大,说明写这个话题的人越多,跟这件事本身有没有效果的关系反而越远。前面那只叫Odd的虚构猫,两周之内就攒够了让模型改口的共识——共识的形成速度,比验证一件事情要快得多。
这套东西会不会让团队变得太保守?
实际观察下来是反的。判断成本降下来之后,团队愿意试的新东西反而更多,因为试错不再意味着要开一场辩论会。真正让团队保守的从来不是严谨,是每一次决定都要重新吵一遍的疲惫感。
客户或者上级坚持要做,我该怎么办?
做,但把它按成本归档。成本低就顺手做掉,别争;成本高就把对照数据摆出来,同时给一个折中方案,比如先在一个栏目上做,三个月后按同一口径复盘。把分歧转成一个有时间点的复盘约定,比当场分出对错有用得多——三个月后数据会替你说话,而且那时候没人需要认错。
这篇文章讲的方法,本身经过验证了吗?
问得好,这个问题必须回答。对照这套方法在别的领域有几十年的使用记录,本身不需要重新证明。但本文给出的具体数字只来自一个站、51天,站型是中文内容站,结论对电商站、外贸站是否成立没有验证过。方法可以直接借用,数字请自己量一遍——这也正是全文一直在强调的那件事。
权威参考资料
本文标题:《GEO效果怎么验证?给那条建议配一个注定无效的对照组》
本文链接:https://zhangwenbao.com/geo-tactic-control-group-evidence-test.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0