都说AI把搜索流量吃掉了,可场上没有一个数字能算得到你自己的站上

都说AI把搜索流量吃掉了,可场上没有一个数字能算得到你自己的站上
张文保 更新 45 分钟阅读 2,901 阅读
本文目录
  1. 同一周出来两个数字,方向正好相反
  2. 9.4% 这个降幅,到底测的是什么?
  3. 5.2% 对31.1%,真正该盯的其实是这一组
  4. 查询量少了,那些需求都去哪了?
  5. 降幅从9.4% 走到17%,这条时间线说明什么?
  6. 这份研究的边界在哪,哪些结论不能外推?
  7. 那份点击流研究的样本,为什么常被引述错?
  8. 十个月里一次外链点击都没产生的家庭,占了多少?
  9. 为什么同一份研究里会有8.2%和17.0%两个降幅?
  10. 广告支撑型网站少了27.6个百分点,这对谁是坏消息?
  11. 数十亿次点击,为什么是一句无信息量的话?
  12. 为什么Google不给分母?
  13. 第三方工具给的替代率,可信度排第几?
  14. 三类数字放一张表上,各自能回答什么?
  15. 与其等一个准确的行业数字,不如自己建一套口径
  16. 第一层:能直接测的三个读数
  17. 第二层:只能代理的两个信号
  18. 第三层:只能定性的部分,怎么做到不自欺?
  19. 哪类页面先被替代?一张替代梯度表
  20. 怎么给自己的站算一个粗略的暴露度分数?
  21. 一个户外露营装备站的六个月读数
  22. 出海做多市场,这个替代结构会更重还是更轻?
  23. 数字不确定的时候,哪些动作在两种情形下都不后悔?
  24. 拿行业数字给老板做预测,会踩什么坑?
  25. 那这件事最终该怎么看?
  26. 那句每周数十亿次点击,原帖到底是怎么说的?
  27. 为什么每天和每周这两个数字,不能放在一起读?
  28. 同一天发在另一个平台的版本,为什么把每天那句删掉了?
  29. billions这个词,实际能指多大的区间?
  30. 那个每天的说法,最早出自哪里?
  31. 一篇指责别人方法论有缺陷的文章,自己披露了多少方法论?
  32. 高质量点击是个什么指标,谁定的?
  33. Google自己承认的那句话,为什么比争论本身更值得记?
  34. 反方那个68%的零点击,样本经得起看吗?
  35. 那个AI概览让点击降42%的说法,是怎么被传错的?
  36. 这几份材料里,哪一份的设计最经得起推敲?
  37. 把这几个数字放一张表上,各自能回答什么?
  38. 常见问题解答
  39. AI搜索到底让网站流量掉了多少?
  40. 查询量下降9.4% 是不是意味着我的流量要掉9.4%?
  41. 为什么Google不公布AI搜索的点击占比?
  42. 在Search Console里能看到AI带来的流量吗?
  43. 可见度监控工具的数字能信吗?
  44. 哪类页面最先被AI替代?
  45. 在数字不确定的情况下,现在该做什么不会后悔?
  46. 怎么向只看数字的老板解释这件事?
  47. 权威参考资料

摘要:同一周里,一份点击流研究说AI让传统搜索查询量掉了9.4%,Google那边说AI功能每周给网站送出数十亿次点击。两个数字都不假,但都回答不了你真正想问的那个问题——我的站到底被吃掉了多少。这篇拆开三类数字各自测的是什么、边界在哪、为什么谁都给不出分母,然后给一套不依赖行业数字的自证口径:三层读数、页面替代梯度表,以及在数字不确定时依然不后悔的那几个动作。

同一周出来两个数字,方向正好相反

2026年7月中旬,行业里前后脚出现了两组关于AI搜索影响的数字。

一组来自学术侧:基于美国桌面点击流数据的研究给出结论,ChatGPT搜索功能开放范围扩大之后,传统搜索的每周查询量平均下降9.4%,二十周之后降幅扩大到17%。

另一组来自Google侧:官方公开表态称,现在光是搜索里的AI功能,每周就向网站送出数十亿次点击。

一个说流失,一个说输送。做这行的人看到这种局面,第一反应通常是选边站——看空的人转发前者,看多的人转发后者。这两种反应都跳过了更值得做的一步:先搞清楚这两个数字各自测的到底是什么,以及它们能不能推导到你自己的站上。

提前说结论:都不能。而这个结论本身,恰恰是最有用的一条信息。

9.4% 这个降幅,到底测的是什么?

先把研究本身说清楚,因为传播过程里它被简化得面目全非。

这项研究来自博科尼大学的研究团队,论文《Answering Without Referring》的arXiv预印本用的是Comscore的网址级桌面点击流记录,覆盖四万五千多个美国家庭,时间窗从2024年10月到2025年7月。选这个窗口是有讲究的——ChatGPT搜索功能是分批开放的,先付费用户、再免费用户、最后匿名访客,这种分阶段推开的过程刚好制造了一个准自然实验:可以比较“已经能用”和“还不能用”的两群人。

关键在于:9.4% 测的是搜索查询量的减少,不是你网站流量的减少。

这两件事完全不是一回事。查询量减少意味着人少搜了几次,而这些少掉的搜索原本会不会点进你的站、点进去会不会转化,研究没有回答,也回答不了。把“查询量降9.4%”读成“网站流量降9.4%”,是这一轮传播里最普遍的一次误读。

5.2% 对31.1%,真正该盯的其实是这一组

同一份研究里还有一组数字,比9.4% 重要得多,却传播得少得多:ChatGPT的对话会话里,产生对外引荐点击的比例只有5.2%;而Google搜索查询产生对外点击的比例是31.1%。

这一组对比才是机制层的答案。它说明的不是“搜索少了”,而是同一个信息需求,走AI这条路,流向外部网站的概率大约只有走传统搜索的六分之一

为什么这更重要?因为它可以推导。假设某个需求场景整体搬到了AI那边,你能拿到的点击不是打个九折,而是掉到原来的一个零头。前者可以靠优化补回来,后者是渠道结构变了,得换打法。

顺带说一句,这条数据也解释了为什么很多人的体感比统计数字惨烈得多——统计口径看的是全网平均,而你的体感来自你那几类页面,如果它们恰好落在被替代最狠的类目里,感受当然更接近32.8% 那一档(研究里查资料和研究类查询的降幅)而不是平均值。

查询量少了,那些需求都去哪了?

“替代”这个词很容易被读成“需求消失了”,实际上少掉的那部分查询有三条完全不同的去向,对应三种完全不同的应对。分不清去向,就会把力气使错地方。

去向一,同一个需求换了个地方问。用户还是想知道那件事,只是从搜索框换成了对话框。这部分是真正意义上的替代,也是被讨论最多的一条。它的应对是可见度问题——你得让AI在回答这类问题时提到你、引用你。

去向二,需求被前一次对话顺手消化掉了。这条更隐蔽。过去要搜三次才能问明白的事,现在一次对话里追问两轮就完了,后面那两次搜索根本没发生。从统计上看是“查询量下降”,从用户角度看不是转移,是压缩。这部分需求你几乎无从触达,因为它压根没有形成一次独立的检索。

去向三,需求根本没被满足,用户放弃了。AI给了个似是而非的答案,用户接受了,也就不再往下查。对你来说这是最难受的一种——你的内容明明更准确,但用户已经不觉得自己需要它了。

这三条去向的比例,没有任何公开数据能拆开。但它们的存在本身有个实用推论:那个降幅数字里,只有第一部分是你能通过做可见度去追回来的。把全部降幅都当成“能靠GEO打法追回的流量”,会让你高估投入产出比,然后在半年后对着没达标的数据怀疑人生。

降幅从9.4% 走到17%,这条时间线说明什么?

研究里还有一个容易滑过去的细节:降幅不是一次性发生的,而是随暴露时间加深——刚开放访问时是9.4%,二十周之后是17%。

这条曲线的形状比它的终点更有信息量。它说明这不是一次性的冲击,而是习惯迁移的过程:人不会因为出了个新工具就立刻改变行为,是用着用着,某一类问题就默认不去搜索框了。

三个推论跟着出来。

第一,用早期数据做长期外推一定会低估。一个产品刚铺开三个月时测到的影响,不是它的稳态影响。反过来,用二十周的数字去外推两年,同样没有依据——曲线会不会走平、什么时候走平,没人知道。

第二,基线要滚动重设。如果你去年建了一条基线就一直沿用,那条基线正在持续失真。比较合理的做法是每个季度重设一次同比口径,并且在报告里注明基线更新时间。

第三,你自己的曲线也应该是渐变的。如果你的数据显示某一周突然断崖,那多半不是AI替代,而是别的原因——改版、索引问题、算法更新、跟踪代码坏了。替代是慢慢渗的,断崖是别的事。这个判据很实用,能帮你少走很多冤枉路。

这份研究的边界在哪,哪些结论不能外推?

研究团队自己在论文里写了局限,这一段在转发里几乎全部丢失,但它决定了你能不能拿这个数字做决策。

只有美国桌面数据。移动端没有,国际市场没有。做外贸和出海的人要特别注意这一条:你的用户在东南亚用手机搜,和美国家庭在桌面浏览器上搜,行为结构差得很远。

没有收入数据。研究能看到点击去了哪,看不到那些点击值多少钱。少掉的那部分查询里,可能大部分本来就不带来收入。

时间窗到2025年7月。之后一年AI搜索产品形态又变了好几轮,趋势方向大概率还在,但幅度不能直接沿用。

类目差异巨大。研究本身就报告了交易类和娱乐类查询的变化明显更小。拿一个跨类目平均值去预测某个具体类目,方法上就不成立。

所以这份研究的正确用法是:它给了你一个机制方向和一组结构性比例,不是给你一个可以往财务模型里填的系数。

那份点击流研究的样本,为什么常被引述错?

这份研究传开之后,中英文渠道里出现频率最高的一句概括是:它覆盖了四万五千多个美国家庭。

这句话不算错,但位置放错了。

论文里的原始口径是这样的:Comscore的完整样本每月包含十六万八千余到二十三万八千余个活跃的美国桌面家庭;其中有一个由四万五千三百八十六个家庭组成的平衡子面板,要求每个月都至少产生四次前台页面加载。

关键在后半句——这个四万五千多户的子面板,只被用于传统搜索的替代效应分析这一项。研究里关于对外点击比例、目的地构成的那些结论,用的是范围大得多的完整样本。

所以把四万五千当成整份研究的样本量,等于把一个专用子集的规模,说成了全部工作的规模。

再往下还有一层。用于识别替代效应的处理组,规模其实小得多:合计三千八百八十二个家庭,其中付费订阅那一组只有八十四户。

八十四这个数字值得记一下。分组结论的可靠性跟总样本量没关系,跟那一组自己有多少人有关系。看到按人群拆开的结论时,先找那一组的分母,这是比看总样本更有用的习惯。

十个月里一次外链点击都没产生的家庭,占了多少?

这份研究里最该被拎出来、却几乎没被转述过的一个数字,是74.4%。

在十个月的窗口里,五万六千多个用过ChatGPT的活跃家庭当中,有74.4%从头到尾没有产生过一次干净的对外点击。同期,二十九万多个用搜索引擎的家庭里,这个比例只有9.6%。

先体会一下这两个数的差距。用搜索的人里,十个中有九个至少点出去过一次;用AI的人里,四个中有三个一次都没有。

这比前面那个5.2%更能说明问题。5.2%是把所有会话摊平算的平均值,容易让人以为流量是被均匀削薄了。而74.4%告诉你的是另一回事:对大多数用户而言,这条通道不是给你送来的流量变少了,是压根就没有过。

剩下那些点击高度集中在少数家庭身上。换句话说,AI带来的站外访问,从一开始就是一个由少数重度用户贡献的长尾结构,而不是一个人人都贡献一点的普惠结构。

这条推论对做预期管理特别有用。如果你的站在这轮里确实拿到了一些AI来源的访问,那它大概率来自很小一撮人;用这批数据去外推整个用户盘的行为,会得出严重偏乐观的结论。

为什么同一份研究里会有8.2%和17.0%两个降幅?

前面用到的降幅是二十周之后17.0%。但同一份研究里还有另一个数:8.2%。

两个数字都对,差别在于比较的是谁和谁。

17.0%来自研究的主口径,把新获得访问权的家庭,跟此前完全没碰过这类工具的家庭做对比。8.2%来自一个更干净但样本更小的比较:拿已经在用这个工具的两批人互相比,只是获得完整访问权的时间不同。

后者剔除了一部分选择性偏差——毕竟主动去用AI的人,本来就可能是那些搜索习惯正在变化的人。剔除之后,降幅缩水了一半还多。

这里有个可以带走的通用判断:当一份研究同时给出几个估计值时,口径越干净的那个通常越小,而进摘要的通常是最大的那个。

这不一定是研究者存心。审稿、传播、注意力竞争,每一环都在把最醒目的数字往前推。但对读的人来说,习惯性地翻到方法论里找那个更保守的估计,几乎总是值得的。

研究团队自己在这件事上态度相当克制。他们明确写了,这项工作的主张刻意窄于福利层面的主张——测的是可观察的流量分配变化,而不是消费者福利、发布商收入,也不是长期的内容生产。

这句自我设限,比论文里任何一个百分比都值钱。它等于提前否掉了一整类外推:拿这份研究去论证内容行业整体的兴衰,是研究者自己都不认的用法。

广告支撑型网站少了27.6个百分点,这对谁是坏消息?

还有一组少有人提的数字,讲的是那些确实发生了的点击流向了哪里。

把AI产生的对外点击和搜索引擎产生的对外点击按目的地的变现方式分类比较,结果是:流向靠广告变现的网站的比例,低了27.6个百分点;流向媒体类站点的比例,低了15.8个百分点。

反过来,流向专门性目的地的比例更高。

这说明剩下的那部分点击不是原来那股流量的等比例缩小版,它的成分变了。

顺着这条往下推,不同类型的站受到的冲击结构完全不同。

靠广告变现的内容站是双重挨打:总量在降,而剩下的流量还系统性地绕开它们。品类维度的数据也对得上——学术研究类目的地的搜索引荐下降32.8%,参考知识类下降26.5%,开发技术类15.1%,新闻资讯类13.4%。前两类正是典型的“查完就走”的信息需求。

而靠交易变现的站相对轻一些。这不是因为它们做对了什么,是因为买东西这件事本身还没法在对话框里完成,用户终究得走到某个能付款的地方去。

对做独立站的人来说,这算是这份研究里少有的一条好消息,但也别高兴太早:它保护的是交易环节,不保护交易之前的那些内容页。你站上那些用来做认知、做教育的文章,处境跟内容站是一样的。

顺带一提,同一块结果屏幕上广告位、被引来源和自然结果其实是三条互不相通的通道,谁也带不动谁。这件事站内另有一篇拿五万个商业词的实测专门拆过,跟这里的替代效应是同一个问题的两个侧面。

数十亿次点击,为什么是一句无信息量的话?

再看另一边。Google公开表态说,搜索里的AI功能每周单独送出数十亿次点击。这句话每个字都可能是真的,但它作为信息的价值接近于零,原因有三个。

没有分母。数十亿听着很大,问题是相对于什么?Google搜索整体的日均点击本身就在数十亿量级。一个周度绝对数,和一个日均绝对数,放在一起是没法比的——除非你知道总量,否则你不知道这是大头还是零头。

没有定义。什么算一次“点击”?AI概览里的来源链接被展开算不算?引用角标的悬浮预览算不算?不同定义之间的量级差异可以有好几倍。

没有基期。没有说这个数字比去年同期是涨了还是跌了。一个不带趋势的绝对数,无法支撑任何判断。

更关键的是最后一层:就算这三样都给了,它也仍然是一个汇总数字,跟你的站没有任何映射关系。你无法从“全网每周数十亿”里,反推出“我的站这周应该拿到多少”。

为什么Google不给分母?

这里不必做阴谋论解读,有两个更朴素的解释。

一是竞争考量。点击的绝对量和占比是Google最核心的商业数据之一,公开完整口径等于把广告业务的底牌摊开。

二是产品口径本身就在动。Google关于搜索中AI功能的官方说明里,AI概览、AI模式这些形态的数据是按搜索类型合并进现有报告的,并没有单独拆出一套。产品形态每几个月变一次,口径也就跟着变,公布一个会在三个月后自己打脸的数字,对谁都没好处。

理解了这一点,你就不该再等了:官方不会给出让你能算自己那份的数据,这不是暂时的信息滞后,是结构性的。等一个权威数字来解决你的困惑,等不到。

第三方工具给的替代率,可信度排第几?

市面上还有第三批数字——各家可见度工具给出的AI流量占比、引用份额、替代率。这类数字的问题不在于造假,在于外推链条太长。

典型做法是:建一个提示词池,跑一批引擎,统计品牌出现和引用情况,再按某种权重外推到市场份额。链条上每一环都有假设——提示词池代表不代表真实需求分布?跑的那几个引擎的市场份额怎么加权?出现一次和被点击一次怎么换算?

这些工具用来做纵向对比是合适的:同一套提示词池、同一批引擎、每周跑一次,看自己的曲线是升是降,这个用法很扎实。用来做横向的绝对值判断就不合适:说“我们在AI里的份额是12%”,这个12% 的置信区间大到没有意义。

三类数字放一张表上,各自能回答什么?

数字来源 实际测的是 能回答 不能回答
学术点击流研究特定人群的查询行为变化替代是否真实发生、机制往哪个方向走你所在类目、你所在市场的具体幅度
平台官方表态全网汇总的绝对量这条渠道整体上还在输送流量占比、趋势、以及你那一份是多少
可见度工具自设提示词池里的出现与引用自己的曲线是升是降绝对份额、跨品牌横向比较
你自己站的读数真实发生在你这里的事哪类页面在掉、掉多快、掉的是不是值钱的那部分全行业发生了什么、同行是不是也这样

看这张表要看最后一行和前三行的关系:前三类数字都在回答“世界怎么了”,只有第四类在回答“我怎么了”。而需要做决策的是后者。

与其等一个准确的行业数字,不如自己建一套口径

接下来是可执行的部分。自证口径分三层,按确定性从高到低排,别把三层混着用,混着用就会自欺。

第一层:能直接测的三个读数

读数一,按页面类型拆的展现与点击趋势。在Search Console的性能报告里,把页面按类型分组打标——定义解释型、操作教程型、对比评测型、交易转化型——然后分组看展现量和点击量的走势。Search Console性能报告的官方口径说明里有一点必须记住:AI相关形态的数据是合并计入的,你看到的是合并后的结果,所以别指望能在这里读出纯粹的AI影响,能读出的是“哪类页面在失血”。

读数二,展现涨、点击跌的剪刀差。这是最有信息量的单一指标。展现量稳住甚至上升,点击量却在掉,说明你的内容还在被检索到,只是不再需要点进来了。这个剪刀差的斜率,比任何行业百分比都更接近你的真实处境。GSC里各项指标怎么读才不被带偏,保哥在GSC的数字为什么人人都读错里逐项拆过。

读数三,引荐来源里的AI域名。在分析工具里把来自各家AI产品域名的引荐流量单独拉出来。这部分量通常小得可怜,但它的绝对值不是重点,重点是它的转化率——多数站会发现这批流量的转化率明显高于自然搜索平均,因为用户已经被AI预筛选过一轮。

第二层:只能代理的两个信号

代理信号一,品牌词搜索量。如果AI在推荐你,一部分人会转头去搜你的品牌名。品牌词搜索量的变化能当作可见度的间接证据,但它同时受广告、社媒、线下等一堆因素影响,不能单独拿来归因。

代理信号二,直接访问的异常。没有来源标记的直接访问上涨,可能是AI推荐后用户手动输入网址,也可能只是统计口径的锅。这类信号的正确读法是“值得进一步查证”,不是“证据”。

这两个信号怎么组合成一张分层归因表,保哥在零点击时代的归因怎么补里给过完整的做法,这里不重复。

第三层:只能定性的部分,怎么做到不自欺?

剩下的部分——AI在多少次相关对话里提到了你、提到时说得对不对、有没有把你和竞品放在一起比——只能定性地测。

做法是建一个固定的提示词池,每周或每两周手动跑一遍,记录三件事:有没有出现、出现时的表述是否准确、引用的是不是你自己的页面。关键在于提示词池固定不变,一旦中途改了池子,前后就没有可比性了,而这恰恰是最常见的自欺方式——曲线不好看就换一批提示词。

零点击环境下品牌影响力还有哪些可衡量的维度,零点击搜索拿走了流量,品牌影响力还怎么衡量那篇给了一整套仪表盘,可以直接拿去用。

哪类页面先被替代?一张替代梯度表

这张表是把研究里的类目差异,翻译成你能对着自己站点打标的形态。它的作用是让你知道该先看哪一批页面。

页面类型 被替代压力 原因 该往哪改
名词解释、概念定义最高答案短、无歧义,一句话就能给完别指望它带流量,改成承接内链和实体佐证的枢纽
通用型操作步骤步骤可被完整复述加版本差异、报错处理、实际截图这些复述不了的东西
横向对比、选型AI能列表格,但列不出真实使用体验补自己实测的数据和踩坑,把对比锚在一手经验上
带地域、带资质的服务页中低需要核实主体,AI倾向给出处把实体信息和第三方佐证做扎实
交易与产品页最终必须落到某个具体商家保证结构化数据和库存价格准确,别在这层丢分

这张表还有一个副作用,值得单独指出来:压力最高的那两类,往往正是过去几年做内容时被当作流量主力的类型。这解释了为什么很多内容站的体感远比行业平均惨——不是行业跌得更狠,是它们的资产结构正好压在替代梯度的顶端。

怎么给自己的站算一个粗略的暴露度分数?

梯度表是定性的,再往前推一步可以变成一个能排序的数字。这个算法很土,但它解决的问题很实在:当老板问“我们受影响大不大”的时候,你需要一个能摆上桌的东西,而不是一句“要看情况”。

三步。

第一步,给页面类型赋权。按上面的梯度表给每一类一个替代压力系数:名词解释类1.0,通用操作步骤类0.8,对比选型类0.5,带地域资质的服务页0.3,交易产品页0.1。这些数字是相对刻度,不是概率,别去纠结它准不准——只要全站用同一把尺子,排序就有意义。

第二步,按自然搜索点击量算权重。取过去90天的数据,算出每一类页面的点击量占全站自然搜索点击的百分比。注意用点击量而不是页面数量——一百个没人看的名词解释页,不该和一个主力页面同等计分。

第三步,加权求和。把各类的占比乘以对应系数再相加,得到一个0到1之间的分数。0.6以上说明你的流量结构重度压在高替代压力的资产上,这件事对你就是战略级的;0.3以下说明短期内影响有限,可以按常规节奏推进,先建口径别急着大改。

这个分数最有价值的用法不是看它的绝对值,是每季度重算一次看它的移动方向。分数在降,说明你的流量结构正在往抗替代的方向迁移,这本身就是一个可以写进汇报的成果指标;分数不动甚至在升,说明你新做的内容仍然堆在最容易被吃掉的那一类上。

要注意一个失真点:改版、季节性和新页面上线都会扰动这个分数,所以算完之后要顺手记一句当期发生了什么。至于GSC里那份生成式AI相关的报告怎么读、屏蔽开关要不要动,保哥在GSC生成式AI性能报告与屏蔽开关怎么用里单独写过,那份报告能给这套算法补一层实证。

一个户外露营装备站的六个月读数

去年帮一个做户外露营装备的独立站看过这件事,他们卖便携炉具和睡袋,主力市场是欧洲和澳洲。老板拿着一堆行业报告来问的第一个问题是:我们该按跌多少来做预算?

这个问题回答不了,所以当时的做法是先把他们自己的读数拉出来。按上面那套页面分类打标之后,六个月的数据呈现出很清楚的分化:科普解释类的页面展现基本没掉、点击掉了将近一半;产品页和分类页几乎没有变化;对比选型那批页面点击小幅下滑,但引荐来源里AI域名的量在同期涨了一截,转化率高于自然搜索平均。

换句话说,行业里那个平均数字,落到这个站上是三种完全不同的走向。用任何一个单一百分比来做全站预算,都会同时高估一部分和低估另一部分。

后续动作也就顺理成章:科普页不再追点击,改成把实体信息、产品内链和佐证材料织进去的枢纽;对比页补进了他们自己在阿尔卑斯做的低温实测数据,这是AI复述不了的东西;产品页那边什么都没改,只把结构化数据和库存状态的准确性重新过了一遍。

需要说明边界:这套读数解决的是“钱该往哪投”,不解决“总量会跌多少”。后面这个问题在数据结构上就没有答案,谁给出精确答案,谁在编。

出海做多市场,这个替代结构会更重还是更轻?

研究只覆盖美国桌面,而做外贸和独立站的人面对的是一堆别的市场和一大半移动流量。这个缺口不能靠猜,但可以按几条已知的结构差异来推方向。

移动端大概率更重,但基数本来就低。手机上的AI入口正在往系统层和浏览器内置里钻,路径比桌面更短,替代发生得更自然。不过移动端搜索的点击率本来就低于桌面,所以从“损失的绝对点击”看,未必比桌面惨。这两个方向相反的效应叠在一起,净结果只能自己测,不能沿用别人的数字。

非英语市场目前偏轻,但这是个正在关闭的窗口。小语种的AI答案质量普遍不如英语——训练语料少、本地实体识别弱、引用的来源经常驴唇不对马嘴。用户被坑过几次之后会退回搜索框。这给做小语种市场的人留了一段缓冲期,但语料在补,缓冲期在缩短。合理的做法是把这段时间用来抢占本地实体和本地佐证,而不是当作可以躺着的理由。

B2B出海的替代压力,结构性低于B2C信息类。采购决策要核实主体、要看资质、要走多人流程,AI在这类场景里更倾向给出处而不是给结论。所以工业品和设备类的独立站,短期内不该把AI替代当成头号威胁——真正该担心的是另一件事:当采购方用AI做初筛时,你在不在候选名单里。

落到操作上只有一条:按市场分开建口径。全球一条曲线是这件事上最没用的图表,因为它把方向相反的几个市场平均成了一条没有信息的横线。至少按主力市场拆三条,每条单独看展现与点击的剪刀差。

还有个便宜的判据可以顺手加上:看某个市场里品牌词点击和非品牌词点击的比值走向。非品牌词的点击在掉、品牌词的在涨,通常说明替代正在发生但你的品牌资产在接住它;两者一起掉,那多半不是AI的问题,是这个市场的整体运营出了别的岔子。

数字不确定的时候,哪些动作在两种情形下都不后悔?

做决策的人真正需要的不是准确预测,是一组“无论替代率是9% 还是30% 都该做”的动作。这样的动作有四个。

一,把可被复述的内容改成不可复述的。替代率高,这么做能保命;替代率低,这么做本来也能提升内容质量。两种情形都对。

二,把实体信息做扎实。官网主体信息、第三方佐证、一致的品牌描述——AI时代它决定你会不会被推荐,传统搜索时代它是E-E-A-T的地基。两边都吃。

三,把测量口径先建起来。建口径的成本很低,价值随时间增长。等你需要向老板解释的时候再建,就晚了半年基线。

四,把渠道结构分散一档。不是让你全面转投别的平台,是别让某一个渠道占到七成以上。这条在任何一种未来里都成立。

反过来,有两个动作是明确该缓的:为了追一个不确定的趋势而大规模重写老内容,以及在没有自己基线的情况下就采购一整套昂贵的监控工具。这两件事都是拿确定的成本,去赌一个不确定的收益。

拿行业数字给老板做预测,会踩什么坑?

最后说几个具体的坑,都是真见过的。

坑一,把查询量降幅当流量降幅报上去。触发条件是转述二手结论时没看原始口径。后果是预测系统性失真,而且失真方向不定——可能高估也可能低估。处理方式很简单:任何要写进汇报的数字,都去看一眼它的原始定义。

坑二,用全球平均值预测单一市场。美国桌面数据推不出东南亚移动端的情况。做出海的尤其容易在这里翻车。处理方式是明确标注适用范围,宁可写“缺该市场数据”,也别拿一个不适用的数字充数。

坑三,把没有分母的绝对数当利好。看到“数十亿次点击”就安心了,这跟看到降幅就恐慌是同一个错误的两面。处理方式是养成一个习惯:任何绝对数,先问分母和基期,两个都没有就当没看见。

坑四,中途更换提示词池。这是自证口径里最隐蔽的自欺。曲线不好看就换一批词,换完曲线漂亮了,但这条曲线已经不代表任何东西。处理方式是把提示词池当合同处理,要改就重新起算基线并留档说明。

坑五,把三层读数混着用。拿第三层的定性观察去回答第一层的定量问题,或者反过来。处理方式是汇报时明确标注每个数字来自哪一层、置信度如何。老板不怕数据有不确定性,怕的是你把不确定的东西讲得很确定,然后在下个季度被现实打脸。

那这件事最终该怎么看?

替代在发生,这一点不用再争了,机制层的证据已经够扎实——同一个信息需求走AI路径,流出到外部网站的概率只有传统搜索的一个零头,这是结构性的。

但幅度不可知,而且大概率会长期不可知。平台没有动机公布让你能算自己那份的数据,学术研究受限于样本和时滞,工具受限于外推链条。等一个权威数字来告诉你该慌到什么程度,这个数字不会来。

能做的是把问题换掉:不问“行业跌了多少”,问“我的哪一类页面在掉、掉的是不是值钱的那部分、我手上有没有一条能自己解释的曲线”。这个问题有答案,而且答案就在你自己的后台里,今天就能开始拉。

那句每周数十亿次点击,原帖到底是怎么说的?

这个说法的源头是Google负责知识与信息的高级副总裁Nick Fox在2026年7月17日发的一条领英帖子。行业媒体的转发大多只截了一句,把上下文丢了,而上下文恰恰是关键。

原帖里相关的那一段是这样的:

Actually, as we've shared before, we continue to send billions of clicks to the web every day through Search. And we've designed our AI features in Search to connect people to websites. In fact, we're now sending billions of clicks to websites every week through AI features in Search alone – and we're just getting started.

把这段读慢一点,会发现里面其实并排放了两个数字,而且这两个数字不是一回事。

为什么每天和每周这两个数字,不能放在一起读?

拆开看:

  • 每天数十亿次——说的是整个Search,包含所有传统搜索结果的点击;
  • 每周数十亿次——说的是AI功能单独贡献的点击。

两个数字,分母不同,时间单位也不同,却被放在紧挨着的两句话里。读的时候如果不特别留神,脑子里留下的印象就是一个笼统的“Google送出好多点击”,而这恰恰是这种写法最省力的效果。

更值得算一笔的是量级关系。如果每天数十亿、每周也是数十亿,那么按最朴素的口径推,AI功能贡献的那部分大致相当于整体的七分之一上下——前提是两个“数十亿”取值接近,而这个前提恰恰无法验证。

所以这里真正该记住的不是某个比例,而是一段话里出现两个同样模糊的大数时,先看它们的分母和单位是不是同一个。不是的话,任何把它们连起来读出的结论,都是你自己脑补的,不是发布方说的。

同一天发在另一个平台的版本,为什么把每天那句删掉了?

有个细节挺有意思。同一天晚些时候,同一位高管在另一个社交平台也发了一版,内容大体一致,但删掉了“每天数十亿次”那一句,只保留了AI功能每周数十亿次那句。

这算不上什么阴谋,更可能只是不同平台的篇幅习惯。但它有一个实际后果:从不同平台看到这条消息的人,拿到的信息量是不一样的。只看到删节版的人,会以为“每周数十亿”是Google给出的唯一口径,完全意识不到旁边还并排着一个更大的、口径不同的数字。

这件事提醒的是引用习惯:转述一条平台高管的表态时,最好回到他最先发布的那个版本,而不是随手引用你正好刷到的那一版。同一个人、同一天、同一件事,措辞可以是不同的。

billions这个词,实际能指多大的区间?

还有一层模糊性藏在词本身里。

英文里的billions,下界是20亿,上界没有——20亿可以叫billions,9000亿也可以叫billions。这两个取值之间差了450倍。

换句话说,这个表述从一开始就不具备可证伪性。你没法说它错,因为它没有给出任何一个能被检验的具体值;你也没法用它做任何测算,因为代入下界和代入上界得到的结论可以差两个数量级。

这不是挑字眼。一个无法被证伪的表述,本质上不承担任何信息义务,它的作用是塑造印象,不是传递事实。识别这一点之后,再看到平台方给出的各种“数以亿计”“大幅提升”“显著改善”,你就知道该把它们放在哪一档来读。

那个每天的说法,最早出自哪里?

“每天数十亿次点击”不是这次才有的新说法,帖子里那句as we've shared before也点明了它是旧话重提。它的规范出处是Google搜索负责人Liz Reid在2025年8月发布的一篇官方博文。

那篇文章的原话是:

We continue to send billions of clicks to websites every day and believe that Search's value exchange with the web remains strong.

同一篇里还给了一个更关键的主张,是关于趋势而非绝对值的:

Overall, total organic click volume from Google Search to websites has been relatively stable year-over-year.

注意这句的口径:总量、同比、相对稳定。它没说增长,说的是稳定。这已经是三个限定词,每一个都在缩小这句话的适用范围。

一篇指责别人方法论有缺陷的文章,自己披露了多少方法论?

这是整件事里最值得单独拎出来的一处。

那篇官方博文在给出自己数据的同时,明确批评了第三方研究:

This data is in contrast to third-party reports that inaccurately suggest dramatic declines in aggregate traffic — often based on flawed methodologies, isolated examples, or traffic changes that occurred prior to the roll out of AI features in Search.

指出别人方法论有缺陷、样本孤立、时间窗口错位,这三条批评本身其实都挺在理,前面拆那些第三方研究的时候也能看到类似问题。

但接下来就是那个反差:这篇指责别人方法论有缺陷的文章,自己没有披露任何方法论。没有绝对数值、没有样本量、没有地域范围、没有统计窗口、没有说明“相对稳定”的容差是多少——降5%算稳定吗,降15%算吗?全文没有一个可以被外部审计的数据点。

这不是说Google在撒谎,它大概率没有必要撒谎。问题在于证据等级:一方给出了可被检查的方法论和可被指出的缺陷,另一方给出的是不可检查的结论。在方法论层面能被批评,恰恰是因为人家公开了方法论。

这条读法可以直接搬到别处用:当一份材料同时做两件事——批评别人的方法论、并给出自己的结论——先看它有没有为自己的结论提供同等标准的方法论。没有的话,这就不是一次学术争论,是一次公关表态。

高质量点击是个什么指标,谁定的?

同一篇博文里还有一个更该警觉的说法,因为它听起来最像是数据,实际上最不像。

原话是这样定义的:

Additionally, average click quality has increased and we're actually sending slightly more quality clicks to websites than a year ago (by quality clicks, we mean those where users don't quickly click back — typically a signal that a user is interested in the website).

三个问题跟着就来了。

第一,这是个自造指标。“高质量点击”不是行业通用定义,是Google自己在这句话里现场定义的。自己定义指标、自己测量、自己宣布该指标上升,这个闭环里没有任何一环是外部可介入的。

第二,判据只有一条行为信号——用户没有很快点返回。那么多快算“很快”?三秒、十秒、三十秒?阈值没公布。而这个阈值直接决定了这个指标的取值。

第三,测量面板没公布。在什么样本上测的、覆盖哪些地区、哪些设备,全无。

再加上那个“slightly”(略微),这句话的实际信息量已经接近于零:一个自己定义的、阈值未公开的指标,在未披露的样本上,略微上升了。这句话没有错,但它也没有说任何事。

Google自己承认的那句话,为什么比争论本身更值得记?

吵总量的时候,很容易漏掉官方在同一篇文章里主动承认的一件事。原话是:

While overall traffic to sites is relatively stable, the web is vast, and user trends are shifting traffic to different sites, resulting in decreased traffic to some sites and increased traffic to others.

翻成人话:总量大体稳定,但流量在站与站之间重新分配,有些站少了,有些站多了。

这句话的分量比它看起来大得多。它等于官方亲口承认:“行业总量稳定”和“你的站掉了”这两件事可以同时成立,而且并不矛盾。

于是那场“AI到底有没有吃掉流量”的争论,在决策层面就失去了意义。因为无论总量是稳定还是下滑,都推不出你自己站的走向——这正是这篇文章从头到尾在讲的那件事。真正该问的问题从来不是“行业掉了多少”,而是“我的哪些页面在被替代、替代到什么程度”。

顺带一提,这句话也解释了为什么平台方和站长的体感能差那么远。平台看的是整个池子,你看的是自己那一瓢。池子的水位没变,不代表你那一瓢没被人舀走。

反方那个68%的零点击,样本经得起看吗?

争论的另一边,被引用最多的是零点击比例。这个数字的准确值是68.01%,不是常见转述里的整数68%,出自SparkToro的Rand Fishkin。

先把三方角色分清楚,因为这里最容易张冠李戴:SparkToro是分析方和发布方,Similarweb只是提供点击流面板数据的一方,2024年的对比数据来自Datos,更早的历史数据来自已经停运的Jumpshot。把它说成“Similarweb的研究”是不准确的。

口径是2026年1月至4月、仅美国。这份研究值得肯定的地方在于它主动自曝了缺陷,其中一条很关键:

This data is not inclusive of the Google mobile search application, but rather mobile searches within the browser.

也就是不含Google的移动搜索应用,只统计浏览器内的搜索。而作者自己判断,应用内的零点击特征只会更强,所以真实的零点击率很可能比68.01%还要高。这是个诚实的自我披露,值得记一笔。

但它也有硬伤:样本量通篇未披露,只说明了数据源是Similarweb的桌面与移动点击流面板,没给面板规模、用户数或搜索次数。另外跨年对比换过数据提供方,作者原话是these aren't the same users or devices,所以那条历史趋势线只能读方向,不能当精确数列引用。

那个AI概览让点击降42%的说法,是怎么被传错的?

这条流传极广,而且被传成了因果结论——“AI概览让点击掉了42%”。回原报告看,这个转述至少错了两层。

原文的表述是:

Compared to the pre-AIO average, organic search in Q4 2025 is down -42%.

第一层错在因果。原文说的是“与AI概览上线之前的均值相比,2025年第四季度的自然搜索下降了42%”,这是一个前后对比,不是对AI概览的因果隔离。它没有、也无法证明这42%是AI概览造成的。

第二层错在范围。这份数据的样本是一家数字媒体服务商自家的新闻出版客户组合,属于单一垂类。新闻类内容对AI概览的敏感度显著高于电商、B2B、本地服务,这个数字外推到全网毫无依据。

还有个更要命的细节:它的基线是2023年第一季度到2024年第一季度的均值,对比期是2025年第四季度,跨度接近三年。这中间发生了多少事?几轮核心算法更新、社交平台去链接化、新闻消费习惯向短视频和推送迁移、内容分发产品的权重调整——这些全部被打包记在了AI概览一家头上。

需要说清楚的是,这份数据本身是真实的,取自他们自己的搜索后台,真实性没问题。不成立的是那个因果命题,不是那个数字。所以引用时的正确措辞是“某新闻出版组合在这段时间里自然搜索下降了42%”,而不是“AI概览让点击降了42%”。

这几份材料里,哪一份的设计最经得起推敲?

把上面几份摆在一起,会发现一个有点讽刺的结果:被引用最多的两份,设计上都不是最扎实的;设计最扎实的那份,反而传播得最少。

那份是皮尤研究中心2025年7月发布的调查。它的核心结论是:

  • 遇到AI摘要的用户,在8%的访问里点击了传统搜索结果;
  • 没遇到AI摘要的用户,点击比例是15%,接近前者的两倍。

它凭什么更扎实?因为它是这几份里唯一有对照组的。同一批人、同一个时间窗,按有没有遇到AI摘要自然分成两组做比较,而不是拿今年和三年前比。方法是给900名美国成年人的设备装追踪应用,采集2025年3月的全量访问记录;研究期内18%的搜索出现了AI摘要,58%的受访者至少遇到过一次。研究机构本身也没有商业利益卷在结论里。

它的局限同样要说清楚:样本偏小、只覆盖一个月、只限美国,而且数据是2025年3月的,放到现在已经偏旧。

把这几个数字放一张表上,各自能回答什么?

数字发布方有无对照组能回答的问题不能回答的问题
每周数十亿次AI点击Google基本什么都回答不了无分母、无方法论、量级开区间
总量同比相对稳定Google官方对行业总量的定性判断不可外部审计,且官方自承流量在重新分配
68.01%零点击SparkToro美国浏览器端搜索有多大比例不产生点击样本量未披露,不含移动应用,跨年换过面板
自然搜索降42%某数字媒体服务商一个新闻出版组合近三年的流量变化不能归因给AI概览,不能外推到其他行业
8%对15%皮尤研究中心同期人群中,AI摘要是否降低点击倾向样本小、仅一个月、仅美国、数据偏旧

这张表最该被记住的是最后一列。每个数字都有它答得了的问题,也都有它答不了的问题,而传播过程中被丢掉的永远是后一列。

回到最初那个问题:这几个数字里,有没有哪个能算到你自己站上?一个也没有。但它们合起来能告诉你一件事——连最有动机说清楚的那一方都拿不出可审计的分母,你就别指望有人能替你算这笔账了。自己建口径这件事,没有捷径。

常见问题解答

AI搜索到底让网站流量掉了多少?

没有可靠的行业数字,而且大概率长期不会有。公开研究测的多是查询量变化而非网站流量变化,覆盖范围也常限于特定市场和特定设备;平台方公布的是没有分母、没有基期的绝对量;第三方工具的数字建立在自设提示词池外推之上。这三类数字都能说明“替代在发生”,但都无法推导到你的站。可行的替代方案是建立自己的读数:按页面类型拆分的展现与点击趋势,尤其是展现涨、点击跌的剪刀差。

查询量下降9.4% 是不是意味着我的流量要掉9.4%?

不是。这两个指标测的是不同的东西:查询量下降指的是人少搜了几次,而那些少掉的搜索原本会不会点进你的站、点进来值不值钱,数据没有回答。更值得关注的是同一研究里的另一组数字——AI对话产生对外点击的比例约5.2%,传统搜索约31.1%。这说明当一个需求场景整体转移到AI时,流出到外部网站的概率大约只有原来的六分之一,这是结构变化,不是打折。

为什么Google不公布AI搜索的点击占比?

有两个现实原因。一是点击的绝对量和占比属于核心商业数据,公开完整口径等于摊开广告业务的底牌。二是产品形态本身在持续变化,AI相关形态的数据目前是按搜索类型合并进现有报告的,并未单独拆分,公布一个几个月后就会失效的口径对平台没有好处。所以这不是暂时的信息滞后,是结构性的——等官方给出能让你算自己那份的数据,等不到。

在Search Console里能看到AI带来的流量吗?

看不到纯粹的那一份。AI相关形态的数据是合并计入现有报告的,你读到的是合并后的结果。能读出来的是另一件更有用的事:把页面按类型分组之后,哪一类的展现量还在、点击量却在掉。这个剪刀差说明内容依然被检索到,只是用户不再需要点进来。它比任何行业百分比都更贴近你的真实处境。

可见度监控工具的数字能信吗?

看用法。用来做纵向对比是可靠的:固定提示词池、固定引擎组合、固定频率,看自己的曲线走向,这个用法很扎实。用来做绝对值判断就不可靠:说自己在AI里占多少份额,这个数字的置信区间大到没有决策价值。最需要警惕的是中途更换提示词池,换完曲线会好看,但已经不代表任何东西。

哪类页面最先被AI替代?

压力从高到低大致是:名词解释和概念定义类最高,因为答案短、无歧义,一句话就能给完;通用型操作步骤次之,因为步骤能被完整复述;横向对比和选型居中,AI能列表格但列不出真实使用体验;带地域和资质的服务页较低;交易和产品页最低,因为最终必须落到某个具体商家。麻烦的地方在于,压力最高的那两类,往往正是过去几年被当作流量主力来做的类型。

在数字不确定的情况下,现在该做什么不会后悔?

四个动作在任何一种未来里都成立:把可被复述的内容改造成不可复述的(加版本差异、报错处理、一手实测);把实体信息和第三方佐证做扎实;先把测量口径建起来,成本低而且价值随时间增长;把渠道结构分散一档,别让单一渠道占到七成以上。反过来,两件事该缓:为追不确定趋势大规模重写老内容,以及在没有自己基线之前就采购昂贵的监控工具。

怎么向只看数字的老板解释这件事?

别去争行业数字的准确性,那是一场赢不了的辩论。换个讲法:先承认总量幅度不可知并说明原因(平台不公布分母、研究样本受限),再把自己站的三条曲线摆出来——分类型的点击趋势、展现与点击的剪刀差、AI引荐流量的转化率。然后把结论落在资源配置上:哪类页面不再追点击、哪类页面加投入。老板真正需要的是投哪里的依据,不是一个精确到小数点的预测。

权威参考资料

分享到
标签
版权声明

本文标题:《都说AI把搜索流量吃掉了,可场上没有一个数字能算得到你自己的站上》

本文链接:https://zhangwenbao.com/ai-search-traffic-decline-numbers-unverifiable.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交