# 保哥笔记 — AI监控与数据 > 本分片含 23 篇文章,按发布日期倒序。全部分片索引见 https://zhangwenbao.com/llms-full.md **站点**:https://zhangwenbao.com/ **分类**:AI监控与数据 **生成**:2026-09-12 16:00:11 CST --- ## AI引用拆品牌词和非品牌词,这条线画在一句你看不到的话上 - URL:https://zhangwenbao.com/brand-nonbrand-split-grounding-query.html - 分类:AI监控与数据 - 发布:2026-08-12 | 更新:2026-08-12 - 摘要:分析面板把AI引用拆成了品牌词和非品牌词两条线,看着终于能分开算账了。可这条线是靠字符串匹配画的,而每六个DTC品牌里就有一个,名字本身是英语常用词。 - 关键词:GEO优化,AI搜索,数据分析,品牌词 > **TLDR**:摘要:把169个DTC品牌的名字逐个丢进英语词表里查,27个整体就是一个英语常用词,46个能在词典里查到,64个至少有一个词是日常用语。也就是说每六个品牌里就有一个,它的名字和普通名词长得一模一样。而AI分析面板里那条“品牌词还是非品牌词”的分界线,恰恰是靠字符串匹配画出来的,画在一句你根本看不到的检索词上。 > 摘要:把169个DTC品牌的名字逐个丢进英语词表里查,27个整体就是一个英语常用词,46个能在词典里查到,64个至少有一个词是日常用语。也就是说每六个品牌里就有一个,它的名字和普通名词长得一模一样。而AI分析面板里那条“品牌词还是非品牌词”的分界线,恰恰是靠字符串匹配画出来的,画在一句你根本看不到的检索词上。 Microsoft Clarity在2026年8月给AI引用面板加了一组新东西:给检索查询打上品牌与非品牌的标签,可以按这两类筛选,分别看引用次数,还分别算了一个权威占比。 这个更新本身是好事。以前所有AI引用混在一个数字里,现在至少能分成两堆看。问题出在这条分界线是怎么画的,以及它画在了什么东西上面。 它不是画在用户问的那句话上,而是画在模型自己拼出来的那条检索词上。而判断那条检索词算不算品牌词的办法,说到底就是看里面有没有出现你的品牌名。 这篇文章分两半。前半段说清楚这条线的位置和它中间隔着几层;后半段是我拿169个真实DTC品牌名做的一次测量,用来回答一个很实际的问题:你的品牌名,到底是不是一个能被字符串匹配可靠识别出来的东西。 ## Clarity把AI引用拆成品牌词和非品牌词,这条线画在哪? 先把这次更新的内容摆清楚,再说它的边界。 ## 新增的四样东西 一是给相关的检索查询打上品牌标签;二是可以按品牌和非品牌两类做筛选;三是每一类各自给出引用计数;四是每一类分别计算权威占比。这次更新的完整报道 (https://www.searchenginejournal.com/clarity-branded-non-branded-ai-citations/584654/)里把这四项列得很清楚,也提到了它的几处限制。 同类工具还有不少,20款GEO与AEO监控工具的选型 (https://zhangwenbao.com/geo-aeo-monitoring-tools.html)可以对着挑。 这四样凑在一起,等于把原来的一个总数拆成了两条线。对做品牌的人来说,这两条线的含义差得很远,能拆开当然比混着看强。 值得一提的是,这个面板本身是免费的。Clarity这个产品 (https://clarity.microsoft.com/)从热图和会话回放起家,这两年一路往AI可见度这边加功能,对预算不多的独立站团队来说是个挺实在的选择。它的官方文档 (https://learn.microsoft.com/en-us/clarity/)更新得也算勤快。 但免费和好用是两件事,好用和读得对又是另外两件事。这篇的重点全在最后那一层。 ## 品牌检索和非品牌检索,各自意味着什么 品牌检索指的是那条检索词里直接出现了你的品牌名,这时候模型往往会去找你的产品文档、价格页、帮助文章和评测。也就是说,AI已经把你当成了一个待考察的对象。 这两类流量的结构差别,品牌词与非品牌词怎么读怎么经营 (https://zhangwenbao.com/branded-vs-nonbranded-keyword-traffic-structure-strategy.html)里拆得更细。 非品牌检索是更宽的品类或话题查询,里面没有直接提到任何品牌,比如“适合零售商的邮件营销工具”这类。这时候你能被引用,说明你在这个话题上被当成了可用的材料。 ## 为什么现在才拆 因为在此之前,AI引用这件事本身还太新,能有个总数看就不错了。工具方先解决“有没有”,再解决“是什么”,这个顺序很正常。 但顺序正常不代表使用者可以跟着这个节奏走。一个刚拆出来的维度,最容易被当成一个成熟指标来用,因为它长得跟那些用了十几年的指标一模一样:一个名字、一个数字、一条曲线。 越是新拆出来的维度,越该先问它是怎么拆的。这个习惯我建议固定下来:任何一个新增的分类维度,第一次看到它的时候,先花十分钟搞清楚分类依据,再开始用它做判断。 ## 为什么这两条线的含义差得远 非品牌那条线涨,说明你在品类层面的存在感在变强,这是最难做也最值钱的一段。品牌那条线涨,可能是因为你最近做了投放、上了新闻、或者刚发生了什么事——它更多是别的动作的回声。 为什么它们得当两件事做,拆分、防御与归因 (https://zhangwenbao.com/branded-vs-non-branded-keyword-strategy.html)讲过一次。 两条线混在一起看,最常见的后果是把一次公关事件的余波,当成了内容策略见效。这也是这次更新真正的价值所在。 反过来的误判同样常见。一个团队踏踏实实写了半年品类内容,非品牌引用慢慢在涨,但总数被品牌那侧的自然回落盖住了,看上去像是原地踏步。半年之后这条内容线被砍掉,理由是“数据上看不出效果”。 这类事我见过不止一次,而且它有个共同特征:被砍掉的总是那条慢的、需要拆开才看得见的线。因为快的那条不用拆就能看见,会议室里谁能被看见谁就活下来。 ## 拆开之后,两条线各自该跟什么比 品牌那条线该跟你的品牌动作排期比:这个月投了什么、上了什么新闻、发了什么产品。对得上,说明它在正常反应;对不上还涨了,值得去看是不是出了什么你不知道的事。 指标体系怎么搭,从指标到异常诊断 (https://zhangwenbao.com/seo-data-analysis-guide.html)有一套现成框架。 非品牌那条线该跟你的内容排期比:这个月覆盖了哪几个品类问题、发了几篇、深度如何。它的反应会滞后几周,所以比的时候要往前错一到两个月。 这两条线的对照物不同,考核它们的团队也应该不同。把它们放进同一个KPI里,最后一定是内容团队替品牌团队的波动背锅,或者反过来。 ## 那这条线是怎么判定的 官方的说法是给“提到你品牌名的相关检索查询”打上品牌标签。剥掉措辞,实现上就是在一条字符串里找另一条字符串。 自己写规则是什么体验,GSC品牌词过滤器的5步用法 (https://zhangwenbao.com/google-search-console-branded-query-filter.html)可以对照看。 这个做法在绝大多数分析工具里都一样。Search Console的品牌词过滤器也是这个原理,只不过那里的过滤规则是你自己写的,你知道自己写了什么。这里的规则不在你手上。 差别看着不大,实际影响很大。自己写规则的时候,你会主动处理各种变体:常见拼写错误、加不加空格、英文名和中文名、子品牌算不算。这些判断都记录在那条正则里,随时能翻出来看。 而一个第三方工具给你的品牌标签,你既不知道它用的是精确匹配还是包含匹配,也不知道它处不处理大小写、复数和词边界。你能看到的只有结果,看不到判据。这正是这一整篇要处理的问题。 ## 为什么不能指望它公开这套规则 因为公开了就会被针对。任何一个可见的判定规则,只要它连着一个大家在乎的数字,就会有人去迎合它。这不是恶意,是自然反应。 规则一公开就会被迎合,对抗式优化为什么注定失败 (https://zhangwenbao.com/geo-keyword-stuffing-adversarial-attack-cooperative-optimization.html)说的是同一件事。 所以这类规则天然倾向于不公开,而不公开的规则天然无法被外部验证。你能做的不是要求它透明,是估计它的偏差有多大、往哪个方向偏。后面那批数据就是在做这件事。 ## 这条线以前是怎么画的 在传统搜索这一侧,品牌词和非品牌词的拆分已经做了十几年,方法也是字符串匹配,但有两个关键区别。 传统那一侧的打法,品牌词的SERP六位与三层防御 (https://zhangwenbao.com/branded-keyword-defense-serp-occupation-trademark-mechanism.html)。 第一,那边匹配的是用户真实敲进搜索框的词,中间没有改写。第二,规则是你自己写的,写多写少你自己负责。这两条加起来,让那边的拆分虽然也粗糙,但至少是可控的粗糙。 到了AI这一侧,两条都不成立了。匹配对象变成了模型生成的中间产物,匹配规则变成了第三方的黑盒。同一个概念,同一个方法,可靠性掉了不止一个档次。 这不是说不该做这个拆分——该做,而且必须做,因为混着看更糟。只是从传统搜索那边带过来的解读习惯,得改一改。 具体要改的有三条:别把品牌词占比当健康度指标,别拿这两个数跟同行比,别用单月数据下结论。这三条在传统搜索那边都是可以做的,在这边都不太行。 三条背后是同一个原因:那边的误差来自你自己的规则,这边的误差来自一个你看不见的黑盒加一个你十年前起的名字。前者可以修,后者只能估。 ## 最该改的一个习惯 传统搜索里,品牌词占比是个挺有意义的健康度指标:品牌词占比太高,说明获客过度依赖存量认知;太低,说明品牌没建起来。很多团队养成了盯这个比值的习惯。 该淘汰的旧指标不止这一个,9个指标的替代方案 (https://zhangwenbao.com/retire-outdated-seo-metrics-2026-strategy.html)列了一份。 这个习惯在AI这边要慎用。因为这个比值的分子分母,各自带着一个方向相反、大小不明的误差。两个误差一除,得到的东西已经很难说代表什么了。 如果实在想看这个比值,至少做一件事:把它和传统搜索那边的品牌词占比放一起看。两边差得太远的时候,差额里有多少是真实差异、多少是口径差异,值得单独查一次。 ## 一个只有你自己能回答的问题 所以真正该问的问题变成了:你的品牌名,是不是一个足够独特、能靠字符串匹配可靠认出来的东西。 品牌定位这件事,四个动作重塑清晰度 (https://zhangwenbao.com/brand-positioning-clarity-ai-search.html)从另一个角度谈过。 如果是,这条线基本可信;如果不是,这两个数字都会带上一层你看不见的误差,而且方向还不一定。后面那批数据就是为了回答这个问题。 ## 你在报表里看到的那句查询,不是用户问的那句话 这是理解整件事的关键一层,官方文档里也明确提示过。 ## 检索词是模型自己拼的 用户在对话框里打了一句话,模型不会拿这句话原样去检索。它会先理解、拆解、补全,然后生成一条或几条自己认为合适的检索词,再拿这些检索词去找资料。 这条检索词怎么反推,Clarity反推AI引用的实战 (https://zhangwenbao.com/microsoft-clarity-grounding-queries-ai-citation.html)里有做法。 你在面板里看到的,是后面这些检索词,不是用户打的那句话。这中间隔着一次改写,而这次改写你既看不到也管不了。 ## 改写会往哪个方向偏 常见的几种:把口语化的问题改写成更书面的表述;把一个含糊的需求补上限定词;把一个长问题拆成几条短的分别去查;在用户提到某个品牌时,把品牌名带进检索词,也可能不带。 改写敏感性可以测,5步测品牌引用稳定性 (https://zhangwenbao.com/ai-search-paraphrase-sensitivity-geo-test.html)是一套现成方法。 最后这一种直接决定了标签。同一个用户问题,模型这次把品牌名带进去了就算品牌检索,下次没带就算非品牌检索。 还有一种改写特别值得注意:把品牌名替换成品类描述。用户问“某某牌的箱子结实吗”,模型可能生成的检索词是“硬壳行李箱 耐用性 评测”。用户问的是一个明确的品牌问题,落在面板上却是一次非品牌检索。 反过来也有:用户问“有哪些好用的行李箱”,模型可能先检索一遍品类,再针对排在前面的几个品牌各查一次。于是一次非品牌提问,生成了一条非品牌检索词加三条品牌检索词。一次提问在面板上留下了四个印记,分属两个类别。 ## 一个问题会产生几条检索词 没有定数,取决于问题的复杂度和模型的策略。简单事实问题可能一条都不检索,直接答;复杂的对比类问题可能拆出五六条。 用户到底问什么,12类查询分类与内容布局 (https://zhangwenbao.com/ai-search-query-taxonomy-geo-content-strategy.html)做过归类。 这意味着面板里的引用计数,分母是不稳定的。同样是一百次用户提问,这个月可能产生两百条检索,下个月可能产生三百五十条,而变化的原因在模型那边。 这一点在做同比环比的时候尤其要小心。曲线的斜率里混着两样东西:你的可见度变化,和模型检索策略的变化。它们分不开。 ## 官方自己也提醒了这一点 那篇报道里引用的原话大意是:一条带品牌名的检索查询可能只是说明模型选中了这家公司去做进一步了解,它既不能确认用户知不知道这个品牌,也不能说明他处在什么购买阶段,更不能预测他会不会买。 监测提示词有几个误区,AI可见度监测的4大误区 (https://zhangwenbao.com/prompt-tracking-guide.html)点过名。 这句提醒很实在,但它容易被忽略,因为面板上那个数字看起来太像一个可以直接汇报的指标了。 ## 为什么模型要做这次改写 因为用户的话往往不是一条好的检索词。日常提问里有大量指代、省略和口语,直接拿去检索命中率很低。模型把它改写成一条结构清楚、关键词明确的查询,是为了提高找到有用材料的概率。 关键词研究要转向需求研究,六步转向的做法 (https://zhangwenbao.com/keyword-fragmentation-need-research-ai-search.html)。 从产品角度看这是对的,用户也确实受益。问题只出在下游:这个为了检索质量而做的改写,被下游当成了用户意图的代表。它本来不是为这个用途设计的。 这类事在数据里很常见——一个为了A目的产生的中间数据,被拿去回答B问题。中间数据本身没错,错在它被赋予了它承担不了的含义。 ## 这一层带来的第一个后果 你没法用这两个数字去回答“有多少人主动搜了我的品牌”。能回答的只有“模型在多少次检索里用上了我的品牌名”,这是完全不同的两件事。 想从后台挖提示词,GSC正则的5步追踪 (https://zhangwenbao.com/gsc-regex-mine-ai-search-prompts-guide.html)是个入口。 ## 第二个后果更麻烦 这两个数字的比值会随模型行为变化,而模型每次更新都可能改变改写策略。这个月非品牌占比涨了十个点,可能是你的内容起作用了,也可能只是模型这一版更倾向于先做宽查询再收窄。 引用机制本身在变,2万条数据揭示的5条规律 (https://zhangwenbao.com/ai-search-citation-mechanism-content-optimization.html)可以当参照。 你没有办法把这两种情况区分开,因为改写这一步不在任何一份报表里。 ## 那有没有办法间接看出改写在变 有一个粗糙但可用的信号:看检索词的平均长度和结构。如果某个月开始,面板里的检索词普遍变长、开始出现更多限定词,多半是改写策略变了,而不是用户问法变了。用户的问法在几周内不会集体改变,模型的会。 查询变长这个趋势,8词查询暴涨7倍 (https://zhangwenbao.com/infinite-tail-seo-beyond-keywords.html)量过一次。 另一个信号是检索词的重复度。同一条检索词反复出现,说明模型对这类问题有了固定的检索模板;重复度突然下降,说明它开始更多地按具体语境生成。这两种状态下,你的引用机会分布是不一样的。 这两个信号都不精确,但它们至少能让你在解释一次波动时多一个候选原因。一个只有单一解释的波动,通常说明你还没看够。 ## 我把169个DTC品牌名放进英语词表里查了一遍 讲到这儿都还是机制。下面这部分是我自己动手量的。 ## 样本怎么来的 我手上有一批公开可访问的DTC独立站、品牌自营站和几个平台型站点,一共211个域名,逐个抓首页,从og:site_name和标题里取品牌名,取不到的用域名主体兜底,最后人工校准了58个明显提取错的。 另一种一手挖法,从日志看爬虫到底抓没抓 (https://zhangwenbao.com/seo-log-file-analysis-guide.html)。 校准这一步不能省。有14个站抓到的是人机验证页,标题写着“请稍候”,还有几个站的标题是“免运费”“官方网站”这种,直接拿来当品牌名就全错了。清洗环节多花的半小时,决定了后面所有数字算不算数。 那14个挡住抓取的站占抓取成功数的8.3%。它们不是坏数据,是看起来像数据的非数据——有标题、有正文、结构完整,只是内容跟这个品牌毫无关系。不做这一步清洗,我的常用词品牌名单里就会冒出“请稍候”和“安全检查”两个词条。 另一类更隐蔽:品牌名提取出来是对的,但带了尾巴。Casper Sleep、Baseus US、Nespresso China、Brompton UK,后面那个词是地区或品类后缀,不是名字的一部分。不切掉这些尾巴,多词品牌的比例会虚高,常用词命中率会虚低。 ## 校准了58个,这个数本身说明什么 169个里改了58个,超过三分之一。这个比例高得有点吓人,但它说明的其实是另一件事:从页面上自动提取品牌名这件事,本身就不可靠。 自动识别的准确率有多虚,那个95%是自己划的及格线 (https://zhangwenbao.com/ai-audit-tool-accuracy-rate-denominator.html)。 如果我这个明确知道自己要什么的人,自动提取的准确率只有三分之二,那一个通用工具在没有人工校准的情况下能有多准?这个答案我不知道,但它至少提醒一件事:别把任何自动识别出来的品牌相关数据当成精确值。 那58个改动我是逐条对着域名和页面看的,没有用任何自动规则。这是全流程里唯一一处纯手工的环节,也是最花时间的环节。数据工作里最贵的部分往往不是算,是确认。 ## 用哪几份词表 三份公开词表:一份37万词的全量英语单词表,一份2.5万词的常用词表,一份1万词的高频词表。判定分三档,从宽到严。 词表这东西哪来的,十种挖词渠道 (https://zhangwenbao.com/seo-long-tail-keywords-expansion-methods-and-ideas.html)里有更实用的来源。 判据 | 用哪份词表 | 意思 | 能不能在词典里查到 | 37万词全量表 | 它是一个英语单词 | 是不是日常用语 | 2.5万常用表加1万高频表 | 普通人天天在用 | 是不是行业里的品类词 | 从这批站的标题描述里自建 | 在这个行业里指某类东西 | ## 第三份词表是自建的 把169个站的标题和描述合在一起,统计每个词在多少个不同的站上出现过,出现在5个站以上的留下,得到53个词。这就是这批站所在行业的品类词表。 从一个主题长出一批词,5种实战方法 (https://zhangwenbao.com/how-do-you-generate-long-tail-question-keywords-from-a-topic.html)。 排在前面的是discover、accessories、designed、products、clothing、gear、apparel、outdoor、sustainable这些,很符合直觉。用样本自己长出来的词表,比我拍脑袋列一份要靠谱得多。 自建词表还有个副作用挺有意思:它顺带量出了这个行业的话术密度。169个站的首页标题描述里,有23个站用了discover这个词,19个用了accessories,16个用了designed。一个词能出现在四分之一的同行首页上,说明它已经不携带任何区分信息了。 这跟本文的主题没有直接关系,但它提醒了一件事:如果你的品牌名或者品牌标语里恰好含着这类高频词,那它在任何一次基于文本的识别里都会更容易撞车。 ## 门槛为什么定在5个站 定3太松,会把一些巧合放进来;定10太严,只剩下十几个最泛的词。5这个门槛下来的53个词,肉眼扫一遍基本都认,说明它落在一个合理的位置。 阈值怎么定才有用,低竞争词挖掘的9大策略 (https://zhangwenbao.com/low-competition-keywords-strategy.html)也绕不开这个问题。 这类阈值没有标准答案,我的做法是先试三个值,把结果各打印二十个词看一眼,选那个人读起来最像“这个行业的词”的。能被人一眼认出来的阈值,比一个理论上更优但结果读不懂的阈值有用。 ## 为什么不用维基百科去判 本来的计划是查每个品牌名在维基百科上有没有同名条目、有没有消歧义页,这个判据比词表更贴近“这个词在世界上不止指你”。可惜从我的抓取环境访问不到,只好换成词表方案。 维基百科在AI推荐里的位置,别刷Reddit和维基百科了 (https://zhangwenbao.com/ai-recommendation-reddit-wikipedia-geo-strategy.html)说过。 换方案是有损失的:词表能告诉你这个词是不是普通词,但没法告诉你它同时是不是另一个知名实体的名字。所以后面的数字应该理解成一个下限。 损失有多大,可以估一估。样本里像Columbia、Pandora、Weber、Philips这类,本身既是常用词又是别的知名实体,词表能抓到;而像Bershka、Cotopaxi、Kotn这种在词表里查不到、但在别处可能有同名地名或人名的,词表完全看不见。所以真实的“名字不止指你”的比例,只会比我算出来的高。 把这一层说清楚,是因为一份数据的可信度不取决于它有多干净,取决于它的脏在哪一侧。这批数字的脏全部偏保守,那结论方向就是稳的。 ## 用了两份现成词表,一份自建 两份现成的都是公开数据。那份37万词的全量表 (https://github.com/dwyl/english-words)负责回答“它是不是一个英语单词”,那份一万词的高频表 (https://github.com/first20hours/google-10000-english)负责回答“它是不是日常用语”。两份词表口径差得很远,正好用来分档。 实体这条线怎么建,AEEBM五阶段语义网络 (https://zhangwenbao.com/entity-seo-guide.html)是另一套办法。 用现成词表的好处不只是省事,更重要的是可复现:任何人拿同样两份表跑同样一批品牌名,得到的结果应该一样。一个别人复现不了的数据,说服力要打对折。 ## 怎么切词的 品牌名转小写,按非字母切成词,然后分三种口径统计:整个名字去掉空格之后是不是一个词,每个词单独看是不是普通词,以及有没有词命中品类词表。三种口径回答的问题不一样。 切词和停用词清洗,URL slug优化器 (https://zhangwenbao.com/slug-optimizer-url-stopword-scoring-guide.html)里也做同样的事。 为什么整名要去掉空格再查?因为有些品牌名写成两个词,但连起来是一个词,比如Flying Tiger这类。不去空格会漏掉一批;只看去空格的结果又会漏掉像Peak Design这种两个词各自都常见的情况。所以两个口径都要跑。 撇号和连字符做了统一处理:Rothy's、Arc'teryx这类先去掉撇号再判,ice-watch这类按连字符切成两个词。这些细节看着琐碎,但它们决定了几十个样本落到哪一档,而每一档的占比都是我要报出去的数字。 ## 没做的两件事 一是没做词形还原。Rituals这个名字我是按原样查的,没有还原成ritual。如果做了还原,常用词命中率会更高一点。不做的理由是:面板那边的匹配大概率也不做词形还原,我要模拟的是它的行为,不是语言学上的正确。 口径不同就对不上账,三家数据的对账方法 (https://zhangwenbao.com/seo-tool-data-reconciliation-ahrefs-semrush-gsc-discrepancy-framework.html)。 二是没考虑大小写。所有比对都在小写下进行。这一点跟真实匹配可能有出入——有些实现会区分大小写,那样On这个词的误匹配会少很多,因为句中的on通常是小写。这是我这套测量里最大的一处不确定,它会让16% 这个数字偏高。 把这两件事写出来,是因为一个数字的可信度取决于读它的人能不能知道它是怎么算的。藏起方法的数字看起来更权威,但它经不起任何一次追问。 ## 品牌名本身就是普通词的,占多少? 直接上数。 ## 四个口径的结果 口径 | 数量 | 占比 | 只有一个词的品牌名 | 129 | 76.3% | 整个名字能在词典里查到 | 46 | 27.2% | 整个名字是一个英语常用词 | 27 | 16.0% | 至少有一个词是常用词 | 64 | 37.9% | 每一个词都是常用词 | 50 | 29.6% | 名字里含本行业的品类词 | 4 | 2.4% | 换个口径结论就变,3类站点的聚合流量实测 (https://zhangwenbao.com/aggregate-organic-traffic-seo-metric-keyword-dead.html)也说明这一点。 ## 怎么读这张表 六行数字里,最该先看的是第二行和第三行的差:46个能在词典里查到,27个是常用词。中间那19个是生僻词品牌,它们在绝大多数场景下不会出问题,只在特定话题下撞车。 其次看第四行和第五行的关系:64个至少有一个词是常用词,50个每个词都是常用词。这两个数挨得这么近,说明多词品牌名很少是“一个生僻词加一个常用词”的搭配,要么全是常用词,要么全不是。这大概也符合起名时的直觉——两个词的风格不统一,念起来会别扭。 最后一行的4个看着少,但它是唯一一个真正会造成品类混淆的档位,其余几档最多是被无关句子误伤。误伤是噪声,品类混淆是系统性偏差,后者要严重得多。 噪声和偏差的区别值得多说一句:噪声让你的数字上下抖,样本一大就被平均掉了;偏差让你的数字整体偏向一侧,样本再大也不会消失,反而越大越确信一个错的结论。这两样在报表上长得一样,处理方式完全相反。 ## 16% 这个数是什么概念 169个品牌里有27个,它的名字本身就是一个英语日常词。每六个品牌里就有一个。这些名字包括:Article、Away、Canyon、Chewy、Columbia、Native、Nike、Nomad、On、Otto、Prose、Purple、Quince、Ridge、Ritual、Rituals、Seed、Weber、Yeti。 名字里塞关键词有没有用,这个问题2012年就定了 (https://zhangwenbao.com/exact-match-domain-emd-ranking-myth.html)。 看着这份名单会有一种熟悉感:这正是最近十几年DTC品牌起名的主流审美——短、好念、有画面感、容易注册社交账号。而这套审美恰好和“能被字符串匹配可靠识别”是矛盾的。 这个矛盾不是谁的失误。2015年前后决定叫Away的那个团队,考虑的是这个词有没有画面感、域名能不能拿到、读起来顺不顺口。当时没有任何一个理由让他们去想“十年后一个AI分析面板会不会分得清这个词”。 一个当年完全正确的决定,在一套十年后才出现的度量方式下变成了噪声来源。这类事在做数据的时候会反复遇到:你手上的历史数据,是按当时的目的攒下来的,不是按你现在的问题攒的。 ## 单词品牌名占了四分之三 169个里129个只有一个词,占76.3%。这个比例本身就说明了起名风格的集中程度。单词名字好记、好念、logo好做,但它也意味着这个名字必须独自承担全部识别负担——没有第二个词来帮它把上下文钉死。 起名和选域名是一件事,8步决策路线 (https://zhangwenbao.com/domain-name-decision-tld-emd-aged-acquisition.html)。 两个词的名字在这件事上明显占便宜。Warby Parker这样的组合,两个词都不算生僻,但连在一起几乎不可能是别的意思。识别可靠性来自组合的稀有度,不是单个词的稀有度。 ## 最极端的几个 一家跑鞋品牌叫On。两个字母,英语里最高频的介词之一。任何一条包含这个词的检索查询,从字符串上看都命中了这个品牌名。 一个词重复几次有用,答案是一次就够 (https://zhangwenbao.com/title-tag-keyword-repetition-myth.html)。 一家旅行箱品牌叫Away。一家宠物电商叫Chewy。一家床垫品牌叫Purple。一家户外品牌叫Columbia,同时还是一个国家、一所大学、一条河和一个电影公司。 把这几个放进真实的检索场景里看,问题就具体了。“best purple mattress”这条检索词,到底是在问那个叫Purple的品牌的床垫,还是在问紫色的床垫?从字符串上看没有区别,从语义上看是两回事,而打标签的那一步只看字符串。 Away更极端一点。“best carry on away from home”这样的句子在英语里再自然不过,而它包含了一个完整的品牌名。越是高频的日常词,被卷进无关句子的概率就越高,而且这个概率随检索词变长而上升。 前面说过模型改写倾向于把检索词写得更完整、更长。这两件事叠在一起的后果是:检索词越长,日常词品牌被误匹配的机会越多。而检索词变长这个趋势,最近两年一直在持续。 ## 为什么受影响的往往是最成功的那批品牌 这一点挺讽刺。能拿到on.com、away这类域名的,往往是融资早、动作快、品牌意识强的团队;而一个短小的日常词做品牌名,本身就是一种自信的表达——我有能力让这个普通词跟我绑定。 品牌本身的问题SEO补不上,流量暴跌的7大元凶 (https://zhangwenbao.com/seo-cant-fix-broken-brand.html)。 他们大多也确实做到了。在用户心里,Away就是那个旅行箱,Purple就是那个床垫。但在一个只做字符串匹配的系统眼里,这份认知资产完全不存在。系统看到的还是一个普通英文词。 这可能是这批数据里最值得记的一点:品牌建设的成果存在于人的认知里,而这套度量方式读不到人的认知,它只读字符。两者之间的差距,就是你在这两个数字上要打的折扣。 ## 还有一类更隐蔽的 名字不是常用词,但由常用词组成:Peak Design、Outdoor Voices、Peak Performance、Faherty Brand。这几个的名字里直接含着这个行业的品类词。 品类词带来的流量未必是好事,信息词过大的6大危害 (https://zhangwenbao.com/informational-keywords-traffic-dtc-ecommerce-seo-strategy.html)。 Outdoor Voices这个名字,出现在一条关于户外装备的检索查询里的时候,你几乎没法判断它是在说这个品牌,还是在说“户外的声音”。只有4个品牌落在这一档,但它们受的影响是最直接的。 为什么只有4个?因为我的品类词表是从这批站的首页文案里长出来的,只有53个词,覆盖面不大。如果换一份更全的品类词表——比如从这个行业的搜索词库里长出来的——落进这一档的品牌肯定不止4个。 所以这个2.4% 要理解成一个下限里的下限。它的意义不在数值本身,在于告诉你这一档确实存在,而且判断自己在不在里面很简单:把品牌名拆成词,看有没有哪个词是你这行的常用词。 顺带一提,品牌名里含品类词在营销上其实是有好处的:用户一看就知道你是干什么的,认知成本低。这又是一个当年正确、如今变成噪声源的决定。这类取舍在这批数据里反复出现,几乎构成了一个模式。 ## 反过来看,哪些品牌不受影响 造词类的名字完全不受这个问题困扰:Allbirds、Bellroy、Bombas、Brooklinen、Casetify、Cotopaxi、Curology、EcoFlow、Everlane、Fiskars、Glossier、Mejuri、Ruggable、Warby Parker。 品牌身份的地基怎么搭,实体主页怎么做 (https://zhangwenbao.com/entity-home-seo-ai-brand-guide-html.html)。 这些名字在英语里不存在,所以任何一次匹配都是真的。造一个词的代价是前期认知成本高,回报是从此以后所有关于你的数据都是干净的。这个取舍,在决定品牌名的那一刻就已经定下了,而当时没有人会想到十年后要靠它来分品牌词和非品牌词。 这一档在样本里占了大约55%,是最大的一档。所以如果你是这一类,前面说的那些误差基本跟你无关,这两条线可以放心看。剩下45% 才是本文的目标读者。 ## 还有一类介于中间 能在词典里查到、但日常几乎不用的词:Iittala、Marimekko这类外语词不算,我说的是像Quince(榅桲)、Prose(散文)这种。它们在词表里存在,但在日常英语里的出现频率很低。 精确匹配这件事,一字不差才能排吗 (https://zhangwenbao.com/exact-keyword-match-on-page-ranking-myth.html)早就讲清楚了。 这一档在这批样本里有19个,占11.2%(27.2% 减去16.0%)。它们的处境是:绝大多数场景下匹配是准的,只有在特定话题下会撞车。比如一个做散文写作工具的品牌恰好叫Prose,那它在写作类话题里的数据就全花了。 判断自己在不在这一档,有个土办法:把品牌名放进你这个品类最常见的十个问题里读一遍,看有没有哪一句读起来会产生歧义。有一句,就要打折。 ## 为什么这件事对拆分口径是致命的? 把上面两部分接起来,问题的形状就出来了。 ## 误差有两个方向 第一个方向是把非品牌检索误判成品牌检索。一条关于跑步鞋的普通查询,因为里面有个on,被算进了品牌那一堆。结果是品牌数虚高,非品牌数偏低。 指标误用有四种典型,从入门到精通的15步 (https://zhangwenbao.com/google-analytics-metrics-misuse-guide.html)都列过。 第二个方向反过来:用户明明在问你的品牌,但模型改写检索词的时候没把品牌名带进去,这次曝光就落进了非品牌那一堆。结果是非品牌数虚高。 ## 两个方向不会互相抵消 这是最麻烦的一点。它们的大小取决于完全不同的因素:第一种取决于你的品牌名有多普通,第二种取决于模型的改写策略。前者对你是常数,后者会随版本变。 数据虚高之后怎么修,对接一年的口径修正 (https://zhangwenbao.com/gsc-impression-bug-inflated-data-fix.html)。 所以你既不能指望它们抵消,也没法估计净误差有多大。你只知道有一个误差在那儿。 ## 对不同品牌,这条线的可信度差得很远 品牌名类型 | 本次占比 | 这条线可信吗 | 造词,英语里不存在 | 约55% | 基本可信 | 能查到但不常用的词 | 6.6% | 多数场景可信 | 英语常用词 | 16.0% | 要打折看 | 由常用词组合而成 | 13.6% | 要打折看 | 含本行业品类词 | 2.4% | 基本不可信 | 可见性指标分三层,GEO三层可见性拆解 (https://zhangwenbao.com/geo-visibility-metrics-scoring.html)。 ## 误差的大小能不能估出来 能估个数量级。假设你的品牌名是个日常词,那它在自然语言里的出现频率就是它被误匹配的基准概率。以On为例,这个词在英语文本里的出现频率大概是百分之一到百分之二——也就是说,随便一百条检索词里就有一两条含这个词。 量这类影响要多大样本,60万关键词六个月 (https://zhangwenbao.com/ai-overviews-commercial-intent-cpc-study.html)是个参照。 再乘上一个条件:这条检索词得跟你的品类相关,才会出现在你的面板里。这个条件会把误匹配率大幅拉低,但拉低多少取决于你的品类词跟这个词共现的频率。跑鞋品类里出现on的概率,显然比家具品类高得多。 所以这个误差不是一个固定的百分比,它是“词频乘以品类相关度”的结果,每个品牌都不一样。这也是为什么没有一个通用的折扣系数可以用。 ## 另一个方向的误差反而更难估 用户问了你的品牌但模型没把品牌名带进检索词,这一类完全取决于模型策略,你手上没有任何数据可以用来估计它。唯一能做的是通过手工对照测量去感受一下,这个我在后面会说做法。 估不出来就配对照组,给建议配一个注定无效的对照 (https://zhangwenbao.com/geo-tactic-control-group-evidence-test.html)。 两个方向的误差里,可估的那个反而影响小,不可估的那个影响大。这是很多度量问题的常态:你能算出来的部分,往往不是决定结论的那部分。 ## 什么情况下这个误差可以忽略 三种。一是你的品牌名是造词;二是你只看月度环比,且品牌名带来的偏差稳定;三是这两个数字只用来做内部方向判断,不进任何对外报告,也不参与考核。 国内入口容易整批漏掉,日志里带人来的是夸克和通义 (https://zhangwenbao.com/ai-referral-source-domestic-entries-gap.html)。 三种里满足任意一种,就可以不用管这一整节。都不满足的时候,至少要在报表旁边写一行注:本数字含品牌名歧义带来的系统性偏移。写一行的成本是零,省掉的是半年后的一场争论。 ## 换个角度看,这件事在别处也发生过 这类问题不是AI时代独有的。做过一段时间数据的人应该都遇到过:一个指标的定义依赖于某个字符串匹配,而那个字符串恰好是个常见词,于是这个指标从诞生那天起就带着一层脏。 渠道归因里最典型:某个来源的判定靠referrer里含不含某个域名片段,而那个片段又出现在别的域名里。事件埋点里也常见:事件名用了一个太通用的词,结果和另一个团队埋的事件撞在一起。 这些问题的共同结构是:用一个廉价的判据去近似一个昂贵的判断,而这个判据的失效条件写在它自己的定义里,只是没人去读那一层。 廉价判据本身没有错,很多时候它是唯一可行的。真正的问题在于,判据一旦被做成一个指标、印在一张报表上,它当初的近似性质就被忘掉了。指标名字里不会写“本数据基于字符串包含判定”,但所有的解读都建立在这句话上。 所以我的习惯是,每接触一个新指标,先花五分钟问一个问题:这个数是怎么被数出来的。不问它代表什么——那个通常写在文档里;要问它是怎么算的。这两个问题的答案,经常差得比想象中远。 ## 这不是某个工具的缺陷 要说清楚一点:这不是Clarity做得不好。任何一个不掌握用户原始提问的第三方,要把查询分成品牌和非品牌,能用的办法就只有字符串匹配。这是这个位置本身的限制,换谁来做都一样。 工具报告怎么读,五维度100分审计 (https://zhangwenbao.com/geo-optimizer-5-category-100-point-audit-guide.html)提醒别只看总分。 真正该调整的是读数的人。看到这两个数字时,先在心里给自己的品牌名打个分,再决定这两条线该看得多重。 说得再直白一点:工具的责任是把它能看到的东西如实呈现出来,读数的人的责任是知道它看不到什么。后一半从来都不在工具的说明书里,只能靠使用的人自己补。 这也是我做这次测量的原因。它没有改变任何工具的行为,只是把“你的品牌名有多容易被认错”这件事,从一个凭感觉的判断,变成了一个可以查的事实。一件事只要能查,它就不会再被含糊地绕过去。 ## 如果这个工具愿意多给一列 最有价值的一列,是每条检索词的品牌标签是怎么判出来的:精确匹配、包含匹配、还是别的什么规则。哪怕不公开规则本身,只给一个匹配类型的标记,读数的人就能自己判断该不该打折。 监控闭环怎么搭,4步实战与工具选型 (https://zhangwenbao.com/monitor-measure-iterate-ai-citation-optimization-2026.html)。 其次有价值的是把被匹配到的那一段字符标出来。用户能看到“这条检索词里的这三个字母被认成了你的品牌名”,很多误判当场就能识别出来。 这两列的技术成本都不高,但它们能把一个黑盒变成一个半透明的盒子。在度量这件事上,半透明比黑盒的价值高得多,因为它把判断权还给了知道业务的那个人。 ## 那这两个数字还有没有用 有,但用法要改:别看绝对值,看变化;别做横向比较,做纵向比较。你的品牌名带来的偏差是一个稳定的常数,它在时间序列上会被抵消掉,但在跟别的品牌比的时候不会。 数字不好看怎么跟老板讲,8维度的完整说法 (https://zhangwenbao.com/seo-traffic-decline-ai-search-value.html)。 ## Ritual和Rituals是两家公司,这种情况有多常见? 这批样本里有个特别巧的例子,值得单独说。 ## 差一个字母的两家公司 Ritual是一家美国的维生素品牌,Rituals是一家荷兰的香氛和身体护理品牌。两家公司做的是不同的生意,卖给不同的人,注册在不同的国家,名字差一个字母s,而且两个词都是英语常用词。 品牌词被别人占了怎么办,联盟客抢词的对齐实战 (https://zhangwenbao.com/seo-affiliate-program-alignment-brand-keyword-commission.html)。 ## 对字符串匹配意味着什么 任何一条包含rituals的检索查询,从字符串上看同时命中了两个品牌名——因为ritual是rituals的子串。如果匹配规则不做词边界处理,Ritual会把Rituals的每一次曝光都算成自己的。 字符串处理的坑不少,编解码与乱码还原 (https://zhangwenbao.com/uri-codec-percent-encoding-encode-decode-guide.html)也是一类。 做了词边界处理也不保险,因为英语里的复数变化本来就在词边界内部。而“护肤仪式”“晨间仪式”这类说法在这个品类里出现的频率,比这两个品牌加起来还高。 ## 这种撞车有多普遍 严格意义上完全同名的,这批样本里没有。但子串关系的不少:On是几乎所有含这个词的查询的子串;Article、Native、Seed、Prose、Ridge这些都会大量出现在普通句子里。 品牌词被蚕食的应对,品牌经理协作7动作 (https://zhangwenbao.com/brand-manager-seo-collaboration-7-actions-keyword-eat-crisis-pr.html)。 我粗略数了一下,如果不做词边界处理,27个常用词品牌里至少有20个会被大幅高估。做了词边界处理,还剩下十来个会被高估,因为它们本来就是完整的常用词。 ## 要不要为此改名 当然不用。品牌名的价值远大于一个分析面板的口径准确度,为了后者去动前者是本末倒置。这一节的意义只在于:如果你的品牌名恰好属于这一类,你要知道自己在读的是一个被系统性抬高的数字。 品牌防御还有别的战场,X平台的六位与Grok机制 (https://zhangwenbao.com/twitter-x-seo-tweet-search-engine-brand-defense-grok-mechanism.html)。 ## 可以做的一个补救 在自己这边建一份“容易撞车的说法”清单:你的品牌名在这个品类里最常见的日常用法是哪几种。有了这份清单,至少在解读异常波动的时候,能先排除掉一个可能。 小品牌怎么突围,AI搜索大品牌偏见的6条路径 (https://zhangwenbao.com/ai-search-big-brand-bias-small-brand-strategy.html)。 这份清单怎么攒?最省事的办法是把你的品牌名加上品类词,在普通搜索引擎里搜一遍,看前两页里有多少条结果跟你无关。无关的那些标题里出现的说法,就是撞车说法。 做完你会得到一个很直观的印象。有的品牌搜下来两页全是自己,那基本可以放心;有的品牌搜下来自己只占三分之一,剩下三分之二是各种日常用法和同名实体,那这个品牌看面板里的品牌词数据时,心里就该有个数了。 ## 子品牌和产品线名字也算 还有一类容易被忽略:主品牌名很独特,但产品线名字是常用词。用户问“某某牌的Pro系列”,检索词里可能只留下产品线名字。这时候匹配规则认不认得出这是你,就看它有没有把产品线名字也纳进品牌词表。 产品线该合该拆,几十个URL的取舍 (https://zhangwenbao.com/product-variant-seo-url-canonical-indexation-strategy.html)。 大概率没有。第三方工具通常只认一个主品牌名,不认你的产品线。所以产品线相关的检索,很可能整批落进非品牌那一堆——这会让你的非品牌数据看起来比实际好。 这一条对产品线名字取得比较通用的品牌影响最大。如果你的系列叫Air、Pro、Lite、Max这种,那基本没救,只能在心里记着这部分数据是混的。 ## 中文品牌名有没有这个问题 有,而且形态不太一样。中文没有词边界,字符串匹配更容易把品牌名匹配到一个更长的词里面去。反过来,中文品牌名用两三个常用字组合的情况非常普遍,撞车概率也不低。 国内这一侧怎么做,百度AI平台的本地化落地 (https://zhangwenbao.com/baidu-ai-search-geo-optimization-localized-guide.html)。 但对做外贸和独立站的团队来说,这一层通常影响不大,因为你的用户是在用英语提问。真正要小心的是那些中英文名都在用、而两个名字歧义度差很多的品牌——你在两个语言市场看到的这条线,可信度可能完全不同。 ## 引用数和引荐流量,为什么不能画在一张图上? 这是另一个很容易出事的地方,那篇报道里也点到了。 ## 它们量的是两件事 引用数量的是“你被拿去当材料用了多少次”,引荐流量量的是“有多少人因此点进来了”。中间隔着一个决定权不在你手上的环节:AI的回答有没有把话说完。 GEO流量默认追不到,过滤器加渠道分组这样补 (https://zhangwenbao.com/geo-ga4.html)。 ## 回答越完整,引用越多,点击越少 这是个很反直觉但完全成立的关系。一个页面被引用,说明它的内容被采信了;如果它的内容足够完整,AI就能直接把答案说清楚,用户没有理由再点进来。 只被引用不被推荐,5大破解法 (https://zhangwenbao.com/content-cited-brand-not-recommended.html)说的是相邻的问题。 所以内容做得越好,这两个数字越容易背道而驰。把它们画在一张双轴图上,看起来就像是“引用涨了但转化没跟上”,然后有人会得出“AI引用没用”的结论。 ## 那还要不要争取点击 要,但要用对办法。指望通过把内容写得不完整来逼用户点进来,是条死路——内容不完整,首先被牺牲的是被引用的机会,你连出现的资格都没了。 留住点击有别的招,配个AI摘要按钮涨691% (https://zhangwenbao.com/blog-ai-buttons-ux-geo-guide.html)。 可行的做法是把“完整的答案”和“只有到你这儿才拿得到的东西”分开。答案完整地给出去,同时在页面上留一个必须来现场才有价值的东西:一个可以输入自己数据的计算器、一份可下载的对照表、一个需要选参数的配置工具、一份定期更新的实时数据。 这类东西的共同点是它们没法被一段文字复述完。AI可以告诉用户“某某站上有一个可以算这个的工具”,但它替代不了这个工具本身。这才是AI时代还能留住点击的那部分内容。 ## 反过来说,哪些内容注定只能收获引用 纯知识型的、结论明确的、没有交互的内容,比如概念解释、流程说明、标准解读。这类内容做得越好,越会被完整复述,点击率越低。 AI爱引哪种内容,7.5万条答案的实证拆解 (https://zhangwenbao.com/ai-search-citation-content-types-geo-strategy.html)。 这不是说不该做。它们是你被引用的基础,是让模型认识你的那一层,只是不该拿点击率去考核它们。给这类内容配的指标应该是引用数和被引用的稳定性,不是流量。 一个团队如果所有内容都用同一套指标考核,最后一定会砍掉这一层,然后发现自己在AI回答里慢慢消失了。 ## 正确的读法 把引用当成可见度指标,把引荐流量当成转化指标,两者分开看,各自跟自己的历史比。想看它们的关系,看的应该是比值的变化趋势,而不是两条绝对值曲线的相对位置。 排名和引用怎么兼得,双线执行框架 (https://zhangwenbao.com/google-ranking-vs-ai-citation-seo-geo-guide.html)。 ## 还有一层采集口径的问题 引荐流量能不能被正确归因,取决于你的分析工具认不认识那些AI入口的来源标识。国内的几个入口尤其容易漏,这跟拆品牌词是两个独立的问题,但它们经常一起坏。 渠道分组这一层,GA4默认渠道组全指南 (https://zhangwenbao.com/ga4-default-channel-grouping-complete-guide.html)得先弄明白。 ## 被引用的页面类型,决定了这个比值 这里还有一层结构:不同类型的页面,引用转点击的比例天差地别。一篇把某个问题彻底讲完的长文,引用多点击少;一个价格页、一个规格对比表、一个需要交互的工具页,引用少但点击率高得多。 页面形态影响很大,7种结构化内容格式 (https://zhangwenbao.com/optimize-content-structure-ai-citations-2026.html)。 所以这个比值在很大程度上反映的是你的内容结构,而不是你的内容质量。一个团队从写长文转向做工具页,这个比值会明显上升,但不代表内容变好了,只代表内容换了一种形态。 看这个比值的时候,最好按被引用页面的类型分开算。分不开的话,至少在内容形态发生转变的月份打个断点。 ## 一个简单的自检 拉出最近三个月的引用数和AI引荐流量,算月度比值。如果这个比值稳定,说明两个采集口径都正常;如果某个月比值突变,先怀疑采集,再怀疑内容。 三种可见性策略,哪种能提升40% (https://zhangwenbao.com/geo-visibility-optimization-strategies.html)。 为什么先怀疑采集?因为采集口径是二元的——要么认得出这个来源,要么认不出,一变就是断崖。而内容效果是渐变的,很少在一个月里翻倍或者腰斩。断崖形状的变化,几乎总是口径问题。 ## 还有一个更基础的检查 确认你的分析工具到底把哪些来源算进了AI引荐。这份名单各家不一样,而且一直在变。新的AI入口冒出来的时候,它带来的流量可能被归进直接访问,或者被归进一个你根本没在看的来源分组。 多个数据源怎么打通,GA4关联三方的逐项操作 (https://zhangwenbao.com/ga4-bigquery-google-ads-search-console.html)。 检查方法很土:找一个AI入口,自己点进自己的站,然后去实时报表里看这一次访问被算到了哪。三分钟,能查出一整类归因黑洞。这件事值得每个季度做一次,因为入口列表一直在变。 ## 权威占比这个指标该怎么读才不至于自我安慰? 面板里那个权威占比,是这次更新里最容易被误读的一个。 ## 它是个相对数 权威占比的分母是这一类检索里被引用的所有来源,分子是你。它衡量的是你在这个话题上的相对份额,不是绝对存在感。 相对数的分母有多要命,前1%是400家里的4家还是51家 (https://zhangwenbao.com/industry-ranking-top-1-percent-denominator-slicing.html)。 ## 相对数会往两个方向骗人 往好的方向骗:如果这个话题整体被检索的次数在下降,被引用的来源也少了,你的占比会自动上升,看起来像在变强。 同样是分母问题,92%只覆盖了7.4%的买家 (https://zhangwenbao.com/satisfaction-survey-denominator-gates.html)。 往坏的方向骗:如果这个话题突然变热,涌进来一批新来源,你的占比会下降,但你的绝对引用数可能还涨了。相对数和绝对数背离的时候,通常是绝对数在讲真话。 ## 所以它必须和引用数一起看 引用数 | 权威占比 | 大概率的解释 | 涨 | 涨 | 真的在变强 | 涨 | 跌 | 话题变热了,别人涨得比你快 | 跌 | 涨 | 话题在降温,别高兴太早 | 跌 | 跌 | 要查了 | 9大策略哪个真管用,效果实测排名 (https://zhangwenbao.com/geo-optimization-strategies-ranking.html)。 ## 非品牌那一侧的占比更值得盯 品牌检索里你的占比天然就高——那条检索词里都带着你的名字了。这个数常年在高位,波动也小,看它意义不大。 中小站怎么抢那几个位,9种不被剃光的策略 (https://zhangwenbao.com/geo-small-website-visibility-boost.html)。 非品牌那一侧才是真战场:在一条完全不提品牌的品类查询里,你能不能挤进被引用的那几个来源。这个数从个位数涨到两位数,比品牌那一侧从八十涨到九十有价值得多。 ## 一个容易被忽略的分母陷阱 面板给的占比只覆盖它能观测到的那些AI场景,不是全网。所以两个不同工具算出来的占比不可比,同一个工具在不同时期扩了观测范围之后,前后也不可比。 跨年数据能不能直接比,一条趋势线上有三处口径变更 (https://zhangwenbao.com/trend-line-break-in-series-comparability.html)。 这个陷阱的隐蔽之处在于,扩观测范围这件事通常不会大张旗鼓地公告。产品那边加了一个新的AI场景进来,对他们是功能增强;对你是分母突然变了,而曲线上只会显示成一次下跌。 凡是分母不在你手上的指标,它的历史曲线都要当成一段一段的,不是一条连续的线。遇到无法解释的整体性跳变,先去看产品更新日志,比自己在数据里找原因快得多。 ## 怎么给这个指标配一个更稳的搭档 配一个绝对数。引用数的绝对值虽然也受观测范围影响,但它至少是单向的:范围扩大,绝对数只会涨不会跌。所以当占比跌而绝对数涨的时候,基本可以判定是分母变了。 该信什么不该信什么,3000条数据揭开的认知差 (https://zhangwenbao.com/ai-search-citation-optimization-guide.html)。 再配一个更土的:被引用的具体页面清单。清单里的页面数和构成,比任何百分比都稳定。某个月清单里突然多出五个从没被引用过的页面,这个信息量比占比涨了两个点大得多,而且它直接指向你该去看什么。 ## 横向比较为什么几乎总是错的 因为要比,两边的偏移量得一样。而偏移量取决于品牌名的歧义度、品类的检索热度、以及各自被观测到的场景覆盖。这三样没有一样是对齐的。 跨工具比数据的前提,三条路的横评 (https://zhangwenbao.com/rank-tracker-tools-comparison-selection-guide.html)说过。 我见过团队拿自己的权威占比去跟一个竞品比,得出“我们在这个话题上落后十五个点”的结论。而那个竞品的品牌名是个纯造词,它的品牌检索识别得干干净净,非品牌那侧自然显得干净——这十五个点里,有多少是真差距,没有人算得出来。 ## 一个能替代横向比较的做法 既然占比不能比,那怎么知道自己在这个品类里排第几?答案是别用占比,用那份被引用来源的清单。 共识层那六个信号,90天实战指南 (https://zhangwenbao.com/seo-consensus-layer-ai-search.html)也是靠来源清单在看。 做法是:跑一组固定的非品牌问题,把每次回答里被引用的所有来源都记下来,累计几个月。你会得到一张这个话题上的来源频次表——谁反复出现、谁偶尔出现、谁从来不出现。这张表比任何百分比都直观,而且它的口径完全在你手上。 这张表还有一个额外好处:它会告诉你竞争对手是谁。很多团队以为自己的对手是那几个同行品牌,跑完这个测量才发现,在AI回答里反复出现的是三个评测站和一个论坛。那才是真正在跟你抢那几个引用位的对象。 ## 那什么时候可以横向比 只有一种情况:两边的品牌名歧义度接近,而且你能确认用的是同一个观测口径。实务上这个条件几乎不会满足,所以我的建议很简单——这个指标只跟自己的历史比,别的一律不比。 跨平台指标怎么对齐,3平台300站实测 (https://zhangwenbao.com/seo-kpi-guide.html)给了参照。 ## 那六个建议追踪的指标里,哪几个是能行动的? 那篇报道给了一份六项指标的清单:品牌引用数、品牌权威占比、非品牌引用数、非品牌权威占比、AI引荐流量、AI引荐带来的转化。 ## 先按能不能行动分个类 指标 | 能不能直接行动 | 动了之后多久见效 | 品牌引用数 | 间接,靠品牌动作 | 慢,且难归因 | 品牌权威占比 | 基本不能 | — | 非品牌引用数 | 能,靠内容覆盖 | 数周到数月 | 非品牌权威占比 | 能,靠内容质量与结构 | 数周到数月 | AI引荐流量 | 能,靠留出点击的理由 | 较快 | AI引荐转化 | 能,靠落地页 | 最快 | 团队怎么分工,SEO团队的4层落地框架 (https://zhangwenbao.com/geo-team-deployment-four-layer-framework.html)。 ## 中间那两个才是内容团队的战场 非品牌引用数和非品牌权威占比,是这六个里唯一能靠写东西直接推动的。它们对应的动作也很具体:把某个品类问题回答得比别人更完整、更可核查、结构更清楚。 怎么写才容易被引,5维度让模型主动引用 (https://zhangwenbao.com/ai-search-content-writing-machine-readable-playbook.html)。 ## 最后两个是产品和页面的事 引荐流量和转化,取决于用户看完AI的回答之后还有没有理由点进来,以及点进来之后落在什么页面上。这两个数不好看,多半不是内容的问题。 落地页那一侧,30个A/B测试方案 (https://zhangwenbao.com/ab-testing-ctr-conversion-optimization.html)可以挑着做。 ## 前两个只适合当背景板 品牌那两个指标,更适合放在月度回顾里当背景,用来解释别的数据的波动,不适合当作某个团队的考核项。因为推动它的动作大部分不在这个团队手里。 汇报口径怎么定,6步翻译成业务语言 (https://zhangwenbao.com/cmo-seo-report-business-outcome-six-step.html)。 ## 非品牌引用数具体怎么推 拆开看,能推它的动作只有三类。第一类是覆盖:这个品类里的高频问题,你有没有一个页面在回答。没有页面,谈不上被引用。这是最基础也最容易被跳过的一步,因为它枯燥——要把问题列出来,逐条对着自己的内容打勾。 事实密度怎么提,7招实战 (https://zhangwenbao.com/boost-content-fact-density-ai-citations-2026.html)对应的正是可核查性那一类。 第二类是可核查性:你的回答里有没有具体的数字、来源、可验证的事实。模型在挑材料的时候,倾向于选那些说得具体、能对上的。一篇通篇都是“很重要”“需要注意”的文章,几乎不会被拿去当材料。 第三类是结构:标题层级清不清楚、结论在不在段首、有没有可以直接摘出来的句子。这一类的收益最快,因为它不需要重写内容,只需要重排。 三类里,第一类决定天花板,第二类决定命中率,第三类决定摘取成本。顺序不能反:没覆盖的时候优化结构,是在给一个不存在的页面排版。 怎么知道自己卡在哪一类?看手工测量的结果。一次都没被引用,是覆盖问题;偶尔被引用但很不稳定,是可核查性问题;稳定被引用但引的总是同一段,是结构问题——说明只有那一段容易摘。 三类的投入产出也不一样。补覆盖最贵,因为要写新内容;补可核查性中等,因为要去找数据和来源;补结构最便宜,重排一下标题和段落就行。所以实际操作上,通常是先把已有内容的结构过一遍,同时排期去补覆盖,可核查性夹在中间慢慢改。 ## 见效周期为什么这么长 因为中间隔着抓取、索引、以及模型选材这三层,每一层都有自己的延迟。一篇新内容从发布到能被AI引用,快的两三周,慢的两三个月,而且这个延迟本身还随站点权重变化。 新鲜度和收录速度,5条实战法则 (https://zhangwenbao.com/maintain-content-freshness-fast-indexing-ai-citations-2026.html)影响的就是这个延迟。 这意味着按月看这条线基本看不出因果,得按季度看趋势。而按季度看,一年只有四个观察点,这就是为什么这件事特别容易在中途被砍掉。提前把这个周期说清楚,比事后解释有用得多。 ## 如果只能盯一个 盯非品牌引用数的绝对值,按周记,连续记三个月。它是这六个里噪声最小、和内容动作关联最直接的一个。 国内做下来什么感受,5个月11个项目的复盘 (https://zhangwenbao.com/geo-china-5-months-real-pitfalls-actionable-routes.html)。 为什么是绝对值不是占比:占比的分母不在你手上;为什么是按周不是按天:按天的噪声太大,一次模型抖动就能让你看半天;为什么是三个月:少于三个月看不出趋势,只能看出波动。 这三个选择合起来的意思是:用最粗的粒度,看最长的周期,盯最直接的那个数。在一个口径不透明的度量里,粗糙反而是一种保护。 ## 想把这条线画准,你得自己补哪一列? 前面说了这么多限制,落到操作上,其实是补一列的事。 ## 缺的是把两头接起来的那一列 面板给了你检索词和引用数,但没给你用户的原始提问;给了你品牌标签,但没给你判定依据。缺的这一列,是任何一次归因都绕不开的连接列。 归因缺列怎么补,8类UA与5种归因方法 (https://zhangwenbao.com/ai-agent-crawler-log-decoding-8-ua-traffic-attribution.html)。 ## 能补上的三种办法 第一种最直接:如果你自己的站上有AI客服或者站内搜索,那里的用户原始提问是你自己的数据。把这批提问和面板里的检索词做个对照,能大致看出改写的方向。 站内搜索那一侧的数据,查无结果和查得到长得一模一样 (https://zhangwenbao.com/site-search-result-page-landing-collapse.html)。 第二种是造对照:拿一组你确定不含品牌名的问题,定期在几个AI入口里问一遍,记录有没有引用到你。这是主动测量,样本小但口径完全在你手上。 第三种最省事,也最容易被跳过:把你的品牌名在这个品类里的常见日常用法列出来,作为一张固定的解读附注。每次看这两个数字之前先看一眼这张表。 ## 那张附注表长什么样 列 | 内容 | 用途 | 品牌名 | 你在面板里被匹配的那个字符串 | 基准 | 词性 | 造词、普通词、常用词、品类词 | 决定打几折 | 常见撞车说法 | 这个词在本品类里的日常用法 | 解释异常波动 | 同名实体 | 还有谁叫这个名字 | 排除外部干扰 | 可信度 | 高、中、低 | 决定这个数进不进汇报 | 一张能交接的表怎么写,可交接的生产规范 (https://zhangwenbao.com/content-brief-production-spec-engineering.html)。 ## 第二列怎么填 不用像我这样跑词表,查一次字典就行:你的品牌名在英语词典里查得到吗,查得到的话是不是日常会用的词。查不到就是造词,可信度高;查得到但生僻,可信度中;日常用词,可信度低。 跨语言的词该怎么判,跨文化语义与查询语言切换 (https://zhangwenbao.com/multilingual-keyword-research-cross-cultural-localization-query-language.html)。 ## 第五列决定了这个数字的去向 可信度低的品牌,这两个数字适合放在内部看趋势,不适合写进对外的报告或者拿去跟同行比。不是因为它假,是因为它带着一个只有你知道大小的偏移量。 分级这件事,三平台分级诊断 (https://zhangwenbao.com/webmaster-alert-triage-gsc-bing-baidu-three-platform.html)是同一个思路。 这张表最大的作用其实是省掉重复讨论。每次有人问“这个数准不准”,把表推过去看一眼就行,不用再从头解释一遍机制。一份能替你回答重复问题的文档,价值远大于它的信息量本身。 ## 第一种办法的细节 拿站内搜索和AI客服的原始提问去对照,做法是这样:导出最近一个月的用户提问,人工标一下每一条有没有提到品牌名,算出一个“用户主动提品牌的比例”。 自有问答数据的用法,帮助中心的索引控制与AI引用 (https://zhangwenbao.com/knowledge-base-help-center-seo-indexing-ai-citation.html)。 然后拿这个比例,跟面板里品牌检索占全部检索的比例比。两个数应该在同一个量级——如果面板那个数明显更高,说明模型倾向于把品牌名带进检索词,或者你的品牌名被误匹配了;明显更低,说明模型倾向于把品牌问题改写成品类问题。 这个对照的价值不在于算出一个修正系数,在于告诉你偏差往哪个方向走。知道方向,很多解读就不会反过来。 ## 第二种办法为什么值得花那半小时 因为它是唯一一个口径完全在你手上的数据源。样本小是真的,随机性大也是真的,但它有一个所有第三方数据都没有的性质:你知道每一条数据是怎么来的。 自己造对照怎么造,加上FAQ引用涨撤掉又掉回来 (https://zhangwenbao.com/ai-citation-split-test-causation-proof.html)。 在一个所有指标口径都不透明的领域里,一个小而透明的数据源,比一个大而不透明的更有用。它的作用不是替代面板,是给面板的结论提供一个独立的印证。 ## 三种办法的成本对比 办法 | 一次性成本 | 每月成本 | 能回答什么 | 站内提问对照 | 半天 | 一小时 | 偏差的方向 | 手工对照测量 | 半小时 | 半小时 | 非品牌场景的真实存在感 | 品牌名附注表 | 十分钟 | 零 | 这个数该打几折 | 成本差异能有多大,140倍成本差下的方案选择 (https://zhangwenbao.com/geo-optimization-cost-autogeo-api-mini.html)。 如果只做一件,做第三件。十分钟,一次做完管一年,而且它是另外两件的前提——不知道自己的品牌名有多歧义,做再多测量也不知道该怎么解读。 ## 有没有一次今天就能做的对照测量? 有,而且不需要任何工具。 ## 三十分钟的做法 准备十条问题:五条明确提到你的品牌名,五条只描述需求不提任何品牌。在两三个AI入口里各问一遍,记录三件事:有没有引用到你的站、引用的是哪一页、回答里有没有出现你的品牌名。 小样本实测长什么样,Perplexity实测的3种方法 (https://zhangwenbao.com/geo-perplexity-real-world-validation.html)。 ## 这个测量能回答什么 第一,那五条不提品牌的问题里,你被引用了几次。这是你在非品牌场景下真实存在感的一个快照。 品牌推荐机制怎么验,Bing排名68次实测 (https://zhangwenbao.com/bing-ranking-chatgpt-brand-visibility.html)。 第二,被引用的是哪几个页面。多数人会发现引用集中在两三个页面上,而这几个页面往往不是你最花力气的那几个。 第三,也是最有意思的一条:那五条提到品牌的问题,回答里引用你自己站的比例是多少。如果低于一半,说明在关于你自己的问题上,别人的说法比你自己的更容易被采信。 这一条我第一次做的时候有点意外。凭直觉会以为,问一个品牌的事,官网肯定是第一来源。实际跑下来往往不是——模型更倾向于引用第三方的说法,因为第三方看起来更中立,而官网的表述天然带着立场。 这个倾向没法改变,但可以利用:越是那些不适合自夸的信息,官网越应该写得明确、具体、可核对。规格参数、材质来源、政策条款、已知的限制,这几类内容没有立场问题,官网写清楚了就是最权威的来源。 这一条的诊断价值特别高,因为它指向一个很具体的问题:关于你自己的事实,你的官网上到底有没有写清楚。退换货政策、材质来源、保修条款、和竞品的差别,这几类信息如果官网上没有明确的一页,模型就只能去引评测站和论坛。 我遇到过一个做厨具的团队,测下来关于自家产品的问题里,只有三成引用了官网,其余全是几个评测站和一个论坛帖。而那个论坛帖里关于材质的说法,是三年前的旧版本。他们花了两周补了一页规格详情,两个月后这个比例上到了六成。 这类修复的性价比是这套测量里最高的,因为它不需要跟任何人竞争——关于你自己的事实,本来就该是你最有权威的地方,只是你没写下来。 ## 还有一件顺手能做的事 把那五条非品牌问题的回答完整存下来,不只记有没有引用你。存三个月之后,把三份回答放一起读,你能看出这个话题上模型的说法在怎么变——哪些点被反复强调,哪些说法消失了,有没有新的考量维度出现。 三大引擎的偏好差别,AutoGEO论文的解读 (https://zhangwenbao.com/ai-search-engine-preferences-autogeo.html)。 这份材料对内容排期的价值,可能比引用数本身还大。它等于免费给你做了一次品类话语的变化追踪,而这件事以前要靠人工翻大量资料才能感觉到。 ## 怎么让它可重复 把这十条问题固定下来,每个月同一时间跑一遍,记在同一张表里。问题不变、时间点固定,是这个粗糙测量唯一的可比性来源。 可重复性最怕外部冲击,上线掉5%的问题出在那26天 (https://zhangwenbao.com/ab-test-field-period-external-shock.html)。 ## 它的局限也要说清楚 样本极小,而且有随机性,同一个问题问两次结果可能不同。所以它只能用来看大的方向变化,不能用来算百分比。它的价值不在精度,在于这是唯一一个你能完全控制口径的数据源。 小样本有多容易翻车,换一个主语答案差16个点 (https://zhangwenbao.com/survey-referent-asymmetry-self-versus-society.html)。 ## 那十条问题该怎么设计 五条品牌问题好设计,把品牌名加上不同的意图就行:产品怎么样、值不值这个价、和某个竞品比如何、退换货方便吗、有没有质量问题。这五条覆盖了用户在决策链上的不同位置。 问题要覆盖哪些意图,5种类型与对应内容策略 (https://zhangwenbao.com/search-intent-seo-guide.html)。 五条非品牌问题难一些,关键是不能带任何能定位到你的线索。不要写“适合出差的硬壳登机箱”如果你正好只做这一种;要写得像一个完全不知道你存在的人会问的那样。 一个实用的技巧:让不熟悉你业务的人来提这五个问题。自己写的问题总会不自觉地带上自家产品的特征词,这些词会把检索引向你,测出来的结果偏高。 ## 记录的时候别只记有没有 至少记四样:有没有引用到你、引用的是哪一页、回答正文里有没有提到你的品牌名、以及排在你前面的是谁。 被引的都是什么内容,81.5万条数据的答案 (https://zhangwenbao.com/chatgpt-citation-content-strategy.html)。 最后这一样最容易被跳过,也最有用。连续几个月记下来,你会得到一份这个话题上真实的来源竞争格局,而这个格局跟你在传统搜索结果里看到的往往不一样——有些常年霸榜的站在AI回答里根本不出现,而一些你没听过的小站反复被引。 ## 问的时候要注意的几件事 用无痕窗口或者退出登录,避免个性化影响结果。同一个入口的同一个问题,间隔几分钟问两次,看结果稳不稳定——不稳定的问题不适合放进长期观测集。 位置也会影响结果,ChatGPT能感知位置之后 (https://zhangwenbao.com/chatgpt-location-sharing-local-seo.html)。 还有一条容易忽略:别在问完之后点进自己的站。这会让这次访问出现在你的分析数据里,虽然量小,但如果每个月都做,久了会在数据里留下一条你自己制造的规律。 ## 跟面板数据怎么配合 面板数据量大但口径不透明,手工测量量小但口径完全透明。两者的作用是互相印证:面板说非品牌涨了,手工测量里也确实多引用了一次,这个结论才敢用。 两个数据源打架时,6场景选型与三源校准 (https://zhangwenbao.com/site-search-operator-vs-gsc-coverage-accuracy-decision.html)。 两边打架的时候怎么办?看方向而不是幅度。如果面板说涨、手工说跌,先别急着信任何一边,去查这个月有没有发生口径变化——模型更新、产品加了新观测场景、你自己改了页面结构,这三样任意一样发生,两边就可能各说各话。 一年做下来,你会慢慢知道这两个数据源各自在什么情况下更可信。这个经验没法从别人那里拿,只能自己攒。而攒它的唯一前提,是你从今天开始就把两边都记下来。 ## 这套东西长期该怎么盯,才不至于每个月重新解释一遍? 最后说落地节奏。 ## 三个层次分开记 第一层是面板的原始数字,按周抄下来,不加工。第二层是你自己的手工对照测量,按月做一次。第三层是那张品牌名附注表,做一次管一年。 自己搭报表也不难,用Claude Code做自定义报表 (https://zhangwenbao.com/claude-code-gsc-custom-seo-reports.html)。 ## 汇报的时候只讲第二层和变化 第一层的绝对值不适合汇报,因为它带着偏移量。适合汇报的是变化率,以及第二层测量里那些具体的、能讲出故事的引用案例。一个“我们在这类问题上被引用了”的具体例子,比一个百分比有说服力得多。 预算会上怎么讲,用商业语言把这笔钱说清楚 (https://zhangwenbao.com/seo-budget-planning-and-roi-model-for-leadership.html)。 ## 这三层各自记在哪 第一层记在一张最简单的表格里,一行一周,列是六个指标加一个备注。别用什么专门的看板工具,因为看板会随着工具更新自己改口径,而一张手抄的表不会。 定期任务挂cron上,备份与sitemap一条龙 (https://zhangwenbao.com/linux-cron-shell-independent-site-automation-ops-backup-sitemap-ssl.html)。 第二层记在另一张表里,一行一次测量,列是十条问题各自的结果。这张表会越来越宽,但它是整套东西里唯一能拿出来讲故事的材料。 第三层就一张纸,五列,做完贴在前两张表旁边。它的作用是每次有人来看数据时,第一眼就知道该打几折。 ## 什么时候该重新校准 三种情况:模型有大版本更新之后,你自己改了品牌命名或者加了子品牌之后,以及品类里出现了一个跟你名字接近的新玩家之后。这三种情况下,之前的历史数据都要打上一个断点。 上游一变全得重来,分层索引那套机制 (https://zhangwenbao.com/google-index-tiers-base-zeppelin-landfill.html)也是一样。 ## 断点这件事要写下来 写在数据表里,不要只记在脑子里。半年之后没有人记得那条曲线为什么在某个月跳了一下,而一个没人能解释的跳变,最后总会被解释成某个人的功劳或者过失。 工具坏过一次就知道,5步SOP与多源替代 (https://zhangwenbao.com/gsc-links-report-outage-2026-may-rollback-fix-monitoring-strategy.html)有多重要。 ## 谁来看这三层 第一层是执行同学抄数,五分钟的事,不需要判断。第二层需要一个懂业务的人来做,因为设计问题和解读引用都要判断力。第三层是负责人做一次,之后基本不用动。 跨职能分工怎么定,后端协作的7个动作点 (https://zhangwenbao.com/backend-engineer-seo-collaboration-7-actions-canonical-sitemap-redirect.html)。 这个分工重要的地方在于,第二层不能外包给不懂业务的人。那五条非品牌问题设计得好不好,直接决定这个测量有没有意义,而判断它好不好需要知道用户真实是怎么想的。 ## 这套东西跑起来大概要花多少时间 把三层的工作量摊开算一遍,心里会踏实很多。第一层每周抄六个数字,五分钟;一个月四次,二十分钟。第二层每月做一次十条问题的测量,连记录带整理半小时到四十分钟。第三层第一次做十分钟,之后基本不动。 加起来一个月不到一小时。这个成本低到几乎不需要立项,也正因为低,它才有可能被坚持下来。我见过太多监测方案死在第三个月,不是因为没用,是因为每次要花两小时。 如果你想再省一点,第一层可以改成每两周抄一次。粒度粗了,但趋势还在。宁可粒度粗一点也要坚持记,比精细地记三个月然后断掉强得多。一段连续但粗糙的数据,价值远高于一段精细但断裂的数据。 ## 三个月之后大概能看到什么 如果你在这三个月里认真做了内容,最先动的通常是手工测量那一侧——某个月你会发现,原来一条都引不到的那五个非品牌问题里,开始有一两条引到你了。这个信号比面板早,因为样本小反而敏感。 面板那一侧会滞后一到两个月,而且第一次变化多半淹没在噪声里。所以别在第一个月就去面板里找证据,那里面还什么都没有。 三个月之后你会有的第二样东西,是那份来源频次表。到时候你大概能说出这个话题上反复出现的五到八个来源分别是谁,其中有几个是你之前完全没注意过的。这份认知本身就值那几个小时。 ## 最容易半途而废的两个坎 第一个坎在第二个月:数据看起来完全没动,做的人会开始怀疑这件事有没有意义。解法是提前把见效周期写进计划里——不是事后解释,是开始之前就说清楚“前两个月看不到变化是正常的”。 第二个坎在第四五个月:数据动了,但动得没有预期大,于是开始有人提议加大投入或者干脆换个方向。这时候最该做的是回头看那份来源频次表,看看被你挤掉的是谁、还没挤掉的是谁。有了具体的对手,讨论才有落点,否则就是在一个百分比上来回争论。 ## 什么样的波动值得开会 非品牌引用数连续两个月同向变化超过三成,值得看一看;权威占比和引用数背离超过两个月,值得查;手工测量里连续两次一条都没引用到,那不是波动,是问题。 波动还是真掉了,怎么分辨 (https://zhangwenbao.com/ranking-fluctuation-normal-vs-real-drop.html)是同一类判断。 其余的都可以在周报里一行带过。给波动定一个门槛,是为了让不到门槛的波动可以被合法地忽略——没有这个门槛,每一次上下都会有人来问,然后每一次都要临时编一个解释。 ## 存档的最小要求 三样东西必须留:每周抄下来的原始数字、每月手工测量的那张记录表、以及所有断点的说明。前两样是数据,第三样是数据的说明书。 要挑性价比高的先做,11个速赢清单 (https://zhangwenbao.com/seo-quick-wins-prioritized-checklist.html)可以参考。 断点说明是最容易漏也最要命的。一条没有说明的曲线,半年后只剩下形状,而形状是可以被任意解释的。我的习惯是断点说明写在数据表的同一行里,不写在另一个文档里,因为另一个文档一定会丢。 ## 一年之后你会有什么 五十二周的原始数字、十二次手工测量、一份品牌名附注表,以及若干条断点说明。这套东西的价值不在任何单个数字上,在于当有人问“我们在AI里的存在感是涨了还是跌了”的时候,你能给一个带条件、带口径、带证据的回答。 一个人也能跑这套,5步搭精准流量系统 (https://zhangwenbao.com/one-person-company-seo-geo-customer-acquisition.html)。 在一个所有指标都不透明的领域里,能说清楚自己在测什么,本身就是一种优势。大部分人给不出这个回答,不是因为没数据,是因为从来没记过口径。 ## 最后回到那条线本身 品牌词和非品牌词的拆分,是一个非常值得做的拆分,Clarity这次更新的方向完全正确。它的问题不在于要不要拆,而在于拆的依据是一条你看不见的字符串,而匹配它的钥匙是一个你十年前起的名字。 整体怎么落地,从AI搜索到结构化数据的实施策略 (https://zhangwenbao.com/geo-strategy.html)。 知道这一点之后,这两个数字反而更好用了:你不再指望它精确,只指望它稳定。而稳定的偏差,是可以一直用下去的。 这个转变听起来像是降低要求,其实是提高了要求——对精确的追求可以靠工具满足,对稳定的追求只能靠自己维护口径。前者是买来的,后者是攒出来的。 ## 把这一整套压缩成三句话 第一句:你看到的那条检索词不是用户问的话,中间有一次你管不着的改写。第二句:品牌与非品牌的分界靠字符串匹配,而每六个DTC品牌里就有一个的名字是英语常用词。第三句:所以看变化不看绝对值,跟自己比不跟同行比。 这几条路的关系,是两条路还是同一条 (https://zhangwenbao.com/seo-aeo-geo-aao-four-optimization-paths-collaboration.html)梳理过。 这三句话背后是两层机制加一批数据,但真到日常使用的时候,记住这三句就够了。一个能被压缩成三句话的结论,才有机会在半年后还被人记得。 ## 最后留一个提醒 这批数据是2026年8月的一次快照,样本是169个偏欧美的DTC与电商品牌,方法是词表匹配。换一批样本——比如换成中国出海品牌为主,或者换成B2B软件公司——常用词品牌名的比例会明显不同。 更长期的打法,5维度深层策略 (https://zhangwenbao.com/ai-search-visibility-deep-seo-strategy.html)。 所以别把16% 这个数字当成一个行业常数记住。该记住的是那个方法:查一次自己的品牌名在词典里是什么,然后决定这两条线该看得多重。方法能用很久,数字只代表这一次。 ## 常见问题解答 ## Clarity里的品牌词和非品牌词,是按用户提问分的吗? 不是。分的是模型自己生成的检索查询,不是用户在对话框里打的那句话。中间隔着一次由模型完成的改写,这次改写既看不到也管不了。这是解读这两个数字时最需要记住的一条。 还没装的话,Shopify怎么装Clarity (https://zhangwenbao.com/shopify-microsoft-clarity.html)有两种方法。 ## 我的品牌名是个英语常用词,这两个数字还能用吗? 能用,但用法要改:看变化不看绝对值,跟自己比不跟同行比。你的品牌名带来的偏差在时间序列上是个稳定的常数,纵向比较时会被抵消掉,横向比较时不会。 五维调参这套,像调均衡器一样精控 (https://zhangwenbao.com/geo-five-dimensions-content-optimization.html)也讲究看变化。 ## 引用数涨了但引荐流量没涨,是不是白做了? 多半不是。内容越完整,AI越容易把答案直接说清楚,用户点进来的理由就越少。这两个数字背离恰恰可能说明内容被采信了。判断方法是看比值的趋势,而不是两条绝对值曲线谁在上面。 从被引到被推荐,子架构加品牌优化的全清单 (https://zhangwenbao.com/ai-search-geo-from-cited-to-recommended-7-rules.html)。 ## 权威占比涨了就一定是好事吗? 不一定。它是相对数,分母是这一类检索里被引用的所有来源。如果这个话题整体降温、来源变少,你的占比会自动上升。所以它必须和引用数的绝对值一起看,两个都涨才是真的在变强。 引用和排名会脱钩,2026 GEO时代的实战指南 (https://zhangwenbao.com/ai-overview-citations-diverge-rankings-bing-geo-2026.html)。 ## 该盯品牌那条线还是非品牌那条线? 非品牌那条。品牌检索里你的占比天然就高,波动小,信息量少。非品牌是真正的战场:在一条完全不提品牌的品类查询里能不能挤进被引用的来源,这个数从个位数涨到两位数,价值远大于品牌那侧的小幅波动。 盘子有多大,8家龙头怎么抢AI流量 (https://zhangwenbao.com/geo-concept-ai-traffic-2000billion-leaders.html)。 ## 手工对照测量的结果和面板对不上,该信谁? 两边都不急着信,先查这个月有没有口径变化:模型有没有大版本更新、工具有没有加新的观测场景、你自己有没有改过页面结构。这三样任意一样发生,两边说法不同都是正常的。都没发生的话,优先信手工测量的方向判断,因为它的口径你完全清楚。 点了不等于复核,验证修复到底在验什么 (https://zhangwenbao.com/gsc-validate-fix-mechanism.html)也是这类误读。 ## 被引用的页面总是那两三个,正常吗? 非常正常,几乎所有站都是这样。值得注意的是这两三个页面往往不是你最花力气的那几个。与其纠结别的页面为什么不被引,不如先看看这两三个有什么共同点——通常是结论明确、有具体数字、结构清楚。把这些特征复制到别的页面上,比重写内容有效得多。 做几个能被反复引的入口页,Hub Page怎么做 (https://zhangwenbao.com/hub-page-generative-search-ai-citation-guide.html)。 ## 这个面板的数据能代表全部AI平台吗? 不能。它覆盖的是它能观测到的那些场景,不是全网。所以两个不同工具算出来的占比不可比,同一个工具扩了观测范围之后,前后的数据也要打断点。 多平台怎么分开布局,4大模型的差异化打法 (https://zhangwenbao.com/multi-platform-distribution-ecosystem-ai-citations-2026.html)。 ## 换个不那么常见的品牌名会不会更好? 为了一个分析面板的口径去改品牌名,是本末倒置。品牌名的价值远大于数据准确度。这件事的意义只在于让你知道自己读的是一个带偏移量的数字,而不是让你去改名。 名字关系到实体能不能被认出来,实体关联分析器怎么用 (https://zhangwenbao.com/entity-analyzer-knowledge-graph-geo-guide.html)。 ## 我的品牌名是造词,是不是完全不用管这些? 品牌名歧义这一层可以不用管,但改写那一层还在。用户提到你的品牌、模型改写检索词时没带上品牌名,这种情况跟名字独不独特无关。所以造词品牌的品牌词数据是偏低的,只是不会偏高。 权威信号怎么强化,从12%到67%的实战 (https://zhangwenbao.com/strengthen-authority-eeat-signals-ai-citations-2026.html)。 ## 子品牌和产品线名字会被算进品牌词吗? 大概率不会。第三方工具通常只认一个主品牌名。如果你的产品线名字取得比较通用,那这部分检索会整批落进非品牌那一堆,让非品牌数据看起来比实际好。这一条在做产品线复盘的时候尤其容易出错。 产品线对应的旅程阶段,6阶段的关键词布局 (https://zhangwenbao.com/ecommerce-seo-customer-journey-mapping.html)。 ## 这两个数字该不该进团队考核? 非品牌引用数可以,前提是说清楚见效周期在数周到数月,考核周期不能短于一个季度。品牌那两个不建议,因为推动它的动作大部分不在内容团队手里,考核它等于让一个团队为另一个团队的动作负责。 团队协作怎么排,实体权威的四阶段框架 (https://zhangwenbao.com/entity-authority-ai-search-seo-content-collaboration.html)。 ## 如果我只有半小时,先做哪一件? 先查一次你的品牌名在英语词典里是什么,然后把它在你这个品类里最常见的日常用法列三条。这两件事加起来不到十分钟,却决定了后面所有数字该打几折。剩下二十分钟,用来做一次十条问题的手工对照测量的第一次记录。 想要一条完整路径,GEO四步实战框架 (https://zhangwenbao.com/geo-four-step-strategy-framework.html)。 ## 权威参考资料 ## AI流量来源漏掉九成:日志里带人来的是夸克和通义 - URL:https://zhangwenbao.com/ai-referral-source-domestic-entries-gap.html - 分类:AI监控与数据 - 发布:2026-08-09 | 更新:2026-08-09 - 摘要:后台那个直接访问不是一个渠道,是一个兜底的桶。把它拆开之后会发现,按英文教程配出来的AI来源规则,在中文站上只认得出十分之一的入口。 - 关键词:AI搜索,流量分析,日志分析,归因 > **TLDR**:摘要:把51天、230万条访问日志按来源字段拆开之后,真正能看出来路的浏览器请求只有4.92%,八成半落进了没有来源那一栏。而在能看出来路的那部分里,来自AI入口的575次访问里有527次来自夸克、通义、豆包这些国内产品,按英文教程那份清单去数,你只能数到48次。 > 摘要:把51天、230万条访问日志按来源字段拆开之后,真正能看出来路的浏览器请求只有4.92%,八成半落进了没有来源那一栏。而在能看出来路的那部分里,来自AI入口的575次访问里有527次来自夸克、通义、豆包这些国内产品,按英文教程那份清单去数,你只能数到48次。 先说结论:如果你现在打开分析后台,看那个叫直接访问或者直接流量的渠道,它不是一个渠道。它是一个桶,凡是没能带上来路标记的访问,全都掉进去。 这个桶有多大?在保哥这个站51天的日志里,浏览器发出的请求一共1814230次,其中1533721次的来源字段是一个横杠,占84.54%。剩下的里面,191212次来自站内自己的页面跳转,89297次带着外站来路,占全部的4.92%。 也就是说,你能看清来路的访问,二十个里只有一个。其余十九个在报表里长得一模一样,而它们的真实来路可能是搜索、可能是社交、可能是某个AI对话框、可能是有人把网址发在了群里。这些完全不同的事,在你的报表里坍成了同一个词。 ## 你后台那个直接访问,到底装了些什么? 把这个桶拆开是有意义的,因为它决定了你接下来所有的判断。 ## 先看这张全景表 来源类型 | 51天请求数 | 占浏览器请求 | 来源字段为空 | 1533721 | 84.54% | 站内跳转 | 191212 | 10.54% | 外站带来路 | 89297 | 4.92% | 想知道分析工具把访问分进哪个渠道靠的是什么条件,默认渠道分组那份完整说明 (https://zhangwenbao.com/ga4-default-channel-grouping-complete-guide.html)值得先读一遍,它决定了你后面所有报表的读法。 ## 来源为空的六种真实成因 成因 | 典型场景 | 能不能补救 | 直接输入或书签 | 老读者、老客户 | 不需要补救,这是真的直接 | 应用内打开 | 聊天工具、笔记应用里点链接 | 难,多数应用不传来路 | 协议降级 | 从加密页面跳到非加密页面 | 全站上加密之后基本消失 | 来源策略限制 | 对方站点设了严格的来源策略 | 不由你决定 | 客户端主动剥离 | 部分AI产品与隐私浏览器 | 只能靠别的办法识别 | 脚本没跑起来 | 统计代码被拦、页面没加载完 | 能,属于自己的问题 | 直接流量这个词在SEO圈还有另一段公案,它到底算不算排名因子 (https://zhangwenbao.com/direct-traffic-not-ranking-factor.html)那篇把相关文件翻出来讲过一次。 顺带说一句,分析工具怎么把一次访问归进某个渠道,是有明确判定条件的,官方那份默认渠道分组说明 (https://support.google.com/analytics/answer/9756891)把每一档的条件都写了出来。读一遍你会发现,直接这一档的定义本身就是兜底:不符合其他任何条件的,都归这里。 六种成因里,只有第一种和最后一种是你能处理的。剩下四种意味着,无论你把埋点做得多完美,那个桶都不会明显变小。这不是技术水平问题,是这条链路本身的设计就没打算告诉你。 ## 这个桶是怎么一年年变大的 十几年前,来源字段基本是可靠的:从哪个页面点过来,浏览器就老老实实带上哪个地址。后来发生了几件事,一件比一件影响大。 当点击本身都在减少,衡量方式也得跟着换,零点击时代品牌影响力怎么衡量 (https://zhangwenbao.com/zero-click-search-brand-influence-measurement.html)给了几条替代路径。 变化 | 对来源字段的影响 | 全站加密普及 | 从加密页跳到非加密页时来源被抹掉 | 搜索引擎隐藏查询词 | 还能看到来自搜索,但看不到搜的什么 | 浏览器默认收紧来源策略 | 跨站时只传域名,不传完整路径 | 移动应用成为主要入口 | 应用内打开的链接多数不带来源 | 对话式产品兴起 | 各家处理方式不一,很多干脆不传 | 五件事的方向完全一致:能看到的越来越少,而且没有一件是可逆的。指望这个趋势掉头是不现实的,所以早点建立不依赖它的测量方式,是一件迟早要做的事。 ## 这个比例是不是这个站特殊 这是个必须先说清楚的问题,否则后面的数字对你没有参考价值。 不同站型的流量曲线本来就长得不一样,三种曲线各自的健康标准 (https://zhangwenbao.com/seo-traffic-curves-three-types-content-matrix-three-layers.html)可以帮你先认清自己属于哪一种。 不算特殊,但要说明背景。这个站的读者以从业者为主,回访比例高,很多人是从收藏夹或者聊天记录里点进来的,这会推高来源为空的比例。如果你的站主要靠搜索获客,这个比例通常会低一些,六到七成是常见区间。 但方向是一致的:所有站的这个桶都在变大,而不是变小。隐私保护的加强、聊天类入口的增多、AI产品对来路的处理方式,三件事同时在往一个方向推。 ## 顺便说一句为什么不能只看统计脚本 很多团队的数据只来自前端统计脚本。脚本被广告拦截插件挡掉、页面没加载完就跳走、用户禁用了脚本,这几类访问在你的报表里干脆不存在——不是归到直接访问,是压根没有。服务器日志的好处就在这里:只要请求打到了服务器,它就有一行记录,不管前端发生了什么。两边的数字对不上是正常的,值得关心的是差多少。 报表失真还有另一个大来源是机器流量,怎么把它揪出来再拦掉 (https://zhangwenbao.com/spam-traffic-ga4-detect-filter-prevent.html)那篇写了完整的识别与过滤办法。 ## 两边差多少才算正常 差值区间 | 通常意味着 | 要不要处理 | 日志比脚本多一到三成 | 正常范围,主要是拦截插件与爬虫残留 | 不用 | 多三到五成 | 可能有一批页面没埋上代码 | 抽查模板 | 多五成以上 | 要么埋点漏了大片,要么日志里混着大量机器请求 | 先分客户端类型再比 | 脚本比日志多 | 几乎只有一种可能:重复触发 | 立即查 | 指标读错比数据缺失更常见,四个最容易误用的核心指标 (https://zhangwenbao.com/google-analytics-metrics-misuse-guide.html)挨个拆过一遍,对账之前值得过一眼。 比之前有一步不能省:先把日志里的机器请求剔干净。这个站51天230万条请求里,浏览器发出的只占七成多,其余是各类爬虫、监控与扫描。不剔就比,两边永远对不上,而且会得出一个错误结论——以为自己的埋点漏了一半。 ## 那个桶的构成会随时间变吗 会,而且能看出来。把无来源比例按周画一条线,正常情况下它应该是平的。什么时候它会跳?三种:站点上线了新的入口方式,比如做了小程序或者应用内嵌;某个大流量来源改了来源策略;你自己动了跳转规则或者协议配置。 判断一条曲线是季节性还是真出事,季节曲线的量化方法 (https://zhangwenbao.com/seo-seasonality-forecasting-traffic-pattern-playbook.html)给了可操作的判据,别看到掉就慌。 这条线的价值不在于绝对值,在于它跳的那一天。它跳了,说明这段时间有件事改变了你的流量构成,而这件事往往不在你的变更记录里——因为改的人不是你。 ## 那个桶里到底有多少是AI带来的 这是最想知道、也最没法直接回答的问题。但可以估个范围,方法是从两头夹。 分析工具后来也加了AI渠道,它能回答和回答不了的事 (https://zhangwenbao.com/google-analytics-ai-assistant-guide.html)单独写过,读完你会知道该指望它多少。 下限好定:能看到来路的那575次就是下限,这部分板上钉钉。上限要靠推算——把带来路的AI访问占带来路访问总数的比例算出来,再假设无来路那部分的构成与之相似,就能推出一个上限值。这个假设当然不成立,但它给出的是一个不会被突破的天花板。 估算方式 | 结果 | 可信度 | 只数能看到来路的 | 575次 | 确定,是下限 | 按可见部分的比例外推 | 约一万次 | 假设太强,只当天花板 | 用自述来源反推 | 需要积累样本 | 最接近真实,但要时间 | 下限和上限差了将近二十倍,这个区间大到没法用来做决定——这正是为什么必须补那条不依赖技术链路的通道。在拿到自述数据之前,任何关于AI带来多少流量的精确说法,都是在这个二十倍的区间里挑了一个自己喜欢的数。 ## 为什么不能直接拿行业平均比例来套 网上能查到不少关于AI流量占比的行业数字,从千分之几到百分之几都有。这些数字之所以差这么远,是因为它们的分母口径根本不一样:有的按会话算,有的按请求算,有的只统计几个海外入口。把一个不知道口径的比例乘到自己的流量上,得到的是一个假装精确的猜测。 要用别人的数字,先问三个问题:分子是怎么判定的、分母包含哪些流量、样本站是什么类型。三个问题里只要有一个答不上来,这个数就只能当谈资,不能当依据。 ## 为什么外推的那个假设一定不成立 因为剥离来路这件事在不同来源上的发生概率完全不同。搜索引擎基本都会传来路,聊天类应用基本都不传,AI产品各家不一样。会不会被看见,跟来源是谁强相关,所以拿可见部分的比例去推不可见部分,从统计上就站不住。 刚开始做数据分析容易犯的几个基础错,三类工具与排名追踪习惯 (https://zhangwenbao.com/seo-data-concept.html)那篇适合当入门底子。 知道这一点有个实际好处:当有人拿着一个精确到小数点后一位的AI流量占比来跟你讨论时,你可以直接问他这个数是怎么算的。八成答不上来,或者答案是某个工具算的。 ## 按英文清单去数AI流量,会漏掉多少? 接下来是这次翻日志最意外的一段。 ## 先说数出来的结果 把浏览器请求里带着外站来路、且来路属于AI类产品的挑出来,51天一共575次。按域名归类之后,分布是这样的: 这些入口各自是什么产品、面向什么人,十款主流工具的实测对比 (https://zhangwenbao.com/what-is-ai-search-tools-comparison.html)可以当一份认名字的索引用。 来源 | 51天次数 | 归属 | 通义相关域名合计 | 260 | 国内 | 夸克与神马系合计 | 149 | 国内 | 一个第三方AI助手工具 | 45 | 国内 | 某AI创作平台 | 33 | 国内 | 豆包 | 10 | 国内 | 其余国内小入口合计 | 30 | 国内 | Perplexity | 18 | 海外 | Claude | 13 | 海外 | ChatGPT | 9 | 海外 | Copilot | 5 | 海外 | 其余海外入口 | 3 | 海外 | ## 这张表里最该盯的是那条分界线 国内入口合计527次,海外入口合计48次。国内占91.7%,海外占8.3%。 国内搜索早就不是一家独大,五个战场各自的接入方式 (https://zhangwenbao.com/china-fragmented-search-ecosystem-seo-2026.html)那篇把碎片化的现状拆得比较清楚。 而你能在英文行业媒体上读到的每一份AI流量监测指南,给的清单都是ChatGPT、Perplexity、Gemini、Copilot、Claude这几个。照着那份清单配规则,你会数到48次,然后得出一个结论:AI带来的流量可以忽略不计。 真实情况是它已经有575次,只是十分之九来自你没配进规则里的域名。这不是流量少,是你的量具只认得一种货币。 ## 为什么这件事对做中文站的人格外重要 因为这两年绝大部分关于AI流量的方法论都是英文世界写的,样本是英文站,用户是英文用户,入口清单自然也是英文产品。这些方法论本身没错,但它们的默认前提在国内不成立。 两套生态的差别不只在算法,从备案到时效的五维对比 (https://zhangwenbao.com/baidu-vs-google-seo-essential-differences.html)能解释很多方法论水土不服的原因。 做出海独立站的人可能会说,我的用户就是海外用户,那份清单对我够用。这话对一半。如果你的站同时有中文内容、或者服务华人客户、或者产品在国内被讨论,你的AI入口构成会比你想的复杂得多。成本极低的验证办法:把日志里的外站来路按域名排个序,从上往下扫一遍,看有没有你没听说过的名字。 ## 一个容易被忽略的推论 如果国内入口占了九成,那么另一件事也跟着成立:你在国内做的那些内容动作,效果会先出现在这批入口上,而不是在你天天盯的那几个海外产品里。很多团队感觉做了半天没反应,其实是没在正确的地方看。 验证成本很低:把最近三个月发的内容标一下,看这批入口带来的落地页里有没有它们。有,说明动作是有效的,只是反馈渠道你之前没打开。 ## 那些没听说过的名字往往最有意思 这次扫出来的几个域名,之前保哥自己也没注意过:一个做浏览器侧边栏AI助手的产品带来了8次;一个AI创作平台带来33次;还有一个专门做AI搜索优化服务的站点带来8次访问,看起来是同行在研究这个站。 国内那几个AI入口各有各的脾气,本地化落地的三类对策 (https://zhangwenbao.com/baidu-ai-search-geo-optimization-localized-guide.html)给了分平台的具体动作。 这些数字都不大,但它们说明了一件事:AI入口不是几个大厂的事,它是一片正在长出来的杂树林。用固定清单去数,清单更新一次的周期是几个月,而新入口冒出来的周期是几周。 ## 把视野再放宽,整张外部来源榜是什么样 来源 | 51天次数 | 类型 | 谷歌各区域域名合计 | 68000以上 | 搜索 | 必应中国站与国际站合计 | 8300以上 | 搜索 | 某内容聚合站 | 2144 | 导流 | 百度移动端与桌面端合计 | 713 | 搜索 | AI类入口合计 | 575 | 对话与AI搜索 | 某新标签页推荐位 | 213 | 内容分发 | 隐私搜索引擎合计 | 约270 | 搜索 | 社交平台合计 | 约250 | 社交 | 流量涨了生意没起色是另一个常见困境,从点击到成交的断点排查 (https://zhangwenbao.com/seo-traffic-up-pipeline-flat-revenue-attribution.html)那篇按环节逐个查过。 放在一起看,AI入口的量级已经超过了社交平台,也超过了百度带来的访问,跟隐私类搜索引擎在同一个数量级。它当然还远不能和主流搜索相比,但已经不是可以四舍五入掉的数字了。问题在于它散落在十几个域名上,任何一个单看都不起眼。 ## 怎么认出一个陌生域名是不是AI入口 排行榜上冒出一个没见过的域名,判断它属于哪一类,有四个信号可以看,从便宜到贵排: 不同引擎的取源方式差别不小,分引擎的优化策略 (https://zhangwenbao.com/ai-search-engine-geo-optimization-strategy.html)可以帮你判断某个入口值不值得单独对待。 信号 | 怎么看 | 能判断什么 | 落地页分布 | 它带来的访问都落在哪几页 | 集中在几个事实型页面,多半是问答类入口 | 来源路径 | 来源字段里除了域名还有没有路径 | 带搜索路径的是搜索类,只有域名的多为对话类 | 访问节奏 | 是持续小量还是集中爆发 | 集中爆发通常是被某篇内容引用了一次 | 直接打开看 | 浏览器访问这个域名 | 最准,但要花一分钟 | 多数时候前两条就够用了。真正需要打开看的,是那些量突然变大又叫不出名字的——这类往往是新上线的产品,早点认出来,你就比同行早几个月知道它存在。 ## 把入口按性质分三档,比按品牌分更耐用 品牌会变、域名会改,但入口的性质相对稳定。按性质分档,规则的寿命会长很多: 按查询类型分类同样比按平台分类耐用,十二类查询的内容布局 (https://zhangwenbao.com/ai-search-query-taxonomy-geo-content-strategy.html)是一个可以直接抄的框架。 档位 | 特征 | 该怎么对待 | 对话型 | 来源只有域名,落地散 | 关注落地页的事实准确度 | AI搜索型 | 来源带查询路径,落地集中 | 当搜索渠道优化,看得见查询词 | 插件与助手型 | 量小但持续,用户代理常有特征 | 只做监控,量级通常撑不起投入 | 这三档对应的用户状态完全不同,混在一起算成一个AI流量,等于把三种人当成一种人。分档之后你会发现,值得单独做承接的往往只有其中一档。 ## 清单该多久更新一次,怎么更新 不建议维护一份静态清单,建议维护一个流程:每周把外部来源域名按次数排序,只看那些第一次出现、且次数超过某个门槛的域名。门槛按自己站的量级定,小站设3次,大站设20次。让新名字自己从榜单上冒出来,比你去追行业新闻靠谱得多。 关键词研究这件事本身也在变,从选词转向需求研究的六步 (https://zhangwenbao.com/keyword-fragmentation-need-research-ai-search.html)说的是同一个方向上的转变。 这个流程能顺带解决另一个问题:不少AI产品的来源域名跟它的品牌名对不上,光看域名根本认不出来是谁。这次扫出来的几个都是这样,得点进去看一眼才知道。指望用品牌名做关键词匹配去认AI入口,从一开始就走错了路。 ## 同一份日志,三把尺子为什么给出三个完全不同的数? 这一段是本文的核心,也是最容易在自己团队里复现的一个坑。 ## 第一把尺子:关键词包含匹配 最省事的写法是:来源字段里只要包含chatgpt、claude、perplexity这些词,就算AI来源。这样跑出来的数字是4979。 工具给的数和你自己查的对不上,是老问题了,六步排查法 (https://zhangwenbao.com/webmaster-tool-query-website-keywords-ranking-and-baidu-search-results-are-inconsistent-reasons.html)那篇给过一套定位口径差异的顺序。 ## 第二把尺子:按域名精确判定 把来源字段解析成域名,先排除本站,再按域名清单匹配。这样跑出来是575。 想在分析工具里单独看这批流量,用过滤器加渠道分组补上 (https://zhangwenbao.com/geo-ga4.html)那篇给了具体的配置步骤。 ## 第三把尺子:只认带标记的链接 部分AI产品在跳出链接上带了来源参数。只数带这个参数的访问,一共23次。 追踪参数带来的另一类麻烦是被搜索引擎当成重复地址,能不能用抓取规则屏蔽它 (https://zhangwenbao.com/robots-txt-disallow-utm.html)讲过正确做法。 ## 三个数字放在一起 口径 | 结果 | 相对第二把尺 | 问题出在哪 | 关键词包含匹配 | 4979 | 高8.7倍 | 把本站网址里含这些词的自跳转全算进来了 | 域名精确判定 | 575 | 基准 | 依赖清单完整度,会漏掉没听说过的入口 | 只认参数标记 | 23 | 低25倍 | 只有少数产品会带,多数链接没有 | 单一指标撑不住判断,把聚合自然流量当主口径 (https://zhangwenbao.com/aggregate-organic-traffic-seo-metric-keyword-dead.html)那篇实测了三类站点的效果差异。 ## 第一把尺子错在哪里,值得展开讲 这个站写了几十篇讨论AI工具的文章,网址里自然带着这些产品的名字。读者在站内从一篇跳到另一篇,来源字段就是这些带着产品名的本站网址。包含匹配把这些站内跳转,全部算成了从AI产品来的访问。 品牌词与非品牌词混算会得出同样荒唐的结论,这两类流量该怎么分开读 (https://zhangwenbao.com/branded-vs-nonbranded-keyword-traffic-structure-strategy.html)写得比较细。 更妙的是,写这类文章写得越多,这个虚高的数字就越好看。一个用来衡量AI带来多少流量的指标,实际上在衡量你自己写了多少篇讲AI的文章。 ## 第三把尺子为什么低得离谱 带来源参数是产品方的选择,不是标准。同一个产品,网页版可能带、客户端可能不带;这个月带、下个月改版就可能不带。所以这个数字只能当下限用,不能当结论。 想从现有后台里挖出更多线索,用正则挖提示词的五步 (https://zhangwenbao.com/gsc-regex-mine-ai-search-prompts-guide.html)是目前少数还能用的办法。 能用参数标记数到的,永远只是真实数量的零头,而这个零头占多大比例,你无法预先知道。 ## 还有第四把尺子,但它有前提 如果你能拿到会话级的数据,可以按会话去数,而不是按请求。一个人从AI入口点进来、在站内翻了五页,按请求算是六次,按会话算是一次。这把尺子给出的数字最接近人的概念,但它要求你的统计能正确把请求串成会话,而串会话本身又依赖前端脚本或者登录状态。 要做会话级的分析通常绕不开数据仓库,三个平台怎么关联起来 (https://zhangwenbao.com/ga4-bigquery-google-ads-search-console.html)那篇有逐项操作。 换句话说,最贴近业务含义的那把尺子,恰好也是最依赖那条会断的链路的。这就是这类测量的根本困难:越准的口径越脆,越结实的口径越粗。 ## 三把尺子该怎么配合 正确用法是三个一起报,各标各的口径。参数标记那个数当地板,域名判定那个数当主口径,包含匹配那个数直接扔掉。只报一个数的报表,读的人无从判断它的可信度;报三个数并注明口径,反而没人质疑。 多口径并存最后一定要对账,七个动作点的对账清单 (https://zhangwenbao.com/data-analyst-seo-reconciliation-7-actions.html)是跟数据同事协作时的现成模板。 ## 报表里那句口径说明该怎么写 一句话就够:本数按来源域名判定,已剔除静态资源与站内跳转,统计区间为某月某日至某月某日,未包含无来源访问中可能存在的部分。 流量下降的时候怎么跟老板解释,八个维度的完整说法 (https://zhangwenbao.com/seo-traffic-decline-ai-search-value.html)比临时找理由体面得多。 这句话看着啰嗦,但它把三件事钉死了:怎么算的、算了哪段时间、哪部分没算。三个月后有人拿这个数来质疑你,你不用重新解释一遍,指着这句话就行。更重要的是,写这句话的过程会逼你把自己的口径想清楚——很多口径问题就是在写说明的时候暴露出来的。 ## 从零写一份统计规则,需要处理的字段就这几个 字段 | 处理动作 | 不做会怎样 | 用户代理 | 先分出浏览器、搜索引擎爬虫、AI客户端、脚本工具四类 | 爬虫混进人类流量,比例全错 | 请求路径 | 切掉参数与锚点,剔除静态资源 | 图标请求让数字虚高数倍 | 来源字段 | 解析出域名,转小写,去端口 | 本站被当外站,同域被拆成多个 | 状态码 | 只统计成功与跳转,失败单独看 | 把打不开的访问也算成到达 | 时间 | 统一时区,按周聚合 | 跨时区的日界线会造成假波动 | 这类脚本迟早要接进日常流程,自动化该在哪个环节介入 (https://zhangwenbao.com/seo-automation-engineering-ci-maintenance-architecture.html)那篇讲了工程化的取舍。 五个字段,五个动作。这套规则写一次能用很久,因为它处理的是数据本身的形态,跟业务无关。真正需要维护的只有那份域名归类表,而前面说过,那份表最好交给排行榜自己生长。 ## 规则写在哪一层,决定了它能活多久 同样一条规则,写在分析工具的界面里、写在数据仓库的查询里、写在一段独立脚本里,寿命完全不同。界面配置最快但最脆,换个工具就没了;查询语句次之;独立脚本最耐用,因为它只依赖日志格式,而日志格式十年没怎么变过。 如果你打算长期做这件事,把核心规则写成一段能独立运行的脚本,比配在任何平台里都划算。平台会改版、会涨价、会下线,日志不会。 ## 写完之后必做的一次自检 随手挑一个具体路径,用最笨的方法数一遍——直接在日志里搜这一行,人工确认条数。然后拿脚本跑同一个路径,看两个数一不一致。不一致就查规则,别怀疑日志。 统计口径的欠账和技术债是一回事,五步排查与还债的顺序 (https://zhangwenbao.com/seo-technical-debt-audit-and-digital-asset-management.html)可以照着排优先级。 > 任何统计脚本第一次跑出来的数都不该被相信,除非它通过了一次你能手工验证的对照。 ## 还有一个建议:把中间结果留下来 不要只输出最终那张汇总表,把分类之后的中间数据也存一份。三个月后有人问某个数字是怎么来的,有中间结果你能十分钟给出答案,没有就得重跑一遍,而那时候日志可能已经被轮转掉了。日志是有保质期的,结论不是——所以结论要连着它的原料一起存。 把这类分析做成可复现的脚本并不难,用命令行工具做自定义报表 (https://zhangwenbao.com/claude-code-gsc-custom-seo-reports.html)那篇给了一个完整例子。 ## 那些国内入口分别是谁,各自带来什么样的人? 光有总数不够用,得看结构。 ## 通义那260次的构成 来自三个不同的子域名,主站占231次,另外两个是移动端与预发布环境。预发布环境这个细节挺有意思——它说明有产品侧的人在测试环境里访问过这个站,这类访问严格说不该算作用户流量。 这批入口背后是几家在抢同一块蛋糕,八家龙头各自的打法 (https://zhangwenbao.com/geo-concept-ai-traffic-2000billion-leaders.html)能解释它们为什么长成现在这样。 ## 夸克与神马系那149次的构成 这一组域名最杂,光是能识别出来的就有七八个不同前缀,有主站、有移动搜索、有调试环境,还有一个看起来是内部工具的域名。如果你的规则只写了主站域名,这一组你会少数掉将近一半。 国内搜索这块到底还值不值得投,该不该投怎么投的决策框架 (https://zhangwenbao.com/baidu-seo-still-worth-doing-2026.html)给了一套算账方法。 ## 为什么国内这几个入口的域名这么碎 这跟产品形态有关。国内几家的AI能力多数是长在已有产品里的——搜索里加一个AI答案区、浏览器里加一个侧边栏、输入法里加一个助手。它们不是独立的新站点,所以来源域名沿用的是原产品的各种子域名,移动端、桌面端、内测环境各有一套。 内容平台的入口同样碎,问答社区这条路还有没有戏 (https://zhangwenbao.com/zhihu-seo-qa-content-search-ranking-guide.html)那篇的五步实战可以参考。 海外那几家反过来,多数是从零起的独立产品,域名干净,一个牌子基本就一两个域名。这个差别直接决定了你的统计规则该怎么写:对海外入口列域名清单够用,对国内入口必须按主域名归并,否则一定漏。 ## 归并到主域名之后要注意什么 归并会带来一个新问题:不同子域名代表的场景可能完全不同。搜索里的AI答案区和浏览器侧边栏,虽然是同一个品牌,用户状态却不一样。所以合理做法是双层:报表上按主域名归并给总数,明细里保留子域名。总数用来判断量级,明细用来判断场景。 归并这件事在索引侧也有对应问题,索引膨胀的诊断与处置 (https://zhangwenbao.com/index-bloat-mechanism-sitewide-diagnosis-decision-matrix.html)讲的是同一类归并逻辑。 ## 顺带说一个容易误判的情况 日志里有几条来源是调试或者预发布环境的域名。这类访问严格说不是用户流量,是产品方自己的测试。量很小,但如果你的站量级也小,它可能足以让某个月的曲线看起来涨了一截。凡是域名里带着测试、预发、调试这类字样的,单独归一档,别混进主表。 第三方统计留下的痕迹也常被误读,这些图标怎么处理才合规 (https://zhangwenbao.com/hidden-third-party-website-statistics-icons.html)顺手写过一份做法。 ## 不同入口带来的人,落点差别很大 入口 | 最集中的落地页类型 | 说明 | 夸克 | 工具型与查询型页面 | 用户在找一个具体答案 | 通义 | 分布较散 | 更像是对话中顺手点开 | 神马移动搜索 | 移动端加速页版本 | 移动场景占绝对多数 | Claude与ChatGPT | 技术类与限额查询类 | 用户多为从业者 | 不同入口对品牌大小的偏好也不同,中小品牌的六条突围路径 (https://zhangwenbao.com/ai-search-big-brand-bias-small-brand-strategy.html)针对的正是这种不对称。 ## 被引最多的那批页面有什么共同点 把AI引荐落地最多的十几个页面摊开看,它们几乎全是同一类:回答一个具体事实问题的页面。免费邮箱怎么选、某地手机卡资费、某个州收不收税、某个产品的限额是多少、某种技术方案的实测数据。 哪类页面既能被引用又能赚钱,底部漏斗内容的页型清单 (https://zhangwenbao.com/commercial-intent-bottom-funnel-content-engineering.html)给了先建哪个的顺序。 而站上那些几千字的策略长文、方法论文章,在这张表上几乎看不见。这个分布跟很多人的预期是反的:不是内容越深越容易被引,而是问题越具体越容易被引。 页面类型 | 在AI引荐里的表现 | 原因 | 事实查询型 | 占绝大多数 | 对话里被追问的就是这类问题 | 工具与计算型 | 次多 | 模型给不了结果,只能给地址 | 实测数据型 | 有一定占比 | 数字是模型自己编不出来的东西 | 观点与方法论 | 很少 | 模型自己就能生成一份差不多的 | ## 这个分布对内容规划意味着什么 不是让你放弃写深度内容,而是说:如果你的目标之一是被AI引用,那么至少要有一批内容承担事实提供者的角色。具体的数字、具体的对比、具体的实测结果,这三类东西模型自己造不出来,只能来找你。 原创视角这件事在这条路径上尤其值钱,八个信号与十四周的实操账本 (https://zhangwenbao.com/ai-search-deeper-content-original-human-perspective-strategy.html)记录了具体做法。 反过来,纯观点类内容在这条路径上天然吃亏,因为模型自己就是生产观点的机器。这话说得直白了点,但看着那张表,很难得出别的结论。 ## 有一个细节值得单独说 夸克带来的访问里,有19次落在了移动端加速页版本上,占它带来流量的相当一部分。这意味着如果你的加速页版本内容陈旧、或者没有转化入口,那么这批人看到的是一个你早就不再维护的页面。 首页的角色这两年也在变,信息架构重新成为入口 (https://zhangwenbao.com/homepage-seo-ai-era-information-architecture.html)那篇讨论的是同一个变化。 保哥自己就是翻到这一行才想起来,站上还留着一批几年前生成的加速页。这类东西平时完全不在视野里,只有按来源拆一遍落地页才会浮出来。 ## 为什么这批入口的绝对量都不大 看完明细会有个疑问:加起来五百多次,单个入口最多两百多,这个量级实在算不上多。原因有三层,值得说清楚,免得把小量误读成没价值。 这批产品的规模受限于更底层的东西,算力这个真变量 (https://zhangwenbao.com/anthropic-compute-crisis-seo-impact.html)解释了为什么增长没那么快。 第一层是点击本身就少。对话式产品的设计目标是在对话里把问题解决掉,用户点开来源链接的比例本来就低,有研究给出的数字是百分之一量级。零点击不是缺陷,是这类产品的设计意图。 第二层是能被看到的更少。前面说过,来源字段会丢,各家处理方式不同,所以你数到的永远只是实际点击的一部分。 第三层是站型限制。一个中文技术内容站,能被问到的场景本来就集中在几类具体问题上。如果换成一个消费品品牌,被问到的频率和场景会完全不同。 ## 那这个小数字的意义在哪 在于它的方向和结构,不在于它的大小。五百多次告诉你的不是有多少流量,是有哪些入口正在把人送过来、送到哪几页、这些页面的内容还准不准。这三件事的价值跟量级无关,一次访问就能暴露一个过期页面。 老内容悄悄掉量同样是靠小信号发现的,内容衰退的识别与分级 (https://zhangwenbao.com/content-decay-mechanism-portfolio-roi-tiering.html)给了一套分档方法。 换个说法:这批数据的用途是诊断,不是计量。拿它去算收入贡献没有意义,拿它去找该修的页面非常有效。 ## 为什么带参数的那个标记只覆盖到零头? 这一节是给还在指望技术手段一劳永逸的人看的。 ## 参数是善意,不是义务 产品方在跳出链接上带来源参数,本质上是主动告诉你人是从它那儿来的。它没有义务这么做,也随时可以停。把自己的测量体系建立在别人的善意上,是一件很脆的事。 平台给什么数据从来是它说了算,品牌词过滤器怎么用 (https://zhangwenbao.com/google-search-console-branded-query-filter.html)那篇正好是一个平台给了之后的用法示例。 ## 一次改版就能让你的曲线断掉 行业里已经出现过这种情况:某家产品调整了回答里展示来源的数量,很多站点的相关流量应声下跌,一个月后又改回去,数字再涨回来。整个过程里,这些站点什么都没做。 曲线突然断掉先别慌,四类原因的诊断决策树 (https://zhangwenbao.com/seo-traffic-drop-diagnosis-decision-tree-manual-algorithm-tech-seasonal.html)能帮你几分钟内定位到大方向。 凡是完全由对方决定、你一点都影响不了的数字,只适合监控,不适合当考核目标。把它写进季度目标,等于把自己的绩效交给别人的产品经理。 官方渠道给的数据同样受这条约束。新增的生成式AI表现报告 (https://developers.google.com/search/blog/2026/06/gen-ai-performance-reports)就明确写了它有哪些维度、没有哪些维度,而且一开始只对一部分站点开放。看这类公告的时候,最该读的永远是那份不提供清单,它比提供清单更能说明你能做什么。 ## 参数会在哪些地方掉 场景 | 参数还在吗 | 后果 | 用户直接点击跳转 | 在 | 正常记录 | 页面做了跳转到规范地址 | 多数会丢 | 这次访问变成无来源 | 用户复制链接再打开 | 看他复制的是哪一版 | 不确定 | 站内再点一次导航 | 丢 | 后续页面全部归到站内 | 被缓存或加速服务改写 | 可能丢 | 取决于配置 | 跳转规则改动引发的连锁反应最难查,迁移不掉流量的六维路线图 (https://zhangwenbao.com/site-migration-seo-no-traffic-loss-complete-guide.html)里有一整节讲这个。 第二行是最常见也最容易自己修的:很多站的跳转规则会把带参数的地址跳到干净地址,跳的那一刻参数就没了。如果你在做参数追踪,这条规则得留个例外,把追踪参数保留下来。 ## 那还要不要做参数追踪 要做,但摆正位置。它的价值不在于总量,在于它是唯一能百分之百确认来路的那部分样本。用它去校准别的口径:如果参数标记的数占域名判定数的比例长期稳定,那么当这个比例突然变化时,你就知道要么是产品改了,要么是你的规则漏了。 流量与转化之间的交接点最容易掉数据,边界与交点的五步实战 (https://zhangwenbao.com/seo-cro-boundary-handoff-collaboration.html)讲了两边怎么对齐口径。 ## 这些人来了之后,落在了哪一页? 这一段的结论跟英文世界流行的说法正好相反,所以要格外小心地说清楚。 ## 先说英文那边的数据 今年有几份被广泛引用的研究给出过这样的结构:模型引用的网址里,六成以上位于站点的二三级目录深处;而实际点进来的人,接近六成落在首页。把这个现象概括成机器读得深送人送得浅的那篇分析 (https://www.searchenginejournal.com/ai-referrals-are-recreating-the-oldest-mistake-in-conversion-optimization/584331/)还补了一个更扎心的数字:将近三成的引荐直接落在了站内搜索结果页上,也就是那个几乎没人维护的页面。 两条路径的流量结构确实在分裂,分裂的定量证据与内容矩阵 (https://zhangwenbao.com/seo-geo-gap-llm-traffic-content-type-citation-evidence.html)那篇拿数据做过一次切分。 ## 这个站的数据是反的 剔掉图标之类的静态资源请求之后,能确认来路的AI引荐访问一共210次左右,其中落在具体文章页的197次,落在首页的5次。深页占九成以上,首页只占2.4%。 品牌被当作实体来处理时,落点会变,实体主页这个地基怎么搭 (https://zhangwenbao.com/entity-home-seo-ai-brand-guide-html.html)解释了背后的机制。 ## 为什么会差这么多 站型 | 被引用的是什么 | 点进来落在哪 | 品牌电商站 | 产品页、评测页 | 常被替换成品牌首页链接 | 内容站 | 某一篇具体文章 | 就是那篇文章本身 | 工具站 | 某个具体工具页 | 那个工具页 | 品牌定位清不清晰会直接影响模型怎么处理你,四个动作重塑清晰度 (https://zhangwenbao.com/brand-positioning-clarity-ai-search.html)给了具体做法。 差别的根源在于,AI产品对品牌类查询会做一件事:把答案里的品牌指向品牌的主入口。而内容型站点没有品牌指向这一说,被引用的就是那一篇。 所以那条机器读得深送人送得浅的规律,不是普遍规律,是站型决定的。直接把它套到自己站上,可能会让你去优化一个根本不存在的问题。 ## 怎么判断自己属于哪一类 三十秒就能查:把带AI来路的访问按落地页分组,看首页占比。超过三成,你就是被当品牌处理的那一类,要重点做首页承接;低于一成,你的落地页是深页,要重点做单页的转化路径。别看别人的结论,看自己那张表。 行业不同打法也不同,七个行业的方法矩阵 (https://zhangwenbao.com/geo-domain-strategy-matrix.html)可以先找到自己那一行再动手。 ## 两类站的承接动作完全不一样 落地位置 | 访客状态 | 页面要提供什么 | 最常见的失误 | 首页 | 已被说服,只想找到那个东西 | 一条最短的直达路径 | 还在从头介绍品牌故事 | 具体内容页 | 正在核对某个事实 | 把那个事实说准,顺便给下一步 | 页面只有信息,没有任何出口 | 已下架的老页面 | 拿到了一个过期答案 | 明确说明并给替代项 | 放着不管,或者直接删掉变404 | 承接这件事本质是转化设计,八模块九十天的实战路线 (https://zhangwenbao.com/high-conversion-ecommerce-cro-seo-90day-playbook.html)可以当一份长期改造清单。 第三行是最容易被忽略、代价却最实在的一类。模型的答案有滞后性,它可能一直在拿你两年前的页面当依据。这批人不是走错了路,是被送到了一个正确但过期的地址。 ## 把落地页清单变成一份月度作业 光看一次没用,得让它进流程。做法是每月导出一次AI引荐落地页排行,取前二十,逐个过三件事:内容还准不准、有没有出口、移动端排版有没有问题。三件事各打个勾,不合格的排进当月内容排期。 检查项 | 不合格的典型表现 | 修复成本 | 内容准确度 | 价格、政策、版本号已经变了 | 十分钟到半天 | 是否有出口 | 整页读完没有一个下一步 | 十分钟 | 移动端呈现 | 表格横向溢出、关键数字被截断 | 视模板而定 | 二十个页面,一个人半天能过完。这半天的产出通常比同样时间写一篇新文章的收益高,因为这些页面已经有确定的人在看。 ## 顺带解决一个长期没人管的问题 做这件事会附带发现一批僵尸页面:还有访问、内容却早已过期、没人认领。它们平时不会出现在任何一张报表上,因为量小;但正是这些页面在替你回答着别人的问题。 处理原则很简单:有访问就必须有人负责,没人负责就该下线。介于两者之间的那种状态——挂着、不管、也不删——是成本最高的一种,因为它一直在以你的名义给出过时的答案。 ## 落地页承接的一个最小动作 这一步的门槛低到几乎没有借口不做,而它带来的变化往往是整套动作里最直接的。 想验证这一句话加得有没有用,三十个可直接抄的测试方案 (https://zhangwenbao.com/ab-testing-ctr-conversion-optimization.html)里有现成的对照设计。 不必大改。在被AI引荐最多的那五到十个页面上,各加一句指向下一步的话就行——相关产品、更详细的说明、或者一个咨询入口。这批访客已经带着明确目的来了,他们缺的不是说服,是一个出口。一句话的成本,可能比你重做一版首页的收益还高。 ## 静态资源和大小写,怎么悄悄把统计搞乱? 这一节全是坑,都是这次实测踩出来的。 ## 图标请求占了六成 带AI来路的请求一共575次,其中365次请求的是网站图标文件,占63.5%。也就是说,如果你直接数带AI来路的请求条数,会把数字放大到真实访问的将近三倍。 第三方脚本带来的杂音不止统计这一处,五个场景的治理办法 (https://zhangwenbao.com/psi-deprecated-api-third-party-tracker-pagehide-fix.html)那篇顺带解决了性能告警。 原因不复杂:浏览器打开一个页面时会顺带请求图标,这个请求同样带着来路。凡是要数会话或者访问,必须先把静态资源剔掉,只留页面请求。这条规则听起来是常识,但在自己写脚本的时候特别容易漏。 ## 大小写让本站变成了外站 有649次请求的来源字段写的是全大写的本站域名。规则里如果按小写去比对本站域名,这649次会被判成外部来源,堂堂正正地进入外链带来的流量那一栏。 自己写统计的时候这类细节最容易翻车,五层实现方案的对比 (https://zhangwenbao.com/using-wordpress-built-in-function-to-call-all-kinds-of-statistical-data-of-websites.html)里有不少可复用的写法。 域名是不区分大小写的,但字符串比对区分。这个细节在任何一份教程里都不会写,因为它太基础了,基础到没人提。 ## 攻击流量混进了来源维度 日志里有好几组来源字段根本不是网址,而是数据库注入测试用的字符串,每一组都出现了六百多次。这些东西一旦进入按来源分组的统计,就会以外部来源的身份出现在你的排行榜上,排名还相当靠前。 这类字符串扎堆出现有时是更坏消息的前兆,被黑与负面攻击的分诊救法 (https://zhangwenbao.com/hacked-site-penalty-negative-seo-recovery-reinclusion.html)值得先存着。 处理方式很简单:解析不出合法域名的来源,一律归到无效那一档,别让它进主表。顺带一提,这类字符串的出现频率还能当一个安全指标看,它们扎堆出现的那几天,通常也是服务器负载异常的那几天。 ## 一份可以照着跑的自检清单 检查项 | 怎么验 | 通过标准 | 静态资源是否剔干净 | 看落地页排行里有没有图片、脚本、图标 | 一个都没有 | 本站是否被误判成外站 | 在外部来源榜里搜自己的域名 | 搜不到 | 非法来源是否已隔离 | 看榜单里有没有不像网址的字符串 | 没有 | 同域是否已归并 | 看有没有同一个名字带不同前缀反复出现 | 只出现一次 | 机器请求是否已分开 | 看浏览器类请求占总请求的比例 | 与经验值相符 | 时间口径是否统一 | 看跨日的数据有没有异常锯齿 | 曲线平滑 | 落地页体验也有一份官方及格线,质量白皮书里的具体要求 (https://zhangwenbao.com/baidu-landing-page-experience-search-quality-whitepaper-guide.html)可以当另一份自检表用。 六项全过,这份数据才值得拿去开会。六项里任何一项没过,你算出来的比例都可能有数倍的偏差,而偏差的方向还不固定。 ## 还有一类更难察觉的污染:你自己人 团队成员、外包同事、客服每天都在访问自己的站,这批访问同样会进日志,而且因为他们常从内部文档或者聊天工具点链接,来源字段五花八门。站点越小,这个比例越吓人——保哥见过一个刚上线的站,前两周有超过三成的访问来自内部。 处理办法有两种:按办公网出口地址排除,或者给内部访问加一个固定参数。前者一劳永逸但需要固定出口,后者依赖大家配合,通常两个都得用。做不了排除也没关系,至少在解读数据时把它记在心里,别把自己人的访问当成市场反馈。 ## 内部访问还会污染另一个指标 比来源更受影响的是页面停留和跳出。自己人打开一个页面查资料,可能停留十几分钟;客服为了核对信息一天点开同一页七八次。这些行为混进平均值里,会让某些页面的数据好得不像话。凡是某个页面的停留时长明显高于同类,先怀疑是不是自己人在贡献。 ## 什么时候该怀疑自己的数据 现象 | 大概率原因 | 某个渠道占比整齐得像人为设定 | 规则里有硬编码或者兜底分类 | 周末和工作日曲线一模一样 | 混进了大量机器请求 | 某天数字突然翻倍又立刻回落 | 一次采集、一次扫描或者一次自己人的批量操作 | 新入口一出现就贡献很多 | 先确认不是测试环境或者监控服务 | 四条里任何一条出现,先别急着写结论,回去看明细。数据分析里最贵的时间,都花在为一个错误数字编解释上。 ## 三条一起构成的教训 > 统计口径出错的地方,往往不在业务逻辑里,在你没想过要处理的那些边角上:一个图标、一次大小写、一串攻击字符。 很多经验都是被事故教出来的,十年算法史里的那些教训 (https://zhangwenbao.com/baidu-algorithm-history-luvluo-shiliu-jinglei-qingfeng-decision.html)读起来比方法论更有画面感。 ## 还有三个次一级的坑,一并记下 坑 | 表现 | 处理 | 带端口的来源 | 同一个域名因为带了端口号被当成两个 | 解析域名时统一去掉端口 | 加速页与主版本分开算 | 同一篇内容的两个路径各算各的 | 按内容归并,别按路径归并 | 锚点与查询参数 | 同一页因为带了不同参数被拆成十几行 | 分组前先把参数与锚点切掉 | 改版引发的连锁问题同样藏在细节里,不掉流量的完整防护清单 (https://zhangwenbao.com/website-redesign-theme-switch-seo-protection-h-tag-schema-internal-link-cwv.html)可以在动手前过一遍。 这三条都不难,难的是你得先知道它们存在。判断自己有没有踩到,只要看排行榜里有没有同一个名字反复出现的行——有,就说明归并没做干净。 ## 不靠技术链路,怎么把来源问出来? 前面全是拆问题,这一节讲解法。 ## 最有效的一招是直接问 在表单里加一个字段:你是怎么知道我们的。不做必填,不做下拉选项,就一个输入框。那份关于AI可见度该测什么的讨论 (https://www.searchenginejournal.com/ai-visibility-measurement-what-to-track-what-to-ignore/582009/)里把这一招放在了最高优先级,理由很直白:它是唯一一条不经过任何技术链路的信息通道。来源字段会被剥离,参数会丢失,脚本会被拦,但用户自己写下的那句话不会。文中还提到一个具体数字,有团队实测发现,通过AI平台进来的线索里有八到九成被系统错误地标成了自然搜索或者直接访问。 把这批人接到询盘上还有别的动作,获客三步指南 (https://zhangwenbao.com/ai-search-lead-generation-seo-ppc-strategy.html)讲了从可见到成交的衔接。 ## 这一栏解决的是哪个问题 回到最开头那张表:八成半的访问看不出来路。技术手段能做的,是把那4.92%里的信息榨得更干净——把域名归并对、把静态资源剔掉、把新入口认出来。但它对那84.54%无能为力,因为信息在到达你之前就没了。 可见度做出来了询盘却不来,从被看见到被信任的全链路 (https://zhangwenbao.com/b2b-geo-full-funnel-conversion-path.html)那篇拆过中间断在哪。 自述来源不是把那个桶变小,是绕开它。它不依赖来源字段、不依赖参数、不依赖脚本能不能加载,它依赖的只有一件事:人愿不愿意回答。这是整条链路上唯一一个不受技术条件影响的环节。 > 当一条通道系统性地丢信息,正确做法不是把它修得更密,是另外开一条不经过它的路。 ## 它当然也有毛病 人的记忆不可靠,会把最近一次接触当成第一次接触,也有人随手填两个字。这些偏差是真实存在的,谁也没法消除。但它的价值不在于精确,在于它能发现你完全不知道存在的渠道——有从业者分享过,加了这个字段之后才发现有相当比例的注册来自某个AI产品,而他们此前在这个方向上什么都没做过。 任何单一信息源都有偏差,四层逆向拆解对手的框架 (https://zhangwenbao.com/competitor-reverse-engineering-framework-content-link-entity-stack.html)说的是怎么用多个来源互相校正。 ## 怎么问才不掉转化 做法 | 效果 | 备注 | 放在提交后的感谢页 | 不影响转化,回答率中等 | 推荐从这里开始 | 放在表单里做选填 | 回答率高,略增加填写负担 | 字段要放最后一个 | 放在表单里做必填 | 数据全,但会掉转化 | 只在高价值表单上用 | 做成下拉选项 | 好统计,但会限制发现新渠道 | 与输入框结合使用 | 在关键页面上加字段是要算账的,退换货政策页怎么写 (https://zhangwenbao.com/dtc-return-refund-policy-page-seo-trust-conversion-design.html)那篇讨论的是同一种取舍。 如果只能选一种,选感谢页那种。它的成本几乎为零,而且拿到的答案质量意外地高——人在完成一件事之后,比在中途更愿意多说两句。 ## 拿到答案之后怎么用 存下来只是第一步,真正有用的是拿它跟系统记录做对比。 自述数据最终要接进归因体系,多触点模型怎么选 (https://zhangwenbao.com/dtc-multi-touch-attribution-model-selection.html)那篇给了不被最后一次点击骗走的办法。 把自述来源和后台记录的渠道并排放,看两边差多少。差得越多,说明你的技术口径漏得越厉害。这个差值本身就是一个值得长期跟踪的指标,它比任何单一渠道的数字都更能说明你的测量体系状况如何。 ## 自述那一栏的答案该怎么归类 别急着做成标准化选项。前两三个月保持自由文本,把答案原样存下来,每个月人工读一遍。这个阶段的价值全在那些你没想到的答案里:有人写朋友推荐、有人写在某个群里看到、有人写不记得了但确实听说过。这些答案没法归进任何一个预设分类,但它们描述的是真实的传播路径。 怎么把一句话问得让人愿意答,也是文案功夫,八个实战技巧 (https://zhangwenbao.com/seo-copywriting-tips.html)里有几条能直接用上。 读满两三个月,再把高频答案固化成选项,同时保留一个其他加输入框。顺序反了会有个后果:一开始就给选项,你只能收到你已经知道的那些渠道。 ## 一个能立刻用的对账动作 取最近三个月成交或者留资的客户名单,把他们的自述来源和系统记录的渠道逐个对一遍。这个动作看着笨,但样本量通常也就几十到几百个,一下午能做完。做完你会得到一个非常具体的数字:系统记录对了多少个。这个数字比任何渠道占比都更能说明问题,而且没人能跟你争。 跟财务对账是另一场硬仗,七个动作的账本 (https://zhangwenbao.com/finance-cfo-seo-collaboration-7-actions-budget-attribution-asset.html)给了从预算到归因的完整交接方式。 ## 一张能长期跑下去的来源账,该怎么记? 说到这里,可以给一个能落地的东西了。 ## 卡点是一栏自述,不是一套系统 这批问题的根子在于所有技术手段都依赖同一条会断的链路。解法不是把那条链路修得更结实,是在旁边另开一条完全不依赖它的通道。一栏自述来源就是那条通道,它简单到不需要任何技术投入,也正因为简单,它能长期活着。 在这个阶段,底层逻辑比工具更值得先想清楚,内容优化的底层框架五步 (https://zhangwenbao.com/context-first-seo-ai-search-strategy.html)可以对照着排序。 ## 这张账表长什么样 列 | 数据来源 | 更新频率 | 无来源占比 | 服务器日志 | 每周 | 外部来源域名排行 | 服务器日志,剔静态资源 | 每周 | AI入口合计与明细 | 同上,按域名判定 | 每周 | 带参数标记数 | 同上,当地板值 | 每周 | 自述来源分布 | 表单字段 | 每月 | 两边差值 | 后两列相减 | 每月 | 表格里的数最终要接到生意上,四维公式怎么把渠道换算成生意 (https://zhangwenbao.com/how-to-forecast-gmv-sales-from-seo-channel.html)那篇给了折算方法。 ## 第一个月、第三个月、第六个月分别该看什么 阶段 | 重点 | 典型产出 | 第一个月 | 把口径跑通,把域名认全 | 一份能复现的统计脚本与一张域名归类表 | 第三个月 | 看趋势,看新入口的出现节奏 | 知道哪些入口在长、哪些在退 | 第六个月 | 把自述来源与技术口径对账 | 一个说明测量体系可信度的差值 | 分阶段推进比一次做完靠谱,四步实战框架 (https://zhangwenbao.com/geo-four-step-strategy-framework.html)的节奏安排可以直接借用。 三个阶段的共同点是每一步都不需要新工具。拖住多数团队的从来不是工具,是没人把第一个月那件枯燥的事做完。 ## 这张表最容易被砍掉的时刻 是它连续几周没变化的时候。有人会说这东西没什么可看的,要不停了吧。这时候正确的回应不是坚持每周看,是把频率降下来但别停——没变化本身就是一个有效读数,停了之后你连没变化都不知道。 ## 什么时候可以停下来 这套东西不需要永远跑。当你的AI入口构成连续三个月没有新名字出现、且总量占比稳定,就可以把频率从每周降到每月。监测的目的是发现变化,变化停了,监测的价值自然就下降了。别为了看板好看而维持一个已经没有信息量的流程。 判断一件事还值不值得投,行业基准与投入产出测算 (https://zhangwenbao.com/core-web-vitals-ai-search-industry-benchmark.html)那篇给了可算的口径。 ## 第一次做的四个动作 拿到日志、剔掉静态资源与非法来源、按域名分组排序、把没见过的域名手动认一遍。第四步是唯一需要动脑的,也是每次能有新发现的那一步。这张排行榜的价值恰恰在于它会不断冒出你没配过的名字,而固定清单永远不会。 把这类操作工程化能省下大量重复劳动,站点验证与接口申诉的工程化做法 (https://zhangwenbao.com/baidu-search-resource-platform-engineering-guide.html)是一个可参照的例子。 ## 这张表放在哪里,谁来看 补一句更实际的:这张表最好跟现有的周报合并,别新开一个文档。团队里每多一份需要单独打开的文件,被遗忘的概率就翻一倍,这条经验在任何规模的团队里都成立。 把职责写清楚能避免大半扯皮,达标定义与责任划分的模板 (https://zhangwenbao.com/seo-website-optimization-contract-model.html)虽然是合同用,思路是通的。 放在团队每周都会打开的那个文档里,不要单独建一个新看板。看的人最好是同时懂内容和懂业务的那一位——技术同事能把数字跑出来,但判断某个新入口值不值得关注,需要知道公司在卖什么给谁。 这类监测最常见的死法不是没人做,是做的人和能判断的人不是同一个人。数字每周准时出现,却没有人对它做出反应,三个月后自然就停了。 ## 报给上级的时候,说三句话就够 第一句:我们能看清来路的访问只有百分之几,其余在报表里都是直接访问。第二句:在能看清的那部分里,AI入口的量级大概相当于某个你熟悉的渠道。第三句:基于这个数,我们打算做的是修几个页面,不是上一套新系统。 汇报里最容易被追问的是流量质量,信息词流量过大的六大危害 (https://zhangwenbao.com/informational-keywords-traffic-dtc-ecommerce-seo-strategy.html)那篇提前准备了答案。 三句话分别对应现状、量级、动作。多数汇报翻车不是因为数字不好,是因为只报了现状没给动作,于是听的人只能自己脑补一个昂贵的动作。 ## 一个真实的客户案例 保哥有个做露营与户外炊具的客户,市场在欧洲和日本,团队13个人。去年他们的投放负责人在复盘会上说了一句,我们在AI这块基本没有流量,可以先不投入。依据是分析后台里那个AI相关渠道分组常年是个位数。 这类站的信息型页面往往是流量主力,配送政策页怎么写 (https://zhangwenbao.com/dtc-shipping-policy-page-seo-delivery-time-cost-transparency-conversion.html)那篇算过它的两头收益。 后来他们按上面这套做了一次,结果有两处出乎意料。第一,把静态资源剔掉、把域名清单补上之后,实际数字是后台显示的十几倍;第二,也是更要命的一条,他们发现有一批带AI来路的访问落在了一个已经下架产品的页面上——那个产品页因为外部还有引用,一直没做跳转,模型也就一直拿它当答案。 修的动作很小:给那个页面做了跳转,加了一句替代产品的说明,改完花了不到两小时。三个月后这条路径带来的咨询变成了一个稳定的小数字,不多,但比之前的零好。 ## 这件事在他们内部是怎么推进的 过程比结果更值得说。最开始提出要查一下的是他们的内容同事,理由很朴素:她在几个AI产品里搜自己家的品类词,发现有几次回答里提到了他们,但后台从来看不到对应的流量,两件事对不上。 跨团队推进这类事有固定的卡点,四阶段协作框架 (https://zhangwenbao.com/entity-authority-ai-search-seo-content-collaboration.html)把每一步该谁做写清楚了。 技术同事第一反应是没有这回事,因为后台的AI渠道分组确实是个位数。两边僵了两周,最后是运维顺手导了一份日志,按域名排了个序,事情才清楚。争论卡住的时候,多数不是因为谁不讲道理,是因为双方看的是同一件事的两个不同侧面,而没人去看第三个。 ## 他们中间还走了一段弯路 拿到数字之后,第一版方案是给每个AI入口配一个专门的落地页,做一整套承接。做了两周,落地页做出来了,量却撑不起——单个入口一周十几次访问,专门做页面完全不划算。 照搬别的打法是最常见的弯路,为什么流量涨了询盘不动 (https://zhangwenbao.com/b2b-industrial-seo-vs-consumer-dtc-playbook-not-transferable.html)那篇拆过一个典型例子。 最后收缩成前面说的那个动作:只修被引最多的那几个既有页面。他们自己的复盘是,看到一个从未见过的数字时,很容易高估它,因为它是新的。新和大是两件事,中间隔着一次冷静的量级判断。 ## 这个案例里最值得抄的一步 不是他们修了什么,是他们先把数字量清楚了才决定修什么。在量清楚之前,他们打算做的事是投一笔预算去做AI可见度优化;量清楚之后,实际要做的只是修一个页面。这两件事的成本差了两个数量级。 先诊断再动手这条原则适用面很广,三个诊断案例 (https://zhangwenbao.com/seo-cant-fix-broken-brand.html)里能看到没诊断就动手的代价。 ## 这件事带来的一个意外收益 他们做完之后,内容同事第一次拿到了一份按外部真实需求排序的页面清单。以前排内容计划靠的是关键词工具和拍脑袋,现在多了一条依据:哪些页面正在被机器当作答案引用。这条依据的好处是它反映的是别人已经在问的问题,而不是你猜别人会问什么。 ## 他们后来遇到的一个新问题 这套跑了两个月之后,他们的运营同事提了一个很实在的问题:排行榜每周都会冒出新域名,一个个点开看太费时间。解决办法比想象的简单——设一个门槛,一周内出现少于5次的新域名先不管,攒到月底一起看。监测这类事情,把频率降下来通常比把流程做复杂更管用。 有些东西一旦跑起来会自己积累,流量资产的持久化机制 (https://zhangwenbao.com/linkable-asset-digital-pr-earn-links-mechanism.html)那篇做过三十个维度的实测。 另外他们还犯过一个错,值得写出来:有段时间他们把这张表交给了实习生维护,结果连着三周没人发现某个入口的量翻了一倍,因为那位同事只负责把数字填进去,没人告诉他哪些变化算异常。看板可以交给任何人维护,但异常判断得留给知道业务的人。 ## 换个规模看,小团队怎么做 如果只有一两个人,别做表,做一件事就够:每月最后一个工作日,把外部来源域名排一次序,只看前五十行,把没见过的名字点开。二十分钟。这个动作的价值不在于精确,在于它保证了每个月至少有一次,你的视野是被真实数据刷新过的。 小站有小站的打法,九种不被大站剃光的策略 (https://zhangwenbao.com/geo-small-website-visibility-boost.html)针对的正是资源有限的情况。 ## 这套账记下来之后,第一步该改什么? 数据摆出来之后最怕的是没有下一步。这一节把动作按投入产出排一遍。 ## 第一优先:修那些被引用的过期页面 把带AI来路的落地页按次数排序,逐个打开看内容还准不准。这个动作没有技术含量,但它是唯一一件必然有收益的事——你不知道模型什么时候会重新读这些页面,但你知道它现在给出的就是这些地址。 老内容怎么改才算改到位,十二步把旧版更新成可信来源 (https://zhangwenbao.com/revise-old-content-for-aeo-ai-search-optimization.html)给了逐步的操作顺序。 判断标准也简单:一个不熟悉你的人打开这一页,能不能在十秒内确认自己找对了地方。确认不了,就是要改的。 ## 第二优先:给这些页面加出口 出口不是一个按钮那么简单,它得跟这一页的内容有关。查资费的页面,出口是更详细的对比;讲某个故障怎么修的页面,出口是相关的工具或者服务。出口跟内容不搭,效果还不如没有——它只会显得这一页是个诱饵。 出口写什么可以借用现成素材,把用户评论变成产品描述 (https://zhangwenbao.com/ai-transform-reviews-into-product-descriptions.html)那篇的做法能省不少时间。 ## 第三优先:把移动端那份副本对齐 如果你的站有加速页或者独立的移动版本,先看这批访问里有多少落在上面。有量就必须对齐内容,没量可以合并掉。这件事的麻烦在于它通常不属于任何人:内容同事不知道有这份副本,技术同事觉得它是历史遗留。 移动端副本这类历史遗留最容易被忘掉,一次跳转方案下线引发的连锁问题 (https://zhangwenbao.com/baidu-uaredirect-js-dedecms-jumps-to-mobile.html)是前车之鉴。 ## 第四优先:补自述来源那一栏 前面三件都是修存量,这一件是建增量。它见效慢,要攒够样本才有意义,所以排在第四,但越早开始越好——今天不加,三个月后你还是只有一个装满东西的桶。 补数据和补选词是同一种思路,缺口分析怎么找高价值机会 (https://zhangwenbao.com/keyword-gap-analysis-competitor-opportunity-method.html)可以当方法上的类比。 ## 不该做的三件事 动作 | 为什么先别做 | 先买一套可见度监测工具 | 它测的是曝光侧,而你连到达侧还没量清楚 | 为AI流量单独做一套落地页 | 量级还撑不起,且和现有页面的差异说不清 | 把某个AI渠道写进季度目标 | 这个数完全由对方产品决定,写进去等于自找麻烦 | 在没想清楚之前先别大改内容,五大设计法则 (https://zhangwenbao.com/ai-search-content-design-principles-guide.html)能帮你判断哪些改动是真需求。 三件事的共同点是:都在还没搞清楚现状的时候,就先给出了一个昂贵的解法。这是这两年最常见的一种浪费。 ## 顺便说说,AI来的这批人跟搜索来的有什么不一样 数完之后总要回答一个问题:这批人值不值得单独对待。 想更细地理解他们为什么来,五步拆解响应模式 (https://zhangwenbao.com/ai-response-patterns-deep-decoding-ai-era-content-strategy.html)那篇做过一次完整的行为分析。 ### 他们到达时的状态不一样 从搜索结果点进来的人,通常还在比较阶段,同一个问题他可能开了五个标签页。从对话里点进来的人,比较那一步已经在对话里做完了,他点进来是为了核对某个具体说法,或者确认这个来源靠不靠谱。 不同阶段的用户对应不同的词,低竞争词的挖掘策略 (https://zhangwenbao.com/low-competition-keywords-strategy.html)里有按意图分层的思路。 前者需要你说服他,后者需要你别让他失望。这两件事对页面的要求完全不同:前者要论证,后者要证据和明确的下一步。 ### 他们的来路对你意味着不同的信息 还有一层容易被忽略:搜索来的人,你能大致知道他搜了什么;对话里来的人,你完全不知道他问的是什么。查询词这个东西在搜索时代已经被隐藏了大半,在对话时代干脆不存在。 查询词看不到的时候,长尾思路要换,十种挖词渠道与意图分类 (https://zhangwenbao.com/seo-long-tail-keywords-expansion-methods-and-ideas.html)还能提供一部分线索。 能补回来的只有间接信息:他落在哪一页,说明模型认为这一页能回答他的问题。落地页就是你唯一能拿到的意图线索,所以按落地页分组去看AI引荐,比按来源分组更有信息量。 ### 他们的数量小但密度高 行业里已经有几份数据指向同一个方向:AI引荐的流量占比很小,但转化密度明显高于平均。有工具类站点披露过,AI来的访客只占其流量的极小一部分,却贡献了超过一成的注册。这个结构和几年前的邮件渠道有点像——量少,但来的都是已经认识你的人。 这个占比还会继续变,七个策略抢回可见性 (https://zhangwenbao.com/google-ai-mode-self-citing-seo-strategy-2026.html)那篇给出了一份可以跟着调整的清单。 ### 他们对页面的判断标准也不一样 搜索来的人会用整个页面来判断你靠不靠谱:排版、深度、更新时间、有没有广告。对话里点进来的人已经在对话中拿到了初步答案,他打开你这一页是为了验证一件具体的事,所以他的目光是扫描式的,直奔那个数字或者那句话。 让机器读得懂和让人读得下去要同时满足,五个维度的写作方法 (https://zhangwenbao.com/ai-search-content-writing-machine-readable-playbook.html)把两边的要求并在了一起。 这意味着页面里那些为了说服而写的铺垫段落,对这批人是纯粹的噪音。不需要为他们重写页面,但把关键事实往前放、给它一个明确的位置,对两类人都有好处。 ### 他们不会给你第二次机会 这一点最需要注意。一个人在对话里问了问题,模型给了答案和来源,他点进来发现页面答非所问或者已经下架,他不会在你站里继续找,他会退回对话框继续问。你和他之间的那次接触只有一页的长度。 做到位了却还是不被选中,十八个常见盲区 (https://zhangwenbao.com/topical-authority-limits-ai-search-entity-evidence.html)里可能有你正踩着的那一条。 ### 所以该做的事其实很收敛 动作 | 成本 | 为什么值得 | 把被引最多的十个页面的事实核对一遍 | 半天 | 这批人来就是为了核对 | 给这十个页面各加一个明确出口 | 两小时 | 他们只看这一页 | 处理掉已下架却仍被引用的页面 | 视数量而定 | 过期答案的代价最直接 | 把加速页版本与主版本对齐 | 一天 | 移动入口占比不低 | 要判断先补哪一块,覆盖率与声量的三维分析 (https://zhangwenbao.com/content-gap-analysis-competitor-coverage-share-of-voice-mechanism.html)比拍脑袋排序可靠得多。 四件事加起来两天以内能做完,且都不依赖任何新工具。比起去买一套AI可见度监测,先把这四件事做了,性价比高得多。 ## 把这件事讲给不看数据的人听,该怎么说? 这套东西的最大障碍往往不在技术,在于怎么让不看数据的同事和老板接受结论。 ## 先把问题变成一个他熟悉的比喻 保哥常用的一个说法是:你的报表像一个只装了监控探头的商场,但探头只覆盖了正门,侧门、地库、员工通道全是黑的。现在有人从侧门进来了一批客人,你的探头拍不到,于是你的报表说侧门没人。 跟人解释这类机制时,共识这个概念很好用,共识层的六个信号 (https://zhangwenbao.com/seo-consensus-layer-ai-search.html)那篇把它讲得比较具体。 比喻的作用不是让对方懂技术,是让他明白看不见和不存在是两件事。这一点明白了,后面的数字才有人愿意听。 ## 然后给一个他能验证的动作 说一百句不如让他自己试一次:让他在手机上用某个AI产品搜一次你们的品类词,看看回答里有没有你们,有没有链接。这个动作三十秒,效果比任何图表都好。亲眼看到之后,他会主动问你我们这块有多少流量,这时候你的数字才有落点。 让对方亲自搜一次之后,接下来该做什么,五大策略让品牌被主动推荐 (https://zhangwenbao.com/geo-strategies-ai-brand-recommendation.html)可以接着往下看。 ## 最后把结论收在一个动作上 不要停在现状描述。给一个具体、便宜、有时间点的动作:这个月修五个页面,下个月看这几页的访问有没有变化。凡是没有配动作的分析,最终都会变成一次没人记得的分享。 动作要具体到内容层面,怎么让内容被优先引用 (https://zhangwenbao.com/aeo-answer-engine-optimization-guide.html)那篇给的清单足够具体。 ## 有一种反对意见要提前准备 会有人说,这点量做了也没用。这个反对是合理的,别硬顶。正确回应是把它拆成两句:从量级看,你说得对,它现在撑不起单独投入;从风险看,它暴露了几个页面内容已经过期,而那几个页面对搜索来的人同样重要。把动作挂在对所有渠道都成立的理由上,这个分歧就不用争了。 量小的时候,外部提及往往比自有内容更划算,五个实战法则 (https://zhangwenbao.com/earned-media-ai-search-strategy.html)解释了为什么。 ## 这份日志还能顺手回答哪几个问题? 既然日志已经摊开了,有几件事顺手就能查,成本几乎为零。 ## 你的哪些老页面还在被外部引用 按来源域名分组,看有哪些外站在给你带流量。这份名单里通常会有几个你完全不知道的站——有人转载了你的内容并留了链接,有人把你的页面收进了某个资源清单。这批链接是现成的关系入口,值得挨个看一眼。 这份名单还能反过来用,反链差距分析怎么挖 (https://zhangwenbao.com/competitor-backlink-gap-link-intersect-prospecting.html)那篇讲了怎么从中找出可复制的机会。 ## 有多少访问撞上了失败页面 按状态码分组,把404和403单独拉出来,再看它们的来源。如果一个404页面有稳定的外部来源,那说明外面有一条活链接指向了一个已经不存在的地址——这是最容易捡的一类修复,做个跳转就行。 抓取失败与不收录经常被混为一谈,抓取与索引机制的拆解 (https://zhangwenbao.com/baidu-index-crawl-mechanism-why-not-indexed.html)能帮你分清是哪一环出了问题。 ## 你的移动端与桌面端流量结构 用户代理里能看出设备类型。这个数字很多团队以为自己知道,实际查一遍常有出入,尤其是当站上有独立移动版本或者加速页的时候,两边的统计口径往往对不上。 设备与可访问性这两件事常被一起忽略,十八个改动带来的实测变化 (https://zhangwenbao.com/website-accessibility-seo-optimization-guide.html)说明了它们的价值。 ## 有没有人在批量抓你的内容 看同一个来源地址在短时间内的请求密度。正常读者不会一分钟请求几十个页面。这件事的价值不只是安全,也关系到统计——采集流量如果没被剔掉,它会让你的访问量看起来很健康,而这份健康是假的。 被恶意盯上还有更麻烦的后果,三大平台的拦截申诉入口 (https://zhangwenbao.com/tencent-baidu-and-360-three-major-platform-websites-intercept-false-reporting-appeals.html)建议提前存好。 ## 你的站被哪些工具在监测 各类SEO工具、外链分析工具、内容监测服务都有自己的用户代理。看看有哪些在定期抓你的站,能大致判断出有多少同行在关注这个方向。这条纯属八卦,但确实有意思。 这些工具你自己也可以用起来,从建项目到看懂核心指标 (https://zhangwenbao.com/ahrefs-beginner-guide.html)那篇适合当上手指南。 ## 常见问题解答 ## 直接访问占八成多,是不是说明我的统计装错了? 不一定。先看服务器日志和统计脚本两边的总量差多少,如果差得离谱,那多半是脚本被拦或者没加载完;如果两边接近,那就是真实情况——来源信息在链路上就丢了,跟你的配置无关。 ## 那我到底该不该继续用那个直接访问的数字? 可以用,但只当基数看,别当渠道看。它的变化趋势有意义,比如某周突然涨了三成,那通常意味着有某个入口开始给你带量了;它的绝对值没有意义,因为里面装的东西太杂。 ## 怎么快速知道自己漏了哪些AI入口? 把日志里的外部来源域名按次数排序,从上往下看前一百个。凡是你叫不出名字的都点开看一眼。这个动作十分钟能做完,通常能发现两到三个没配进规则的入口。 ## 国内那些入口带来的流量值得专门优化吗? 要看你的用户在哪。如果你的客户主要在海外,这些数字对你就是背景信息;如果你的产品在国内也有讨论、有采购、有代理商,那它们的量级足以支撑一次单独的内容规划。判断依据永远是自己的那张表,不是别人的结论。 ## 自述来源那一栏,用户会不会乱填? 会有一部分,但比例远低于预期。真正会填的人多数是认真的,因为他们已经完成了提交动作,没有理由再敷衍。真正需要注意的是别做成必填,必填会显著增加乱填的比例。 ## 能不能用第三方的AI可见度工具替代这套? 可以互补,不能替代。那类工具测的是你在AI回答里出现的频率,属于曝光侧;这里说的是有多少人真的点了进来,属于到达侧。两件事都要看,但只有到达侧的数据在你自己手里。 ## 加速页那批老页面到底该怎么处理? 先按来源分组看还有多少访问落在上面。有量就更新内容并补上转化入口,没量就做跳转合并到主版本。最怕的是既不更新也不下线,让它挂着当一个静默的旧答案。 ## 这些数字会不会过一段时间就全变了? 会,而且变得比你想的快。国内AI入口这一年一直在洗牌,几个月前排前面的域名今天可能已经改名了。所以这套东西的重点从来不是那几个具体数字,是那张会自己冒出新名字的排行榜。 ## 我的站量太小,一个月才几十个外部来源,值得做这个吗? 值得,而且更简单。量小的时候你可以把所有外部来源逐条看完,不需要排序也不需要门槛。真正的门槛是拿到日志,跟量级没关系。反过来说,量小的时候一个新入口带来十次访问就足以被你注意到,大站反而容易被淹没。 ## 服务器日志会不会有隐私合规问题? 访问日志属于常规运维数据,本身就是服务器默认记录的内容。做这类分析只需要路径、来源、用户代理和状态码四个字段,不涉及任何用户身份信息。要注意的是别把带着个人信息的查询参数原样存进分析表,处理时把参数切掉就行。 ## 如果我用的是托管建站平台,拿不到原始日志怎么办? 先问平台客服有没有日志导出或者访问记录下载,多数平台是有的,只是没放在显眼的位置。实在没有,退一步用分析工具里的来源报告,虽然会漏掉被拦截的那部分,但域名排行这一项通常还能看。能看到排行就能发现新入口,这是整套方法里最关键的一步。 ## AI引荐的量这么小,会不会根本不值得花时间? 看你怎么算这笔账。整套动作里最花时间的是第一次拿日志和写规则,之后每周十分钟。而它能防住的是另一类成本:在没量清楚的情况下,基于一个错误的数字做出昂贵决定。省下一次错误决定,就够回本很多次了。 ## 为什么不直接看第三方流量分析平台给的AI渠道数据? 那类平台的渠道分组同样基于来源字段判定,面对的是同一批问题,而且它们的域名清单往往比你自己维护的更新得慢,对国内入口的覆盖尤其薄。它可以当交叉验证用,但把它当唯一口径,你会重复本文开头那个错误:以为AI流量可以忽略。 ## 把带AI来路的访问单独打标签,值得做吗? 值得,而且成本很低。在服务器层面按来源域名给这批请求打一个标记,后续无论是看落地页、看停留、看转化,都能单独筛出来。关键是要在数据进入分析系统之前打标,进去之后再补通常就补不上了。 ## 我的站有多语言版本,这个统计要不要分开做? 要。不同语言版本的AI入口构成差别可能非常大,中文页面的引荐来源和英文页面的引荐来源基本是两套。混在一起算,会得到一个哪边都不像的平均数,这个数对哪个市场的决策都没用。 ## 这批数据能不能用来判断内容做得好不好? 能用一点点,但要小心。被引用多说明这个页面在回答某类高频问题上是够格的,这确实是一种质量信号。但反过来不成立——没被引用不等于内容差,可能只是没人在对话里问这类问题。把它当发现器用可以,当评分器用不行。 ## 如果发现某个入口带来的访问全都秒退呢? 先别怪流量质量差,先打开那个落地页自己看一眼。这种情况多半有具体原因:内容和问题对不上、页面在移动端排版崩了、或者需要登录才能看到关键内容。秒退是结果,原因几乎总能在那一页上找到。 ## 这套方法用在客户的站上,第一次沟通该说什么? 就说三句:我们先看看你后台那个直接访问里装了什么;这件事只需要一份访问日志,不改任何代码;结论出来之前,任何关于AI流量的判断都先放一放。第三句最重要,它把这次分析从一个可做可不做的活,变成了后面所有决定的前置条件。 ## 权威参考资料 ## AI引用测试怎么做?加上FAQ引用涨、撤掉又掉回来,这才叫因果 - URL:https://zhangwenbao.com/ai-citation-split-test-causation-proof.html - 分类:AI监控与数据 - 发布:2026-07-25 | 更新:2026-07-25 - 摘要:从提问集怎么攒、对照组按什么判据配对、基线期和窗口各设多长,到Search Console生成式AI报告补上了哪块缺口、又留了哪块给第三方采样,一套能落地的AI引用因果测试流程。 - 关键词:GEO,AI引用,AI搜索 > **TLDR**:摘要:给一组测试页加上FAQ板块,AI引用相对对照组涨了;把FAQ撤掉,引用又掉回原位。涨那一半只是相关,掉回来那一半才把因果补齐。大模型不肯给你分流量,传统那套五五开的分流实验在这里根本搭不起来,你只能用一组统计上高度相似的页面当对照,用固定基线期和最短窗口卡住时间,再靠反复采样把答案的随机抖动摊平。本文把这套测试从提问集分层、对照组配对、窗口设定、结果判读一路拆到出海小团队能上手的最小版本,并说清Search Console那份生成式AI报告补上了哪块、又留了哪块给第三方工具。 > 摘要:给一组测试页加上FAQ板块,AI引用相对对照组涨了;把FAQ撤掉,引用又掉回原位。涨那一半只是相关,掉回来那一半才把因果补齐。大模型不肯给你分流量,传统那套五五开的分流实验在这里根本搭不起来,你只能用一组统计上高度相似的页面当对照,用固定基线期和最短窗口卡住时间,再靠反复采样把答案的随机抖动摊平。本文把这套测试从提问集分层、对照组配对、窗口设定、结果判读一路拆到出海小团队能上手的最小版本,并说清Search Console那份生成式AI报告补上了哪块、又留了哪块给第三方工具。 先说一个让不少人愣住的场景。某个团队花两个月给站里三百多个页面补了FAQ板块,两周后拿出一张图:核心提问里被AI引用的次数涨了四成,会议室里一片掌声。有人问了句,那要是把FAQ撤掉呢?空气安静了三秒,然后有人说,撤掉干嘛,涨了不好吗。 这三秒的安静,就是当下大部分AI搜索测量的真实水位。涨了是事实,但涨了不等于是你干的。同一时期模型更新了、竞品掉链子了、季节性来了、抓取节奏变了,任何一条都能把曲线抬起来。你手上有的是一条上翘的线,不是一份证据。 ## 为什么“引用涨了”这句话本身不算证据? 相关和因果的区别,说起来谁都懂,落到AI搜索上却格外容易糊弄过去。传统SEO至少还有排名曲线、点击数据、竞品对照可以互相印证,AI引用这件事的数据源本来就薄,一条上翘的线很容易被当成结论。 2026年7月下旬有场行业分享把这个标准摆到了台面上,主题叫做AI搜索是有效的,怎么用真实测试证明它 (https://www.searchenginejournal.com/ai-search-is-working-how-to-prove-it-with-real-tests-recap/583306/),seoClarity的几位产品和技术负责人讲了他们给企业客户跑的分裂测试方法。其中一句话我觉得该被裱起来:可见度分数只告诉你有没有出现,页面级表现和分裂测试才告诉你你做的那件事到底管不管用。 这句话的分量在于,它把行业里最流行的那类指标降级了。市面上大部分AI可见度工具给你的是一个分数、一条趋势、一张竞品对比图,看着专业,实际上只回答了“我在不在”,回答不了“我做的那个动作有没有用”。这两件事的距离,比大多数人以为的远得多。 更麻烦的是,AI搜索的输出本身带着随机性。同一条提问在不同时刻问,被引用的来源会换、顺序会变、有时候干脆不引任何人。这种抖动在传统排名里是以天为单位的小幅波动,在生成式回答里可以是同一分钟内的两个完全不同结果。站内那篇拿两千九百多次实测说名次是噪声的分析,讲的就是这件事,读过之后你会对单次查询的结论客气很多,详见AI可见度排名为什么每次查都不一样 (https://zhangwenbao.com/ai-visibility-ranking-statistical-noise.html)。 ## 撤回测试为什么是那半边证明? seoClarity那三个客户测试里,最干净的一个是FAQ测试。规模大概是一千条提问在测量之下,给测试组页面加上FAQ板块,引用量相对对照组抬起来,改动在线期间一直维持在高位。到这里为止,跟前面那个团队的两周成果没有本质差别。 关键在下一步:他们把改动撤了。引用掉了回来。用他们的原话说,这才是证明的第二半——不是加FAQ的时候引用涨了,而是拿掉FAQ的时候它又掉回去了。这是因果,不是相关。 可逆性是个很高的门槛,高到大部分团队从来没想过要跨。因为它要求你主动破坏一个看起来在生效的东西。人性上这太反直觉了,就像医生让你把刚见效的药停一停看看是不是真的它在起作用,你会本能地觉得这人是不是有毛病。 但如果你做的是需要向老板要预算、向技术团队要排期的事,可逆性证明的价值就出来了。它把“我们觉得FAQ有用”变成“我们证明了FAQ有用,撤掉就掉”。这两句话在预算评审会上不是一个量级的东西。 你手上的证据 | 它能支撑的结论 | 它撑不住的问题 | 改完之后引用涨了 | 时间上有先后关系 | 同期还发生了什么? | 改完涨了、对照组没涨 | 涨幅大概率不来自大环境 | 两组页面本来就不一样怎么办? | 改完涨了、撤回掉了、对照组全程平稳 | 这个改动就是原因 | 换个模板、换个品类还成不成立 | ## 大模型不肯分流量,对照组该怎么搭? 传统SEO的分裂测试有个前提:你能控制流量的分配,或者至少能把页面随机切成两组,让搜索引擎自己去跑。到了生成式引擎这里,这个前提没了。你没法让ChatGPT把一半的提问发给版本A、另一半发给版本B,它不提供这个开关,将来大概率也不会提供。 替代方案是造一组相关页面当对照。核心思路不是“随便挑一批不改的页面”,而是挑一批在历史上表现轨迹跟测试组高度同步的页面,让它们充当噪声过滤器。模型更新了、行业波动了,两组会一起动;只有测试组单独动了,才说明是你的改动在起作用。 怎么算“高度同步”?我的做法是拿最近八到十二周的周度引用次数序列做配对,逐页算相关系数,把相关系数高的配成一对,同一对里随机分一个进测试组、一个进对照组。这么做比按品类或模板随便分组稳得多,因为品类相同不代表引用轨迹相同。 配对判据 | 合格线 | 为什么这么定 | 历史引用序列相关系数 | 0.6以上 | 低于这个数两组会各走各的,噪声过滤失效 | 周均引用次数量级 | 同一量级内 | 一边每周被引几十次一边零星几次,比例变化没法对齐 | 页面模板 | 相同 | 模板不同意味着结构、内链、加载方式都不同 | 近期是否有其他改动 | 测试期内冻结 | 对照组被别的项目顺手改了,整个测试作废 | 最后一行是实操里翻车最多的地方。你在测FAQ,隔壁的内容团队同期给一批页面换了标题,其中一半正好在你的对照组里。等你拿到数据,两组都在动,你连哪一边动得更多都说不清。测试期内两组页面同时冻结所有其他改动,这条写进排期表,不写就一定有人改。 ## 该先测哪些提问? 提问集不是随手列的。seoClarity的做法是先建一个覆盖完整漏斗的黄金提问集,从认知阶段一路到留存阶段,每条提问打上阶段标签,再按品牌当前在AI回答里的处境分层。 第一层是最容易拿下的:你本身就相关,只是AI手上没有一个值得链的URL。这类提问的特征很明显——AI在回答里已经提到了你这个类目该考虑的因素,甚至提到了你的竞品,但轮到给来源的时候,它宁可去引一篇泛泛的行业清单也不引你。原因通常不是它不认识你,而是你那个页面它不敢用:结论埋得太深、事实密度太低、或者干脆渲染不出来。 第二层要费劲得多,属于你在这个话题上还没建立起可信度,得先补内容、补外部提及、补实体一致性,才轮得到测格式。先赢下第一层不是因为它重要,是因为早期的赢能换来继续做硬测试的资源和信任。这是个组织问题,不是技术问题,但它决定了你的测试项目能不能活过第三个月。 关于哪些提问值得进这个集合、怎么把提问和你希望被引的那个页面绑成一个追踪单元,可以顺带看看站内讲AI可见度是主题层竞争那篇,它解释了为什么按主题而不是按单条关键词组织提问更划算,见AI可见度是主题层的争夺 (https://zhangwenbao.com/ai-visibility-topic-ownership-category-level.html)。 ## 提问集本身从哪儿来,靠工具生成还是靠人攒? 这一步的质量决定了整个测试的上限,可惜大部分团队是用关键词工具导一批词、加个问号就当提问集了。这么攒出来的东西有个通病:它像关键词,不像人说的话。 真正的提问是带场景和约束的。用户不会问“露营电源”,他会问“周末两天露营带小冰箱和照明,多少瓦时的电源够用”。前者是检索词,后者才是提问,而生成式引擎接住的是后者。这两类文本在检索层的行为差别很大,用错了你测的就不是真实场景。 我的攒法是三个来源合并: - 客服和售前的聊天记录。这是含金量最高的一层,因为它是用户在花钱之前真正问出口的话,句式、顾虑、误解全在里面。导出半年的记录,把重复的归类,一百条高频问题不难攒。 - 直接向各引擎追问。先问一个宽泛的问题,然后顺着它的回答问下一层,把它自己生成的追问也记下来。引擎倾向于把话题往哪儿引,本身就是它内部话题结构的暴露。 - 论坛和社区里的原帖标题。真人写的求助帖标题是天然的提问语料,尤其是那些带具体场景数字的。 攒完之后要过一遍标注:每条打上漏斗阶段,标出你希望被引的那个页面,再标出当前是否已经被引。这三列齐了,分层和抽样才有依据。这项工作没法外包给工具,但做一次能用一年,属于典型的一次投入长期收益。 ## 哪一类提问应该直接从测试里剔掉? 有一类提问该被踢出去,这一点让当时不少参会的人意外。我的理解是这样:如果一条提问的答案在结构上就不需要引用外部来源,比如纯定义类的“什么是某某”,模型自己就能答完整,它没有动机去链任何人,你在这条提问上做任何格式改造都不会有反应。 还有一类是你根本没有资格参与的。提问指向的是行业排名、第三方评测、监管口径,AI会去引媒体、引官方、引评测机构,你一个品牌站再怎么优化也进不了那个来源池。这类提问放进测试集里只会稀释你的样本,让本来就稀疏的信号更难看出差别。 剔除动作要在测试开始前做完,不能等跑了三周发现没反应再回头删,那样你的样本量在中途变化,统计上就没法比了。 ## 基线期和测试窗口各要多久? 时间纪律是大部分团队直接跳过的一环。改动今天上线,明天就开始看数据,看了三天没动静就宣布这个方法没用——这个流程听起来很敏捷,实际上是在读噪声。 AI搜索的反应不像传统SEO那样偶尔会隔夜见效。它中间隔着好几道:你的页面得先被重新抓取,索引里的内容得更新,模型在生成回答时得重新检索到这个新版本,而检索层的缓存和更新节奏你完全看不见。这几道加起来,两周只能算刚开始。 阶段 | 建议时长 | 这段时间在干什么 | 基线期 | 4周 | 两组页面都不动,只采集,摸清正常波动幅度 | 改动上线到开始读数 | 1到2周 | 等重新抓取和检索层更新,这段数据不算 | 正向测试窗口 | 4到6周 | 看测试组相对对照组是否稳定分离 | 撤回窗口 | 3到4周 | 验证是否掉回基线,掉不回来说明另有原因 | 基线期的作用被严重低估了。它不是走过场,是在告诉你这两组页面在什么都不做的情况下能抖多大。如果基线期里两组的引用次数差本来就能来回摆动三成,那你测试期看到的两成提升就什么都不是。没跑过基线期的测试,涨跌都读不出意义。 ## 改动上线之后,怎么确认引擎真的重新读过? 这一步几乎所有人都跳过,然后在结果出来之后互相甩锅。逻辑很简单:如果引擎压根没重新抓过你改后的页面,那它给出的引用行为反映的还是旧版本,你读到的所有数据都是在测一个不存在的实验。 确认的办法有三层,从便宜到贵: - 看服务器日志。把AI相关的抓取来源单独筛出来,看改动上线后这批URL有没有被重新请求。这是最硬的证据,因为它记录的是真实发生的请求,不是推断。 - 看Search Console的抓取统计和网址检查。抓取时间晚于改动上线时间,且抓到的内容包含新内容,这一条就过了。 - 直接问引擎。在提问里附上你那个页面的URL让它总结,看它复述出来的内容是新版还是旧版。这个办法糙,但在没有日志权限的时候很好用。 三层都过不了的页面,从这一轮的数据里剔出去,别硬凑样本量。抓取确认不通过的页面留在样本里,比样本量小一半更危险,因为它会系统性地把真实效果往下拉。关于AI爬虫在抓取、渲染、提取这三段各自会卡在哪,站内那篇技术端拆解可以配着看,见GEO技术端怎么优化才抓得到读得懂 (https://zhangwenbao.com/geo-technical-optimization-crawl-render-extract-guide.html)。 ## 三种测试结果分别该怎么读? 测试的结果只有三种,涨、不动、跌。分享里有句话说得挺好:每个结果都是赢,因为你拿到的是证据,不是猜测。这话听着像安慰,但确实是对的——多数团队现在连一条能站住的证据都拿不出来。同一个团队在AI搜索时代测试方式的演变 (https://www.seoclarity.net/blog/testing-in-ai-search)里把这层意思讲得更完整:在生成式结果里,看单次输出没有意义,要看的是模式,而看模式就必须有一套可重复的测试框架。 结果 | 最可能的解释 | 下一步该做什么 | 测试组升、撤回后落 | 改动确实是原因 | 推广到同模板其他页面,再验一次 | 测试组升、撤回后不落 | 另有原因,或改动带来的收益不可逆 | 回查同期有没有别的变更,别急着归功 | 两组都升 | 大环境变了 | 这次测试白跑,但你验证了对照组管用 | 完全不动 | 这个杠杆在这个模板上不起作用 | 换杠杆,别加大剂量硬来 | 测试组反而降 | 改动伤到了可提取性 | 立刻回滚,重点查结构和渲染 | 最后一行值得多说一句。加东西也可能减分。把FAQ塞在正文最上面,把原本前置的结论挤到了折叠区下面,模型抓不到那句结论,引用反而掉。这类事情不测是发现不了的,因为从人的视角看页面变得更丰富了。 ## Search Console那份生成式AI报告,补上了哪块? 2026年6月3日,Google发布了Search Console生成式AI表现报告 (https://developers.google.com/search/blog/2026/06/gen-ai-performance-reports),把AI概览和AI模式里的曝光单独拆了出来,能逐页看每个URL在这些生成式界面里出现的频次,还能按设备、按国家拆。分享里把它称作AI搜索测试拿到过的最大一次测量升级,理由是过去所有人都在采样、都在推断,现在Google直接把数给你了。 这个评价我认同一半。一手数据的可信度确实和第三方工具不在一个层级——第三方工具是自己跑一堆提问去看结果里有没有你,本质上是抽样调查;Google给的是它自己的曝光台账。这两者的差别,跟民调和选票的差别差不多。 但它的边界也很硬:只覆盖Google自家的生成式界面。ChatGPT、Claude、Perplexity这些引擎里发生了什么,这份报告一个字都不会告诉你。而对很多出海品牌来说,恰恰是这几个引擎在承接高意向的对比和选型提问。 另外,Search Console一贯的数据边界在这份新报告里同样存在——行数上限、URL分桶、阈值截断这些老毛病不会因为换了个报告名就消失,取数之前最好先搞清楚你能看到的是全量还是被截断过的部分,站内那篇讲GSC隐藏边界的拆解可以当参考手册用,见GSC数据的隐藏边界与绕行工程 (https://zhangwenbao.com/gsc-data-hidden-limits-1000-row-url-bucket-threshold-workaround-engineering.html)。 ## ChatGPT、Perplexity这些引擎的数据怎么补? Google之外的部分只能靠结构化的第三方追踪,也就是自己维护一套提问集,定期向各引擎发问,把返回结果里的来源抓下来入库。这件事说起来简单,做起来有三个坑。 第一个坑是采样频次。前面提到过,同一条提问反复问结果会变,所以每条提问在每个观测周期里必须问多次取比例,问一次记一次那是在收集随机数。我的经验是每条提问每周至少采五次,低于这个数你算出来的引用率方差大到没法比。 第二个坑是登录态和个性化。带账号问和不带账号问,结果可能不同;不同地区的IP问,结果也可能不同。测试期内必须把这些条件固定下来,中途换了采集环境,前后数据就断了。 第三个坑是把“被提到”和“被引用”混为一谈。模型在正文里提了你的品牌名,和它在来源列表里给了你一个链接,是两件事。前者说明它知道你,后者说明它认可你那个页面能当依据。做格式类测试的时候,能动的通常是后者,你要是拿前者当结果指标,测什么都测不出来。这两个口径的差别站内有专文拆过,见提及和引用的差距怎么补 (https://zhangwenbao.com/brand-ai-mention-citation-gap.html);更上游一点,被检索和被引用又是两套打法,见先分清被检索和被引用 (https://zhangwenbao.com/ai-citation-retrieval-content-strategy.html)。 ## 各家引擎能读到的东西不一样,同一套测试怎么跨引擎复用? 把同一个改动同时在四家引擎上测,然后惊讶于结果不一致,这是新手最常见的困惑。不一致才是正常的,因为各家的抓取和渲染能力本来就不在同一水平线上。 有的引擎会执行页面脚本,有的只读初始HTML;有的会解析结构化数据,有的基本无视;有的自己爬,有的租用第三方索引。这几条差异叠在一起,同一个改动在A引擎上明显有效、在B引擎上纹丝不动,完全可能是引擎能力差异造成的,跟你的内容质量没关系。 所以测试报告里必须按引擎拆开写结论,不能合成一个总分。合成之后你会得到一个中间值,它既不描述任何一家的真实情况,也没法指导下一步动作。 顺序上我建议这么排: - 先测抓取和渲染能力最弱的那家。它能读到的改动,别家基本都能读到,这样得出的结论下限是稳的,推广的时候不容易翻车。 - 再测你实际拿到线索最多的那家。业务价值最高,值得单独花时间调优,哪怕结论不通用。 - 最后测Google的生成式界面。这里有一手数据可以校准,正好用来反查第三方工具在这家上的采样偏了多少,偏差摸清楚了,其余几家的采样结论才好折算。 还有一个细节:不同引擎对同一条提问的理解可能不同,有的会把它拆成好几个子问题分别检索再拼答案。这意味着你的页面要被引,得先在某个子问题上胜出,而不是在原提问上。这套拆解机制站内有专文,见查询扇出:AI把一个问题拆成十几个的底层机制 (https://zhangwenbao.com/query-fan-out-ai-search-mechanism-geo.html)。 ## 折叠起来的FAQ,AI到底读不读得到? 这是现场被问到的问题里最实用的一个。答案是:看你怎么折的。 如果折叠只是CSS层面的显示控制,内容本身在初始HTML里就存在,那么对AI搜索引擎和Google来说都是可读的。如果折叠是点击之后才去请求接口把内容拉回来,那对两边都等于不存在。分享里那句话很直白:连Google都不会在你站上到处点。 三种常见实现的判定是这样的:用details标签或者纯CSS控制显隐的,内容本来就在初始HTML里,机器读得到;靠脚本在页面初始化时注入、不需要用户交互的,渲染之后内容在,多数引擎读得到,但要看那家会不会执行脚本;点击之后才发请求把内容拉回来的,初始HTML里根本没有,谁都读不到。 验证方法比争论有用:把页面的源码拉下来搜一下答案里的关键句在不在,再用渲染后的DOM对一遍。两边都不在,那这块内容对机器就是不存在的。顺带说一句,这个判定标准和无障碍领域用了十几年的那套完全一致——读屏软件读不到的东西,AI基本也读不到,两边撞的是同一堵墙。关于可提取性怎么系统性地验,站内有篇拿样本页实测的操作文,见语义化HTML到底影响AI抓取吗 (https://zhangwenbao.com/semantic-html-content-extractability-engineering.html)。 ## 结构化数据和纯文本版本,这两个测试该怎么设计? 这两个是当下答案引擎优化里吵得最凶的题目,也正因为吵得凶,特别值得自己测一遍而不是听人说。 结构化数据这个测试的设计难点在于隔离。你给一批页面加上标记,同时多半也会顺手把页面上那些原本散在正文里的事实整理成表——那么涨了到底是标记的功劳还是事实密度的功劳?想测干净,就得分两轮:第一轮只加标记不动正文,第二轮只整理正文不加标记。两轮的结论合起来才说明问题。 纯文本版本这个测试指的是给页面提供一份结构极简的可读版本,剥掉导航、弹窗、装饰性容器,只留标题层级和正文。争论点在于这值不值得投入工程量。测法比较直接:挑一批模板一致的页面,一半提供简版一半不提供,看引用率是否分离。 我的经验是,这一项在页面本身结构就干净的站上收益很小,在那种正文被埋在五层容器里、加载时还要跑一堆脚本的站上收益明显。换句话说,它更像是在补债,而不是在加分。要是你的页面已经能被顺利读取,把工程量花在事实密度和结论前置上更划算。 测试项 | 怎么隔离变量 | 预期见效周期 | 结构化数据标记 | 分两轮,标记与正文整理不同时做 | 6到8周 | 纯文本简版 | 同模板对半分,正文内容完全一致 | 4到6周 | 结论前置 | 只动首屏段落顺序,其余不动 | 4到6周 | FAQ板块 | 整块增删,位置固定在正文之后 | 4到6周 | ## 引用份额之外,还有哪几个信号能拼出AI眼里的权威? 现场有人问,AI权威怎么量化。回答很诚实:没有一个干净的数,只能叠几个信号拼出一张工作用的图。他们提到的第一个是你在核心提问上的引用份额,第二个是跨引擎一致性——如果各家引擎在同一类问题上都倾向引你,说明你在这个品类的这类问题上确实成了那个权威来源。 跨引擎一致性这个指标我觉得被低估了。单个引擎的偏好可以被它的检索管道、索引来源、合作关系带偏,Perplexity爱引某类站、Google的生成式界面偏好另一类,这都是引擎特性不是你的实力。但四家引擎都在同一类提问上引你,那大概率是内容本身的结构和权威度到位了。 我自己会再加两个:一是引用位置,被放在支撑段落里和被塞在末尾来源列表里,含金量不一样;二是引用稳定性,同一提问连续采样十次有几次引到你。第二个尤其重要,因为十次里引一次和十次里引八次,在一张月度可见度图上可能都显示成“被引用过”。 ## 被引用但没带来点击,这笔账怎么算? 这个问题几乎每次讨论AI搜索都会被抛出来,问的通常是那位管预算的。分享里的回答是:你要被引用,是因为你在控制那个即将出现在用户面前的答案。 这个角度值得认真对待。在对比类提问里,引用来源决定了对比的框架——谁被列进对比集、每家的卖点怎么被概括、有没有陈旧的错误信息被翻出来重复。你不在来源里,这些全由别人的内容替你决定。这不是流量问题,是叙述权问题。 当然,叙述权不能直接换成现金,这一点得诚实。所以我的建议是把AI引用当成品牌与转化之间的中间层指标去管,而不是当成流量指标去考核。指标该怎么摆、哪些是虚荣指标,站内那篇讲AI搜索KPI盲区的分析说得比较透,见AI搜索KPI的盲区与指标替换 (https://zhangwenbao.com/ai-search-kpi-blind-spot-metric-swap.html);更上游的问题——你到底该测什么、什么该在配工具之前先想清楚——见配GA4之前先设计测量框架 (https://zhangwenbao.com/measurement-framework-before-ga4-setup.html)。 ## 传统SEO在AI测试里还算不算变量? 算,而且是地基。分享里的说法是,那些内容做得扎实、技术健康度好的老客户,在AI搜索里的表现同样是最好的,AI优化是叠在上面的一层。还有一句更狠的:他们几乎没遇到过对SEO有效而对AI搜索无效的动作。 这话可以当成一个很实用的筛子。当有人向你推销一个“专门为AI优化”的动作,而这个动作对传统搜索完全无效甚至有害,你就该多问几句了。真正有效的东西通常是同向的——把结论前置、把事实写清楚、把页面渲染干净、把实体关系标明白,这几件事在两边都加分。 ## 测出来的结论能撑多久,模型换代要不要重测? 这是个让人不太舒服的问题:你花两个月证明了FAQ有效,三个月后模型换了一代,这个结论还算数吗? 分开看。如果你测出来的是格式层的收益——某种排版让答案更好抠出来——那它的保质期跟着模型的提取方式走,换代之后大概率还在,但幅度可能变。如果你测出来的是某个引擎当时的检索偏好——比如那阵子它特别爱引某类页面——那这个结论很脆,随时会失效。 区分方法是看跨引擎一致性。四家引擎上都成立的结论,通常是抓住了内容组织本身的规律;只在一家上成立的,多半是那家当时的管道特性。前者可以放心推广,后者当成阶段性红利,别写进长期规范。 至于重测节奏,我的做法是把已经确认的结论排个队,每两个季度抽一条出来复验,优先复验那些投入大、当初结论也不算特别硬的。全部重测既没必要也做不完。 ## 怎么把测试结果讲给不看数据的老板听? 这一节看起来跟方法论无关,实际上决定了你的测试项目能不能拿到第二笔预算。 不要讲引用率、置信区间、对照组配对这些词,讲三句话就够:我们改了什么、改完之后发生了什么、把它撤掉之后又发生了什么。第三句是杀手锏,因为它天然带着说服力——一个东西加上去有变化、拿掉又变回去,这个逻辑不需要统计学背景也能听懂。 如果对方还要问值多少钱,就把它翻译成机会的语言:在这一百条高意向提问里,我们从几乎不出现变成了三成左右能被引到,这些提问背后是什么规模的搜索需求,被引和不被引在对比类回答里意味着什么。诚实标注这是中间层指标,不直接等于订单,反而更容易被信。 ## 撤回测试有业务风险,怎么把损失控住? 可逆性证明的代价是你要主动把一个在生效的东西撤掉,这在钱页上是真的会疼的。几个控损办法: - 撤回只在测试组做,对照组和其他页面全程不动,风险敞口锁定在一组页面里。 - 优先在信息型页面上做撤回验证,别拿转化率最高的产品详情页去当小白鼠。 - 撤回窗口设得比正向窗口短,看到明确回落就恢复,不用等满周期。 - 撤回前把版本完整备份,恢复要能在一小时内完成,不是重新排期开发。 - 提前跟业务方讲清楚这一步的目的和时长,别等他们看见曲线掉了才来问。 还有个更省事的变体:不撤回原页面,而是在另一批同模板页面上做一次反向验证——那批本来没有FAQ的页面加上去,看是否复现同样的涨幅。这不是严格意义上的可逆性证明,但成本低得多,对多数团队够用了。 ## 噪声有多大?采样多少次才算数? 这是整套方法里最容易被省略的一环,也是最要命的。生成式回答的来源列表天然不稳定,同一提问在同一天问两次,引用来源可能重合不到一半。 所以每条提问的观测值不该是“这次引没引我”,而该是“这周问了N次,其中有几次引了我”。有了这个比例,两组之间的比较才有意义。至于N该取多少,取决于你手上的提问数量和采集成本,我的经验值是这样: 提问集规模 | 每条每周采样次数 | 能看出的最小差异 | 50条以下 | 10次 | 只能看出大幅变化,比如引用率从一成到三成 | 100到300条 | 5次 | 能看出中等幅度变化 | 1000条上下 | 3次 | 小幅变化也能被拉出来 | 规律很直白:提问越多,每条需要的采样次数越少,因为样本量在提问维度上补回来了。反过来,如果你只有三十条提问还每周只问一次,那你收集的基本是随机数,拿它做任何决策都不如抛硬币诚实——至少抛硬币不用付工具订阅费。 ## 这套测试和传统SEO的A/B测试差在哪? 维度 | 传统SEO分裂测试 | AI引用分裂测试 | 分组方式 | URL随机分组,引擎自己跑 | 按历史引用序列配对分组 | 结果指标 | 点击、曝光、排名 | 引用率、引用位置、跨引擎一致性 | 观测方式 | 一手数据,全量 | Google部分一手,其余靠采样 | 单次观测可靠性 | 高 | 低,必须多次采样取率 | 见效周期 | 2到4周 | 6到10周 | 因果确认 | 组间差异显著即可 | 建议加撤回验证 | 如果你之前跑过正经的SEO实验,这套东西上手不难,主要是要接受观测精度的下降,并用采样次数和更长的窗口把它补回来。实验设计的统计基本功没变,站内那篇讲统计功效和单因素隔离的文章仍然适用,见SEO实验设计与统计功效 (https://zhangwenbao.com/seo-ab-testing-experiment-design-statistical-power-single-factor.html);广告口径下的增量思路也能借鉴,见增量测试怎么做 (https://zhangwenbao.com/incrementality-testing-marketing-measurement-guide.html)。 ## 出海独立站人手紧,最小可行的测试怎么排? 不是每个团队都有企业级工具和专职分析师。给小团队的最小版本是这样的: - 提问集控制在50到80条,全部围绕一个品类的选型和对比意图,别贪多铺漏斗。 - 配对出20组页面,一半测试一半对照,模板统一,优先选品类聚合页或长文章页。 - 每周采样一轮,每条提问问5到10次,用脚本跑,结果直接写进表格。 - 基线期压缩到3周,正向窗口4周,先不做撤回,用另一批页面做反向复现。 - 一次只测一个变量。同时改三样东西,最后你只会知道“这三样加起来有点用”。 这套下来大概两个多月出第一个可用结论。听起来慢,但比连续跑十个月的“感觉有用”要快——后者永远出不了结论。 ## 一个真实的测试排期长什么样? 保哥去年带过一个做户外便携储能的出海独立站,产品线是露营电源和车载逆变器,客单价不低,用户在下单前会反复问对比类问题。他们的困境很典型:AI回答里经常出现同类产品的推荐,但来源永远是几家评测媒体和一个论坛帖,自家的产品对比页从来没被引过。 我们做的第一件事不是改页面,是先花三周把基线摸出来。挑了60条提问,都是“露营电源怎么选”“多少瓦时够用”“哪种电池更耐用”这类,每条每周问8次,记录哪些来源被引。三周下来发现一件事:他们那批对比页在检索层里几乎不出现,不是排名靠后,是压根没进候选池。 第一轮测试改的是结论位置——把每个对比页开头那段行业背景删掉,直接上结论表格和一句话回答。20组页面配对,10组改、10组不动,改完等两周才开始读数。第五周开始,改过的那批在提问集里的引用率从接近零爬到一成出头,对照组基本平的。 第二轮才是加FAQ板块,同样的配对逻辑,引用率又抬了几个点。到这一步他们本来想直接铺全站,我建议先在改过的那批里挑三个页面把FAQ撤掉,看两周。结果是掉了回去,这才敢往全站推。 中间还有一轮失败的测试值得说,因为它比成功的那两轮更有信息量。第三轮他们想验证“给页面加上一份参数对照表能不能提升引用”,改了十组页面,跑满六周,两组曲线基本贴在一起,一点分离都没有。复盘的时候发现原因很朴素:那批页面本来就有参数信息,只是散在段落里,加表格只是把已有事实换了个容器,模型该抠到的早就抠到了。 这个结果直接省下了后面的排期。原计划是要给全站两百多个页面做参数表改造,前端估的工期是三周。测完之后这件事被砍掉了,工期挪去做加载优化。一次跑砸的测试省下三周开发,这笔账比任何一次成功的测试都划算。 值得说明的是,同期他们也在做产品页的图片和加载优化,所以整体自然流量的变化不能全算在这套测试头上。但引用率这条线是在配对对照组下测出来的,大环境的影响被对照组吸收掉了,这部分结论我认为是站得住的。反过来说,如果他们当初没做基线期就直接改,看到第五周那个上翘的曲线,多半会归功给自己刚上线的那次改版。 ## 测试结论怎么归档,才不会三个月后没人记得? 跑测试的团队普遍有个毛病:结论存在某个人的脑子里和一份没人再打开的表格里。半年后来了新人,又把同样的测试重跑一遍,得出同样的结论,然后又忘掉。 归档要存的不只是结果,还有让结果可复现的那几个条件。缺了它们,一条“FAQ有效”的记录在下一次就没法判断适不适用。 必须记下来的字段 | 不记会怎样 | 测试的具体改动与页面模板 | 不知道这条结论能推广到哪些页面 | 提问集规模与采样频次 | 没法判断当时的信号强度够不够 | 基线期和窗口的起止日期 | 无法排查同期是否有其他变更干扰 | 各引擎分别的结果 | 合成结论掩盖了引擎差异,推广时踩坑 | 是否做了撤回验证 | 分不清这条是硬结论还是待验证的猜测 | 这份档案攒到十几条之后会变成一个很值钱的东西:一张属于你这个站、你这个品类的杠杆效力表。别人写的通用最佳实践只能告诉你行业平均,这张表告诉你在你自己的模板上什么真的有用。到了那个阶段,你就不用再纠结要不要相信某篇雄文里的建议了,直接查表。 ## 这套测试最容易踩的几个坑 - 同期上线多个改动。结论出来了你也不知道是哪个起的作用,整个测试的价值归零。 - 改动没被重新抓取就开始读数。前一两周的数据基本是旧版本的表现,把它算进去会稀释掉真实效果。 - 拿可见度分数当结果指标。那个分数是工具用自己的口径算出来的合成指标,它的波动可能来自工具改了算法,跟你没关系。 - 对照组被别的项目污染。这条前面说过,值得再说一遍,因为它发生的概率高得离谱。 - 提问集中途增删。样本变了,前后就不能比,要改就重新开一轮。 - 把单次查询结果当数据点。这是最常见的,也是最致命的。 这几条里,最难防的不是技术问题,是耐心问题。这套流程从建提问集到拿到第一条能站住的结论,两个多月是常态,中间有六周你手上什么结论都没有,只有一堆还在积累的采样数据。这段时间最容易被人问“到底有没有用”,也最容易在压力下提前下结论、临时加改动、把窗口砍短——而那几个动作恰好是让整个测试失效的动作。守住时间纪律,比掌握任何一个测试技巧都重要。 ## 常见问题解答 ## 没有企业级工具,能跑这套测试吗? 能。核心成本在采集,用脚本定期向各引擎发问并解析来源列表就够了,剩下的配对和统计在表格里也能做。真正的门槛不是工具,是有没有人愿意维持每周一轮的采集纪律。 ## 撤回测试会不会伤到已有的排名和转化? 有风险,但可控。把撤回限制在测试组的信息型页面上,窗口压短,看到回落就恢复,实际损失通常很小。别在核心钱页上做撤回验证,用另一批页面做反向复现更安全。 ## Search Console的生成式AI报告能不能替代第三方工具? 不能,只能替代其中Google那部分。ChatGPT、Claude、Perplexity的数据它一个字都不给。合理的用法是把它当Google侧的一手校准源,用来验证第三方工具在Google上的采样偏差有多大。 ## 一条提问每周问几次才够? 看提问集规模。50条以下建议每条每周10次,几百条的规模5次,上千条3次即可。判断标准是同一提问在同一周内的引用率方差是否小到能支撑组间比较。 ## 测试结果显示改动没用,是不是说明这个方法本身没价值? 不是,说明这个杠杆在这批页面上没用。同样的FAQ改造在信息型长文上可能明显有效,在产品详情页上可能毫无反应,因为两者在AI回答里承担的角色不同。换模板重测比加大剂量硬来划算。 ## 对照组一定要跟测试组同品类吗? 不一定,关键是历史引用轨迹同步,不是品类相同。同品类但一个是长文一个是产品页,两者在AI回答里承担的角色完全不同,轨迹不会同步;反过来跨品类但模板一致、被引节奏接近的页面,配起来反而更干净。 ## 模型换代之后,之前测出来的结论要全部推翻重做吗? 不用。跨引擎都成立的结论通常抓的是内容组织规律,换代后大概率还在,只是幅度会变;只在单一引擎上成立的结论比较脆,那类当阶段性红利看待。实操上按投入大小排队,每两个季度抽一条复验就够。 ## 被引用的次数涨了,但没有带来任何点击,还要继续投入吗? 取决于你怎么定位这个指标。如果你把它当流量渠道考核,多半撑不过两个季度;如果把它当品牌叙述权和转化前置影响来管,那就该继续,但要配上下游的转化观测,别让它孤零零地挂在报表上。 ## 权威参考资料 ## AI搜索的归因数据平台为什么不会给你?拆开看有两层今天就能自己测 - URL:https://zhangwenbao.com/ai-attribution-referral-incrementality-influence.html - 分类:AI监控与数据 - 发布:2026-07-24 | 更新:2026-07-25 - 摘要:从OpenAI给站长的开关与给广告主的转化管线对照说起,拆开引荐、增量、影响三层的可测性差异,附分类规则验证、留出实验观察窗、两份研究的口径对照与月度报表写法。 - 关键词:出海独立站,增量测试,AI搜索归因 > **TLDR**:摘要:你等的那份AI搜索归因报表不会来,原因不是技术没跟上,而是没有一家模型公司有理由免费给你。2011年Google把自然搜索的关键词收进“未提供”那一栏,广告主那边的转化数据反而越来越细,这件事教给后来者的经验很精确:拿走会挨骂,一开始就不给则风平浪静。OpenAI给站长的是一组开关,给广告主的是一整套服务端转化管线,两边摊开看就明白了。但“归因”这个词里其实塞着三个问题,引荐、增量、影响,答案完全不同——前两个今天就能自己测,且不需要任何平台点头。本文把三层拆开,给出可执行的分类规则、留出实验设计、暗漏斗的土办法,以及买工具前那一个能筛掉大半供应商的问题。 > 摘要:你等的那份AI搜索归因报表不会来,原因不是技术没跟上,而是没有一家模型公司有理由免费给你。2011年Google把自然搜索的关键词收进“未提供”那一栏,广告主那边的转化数据反而越来越细,这件事教给后来者的经验很精确:拿走会挨骂,一开始就不给则风平浪静。OpenAI给站长的是一组开关,给广告主的是一整套服务端转化管线,两边摊开看就明白了。但“归因”这个词里其实塞着三个问题,引荐、增量、影响,答案完全不同——前两个今天就能自己测,且不需要任何平台点头。本文把三层拆开,给出可执行的分类规则、留出实验设计、暗漏斗的土办法,以及买工具前那一个能筛掉大半供应商的问题。 做AI搜索这一年多,被问得最多的一句话不是“怎么才能被引用”,而是“我怎么证明这事儿带来了钱”。上个月保哥在一个小范围的交流里问了圈同行,十个人有七个把这件事排在困扰第一位。有意思的是,大家都默认这是个时间问题——工具还不成熟,再等半年一年,总会有厂商把这块补上,就像二十年前排名查询从手工数到自动化那样。 这个预期是错的。它不会被补上,而且不补上的理由跟技术难度一点关系都没有。 ## 为什么你要的那份AI归因报表,等三年也等不来? 先把话说死:从ChatGPT到Perplexity到Gemini,没有任何一家有商业理由把“这次对话里提到你、然后这个人下了单”这条链路免费开放给做自然流量的人。不是做不到,是不会做。 Duane Forrester在一篇把这件事从头拆到尾的长文 (https://duaneforresterdecodes.substack.com/p/google-went-not-provided-in-2011)里说得很直接。他本月自己跑了一份关于AI可见度工具值不值得买的调研,问卷里刻意一个字都没提归因,结果这个词还是自己冒出来了:一位顾问说整个难题就是把可见度、引用、提及跟钱对上;一位管着十几个客户的代理商老板,在“你最没被解答的问题是什么”那一栏只填了一个词加一个感叹号——归因!还有人答得更疲惫,说追踪只是第一步,那接下来呢。 同一个词底下,其实藏着两种完全不同的沮丧。一种是“工具读出来的可见度到底准不准”,另一种是“这份可见度能不能换算成营收”。这两件事经常被搅在一起说,导致讨论永远在原地打转。本文主要处理第二种,第一种在名次为什么每次查都不一样 (https://zhangwenbao.com/ai-visibility-ranking-statistical-noise.html)那篇里已经拆过统计层面的原因。 ## 归因这件事,是从哪一天开始不好使的? 把时间轴拉长一点会发现一个反直觉的事实:确定性归因的崩塌,比第一个大模型上线要早得多。 - 第三方Cookie进入漫长的弃用期,跨站识别的地基先松了。 - 苹果的应用追踪透明度机制上线,移动端一大块信号直接断掉。 - Google Analytics整体转向建模转化,报表里那个数不再是数出来的,而是算出来的。 - 营销组合模型这套比在座多数人年纪都大的老手艺重新流行,恰恰是因为干净的点击路径已经不成立了。 这四件事各有各的起因,没有一件跟ChatGPT有关。大模型不是凶手,它只是在案发之后走进房间,让所有人没法再假装什么都没发生。你现在站着的这块地面,早在答案引擎出现之前就已经是建模的、概率的、依赖用户授权的了。 这一点很重要,因为它决定了心态。如果你以为是AI搞坏了归因,就会一直等着谁来修好;如果你知道地面本来就是这样,就会开始琢磨在这种地面上怎么盖房子。 ## 平台不是不能给,是没有理由给你,这话怎么理解? 归因数据其实正在到来,只不过它走的是广告那扇门,不是站长工具那扇门。 关键在于,付费广告主想要的信号,和做自然流量的人想要的信号,是同一个信号。曝光、点击、后续行为、成交金额,一模一样的链路。既然有人愿意为这条链路付钱,平台就没有任何动机把它白送给不付钱的那一方。这句话听着冷酷,但它是商业世界里最不需要解释的一条逻辑。 保哥觉得这里最容易让人误判的地方在于,我们习惯把搜索引擎的站长工具当成一种“行业基础设施”,觉得它天然应该存在。可它从来就不是公共设施,它是平台在特定阶段为了拉拢内容供给方而给出的一份礼物。礼物什么时候停发,只取决于送礼的人还需不需要你。 ## 2011年那次“未提供”,到底教会了后来者什么? 这部电影我们看过一遍。 2011年,Google开始加密自然搜索的来路,关键词数据集体消失进“未提供”那一栏。同一时期,付费搜索的广告主拿到的转化数据却越来越丰富、越来越细。同样的查询意图,同样的用户行为,一边被货币化,一边被断粮。自然搜索这行的人为这事儿生了十几年闷气,说不定你现在还在生。 但从做产品的人的角度回看,Google在这件事上付出的代价是真金白银的:口碑、信任、无数场大会上的公开质问、论坛里写了十几年的抱怨帖。这份代价被后来所有想做搜索的人看在眼里,并且他们从中提炼出的经验,精确得让人有点不舒服。 ## 为什么“从来没给过”比“给了又收回”高明得多? 经验就一句话:拿走的代价太大,那就干脆一开始别给。 人会为被剥夺的东西打架,因为“曾经有过”意味着有一条清晰的基准线,所有人都能指着它说你欠我。而一样从未存在过的东西,激不起任何抗议,只会留下一种说不清、道不明的低度焦虑。你会觉得哪里不对劲,但你连投诉对象都找不到,因为没人从你手里拿走过什么。 所以这不真是一个关于某家公司的故事。这个经验在2011年之后就一直摆在明面上,写在每一篇复盘里、每一个论坛帖里。任何一个够格的产品负责人在动手做答案引擎之前,都已经知道了。 ## OpenAI给站长的那几个开关,摊开看到底有什么? 不用猜,翻文档就行。OpenAI给站点运营者的爬虫控制说明 (https://platform.openai.com/docs/bots)里,能做的事情是这样的: - 放行OAI-SearchBot,于是你的内容有机会出现在ChatGPT的答案里。 - 拦掉GPTBot,于是你的内容不被拿去做训练。 - 还有一个负责实时读取的抓取器,同样是放行或拦截二选一。 看出来了吗,全是开关。开、关,没有第三种状态。你能决定让不让它进门,但你没有任何办法知道它进门之后干了什么、你的哪一段被引用了多少次、那些看到你的人后来去了哪。这不是文档写漏了,是这套控制体系里压根不存在“计量”这个维度。 关于该不该拦、拦了会损失什么,站内在要不要向AI爬虫收费 (https://zhangwenbao.com/cloudflare-pay-per-crawl-charge-ai-bots.html)里算过一笔账,这里不重复。 ## 同一家公司给广告主的那套管线,又长什么样? 对照着看才有意思。同一家公司,在广告这一侧已经建好的东西是: 能力 | 广告侧 | 自然侧 | 页面像素 | 有 | 无 | 服务端事件接口 | 有,绑定广告账户 | 无 | 标准转化事件 | 有,带金额、币种、单品明细 | 无 | 浏览器与服务端去重 | 有 | 无 | 隐私保护的身份标识 | 有,用于把曝光和结果对上 | 无 | 可用的控制手段 | 完整投放与衡量后台 | 一个robots.txt文件 | 这就是一套完整的闭环转化归因。它现在就存在,就在那家公司的产品里跑着,只不过门票是一个广告账户。站在同一个平台上的自然流量运营者,拿到的是一个文本文件和一句祝你好运。 ## 一边是开关一边是仪表,这个落差意味着什么? 意味着你该停止等待了。 这个落差不是产品排期问题,它是设计选择。开关和仪表这两样东西,技术难度差着十万八千里吗?并没有。真正的差别是,一个能收钱,一个不能。当一家公司已经把能收钱的那套建完并上线,而另一套连路线图上都不见踪影时,这已经不是猜测了,这是可观察的事实。 顺带说一句,这个落差也解释了为什么市面上那些声称能给你AI归因的工具,报出来的数字彼此差异巨大。它们没有一家能拿到平台内部的数据,所以它们只能各自想办法,而不同的办法必然给出不同的数字。这一点后面会展开。 ## 这只是一家公司的选择吗?把几家模型公司排在一条线上看 把视野放大,会发现结论更不乐观,但也更清晰。 可以按“这家公司存在的理由更偏向卖东西,还是更偏向服务用户”给它们排一条线。这条线不是道德评判,纯粹是看它们自己怎么讲自己的商业模式。 公司 | 自述的存在理由 | 建广告归因层的动力 | OpenAI | 大步往电商和广告上跑 | 最强,且已经建好并上线 | Perplexity | 盯着发现与购物这块蛋糕 | 强,方向一致 | Google | 本来就是一家广告公司 | 不用问,早就有 | Anthropic | 围绕安全与长期收益讲自己 | 最弱,几乎没有结构性理由去建 | ## 从“造来卖”到“造来服务”,这条线上各家分别站在哪? 把这张表读完,会读出一个让人有点无奈的结论:这条线的两头,通向的是同一个地方。 偏商业那一头,会把归因做成一个付费产品,锁在广告后台里;偏使命那一头,压根就没打算做这件事,他们有更想建的东西。门不一样,时间点不一样,但对一个不投广告的自然流量运营者来说,结果完全一样:这扇门在哪一头都不会为你打开。 所以“别指望ChatGPT给你归因”只是这句话的窄版本。宽版本是:别指望任何一家。 ## 为什么使命驱动的那一头,同样不会给你归因? 这个容易被忽略,值得单独说一句。 很多人会想,那些不做广告的模型公司总该开放一点吧,他们没有把数据卖钱的动机。可没有动机卖,不等于有动机送。建一套归因体系是实打实的工程投入——事件定义、身份对齐、隐私合规、稳定性保障、文档与支持,样样都要人和钱。一家把资源押在模型能力和安全上的公司,凭什么把工程排期分给一个既不带来收入、也不服务于其核心使命的功能? 答案是不凭什么。所以它不会出现,理由跟商业化那一头完全不同,但结论一模一样。 ## 你嘴里的“归因”,其实是三个各有答案的问题 说完坏消息,说好消息。 行业里讲“归因”的时候,通常是把三件事揉成一团在讲。这三件事的可测性天差地别,揉在一起最大的害处是:明明有两件今天就能做,却因为跟第三件绑在一起,被一并判了死缓。 层 | 要回答什么 | 今天的状态 | 需要平台配合吗 | 引荐 | AI答案有没有链到你、有没有人点、点进来的人转化了吗 | 可测,但默认设置会读错 | 不需要 | 增量 | 这份可见度有没有带来本来不会发生的生意 | 可证,靠实验设计 | 不需要 | 影响 | 用户在AI答案里看到你、没点、三周后搜品牌词进来了 | 真难,只能逼近 | 不需要,但也没法精确 | 三层里,两层的水管其实是通的,只是没人去拧开。 ## 第一层引荐归因:今天就能看,但默认设置会骗你 这一层最容易被低估,因为大家觉得“不就是看referral吗”。问题恰恰出在这个“不就是”上。 AI会话不会老老实实自报家门。相当一部分从AI答案里过来的访问,来路字段要么是空的,要么长得不像你以为的样子,于是被后台顺手归进直接流量或者自然搜索。你打开报表看见AI渠道只有可怜的几十个会话,心想这渠道果然没什么用,然后就把它关掉了——而真实数字可能是它的好几倍。 ## AI会话为什么会被GA4误分到直接流量里? 几个原因叠在一起: - 桌面客户端和移动应用里的跳转,很多不带来路信息,浏览器拿到的就是一次“凭空出现”的访问。 - 有些答案界面用中转跳走,来路字段留下的是中转域名而不是原始产品。 - 分析工具的渠道分组规则是按已知域名清单匹配的,新出现的产品域名进不了清单,就掉进兜底那一栏。 - 用户在对话里复制了你的网址,换个标签页粘贴打开——这种连来路字段都不存在。 这几条里,前三条能靠规则补,第四条补不了,只能承认它永远看不见。把这一点跟老板讲清楚很重要,否则每次报表都像在解释为什么数字对不上。 ## 一条能用的引荐分类规则,该同时看哪几个字段? 只看来路字段肯定不够。稳一点的做法是把几个信号组合起来判断: - 来路域名,这是主信号,把已知的AI产品域名维护成一份清单,定期补。 - 落地页特征,AI引用倾向于落在特定类型的页面上,比如带明确问答结构的那些。 - 链接参数,凡是你自己能控制链接的地方,一律主动打标,别指望自动识别。 - 会话行为形态,从答案里过来的人往往目标很明确,进站路径和站内搜索行为跟泛自然流量长得不一样。 关于主动打标这件事,渠道分组一旦被平台侧的自动打标改动过,历史口径会跟着变,这个坑在自动打标怎么影响渠道归因 (https://zhangwenbao.com/microsoft-ads-utm-auto-tagging-channel-attribution.html)里有过完整案例,规则设计的时候顺手避开。 ## 为什么你算出来的那个数,只能当下限用? 因为漏掉的部分是系统性偏低,不是随机波动。 复制粘贴进来的看不见,跨设备的对不上,跨时间窗的算不进,用了隐私模式的读不到。这些漏项没有一个会让数字偏高,它们全都往下压。所以你拿到的那个数,正确的读法是“至少有这么多”,而不是“就这么多”。 保哥的建议是在报表上直接把这句话写进去,写成一行小字附在数字旁边。这不是甩锅,是防止半年后有人拿这个数去做减法,得出一个更离谱的结论。 ## 引荐层的分类规则,怎么验证它到底准不准? 写完规则不验证,等于写了个心理安慰。验证的办法比想象中简单:拿你自己能控制的链接去走一遍,看规则认不认得出来。 具体做法是这样。挑几个典型的AI产品,在对话里主动问一些你的内容能被引用到的问题,从答案里点进自己的站,然后回后台看这几次会话被分到了哪一栏。同一批动作在桌面端和手机端各跑一次,因为这两条路径的来路信息经常不一样。 能查出来的问题通常是三类:规则漏掉了某个产品的新域名;某个入口经过中转跳转,来路只剩中转域名;移动端应用内的浏览器完全不带来路,被兜底规则吃掉了。前两类补规则就能解决,第三类只能靠落地页特征和参数标记去逼近。 这件事的价值不只是修规则,还在于你会亲眼看见有多少访问是分类规则根本抓不住的。这个亲眼看见的过程,比任何人跟你讲十遍“数字偏低”都管用。做完之后,你在报表旁边写“这是下限”的时候,心里是有底的。 频率上,一个季度跑一次就够。产品更新快的时候可以加密,但没必要每月折腾,规则失真是慢慢发生的。 ## 归因窗口在AI搜索这个场景该怎么设? 这是个容易被忽略的旋钮,但它对最终数字的影响可能比分类规则还大。 传统电商设归因窗口,主要考虑的是决策周期。AI搜索这条路径多了一个变量:用户在对话里接触你的那一刻,往往处在调研的很前段。他不是在比价,是在搞清楚有哪些选项。从这个位置到下单,中间隔的时间比从一次搜索广告点击到下单要长得多。 几条经验: - 窗口至少要覆盖你的典型决策周期,客单价越高留得越长。低客单快消品七天可能够,几千块的耐用品三十天都算短。 - 别用一个窗口打天下。同一份数据用七天和三十天各算一遍,两个数一起报,差值本身就是信息。 - 窗口一旦定了就别频繁改。中途改窗口会让历史趋势直接断掉,而这种断掉在图上看起来特别像“效果变差了”。 - 跟别的渠道对比时,务必确认两边用的是同一个窗口。这一条踩的人比想象中多。 还有个更朴素的提醒:窗口设得越长,看起来的功劳越大,所以它天然有被人往长了调的压力。定窗口的时候把理由写下来存档,比什么都管用。 ## 第二层增量:不需要任何平台配合,你自己就能证明 这一层是被跳过最多的,因为它需要的是设计,不是仪表盘。点开一个看板不需要动脑子,设计一个实验需要。 但正因为它靠的是设计而不是数据源,平台那个黑箱不透明这件事,压根碰不到它。你在自己的地盘上做因果推断,跟对方给不给你数据没有半点关系。这是整件事里最值得高兴的一句话。 ## 地理留出实验在AI搜索上怎么设计才站得住? 基本思路是:挑一批地区什么都不动,在其余地区推进可见度工作,然后看两组的差别。 放到AI搜索这个场景,有几处需要专门调整: - 分组前先跑相关性配对。两组在实验开始前的历史走势要足够贴合,肉眼看着差不多是不够的。 - 观察窗要比广告实验长。内容改动要等抓取、等索引、等模型的缓存周期,前两周基本什么都看不出来。 - 别只看订单。把AI答案里的出现率、品牌搜索量、直接访问一起当成观察对象,因为链路本来就长。 - 留出组要真的什么都不做。这一条听着废话,实际执行里最容易破功,因为总有人手痒去改两个标题。 增量测试本身的设计原理、样本量怎么估、结果不显著该怎么解读,站内增量测试怎么做才不白跑 (https://zhangwenbao.com/incrementality-testing-marketing-measurement-guide.html)那篇讲的是通用方法,这里只补AI场景的差异。 ## 增量实验的观察窗到底该留多久? 广告实验开跑第二天就能看到曲线分叉,AI搜索这边完全不是这个节奏。原因是中间串着三段各自独立的等待。 阶段 | 在等什么 | 大致耗时 | 能不能加速 | 抓取 | 各家的抓取器重新来读改动过的页面 | 几天到两三周 | 能,靠站点地图和内链 | 纳入 | 新内容进入答案可以引用的范围 | 不定,跟站点权重相关 | 基本不能 | 稳定 | 答案里的表现从波动变成有规律 | 两到四周 | 不能,只能等 | 三段叠起来,一个像样的观察窗最少要六到八周,想看到营收端的变化还得再往后压。这就是为什么很多AI相关的实验做完了却什么结论都得不出来——不是方法不对,是提前三周就把数据拿去看了,看到一片噪声,然后判了死刑。 实操上有个小技巧:实验设计的时候就把“第几周才允许看第一次数”写进文档里,并且写明理由。人是很难管住自己的手的,写进文档等于给未来的自己上了个锁。保哥见过团队在第十天开会讨论“为什么没效果”,那一刻数据里除了噪声什么都没有。 ## 增量实验的结论能管多久,多久该重跑一次? 跑出一个结论之后,很多人就把它当常量用了,这是另一种翻车方式。 AI搜索这个环境变化很快:模型换代、答案界面改版、引用来源的偏好调整、竞争对手同期也在做同样的事。任何一条变了,上次实验的结论都可能不再成立。所以结论是有保质期的。 - 半年是个比较稳的重跑周期,对应大多数产品的迭代节奏。 - 遇到明显的界面或模型版本变动,不用等到半年,直接安排重跑。 - 重跑的时候尽量沿用上次的分组和口径,否则两次结果没法比,等于白跑。 - 把每次实验的设计、时间、结论存成一份台账。两三次之后,这份台账本身就是很有说服力的东西。 台账这件事听着行政,但它解决了一个很现实的问题:团队换人之后,新来的人不至于把三个月前踩过的坑再踩一遍。 ## 开关式测试和固定查询集前后对比,各适合什么情况? 不是所有生意都有足够多的地区可以切分。小盘子的站有两个替代方案: 方法 | 怎么跑 | 适合谁 | 主要弱点 | 地理留出 | 分区域,一组动一组不动 | 有多市场、单市场量够大 | 需要足够的地区数和流量 | 开关式 | 同一批页面,做一段停一段再做 | 季节性弱、盘子中等 | 受外部事件干扰大 | 固定查询集前后 | 锁定一组提问,内容改动前后各测一轮 | 几乎所有人 | 只能证到出现率,证不到钱 | 第三种最轻,也最容易被误用——它测的是AI答案里出没出现你,不是生意有没有变好。这两件事之间还隔着好几层,别在汇报里把它们说成一件事。加上撤回验证之后它的说服力会强不少,具体怎么设计撤回,加上FAQ引用涨、撤掉又掉回来这才叫因果 (https://zhangwenbao.com/ai-citation-split-test-causation-proof.html)那篇写得比这里细。 ## 第三层影响:暗漏斗为什么是真的难,而不是假的难? 先说清楚这一层到底指什么。买家在AI的回答里读到了你的品牌,没有点击,甚至没记住是从哪看到的,三周后直接搜你的品牌名进来下单。整条链路上,没有任何一个技术埋点能捕捉到第一次接触。 这不是新问题。线下广告、口碑推荐、行业大会上的一次闲聊,都是同一类东西。它难,是因为“接触”这个动作根本没有在你能观测的系统里留下痕迹,不是因为你的工具不够好。买再贵的工具也一样。 ## B2B用了二十年的那套土办法,为什么现在轮到DTC用了? 做B2B的人对这件事早就习惯了。他们的成交周期动辄半年,中间几十次接触,早就放弃了精确归因这个念头,转而用一套看起来很土但很管用的办法。 现在这套办法轮到做零售、做独立站的人捡起来用了,因为AI搜索把消费决策也变成了一条看不见的长链路。有点像老中医的方子被年轻人重新发现,成分没变,只是终于轮到你的病症了。 ## “您是从哪儿知道我们的”这个字段,怎么问才有效? 自报归因是这一层唯一能拿到一手数据的方式。做得好和做得差的差别巨大: - 放在下单成功页,不放在结账流程中间,别为了一个字段拖累转化。 - 选项里必须单列AI助手,且写成用户熟悉的产品名,不要写“AI工具”这种没人懂的行业黑话。 - 允许多选,因为真实路径本来就是多点触达。 - 留一个开放输入框,那里面会长出你没想到的渠道名。 - 连续收集至少一个完整的购买周期再看数,样本太小的时候这个字段的噪声大得吓人。 这个字段的数据不精确,会有记错的、随手点的、懒得填的。但它是唯一能照进暗处的那束光,粗糙的光也是光。 ## 除了那个字段,还有哪些一手渠道能补影响层? 自报归因不是唯一的入口。你的生意里其实到处都散落着用户主动说出来的线索,只是没人去收。 - 客服对话记录。用户来咨询的时候经常自己交代来路:“我问AI它说你们家这款支持某某功能,是真的吗”。这类句子里信息量极大,既证明了接触,还顺带告诉你AI是怎么描述你的。 - 销售通话与询盘表单。做B2B或者高客单的,销售那边听到的第一手转述比任何报表都新鲜。定期让销售把这类原话摘几条出来,成本几乎为零。 - 退货和取消订单的原因。反向信息同样值钱。如果反复出现“跟我了解到的不一样”,说明AI对你的描述和实际有出入,那是另一个更紧急的问题。 - 站内搜索词。用户进站后搜的词,如果频繁出现你官网上根本没用过的表述,那些词很可能是从别处的答案里学来的。 这几条有个共同点:全是定性的,没法直接做成数字。但影响层本来就不是一个能精确量化的东西,能拿到方向和佐证已经很好了。保哥的做法是每月从这几个渠道各摘三五条原话,附在报表最后一页。老板看数字会打瞌睡,看用户原话不会。 另外有个隐藏收益:这些原话能反过来告诉你AI在怎么介绍你的品牌。如果发现描述里有明显的错误或者过时信息,那就不是衡量问题了,得赶紧去修事实源,提及和引用的差距怎么补 (https://zhangwenbao.com/brand-ai-mention-citation-gap.html)那篇讲的正是这一层。 ## 品牌需求相关性怎么读,才不至于把季节性当成AI功劳? 另一个可用的信号是:你的AI可见度上升的时候,品牌搜索量和直接访问有没有跟着上升。 这个读法有个大坑——相关不等于因果,而品牌需求受季节、促销、投放、公关的影响都很大。几条防身规则: - 同期把所有其他动作列出来,投了什么广告、发了什么公关、做了什么活动,一并写进结论旁边。 - 跟品类大盘对比,如果整个品类的搜索都在涨,那涨的多半不是你。 - 看非品牌词有没有同步动,只有品牌词动而非品牌词不动,这个组合更像是被推荐带起来的。 - 把周期拉到至少三个月,一两周的波动什么都说明不了。 品牌词和非品牌词该分开当两件事看,这个前提在品牌词和非品牌词为什么要拆开做 (https://zhangwenbao.com/branded-vs-non-branded-keyword-strategy.html)里说过,做这套判断之前先把口径分好,否则数字全糊在一起。 ## 买AI可见度工具之前,该先问供应商哪一个问题? 市面上的工具越来越多,销售话术也越来越像。有一个问题能在三分钟内筛掉大半:你们是靠什么数据源把这条链路闭上的? 然后闭嘴,听对方怎么答。答案基本只有两类: - 诚实的那类会说:靠第一方。他们放在你站上的采集脚本、你的分析后台、你的客户关系系统。这类产品是真的,但有边界——它能覆盖的只有引荐这一层。 - 另一类会含糊地暗示,数据来自模型公司那一侧,或者用“独家数据合作”之类的说法绕过去。 第二类不用再聊了。 ## 如果对方的答案暗示数据来自模型公司内部,说明什么? 说明两种可能,都不是好事:要么他们做的其实是来路识别,只是在包装上说成了内部数据;要么他们在直接说假话。 没有第三种可能,因为不存在第三个数据源。模型公司没有把这类数据开放给第三方,前面那一整套推理已经解释过为什么不会开放。一家真的拿到了内部数据的供应商,会把这件事印在首页上当核心卖点,而不是在销售电话里含含糊糊提一句。 这个问题的妙处在于,它不需要你懂技术就能问,而且答案骗不了人。核对方说法有没有出处这件事,保哥在把那份被到处引用的原文逐字数一遍 (https://zhangwenbao.com/seo-agency-fee-cut-claim-source-check.html)里演示过一次完整流程,方法通用。 ## 为什么第一方是唯一那扇开着的门? 把这件事想通了,很多困惑会一起消失。 你自己的站、自己的后台、自己的客户数据,是唯一一块不需要任何人授权就能观测的地面。所有在营收衡量上站得住的做法,最后都会走回这块地面上来:有的把自家店铺的会话跟结账事件对起来,跟一个全站基线做比较;有的走联盟链路,让成交回传;有的干脆把购买上报交回你自己的分析工具。路径各不相同,底下的共同点非常明显——凡是可信的闭环,闭的都是你已经拥有的数据。 这也是为什么把自有数据的底子打扎实,比多买两个可见度工具重要得多。埋点对账这类基本功听着无聊,但它决定了上面所有分析的地基牢不牢,站内数据分析师和SEO怎么对账 (https://zhangwenbao.com/data-analyst-seo-reconciliation-7-actions.html)那份清单可以直接照着做。 ## 归因和增量这两个词,为什么绝对不能混着用? 这是整篇里最该刻在脑子里的一条纪律。 | 归因 | 增量 | 在数什么 | 被你判定为AI来路的那些会话产生的订单 | 因为这件事才多出来的那部分生意 | 怎么得到 | 分类规则加统计 | 必须跑实验 | 包含什么 | 本来就会买的人也算在里面 | 剔掉了本来就会买的人 | 能不能说“带来了” | 不能,只能说“经由” | 可以 | 归因就报归因,只有真跑过实验的场景才配用“增量”这个词。这条纪律看着迂腐,但它是区分靠谱和不靠谱最快的一把尺子——无论量的是供应商,还是量的是你自己写的那份周报。 ## 把归因说成增量的供应商,为什么让人想起“保证首页”那套? 因为结构完全一样:拿一个用户听不懂但听着很硬的承诺,去覆盖一件本质上做不到的事。 “保证关键词上首页”当年也是这么卖的,卖了好些年,直到市场自己把它淘汰掉。今天那些拍胸脯说能证明AI搜索投资回报率的产品,多半会走同一条路——先热闹两年,然后在一片“说好的数据呢”的追问里安静下去。 这不代表这个品类里没有好东西。恰恰相反,那些老老实实说“我只能帮你把引荐这层看清楚”的产品,往往才是真的能用的。 ## 两份研究一个说AI流量转化高11倍,一个说低于几乎所有渠道,谁错了? 这是最近半年最容易让人精神分裂的一组数据。 一边,基于1200多个发行商和新闻站的分析说,AI引荐来的访客注册转化率是自然搜索的11倍多;另一边,一份同行评议的学术研究覆盖973个站、合计约200亿美元营收,结论是自然LLM流量的转化率和每次会话营收,高于付费社交,但低于其余所有传统渠道。 两个都没错。搞清楚它们各自在数什么,比争论谁对谁错有用得多。 ## 那1200多个站测的到底是什么动作? 拆开看数字就不打架了。基于Microsoft Clarity数据的那份分析 (https://www.billhartzer.com/ai/data-ai-visitors-signup-11x/)给的明细是:LLM引荐访客的注册转化率1.66%,自然搜索0.15%,直接访问0.13%,社交0.46%。八个月里AI平台带来的流量涨了155.6%,但即便涨成这样,AI引荐在整个样本里仍然占不到总会话的1%。 注意两件事:样本是发行商和新闻站,转化事件是注册。注册是一个承诺极低的动作——填个邮箱,不掏钱,不留地址,不做决策。一个专门跑来找某个具体答案的人,愿意顺手填个邮箱,一点都不奇怪。 ## 那973个站又测的是什么? 发表在Marketing Science上的这份研究 (https://www.maximiliankaiser.org/publication/organic-llm-traffic/),用的是973个电商站12个月的第一方数据。它的关键结论有几条:上线一年后,自然LLM流量占全部流量不到0.2%,大约是Google自然搜索的两百分之一;转化率和每次会话营收高于付费社交,但低于其余全部传统渠道;随时间推移转化率在涨,客单价却在跌,所以每次会话的营收只有温和提升。 这边的样本是电商站,转化事件是掏钱下单。掏钱是高承诺动作。同一个高意图访客,愿意填邮箱不等于愿意刷卡。 所以这两份研究测的是两种人群、两种站型、两种承诺等级的动作。它们不但不矛盾,放在一起看反而拼出了一张更完整的图:AI引荐带来的人意图很强,越是低门槛的动作越容易被他们完成,一旦涉及掏钱,优势就没那么夸张了。 ## 两个都对,这件事给你的报表定了什么规矩? 规矩就一条:报数的时候必须带着口径一起报。 - 说清楚转化事件是什么。注册、加购、下单、复购,这四个数能差出一个数量级。 - 说清楚样本是哪一类站。发行商的结论搬到电商站上,大概率不成立,反过来也一样。 - 说清楚时间窗。归因窗口设成一天还是三十天,同一批数据能讲出两个故事。 - 说清楚是不是剔除了品牌词。不剔的话,AI渠道很容易替品牌需求领功。 把这四条写进模板,以后每份AI相关的报表都照着填。麻烦一点,但能让你在被追问的时候站得住。指标本身该怎么挑、哪些老指标在AI时代已经开始骗人,该换掉哪些骗你的老指标 (https://zhangwenbao.com/ai-search-kpi-blind-spot-metric-swap.html)那篇有更完整的清单。 ## AI引荐流量占比不到1%,这个数该怎么用才不误导老板? 两份研究在这一点上罕见地一致:一个说不到1%,一个说不到0.2%。这个数怎么用,很考验分寸。 用错的两种方式都很常见。一种是拿它当理由说这事儿不值得做——但0.2%的流量如果转化质量确实更高,而且大盘还在快速膨胀,那它就是一个正在长大的入口,不是一个可以忽略的零头。另一种是绝口不提这个比例,只报绝对值和增长率,等哪天老板自己发现分母有多小,前面所有汇报的可信度会一起崩掉。 正确的做法是主动把它摆在最显眼的位置,然后接一句:现在小,但它的成本结构和成长曲线值得我们现在就占位。零点击环境下该怎么补足这类间接证据,零点击时代的归因怎么补 (https://zhangwenbao.com/ai-search-attribution-zero-click-proxy-signals.html)那篇列的代理信号可以直接接上来用。 ## 为什么“AI可见度份额”这个指标最容易被做成虚荣指标? 几乎每家工具都会给你一个声量份额之类的数,看着专业,涨起来也让人愉悦。它的问题不在于假,而在于它离生意太远,却长得太像结果。 拆开看有三处松动: - 分母是谁定的。同一个品牌换一批提问词,份额能差出一倍。而提问词往往是工具或者你自己挑的,挑的时候人是有偏好的。 - 单次查询不可靠。同一个问题反复问,答案里出现的品牌和顺序都会变,所以任何基于少量查询算出来的份额,误差都不小,这件事本文开头已经提过一次。 - 被提到不等于被推荐。答案里出现你的名字,可能是在做正面推荐,也可能是在陪跑,甚至是在做反面对比。份额这个数把这三种情况揉成了一个。 所以它可以当做过程指标看趋势,但不能当成结果指标去考核。判断标准很简单:如果这个数涨了三成而订单一动不动,你会不会去查原因?如果不会,那它就不该出现在考核表里。相关的完整做法在AI可见度竞品分析怎么做 (https://zhangwenbao.com/ai-visibility-competitive-analysis-share-of-voice.html)里有拆解,那篇讲的是怎么用好它,本文提醒的是别把它用错地方。 ## 出海做多市场,这三层还要多考虑哪几件事? 单市场的做法搬到多市场,会有几个地方直接失效。 - 各市场的引擎份额完全不同。北美和欧洲用户常用的助手,跟东南亚、中东可能不是同一批。分类规则要按市场分开维护,用一份全球清单会漏掉一大截。 - 语言影响引用来源。同一个问题用英文问和用当地语言问,答案引用的站点结构差异很大。做增量实验的时候,语言必须作为分组变量,不能混在一起算。 - 地理留出的可用地区更少。单个市场里量够大的地区不多,很多站被迫改用开关式测试。这不是退而求其次,是现实条件下的正确选择。 - 时区会污染短周期观察。跨时区的数据在按天切片的时候容易出现假的周期性,观察窗留长一点能把这类噪声抹平。 还有一条经常被漏掉:不同市场的品牌认知基数差得很远。在一个刚进入的市场里,品牌搜索量的相对涨幅会非常好看,因为基数太小。拿这个数去跟成熟市场比,得出的结论会完全反过来。 ## 隐私法规和同意模式,会把这三层削掉多少? 这一条在出海场景下绕不开,而且它削的是最底层的那块地基。 用户没有同意统计类脚本运行的时候,引荐层的会话直接不进你的后台。这意味着在同意率偏低的市场,你算出来的AI引荐量还要再往下打一折。增量层受影响小一些,因为它比的是两组之间的差,只要两组的同意率相近,差值仍然可读。影响层里的自报归因反而是最抗打的——那是用户在下单页主动填的,属于业务数据,不依赖统计脚本。 有意思的是,这个顺序跟三层的可测性正好反过来。最容易测的引荐层受法规影响最大,最难测的影响层反而最不受影响。所以在同意率低的市场,把自报归因这个字段做扎实,性价比比想办法修复统计数据高得多。 ## 未来12到24个月,这件事的形状大概会怎么变? 不用水晶球也能推出个大概,因为每条线的驱动力都很清楚。 会变的 | 往哪变 | 为什么 | 引荐识别 | 越来越标准,最后变得无聊 | 产品会主动亮明身份,分析工具会跟上 | 完整归因 | 做成广告产品,付费才有 | 已经建好了,只等铺开 | 供应商话术 | 向“归因和增量分开说”收敛 | 市场最终会惩罚吹过头的那批 | 免费的自然归因 | 不会出现 | 从来没有人有理由建它 | 最后一行是这张表的重点。前三行都会让日子好过一些,但没有一行能把最后一行改掉。 ## 一个出海咖啡设备独立站,三个月怎么把这三层搭起来? 保哥手上有个做家用半自动咖啡机和磨豆机的客户,主要打北美和澳洲,客单价不低,决策周期偏长——买这类东西的人会先在网上泡好几周,看评测、看参数、问哪台适合入门。这种品类天生是AI搜索的重灾区,因为用户的问题全是“预算三千以内该选哪台”这种适合被一句话回答掉的。 三个月是这么走的: 第一个月只做引荐层。先把渠道分组规则重写,把已知的AI产品域名整理成清单,再叠上落地页特征和链接参数。改完之后重新跑历史数据,发现之前被归进直接流量的会话里,有相当一部分具备典型的AI来路特征。这个月没有做任何优化动作,纯粹是把尺子校准了。 第二个月做增量设计。按历史走势把北美几个州配成两组,一组推进内容改造,另一组完全不动。同时在下单成功页加了自报归因字段,选项里单列了几个AI助手的具体产品名。这个月的重点是忍住不看数——两周之内什么都看不出来,早看只会自己吓自己。 第三个月开始读数。实验组在AI答案里的出现率明显高于对照组,这一层是干净的。自报归因字段里选了AI助手的订单开始出现,虽然占比不高,但它是唯一一个能证明有人真的从对话里走过来还掏了钱的证据。 值得说的是那个自报字段带出来的意外收获:好几条开放输入框里写的是“朋友让我问AI,AI推荐的”。这条路径没有任何埋点能捕捉,如果不问,永远不知道它存在。 ## 那次判断失手:把品牌搜索上涨全算成AI的功劳,后来怎么发现不对的? 同一个客户,第三个月的时候差点出个岔子。 当时品牌搜索量涨得挺好,团队的第一反应是这说明AI可见度工作起效了。保哥当时也是这么想的,还在周会上讲了。后来做品类大盘对比的时候才发现,同期整个家用咖啡设备品类的搜索都在涨——原因是有档热门的家居节目播了一期意式咖啡的内容,把整个品类的关注度抬了一截。 把品类基线扣掉之后,属于这个品牌自己的超额部分小了很多,虽然仍然是正的,但远没有原始数字那么好看。这件事之后那份报表加了一行固定项:品类大盘同期变化。多一行字,少一次尴尬。 诚实说一句,就算扣完基线剩下的那部分,也没法完全归给AI,因为同期还投了一轮达人合作。这就是影响层的真实处境——你能做的是不断缩小不确定的范围,而不是消灭它。 ## 老板要一个数,你到底该报哪个数? 老板要的通常是一个能写进汇报的单一数字,而这套三层结构给不出单一数字。硬凑一个出来是很多人翻车的起点。 比较稳的讲法是分三句话: - 第一句报引荐层的实测值,并说明这是下限。 - 第二句报增量实验的结论,用相对值不用绝对值,比如实验组的出现率比对照组高多少。 - 第三句报影响层的方向性证据,自报归因里有多少人提到AI,品牌需求扣掉大盘之后的走向如何。 三句话讲完,通常老板就明白这不是一个能压成一个数的问题。真正麻烦的从来不是老板听不懂,而是我们自己先假装它能被压成一个数。怎么把这类结构性的东西讲给不看数据的人听,先把测量框架设计清楚再上工具 (https://zhangwenbao.com/measurement-framework-before-ga4-setup.html)里有一整节在处理这件事。 ## 这套东西落地,最容易在哪几步翻车? 按踩坑频率排: - 分类规则写完就不管了。AI产品的域名和跳转方式换得比想象中勤,清单三个月不更新就开始失真。 - 留出组被人偷偷改了。实验做到一半有人手痒优化了两个页面,整组数据作废,而且往往到分析阶段才发现。 - 把出现率当成营收证据。这是最常见的一种偷换,出现率涨了不等于钱多了,中间的转化链条一步都不能省。 - 自报归因样本太小就急着下结论。前两百个订单里有三个选了AI助手,这什么都说明不了。 - 拿别人研究的数字直接套自己的生意。发行商的11倍、电商的0.2%,都是特定样本的结论,你的站得自己测。 - 把多触点归因模型的锅算到AI头上。模型选择本身就会大幅改变各渠道的功劳分配,多触点归因模型怎么选 (https://zhangwenbao.com/dtc-multi-touch-attribution-model-selection.html)那篇讲的问题跟AI没关系,但经常被混为一谈。 ## 大家真正缺的,是更准的数字还是敢信的数字? 把那份调研的开放回答连起来读,浮出来的东西挺意外。 大家喊得最响的是归因,但真正让人难受的,不是缺一个更准的数,而是不敢相信眼前已经有的那些数。有人说不信任追踪工具,有人说没法判断读出来的东西准不准,有人说因为不信所以不敢投入。这不是功能缺口,这是信任赤字。 这份不信任有一部分是完全合理的——一个建立在“设计好的缺席”和过度承诺之上的市场,本来就不该被无条件相信。但如果把全部原因都推到市场那边,也不老实。另一部分是老习惯撞上了新情况:把做SEO的那套反射动作原样搬进一个不按那套规则运转的环境,又跳过了搞清楚到底哪里变了这一步,因为“GEO就是SEO”这个说法,比真相舒服得多。 这一部分占多大比例,谁也量不准,只能从会上、群里、日常对话里读个大概。但只要它还占着相当一块,就不是哪家供应商出个新功能能解决的。那是认知的欠账,得自己还。消费者那边其实也在同步发生类似的事,用的人越来越多、信的人越来越少 (https://zhangwenbao.com/ai-search-adoption-rises-trust-declines.html)讲的是同一枚硬币的另一面。 ## 从今天起,先做哪三件事最划算? 不用等任何人,这周就能开工: - 重写渠道分类规则,把AI来路从直接流量那个垃圾桶里捞出来,并在报表上标明这是下限。这件事投入最小,认知收益最大。 - 设计一个最小的增量实验,哪怕只是锁定二三十个提问、做一轮内容改动前后对比。跑过一次,你对这套东西的理解会跟没跑过的人拉开距离。 - 在下单成功页加上自报归因字段,选项里单列AI助手。成本几乎为零,而它是唯一能照进暗漏斗的那束光。 三件事都不需要平台点头,也不需要采购预算。等那份永远不会来的报表,反而是这三件事里最贵的一个选项——它花的是时间。 ## 常见问题解答 ## AI搜索的归因数据,以后真的完全不会开放吗? 完整的、免费的、给自然流量运营者的那种,基本不会。付费的那种正在到来,它会以广告产品的形式出现,绑定广告账户。判断依据不是猜测,而是各家已经公开的产品结构:广告侧的转化回传体系已经建好上线,自然侧连路线图上都看不到对应的东西。 ## 那些声称能提供AI归因的工具,是不是全都在骗人? 不是。区别在于它们闭环用的是什么数据。靠第一方数据的产品是真的,能把引荐这一层看清楚,只是覆盖范围有限;暗示数据来自模型公司内部的,要么是把来路识别包装了一下,要么就是不实陈述,因为那个数据源并不对第三方开放。 ## 引荐、增量、影响这三层,如果只能做一层该做哪层? 先做引荐层。它成本最低、见效最快,而且是另外两层的基础——分类规则不准,后面的实验和相关性分析全都建在流沙上。做完引荐层再补增量实验,影响层放最后。 ## 为什么同样是AI流量,有的研究说转化极好,有的说很一般? 因为在数不同的动作。测注册这类低承诺动作时,AI引荐访客的表现会非常突出;测掏钱下单时,优势就收窄很多。再加上样本站型不同,发行商和电商站本来就不可比。看到这类数字先问三句:测的什么事件、样本是什么站、时间窗多长。 ## AI引荐流量占比这么低,现在投入是不是太早了? 占比低和值不值得做是两个问题。判断依据应该是这个入口的成长曲线、进来的人的质量,以及现在占位的成本。目前的情况是流量小、增速快、进来的人意图强,而且占位成本比它成熟之后要低。真正该避免的是把它当主渠道汇报,那才是自找麻烦。 ## 没有多个市场可以做地理留出,还能怎么证明增量? 可以用开关式测试,同一批页面做一段停一段再做,看指标是否跟着起落;也可以锁定一组固定提问,在内容改动前后各测一轮。后者最轻便,但要记住它只能证明AI答案里的出现率变了,证不到营收,汇报时别把这两件事混着说。 ## 自报归因字段用户会认真填吗?数据能信吗? 会有人乱填、记错、随手点第一项,所以它不是精确数据。但它是唯一能捕捉到未点击接触的方式,方向性的价值远大于精度。用法是看趋势和结构,不要拿单月的绝对值去做除法。 ## 把AI渠道的订单直接汇报成“AI带来的营收”,问题出在哪? 问题在于那批人里有相当一部分本来就会买。归因回答的是“这单经由哪条路进来”,增量回答的是“有没有因此多出生意”,只有跑过对照实验才有资格用后一个说法。混用这两个词,是这个行业最容易在半年后被打脸的地方。 ## 权威参考资料 ## AI可见度是主题层的游戏:85%的品类还没主人,你的机会在哪 - URL:https://zhangwenbao.com/ai-visibility-topic-ownership-category-level.html - 分类:AI监控与数据 - 发布:2026-07-22 | 更新:2026-07-22 - 摘要:AI搜索时代,一个品牌被不被推荐,取决于它在多少主题上被稳定提及,而不是自然流量或权威分有多高。这份指南用一份5万品牌的实测数据,讲清主题主导权的争夺逻辑、传统指标为什么预测不了AI可见度、怎么自查你现在占了哪些主题,以及资源有限的出海独立站该先打哪几个还没主人的主题。 - 关键词:GEO,AI搜索优化,AI可见度,品牌提及 > **TLDR**:摘要:过去半年被反复念叨的一句话,被一份跨5万品牌的实测坐实了——在AI搜索里,输赢不发生在单个关键词上,而发生在整个主题上。更刺激的是,1094个美国品类里,只有15.2%找得出一个明确的主导品牌,剩下85%还是无主之地。传统那套自然流量、权威分,几乎预测不了谁能拿下一个主题;能沾上边的只有品牌搜索量。这篇把这份研究拆开,讲清楚主题层争夺的机制、为什么越热门的品类越没主人、被提及和被引用为什么只有21%重合、主导权拿下之后能不能守住,以及出海独立站该怎么把优先级重排一遍。 > 摘要:过去半年被反复念叨的一句话,被一份跨5万品牌的实测坐实了——在AI搜索里,输赢不发生在单个关键词上,而发生在整个主题上。更刺激的是,1094个美国品类里,只有15.2%找得出一个明确的主导品牌,剩下85%还是无主之地。传统那套自然流量、权威分,几乎预测不了谁能拿下一个主题;能沾上边的只有品牌搜索量。这篇把这份研究拆开,讲清楚主题层争夺的机制、为什么越热门的品类越没主人、被提及和被引用为什么只有21%重合、主导权拿下之后能不能守住,以及出海独立站该怎么把优先级重排一遍。 先说一个很多人没意识到的错位。你打开一个AI可见度工具,看到的往往是一条条关键词、一个个引用链接。于是你下意识地把AI搜索当成又一个排名榜——盯着某个词,想办法让自己被引一次。但AI答案的组织方式根本不是这样。它不是一个词配一个链接,而是围绕一个主题,把好几个来源揉进一段话里,最后端给用户一个结论。 换句话说,用户记住的不是你被引用了,而是在这个主题下AI推荐了谁。这就是为什么一份新的实测数据一出来,做GEO的人都在转:AI可见度是主题层的游戏。这句话听着像口号,但这次它背后有5万个品牌的样本撑着。 这个错位之所以要紧,是因为它直接决定你把力气花在哪。如果你以为AI可见度是关键词的加总,那你会继续把预算摊到几百个词上,每个词薄薄地优化一层,结果哪个主题都没占住。如果你认清它是主题层的争夺,你的动作会完全不同:先划出该占的主题,集中火力在少数几个上做到被稳定提名,而不是在一大片词上平摊到没有存在感。同样的预算,两种世界观打出来的结果天差地别。这篇想做的,就是把这份研究里那些看着抽象的百分比,一条条翻译成你明天就能动手调整的判断。 ## 为什么说AI可见度是一场主题层的争夺,而不是关键词排名? 传统SEO里,你可以为几百个长尾词各自优化一个页面,每个词都能单独拿到一点流量,积少成多。这套打法在关键词检索的世界里成立,因为搜索结果是一个个蓝链接,谁排前面谁得点击,颗粒度就是单个查询。 AI搜索把这套颗粒度打碎了。当用户问一个问题,模型不会只回一条链接,而是先在内部把这个问题扩成一串相关子问题——这就是所谓的查询扇出,我在查询扇出Query Fan-out的底层机制 (https://zhangwenbao.com/query-fan-out-ai-search-mechanism-geo.html)那篇里拆过它怎么把一个问题拆成十几个。扇出之后,模型把这一整片子问题的答案汇成一段,落到某几个反复出现的品牌上。你被拎出来的前提,不是你在某个词上排第一,而是你在这一整个主题的语义空间里,被模型认成了这个领域该提的名字。 所以颗粒度从关键词抬到了主题。你可以在单个查询里被引一次,却在整个主题下从来不被提名——就像一场宴席,你的名片被夹在资料袋里发下去了(被引用),但主持人介绍嘉宾时从头到尾没念到你(没被推荐)。真正决定生意的是后者。 这不是说关键词从此没用了。它更像是在关键词这张地图之上,又叠了一张主题的地图。你还是要靠具体的页面去承接具体的查询——那是地基,塌不得;但你衡量成败、分配资源、判断输赢的单位,得抬到主题这一层。一个只会数关键词排名的团队,会在AI搜索里持续困惑:明明有几个词排得不错,怎么AI就是不提我。答案往往是,那几个词分属不同主题,每个主题你都只沾了一点边、谁都没占住,自然没有一个主题愿意认你当代表。 ## 那份覆盖5万品牌的实测,到底是怎么做的? 这份研究由Semrush联合Growth Memo的创始人Kevin Indig完成,标题直接叫《AI可见度是一场主题层的游戏》。它的规模是这类研究里少见的大:覆盖1094个美国品类、5万多个品牌,背后是22万个域名、60万条引用、22万个URL,时间跨度是2026年1月到6月,用的是Semrush自家的AI可见度工具箱去追ChatGPT的答案。 方法上有个细节值得记住:每个品类不是只问一句话,而是配了5种提问,分别对应买家旅程里的5类问题——要定义、做对比、找替代品、看使用场景、下购买决策。这样设计是为了不让某一种问法的偶然结果污染结论。一个品牌要在一个品类里算数,得在这5种提问里稳定地冒头,而不是碰巧在一句话里被提了一次。 为什么强调这个?因为市面上很多AI可见度研究彼此打架,一个很大的原因就是提问集太随意、样本太小,换一批提示词结论就翻盘。关于这些研究为什么互相矛盾、该按什么顺序去读,我在AI可见度竞品分析全流程 (https://zhangwenbao.com/ai-visibility-competitive-analysis-share-of-voice.html)里专门辨过一轮。这份Semrush的样本量和受控设计,属于比较能站住脚的那一档。 还有一层设计上的讲究值得点出来:用5类买家问题去覆盖一个品类,等于逼着模型从5个不同角度表态,而不是只在一个角度上碰运气。一个品牌如果只在其中某一类问法里冒头(比如只在对比类里被提,定义、场景、购买里都没影),那它顶多算在这个主题里有个侧影,谈不上主导。研究把主导权的门槛卡在多数提问都得稳定露脸,正是为了滤掉这种一招鲜的偶然。这也提示你自己测的时候,别拿一句话的结果就下结论——一个主题得从多个角度问过一遍,你在里面的位置才算数。 ## 85%的品类还没有主人,这个数字意味着什么? 研究先给主导权下了个定义:一个品牌要算某个品类的明确主导者,得在这个品类的多数提问里稳定地被提及、并且领先其他品牌。按这个尺子量下来,1094个品类里,只有15.2%有明确的主导者。 剩下的呢?31.2%属于有个冒头的领先者——它在至少3种提问里出现了,但还没拉开够格的差距;还有53.7%干脆是未定局,没有任何一个品牌能在5种提问里的3种以上稳定露脸。两块加起来,85%的品类没有一个说了算的主人。 这个数字对不同心态的人,读出来是两种味道。悲观的人看到的是连主导者都这么稀有,我更没戏了。但换个角度,这其实是AI搜索早期最大的一块红利:绝大多数主题还是无主之地,谁先在一个主题里把名字打进去、把差距拉开,谁就有机会长期占着。这跟一个成熟的关键词SERP完全不同——那里前三名早被啃得死死的,你挤进去要掀翻别人;而这里更像刚开盘的空地,先到先得的窗口还开着。 为什么会空出这么大一片?一部分原因是AI搜索还年轻,绝大多数品牌的动作还停在关键词层,压根没意识到要按主题去占位,自然也就没人认真去占。另一部分原因是主题主导权这东西,不是靠砸预算一夜能买来的——它需要品牌需求和第三方语境的慢慢积累,这道时间门槛把很多想走捷径的玩家挡在了外面。这两条合起来,就造成了眼下这个略显奇特的局面:机会大把地空着,却没多少人用对的姿势去拿。对愿意扎实做、又下手早的品牌,这是难得的错配窗口。 对资源有限的出海独立站,这条尤其关键。你不必去硬撼一个已经有主人的大品类,完全可以挑几个还没定局、又跟你产品相关的细分主题,集中火力先把它们拿下。 ## 主导者、冒头者、未定局,这三种状态该用三种打法吗? 该。把85%的无主之地笼统当成一块空地,是要吃亏的——它其实分成性质完全不同的两块,加上有主人的那一块,一共三种状态,每种状态该做的事都不一样。 第一种是已有主导者(15.2%)。这类主题里坐着一个把差距拉开了的品牌,你正面硬刚的性价比很差。对它,要么绕道去打相邻的细分,要么老老实实做长线,别指望三个月掀翻别人。第二种是有冒头者(31.2%)——有个品牌在多数提问里都露脸了,但差距还没拉够。这类主题是最微妙的:它既可能一个月后固化成有主人的局,也可能被后来者顶回未定局。如果那个冒头者是你,赶紧补一程把差距做厚;如果冒头的是别人,而你也有积累,这是少数还来得及抢的窗口,动作要快。第三种是未定局(53.7%)——没有任何品牌能稳定占位,是最干净的空地。这类主题谁认真做、谁先把品牌名和它绑牢,谁就有机会从零建立主导权。 所以看到一个主题空着就冲进去,是新手动作。老手会先分清这块空地到底属于哪一档:是相邻有强主人、你其实在陪跑,还是真未定局、值得下注,抑或是有人刚冒头、你必须抢时间。判断错了状态,力气全花在错的地方。 ## 为什么越热门的品类,反而越没人能主导? 这份研究还挖出一个反直觉的对照:高需求的热门主题里,只有11.3%有明确主导者;反倒是低需求的冷门主题里,这个比例是19%。越是大家都盯着的大蛋糕,越没有一家能独占。 道理其实不难想。热门品类里挤满了品牌,谁都在发内容、谁都被提到几句,模型面对的候选太多,很难把票集中投给某一家,于是长期处在群雄割据、谁也不占绝对上风的状态。冷门主题候选少,只要有一两家认真做,模型很快就把这个主题跟它们绑定了。 但这里有个陷阱不能不提:那些顶部的高需求主题,虽然主导者稀有,却吃掉了样本里98%的AI搜索量。也就是说,无主的热门主题是一片巨大的、但也异常拥挤的战场;无主的冷门主题好占,可它带来的实际曝光量小。真正的活儿是判断——哪些主题既还没定局、需求又不至于小到没意义,那才是你该先下注的地方。这跟传统SEO里挑长尾词的取舍逻辑是相通的,只是这次的单位从词变成了主题。 对出海独立站,我更倾向的打法是从中间地带切入:别一头扎进那个吃掉98%流量的顶级热门主题去跟一群人挤,也别沉到没人问的极冷门里自嗨。找那些需求中等偏上、还没定局、又跟你产品强绑定的主题——它们没大到人人都盯着、竞争固化,也没小到占了也没曝光。先在这样几个主题里把主导权做实,攒起一块稳定的AI可见度根据地,再拿它当跳板,去够那些更热门、相邻的主题。一上来就啃最硬的骨头,多半是崩了牙、肉没吃到。 ## 传统SEO指标,为什么预测不了谁能主导一个主题? 这大概是整份研究里最扎心、也最有用的一段。团队拿主导者和非主导者去比几个经典SEO指标,看它们能不能预测谁能拿下一个主题,结果相当冷峻: - 自然流量:主导者只在48.4%的对比里领先——基本等于抛硬币,统计上不显著。 - 权威分(Authority Score):主导者在52.5%的对比里领先,同样没到统计显著的门槛。 - 品牌搜索量:主导者在55.7%的对比里领先,是唯一一个达到统计显著性的指标。 Kevin Indig对这段的总结很直接,大意是:传统那套SEO指标,不足以解释谁能拿下一个主题。这句话值得每个还在拿自然流量汇报AI进展的人抄下来贴在显示器上。你的自然流量翻倍、权威分涨了十分,跟你在AI答案里被不被提名,几乎是两条不相干的线。 这也解释了一个很多人踩过的坑:传统SEO做得很扎实、各项工具评分都漂亮,AI里却查无此人。GEO三层可见性指标拆解 (https://zhangwenbao.com/geo-visibility-metrics-scoring.html)那篇讲的就是这种排名和引用脱钩的结构,这份数据等于从另一个角度把同一件事又砸实了一遍。 ## 品牌搜索量是唯一的信号,这对出海独立站是好消息还是坏消息? 先说结论:一半一半,但可操作的那一半更重要。 坏消息是,品牌搜索量这东西没法一夜刷出来,它是真实需求的沉淀,做不了假。你没法像堆外链那样,一个月就把一个陌生品牌的搜索量拉到主导者的量级。好消息是,它指明了真正该使劲的方向:与其继续在页面上做微雕、盼着某个词被引一次,不如去做那些能沉淀品牌需求的事——让更多真实的人记住你的名字、主动搜你。 而且换个角度想,这个坏消息对小品牌反而是保护。正因为品牌需求刷不出来、只能慢慢攒,那些财大气粗、习惯用预算碾压的大玩家,在这条赛道上的优势被削弱了——他们没法花钱买一个主题的主导权。这给了愿意在一个细分主题里长期深耕的小品牌一个公平得多的机会:你不需要跟大厂比谁烧钱猛,你比的是谁在这个具体主题里,被真实用户记得更牢。对出海独立站来说,这几乎是最友好的一条规则了——它奖励的是扎实和专注,不是账上的余额。 对出海独立站,这意味着GEO和品牌建设不再是两条平行线,而是拧成了一股。红人合作、社群运营、公关露出、第三方媒体提及,这些过去被算作品牌预算的动作,现在同时是喂给模型的可见度信号。你在目标市场被越多真实用户记住,模型就越倾向在相关主题里提你。品牌搜索量之所以能预测主导权,本质是它替模型代言了一件事:这个名字,是这个领域里真的有人在乎的名字。 顺带说一句,这也给出海品牌一个不太舒服但很实在的提醒——如果你的品牌需求全长在中文世界,英文引擎那边的主题主导权,你是很难凭空拿到的。需求信号得落在目标市场的语言和语境里才算数。 ## 为什么品牌搜索量能预测,自然流量却不能? 值得多想一层:为什么偏偏是品牌搜索量这个指标沾上了边,而自然流量、权威分这些更硬的数字反而失灵? 关键在于,这三个指标替模型代言的东西不一样。自然流量高,说明你在传统搜索里拦得住流量,但这跟你是不是这个领域该被提名的品牌没有必然联系——一个靠海量长尾词堆出流量的站,可能在任何一个主题上都没有存在感。权威分是工具厂商基于外链等信号算出来的分,它衡量的是SEO意义上的强弱,同样不直接等于品牌认知。而品牌搜索量不一样:一个人愿意直接搜你的名字,背后是他已经知道你、记住你、认你是这个领域里的一个答案。这恰恰是模型在推荐环节想找的东西——不是谁的SEO做得猛,而是谁在真实世界里被当成了这个主题的代表。 说白了,模型没法直接读到人心里对一个品牌的认知,它只能找一个能代言这种认知的可观测信号,而品牌主动搜索量正好是这样一个信号。这也把GEO的重心从纯技术活,往回拉了半步到品牌本身——你在真实用户心里的位置,比你在爬虫眼里的分数,更能决定AI提不提你。想深挖实体和品牌认知怎么被搜索引擎与AI消化,实体权威怎么建的四阶段协作框架 (https://zhangwenbao.com/entity-authority-ai-search-seo-content-collaboration.html)那篇是配套的读物。 ## 被引用和被提及,为什么只有21%重合? 这份研究做了一件很多工具偷懒不做的事:它衡量主导权,用的是品牌在答案正文里被提及,而不是答案底下列出的引用链接。这两件事听着差不多,数据一比才发现分叉得厉害——最常被引用的域名,和最常被提及的品牌,只有21%重合。 翻译成人话:AI在底下列出来当来源的那些站,跟它在正文里张口推荐的那些品牌,八成对不上。你可能是那个被反复当资料引用的站(比如一篇写得很扎实的评测),却不是那个被端到用户面前推荐的品牌;反过来,一个几乎不被当来源引用的品牌,可能正是模型在正文里逢人就提的那个名字。 举个好懂的场景。用户问某类产品哪个牌子好,AI回了一段:先推荐了A、B、C三个品牌,段末又挂了几个链接,指向某家评测站和某个论坛帖。这里被提及的是A、B、C——它们进了用户的候选购物清单;被引用的是那家评测站和那个论坛——它们只是被当作了支撑这段话的证据。如果你是那家评测站,你会在引用统计里看到自己名列前茅,兴高采烈;可用户记住要去搜、去买的,是A、B、C,没你的份。这就是为什么只盯引用数会误判形势:你数的是自己作为证据被翻了几次,而不是自己作为答案被端了几回。 这条直接影响你该盯哪个数。如果你的仪表盘只数引用次数,你很可能对着一个跟生意关系不大的指标自我感动。被引用衡量的是你的内容作为素材有没有被采纳,被提及衡量的才是你的品牌作为答案有没有被端出去。关于这两套机制的分工,分清被检索和被引用的两套打法 (https://zhangwenbao.com/ai-citation-retrieval-content-strategy.html)那篇拆得更细,这份21%的数据算是给它补了个量化注脚。 ## 那到底该盯被提及还是被引用? 两个都要盯,但要分开盯、别混成一个数。 把被引用当作供给侧信号:它告诉你,你的内容有没有进模型的素材池、够不够格被当来源。这一层靠的是内容质量、结构清晰、事实密度,是地基,不能塌。把被提及当作结果侧信号:它告诉你,在真正给用户的推荐里,你的品牌名有没有被念出来。这一层靠的是品牌需求、第三方语境、以及你在这个主题里被绑定得够不够牢。 一个常见的误区是把两者当成一件事的两个阶段——以为被引用多了自然就被提及多了。21%的重合率正好否定了这个想当然。它们是两条独立的线,各有各的杠杆,得分开投入、分开衡量。有一类特别尴尬的情况:你的内容被当来源引了一堆,模型却把客户推给了竞品——这跟自夸式榜单失效是同一枚硬币的两面,我在自夸式榜单被点名后的合规改造 (https://zhangwenbao.com/self-promotional-listicles-ftc-google-crackdown.html)里算过一笔引用转推荐率的账,可以对照着看。 ## 主导权一旦拿下,真的守得住吗? 这是很多人最关心的问题:好不容易在一个主题里冒头了,会不会下个月就被别人挤下去,白忙一场? 数据给的答案偏乐观。那些已经是明确主导者的品牌,在逐月对比里,90.4%的情况下都保住了第一。也就是说,一旦你真的把一个主题拿下、拉开了差距,它的稳定性相当高,不太会一夜易主。这跟传统SERP里前三名天天洗牌的体感很不一样。 但别高兴太早,稳定的只是已经拉开差距的那一档。研究同时统计了那些还没定局的品类——在5470次逐月对比里,头名换人的有1950次,接近三分之一。换句话说,割据状态下的领先是脆的,今天你冒个头,下个月可能就被顶回去。守得住的前提,是你已经把差距做到了够安全的宽度。 把这两半拼起来看,主导权其实有个很清晰的相变过程:从未定局,到有人冒头,到差距拉开、固化成有主人。跨过固化那道坎之前,一切都是可逆的、脆的;跨过之后,稳定性陡增,90.4%的月份纹丝不动。你要做的,就是尽快把自己从脆的那一半,推过那道坎,进到守得住的那一半。这也解释了为什么半途而废最亏——你在割据阶段投了不少,眼看要冒头却撤了火力,等于把前面的投入喂给了后来居上的人,自己什么护城河都没留下。要么别开这个主题,要么就一口气推过固化线,中途放手是最差的选择。 ## 领先多少个百分点,才算真正安全? 研究给了一个特别实用的阈值感。它对比了两种情况下领先者的典型领先幅度:当领先者最终丢了第一,它当初的领先幅度中位数只有大约1.3个百分点;而当领先者守住了第一,它的领先幅度中位数大约是2.9个百分点。 这个对比给了你一条可以拿去做决策的线:领先1个百分点上下,基本等于没领先,随时会被顶掉;把差距做到接近3个百分点,才算摸到了守得住的门槛。这也回答了资源分配的问题——在一个你已经微弱领先的主题里,与其见好就收、把火力分散到新主题,不如再补一程,把这1个多百分点的脆弱领先,拉到3个百分点的安全线,让它真正变成你的护城河。先发优势在这里是真实存在的,但它只对那些愿意把领先做厚的人兑现。 ## 既然拿下就守得住,为什么说现在不入场就晚了? 把两个数据放到一起看,会推出一个挺紧迫的结论。一边是85%的主题还没有主人,空地大把;另一边是明确主导者90.4%的月份都守得住第一。这两条合起来说明:AI搜索的主题地图,正处在一个从无主到有主的划分阶段,而一旦被谁划走、差距拉开,后来者再想改写就难了。 这跟成熟市场的逻辑正好相反。传统SERP里,因为排名天天在洗,你今天进不了前三,明天还有机会;而AI主题主导权一旦固化,稳定性高到让翻盘变成一件很贵的事。所以现在这个窗口的价值,不在于容易——85%无主不代表随便占,前面讲的挑主题、做厚差距都是硬功夫;它的价值在于门还开着。等这些主题一个个被划走、主导者把差距做到安全线,你再进场,面对的就不是空地,而是一个个90.4%守得住的堡垒。 这话不是催你无脑扩张。恰恰相反,它是在提醒你把有限的资源,尽早押到那几个还没主人、又真正相关的主题上,别把时间耗在一个已经有堡垒的大品类里反复撞墙。早,且准,比多重要。 也别把早入场误读成抢跑就赢。窗口开着,不等于站上去就是你的——研究里那么多冒头者最后被顶回未定局,就是抢跑之后没跟上、差距没做厚的下场。早入场真正的价值,是让你在一个还没有强主人的主题里起步,起跑线相对平;至于最后能不能立住招牌,还得看你有没有把品牌需求和第三方语境实打实地攒起来、把那1个多百分点的脆弱领先推过安全线。窗口给的是入场券,不是冠军奖杯。把这点想明白,你既不会因为门开着就盲目乐观,也不会因为主导者稀有就干脆躺平。 ## 这套发现,跟被引不等于被荐是同一件事吗? 有必要把几层概念掰清楚,不然容易糊成一团。 被引不等于被荐讲的是:你进了答案、被当来源引用了,却没被推荐给客户。品类框定讲的是:同一个品牌,换一个提问的品类词,AI推不推你能整体反转——我在品类框定决定AI推荐名单 (https://zhangwenbao.com/category-framing-ai-brand-recommendation.html)里拆过New Balance在不同品类词下从1%到90%的对调。而这份Semrush研究讲的主题主导权,是再往上抬一层的全景:在一整个主题里,到底有没有主人、主人是谁、拿指标能不能预测、拿下之后守不守得住。 三者是嵌套关系,不是互相替代。品类框定决定你出现在哪个主题的候选池里;被引和被提及是你在这个池子里的两种不同待遇;主题主导权则是把全行业铺开看,你在这张地图上占了几块、占得牢不牢。做GEO的人得同时在这三层上有动作,只盯一层都会有盲区。 打个比方,这就像开店选址加经营的关系。品类框定是你把店开在了哪条街上——开错了街,客流根本不是你的目标客户,再努力也白搭。被引和被提及是顾客进了这条街之后,是把你当橱窗看看就走(被引用当资料),还是真进来买单(被提及被推荐)。主题主导权则是站在全城的地图上看,这条街到底是你说了算、还是隔壁那家说了算、又或者整条街还没有谁立住招牌。三件事发生在不同尺度上,缺哪一层的判断,你的GEO都会有个盯不到的死角。 ## 一个家用健身器材出海站,怎么用主题层思路重排优先级? 举个具象的例子。有个做家用健身器材的出海DTC,主打筋膜枪、可调哑铃和折叠训练凳,之前的GEO打法是典型的关键词思路:把几十个产品词各自优化一遍,盯着每个词在AI里被引没被引。忙活半年,报表上引用数涨了,生意没什么动静。 按主题层思路重排之后,动作变了。第一步不是挑词,而是先划主题:把业务拆成几个用户真会问的主题——比如居家力量训练怎么入门、小空间健身怎么配置、筋膜枪怎么挑。第二步是拿每个主题的5类提问(定义、对比、替代、场景、购买)分别到2到3个AI引擎里问一遍,数自己在多少提问里被提及(不是被引用)。这一测就看清了:在居家力量训练入门这个大主题里,早有几家占着,自己怎么补都只是陪跑;但在小空间健身配置这个还没定局的细分主题里,几乎没人稳定占位。 于是把火力从那个已经有主人的大主题撤出来,集中到小空间这个无主主题上:不是继续堆产品页,而是去攒品牌需求和第三方提及——找垂类红人做真实的小户型健身场景内容、进几个靠谱的第三方器材横评、在社群里把品牌名和这个场景反复绑定。衡量上,他们不再数引用总数,而是每两周测一次自己在这个主题5类提问里的提及率,盯着它稳步往上爬。这里要诚实交代:同期他们也在优化产品页结构和邮件营销,所以最终的提升不能全记在主题重排这一件事上,只能说方向对了、动作没白费。 过程里有两个判断挺能说明问题。一是他们一度想同时也抢那个已有主人的大主题,觉得反正内容都做了、顺手带一带。后来算了笔账:在大主题里,他们测下来自己的提及率长期贴着零、对手差距远超3个百分点,属于典型的怎么补都是陪跑,于是果断把这条线停了,资源全归拢到小空间那条。二是他们没有一上来就大改官网,而是先花了一个多月,把小空间健身这个主题在外部语境里的提及攒起来,等到几家红人和横评里都自然出现了品牌名,才回头去优化对应的自有内容——顺序对了,自有内容的改动才接得住外部带来的势能。这两个动作背后,其实就是前面那套挑主题、分清供给侧与结果侧、把领先做厚的逻辑,落到一个具体生意上的样子。 ## 一个只盯自然流量的失败案例:指标全涨,AI里还是查无此人 反过来看一个栽跟头的。另一个做户外庭院用品的出海站,团队很勤奋,半年里自然流量涨了差不多七成,几个SEO工具的权威分也跟着往上走。老板看着这些数字挺满意,理所当然地以为AI可见度会水涨船高。 结果到年中一测,在自己核心主题的那几类提问里,AI答案从头到尾没提过他们一次。团队一开始不信,反复换问法测,结论没变。问题恰恰就是这份研究点破的那条:自然流量和权威分,几乎预测不了主题主导权,它们涨得再好看,也不自动换来AI里的一句提名。他们把精力全押在了那两个统计上不显著的指标上,却一直没去碰真正显著的那个——品牌搜索量,也没有分主题地去数自己的提及率。等于蒙着眼睛跑了半年,跑的还是条通不到终点的路。 这个案例的教训不是自然流量没用——它当然有用,是地基。教训是别把地基当屋顶,别拿一个预测不了目标的指标,去汇报一件它根本不负责的事。 更值得警惕的是这种错位的隐蔽性。自然流量涨、权威分涨,这些数字会给团队一种一切向好的错觉,让人心安理得地不去碰真正的问题。等到某天客户或老板直接问一句在AI里搜咱们这类产品能不能看到咱,才发现半年积累的漂亮指标,在这个问题面前一句话都答不上来。这半年不是没努力,是努力对着错的靶子——比什么都不做更可惜,因为它消耗了资源,还买来了虚假的安心。定期做一次分主题的提及自查,本质就是给自己装一个防错位的警报,别等外部一问才发现跑偏了。 ## 一个主题到底该切多大?太宽抢不动,太窄没人问 把颗粒度从关键词抬到主题,紧接着就会撞上一个问题:主题这东西没有天然边界,切多大全凭你划。切错了,后面所有的测量和投入都跟着歪。 切得太宽,比如把整个健身器材当成一个主题,你面对的是一个高需求、又几乎不可能独占的巨型战场,投进去大概率是陪跑。切得太窄,比如某个具体到型号参数的问法,倒是容易占,可根本没多少人这么问,占了也没意义。真正值钱的颗粒度,落在中间那一档——用户真会这么问、需求撑得起、竞争又还没固化的那种主题。判断的抓手很简单:把它当成一个用户会原样问出口的问题去念,念着别扭的(太窄或太术语),或者大到一句话根本答不完的(太宽),都不对。 还有个实用技巧:跟着那5类提问的骨架去切。一个好的主题,应该能自然地衍生出定义、对比、替代、场景、购买这5种问法。如果一个主题你连这5类问题都凑不齐,多半是切得太窄了;如果每一类都能再裂成一堆完全不同的子问题,那可能是切得太宽、该往下拆一层。这个骨架既是研究的测量单位,也顺手帮你校准了颗粒度。 颗粒度这件事,很多团队是被迫踩坑之后才学会的:一开始图省事按大品类划,测了几轮发现自己在每个大主题里都排不上号,很受挫;后来把主题拆细,才发现原来在某个细分角度上,自己其实早就被稳定提及,只是被大颗粒度的平均值盖住了。所以如果你第一次测下来满盘皆输,先别急着下自己没戏的结论,很可能只是主题切得太粗,把你已有的那点优势稀释没了。往下拆一层再测,结论常常大不一样。 ## 怎么自查AI现在把哪些主题算在你名下? 不用等买什么高级工具,一套轻量自查就能起步。 先列主题,别列词。把你的业务拆成8到12个用户真会问的主题,颗粒度是主题不是关键词——是家用咖啡机怎么选,不是某个具体型号。每个主题按那5类提问各写一句自然的问法,凑成一张提问表。然后拿这张表,到2到3个主流AI引擎里逐条问,只记一件事:这段答案的正文里,有没有念到你的品牌名。念到了记1,没念到记0。 跑完一轮,你会得到一张主题×提及的地图。你被稳定提及的那些主题,就是AI当前算在你名下的地盘;你想赢却一次都没露脸的,是你要补的方向;那些偶尔冒一下、不稳定的,就是还没定局、值得再加一把力的机会点。这套自查跟竞品声量份额的测法 (https://zhangwenbao.com/ai-visibility-competitive-analysis-share-of-voice.html)是一套底层逻辑,区别只是这次把镜头对准自己、并且颗粒度落在主题上。 想更进一步,就在同一张表里,把两三个主要对手也一起测了。每个主题下,记下你和对手各自在几类提问里被提及。这样你得到的就不只是自己占没占,而是每个主题的主导权归属——是空着没人占(你的机会),是对手已经拉开差距(暂时别碰),还是你俩都只沾了点边、谁也没占牢(该抢的窗口)。这张加了对手列的表,基本就是你排优先级的作战地图了。它不需要什么高级订阅,一个人一下午手动就能跑出第一版,贵的是坚持每隔两三周复测、把趋势记下来。单次的数会飘,连续几轮的走向才是真信号。 ## 找没主人的主题,具体按什么顺序打? 拿到地图之后,别看见空位就一拥而上,排个序再动手。 第一优先,是还没定局、又跟你产品强相关、需求也不算太冷的主题——这类是性价比最高的入口,先到先得的窗口还开着,拿下的成本远低于去撬一个有主人的大品类。第二优先,是你已经微弱领先、但差距还没到安全线的主题——回去把那1个多百分点的脆弱领先补到接近3个百分点,把它从随时会丢,做成真正守得住。至于那些已经有强主人、你又毫无相关积累的热门主题,往后放,甚至短期内别碰,硬撼的投入产出比通常很差。 这个排序的精神,跟传统SEO里先摘低垂果实、再啃硬骨头是一致的,只是判断维度从关键词难度,换成了主题的主导权状态加需求量。会挑主题,比会写内容更早决定成败。 ## 挑好了无主主题,怎么真把品牌名打进去? 挑对主题只是选好了战场,接下来得真在这个主题里被模型认成该提的名字。既然唯一显著的信号是品牌搜索量、而推荐环节靠的是第三方语境,那打法就顺理成章地落在两条腿上。 第一条腿,是在这个主题的语境里制造真实的品牌提及。找垂类里真做内容的红人、媒体、社群,让你的品牌名和这个主题在别人的内容里反复一起出现——不是买一堆没人看的软文,而是进那些用户真会去查证、去参考的地方。模型在推荐时检索的是这些外部语境,不是你的官网。第二条腿,是把自有内容做成模型愿意采纳的素材,让你在供给侧也够格。这一层回到内容本身:结构清晰、事实密度高、能被单段抽走。两条腿缺一条都跛:只做自有内容,你可能被引用却不被提及;只买外部提及、自己内容拿不出手,模型采信你的成本又太高。 这里有个顺序上的坑得提醒:很多人上来就急着改官网文案、堆schema,指望这样就能被推荐。但如果你的外部语境全空着,改再多自有字段也撬不动推荐环节——那更像是把最漏风的窗户晾着,先去补衣柜门缝。先在目标主题里把第三方提及攒起来,自有内容的优化才有地方生根。想把品类和语境这层再吃透,可以接着看品类框定怎么决定AI推荐名单 (https://zhangwenbao.com/category-framing-ai-brand-recommendation.html)那篇里第三方语料和知识图谱各管一半的拆解。 具体到出海独立站,制造真实提及有几条投入产出比不错的路子值得排个序。最快见效的,是进目标市场里真有人参考的横评、清单、社区问答——让品牌名和你选定的那个主题,在这些用户会去查证的地方自然共现。其次是做垂类红人的真实场景内容,注意是真实使用、不是硬广,模型和用户都越来越能分辨。再往长里做,是持续产出能被别人引用的原创数据或观点,让别人主动提到你——这条最慢,但一旦成了,是最扎实的护城河。这几条的共同点是:它们制造的都是发生在你自己网站之外的品牌痕迹,而那正是模型在推荐环节真正会去翻的地方。反过来,任何只发生在你自己站内、外人看不见也不会引用的动作,对推荐环节的撬动都极其有限。 ## 衡量效果,该看哪几个数才不自欺欺人? 把该看的和别被带偏的分清楚。 该看的第一个数,是分主题的提及率——同一批目标提问,你在多少比例的答案正文里被念到名字,按主题分开统计,定期多测几轮取稳态。第二个数,是主导权的稳定性——你在一个主题里的领先,是不是逐月都守得住、差距有没有往3个百分点的安全线靠。这两个数,才对应研究里真正预测生意的东西。 别被带偏的,是引用总数这种虚荣指标。数引用次数容易涨、也好看,但它跟被推荐只有21%的重合,涨了半天可能跟生意没多大关系。同样要提防单次测量的噪声——AI答案本身有随机性,同一个问题多问几次结果会飘,所以任何一次的名次波动都别太当真,看的是多轮取稳态之后的趋势。关于怎么给AI可见度搭一套不自欺的衡量体系,三层可见性指标 (https://zhangwenbao.com/geo-visibility-metrics-scoring.html)那篇提供了更完整的脚手架,可以接着往下搭。 还有个容易被忽略的第三类数,值得单独记一笔:跟领先幅度挂钩的稳定性。你在一个主题里的提及率就算涨到了第一,也得看这个第一守了几个月、跟第二名的差距有没有往安全线靠。研究里那个丢了第一的领先者,当初也是第一,只是差距薄,一阵风就吹翻了。所以别在刚冒头、差距还只有1个百分点上下的时候就宣布胜利、撤掉火力——那正是最容易被顶回去的时刻。把这三类数摆在一起看:分主题的提及率告诉你现在占没占,稳定性告诉你占得牢不牢,而引用这类供给侧信号只当地基体检、不当成绩单,你的仪表盘才算对着正确的东西。 顺便说个汇报层面的实在建议:给老板看的那份AI可见度数字,最好是你自己能复现的。别拿一个来路不明、换个人测就对不上的第三方分数去汇报,那种数字经不起追问。分主题提及率这套,胜在你随时能重跑一遍、把过程摊开给人看,可信度天然就高。 ## 中文出海站做这件事,有什么特别要注意的? 有两点,踩了就白干。 第一,品牌需求这个唯一显著的信号,必须落在目标市场的语言里。你在中文世界攒的品牌搜索量,对英文引擎判断你能不能主导某个英文主题,帮助非常有限。想赢英文主题,就得在英文语境里被真实用户记住、主动搜索,这活儿绕不过去。这也意味着,出海品牌的GEO投入和当地市场的品牌建设,实际上是同一笔钱在办同一件事,别把它们拆成两个部门、两个预算各干各的,那样两头都做不厚。 第二,主题和品类的叫法,各市场不一样,别机翻。同一件产品,在不同国家用户嘴里的主题词可能完全不同——你按中文思维直译过去的那个主题名,也许根本不是当地人会用来提问的说法。所以划主题、写那张提问表的时候,得按每个目标市场单独校准,用当地用户真正在用的主题词,而不是你自己翻出来的。这一步做歪了,后面测得再勤,量的也是一个没人问的主题。 ## 这份研究的边界在哪,哪些结论别过度外推? 数据再漂亮,也得知道它的适用范围,不然容易把一份特定条件下的结论,当成放之四海的铁律。 第一,样本是美国市场、ChatGPT这一个引擎、2026年上半年这半年的快照。机制层面的东西——主题层争夺、指标预测力弱、提及和引用分叉、主导权可守——大概率能迁移到别的市场和引擎,因为这是生成式检索的共性。但那些具体百分比,15.2%、90.4%、2.9个百分点,是这个特定切片里的数字,换个市场、换个引擎、换个时间,量级都会变。落地时搬方法,别搬数字。这一点对出海尤其要记牢:你的目标市场大概率不是美国、你面对的引擎可能是好几个混着用,直接把这份研究的数字当成你市场的现状去汇报,会闹笑话。正确的用法是拿它的方法论,去测出你自己市场、你自己那几个引擎里的那套数字。 第二,这些结论基本是相关性,不是因果。品牌搜索量和主导权正相关,不代表你刷高了品牌搜索量就一定能拿下主题——很可能两者都是同一个更深的东西(真实的品牌认知)的结果。所以别把它当成一个可以直接拉的杠杆,而是当成一个方向指针:它告诉你该往品牌认知这个方向使劲,具体怎么使、能不能兑现,还得看你自己的执行。第三,AI搜索本身还在快速变化,今天测出来的主导权格局,半年后可能因为模型换代而重新洗牌。这也是为什么前面反复强调,要定期多测、看趋势而不是看单次快照。把这份研究当成一张此刻的地图,而不是一份永久的地契——地图能指路,但路况天天在变,得靠你自己定期重新勘一遍。 ## 常见问题解答 AI可见度是主题层的游戏,这句话到底该怎么落地?意思是别再把AI可见度当成一个个关键词去抠,而是按主题来划、来测、来打。具体三步:把业务拆成用户真会问的主题,每个主题用定义、对比、替代、场景、购买这5类提问去测你在AI答案正文里的提及情况,然后按主题的主导权状态排优先级——先拿还没主人又相关的,再补自己微弱领先的,暂时避开有强主人的热门大品类。 只有15.2%的品类有主导者,是不是说明这事太难、普通品牌别想了?恰恰相反。85%的品类还没有主人,意味着现在是先到先得的窗口期。跟前三名被啃死的成熟SERP不同,AI搜索里大量主题还是空地,谁先在一个相关主题里把名字打进去、把差距拉开,谁就有很高概率长期占着(研究显示明确主导者90.4%的月份都保住了第一)。难的不是挤进去,而是挑对那个还没定局、又值得占的主题。 我自然流量涨了、权威分也上去了,为什么AI里还是不提我?因为这两个指标几乎预测不了主题主导权。研究里,自然流量的领先只在48.4%的对比里成立、权威分52.5%,都没到统计显著;唯一显著的是品牌搜索量,55.7%。也就是说,传统那套指标涨得再好看,也不自动换来AI答案里的一句提名。想被提,得去做能沉淀品牌真实需求的事,并且分主题地衡量提及率,而不是盯着流量自我感动。 被引用和被提及,我平时该盯哪个?两个都盯,但分开盯。被引用是供给侧信号,说明你的内容够格进模型素材池,是地基;被提及是结果侧信号,说明你的品牌名有没有被真的端给用户,是生意。两者只有21%重合,涨一个不等于涨另一个。仪表盘上把它们做成两个独立的数,别混成一个引用总数糊弄自己。 领先幅度到底做到多少才安全?研究给了个很实用的参照:丢掉第一的领先者,当初的领先中位数只有约1.3个百分点;守住第一的,约2.9个百分点。所以领先1个百分点上下基本等于没领先,随时会被顶掉;把差距做到接近3个百分点,才算摸到守得住的门槛。在一个你已微弱领先的主题里,值得再补一程把领先做厚,而不是急着分散火力。 这份研究测的是ChatGPT,结论能套到别的AI引擎吗?机制层面大概率能迁移——主题层争夺、指标预测力弱、提及和引用分叉、主导权可守,这些是生成式检索的共性,不是ChatGPT独有的。但具体的百分比、各引擎的偏好会有差异,所以落地时别照搬数字,而是把方法搬过去:分主题、按提及测、多引擎交叉验证、取稳态看趋势。数字会变,方法不变。 出海独立站资源有限,第一步先做什么?先做那张主题自查地图,成本最低、信息量最大。列8到12个用户真会问的主题,各配5类提问,到2到3个AI引擎里逐条测提及。跑完你就知道自己现在占了哪些主题、哪些是还没主人又相关的机会点。把第一笔资源押在那个最划算的无主主题上,而不是继续在有主人的大词里陪跑。 主题该切多大,有没有一个简单的判断标准?有个好用的土办法:把这个主题当成一个用户会原样问出口的问题去念。念着别扭、太专业太窄的,或者大到一句话根本答不完的,都不合适;落在中间那档、用户真会这么问、又能自然衍生出定义对比替代场景购买这5类问法的,才是合适的颗粒度。太宽你抢不动,太窄没人问,两头都是白费力气。 我该继续做传统关键词SEO吗,还是全转去做主题?两个不是二选一。传统关键词SEO和内容质量是地基,塌了模型连把你当素材采纳都做不到,不能丢。变的是你衡量成败和分配资源的单位——从数关键词排名,抬到看主题层的提及与主导权。地基照打,但眼睛要抬到主题这一层看全局,别再拿几个词的排名当AI可见度的成绩单。 ## 权威参考资料 ## ChatGPT来的电话更容易成线索,却没更容易成交:7000万通电话拆出的漏斗真相 - URL:https://zhangwenbao.com/ai-referred-calls-lead-rate-close-rate-funnel.html - 分类:AI监控与数据 - 发布:2026-07-19 | 更新:2026-07-19 - 摘要:49% 这个比率的分母到底是什么、厂商自己发的基准报告该按什么顺序读、近一半来电没人接为什么长期没人认领、跨行业平均值为何只能取形状不能取数值、拿线索率去要预算会在哪三步翻车,写给要向老板解释AI渠道价值的独立站与外贸团队。 - 关键词:AI搜索,ChatGPT,数据口径 > **TLDR**:摘要:Invoca的2026年线索转化基准报告拆了7000万通电话,结论是ChatGPT转介来的电话成线索的比例达到49%,比全渠道均值高约10个百分点,比第二名的谷歌商家资料还高6个点;可这批线索真正当场成交的比例是40%,反而略低于全渠道42% 的均值。也就是说,AI带来的优势集中在漏斗中间那一段,进门那一段和临门一脚那一段都没跟上。更要紧的是这份报告有四件事没说:49% 的分母是多少、测量窗口是哪一段时间、归因具体怎么判、除ChatGPT之外的助手为什么不在表里。这篇把接通、成线索、成交拆成三笔独立的账,给出小样本自查的土办法、归因能盖住和盖不住的分界线,以及电话之外把同一套分段度量搬到表单和即时通讯上的做法。 > 摘要:Invoca的2026年线索转化基准报告拆了7000万通电话,结论是ChatGPT转介来的电话成线索的比例达到49%,比全渠道均值高约10个百分点,比第二名的谷歌商家资料还高6个点;可这批线索真正当场成交的比例是40%,反而略低于全渠道42% 的均值。也就是说,AI带来的优势集中在漏斗中间那一段,进门那一段和临门一脚那一段都没跟上。更要紧的是这份报告有四件事没说:49% 的分母是多少、测量窗口是哪一段时间、归因具体怎么判、除ChatGPT之外的助手为什么不在表里。这篇把接通、成线索、成交拆成三笔独立的账,给出小样本自查的土办法、归因能盖住和盖不住的分界线,以及电话之外把同一套分段度量搬到表单和即时通讯上的做法。 ## 先把这组数字摆清楚:高的是哪一段,不高的是哪一段 先说数据出处。Invoca在2026年7月13日发布了2026年线索转化基准报告 (https://www.invoca.com/reports/the-invoca-lead-conversion-benchmarks-report-2026),样本是它自己平台上跟踪并分析过的通话,覆盖10个行业、7个营销渠道,总量超过7000万通电话、6亿分钟通话内容。Invoca自己卖的就是通话跟踪和对话分析,这一点后面还会再提。 报告里最抓眼球的一句话是:ChatGPT转介来的电话,成线索的比例是49%,在所有渠道里排第一。全渠道均值大约39%,第二名是谷歌商家资料的43% (https://ppc.land/chatgpt-calls-convert-to-leads-at-49-beating-every-channel-invoca-finds/)。也就是说ChatGPT比均值高约10个百分点,比第二名高6个点。 紧接着的一句话就没那么好听了:这批线索最终当场成交的比例是40%,而全渠道均值是42%。Invoca自己的措辞是“大致属于平均水平”。 两句话摆在一起,事情就有意思了。同一批电话,在漏斗的一个环节上遥遥领先,到下一个环节就掉回大部队里。绝大多数转述这条新闻的人只抄了前半句,连官方新闻稿的标题都写成了“最好的线索现在从ChatGPT开始” (https://www.prnewswire.com/news-releases/new-invoca-data-finds-the-best-leads-now-start-in-chatgpt-302823196.html)。后半句被安静地留在了正文第三段。 做这行久了会有个条件反射:一个指标突然特别好看的时候,先别急着庆祝,先看看它的上游和下游。保哥的经验是,单点指标越漂亮,越有可能是漏斗别处在漏。 ## 49% 这个数字到底是怎么算出来的? 要读懂49%,得先知道Invoca的分母是什么。它统计的是“被跟踪到的通话里,有多少通被判定为合格销售线索”。判定动作由它的对话分析做,也就是听录音、抠关键词、按客户预设的规则打标。 这里有个容易被忽略的前提:这不是“有多少人打了电话”,也不是“有多少人最后付了钱”,而是中间那一道筛子。筛子的孔径由每个客户自己设定,Invoca只是把这些客户的结果汇总起来算平均。 所以49% 的准确读法是:在那些用了Invoca、并且把ChatGPT来源单独打了标的商家里,被ChatGPT送来的电话,通过各家自定义的线索判定规则的比例,平均是49%。这句话比“ChatGPT线索质量最高”啰嗦得多,但它才是这个数字真正的意思。 Invoca还提到,这是它第一年攒够了足够的通话量,能把生成式AI单独列成一个渠道类别,和付费搜索、自然搜索、谷歌商家资料、付费社交并排放。Search Engine Journal在报道里把“报告没说什么”单列了一节 (https://www.searchenginejournal.com/chatgpt-calls-turn-into-leads-more-often-invoca-report/582400/),这个处理比原始新闻稿克制得多,也是我愿意多花时间读它的原因。 ## 厂商自己发的基准报告,该怎么读? 这里插一段方法论,因为它适用于你今后读到的每一份行业基准报告。 Invoca卖的是通话跟踪和对话分析。它发这份报告的商业动机很清楚:让你相信“打进来的电话里藏着你没看见的生意”,然后来买它的产品。这不是什么见不得人的事,几乎所有行业基准报告都是这个逻辑,Ahrefs发外链研究、Semrush发关键词研究,动机都一样。 关键不在于有没有立场,而在于立场会把数字往哪个方向推。读厂商报告时,我习惯先问三个问题。 第一,样本是谁?永远是这家厂商的客户,不是全行业。能用得起通话分析系统的商家,本身就比平均水平更重视电话、投入更多。所以任何“接起率”“线索率”的绝对值,都天然高于真实的行业平均。 第二,哪个数字对它有利?“电话线索质量高”对通话分析厂商有利,“AI渠道值得单独跟踪”对它更有利——因为这直接对应一个新的付费功能。所以49% 这个数字被放到标题上,一点也不奇怪。 第三,它主动承认了什么?这一条最有价值。一份报告如果连自己的局限都愿意写出来,可信度反而更高。Invoca承认了生成式AI的整体量很低、承认了其他助手测不到,这些自曝其短的地方,恰恰是最该认真读的地方。 用这三个问题过一遍,你会发现真正值得带走的不是49%,而是“电话渠道值得按来源分段记账”这个方法论。数字会变,方法不会。 ## 为什么说接通、成线索、成交是三笔不同的账? 报告里其实还给了一组更基础的数字,被49% 的光芒盖住了。把它们排开,一条完整的电话漏斗就出来了。 ## 第一段:电话有没有被人接起来 所有打给商家的电话里,大约56% 被真人接起。这个数字本身就够扎心了,将近一半的电话没人接。 更有意思的是通话时长的分层:如果一通电话持续超过15秒,接起率上升到约65%;超过30秒,上升到约71%。这不是因果,是统计上的自然结果——接起来的电话才可能聊得久。但反过来看,它给了一个很实用的诊断口径:如果你的短时长通话占比异常高,问题多半出在接听环节,而不是营销环节。 ## 第二段:接起来的电话有没有算成线索 在被接起的电话里,大约38% 被判定为合格线索。这是全渠道的整体水平。ChatGPT那49% 就是在这一段上跑赢的。 ## 第三段:算成线索的有没有当场成交 在合格线索里,大约42% 在通话中就完成了转化。ChatGPT这一段是40%,略低。 三段串起来看,一通随机打进来的电话,最终当场成交的概率大约是0.56 × 0.38 × 0.42,不到9%。而这三段的瓶颈完全不在同一个部门手里:第一段归运营和排班,第二段归营销和渠道,第三段归销售和话术。 把这三段合成一个“转化率”去考核任何一个部门,都是耍流氓。这也是为什么我坚持把它拆成三笔账——不拆开,你永远不知道那个漂亮或难看的总数到底是谁的功劳、谁的锅。 ## 近一半电话没人接,这一段为什么最没人管? 把三段账排开之后,最刺眼的其实不是49%,而是56%。将近一半打进来的电话,没有真人接起。 这一段的尴尬在于,它既不归营销管,也不完全归销售管。营销的KPI停在“带来了多少通电话”,销售的KPI从“接起之后”才开始计算。中间这道最大的漏,处在两个部门的责任缝隙里,于是长期没人认领。 算一笔很粗的账就明白它的分量了。假设你把线索率从38% 提到42%,这是一次相当扎实的渠道优化,通常要花一个季度;而把接起率从56% 提到66%,最终成交量的提升幅度更大,需要做的却往往只是排班和转接规则。前者要动策略,后者只要动排班表。 几个立刻能查的地方: - 按小时看未接分布。大部分公司的未接电话高度集中在午休和下班前后那两个时段,而不是均匀分散的。看一眼分布图,问题往往自己跳出来。 - 看响铃几声挂断。如果大量未接发生在响铃三声以内,那多半是转接规则太长或者语音菜单太绕,而不是没人在岗。 - 看有没有回拨机制。未接来电十分钟内回拨的接通率,远高于两小时后。很多系统本来就有这个功能,只是没人打开。 - 看非工作时间的占比。如果你的用户是被AI助手带来的,那他们的活跃时段和你的排班表未必对得上——助手不看你的营业时间。 这一段跟本文主题的关系在于:如果第一段在漏,第二段那个漂亮的49% 就是在一个已经缩水的池子上算出来的。你以为自己在优化渠道质量,实际上前面早就丢了一半的人。 ## 10个行业混在一起算的平均,为什么对你几乎没用? 报告覆盖10个行业,包括医疗、家装、金融、电信、汽车这些典型的电话驱动型生意。把它们平均起来的那个数字,落到任何一个具体行业上都是失真的。 失真的根源在于“线索”这个词在不同行业里根本不是一回事。家装行业的一通合格线索,可能只需要确认“这个人有房、在服务范围内、有装修计划”;而金融行业的一通合格线索,可能要过资质、额度、合规三道关。前者的线索率天然就该比后者高十几个点,这跟渠道质量毫无关系。 通话长度的分布也完全不同。汽车经销商的电话平均两三分钟就能问完,医疗预约的电话动辄十几分钟。用同一条“超过30秒接起率上升到71%”的规律去套两边,结论会很滑稽。 所以看这类跨行业基准,正确的姿势是只取形状,不取数值。形状是“AI渠道在中段领先、在末段回落”,这个形状很可能在你的行业里也成立;数值是49% 和40%,这两个数跟你没关系。 顺带说一句,这也解释了为什么各家AI流量研究的结论老是打架——不同的样本行业构成,能把同一个现象算出两个方向。Semrush那份覆盖60万关键词的商业意图研究 (https://www.semrush.com/blog/ai-overviews-commercial-search-study/)就发现了一个形状相近的现象:商业意图查询的AI概览覆盖增长了71%,而更靠近成交的交易意图查询反而回落了5%。中段扩张、末段收缩,和电话数据是同一副骨架。 ## AI转介的人,为什么进门时看着更对口? 先说清楚:下面这一段是机制推断,不是报告结论。Invoca只给了数字,没给解释。 最直白的一条:能在助手里问到你、并且问完还愿意抄起电话打过来的人,本身就已经过了好几道筛子。他先得有一个具体到需要打电话的问题,再得在助手的回答里看见你,最后还得觉得这个回答不够、值得再问一句真人。这三道筛子筛掉的都是闲逛的人。 对比一下自然搜索。搜索结果页上一排十个蓝链,用户点进来的那一刻,很可能还处在“我先看看有哪些选择”的阶段。助手的回答通常只推两三家,能从里面走到你电话上的人,位置天然更靠后。 这跟站内之前拆过的AI来的流量转化率高,落地页却接不住 (https://zhangwenbao.com/ai-referral-traffic-conversion-landing-page.html)是同一个现象的两个切面:那篇讲的是这批人落到网页上之后你接不接得住,这篇讲的是他们绕开网页直接打电话之后,销售侧接不接得住。两处漏的是不同的水。 ## 那为什么优势到成交这一步就没了? 这是我觉得整份报告里最值得琢磨的一个反常。同样一批“更对口”的人,到了掏钱那一刻反而不如平均水平。有三条假说值得摆出来,同样都是推断,我把它们的可验证程度也标出来。 ## 假说一:AI已经把功课替他做完了 用户在助手里已经完成了选型、对比、排除。他打电话过来不是来听你介绍的,是来确认某几个具体细节的。销售那套“先了解需求再顺势推荐”的流程,对他基本无效——他的需求已经被自己定义完了,你顺不上势。 这条相对好验证:调几通AI渠道的录音,听开场三十秒。如果客户上来就问具体型号、具体价格、具体交期,而不是“你们都做些什么”,这条就成立。 ## 假说二:AI顺手把价格和条款的预期也定死了 助手在给建议的时候,往往会连带说出一个价格区间、一个交付周期。这个数字可能来自你三年前的旧页面,可能来自某个第三方聚合站,也可能是模型自己拼出来的。用户拿着这个预期打过来,销售一开口报价,落差就出来了。 这条也能验证,而且验证成本很低:拿几个你的核心问题去问助手,看它报给你的价是多少。保哥见过一个做工业配件的客户,助手给出的报价区间是他实际报价的六成——那批线索接得再多也白搭,销售每次都得先花十分钟解释为什么贵。 ## 假说三:他跳过了你自己那套预热 正常的自然搜索路径里,用户会先落到你的页面上,看到你的案例、你的资质、你的服务承诺,被你自己的话术预热一遍再联系你。AI转介的人很可能一页都没看过,他对你的全部印象来自助手那一两句话。 信任是要垫的。这批人身上,你一层都没来得及垫。 ## 这份报告没说的四件事,哪一件最该让你警惕? 接下来这一节,是我认为这条新闻里最有价值、也最容易被跳过的部分。 ## 没说49% 的分母是多少 Invoca明确表示,生成式AI带来的整体通话量“仍然非常低”,但没有公布ChatGPT那一栏的绝对数量。同样是一个比率,从几百通电话里算出来的49%,和从几十万通付费搜索电话里算出来的39%,可信度差着量级。 小分母上的比率会剧烈跳动。今天49%,下个季度可能是41%,也可能是55%,而这中间未必发生了任何真实的变化。这一条最该警惕。 ## 没说测量窗口是哪一段时间 报告的方法论只说了行业数和渠道数,没写起止日期。这意味着你没法判断这个数字反映的是哪一个阶段的市场状态。AI助手的用户构成在过去一年里变化极快,早期用户和现在的用户完全是两拨人。 ## 没说归因具体怎么做的 Invoca把一部分电话标成了“ChatGPT转介”,但没说这个判定是怎么下的:是用户从助手里点了链接跳到你的落地页、再拨了页面上的追踪号码?还是用了某种专属号码?还是别的方式? 报告只承认一点:它只统计“能直接归因到ChatGPT”的通话,不包括那些在助手里研究了半天、然后用未被跟踪的方式联系你的人。这句话的信息量很大——它等于承认了统计口径存在一个已知的缺口,而缺口的大小未知。 ## 没说Gemini、Claude、Perplexity去哪了 渠道拆分表里只有ChatGPT。Invoca特意说明,这是测量能力的限制,不是对其他助手的评价——在它的数据集里,ChatGPT是唯一产生了可测量通话量的大模型。 这句澄清很克制,但它同时也提醒你:如果你的用户主要在别的助手里活动,这份报告的结论对你的参考价值要打折。 ## 你后台那个漂亮的AI转化率,是不是小样本在骗你? 上面的第一条警惕,几乎每个自己拉数据的人都会撞上。你在GA4或者CRM里把AI来源单独拎出来,一看转化率好得不像话,兴冲冲跑去汇报,结果下个月数字塌了。 给三条土办法,不需要统计学背景也能用。 第一,先看分母够不够。经验门槛是:算比率的那一栏,样本数低于30就基本没有参考价值,低于100只能当趋势看,到300以上才值得写进汇报材料。这不是什么严格的统计学结论,是拍脑袋定的实用线,但它能挡掉绝大多数自欺欺人。 第二,用一个粗糙的波动区间。把比率记作p,样本数记作n,那么这个比率的大致波动幅度约等于两倍的根号下p乘以(1减p)再除以n。听着绕,实际算起来很快:50个样本、40% 的转化率,波动幅度大约是正负14个百分点。也就是说你看到的40%,真实值落在26% 到54% 之间都不稀奇。这个区间一算出来,很多“惊人发现”当场就没了。 第三,看连续几周稳不稳。一个真实的差异会稳定地出现在连续多个周期里。如果某个渠道的转化率上上下下像心电图,那多半就是噪音。这条最简单,也最有效。 站内那篇SEO行业基准数据大全 (https://zhangwenbao.com/seo-industry-benchmarks-data-reference-guide.html)里讲过口径陷阱,和这里是一脉相承的事:别人的数字要先弄清是怎么算的,才谈得上能不能对标。 ## 归因能盖住的和盖不住的,怎么画这条线? Invoca那句“只统计能直接归因的通话”,值得展开成一张图。把用户从助手走到你这里的路径按可追踪程度分成四类: 第一类,点击可追踪。用户在助手回答里点了你的链接,落到你的页面上,页面上的号码是动态追踪号,他拨了。这一类归因链条完整,Invoca统计的应该主要是这一类。 第二类,号码可追踪但来源模糊。用户点了链接进来,但没马上打电话,过了两天直接拨了收藏的号码。这一类能追到号码,追不到来源,通常被记成直接流量。 第三类,用户自己说出来。他在助手里看到了你,没点链接,直接搜了你的品牌名找到号码。这一类只有靠销售在通话里问一句“您是怎么找到我们的”才能捞回来。 第四类,彻底追不到。他在助手里记住了你的名字,两周后在别的场合想起来,通过完全无关的路径联系你。这一类永远不会出现在任何报表里。 第一类是Invoca的统计范围,第二类和第三类要靠你自己补,第四类只能认。这也正是站内讲零点击时代归因怎么补 (https://zhangwenbao.com/ai-search-attribution-zero-click-proxy-signals.html)那篇的核心难题——代理信号不是为了求精确,是为了在追不到的地方留下一条可以论证方向的线索。 如果你已经在投Google Ads,还有一条被低估的补漏路径:把线下通话结果回传成转化 (https://support.google.com/google-ads/answer/6275629?hl=en)。用转发号码和通话按钮资产做基础,按来电号码加通话开始时间的模板把成交结果上传回去,广告侧才看得见第三段。要留意两个细节:号码得用E.164格式,而且导入的转化删不掉,格式错了只能将错就错。 最实用的一条建议:在销售话术里加一句来源询问,并且把答案结构化地记进CRM。这是成本最低、回报最高的补漏动作,很多公司做了但没把答案做成可统计的字段,最后全散在备注栏里,等于没做。 ## 电话不是你的主渠道,这套账还怎么记? 说到这儿要承认一个现实:这份报告的场景是北美的电话经济。家装、医疗、汽车、金融这些行业,一通电话就是一单生意的开始。中文出海和国内的生意结构不太一样,电话往往不是第一联系方式。 但漏斗分段这套方法是通用的,换个载体就行。把三段账映射过去: - 接通率对应的是“发出的第一条消息有没有被回复”。WhatsApp的消息送达率、企业微信的加人通过率、询盘表单提交后的邮件回复率,都是这一段。 - 线索率对应的是“回复了的人里,有多少问到了具体需求”。这一段最需要人工或规则打标,也是最容易偷懒不做的一段。 - 成交率对应的是“问到具体需求的人里,有多少走到了报价、样品、合同”。 做外贸独立站的,可以直接把询盘表单当电话用:表单来源分渠道打标,第一段看有效提交率(去掉垃圾提交),第二段看销售判定为有效询盘的比例,第三段看进入报价环节的比例。三段分开记,不出一个季度就能看出AI渠道到底强在哪一段。 顺带说一句,很多人做到第一段就停了,因为第一段的数据是系统自动产生的,后两段要人去打标。可偏偏是后两段才回答“这个渠道值不值得投”。省的那点力气,全变成了后面的糊涂账。 ## 拿这个数字去要预算,会在哪一步翻车? 这是最现实的一节。假设你想用这份报告去说服老板加大GEO投入,最容易翻车的三个地方: 第一,你引的是行业均值,老板问的是你自己的数。Invoca的49% 是它平台上一堆商家的平均,跟你没有任何关系。拿它当自己的预期,第一次复盘就会被打脸。正确的用法是:拿它当“这件事值得测量”的论据,而不是“我们能做到49%”的承诺。 第二,你只报了线索率,没报成交率。如果你只讲“AI渠道线索质量最高”,老板批了预算,半年后一看营收没动,这笔账就算到你头上了。老老实实把两个数字一起报,反而更安全:线索质量确实更高,但当前的成交转化没有优势,所以投入的重点应该同时放在销售侧的承接上。 第三,你没说样本量。如果你自己的AI渠道一个季度只有40通电话,任何比率都不该被当成结论。这时候诚实的说法是“信号为正但样本不足,建议再观察一个季度”,而不是把40通电话算出来的数字画成一条上升曲线。 这三条其实是同一件事的三个面:用别人的数字论证方向,用自己的数字论证成绩。混着用,早晚出事。站内那篇AI搜索流量的数字为什么互相打架 (https://zhangwenbao.com/ai-search-traffic-decline-numbers-unverifiable.html)拆过同一周里两个方向相反的行业数字,逻辑是一样的:外部数字用来定方向,不用来定KPI。 ## 效率冠军和规模冠军,预算到底该给谁? 报告里还有一句被普遍忽略的话:付费搜索仍然是带来通话量、线索量和转化量最多的渠道;对多门店企业来说,谷歌商家资料是最大的自然来源。Invoca特意提醒,渠道效率和渠道规模是两个不同的因素,光看百分比看不出哪个渠道带来的生意最多。 这话说得很克制,但意思很硬:ChatGPT是效率冠军,付费搜索是规模冠军,这两顶帽子不能互相顶替。 打个不太严谨的比方:一个渠道每月带来20通电话、49% 成线索,另一个每月带来2000通、39% 成线索。前者的比率好看得多,后者一个月多出来的线索是前者的四十多倍。你要是按比率分预算,会把钱全押在那20通电话上。 正确的做法是两个维度分开看,然后交叉决策: - 规模大、效率高——加投,这是主战场,通常是付费搜索或品牌词。 - 规模大、效率低——先修承接,别急着砍量。效率低往往是落地页或话术的问题,不是渠道的问题。 - 规模小、效率高——这就是当下的AI渠道。适合投入的是“研究它为什么高”,而不是“立刻把预算搬过来”。它的规模由平台侧决定,你砸钱也放大不了多少。 - 规模小、效率低——观察名单,不投入不砍掉,攒够样本再说。 把AI渠道放在第三格,是我目前认为最诚实的位置。它值得你认真测量、值得你为它调整销售话术,但把它当成下个季度的增长引擎,多半会失望——因为你控制不了它的进水量。 ## 那到底该怎么给老板汇报AI渠道? 给一个可以直接抄的汇报结构,四句话: 一、这个季度AI渠道带来了多少条可归因的联系,绝对数是多少。先给绝对数,再给比率,顺序不能反。 二、这些联系在三段漏斗上分别是什么表现,和其他渠道比强在哪段弱在哪段。这是这篇文章的全部价值所在。 三、样本量够不够支撑结论,够就下结论,不够就明说要再观察多久。主动承认不确定性,比被人问出来强得多。 四、基于以上,下个季度打算改什么、预期改完哪个数字会动。要预算的部分放最后,且必须挂在一个具体指标上。 保哥带过的团队里,最快建立信任的那些人,往往不是数字最好看的,而是每次都能说清楚“这个数字有多可信”的。 ## 从今天起可以动手的六件事 - 把渠道漏斗拆成三段记账。不管你的载体是电话、表单还是即时通讯,第一段接触率、第二段有效率、第三段成交率,分开存,分开看。 - 给AI来源单独打标。落地页加来源参数、销售话术加来源询问、CRM加结构化的来源字段,三件一起做才闭环。 - 去助手里问一遍自己的核心问题。看它怎么描述你,尤其看它报的价格和交期对不对。这一步半小时就能做完,很多人从来没做过。 - 抽听十通AI渠道的对话记录。听开场三十秒,判断客户是带着问题来的还是带着答案来的,这直接决定销售话术要不要改。 - 给每个比率标注样本量。报表里的每一个百分比后面都跟上分母,这个习惯能挡掉大量误判。 - 先别改产品,先改承接。数据显示优势在中段丢失,那么优先级最高的动作是销售侧的承接,而不是继续加大前端投入。 ## 常见问题解答 ## ChatGPT转介的电话线索率49%,这个数字可以直接拿来当自己的目标吗? 不可以。这是Invoca平台上跨10个行业、多家商家的平均值,每家的线索判定规则还是自己设的,口径并不统一。它的正确用途是证明“AI渠道值得单独测量”,而不是给你一个可以对标的目标值。你自己的目标应该从你自己过去几个季度的基线里长出来。 ## 为什么线索率高,成交率反而略低? 报告没有给出解释,以下是推断:用助手做完调研的人,需求已经自我定义完毕,销售那套先探需求再推荐的流程用不上;助手还可能顺带给了他一个价格或交期预期,而这个预期未必和你的实际报价一致;此外这批人很可能一页你的网站都没看过,你自己的品牌话术一层都没垫上。三个因素叠加,进门时的优势到谈钱时就被抵消了。 ## Gemini、Claude、Perplexity为什么不在报告里? Invoca说明这是测量限制,不是对这些助手的评价——在它的数据集里,ChatGPT是唯一产生了可测量通话量的大模型。如果你的用户主要活跃在其他助手上,这份报告对你的参考价值需要相应打折。 ## 我的站没有电话业务,这套东西还有用吗? 有用,把载体换掉即可。接通率对应第一条消息的回复率,线索率对应回复者里问到具体需求的比例,成交率对应走到报价或合同的比例。外贸独立站可以直接用询盘表单跑这三段:有效提交率、销售判定有效询盘率、进入报价率。方法通用,数字自己攒。 ## 样本量到多少,比率才值得写进汇报? 没有绝对标准,给一条实用线:低于30基本无参考价值,30到100只能当趋势看,300以上才值得当结论写。另外可以用一个粗算的波动区间做辅助判断——把比率记作p、样本数记作n,波动幅度大约是两倍的根号下p乘以(1减p)再除以n。50个样本算出的40%,波动幅度就有正负14个百分点。 ## 接起率只有56%,这个数字正常吗?我该先修哪一段? 56% 是Invoca平台上的跨行业平均,也就是说将近一半的来电没有被真人接起。这个数字在电话驱动型行业里算是常态,但常态不等于合理。判断优先级的方法很简单:把三段的数字都拉出来,看哪一段离行业形状最远。如果你的接起率明显低于六成,那它一定是回报最高的修补点——因为它在漏斗最上游,修好之后后面两段的绝对量会同比例抬升,而且通常只需要调排班和转接规则,不需要动策略。反过来,如果接起率已经在七成以上,再往上抠的边际收益就很小了,该把精力挪到线索判定和销售话术上。 ## 销售话术里问“您是怎么找到我们的”,真的有用吗? 有用,但前提是把答案做成结构化字段而不是备注栏里的自由文本。它能捞回来的是那一类“在助手里看到你、却没点链接直接搜品牌名找上门”的用户——这部分人在任何自动归因里都是隐形的,而且往往是意向最强的一批。做了不记,等于没做。 ## 权威参考资料 ## 对手在ChatGPT里被推荐、你却查不到?AI可见度竞品分析全流程 - URL:https://zhangwenbao.com/ai-visibility-competitive-analysis-share-of-voice.html - 分类:AI监控与数据 - 发布:2026-07-18 | 更新:2026-07-20 - 摘要:AI可见度竞品分析完整方法:为什么竞品分析要加AI搜索这块屏幕、该测哪些指标、怎么搭代表真实需求的提示词集、如何按引擎算声量份额、怎样定位对手的引用来源与缺席提示词,并给出行动优先级排序与一个宠物营养DTC的复盘。 - 关键词:AI可见度,竞品分析,声量份额,AI监控 > **TLDR**:摘要:过去做竞品分析,你盯的是对手的网站和第三方报道两块屏幕;到了2026年,得再加一块——对手在ChatGPT、Gemini、Perplexity这些AI搜索里被推荐、被引用的情况。潜在客户很可能在AI答案里就对你的品牌形成了印象,压根没点进任何网站。这篇讲清怎么把AI可见度纳入竞品分析:要测哪些指标、怎么搭一套代表真实需求的提示词集、怎么算你和对手在AI答案里的声量份额、怎么扒出对手是靠哪些来源被引用的,再用缺席提示词找到最快的突破口。文末附我一个宠物营养品客户从查不到自己、到把对手AI声量抢回来的完整复盘。 > 摘要:过去做竞品分析,你盯的是对手的网站和第三方报道两块屏幕;到了2026年,得再加一块——对手在ChatGPT、Gemini、Perplexity这些AI搜索里被推荐、被引用的情况。潜在客户很可能在AI答案里就对你的品牌形成了印象,压根没点进任何网站。这篇讲清怎么把AI可见度纳入竞品分析:要测哪些指标、怎么搭一套代表真实需求的提示词集、怎么算你和对手在AI答案里的声量份额、怎么扒出对手是靠哪些来源被引用的,再用缺席提示词找到最快的突破口。文末附我一个宠物营养品客户从查不到自己、到把对手AI声量抢回来的完整复盘。 上个月一个做宠物营养品的客户找到我,一上来就很焦虑:他用ChatGPT问“best joint supplement for senior dogs”,答案里推的全是竞争对手,翻来覆去就那么几个牌子,自家产品连个影儿都没有。他做了大半年SEO,Google自然排名其实爬上来了,可AI搜索这块像是另一个平行世界,他完全摸不着自己在里面是什么位置。 这不是个例。越来越多客户遇到同一个坎:传统竞品分析那套还在跑,但它漏掉了一整块正在快速长大的战场——AI搜索里的可见度。今天就把这块怎么系统地测、怎么和对手比、怎么找到差距,一次讲透。 ## 为什么“竞品分析”现在必须加上AI可见度这第三块屏幕? 传统竞品分析看两块屏幕:第一块是对手自己的网站——他们的内容、关键词、页面结构;第二块是第三方对他们的报道和讨论。这两块今天依然重要,但它们有个共同前提:用户最终会点进某个网页。 问题是,这个前提正在松动。现在大量的信息需求,用户在AI答案里就被满足了,根本不再点进任何一个网站。也就是说,潜在客户对你和对手的第一印象,很可能是在AI搜索平台里形成的——在他们访问你的站之前。这就多出了第三块屏幕:你和对手在AI答案里各自是什么形象、被不被推荐、被谁引用。 如果你的竞品分析只盯前两块,就等于漏看了客户做决策的第一现场。对手可能在你的网站数据上看着平平无奇,却已经在ChatGPT的推荐位里把你的潜在客户截走了大半。把AI可见度补进竞品分析,本质上是把分析的视野对齐到用户真实的决策路径上。Semrush在把AI可见度纳入竞品分析框架 (https://www.semrush.com/blog/competitive-analysis/)时也强调,潜在客户往往在访问你的网站之前,就已经在AI搜索平台里对你的品牌形成了判断。 这也是为什么我一直说,做GEO不能只顾自己被不被引用,还得盯着对手,因为被检索和被推荐的争夺是零和的 (https://zhangwenbao.com/ai-citation-retrieval-content-strategy.html)——AI答案的推荐位就那么几个,你多占一个,对手就少一个。传统SEO里你和对手争的是十条蓝链接的排位,AI搜索里争的是那三五个被点名推荐的名额,位置更少、竞争更凶,谁被挤出去,几乎就等于在这个问题上从用户视野里消失。 ## AI可见度竞品分析,到底要测哪几个指标? 要把这块屏幕量化,光凭感觉说“对手好像更常出现”是不够的,得落到几个可对比的指标上。我常用的是下面这一组,从粗到细。 第一个是整体AI可见度评分,通常做成一个0到100的综合分,把你在各AI平台被提及、被引用的频率折算成一个总览数字,方便和对手直接比高下。第二个是提及量,你的品牌名在AI答案里被点到的总次数,不管有没有署名链接。第三个是引用量,特指你作为可点击来源被正式署名的次数——这两个要分开看,因为被提及不等于被引用。 第四个也是最关键的一个,是在非品牌词提示下的声量份额。所谓非品牌词,就是用户不带任何品牌名、纯按需求去问的问题,比如“老年犬关节保养吃什么”。在这类问题的答案里,你的品牌占了多大比例、对手又占多大,这个声量份额(share of voice) (https://en.wikipedia.org/wiki/Share_of_voice)才真正反映你在AI心智里的自然位置。第五个是情感倾向,AI在提到你时是正面、中性还是负面。第六个是引擎分布,你的可见度在ChatGPT、Gemini、Perplexity之间是不是均衡,还是严重偏科。 这几个指标里,非品牌词声量份额是重中之重,它的逻辑和传统SEO里的内容覆盖率与声量份额 (https://zhangwenbao.com/content-gap-analysis-competitor-coverage-share-of-voice-mechanism.html)一脉相承,只是战场换到了AI答案里。像Ahrefs的Brand Radar这类AI可见度工具 (https://ahrefs.com/blog/brand-radar-use-cases/)已经把这些指标产品化,你也可以先用一张手工表格把它们记下来,重点不在用什么工具,而在于你有没有把这几个维度分开来量、再拿去和对手逐项比对。测量的颗粒度决定了你能不能看清差距到底在哪一格。 ## 第一步:怎么搭一套能代表真实需求的提示词集? 所有测量都建立在一个基础上——你拿什么问题去问AI。这套问题集(提示词集)搭得好不好,直接决定了你测出来的数据有没有代表性。搭歪了,后面全是无效功。 核心原则是:提示词要模拟你的真实潜在客户会怎么问,而不是你希望他们怎么问。我的做法是把它分成几层。第一层是纯需求型的非品牌词,用户带着问题来、不知道任何品牌,比如“怎么给老狗补关节”“老年犬软骨素有用吗”,这一层最能反映自然声量。第二层是带比较意图的,比如“XX品牌和YY品牌哪个关节补剂更好”,用来看正面交锋时AI偏向谁。第三层才是品牌词,直接问“XX品牌怎么样”,看AI对你和对手各自的既有印象。 数量上不用贪多,但要覆盖你核心品类的主要需求场景,一般三五十条精心挑过的提示词,比几百条随手凑的更有用。挑的时候可以借力关键词工具里的真实搜索词、AI搜索的相关追问、以及销售和客服那边听来的真实问法。这套提示词集一旦定下来,就要固定用它做周期性测量,这样不同时间点的数据才可比。提示词集本身也要定期复盘更新,因为用户的问法会随需求变化而漂移。 ## 怎么算“AI答案里的声量份额”,才不会自欺欺人? 有了提示词集,跑一轮就能拿到一堆原始答案。接下来要把它们折算成声量份额,这里有几个容易踩的坑。 最基本的算法是:在某一组非品牌词提示下,统计所有品牌的总提及次数,你的提及次数除以总数,就是你的声量份额。但只算这一层数字容易骗自己,得配合两个维度一起看。一是要区分提及和推荐——前面文章里说过,被AI引用不代表被推荐,所以真正值钱的是在最终推荐里占的份额,而不是被顺带提一嘴的份额。 二是要按引擎分开算,因为同一个品牌在ChatGPT和Perplexity里的份额可能差很远,混在一起平均会掩盖掉严重偏科的真相。Search Engine Land剖析为何各家AI搜索研究结论互相打架 (https://searchengineland.com/why-every-ai-search-study-tells-a-different-story-465511)时也点到,口径和引擎不统一是数据失真的主因,跨引擎混算更是最常见的自欺陷阱之一。 我的建议是做一张矩阵:行是你和几个主要对手,列是几个核心引擎,格子里填各自在非品牌词推荐里的声量份额。这张矩阵一铺开,谁在哪个引擎强、你在哪块是洼地,一目了然。测完还要定期重测,把它变成一条随时间走的曲线,才能看出你的动作到底有没有推动份额上涨。关于怎么把这套测量做成可持续的闭环,可以参考AI引用率监控的迭代方法 (https://zhangwenbao.com/monitor-measure-iterate-ai-citation-optimization-2026.html),竞品维度只是在同一套闭环上多加了对手这条基准线。 ## 对手是靠哪些来源被AI引用的,你怎么扒出来? 知道对手份额高,只是知道了结果;更有用的是搞清楚他们为什么高——AI是从哪些来源把他们捞出来推荐的。这一步是整套分析里杠杆最大的地方。 做法是:把对手在AI答案里被引用时的来源域名一个个记下来,统计哪些域名最频繁地把对手带进AI的视野。你多半会发现,这些来源高度集中在几类地方——用户生成内容的社区(比如Reddit上的真实讨论)、权威百科(比如Wikipedia词条)、垂直媒体和测评站。这些就是喂养对手AI可见度的“食料来源”。 搞清楚这张来源地图,你的行动方向立刻就明确了:对手靠哪些域名被引用,这些域名往往也是你能去争取的。人家在某个宠物垂直论坛有一堆真实好评被AI反复引用,那你就该想办法在同样的社区沉淀真实口碑;人家有一篇媒体测评被当权威来源,你就该去争取类似的第三方报道。Search Engine Journal就分析过Reddit为何在AI搜索里主导话语权 (https://www.searchenginejournal.com/why-reddit-is-driving-the-conversation-in-ai-search/556428/),Reddit等UGC社区正成为AI答案里被引用最频繁的来源之一,这类地方的真实讨论权重高得超出很多人预期。 与其漫无目的地生产内容,不如精准地去对手的食料来源里抢一份。这个思路和传统外链建设里分析对手反链、再去争取同源链接的打法,底子上是一样的,只是终点从Google排名换成了AI推荐。差别在于,AI更看重来源的真实性和可信度,你在这些枢纽里堆硬广没用,得沉淀经得起核实的真东西才会被反复引用。 ## 什么是“缺席提示词”,怎么用它找到最快的突破口? 如果说来源地图告诉你从哪补料,那缺席提示词就是告诉你先补哪一勺——它是整套分析里ROI最高的一个产出。 缺席提示词,指的是那些对手频繁出现、而你完全缺席的问题。把你的提示词集跑一遍,逐条标记:这条对手在、我不在。这些“对手在我不在”的问题,就是你最该优先攻的缺口。原因很简单:这些问题AI已经在给答案、已经在推荐别人,说明需求是真实存在、流量是现成的,你缺的只是挤进那个答案。相比去开拓一个AI还没什么标准答案的新问题,补上一个现成的缺口,见效通常快得多。 找到缺席提示词后,逐条去拆:AI在这个问题上推的是谁、引用的是什么来源、那个来源里有什么是你没有的。是你缺一篇结构清晰的深度内容,还是缺第三方的真实背书,抑或是你的内容压根没被AI有效抓取。对症下药,一条条把缺口填上。我通常会把缺席提示词按“需求量 × 补齐难度”排个序,先打那些需求大、又相对好补的,用几个快赢把团队的信心和节奏带起来。这一步做扎实,AI可见度的增长往往来得比想象中快。 ## 拿到差距清单后,先打哪几个点? 分析的终点是行动。当你手里攥着一张矩阵、一张来源地图、一份缺席提示词清单,别一股脑全上,得排出优先级。我的排序逻辑是三条。 第一,优先补需求大、你又缺席的高价值提示词,这些是现成流量,投入产出最划算。第二,优先去对手最集中的引用来源里布局——如果某个论坛或某类媒体反复喂养了好几个对手,那它就是这个品类的AI枢纽,在那儿建立存在感的杠杆最大。第三,优先修那些你已经在场、但形象是中性甚至负面的问题,把已有的曝光从“提到但不推荐”推向“正面推荐”,这比从零冒头更省力。Backlinko在讲怎么计算品牌声量份额 (https://backlinko.com/share-of-voice)时也主张同一条思路:先守住并放大已有的存在感,再去开拓空白,往往比处处开花更高效。 把这三条揉进一个季度的执行计划里,每个动作都对应清单上一个具体的缺口,而不是凭感觉发内容。执行一段时间后回到那张声量份额矩阵,看数字有没有动——这才是竞品分析真正闭环的样子:测出差距、定向行动、再测验证。至于AI到底凭什么把一个来源选进答案,背后的AI引用机制的底层规律 (https://zhangwenbao.com/ai-search-citation-mechanism-content-optimization.html)值得吃透,它能帮你判断某个缺口到底该用什么招去补。 ## 保哥的客户案例:一个宠物营养品DTC怎么把对手的AI声量抢回来? 回到开头那个宠物营养品客户。焦虑归焦虑,保哥没让他急着写内容,而是先带他把这套分析走了一遍。第一步搭提示词集,围绕老年犬关节、皮毛、肠道三个主打场景,挑了40条真实问法,纯需求型的非品牌词占了大头。 跑完第一轮,数据很扎心也很清醒:在关节这个核心场景的非品牌词里,他的声量份额是2%,三个主要对手分别是28%、22%、15%。更关键的是引擎分布——他在Perplexity几乎为零,在ChatGPT偶尔冒头。接着扒来源地图,发现对手被引用最多的来源高度集中在两处:一个知名宠物垂直论坛的长帖,和几篇宠物医疗媒体的成分测评。他的产品在这两处几乎没有任何真实沉淀。 然后是缺席提示词。40条里有17条是“对手在我不在”,其中“老年犬关节保养每天该补多少软骨素”这条需求量大、AI答案还都语焉不详,被我标成了第一优先。他们的动作也很聚焦:没有铺量写几十篇泛泛的关节文章,而是围绕这17条缺席提示词,做了8篇有一手数据的深度内容(不同体重犬只的补充量实测、成分对比表),同时推动几位养宠博主在那个垂直论坛做真实体验分享,又争取到一篇媒体的成分解析。 三个月后重测那张矩阵,关节场景的非品牌词声量份额从2%涨到了19%,Perplexity从零到能稳定冒头。涨得最快的,正是那17条缺席提示词对应的问题。这个案例最想说明的一点是:AI可见度不是玄学,把它拆成可测的指标、和对手比出差距、再定向去补,它就是一块能被系统性经营的阵地。凭感觉猛发内容,远不如先把对手这面镜子照清楚。 ## 市面上那些AI可见度研究,为什么彼此打架? 把上面这套流程跑起来之后,你很快会遇到另一个问题:想找个行业基准对照一下,结果发现各家研究给的数字对不上,甚至方向相反。 这不是因为谁在撒谎,绝大多数情况下是分母不一样。而分母这件事,恰恰是转述时最先被丢掉的。 下面几个例子都是当下被引用得最多的数据,我把它们的原始口径逐条核了一遍。看完你大概会同意一件事:拿到任何一个AI可见度数字,先问它的分母是什么,比研究结论本身更值钱。 ## “换个模式,八成推荐结果都会变”,这个八成是怎么算的? 有一项测试比较了ChatGPT开启与关闭联网搜索时的产品推荐差异,结论被广泛转述成:测试了2万条响应,产品推荐有80.2%发生变化。 这句话里的分母错了。 80.2%的分母不是2万条响应,而是关闭搜索时被推荐出来的那批产品。原始表述是:关闭搜索时被推荐的产品里,只有19.8%在开启搜索后仍然被推荐。具体到绝对数,是21786个产品里只有4037个重合。 这2种读法差别有多大?前一种听起来像“模型的回答整体上极不稳定”;后一种说的其实是“开搜索和不开搜索,命中的是2批基本不重叠的商品”。 后一种对你更有用,因为它直接告诉你:做测量的时候,联网开关必须固定下来并记录在案。同一个提示词,开与不开,测的根本是2件事,混在一起统计出来的份额没有意义。 ## 一个相关系数,怎么会被用来论证2个相反的结论? 还有个数字流传很广:被引用与被推荐之间的相关系数只有0.4,属于弱相关。这个数字常被拿来论证“进了引用来源列表没什么用,不等于会被推荐”。 回到原始出处会发现,原作者用同一个系数论证的是相反的结论。他的原话大意是:让自己出现在被引用的来源里,是提升在ChatGPT中被推荐频率最有效的做法之一。 同一个0.4,一边读成“关系不强,别费劲”,一边读成“关系确实存在,值得做”。谁对? 严格说两边都不算错,这正是相关系数这类指标的麻烦之处——它只给强度,不给方向性建议。0.4意味着被引用不是被推荐的充分条件,但它同时也意味着这是目前能找到的最强的单一关联。 实际的启发是:别把“进入引用来源”当成终点验收指标,但也别因为它不是充分条件就放弃。把它当成一个必要不充分的中间指标来跟踪,是比较诚实的做法。 ## “91%的引用只出现在一个引擎”,这个91%的样本有多大? 跨引擎重叠度是个很有价值的角度,但流传的版本同样有分母问题。 常见转述是:分析了370万条引用,发现91%的被引URL只出现在一个引擎里。 实际情况是,370万是研究里另一个视图的总语料量,而91%这个结论出自另外单独抽取的2万条提示词样本。2个数字来自同一份研究的不同部分,被转述时接到了一起。 还有一层限定也常被丢掉:那份研究的样本来自某个监测工具的客户池,地域偏向欧洲几个市场,并不是通用抽样。 这个限定对我们特别重要。做中文和亚洲市场的人,直接套用这类基准会系统性偏差,因为提示词、语言和引擎份额都不一样。它能说明“跨引擎重叠度确实很低”这个方向性结论,但具体数值别拿来当自己的目标线。 ## 一个在研究原文里根本找不到的数字 这个例子最值得警惕,因为它已经被引用了很多轮。 流传的说法是:平均要问同一个模型1500次,才能拿到2份完全相同的品牌列表。听起来很有冲击力,也很具体。 我去翻了被指为出处的那份研究全文——里面没有1500这个数字。那份研究给的是另一个表述:2次询问得到完全相同顺序的同一份列表,概率低于千分之一。 1500这个数字真正的来源,是研究作者在一档播客里的口头估算,没有公开的计算过程。 从口头估算,到被写进正文,再到被无数二手文章引用,中间没有任何一环做过核对。这条传播链本身就是个很好的教材:一个数字越具体、越好记、越适合当标题,就越值得回去查它的原文。 顺带一提,那份研究的作者自己在文中写明了不是专业研究人员、没有做置信区间计算。而转述版本里却出现了精确到正负若干个百分点的采样精度建议——这是凭空长出来的。 ## 一份研究里唯一没被压缩的数字长什么样? 说了这么多问题,也有处理得干净的例子,值得当成正面标本看。 有一份跨引擎研究给出的是区间:不同引擎之间的引用来源重叠度在16%到59%之间,跨度43个百分点;被点名的品牌重叠度在36%到55%之间,跨度19个百分点。 注意这里给的是区间和跨度,不是一个平均值。这个写法比给单一数字诚实得多,因为它把“不同引擎之间差异巨大”这个最重要的信息保留了下来。 如果它被压成一句“引擎间来源重叠度约37%”,读者就完全看不出来还有一个引擎组合只有16%。而恰恰是那个16%,才是决定你要不要分引擎单独做优化的关键。 不过这份研究也有个小坑:它统计的是被点名的品牌,转述时经常被写成被推荐的品牌。这2个动作不是一回事——被提到名字和被推荐购买,中间差着一整个决策环节。 ## 拿到一份AI可见度研究,该按什么顺序读? 把上面这些坑归纳一下,形成一个可以照着走的检查顺序: 顺序 | 要问的问题 | 答不上来的后果 | 第一步 | 分母是什么?总样本还是某个子集? | 百分比的量级可能差好几倍 | 第二步 | 样本怎么抽的?地域、语言、行业分布如何? | 结论无法迁移到你的市场 | 第三步 | 给的是区间还是端点? | 最刺眼的那个端点会被当成常态 | 第四步 | 测的是哪个动作?被提到、被引用还是被推荐? | 3个动作的难度和价值完全不同 | 第五步 | 作者跟结论有没有利益关系? | 倾向性会体现在指标的选择上 | 第五步不是阴谋论,是个很实际的提醒。行业里大量测量方法论的文章,作者本身就在卖测量工具或者提供相关服务。这不代表结论错,但它会影响作者选择强调哪个指标、忽略哪个指标。 判断方法很简单:看文章推荐的指标,是不是恰好只有某类工具才测得出来。如果一套方法论里的每个指标都指向同一个产品,那它首先是产品说明书,其次才是方法论。 ## 你报给老板的那份竞品数字,自己复现得了吗? 把上面这套标准掉转枪口,对着自己刚做完的竞品分析报告问一遍,通常会挺尴尬的。 最常见的问题是分母漂移。第一轮测的时候用了60个提示词,第二轮觉得有几个词不太准换掉了几个,第三轮又加了几个新场景的词。3轮下来,份额曲线画得很漂亮,但每一个点的分母都不一样。 这种曲线是没法读的。份额上升可能是你做得好,也可能只是这轮换掉的那几个词恰好是你的弱项。 解决办法不复杂,但需要一点纪律:把提示词集冻结成有版本号的固定资产,每次测量记录用的是哪个版本。要加词可以,加完之后把历史数据重跑一遍,或者干脆开一条新曲线,别在老曲线上接。 第二个常见问题是把不同时间、不同联网状态、不同模型版本的结果混进同一张表。模型一次静默更新,你的曲线就可能整体平移,而你会误以为是自己的优化起了作用。所以每次测量至少要记3样:日期、模型版本、联网开关状态。 ## 对手的可见度,你测出来的数字可信吗? 测自己有个天然优势——你知道自己的事实是什么,能判断模型说得对不对。测对手就没有这个优势了。 这里有个容易忽略的偏差:你的提示词集是围绕你自己的强项和你关心的场景搭起来的。拿这套词去测对手,测出来的是“在我擅长的这些场景里,对手表现如何”,不是“对手的整体可见度如何”。 这个偏差通常会让你低估对手。因为对手真正强的那些场景,很可能压根没进你的词集——你都想不到那是个场景。 有个成本很低的纠偏办法:从对手的内容资产反推词集。把它站上流量最高的那批页面、它主推的产品线、它常年在讲的几个概念各自转成提示词,加到一个单独的对照组里。这个对照组不进主曲线,只用来回答一个问题:有没有一整片战场是我根本没上过的? 前面提到的缺席提示词,找的是你输了的仗;这个对照组找的是你没打过的仗。后者往往更值钱,因为它揭示的是认知盲区,不是能力差距。 ## 那到底该测哪几个指标才算靠谱? 撇开各家的具体主张,真正经得起追问的指标其实不多,共同点是定义清晰、可复现、不依赖某家工具的私有算法。 第一个是出现率:在你的提示词集里,你的品牌被提到的比例是多少。它最粗,但也最稳,任何人用同一套提示词都能复现。 第二个是推荐位次分布:被提到的那些次里,你排在什么位置。这个比出现率更接近生意,因为第一位和第七位的实际价值差得很远。 第三个是事实准确率:模型说出来的关于你的信息,有多少是对的。这一个最容易被忽略,却往往最值得先修——被提到但说错了,比没被提到更麻烦。 这3个指标有个共同的好处:都不需要相信任何一家厂商的黑箱。你自己跑一轮提示词,把结果记下来,就能算。 至于那些名字花哨、算法不公开、跨工具之间对不上的复合评分,可以当参考,但别拿它当汇报口径。一个你自己解释不清算法的分数,在老板追问时是负资产。 ## 这套分母意识,怎么用回到日常汇报里? 最后说个很实际的用法。当你在周会上被问“我们的AI可见度到底是多少”时,最稳的答法不是报一个数,而是报一个带口径的数。 比如:在我们冻结的这60个核心提示词上,最近一次测量里我们的出现率是23%,测的是ChatGPT开启联网的状态,对照组是那4个主要竞品。 这句话比“我们的可见度是23%”长了不少,但它把所有能被追问的地方提前堵上了。更重要的是,它让下个月的数字有了可比性。 反过来,如果你习惯了只报一个光秃秃的百分比,几个月后一定会遇到这样的场面:数字掉了,老板问为什么,而你发现自己根本没法回答,因为你不确定这2次测量的条件是不是一样的。 这个习惯的养成成本几乎为零,收益却是复利的:每多记一次口径,历史数据就多一分可比性。行业里那些互相打架的研究,问题从来不在于研究者不够聪明,而在于口径没有被完整地写下来,于是转述一次就失真一层。你自己的报表,别重复同一个错误。 ## 常见问题解答 ## AI可见度竞品分析和传统竞品分析冲突吗? 不冲突,是补充。传统竞品分析看对手的网站和第三方报道两块屏幕,AI可见度是加上第三块——对手在AI搜索答案里的被推荐和被引用情况。因为越来越多用户在AI答案里就完成了决策、不再点进网站,只看前两块会漏掉客户形成第一印象的关键现场。三块一起看,才对齐了用户真实的决策路径。 ## 没有付费工具,能做AI可见度竞品分析吗? 能,只是更费人力。核心方法不依赖某个特定工具:搭一套代表真实需求的提示词集,手动去几个主流AI里跑这些问题,记录你和对手各自的出现与被推荐情况,再统计声量份额、扒引用来源。付费工具的价值在于把这套流程自动化、规模化、可持续追踪,但小规模起步完全可以先手动跑通逻辑,验证有效后再考虑上工具提效。 ## 声量份额应该按提及算还是按推荐算? 两个都要看,但真正值钱的是按最终推荐算。被AI提及甚至被引用,都不代表被推荐——你的内容可能只是被当成了了解品类的参考资料。所以除了统计总提及份额,更要单独算你在AI最终推荐结果里占的比例,后者才反映你真正的竞争位置。同时务必按引擎分开算,避免不同引擎的巨大差异被平均值掩盖。 ## 什么是缺席提示词,为什么它优先级最高? 缺席提示词是那些对手频繁出现、而你完全缺席的问题。它优先级高是因为这些问题AI已经在给答案、在推荐别人,说明需求真实、流量现成,你缺的只是挤进那个答案,补起来通常比开拓一个全新问题见效快得多。找到后按需求量和补齐难度排序,先打需求大又好补的,用快赢带节奏。 ## 多久做一次AI可见度竞品分析比较合适? 建议把它做成周期性的固定动作,而不是一次性体检。AI答案的来源高度流动,份额会随你和对手的动作不断变化,一般按月或按季度用同一套提示词集重测一轮,把数据连成随时间走的曲线,才能看出你的动作有没有真正推动份额上涨。提示词集本身也要定期复盘,跟上用户问法的漂移。 ## 发现对手在某个论坛或媒体被反复引用,我该直接去投放吗? 方向对,但别用投放的思路。对手集中的引用来源确实是你该布局的枢纽,但AI偏爱的是真实、可信的内容,硬广或伪造口碑很容易适得其反。正确做法是在那些来源里沉淀真实的价值——真实的用户体验、真实的专业讨论、经得起核实的数据,让你自然地成为AI愿意引用的对象。抢的是真实存在感,不是买位置。 ## 权威参考资料 ## AI可见度排名为什么每次查都不一样?2961次实测说名次是噪声 - URL:https://zhangwenbao.com/ai-visibility-ranking-statistical-noise.html - 分类:AI监控与数据 - 发布:2026-07-16 | 更新:2026-07-16 - 摘要:从需要33到94条带引用回答才能收敛、前十名约五个位次的误差、真人问法语义相似度只有0.081,到该多跑几次而不是多攒问法、自己动手采样的四步记录法、以及一份标注结论强度的周报模板。 - 关键词:AI搜索,AI可见度,数据口径 > **TLDR**:摘要:你在AI可见度工具里看到的那个名次,多半没有你以为的那么实在。一项600人参与、跑了2961次的实测给出的结论是:同一个提示词问100次,拿到完全相同推荐名单的概率不到百分之一;连顺序都一样的,大约要跑一千次才碰得上一回。但事情还有另一半:被推荐的核心品牌其实相当稳。某家代理商在95条回答里出现了85次,某家医院在71条里出现69次。不稳的是排序和长尾,稳的是核心圈——这决定了该测的是出现率,不是名次。另一份论文进一步给出量化门槛:要让排名的顺序稳定、且头部差距超出误差,需要33到94条带引用的回答,有3组跑到125个问题仍分不出高下。下面拆这套统计逻辑、中文场景的额外折扣、以及一份不自欺的周报该怎么写。 > 摘要:你在AI可见度工具里看到的那个名次,多半没有你以为的那么实在。一项600人参与、跑了2961次的实测给出的结论是:同一个提示词问100次,拿到完全相同推荐名单的概率不到百分之一;连顺序都一样的,大约要跑一千次才碰得上一回。 但事情还有另一半:被推荐的核心品牌其实相当稳。某家代理商在95条回答里出现了85次,某家医院在71条里出现69次。不稳的是排序和长尾,稳的是核心圈——这决定了该测的是出现率,不是名次。另一份论文进一步给出量化门槛:要让排名的顺序稳定、且头部差距超出误差,需要33到94条带引用的回答,有3组跑到125个问题仍分不出高下。下面拆这套统计逻辑、中文场景的额外折扣、以及一份不自欺的周报该怎么写。 ## 同一个问题问一百遍,AI会给出多少份不同的名单? 先从一个你现在就能自己验证的观察说起。 SparkToro在2025年11月到12月做过一次规模不小的实测:600名志愿者,12个不同的提示词,分别在ChatGPT、Claude和谷歌AI概览上跑,合计2961次。结论相当粗暴: - 问100次,拿到完全相同那份名单的概率不到1次。 - 要碰上两份不仅内容相同、连顺序都一致的名单,大约得跑一千次。 这个结果动摇的是一个很基本的假设:我们默认“查询到结果”是一个稳定映射,像查字典一样。传统搜索大体满足,同一个词今天查明天查,前十名不会大变。生成式回答不满足——它每次都在重新生成,而生成本身带着随机性。 Rand Fishkin给的建议因此毫不客气:任何给你一个“AI里的排名位置”的工具,都是在胡扯。他另外那句更该被贴在办公室墙上:在为AI可见度追踪花一分钱之前,先确认服务商能回答这些问题、并且把它的计算过程亮出来。 这个要求听起来很基本,但你真的拿去问,很多工具的回答会突然变得含糊:一个数字背后跑了多少次?怎么聚合的?误差多大?这份研究把该问的问题一条条列了出来 (https://sparktoro.com/blog/new-research-ais-are-highly-inconsistent-when-recommending-brands-or-products-marketers-should-take-care-when-tracking-ai-visibility/),拿它当验收清单最省事。 ## 但先别急着说“AI完全没规律” 如果只看上面那两条,容易滑到另一个极端:既然全是随机的,那这事没法测了。恰恰相反。同一份研究里还有另一半结果,而这一半被转述得少得多: 被测对象 | 出现情况 | 出现率 | 某数字营销代理商 | 95条回答里出现85次 | 约89% | 某医院 | 71条回答里出现69次 | 97% | 某位影响力人物 | 73条回答里出现36次 | 约49% | 某几个耳机品牌 | 反复测试中 | 55%到77% | 某几家品牌设计代理商 | 反复测试中 | 30%到40%区间 | 看出来了吗?名次每次都在洗牌,但“谁会被提到”这件事相当稳定。一家97%出现率的机构,你问一百次它出现九十七次,这个数字可靠得能拿去做决策;而它这一百次里排第几,纯属看运气。 所以正确的结论不是“测不了”,而是测错了对象。研究本身也是这么说的:跨数十到数百次运行统计出来的出现率,是一个合理的指标。名次不是。 ## 为什么“稳的是核心圈、不稳的是排序”这件事这么关键? 因为它直接决定了你该往哪儿使劲。 如果不稳定是全局的,那唯一的策略就是广撒网碰运气。但既然核心圈是稳的,那真正的分水岭就落在你在不在那个圈里——进了圈,出现率就在七八成上下浮动;没进圈,你在长尾里被偶尔提到一次,看起来像是有排名,实际上是噪声。 这也解释了一个常见的困惑:为什么有的品牌“查得到但抓不住”。你的工具显示这周第5、下周第9、再下周没了,团队以为是排名在波动,实际情况多半是你压根没进核心圈,每次出现都是抽签抽中的。这种状态下讨论怎么从第9升到第5,是没有意义的。 判断自己在不在圈里,方法很土但有效:同一个问题跑二三十次,数出现了几次。七成以上,你在圈里,接下来该做的是巩固和扩品类;三成以下,你在长尾,接下来该做的是想办法被更多可信来源提及,而不是优化名次。四五成之间是最难受的中间态,通常意味着你只在某些问法下才被想起来。 ## 真人问同一件事,措辞能差多少? 同一份研究里还有个数字,单独拎出来很有意思。 他们让142个真人各自写提示词去问同一类问题,收了994条回答,然后算这些提示词之间的语义相似度:平均只有0.081。几乎可以说,真人在问同一件事的时候,措辞彼此毫不相似。 但结果呢?尽管措辞五花八门,模型给出的推荐集合却经常高度重叠——它能识别出这些说法背后是同一个意图。 这两件事放在一起,推翻了很多人正在做的事情。目前主流做法是拼命扩充提示词池:同义词、长尾问法、各种句式,攒到几百条,然后每条问一次。可研究告诉我们:意图相同的不同问法,结果高度重叠;而同一个问法的不同次运行,结果差异巨大。 结论就有点反直觉了:你不需要穷举问法,你需要穷举次数。与其准备300个问法各问一次,不如挑30个真正有代表性的问法各问十次。前者给你一堆互相重复的信息加上满满的噪声,后者才给得出能算出置信度的分布。 保哥见过好几个团队在这件事上花了冤枉钱,问题池做得极其精美,每个问法却只跑一次——等于把预算全花在了信息重复的那个维度上。改写问法带来的引用敏感性 (https://zhangwenbao.com/ai-search-paraphrase-sensitivity-geo-test.html)确实存在、也值得单独测,但它和“重复采样”是两件不同的事,不能互相替代。 ## 那份论文给的量化门槛是多少? 2026年4月发表的另一篇论文,把这件事从“感觉不稳”推进到了“需要多少次才够”。作者是Ron Sielinski,来自IQRush,这篇报道把它的关键数字整理得比较全 (https://www.searchenginejournal.com/ai-visibility-rankings-arent-stable-new-research-shows-its-mostly-statistical-noise/581905/)。 先把利益关系摆出来:IQRush卖的正是按论文主张的方式去测量AI可见度的软件。一份论证“你需要测更多次”的研究,出自一家靠帮你测更多次赚钱的公司,这个组合天然需要打折看待。作者自己也做了披露。 但有个情况让它没法被简单打发:同在4月,一支与之毫无关联的团队用独立数据集得出了同方向的结论——单次读数不可靠,必须对引擎重复采样。那篇的作者是Julius Schulte、Malte Bleeker与Philipp Kaufmann,来自圣加仑大学。 这就构成了一个还算健康的证据结构:有商业动机的一方提出了具体数字,无商业动机的一方独立验证了方向。你可以怀疑具体阈值定得偏高,但很难再说“不稳定”是厂商编出来卖软件的。 ## 顺手固化一套厂商研究的读法 - 先问它的结论指向谁的钱包。结论如果正好推荐了发布方自己卖的东西,不必愤怒,只需提高证据门槛。 - 再找有没有无关联的复现。方向被独立验证过的部分可以采信,只有单一来源的具体数值当参考值。 - 最后看它主动承认了什么。一份肯把局限写清楚的研究,通常比一份处处都是漂亮结论的研究可信得多。 ## 判定一个排名可信,要同时满足哪两个条件? 论文给的判据很朴素,也正因为朴素才好用。一份排名值得相信,需要同时满足两条: 第一,顺序必须已经停止变动。你继续增加采样,前几名的次序不再发生变化。如果每加十条回答名次就换一轮,说明你还在噪声里。 第二,头部之间的差距必须大于各自的误差范围。两家的份额是9.5%和6.0%,看着差了不少,但如果各自误差都有正负3个百分点,这3.5个百分点的差距就没有意义——它们的可信区间是重叠的。 论文里给的正是这个例子:用某个引擎测跑步装备类问题,Tom's Guide约占引用的9.5%,Runner's World约6.0%。仪表盘上前者明显更高,任何人看了都会得出“前者更强”的结论。可这3.5个百分点落在误差范围内,单次采样不足以支撑谁赢了这个判断。 这个例子的价值在于它足够普通。9.5%对6.0%不是什么胶着局面,看上去差了将近六成,仍然不够。如果连这种量级的差距都可能是噪声,那周报里那些“我们从第7升到第5”的表述,含金量可想而知。 ## 33到94次,这个区间是怎么来的 论文的核心数字是:在30组“平台乘主题”的测试中,让上述两个条件同时成立所需的回答数在33到94之间,且只计入带引用的回答。 更值得注意的是失败案例:30组里有3组,即使跑到125个问题仍然没能达标,全部出现在同一个引擎上,原因是头部几家太接近,怎么采样都分不出先后。论文因此明确表示:不存在一个通用阈值。 “只计带引用的回答”还藏着一笔损耗。某个主题下125个问题只产出104条可用回答,缺失率17%——有些回答压根没给引用,直接作废。所以实际要提交的问题数比目标数字还得往上抬一截。 ## 把这些数字翻译成一份能执行的采样方案 要素 | 建议做法 | 理由 | 问法数量 | 30到50个有代表性的问法即可 | 意图相同的问法结果高度重叠,多了浪费 | 每个问法跑几次 | 至少10次,核心问法跑到30次 | 差异主要来自重复运行,不是来自换问法 | 问法来源 | 优先真实客服与销售记录里的原话 | 真人措辞的语义相似度只有0.081,自己编的覆盖不到 | 采样频率 | 月度全量,周度只跑核心子集 | 周度数据本来就不该用来下结论 | 主指标 | 出现率,不是名次 | 出现率跨多次运行才稳定,名次不稳定 | 结论粒度 | 只判断梯队,不报精确名次 | 中后段名次误差大到没有意义 | 这套方案会比很多工具的默认采样密度更重,也更贵。但它至少给了一个诚实的选项:要么按这个强度测、拿一个站得住的结论,要么承认自己只是在看大致方向、别拿它做重大决策。最糟的是花了钱、拿了个精确到小数点的数字、然后据此调整了半年的内容策略。 ## 为什么不同引擎需要不同的采样预算? 论文里有个观察挺有意思:不同引擎的引用行为差别很大,因此同样的回答条数在它们身上买到的确定性并不相同。 一类引擎倾向于把引用集中堆在同一小撮站点上,同一条回答里的多个引用其实提供的是高度重复的信息;另一类每条回答给的引用更少,但来源更分散,因此每条回答携带的独立信息反而更多。 后果很直接:在引用集中的引擎上够用的采样量,搬到引用分散的引擎上可能仍然是在猜。如果你的报告是跨引擎横向对比的,这一点尤其要命——你可能在一个引擎上得到了可信结论,在另一个引擎上得到的只是噪声,然后把两者并排放进了同一张表。 对策不复杂:按引擎分别设采样量,而不是全局设一个统一次数。哪个引擎的结论迟迟不收敛,就给它加量;加到某个程度还是分不出来,就在报告里如实写“该引擎暂无法区分”,而不是硬凑一个名次出来。 ## 前十名的误差有多大,什么时候才该往上报? 还有一组数字,直接决定周报该怎么写。 论文指出,排名的可信度是从头部往下递减的:头部最稳、最可防守,越往中后段误差越大,到某个位置之后相邻名次的差别形同抛硬币。具体量级是,即便前十名,典型误差范围也约为5个位次,其中五分之一的站点误差大于10个位次。 五个位次是什么概念?你看到的“第6名”,真实位置可能在第1到第11之间的任何地方。而“从第6进步到第4”这种喜讯,在统计上跟没发生过区别不大。 你观察到的变化 | 能不能写进周报 | 怎么表述才诚实 | 名次在前十内小幅移动 | 不能 | 不提,或写“仍在头部梯队” | 出现率从三成升到七成 | 能,这是最该报的 | 直接报出现率与采样次数 | 从榜外进入头部梯队 | 能 | 说梯队变化,不说具体名次 | 从头部彻底消失 | 能,且该警觉 | 先复测确认不是单次异常 | 中后段名次变化 | 不能 | 这个区间本来就是噪声区 | 被引用的来源类型变了 | 能 | 比名次稳定得多,信号更强 | 最后一行值得额外强调:与其盯名次,不如盯“AI是从哪里知道你的”。引用来源的构成比名次稳定得多,也更能指导动作——发现对手大量来自某类垂直媒体,你就知道下一步该去哪儿;发现自己的引用全集中在官网一个来源,你就知道风险在哪。想系统地扒对手的引用来源,AI可见度竞品分析那套流程 (https://zhangwenbao.com/ai-visibility-competitive-analysis-share-of-voice.html)可以直接套用。 ## 这份论文没有证明什么? 这一节比前面所有节都重要,因为它决定了你能把结论推到多远。论文自己列出的局限有这么几条: - 它是预印本,没有经过同行评审。方向可信不等于每个数字都经得起推敲。 - 只覆盖3个引擎、30组平台与主题的组合。你的行业、语言、问题类型都可能不在其中。 - 问题是由模型生成的,不是真实用户的搜索记录。这条影响最大,下面单独说。 - 只在单一时间段采集。引擎在不断更新,今天的稳定性结论未必适用于半年后。 - 方法学自检是内部的:论文拿自己所谓的早期排名去比同一批数据的最终排名,而不是任何外部真值。 “问题由模型生成”这条为什么最要命?因为模型生成的问法往往比真人问得更规整、更完整、更书面。真实用户会打错字、用行话、问半截、带一堆无关前提。前面那个0.081的语义相似度已经说明了真人的措辞有多离散。规整的问题池测出来的稳定性,很可能比真实场景下更乐观——也就是说,真实世界大概率比论文说的还要更不稳。 ## 换到中文场景,这件事会更好还是更糟? 两份研究测的都是英文引擎,直接搬到中文语境要打几个折扣,而且多数是往坏了打。 第一,中文问法的离散度只会更高。同一个需求,用户可能用完全不同的词组表达,还夹杂简称、行业黑话和地域说法。要覆盖同样的语义空间,中文需要的问法数量通常更多。 第二,引擎池更碎。除了国际引擎,还要考虑本土的几家AI产品,各自引用行为差异很大。按“按引擎分别设采样量”的原则,总成本是乘上去的。 第三,中文内容的可引用源结构不同。英文环境里社区问答和垂直媒体承担了大量被引用的角色,中文这边不少高质量内容锁在需要登录的平台里,模型取不到。这会让某些行业的引用来源高度集中在少数几个源上,进而让排名看起来比实际更稳定——这是一种假稳定,一旦那个源的内容变了,整个名单会跟着翻天。 所以中文场景下更该先做的一件事,是搞清楚模型到底在从哪几个源取材,再谈名次。关于哪些站在AI回答里被引用得最频繁,被引来源榜单那份数据 (https://zhangwenbao.com/most-cited-domains-ai-search-citation-sources.html)是个不错的起点。 ## 那到底还要不要测?测到什么程度该停? 看到这里可能会有点泄气:测不准,那还测什么。这个反应可以理解,但结论下反了。 不稳定不等于不可测,只等于不能用单次读数下结论。体重每天上下浮动两斤,不妨碍你通过月度趋势判断自己是胖了还是瘦了——前提是别拿今天早上那一次称重去跟上周三比。 更实际的问题是:测量要花钱花时间,什么时候该收手去干正事?三条停止规则: - 当结论不会改变你的动作时,停。如果无论测出七成还是三成出现率,你下个季度都是同一套内容计划,那这次测量的唯一产出就是一张图。 - 当加大采样量已经不再改变梯队判断时,停。再往下追求精确名次是浪费,那个精度本来就不存在。 - 当你连续两轮都在讨论名次、没人讨论引用来源时,停。这通常说明团队已经把手段当成了目的。 ## 不买工具的话,怎么自己跑一次最小可行的采样? 预算有限、或者只是想先验证一下工具给的数字靠不靠谱,完全可以自己手动跑一轮。花不了一天。 第一步,挑问法。去客服记录、销售通话、售前咨询里翻真实原话,挑出10到15个最常被问到的。不要自己编,也不要用那种“最好的XX品牌推荐”这类过分标准的句式——真人不那么说话,前面那个0.081的相似度就是证据。 第二步,定引擎。先别贪多,挑你的客户最可能用的两个。做外贸B2B的,办公套件自带的那个不能漏;做消费品的,对话式产品优先。 第三步,跑起来并记录。每个问法在每个引擎上跑10次,每次开新会话,别在同一个对话里连着问——上下文会污染结果,这是自测里最常见的错误。每次记四件事: 记录项 | 怎么记 | 为什么记它 | 有没有提到你 | 是或否 | 算出现率,这是主指标 | 还提到了谁 | 列全 | 这才是你真正的对手名单 | 提到你时说了什么 | 抄原句 | 看它替你选了哪个卖点 | 引用了哪些来源 | 记域名 | 模型是从哪儿认识你的 | 第四步,只算三个数。你的出现率、每个对手的出现率、引用来源的域名分布。就这三个,别算名次,也别算加权分。 跑完这一轮,多数人会有两个意外发现。一是对手名单和自己以为的不一样——市场部盯的那几家常常根本不在AI的候选池里,而池子里冒出来的几家你可能都没听过。二是模型描述你的方式和你的定位不一致,它可能一直在夸你的次要卖点。这两条都不需要精确统计就能看出来,价值却比一个名次高得多。 ## 出现率之外,还有什么值得记? 出现率是主指标,但只记它会漏掉不少信息。下面三项是保哥觉得性价比最高的补充,记录成本几乎为零。 第一是位置。同样是被提到,出现在回答的第一句、和出现在“其他还可以考虑”那一串里,含义完全不同。不必精确到第几个字,粗分成首选、并列提及、附带一提三档就够用了。出现率高但全是附带一提,说明你进了池子但没进第一梯队。 第二是描述准确度。模型提到你的时候,说的对不对?有没有把别家的功能安在你头上、把停售的产品当在售的讲、把价格说错?这类问题的杀伤力比排名靠后大得多——一个被准确描述的第三选择,胜过一个被描述错误的首选。发现描述错误,该做的是补充和纠正公开信息,而不是加大投放。 第三是有没有给链接。被提到但没给链接,意味着这次曝光很难变成访问。哪些回答会给链接、给谁的链接,通常和内容是否可被检索到直接相关,这跟纯粹的品牌提及是两条不同的路径。 这三项加上出现率,构成一个比“第几名”信息量大得多的四元组。更重要的是它们都不需要跑到统计显著才能用——描述错了就是错了,跑三次看到两次错就该去处理,不必等攒够94条回答。 ## 自己动手测的时候,最容易犯哪几个错? 见过的翻车基本都集中在这五条上,每一条都会让结果作废。 - 在同一个对话里连着问十次。上下文会互相污染,模型记得你上一轮问过什么,第二次开始的回答已经不独立了。必须每次开新会话。 - 用带品牌名的问法去测。问“XX品牌怎么样”,模型当然会提到你,这测的是它认不认识你,不是它会不会推荐你。要测推荐,问法里就不能有你的名字。 - 只测自己想被问到的那些问法。团队挑问法时会不自觉地挑对自己有利的场景,测出来自然好看。挑问法这一步最好交给不做优化的人,或者干脆从客服记录里随机抽。 - 只记自己有没有出现,不记还有谁。这是最可惜的一种浪费——同样一次采样,记全对手名单几乎不增加成本,拿到的信息却翻倍。 - 拿工具的默认设置当结论。多数工具的默认采样密度是为了出图快,不是为了统计可靠。用之前先问清楚一个数字背后跑了几次。 还有个不算错误但值得提的现象:不同类型的AI产品,稳定性本身就不一样。绑定在搜索结果上的那类,因为要受检索结果约束,回答的波动通常小一些;纯对话式产品的自由度更大,波动也更大。所以跨产品比较出现率的时候,别把差异全算到自己头上,有一部分是产品形态带来的。 ## 老板要一个名次,你怎么解释才不像在找借口? 这可能是最现实的问题。你讲了半天统计误差,对方一句“那我们到底第几”就把你打回原点。 硬讲置信区间通常没用,换个说法效果会好很多:把它类比成民意调查。没有人会问“这次民调里我们精确排第几”,大家都接受支持率是一个带误差的区间,也都接受两家差三个点等于打平。AI可见度是同一类东西——它测的不是一个客观存在的排名,而是一群随机回答里的分布。 然后给出替代品,别只说不能给什么。可以承诺的是这三个数:本季度出现率从多少到多少、对手的出现率各是多少、我们被提到时模型说的是哪个卖点。这三个都能给出明确数值,也都能跟动作挂钩。多数管理者要的其实不是“第几名”这三个字,而是“我们是在变好还是变差、下一步做什么”,后者你完全答得上来。 最后留一句实话给自己:如果你的汇报里必须有一个精确名次才过得去,那问题不在测量方法上,在汇报文化上。这事解决不了统计问题,但至少你知道自己在跟什么较劲。 ## 这套统计规律对内容策略有什么直接影响? 说了这么多测量的事,最后落到该干什么上。三条推论: 第一,目标应该是进核心圈,而不是提升名次。既然名次是噪声、出现率才稳定,那所有优化动作的验收标准就该换成出现率有没有从三成走到七成。这个转换会让很多动作的优先级重排:让三个新的可信来源提到你,比把官网某个页面再优化一遍有用得多。 第二,节奏该按季度而不是按周。单次读数的波动大于多数真实变化,这意味着周度对比在数学上没有意义。硬要按周汇报,团队会被迫为噪声编故事,久而久之报告就变成了创作。提示词追踪里那几个常见误区 (https://zhangwenbao.com/prompt-tracking-guide.html),多半也是被汇报节奏逼出来的。 第三,别为一次掉出就大改。这条最花钱。某周发现自己没了,团队紧急调整内容方向,两周后又回来了——回来跟那次调整可能毫无关系。正确动作是先复测:同样的问法再跑二三十次,看是真的掉出核心圈,还是这次抽签没抽中。复测的成本,永远低于误判之后的方向调整成本。 ## 一份不自欺的AI可见度周报,长什么样? 板块 | 写什么 | 不写什么 | 出现率 | 核心问题集里提到你的比例,附采样次数 | 不写名次 | 梯队位置 | 头部、中部、未出现三档 | 不写具体第几名 | 引用来源 | 模型是从哪几类源知道你的,占比如何 | 不写单条来源的排名 | 缺席清单 | 哪些该出现你却没出现的问题 | 不写“暂无异常”了事 | 采样说明 | 本轮跑了多少条、缺失多少 | 不隐藏样本量 | 结论强度 | 标注哪些可采信、哪些仅供参考 | 不让所有数字看起来同样确定 | 最后那行“结论强度”是整张表里最容易被砍掉、也最不该砍的一栏。一份把不确定性标出来的报告,短期显得没那么有力,长期却能救你一次。因为总有一天某个数字会被拿去做一个真正花钱的决定,那时候你会庆幸自己当初写清楚了它有多虚。 顺带说一句工具选型:市面上的产品在采样透明度上差别很大,各家对可见度指标的定义 (https://www.semrush.com/blog/ai-visibility/)并不统一,另一家给同一概念的追踪口径 (https://ahrefs.com/blog/ai-visibility/)又是另一套算法,同一个词在不同工具里算出来的数字可能完全不可比。选之前把“跑多少次、怎么聚合、误差多少”这三个问题当成硬性验收条件,答不上来的直接排除。 ## 一个宠物用品站的两轮测量,前后差了多少? 保哥接触过一个做宠物智能用品的出海站,他们的经历挺能说明问题。 第一轮,他们用工具默认设置测了一批核心问题,拿到一份排名,自己排第4,一家竞品排第2。团队据此判断差距不大,决定加大内容投入去追那两个位次,季度计划就这么定了。 第二轮是三周后,同一批问题、同一个工具、什么都没改。结果自己变成第7,那家竞品变成第3,另外冒出来两个之前根本没见过的品牌。 这时候他们才意识到,第一轮那份排名根本没到能下结论的采样量。后来把每个问法从跑一次改成跑十次、只保留30个有代表性的问法,才发现真实情况是:自己的出现率在四成上下,那家竞品在五成上下,两家其实长期在同一个梯队里反复交换位置;而真正稳定压着他们的是另一家出现率接近九成、之前两次都被当成偶然的品牌。 更有价值的发现来自引用来源那一栏——那家稳定领先的品牌,引用大量来自几个海外宠物垂直媒体的评测文章,而他们自己的引用几乎全部来自官网和一个电商平台的商品页。这条信息比任何名次都有用,因为它直接告诉了他们下个季度该去敲谁的门。顺带说一句,如果当初按第一轮那份排名去追两个位次,这半年大概率会花在一件根本不存在的事情上。 ## 常见问题解答 ## AI可见度工具给的排名,是不是完全不能用? 名次基本不能用,出现率可以用。研究显示同一个提示词问100次,拿到完全相同名单的概率不到1次;但被推荐的核心品牌相当稳定,某家机构在71条回答里出现了69次。所以把工具当出现率统计器用,别当排行榜用。 ## 要跑多少次才能相信一份数据? 没有通用数字。一篇论文在30组测试里得到的区间是33到94条带引用的回答,其中3组跑到125个问题仍未收敛。实操上建议挑30到50个有代表性的问法,每个至少跑10次,核心问法跑到30次,并按引擎分别设定采样量。 ## 为什么同一个问题问两次,AI给的品牌名单会不一样? 因为生成式回答每次都是重新生成的,过程本身带随机性,不像传统搜索那样存在稳定的查询与结果映射。实测中连顺序都相同的两份名单,大约要跑一千次才碰得上一次。 ## 该多准备问法,还是该多跑几次? 多跑几次。真人问同一件事的措辞其实极度离散,实测语义相似度只有0.081,但模型能识别背后的相同意图,所以不同问法的结果高度重叠。真正造成差异的是同一问法的重复运行,把预算花在次数上比花在扩充问法池上划算得多。 ## 那份说排名是统计噪声的论文,可信吗? 方向可信,具体数值当参考。它是未经同行评审的预印本,作者所在公司正好卖相关测量软件,存在利益关系。但同期另一支无关联的团队用独立数据集得出了同方向结论,所以“单次读数不可靠”这个判断本身站得住。 ## 中文场景下测AI可见度,会比英文更难吗? 通常更难。中文问法的表达离散度更高,需要更多问法才能覆盖同样的语义空间;需要盯的引擎更碎;而且不少优质内容锁在登录墙里模型取不到,容易造成引用来源过度集中的假稳定。 ## 比起名次,更该盯什么指标? 盯出现率和引用来源构成。出现率跨多次运行是稳定的,能支撑决策;引用来源告诉你模型是从哪儿认识你的,直接指向下一步动作。另外“该出现却没出现”的缺席清单,实用性也远高于排名本身。 ## 周报里到底该怎么写才不算糊弄? 写出现率并附上采样次数,写梯队不写名次,写引用来源构成,写缺席清单,并如实标注结论强度。把不确定性标出来短期显得没那么有力,但能避免某个虚的数字被拿去做花钱的决定。 ## 权威参考资料 ## 被AI推荐过一次就够了吗?AEO得靠六个自动化环节持续盯防 - URL:https://zhangwenbao.com/aeo-monitoring-automation-continuous-defense.html - 分类:AI监控与数据 - 发布:2026-07-16 | 更新:2026-07-16 - 摘要:为什么AEO是持续防御战而非一次性优化、人力盯防为何必然崩溃、六个监控环节各自怎么自动化,以及搭建监控体系的四条原则,结合美容仪DTC客户靠监控抓出份额下滑、负面框定与AI幻觉并逐一纠偏的实战案例。 - 关键词:GEO,AEO,AI可见度,AI监控 > **TLDR**:摘要:把内容优化好、被AI推荐一次,不等于就此高枕无忧——AI答案里的品牌推荐每周甚至每天都在变,你这周还在ChatGPT的推荐位,下周可能就被人挤下去了。这意味着AEO不是一锤子买卖,而是一场需要持续盯防的拉锯战。可盯防这件事,靠人手一个个去问AI、一条条记下来,根本盯不过来。这篇把AEO里六个最该交给机器自动跑的监控环节拆开讲清:优先提示词、跨平台声量份额、竞品引用来源、情感倾向、AI幻觉核查、月度汇总,再说清哪些活机器干、哪些判断必须人来。结合我一个美容仪DTC客户的监控实操,帮你把有限的人力从重复劳动里解放出来,真正花在策略上。 > 摘要:把内容优化好、被AI推荐一次,不等于就此高枕无忧——AI答案里的品牌推荐每周甚至每天都在变,你这周还在ChatGPT的推荐位,下周可能就被人挤下去了。这意味着AEO不是一锤子买卖,而是一场需要持续盯防的拉锯战。可盯防这件事,靠人手一个个去问AI、一条条记下来,根本盯不过来。这篇把AEO里六个最该交给机器自动跑的监控环节拆开讲清:优先提示词、跨平台声量份额、竞品引用来源、情感倾向、AI幻觉核查、月度汇总,再说清哪些活机器干、哪些判断必须人来。结合我一个美容仪DTC客户的监控实操,帮你把有限的人力从重复劳动里解放出来,真正花在策略上。 做GEO这两年,我发现一个反直觉的现象:很多品牌好不容易被ChatGPT或Perplexity推荐了一次,就以为大功告成,把优化的事放下了。结果过了一个月回头一查,推荐位早没了,取而代之的是竞争对手的名字。他们百思不得其解——内容没删、页面还在,怎么就被换掉了? 答案其实很简单:AI的推荐从来不是刻在石头上的。同一个问题,你今天问和明天问,得到的品牌名单可能就不一样。它随时在根据全网信号的变化、模型的更新、竞争对手的动作重新洗牌。这种高频流动性,决定了AEO必须从一次性优化,转向持续监控与响应。而持续这两个字,恰恰是纯靠人力最扛不住的地方。 ## 为什么AEO是一场持续防御战,而不是一次性优化? 先把这件事的底层逻辑说透。传统SEO里,你辛苦做上去的排名,虽然也会波动,但通常是相对稳定的——今天排第三,明天大概率还在前五,不会一夜之间消失。AI答案不是这个脾气。 AI在生成推荐时,是从海量来源里实时合成一个答案,而这些来源本身高度流动。一项针对AI助手推荐一致性的观察 (https://ahrefs.com/blog/letaido-for-aeo/)发现,同一个问题反复问,得到的品牌推荐每次都在变——AI助手在推荐品牌这件事上极不稳定。这就意味着,你在某个提示词下的可见度,不是一个可以标定一次就锁死的数值,而是一条需要天天量体温的曲线。 更麻烦的是,这种波动是多维度的:不同平台脾气不同,ChatGPT推你、Gemini可能不推;同一个意思换个问法,结果又不一样;竞争对手上了一批新的第三方测评,你的份额就被稀释。这些变化任何一个发生,你原本的推荐位都可能松动。传统那种季度做一次审计的节奏,在这种高频洗牌面前完全跟不上——等你季度报告出来,黄花菜都凉了。 所以AEO的正确姿势是把它当成一套持续运转的监测系统,而不是一个做完就归档的项目。业内也早把AEO视为一项需要持续迭代的增长流程 (https://www.searchenginejournal.com/aeo-guide-seo-visibility-tac-spa/559880/),而非一次交付就结束的任务。而一旦要持续、要覆盖多平台多提示词,工作量就会指数级膨胀,靠人根本盯不过来。这也是为什么,搞清楚AI可见度监测到底该盯哪些指标、又容易踩哪些误区 (https://zhangwenbao.com/prompt-tracking-guide.html),成了做AEO绕不开的第一课。 ## 哪些监控活最该交给机器,人力盯防为什么必然崩溃? 算一笔账你就明白了。假设你要认真监控AEO,需要覆盖的维度有多少:值得盯的核心提示词,少说也有几十到上百个;主流AI平台,ChatGPT、Gemini、Perplexity、Copilot、Google的AI概览,至少五六个;而AI答案的波动周期,是以天计的。 把这几个数字乘起来:100个提示词 × 6个平台 × 每天一次,就是每天600次查询。而且不能只看有没有提到你,还得记录你排在第几、被没被署名引用、语气是褒是贬、旁边推荐了哪些对手。让一个人去手动干这件事,一天到晚啥都别做了,还大概率漏记、记错、坚持不下来。这不是态度问题,是这类高频、重复、结构化的采集工作,本就不该由人来做。 机器擅长的恰恰是这个:不知疲倦地反复查询、精确记录、结构化存储、发现异动时报警。人擅长的则是另一头:看着这些数据判断发生了什么、决定怎么应对。把这两者分工清楚,是搭建AEO监控体系的核心思路。下面这六个环节,就是最该、也最能被自动化的部分。想更系统地看整个AEO的框架结构,可以对照从被看见到被AI推荐的三层框架和六步行动 (https://zhangwenbao.com/ai-crawler-aeo-optimization-guide.html)一起理解,监控是其中确保成果不流失的闭环环节。 ## 环节一:优先提示词怎么挑,才不至于盯错了地方? 监控的第一步不是急着去查,而是先想清楚查什么。你不可能监控所有问题,得先锁定那些真正值得盯的高价值提示词。 挑选的逻辑有两层。一层是需求量——真实有多少人会拿这个问题去问AI。这里有个容易被忽略的点:一个词在Google的搜索量,和它在AI助手里被提问的频率,并不完全对等。有些偏对话式、偏决策式的长问题,Google搜索量不高,但恰恰是人们爱丢给ChatGPT的。所以挑词时要按AI助手的实际使用场景来加权,而不是照搬传统关键词量。 另一层是商业意图——这个提示词背后的人,离掏钱有多近。问最好的XX工具的人,比问XX是什么的人,商业价值高得多。把需求量和商业意图这两个维度叠起来给提示词排序,你就得到了一份该优先监控的清单。这份清单本身也不是一劳永逸的,得随着业务重心和市场变化定期刷新。 ## 环节二:跨平台声量份额,为什么必须拆到每个提示词去看? 选好了要盯的提示词,接下来就是量核心指标——声量份额,也就是在这些提示词下,AI的推荐里有多大比例提到了你、又有多大比例给了对手。 这里的关键动作是跨平台、并且拆到单个提示词。跨平台好理解:ChatGPT、Gemini、Google AI概览、Perplexity各查各的,因为它们的答案往往差异很大,一个平均分会把真相抹平。拆到单提示词则更重要——你可能整体声量份额看着还行,但在某几个高价值提示词上其实是缺席的。只有拆开看,你才知道到底是哪几场仗打赢了、哪几场在丢分。 这套声量份额的算法和竞品对标,正是把AI可见度当第三块屏幕做竞品分析 (https://zhangwenbao.com/ai-visibility-competitive-analysis-share-of-voice.html)的核心。自动化在这里的价值是把这个矩阵每天刷新一遍,一旦某个提示词上你的份额突然掉了,系统能第一时间标红,而不是等你下个季度才后知后觉。 ## 环节三:对手被AI引用的来源,能不能反向扒出来? 光知道自己份额掉了还不够,你得知道对手是靠什么赢的。这就是第三个该自动化的环节:逆向追踪AI在推荐竞争对手时,到底引用了哪些域名、哪些页面。 这件事的价值在于,它把模糊的对手做得好翻译成了具体的对手在哪些地方被提到。你会发现,AI推荐对手时,反复引用的可能是某个垂直媒体的测评、某个论坛的讨论帖、某个行业榜单。这些就是它的信任来源。 拿到这张来源地图,你的行动就有了明确靶子:要么去争取在这些同样的来源里获得提及,要么在自己能影响的渠道里补齐类似的信号。手动去一条条排查AI引用了谁,几乎不可能穷尽,但机器可以系统地抓取和归类,把对手的引用来源整理成一份可执行的清单。这套逆向思路,和用多维度对标揪出AI引用竞品却不引用你的真因 (https://zhangwenbao.com/geo-competitor-17-dimension-ai-citation-gap-guide.html)是一脉相承的。 ## 环节四:AI是夸你还是损你,情感倾向怎么持续盯? 被提到,不代表被说好话。第四个环节是情感追踪——监控AI在提到你时,语气是正面、中性还是负面,并且看这个倾向随时间怎么变。 为什么这很重要?因为一次负面的框定,杀伤力可能比不被提到还大。想象一下,用户问哪款产品适合敏感肌,AI提到了你,但补了一句据部分用户反馈可能引起刺激——这一句话足以劝退大半潜在客户。而这种负面框定,往往源于某些被AI采信的负面讨论或过时信息,你不盯着就完全不知道它的存在。 情感追踪的意义,是让你能在负面倾向刚冒头时就发现它、追溯来源、及时干预,而不是等销量莫名下滑了才回头找原因。给AI答案里的品牌提及做基准测试 (https://www.semrush.com/blog/benchmark-brand-mentions-in-ai-answers-semrush/)时,情感往往和声量被放在一起监测,正是这个道理。这类监控重复且需要长期坚持,天生适合交给自动化去跑,人只在倾向异动时介入判断。 ## 环节五:AI凭空捏造你的信息,怎么第一时间抓出来? 第五个环节,是我个人认为最容易被忽视、却最该严防的一项:核查AI关于你的幻觉。 大模型会一本正经地胡说八道,这早不是新闻。AI幻觉(模型自信地生成与事实不符内容) (https://en.wikipedia.org/wiki/Hallucination_(artificial_intelligence))放到品牌身上,就是AI可能凭空捏造你的价格、瞎编你没有的功能、张冠李戴你的资质。用户看到这些错误信息,很可能直接据此做决定,而你连自己被冤枉了都不知道。 自动化在这里能做的,是拿你的权威事实作为基准——真实的价格、真实的功能列表、真实的资质文档——去比对AI在各平台上关于你的表述,一旦发现对不上,就报警并尽量追溯这个错误信息可能的来源。抓出幻觉只是第一步,接下来还得靠人去修正源头信号:更新官网表述、补齐结构化数据、澄清被误读的内容。给AI喂清晰、一致、可核查的事实,本就是用结构化数据把关键信息标注清楚 (https://developers.google.com/search/docs/appearance/structured-data/intro-structured-data)这类基础功课的延伸。 ## 环节六:这么多数据,怎么自动汇总成一份看得懂的报告? 前面五个环节每天产出的数据量非常可观,如果只是堆在后台无人整理,那监控就成了自嗨。第六个环节,是把这些散落的数据自动聚合成一份定期报告。 一份有用的AEO报告,应该把几样东西放到一起看:各平台的声量份额及其趋势、被引用来源的变化、情感倾向的走向,最好还能接上搜索后台的数据和实际的引荐流量,看看AI可见度到底有没有转化成真金白银的访问。声量份额这个指标的计算口径 (https://backlinko.com/share-of-voice)本身有讲究,报告里要口径统一才有可比性。 自动生成报告的价值,一是省掉每个月手动拉数、做表、写结论的几天工,二是让口径固定、可纵向对比,你能清楚看出这个月比上个月是进步了还是退步了。人要做的,是看着这份报告问一句:所以我们下一步该改什么?报告负责把事实摆清楚,决策永远是人的活。 ## 保哥的客户案例:一个美容仪DTC靠监控抓出了什么? 去年年底,保哥接手一个做家用美容仪的DTC独立站客户,主打射频类的家用美容设备,客单价不低,北美市场刚打开一点局面。他们之前做过一轮GEO,在几个核心提示词下确实进过AI的推荐名单,团队一度很满意,就把优化的事搁下了。 我接手后做的第一件事,不是急着改内容,而是先把监控搭起来——盯住二十来个核心提示词,每天扫一遍主流平台,记录份额、排位、情感和被引来源。跑了大概三周,几个问题就浮出了水面。 第一个是份额悄悄在掉。在最好的家用射频美容仪这个高价值提示词上,他们的出现率从起初的稳定露出,慢慢滑到时有时无,而一个新入场的竞品出现频率在上升——逆向一看,对手刚在两个垂直美妆媒体拿到了测评,来源信任被补厚了。第二个更要命:某个平台在提到他们时,反复带出一句可能不适合敏感肌肤使用的负面框定,一查,源头是一条被AI采信的旧论坛帖,里面是个别用户操作不当导致的不适,被当成了产品通病。第三个是幻觉,有个平台把他们一款设备的功率参数报错了,还顺带说了句未获相关认证,而实际上这款产品该有的认证一个不缺。 这三个问题,没有一个是靠翻自己网站能发现的——它们全发生在AI的答案里,不盯着就永远蒙在鼓里。针对性处理也就有了抓手:对手那两家媒体,我们去争取了同类的真实测评;那条负面旧帖,通过在官网和多个渠道补充正确的敏感肌使用指引来对冲;参数和认证的幻觉,则靠更新官网结构化数据、把认证信息标注到显眼位置来纠偏。 又过了一个多月,那个高价值提示词上的稳定露出回来了,负面框定的出现频率明显下降,参数也报对了。这个案例给我的印象很深:AEO真正的战场在你看不见的AI答案里,而监控,就是让这个看不见的战场变得看得见的唯一办法。 ## 搭建AEO监控体系,该守住哪几条原则? 把上面的思路收一收,如果你也想把AEO从一次性优化升级成持续监控,有几条原则值得记住。 第一,先定清单再上工具。别一上来就被各种监控功能晃花了眼,先想明白自己要盯哪些提示词、哪些平台、哪些指标,清单清楚了,工具才是趁手的兵器而不是玩具。第二,自动化采集、人工判断,分工别错位。让机器干重复的查询和记录,让人干看数据、下判断、做响应,把人力花在机器替代不了的策略层。 第三,盯异动而非盯绝对值。AI可见度天生波动,你要关注的是异常的、持续的下滑或负面倾向,而不是被每天的正常抖动牵着走。第四,闭环到行动。监控发现问题只是开始,配套的响应机制——补第三方来源、纠正幻觉、对冲负面——才是让监控产生价值的下半场。 说到底,在AI答案高频洗牌的今天,谁能持续地看见自己在AI里的样子、并快速做出反应,谁就能在这场没有终局的防御战里守住阵地。而这份持续,只有把该自动化的交给机器,人才腾得出手去做真正重要的事。 ## 常见问题解答 ## AEO为什么不能像SEO那样优化一次就长期见效? 因为AI答案的来源高度流动。AI在生成推荐时是从海量来源实时合成答案,同一个问题反复问,得到的品牌名单可能每次都不同,波动以天计。竞争对手补了新的第三方测评、模型做了更新、你的信号出现不一致,都可能让你原本的推荐位松动。传统季度审计的节奏完全跟不上这种高频洗牌,所以AEO必须从一次性优化转向持续监控。 ## AEO监控里哪些环节最该交给自动化? 六个环节最适合:一是优先提示词的筛选与刷新,二是跨平台声量份额的每日测量,三是竞品被AI引用来源的逆向追踪,四是情感倾向的持续监控,五是AI关于品牌幻觉的核查,六是把这些数据自动聚合成定期报告。它们的共同点是高频、重复、结构化,这类活人做又累又容易出错,机器却能不知疲倦地精确完成。 ## 为什么声量份额要拆到单个提示词去看,而不是看整体? 因为整体平均会把真相抹平。你可能整体份额看着还行,但在某几个高价值提示词上其实是完全缺席的。只有拆到单提示词、并且跨平台分开看,你才能定位到底是哪几场仗打赢了、哪几场在丢分,从而把优化资源精准投到最该救的地方,而不是被一个笼统的平均分误导。 ## AI幻觉为什么值得单独设一道监控? 因为它的杀伤力直接且隐蔽。AI可能凭空捏造你的价格、瞎编功能、报错资质,用户看到这些错误信息很可能直接据此决策,而你自己完全不知情。设一道幻觉核查,就是拿你的真实事实作基准去比对AI各平台的表述,一旦对不上就报警。抓出来之后,还要靠更新官网、补齐结构化数据等方式修正源头信号,给AI喂清晰可核查的事实。 ## 情感追踪和声量份额有什么区别,为什么两个都要盯? 声量份额回答的是有没有被提到、提到的比例多高;情感追踪回答的是被提到时说的是好话还是坏话。两者缺一不可——被大量提到但全是负面框定,可能比默默无闻更糟。一句据反馈可能有某某问题的负面描述,足以劝退大半潜在客户。只有同时盯住量和质,你才能完整判断自己在AI里的真实处境。 ## 小团队没有专门工具,可以先从哪一步开始做AEO监控? 建议从优先提示词清单和声量份额这两项起步。先花时间列出十到二十个真正高价值的核心提示词,然后哪怕先靠人工,每周固定在主流平台上把这些问题问一遍,记录有没有提到你、旁边推荐了谁。这份手动记录会很快让你意识到波动的真实存在,也能帮你判断后续值不值得投入自动化工具。先把该盯什么想清楚,比一上来就堆工具重要得多。 ## 权威参考资料 ## 排名转化都正常生意却没起色?三个问题看清真实搜索表现 - URL:https://zhangwenbao.com/search-performance-presence-interpretation-momentum.html - 分类:AI监控与数据 - 发布:2026-06-23 | 更新:2026-06-23 - 摘要:排名和转化看着都正常,生意却卡住不动,问题往往出在更上游。本文拆解衡量真实搜索表现的三个问题与需求可发现性差距诊断法,给独立站和外贸站一套把预算花在刀刃上的判断清单。 - 关键词:AI可见性,创作者,品牌词 > **TLDR**:摘要:排名在涨、转化也没塌,可生意就是不见起色——大多数人这时候会去抠转化率,方向其实从一开始就偏了。真正能照出搜索表现好坏的,是三个更上游的问题:你有没有出现在需求刚冒头的地方、被搜到时有没有被读懂、这份资产是在复利还是每一单都得花钱买。这篇把这三问拆成一套能落地的诊断框架,再配上“需求排名对照可发现性排名”这把尺子,帮你判断钱到底该往哪儿砸。 > 摘要:排名在涨、转化也没塌,可生意就是不见起色——大多数人这时候会去抠转化率,方向其实从一开始就偏了。真正能照出搜索表现好坏的,是三个更上游的问题:你有没有出现在需求刚冒头的地方、被搜到时有没有被读懂、这份资产是在复利还是每一单都得花钱买。这篇把这三问拆成一套能落地的诊断框架,再配上“需求排名对照可发现性排名”这把尺子,帮你判断钱到底该往哪儿砸。 ## 为什么排名涨了、转化也不差,生意却不见起色? 保哥这些年陪不少独立站和外贸站做复盘,遇到最多的一种困局长这样:后台报表挑不出毛病,关键词排名一路向上,品牌词的转化也稳,单次获客成本压得住,可一问营收增量,老板就沉默了。报表全是绿灯,生意却在原地踏步。 问题不在于数据假,而在于这些数据测的是结果,不是过程。排名和转化告诉你“已经被你抓住的人成交得怎么样”,却完全测不到“还没进到你视野里的人,是不是压根就没机会遇见你”。换句话说,你拿着一把只能量漏斗底部的尺子,去判断整条漏斗的健康度。 更隐蔽的一层,是组织上的割裂。品牌团队管声量和心智,效果团队管点击和成交,两拨人各有各的预算、各有各的成功定义,中间隔着一道墙。可消费者那头根本没有这道墙——他在一次决策里会同时刷到搜索结果、评论、广告、AI给的答案、电商平台的列表、创作者的安利。体验是一整块的,衡量却被切成了两半。这种指标错配,在KPI仪表盘全是绿灯生意却没动那篇 (https://zhangwenbao.com/ai-search-kpi-blind-spot-metric-swap.html)里专门拆过,这里不重复。 测错指标的代价,比很多人想的更隐蔽。它不会让报表难看,恰恰相反——它让报表好看,好看到你以为一切正常,于是把本该投向上游的预算继续加码在已经饱和的下游。等到几个季度后增长彻底停滞,你回头复盘,才发现问题早就埋下了,只是被一堆漂亮的下游指标盖住了。这种“用对的方法把错的事情做到极致”的陷阱,是搜索表现里最贵的一种。 要跳出这个困局,得换三把尺子。不是问“我排第几、转化几个点”,而是问下面这三个更要命的问题。这三问不是并列的检查项,而是一条有先后的链路:先得在场,才谈得上被读懂;被读懂了,才可能攒下势能。任何一环断了,后面都白搭。 ## 第一问:你出现在需求“开始形成”的地方了吗? 需求不是在结账页才出现的,它在更早的地方就已经悄悄成型。一个人想买跑步装备,往往先去刷小红书看别人怎么搭、上论坛问哪双鞋包脚、去平台看评价区的吐槽、在AI助手那儿丢一句“预算八百以内有什么推荐”——这些全是需求“开始形成”的现场。等他搜你的品牌词时,决策的大头其实早就定了。 所以第一问的真正含义是:你的品牌,出现在需求起点了吗,还是只守在转化终点?具体可以拆成几个场景自查—— - 用户在早期探索、还没锁定品牌时,搜泛需求词能不能碰到你; - 做品类横向对比时,对比清单里有没有你; - 翻评论和真实口碑时,关于你的声音是正是负还是干脆没有; - 在电商平台、创作者内容、社交搜索这些非搜索引擎的入口,你的覆盖密度够不够。 怎么落地查?一个可操作的做法是先列一张“需求起点地图”:把目标客户从冒出念头到掏钱的整条路上会经过的入口全摆出来,再逐个去搜、去看自己在不在场、排在什么位置。怎么验证有没有改善?盯一个先行指标——非品牌泛需求词的展现份额,以及第三方平台(评论站、平台分类页、创作者内容)里品牌被提及的频次,看它们是不是在往上走。要是动作做了三个月还纹丝不动,多半是你只在自己地盘发力,没真正挤进那些第三方现场,得换打法、把资源往站外的内容和公关上挪。 旅游这个品类把这件事演示得最透:人们是先决定“今年去哪儿玩、大概什么档次”,才慢慢收敛到具体某家。谁在早期探索那一刻就反复被看见,谁就拿走了市场份额的大头。对它来说,存在感几乎就是份额本身。 ## 需求形成的现场,到底散落在哪几个入口? “出现在需求形成的地方”听着抽象,落到具体动作上,其实就是把那几个真实入口一个个盘清楚。这些入口大多不在你自己的官网里,恰恰是最容易被忽略的盲区。下面这几类,是盘客户时几乎每次都要逐个查的—— - 电商平台的站内搜索和分类页:很多人买东西第一步不是上Google,而是直接在亚马逊、独立站聚合平台里搜。你在这些平台的关键词排名、分类页露出、评分星级,决定了你在这一层在不在场。动作:盯住平台站内的核心品类词排名,把标题、属性、评价星级当独立战场经营。 - 第三方评论站和测评内容:用户做决策前总要找“中立第三方”背书。这些站点里有没有你、说你好还是坏,AI也在大量抓取它们来形成判断。动作:主动争取进入垂直测评站的对比清单,而不是只在自家页面自卖自夸。 - 创作者内容:在YouTube、小红书、抖音上,测评博主的一条视频可能比你的官网更能左右决策。动作:和真正覆盖你目标客群的创作者合作,让品牌出现在他们的横向对比里。 - 社交搜索:越来越多年轻用户直接在社媒里搜,把它当搜索引擎用。动作:把社媒账号的内容也按搜索意图来组织,而不是只发品牌广告。 - 垂直社区和论坛:Reddit、知乎、行业论坛里那些“求推荐”的帖子,是高意图需求的密集地。动作:用真实有用的回答建立存在感,硬广只会被反噬。 - AI助手对话:用户直接问AI“帮我推荐几个”,这一层你在不在推荐名单里,前面几个入口的积累在这里集中兑现。 把这六个入口列成一张表,逐个标上“在不在场、排第几、口碑正负”,你对自己真实存在感的认知会比只看排名报表清醒得多。很多站长第一次做这张表,都会被自己在前五个入口的大面积空白吓一跳——而那恰恰是增长被卡住的真正原因。 ## 品牌词转化很猛,是不是就高枕无忧了? 这是保哥最想给你提个醒的陷阱。很多站长看到品牌词转化漂亮,就默认“我这盘棋稳了”。但品牌词转化强,只能说明已经认识你的人很愿意买,它恰恰掩盖了一个要命的事实——还不认识你的人,可能根本碰不到你。 把这两件事拆开看,结论会立刻翻转:如果品牌词转化很强、但非品牌的存在感很弱,那这不是转化问题,而是上游的获客口太窄。增长的钱不该砸在已经会买的人身上去优化转化率,而该砸在评论平台、电商货架、创作者内容、社交搜索和长尾非品牌词上,把还没听过你的人先捞进来。 判断自己是不是踩在这个坑里,有个简单办法:把品牌词和非品牌词彻底分开算两笔账,分别看展现、点击和它们各自的趋势。要是品牌侧一片繁荣、非品牌侧一潭死水,那你看到的“健康”是个幸存者偏差。这套品牌词与非品牌词分账的具体做法,可以参考之前写过的拆分逻辑,思路是一致的。 那上游的投入具体长什么样?不是再去抢一遍品牌词,而是去经营那些“还不知道你是谁”的人会经过的地方:写真正解决品类问题的内容去接非品牌长尾、把产品铺进第三方评测和对比清单、和创作者合作让品牌出现在横向推荐里、在用户求推荐的社区里用有用的回答刷脸。这些动作短期看不出转化,却是在把漏斗顶部一点点撑开。一个常见的误区是,老板看不到这些投入的即时回报,就把预算砍了转去加码品牌词广告——结果就是品牌词转化越来越好看、新客却越来越少,把自己一步步逼进一个越来越窄的存量池子里。 ## 第二问:被搜到的时候,你“被读懂”了吗? 光出现还不够。出现了却没人看懂你好在哪、跟别家有什么不一样,那这个曝光等于白给。第二问问的就是:你露脸的时候,是不是以一种“能帮用户做出选择”的方式被理解的? 这事在AI搜索时代变难了。AI给的答案是高度压缩的,而且不稳定——它怎么描述你,可能这个月和下个月就不一样。用户带着很具体的意图来,比如“这东西到底值不值”、“有没有比X更好的平替”、“真实买过的人怎么说”、“适不适合我这种情况”,AI会替他把一堆零散信息揉成一句结论。要是你在广告里、自然结果里、评论区、落地页、AI摘要里给出的说法各唱各的调,用户就得自己费劲去拼图,而大多数人懒得拼,转身就走了。 所以“被读懂”的核心是一致性:同一个核心价值,在所有触点上要用同一套口径讲。Google官方在面向AI功能的网站指南 (https://developers.google.com/search/docs/appearance/ai-features)里讲得很直白——想出现在这些AI功能里,你不需要额外造什么机器可读文件或特殊标记,AI会用“查询扇出”的方式去发散检索、把更宽更杂的链接摆出来。这话反过来读就是:它读的还是你那套实打实的内容和结构,你内容里把自己讲清楚没有、口径统没统一,直接决定它把你描述成什么样。关于跨引擎到底怎么系统地测自己“被理解”的程度,在AI可见性漏斗查询树那篇 (https://zhangwenbao.com/ai-visibility-funnel-query-tree.html)里给了一套可操作的框架。 怎么落地做一次“被读懂”的自查?一个简单办法是把你的核心价值主张写成一句话,然后挨个比对各个触点上的说法对不对得上:付费广告里你强调的是什么、自然搜索结果的标题描述讲的是什么、评论区用户复述出来的是什么、落地页第一屏给的承诺是什么、AI摘要把你概括成了什么。这五处说法如果指向同一个理由,那你是被读懂的;如果各说各话,用户就得自己当侦探去拼,而大多数人没这个耐心,拼到一半就关掉页面去看下一家了。 怎么验证这件事有没有改善?盯AI答案里描述你的那几个关键词,看它是不是慢慢收敛到了你想要的标签上。要是改了半天AI还在用旧框架说你,那说明你喂给它的料还不够干净、不够一致,得回头继续统口径。这个过程往往要反复几轮,因为AI对内容的重新理解有滞后,别指望改一次就立竿见影。 ## 为什么有的牌子在AI答案里露脸越多,份额反而越掉? 这是最反直觉、也最值得你警惕的一个发现。直觉上,AI提你提得越勤,应该是好事。但把不同品类摊开看,关系并不统一,甚至会掉个头。 在时尚、美妆这类品类里,一个牌子在AI答案里出现得越多,市场份额往往也越高,两者高度同向——这里AI可见性确实是份额的好代理。可一换到金融、综合零售这类品类,关系就反过来了:AI提得最勤的那几个,份额反而在往下走。 这说明什么?说明在这些品类里,AI虽然频繁提到这些牌子,却是用一种“劝退式”的方式在描述它们——可能反复强调它的高收费、差评、或者把它框定在一个不利的对比位置上。曝光不是问题,被怎么描述才是问题。露脸越多,反而把负面框架放大得越狠。 背后的机制其实不难懂。AI给推荐时,不是简单数谁被提得多,而是要从一堆内容里提炼出“该不该选它”的判断。在金融、综合零售这类信任成本高、用户特别在意踩坑的品类里,网上关于大牌的内容往往掺着大量投诉、纠纷、避坑提醒——这些负面语料越多,AI越容易把它们总结进描述里。 于是就出现了那个吊诡的局面:你越大、被讨论得越多,被翻出来的负面也越多,AI在推荐时反而越谨慎。中小品牌内容少、负面也少,有时候反而显得“干净”。这不是说曝光没用,而是提醒你:在做大存在感之前,先得把别人怎么谈论你这件事管起来,否则放大的是一把双刃剑。对中小品牌来说,这甚至是个隐藏的窗口期——趁负面还没积累,先把正面口碑和清晰定位铺扎实,等规模上来时AI对你的底色判断就已经定了。 所以这一层的动作很明确:定期去审一遍AI系统到底是怎么描述你品牌的。具体怎么做——拿一批真实购买意图的提问,挨个丢给主流AI引擎,记下它把你和谁放一起比、突出了你哪些属性、用了什么措辞。怎么验证?看这些被拎出来的属性,是在帮你成交还是在帮对手。要是发现AI老拿你的短板说事,那别急着加预算冲曝光,得先回去把官网的自我描述、结构化数据、第三方口碑这些“喂给AI的料”修一遍,否则你花钱买来的只是更大声的劝退。 ## 第三问:你的搜索资产在“复利”吗,还是每一单都得花钱买? 前两问看的是横截面,第三问看的是时间轴。大多数衡量周期都太短,短到根本看不出一个品牌到底是在积累可复利的资产,还是在持续烧钱续命。第三问就是要把这层捅破:你的品牌是在变得越来越好找、越来越被信任、越来越容易被选中,还是每一笔成交都还得现买现卖? 判断有没有在复利,盯这几个信号: - 品牌词搜索量,在没加品牌投放的情况下还在自然往上走; - 直接访问(直接输网址、收藏夹进来的)在变厚; - 老内容不靠新一轮投放,自己还在持续带来访客; - 评论和口碑的量在稳定累积,而不是冲一波就停。 反过来,下面这几个是“在烧钱续命”的报警灯:付费依赖越来越重、自然需求在软、品牌词的起伏死死跟着投放走(一停投就掉)、访客来了却不转化。这些信号怎么量化追踪,在零点击时代品牌影响力还怎么衡量那篇 (https://zhangwenbao.com/zero-click-search-brand-influence-measurement.html)里给过一套零点击场景下的代理指标,可以直接搬来用。 这里有个特别值得做的实验:挑一段相对平稳的时期,把品牌投放停一周,盯着品牌词搜索量和直接访问的变化。要是几乎没动,说明你已经攒下了真实的认知资产,停投也有人主动来找你;要是应声就掉、掉得还很陡,那残酷的真相是——你那些所谓的“品牌指标”,其实是花钱租来的,租约一到期就消失。这个测试很多老板不敢做,可正是因为不敢做,他们才一直分不清自己到底是在建资产还是在交租金。 说句大白话:广告能买来一时的“出现”,但买不来“复利”。复利只能靠内容、口碑、品牌认知这些慢变量一点点攒出来。一个站健不健康,最后就看它松开油门(停投)之后,还能不能靠惯性往前滑一段。能滑得越久,说明你攒下的势能越厚,往后每一笔获客的成本也会被这层势能一点点摊薄。 ## 需求排名和可发现性排名,到底差了多少? 三个问题问完,得有把尺子把它们串起来,给出可操作的判断。这里用的是一组对照:需求排名对照可发现性排名。 需求排名,是这个品类里大家对你这个牌子的真实需求强度排第几(品牌搜索量、口碑声量这些反映“想要你的人有多少”)。可发现性排名,是你在那些需求形成的现场实际能被找到的程度排第几。把这两个排名一摆,差距在哪儿,问题就在哪儿。 诊断场景 | 表现特征 | 钱该往哪砸 | 存在感弱、动量健康 | 漏斗本身在转,但顶部是空的,没人进来 | 投品类可见性,别再优化转化——漏斗底部没毛病 | 存在感强、解读差 | 到处都看得见你,但描述乱、口径不一 | 先修品牌在搜索、评论、AI答案里被怎么说,再谈加预算 | 存在感和解读都在、动量弱 | 能被看见也被读懂,就是攒不下势能 | 缺的是“证明”——评论、声量份额、口碑得先补上,否则获客花的钱回不了本 | 这把尺子最实用的一点是:当需求排名明显高于可发现性排名时——也就是想要你的人不少、但你在该出现的地方却不够显眼——这个缺口通常在三个月左右就能补上,因为需求已经在那儿了,你要做的只是把自己挪到被看见的位置,而不是从零造需求。这是性价比最高的一种增长,很多站长却因为只盯转化率,白白把它放过了。 举个好理解的对照。假设你这个牌子在用户心里的需求强度,在同品类里排得上前五,可你在品类词、评论平台、AI推荐里的实际露出,连前二十都进不去——这个巨大的落差就是你最该先补的窟窿,而且补起来快,因为你不是在说服别人想要你,只是在让已经想要你的人能找到你。反过来,要是你的可发现性排名比需求排名还高(到处都看得见你,但其实没多少人真的想要你),那硬铺存在感就是把钱往水里扔,问题出在更根上的产品力或品牌认知,不是搜索能解决的。先看这两个排名谁高谁低,再决定动作,能帮你避开大多数把预算花反方向的错。 ## AI带来的访客那么少,为什么还值得当回事? 有个常见的误判:一看后台,从AI平台过来的引荐流量占比小得可怜,连百分之一都不到,于是觉得“这玩意儿不值得投入”。保哥得拦一下这个结论。 有大型新闻机构披露过,AI平台明明频繁引用它们的内容,可真正点回站里的访客却不到1%——光看这个数,确实不起眼。但另一头的故事完全不同:也有出版机构发现,从AI平台过来的那一小撮访客,订阅转化率是传统搜索访客的好几倍。量很小,质却高得离谱。 原因不难理解:能被AI筛过一轮、还愿意点进来的人,往往已经在AI那儿做完了大半评估,是带着相当明确的意图来的——这不是漫无目的的逛街客,而是临门一脚的准买家。用占比去给这个渠道判死刑,等于把最贵的那拨人扔了。 换个角度看,这其实重新定义了“什么叫赢”。传统搜索的逻辑是争点击、把人引到站里来转化;而在AI这一层,很多时候用户根本不点进来,他在AI给的那段答案里就把判断做完了。这意味着你的目标得从“抢一次访问”挪到“成为AI答案里那个被推荐、被正面描述的选项”——哪怕这次没带来点击,它也在用户心里种下了认知,下一次他可能就直接搜你的品牌词进来了。把AI渠道单纯当成一个引流来源去算账,会严重低估它在决策链更上游埋下的那部分价值。 更现实的麻烦是,这部分流量你在常规报表里还特别难单独拎出来。就拿Google Search Console来说,它的效果报告 (https://support.google.com/webmasters/answer/7576553)能按搜索类型拆成网页、图片、视频、新闻这四类,可AI答案带来的曝光和点击,并没有一个干净的独立维度让你筛。这也是为什么很多人压根没意识到这拨高质量访客的存在。怎么把这部分隐形价值补回来,在零点击时代归因怎么补那篇 (https://zhangwenbao.com/ai-search-attribution-zero-click-proxy-signals.html)里给了一套代理信号的搭法。 ## 这三问,隔多久测一次才靠谱? 知道该测什么,还得知道隔多久测一次。三问的节奏并不一样,用同一个周期一刀切,要么白费力气,要么错过信号。 存在感适合按季度测。你在各个入口的覆盖不是一夜之间能铺开的,它跟着内容、合作、口碑慢慢长,测得太勤反而看不出趋势,季度复盘一次刚好能看清自己挪动了多少。 解读适合按月测,甚至更勤。因为AI给的描述变得快,可能这个月还把你框得不错,下个月就换了说法。一旦你改了官网描述、补了结构化数据、处理了一批差评,更要紧盯着AI的口径有没有跟着变。这一层是反应最快、也最值得高频盯的。 动量只能看长周期。复利是个慢变量,盯一个月的波动毫无意义,得拉到6到12个月的趋势线上看:品牌词搜索、直接访问、老内容的自然流量,这些曲线是在持续抬头,还是一停投放就软。周期太短,你会把季节性波动误当成趋势,做出错误的加减预算决定。 把三个不同节奏叠在一张时间轴上,你会得到一个更立体的判断:短周期看解读有没有跑偏,中周期看存在感铺得动不动,长周期看势能攒没攒下。任何一条线异常,都能提前几个月给你预警,而不是等营收掉了才后知后觉。 ## 把品牌和效果拆成两个部门管,是不是从根上就错了? 回到最开头那道组织的墙。品牌归品牌、效果归效果,各管各的预算和KPI,这套分工在传统漏斗时代还能凑合,到了今天就成了系统性的盲区。因为这三问根本不是三件独立的事,它们是一个互相喂养的闭环。 这个闭环可以这样串:存在感喂养解读——你出现得够多,AI和用户才有足够的料把你看懂;解读喂养动量——被读懂、被选中得多了,品牌认知和口碑才攒得起来;而动量反过来又拉低存在感的成本——一旦有了势能,你不用再花大钱买曝光,自然就被反复看见。三者是一根链条,断哪一环,后面全跟着塌。 这个闭环一旦转起来,威力是复利级的:势能越厚,你买曝光的单价就越低,省下的钱又能投回内容和口碑,把势能堆得更厚。强者会越来越强,靠的不是某一年砸了多少广告,而是这台飞轮转了多少圈。反过来,飞轮没转起来的牌子,每年都得从零开始重新买流量,钱花得不少,却什么资产都没沉淀下来,这才是最让人心疼的浪费。 可一旦把它们拆给两个互不通气的部门,没人为这整根链条负责。品牌团队看不到自己的投入怎么变成了效果侧的转化,效果团队也不知道自己的成交在帮品牌攒什么资产,中间的传导全靠运气。一个实在的建议是:衡量框架要按这根链条来搭,而不是按部门墙来切。哪怕组织上一时拆不动,至少在数据看板上得让这三问并排站在一起,逼着两边看同一张图。 ## 这套三问,落到独立站和外贸站具体怎么跑? 讲框架容易,落地才是真功夫。保哥拿手上一个做户外装备的北美独立站客户举个去标识化的例子,看看这三问具体怎么一步步用。 这家站当时的症状很典型:品牌词排名稳、品牌词转化也好,老板却纳闷增长卡住了。按三问过一遍——第一问,去查需求起点,发现非品牌的品类词、还有几个大评论平台和户外社群里,几乎找不到他家的影子,存在感弱;第二问,把品牌词和品类词分账后看,已经认识他的人买得很欢,但新客入口窄得吓人;第三问,停掉一周品牌投放做测试,品牌词搜索量应声就掉,说明没有复利,全靠买。 对照那张诊断表,他属于典型的“存在感弱、但底层动量其实有救”——漏斗能转,就是顶上没人进。于是动作很明确:不去碰已经够好的转化率,而是把预算挪到品类内容和站外口碑上,先在那几个评论平台和社群里把存在感铺起来。这一步不需要新造需求,因为需求排名本来就不低,要的只是把可发现性这条腿补齐。 再看一个相反的例子,提个醒:另一个做美妆的客户,症状刚好倒过来。她家在各个入口的存在感不弱,测评博主、社群、平台分类页里到处都看得见,可生意一样不温不火。按三问一查,问题出在第二环——被搜到了,却没被读懂。她在不同渠道讲的卖点各不相同:官网主打成分党、达人内容里强调性价比、AI答案则把她框成了一个“平价替代”。三套说法互相打架,用户拼不出一个清晰的理由非买她不可,AI也只能挑那个最弱的标签贴上去。 这种情况下,把钱再砸去铺存在感纯属浪费——她不缺曝光,缺的是一致的口径。动作是反过来的:先把核心价值在所有触点上对齐成同一句话,修官网描述、统一达人简报的口径、补足结构化数据和真实好评,让AI有干净的料可抓。两个案例放一起就看明白了:同样是生意卡住,病根可能在完全不同的环节,盲目加预算只会把钱浇在不漏水的地方。 对独立站主、外贸运营和SEO从业者来说,这套三问最大的价值,是把“我到底该往哪儿使劲”这个含糊的焦虑,变成一个能照着查的清单:先看在不在场,再看被没被读懂,最后看攒没攒下势能。哪一环最弱,钱就先往哪一环砸。比起一头扎进转化率的小数点里反复纠结,这才是把杠杆撬在了对的地方。 真要上手,不用一步到位搞个大而全的看板。最小可行的做法是:这周先做那张“需求起点入口表”,老老实实把六个入口逐个搜一遍、标上在不在场;下周把品牌词和非品牌词分账,看新客入口宽不宽;找个生意平稳的周末把品牌投放停一天,看品牌词搜索掉不掉。三件小事做完,你对自己卡在三问的哪一环,心里基本就有数了。框架的价值不在于它多精密,而在于它逼你从“反正报表是绿的”这种自我安慰里跳出来,去看那些报表故意不告诉你的地方。 ## 常见问题解答 问:这套三问框架,和我现在用的排名、转化指标是替代关系还是补充关系? 是补充,不是替代。排名和转化依然要看,它们测的是漏斗底部的成交效率。三问补的是它们测不到的上游——你在不在场、被没被读懂、有没有在复利。两套一起用,才看得到整条漏斗。 问:需求排名和可发现性排名,没有现成工具直接给,我怎么估? 需求排名可以用品牌搜索量、口碑声量这些反映“想要你的人有多少”的数据近似;可发现性排名则靠你在品类词、评论平台、AI答案、社交搜索这些需求现场的实际露出程度来估。不用追求精确,关键是把两个排名摆一起看缺口在哪。 问:AI引荐流量占比那么低,我是不是可以先不管,等它涨上来再说? 不建议。占比低不等于价值低,从AI平台点进来的那拨人往往意图最明确、转化最高。等它涨上来你再布局,前面被对手反复喂给AI的认知优势已经攒厚了,到时候很难撬动。 问:我是小站,没法像大牌那样到处铺存在感,这框架对我有用吗? 反而更有用。小站资源有限,最怕把钱撒在错的地方。三问能帮你判断当下最弱的是哪一环,把有限的预算集中砸在一个点上,而不是平摊。很多时候补齐可发现性这条腿,三个月就能看到需求缺口收敛。 问:怎么知道AI是用“劝退”的方式在描述我的品牌? 拿一批真实购买意图的提问挨个去问主流AI引擎,记下它把你和谁比、突出了你哪些属性、用了什么措辞。如果反复强调的是你的短板、或者总把你框在不利的对比位,那就是劝退式描述,得先回去修自我描述和第三方口碑,而不是加预算冲曝光。 问:把品牌和效果合在一起衡量,组织上推不动怎么办? 组织墙一时拆不动很正常,但数据看板可以先打通。至少让“存在感、被理解、动量”这三组指标在同一张图上并排呈现,逼着品牌和效果两边看同一份现实,比各看各的报表强得多。先让数据合流,组织合流往往是水到渠成的下一步。 ## 权威参考资料 ## ChatGPT推荐带来的访问,2.5倍且更优质,却在你后台隐了身 - URL:https://zhangwenbao.com/chatgpt-recommendation-traffic-attribution-blindspot.html - 分类:AI监控与数据 - 发布:2026-06-22 | 更新:2026-06-22 - 摘要:AI推荐正在制造真实需求,却因为引荐来源丢失、没有UTM、被归进默认渠道而在你的分析后台隐身,让你低估它、不敢投。看懂三大行业的对照数据,学会用referrer、落地页特征、品牌词抬升和问客户等办法,把这块暗流量从噪音里识别出来。 - 关键词:GEO,AI可见性,数据分析,流量归因 > **TLDR**:摘要:一份覆盖金融、旅游、美妆三大行业的实测数据给出了硬证据:被ChatGPT推荐的品牌,一周内拿到的网站访问量是竞品的2.5倍,而且这些访客明显更优质——浏览页数几乎翻倍、停留时长翻倍。问题在于,这波高质量流量在你的分析后台里基本是"隐身"的:超过一半被算成了自然搜索,还有一部分混进了直接流量。结果就是,AI正在实打实地给你带客,你却因为看不见而严重低估它、不敢往里投。本文带你看懂这份数据、拆清AI推荐流量为什么会在后台被错误归因,并给出几个能动手把它从噪音里揪出来的办法。看不见不等于不存在,用旧地图是找不到新大陆的。 > 摘要:一份覆盖金融、旅游、美妆三大行业的实测数据给出了硬证据:被ChatGPT推荐的品牌,一周内拿到的网站访问量是竞品的2.5倍,而且这些访客明显更优质——浏览页数几乎翻倍、停留时长翻倍。问题在于,这波高质量流量在你的分析后台里基本是"隐身"的:超过一半被算成了自然搜索,还有一部分混进了直接流量。结果就是,AI正在实打实地给你带客,你却因为看不见而严重低估它、不敢往里投。本文带你看懂这份数据、拆清AI推荐流量为什么会在后台被错误归因,并给出几个能动手把它从噪音里揪出来的办法。看不见不等于不存在,用旧地图是找不到新大陆的。 ## 一份新数据:被ChatGPT推荐的品牌,访问量是竞品的2.5倍 关于"AI推荐到底有没有用",过去大家多半凭感觉吵,缺硬数据。现在有了。一项针对美国桌面端用户、横跨2025年下半年的行为追踪研究,给出了一个相当扎实的结论:当用户向 OpenAI的ChatGPT (https://openai.com/chatgpt/) 提了行业相关的问题、拿到某个品牌的推荐之后,一周内,他去访问这个被推荐品牌的概率,平均是去访问其直接竞品的2.5倍。 这个研究的设计很讲究,排除了不少干扰:只统计那些拿到推荐后七天内的访问,剔除了此前四周已经访问过该品牌的人,也剔除了在提问里直接点名品牌的人。换句话说,它尽量排除了"本来就认识、本来就想去"的情况,留下的是因为AI推荐才产生的增量访问。2.5倍这个数字,说的是AI这一句推荐,实打实地把人往某个品牌那儿推了一把。Similarweb公布的这组生成式AI可见度数据 (https://www.similarweb.com/blog/marketing/geo/gen-ai-stats/),第一次把"AI推荐能带来真实访问"从行业直觉变成了可量化的事实。 对做独立站、做出海的人来说,这个信号的意义不用我多说:那个你一直半信半疑的AI流量入口,是真的,而且效率不低。问题只剩一个——你能不能看见它、并把它用起来。 值得强调的是这个数字的"增量"属性。它排除了本来就认识你、本来就会来的人,量出来的纯粹是AI这一推所产生的额外访问。这跟很多AI流量报告不一样——那些常常把"碰巧从AI来的所有访问"都算进去,里头混着大量本来就要来的人,数字虚高、参考价值打折。这份研究的设计,挤掉了这部分水分,留下的是干货。所以当你看到2.5倍时,可以比看其他AI流量数字时更踏实一点:这是AI实打实"多带"给你的,不是把存量算了一遍。理解这层,你才不会在自己测算时犯同样的错——把本来就会来的客人,也记到AI头上去邀功。 ## 不只是来得多,来的还是"好客户" 如果只是访问量多,还不足以让人兴奋,毕竟流量有水分。但这份数据最让保哥眼前一亮的,是AI推荐带来的访客质量明显更高。 具体看两个核心的参与度指标:受AI推荐影响而来的访客,平均浏览了 12个页面、在站上停留了 11.8分钟;而非AI影响的普通访客,这两个数字只有 6.5个页面和 5.6分钟。也就是说,AI带来的访客,浏览深度和停留时长几乎都是普通访客的两倍。 指标 | AI推荐影响的访客 | 普通访客 | 平均浏览页数 | 12页 | 6.5页 | 平均停留时长 | 11.8分钟 | 5.6分钟 | 这个差距背后的逻辑其实很顺:能问到AI让它推荐、又愿意点进来的人,往往已经走到了决策链条的中后段,意图比泛泛而来的人强得多。AI帮你做了一轮前置筛选,把那些"还在闲逛"的过滤掉了,送到你站上的,是带着明确问题、准备认真看看的高意向用户。一个浏览12页、待将近12分钟的访客,离转化能有多远?这已经不是"流量",是"准客户"。 这一点对预算的含义很关键。衡量一个渠道值不值得投,不能只看它带来多少访问(量),更要看这些访问的转化潜力(质)。一个量大但质差的渠道,可能远不如一个量中等但质极高的渠道划算。AI推荐恰恰是后者——它送来的人少而精,每一个都更接近成交。如果你只用"带来多少UV"这一个维度去评估它,会严重低估它的真实价值;把参与度和转化潜力算进去,它的性价比排名会立刻往上窜。这也预告了后面要讲的核心矛盾:一个又精又准的好渠道,偏偏在你的报表里几乎不留痕迹。 ## 三个行业的对照实验:金融、旅游、美妆都成立 2.5倍是个平均数,可能有人会怀疑是不是被某个特殊行业拉高的。研究者把数据拆到三个差异很大的行业里分别验证,结果这个规律稳得很——哪个品牌被推荐,哪个品牌的访问占比就显著领先竞品。 行业 | 被推荐方 → 自身访问占比 | 对照竞品访问占比 | 金融 | 美国运通被推荐 → 7.2% | 第一资本3.1% | 金融 | 第一资本被推荐 → 14.2% | 美国运通3.8% | 旅游 | Skyscanner被推荐 → 9.5% | Kayak 7.6% | 旅游 | Kayak被推荐 → 12% | Skyscanner 3.4% | 美妆 | Sephora被推荐 → 7.9% | Ulta 3.3% | 美妆 | Ulta被推荐 → 7.6% | Sephora 4.6% | 这张表读下来你会发现一个有意思的现象:被推荐方的访问占比,几乎总是大幅碾压没被推荐时的自己。同样是第一资本,被AI推荐时拿到14.2% 的访问,没被推荐(竞品被推荐)时只剩3.8%。同一个品牌,是否被AI推荐,访问表现能差出三四倍。这说明AI推荐不是锦上添花的小变量,它是能在短时间内显著改变流量分配的大杠杆。被它点名,你就赢一大截;被它忽略,你的客户就被推到了竞品那边。这个对照,比任何理论都更能说明AI可见性为什么值得认真做。 ## 那为什么你的GA后台看不到这波流量? 讲到这,关键的转折来了。AI推荐既然带来这么多高质量访问,那它在你的Google Analytics后台里,应该是清清楚楚一条"来自ChatGPT"的流量才对吧?现实是——基本看不到。这正是AI流量最坑人的地方:它真实存在,却在你的数据里隐了身。 同一份研究还扒出了归因的真相:那些受AI推荐影响的访问,有 55.9% 在分析工具里表现为搜索流量(普通访问这个比例是40.4%),还有 19.9% 被算作直接流量(普通访问的直接流量占比反而高达38.8%)。换句话说,AI带来的访客,一大半被你的后台默默记到了"自然搜索"头上,剩下一部分进了"直接访问"这个糊涂账,唯独没有一个清晰的"AI推荐"标签。 这意味着什么?意味着你可能一直在低估自然搜索、误读直接流量,并且完全没意识到AI已经成了你的获客渠道之一。你以为是SEO做得好带来的搜索增长,里头其实掺了一大块AI推荐的功劳;你以为那些"直接输网址进来"的忠实用户,有些其实是被AI推过来的新客。地图画错了,你对自己流量结构的整个认知都是偏的。 这里还藏着一个反直觉的细节值得品一下:AI影响的访问里,直接流量占比反而低于普通访问(19.9% 对38.8%)。乍看奇怪——不是说AI流量会被算进直接流量吗,怎么占比还更低?原因是AI影响的那批人,更多带着搜索动作(自己又去搜了一道),所以大头进了搜索桶,反衬得直接流量占比显得低。这恰恰说明AI推荐和"搜索"这个动作深度交织:很多人被AI推荐后,不是直接点链接,而是转头去搜你的名字再进来。理解这条"AI推荐 → 触发搜索 → 进站"的路径,对后面怎么识别它至关重要——它意味着你不能只盯着referrer是AI域名的那一小撮,还得去搜索和品牌词那边找它的影子。 ## 拆解:AI推荐流量是怎么在后台"隐身"的 要解决问题,先得搞懂它为什么会发生。AI推荐流量被错误归因,不是Google Analytics出了bug,而是几个机制叠加的必然结果: - 引荐来源(referrer)丢失。分析工具靠访问携带的referrer信息判断"你从哪来"。但用户从AI助手点链接、或者干脆复制网址再访问时,这个referrer常常是缺失或被剥离的。W3C的引荐来源策略规范 (https://www.w3.org/TR/referrer-policy/)本身就定义了多种会主动剥离referrer的策略,referrer一丢,分析工具就成了睁眼瞎,只能把这次访问归到"直接流量"里。 - 没有UTM标记。你自己投广告会带UTM参数,方便追踪。但AI推荐你的时候,可不会贴心地帮你加UTM,它给的就是个光秃秃的网址,分析工具无从分辨这是AI来的。 - 被归进默认渠道分组。当一次访问既没有清晰referrer、又没有UTM时,GA4的默认渠道分组规则 (https://support.google.com/analytics/answer/9756891)会按它能拿到的线索把它塞进某个桶——要么因为带了点搜索特征算进"自然搜索",要么因为啥都没有算进"直接流量"。整个过程是自动的,AI推荐这个真实来源就这么被规则碾平了。 这套机制的产物,行业里有个形象的叫法:暗流量。维基百科对"暗社交流量"的定义 (https://en.wikipedia.org/wiki/Dark_social)讲的就是这类看着像直接访问、实则来路不明的流量。AI推荐流量,正是暗流量在2026年的最新、也最大的一个来源。理解了这点你就明白,不是AI没带客,是你的尺子量不到它。 ## 为什么AI偏偏把人导向内页,而不是首页? 前面提到一个排查线索:AI推荐的访客常常落在内页而非首页。这个特征值得单独说,因为它既是识别AI流量的关键信号,也藏着一条优化思路。 原因在于AI推荐的语境是高度具体的。用户问的不是"有什么好牌子",而是"预算两千、主要拍夜景,推荐哪款相机"这种带着明确条件的问题。AI为了给出贴合的答案,会去找最能回答这个具体问题的页面——往往是某个产品详情页、某篇针对性的对比测评、或者某个解决方案页,而不是泛泛而谈的品牌首页。于是它把人直接送到了那个最相关的内页门口,跳过了首页。 这对你的启发是双重的。第一,识别上:盯紧那些深层内页的流量异常,比盯首页更容易发现AI流量的踪迹。第二,优化上:既然AI偏爱把人导向能精准回答具体问题的内页,那你就该把这类高价值内页当成AI时代的"落地页"来经营——针对真实的用户问题,把产品规格、适用场景、对比信息、可核查的实证补到位。换句话说,过去你可能只精心打磨首页和几个核心页,现在你得意识到,那些回答具体问题的内页,才是AI最可能引用、最可能用来接客的入口。AI在后台到底会搜哪些具体问题来匹配你的页面,我在ChatGPT后台搜了什么那篇 (https://zhangwenbao.com/ai-background-grounding-queries-capture.html)里有完整的盘点方法,知道了它搜什么,你才知道该把哪些内页喂肥。 ## AI推荐流量和SEO流量,到底该怎么分开看? 既然AI流量大半混在了自然搜索里,一个绕不开的问题是:这两块到底怎么拆开,才能各自看清、各自优化?给一套思路。 首先要承认,在现有工具下,你很难做到100% 精确切分,但可以做到"建立两套独立的观察口径"。具体做法是: - 分指标看,而不是只看总量。传统SEO流量和AI推荐流量的访客画像不同——后者浏览更深、停留更久、更集中在内页。与其纠结每一次访问到底归谁,不如把"高参与度、落在内页"的那部分流量单独建一个观察分组,把它当成AI影响流量的代理指标来追踪趋势。 - 分目标看。SEO的目标是关键词排名和自然点击,AI可见性的目标是"在AI答案里被准确提及和推荐"。给这两件事设不同的KPI、用不同的方法监测,别用一个"自然流量涨了"把两件事的功劳混在一起邀功,那会让你看不清到底哪块在起作用。 - 分动作看。当你做了一次纯AI可见性的优化(比如补全某个对比页的实证、统一了全网信息口径),重点观察对应内页的高参与度流量有没有变化,而不是只看整体排名。把动作和它最该影响的指标对应起来,归因才不会一锅粥。 这套"分指标、分目标、分动作"的拆法,不追求会计意义上的精确,追求的是让你能分别判断两个渠道各自的健康度和投入回报。在AI流量还没有标准归因方案的阶段,能把两条曲线大致分开看,已经足够指导你"该往SEO加力还是往AI可见性加力"这个核心决策了。 ## 把AI推荐流量从噪音里揪出来:几个能动手的办法 好消息是,虽然没有一个开箱即用的"AI推荐"按钮,但你可以用几个组合动作,把这块隐身流量大致估出来、追踪起来。从易到难: - 查引荐来源里的AI域名。在分析后台里,专门去看referrer包含chatgpt、openai、perplexity、gemini等AI域名的访问。这部分是referrer没丢、能被直接识别的AI流量,是你能看见的冰山一角,先把它单独拎出来盯着。 - 看落地页与行为特征。AI推荐常常把人导向很具体的内页(某个产品、某篇对比、某个解决方案页),而不是首页。如果你发现某些深层内页的直接流量或自然搜索流量异常上涨、且这些访客的浏览深度和停留时长明显偏高(对得上前面那组高参与度特征),那很可能就是混进来的AI流量。 - 盯品牌词搜索的异常抬升。很多人被AI推荐后,不会直接点链接,而是转头去搜你的品牌名。所以品牌词的搜索量与点击如果出现说不清来由的上涨,背后往往站着AI推荐。把品牌词搜索趋势和你的AI可见性变化对照着看,能捕捉到这条间接路径。 - 用服务器日志补盲区。前端分析工具受referrer策略和拦截影响大,服务器日志相对更全。有技术能力的话,从原始访问日志里按AI域名和访问模式做分析,能补上前端工具看不到的部分。要做得更彻底,可以上服务端追踪,GA4的Measurement Protocol文档 (https://developers.google.com/analytics/devguides/collection/protocol/ga4)就是干这个的。 - 直接问客户。最朴素也最容易被忽略:在询盘表单、下单流程里加一句"您是怎么找到我们的",把"AI助手推荐"列为一个选项。一手的自述数据,是对所有间接推断最好的校准。 给个落地的优先级建议:如果你时间有限,先做第1招(查AI域名referrer)和第5招(问客户),这两招一个看现成数据、一个加个表单选项,成本最低、见效最快,能让你迅速对"AI到底给我带了多少客"有个初步的体感。等你确认这块流量确实可观,再投入精力去做第2、3、4招的精细化追踪。别一上来就追求完美的全链路归因,那容易半途而废;先用最省力的办法拿到第一个估算数字,让这件事在你心里和报表里"存在"起来,比什么都重要。 这几招没有一个能给你100% 精确的数字,但组合起来,足以让你从"完全看不见"进步到"心里有数"。在AI流量还没有标准归因方案的当下,"有数"已经比绝大多数还在抓瞎的同行强了。怎么系统地搭一套跨引擎的AI可见性测量框架,我在漏斗查询树那篇 (https://zhangwenbao.com/ai-visibility-funnel-query-tree.html)里讲得更完整,可以接着深入。 ## 这对你的预算意味着什么:别用旧地图找新大陆 把前面这些串起来,落到最实际的问题:这影响你怎么花钱。 归因失真的直接后果,是预算分配的系统性偏差。因为AI推荐的功劳被记到了搜索和直接流量头上,你在做投放复盘、算渠道ROI时,会严重低估AI可见性的价值,进而不敢往这个方向投——明明是个2.5倍效率、还专带高质量客户的渠道,却因为在你的报表里"没有数据",被当成不存在。与此同时,你可能把功劳错算给了别的渠道,继续往那些被高估的渠道里加码。钱花错了地方,根子是数据骗了你。 还有个更隐蔽的代价:归因失真会让AI可见性这件事在公司内部"立不了项"。你想申请资源去做GEO,老板第一句就是"它带来多少收入、给我看数据",而你恰恰拿不出清晰的数据——因为功劳都被记到搜索头上了。于是这个真实有效的渠道,因为在报表里"查无此人",永远排不进预算优先级,陷入"看不见所以不投,不投所以更看不见"的死循环。打破它的唯一办法,就是主动去把这块流量估出来、可视化出来,哪怕只是个粗略的估算口径,也好过报表上的一片空白。能拿出"我们估算AI渠道贡献了这么多高质量访问"的人,才有资格谈投入。 反过来想,这也是个机会窗口。正因为大多数人还在用传统归因那张旧地图,看不见AI这块新大陆,谁先建立起对AI流量的感知、谁先把AI可见性当成正经渠道来经营,谁就能在竞争对手反应过来之前抢占先机。AI可见性现在的处境,有点像十几年前的移动端流量——早期数据糊、归因乱、很多人觉得不值得投,但回头看,那批顶着数据不清晰也坚持卡位的人,吃到了最大的红利。多触点归因模型本身怎么选才不被最后一次点击骗走预算,我在多触点归因模型选择那篇 (https://zhangwenbao.com/dtc-multi-touch-attribution-model-selection.html)里有详细拆解,配合这块看能帮你少走弯路。 ## 一个出海DTC的真实切片 讲个把这套用起来的例子,细节脱敏。一家做出海家居用品的DTC品牌,2025年底发现一件怪事:自然搜索流量和直接流量都在涨,可他们既没大改SEO,也没投品牌广告,涨得莫名其妙,团队一度以为是数据出了错。 我们没急着归因到SEO,而是按上面的办法做了一轮排查。先查referrer里的AI域名,发现来自几个主流AI助手的可见访问确实在稳步增长;再看落地页,那些"说不清来由"的增量,高度集中在几个具体的产品对比页和解决方案页,而非首页,且这些访客的平均浏览页数明显高于站点均值——特征和AI推荐流量的画像严丝合缝。最后他们在结账页加了一句"您从哪里了解到我们",三个月攒下来,勾选"AI助手/ChatGPT推荐"的比例稳定在一个不低的水平,把前面的推断坐实了。 认清这是AI在带客之后,他们做了两件事:一是把那几个被AI偏爱的对比页和解决方案页当重点资产来养,补全产品规格、加上可核查的实证,让AI更愿意、也更准确地引用;二是在内部报表里单独切出一块"AI影响流量"的估算口径,不再把这部分功劳稀里糊涂地算给SEO。 这里有个细节值得说:他们一开始差点把这波增长当成"SEO自然见效",准备给SEO渠道追加预算、继续堆传统的关键词内容。要真这么干了,就是典型的"钱花错地方"——把AI的功劳记到SEO头上,然后用错误的归因去指导下一步投入,越走越偏。幸好排查及时,他们把追加的资源转向了更对路的方向:优化那些AI爱引用的内页、补强信息一致性。半年后回看,他们对自己流量结构的判断清晰了一大截,预算也开始有意识地向AI可见性倾斜,而且因为投得准,这部分投入的回报相当可观。整件事没有什么高深技术,核心就一句话:先承认这块流量存在,再想办法把它看见。看见了,才谈得上经营;看不见,就只能继续被数据牵着鼻子走。 ## 常见问题解答 ## 这个2.5倍是国外的数据,对我做中文站、做国内市场有参考意义吗? 规律有参考意义,具体数字别照搬。这份研究测的是美国市场、英文AI助手、桌面端,所以2.5倍、12个页面这些精确数字,不能直接套到中文站或国内场景上——用户习惯、AI生态、主流助手都不一样。但它揭示的底层规律是通用的:AI推荐能带来真实且高质量的访问,而这部分访问在标准分析工具里会被错误归因、难以追踪。这两点不分国界。对你的实操指导是:别纠结于"我这儿是不是也刚好2.5倍",而要去做那件更重要的事——在你自己的后台里,按本文的办法把AI推荐流量识别出来、估出你自己的数字。别人的数字是用来提醒你"该去看了",你自己的数字才是用来做决策的。 ## 既然AI流量大半被算进了自然搜索,那我是不是其实不用单独管它? 恰恰相反,正因为它藏在搜索里,你才更得单独管,否则会连环做错好几个判断。第一,如果你不知道搜索流量里掺了AI的功劳,你会高估自己的SEO效果,可能在SEO上投入产出的判断全是偏的。第二,AI推荐和传统搜索的优化逻辑不完全一样——传统SEO优化的是排名和点击,AI可见性优化的是"被AI理解和引用",两者抓手不同。把它们混为一谈,你就会用错方法。第三,AI流量的增长趋势和搜索流量未必同步,把它埋在搜索里你就看不到这条独立曲线的变化。所以"算进了搜索"不是"不用管"的理由,而是"必须拆出来单独看"的理由。混着看,你对两个渠道的判断都会失真。 ## 我没有技术团队,服务器日志、Measurement Protocol这些搞不定,还有别的办法吗? 完全有,而且最有效的两招恰恰不需要技术。第一招是直接问客户:在你的询盘表单、下单流程、甚至客服对话里,加一个"您是怎么找到我们的"的问题,把"AI助手推荐"设成选项。这是零技术门槛、却能拿到一手真实数据的办法,攒一两个月就有参考价值。第二招是看落地页和品牌词:在你现有的分析后台里(不用写代码),观察那些深层内页的流量是否异常上涨、品牌词搜索是否说不清地抬升,这些都是AI推荐的间接信号,靠现成报表就能看。服务器日志和服务端追踪是锦上添花的进阶玩法,没有技术团队不做也无妨。先用问客户加看落地页这两招,你已经能从"完全看不见"到"心里有数"了,这就够指导决策了。 ## 怎么才能让AI更可能推荐我,而不只是被动地测量它带来多少流量? 测量是第一步,优化是第二步,方向上要做的事和"被AI准确理解"高度重合。简单说几条:把你最希望被推荐的场景对应的内容做扎实——产品规格、适用场景、对比信息、可核查的实证,让AI有据可引;保证全网关于你的信息一致、不打架,矛盾信号会让AI不敢推你;争取真实的第三方提及和讨论,AI很看重独立信源;用结构化数据帮机器准确提取你的关键信息。这套打法本质上就是GEO(生成式引擎优化),它和传统SEO有重叠但侧重不同,核心是从"取悦排名算法"转向"方便AI理解和信任你"。值得注意的是,前面那份数据里,AI推荐带来的访客质量本来就高,所以优化AI可见性的回报,是流量和质量双高,性价比很可观。 ## AI推荐的访客质量这么高,是不是意味着我该把预算从传统渠道大幅搬过来? 别急着大搬家,先小步加注、用数据说话。AI推荐渠道质量高是事实,但它现在还有两个特点:一是绝对规模通常还不如成熟的搜索、社交渠道,二是归因不清晰、可控性不如投放。所以理性的做法不是把预算从传统渠道一把梭过来,而是先按本文的办法把你自己的AI流量规模和质量摸清楚,建立起估算口径,再根据这个真实数据决定加多少。一个稳妥的节奏是:先用很小的成本把AI可见性这块业务建起来(内容优化为主,本来花不了几个钱),同时把测量做扎实,等你能看清它的真实贡献了,再谈预算倾斜的幅度。记住前面的教训——别用看不清的数据做大决策。先看见,再下注,下注的幅度跟着你看清的程度走,这才稳。 ## 这股AI推荐流量会不会只是一阵风,过段时间就没了,值得我现在投入吗? 从趋势看,它更像是结构性的新渠道,不是一阵风,现在卡位正当时。判断依据有几个:用AI做信息查询和决策辅助的用户基数在持续扩大,且越来越多人习惯让AI帮忙做选型推荐,这是个还在上行的长期习惯迁移;前面那份数据也证明了这个渠道不只是有量,还有高质量转化潜力,不是虚火。当然,具体哪个AI助手更主流、推荐机制怎么演变,这些会变,但"用户通过AI获取推荐"这个大方向短期内不会逆转。对你的启示是:现在投入的最大价值,不在于立刻吃到多少流量,而在于趁着大多数人还看不清、还没认真做的窗口期,提前建立起AI可见性的优化能力和测量体系。等这条渠道彻底主流化、人人都来抢的时候,早入场的人已经有了先发优势。早做不亏,因为优化AI可见性的很多动作(内容质量、信息一致性)本来就对传统SEO也有好处,不存在白投。 ## 权威参考资料 - Similarweb:生成式AI可见度统计与AI推荐流量研究 (https://www.similarweb.com/blog/marketing/geo/gen-ai-stats/)——生成式 AI 可见度与推荐流量的规模统计。 - Google Analytics:GA4默认渠道分组规则 (https://support.google.com/analytics/answer/9756891)——GA4 默认渠道分组规则,理解归因错位的依据。 - W3C:引荐来源策略规范(Referrer Policy) (https://www.w3.org/TR/referrer-policy/)——引荐来源策略规范,解释流量为何会丢失 referrer。 - 维基百科:暗社交流量(Dark social) (https://en.wikipedia.org/wiki/Dark_social)——暗社交流量的概念,与 AI 推荐归因盲区同源的现象。 - Google:GA4 Measurement Protocol(服务端数据采集) (https://developers.google.com/analytics/devguides/collection/protocol/ga4)——GA4 Measurement Protocol,服务端补全归因的官方接口。 - OpenAI:ChatGPT产品页 (https://openai.com/chatgpt/)——ChatGPT 产品页,这股流量来源的主体本身。 ## AI经常编造不存在的链接:幻觉引用怎么查、怎么把404变成机会 - URL:https://zhangwenbao.com/ai-hallucinated-links-fake-citations-seo.html - 分类:AI监控与数据 - 发布:2026-06-18 | 更新:2026-06-18 - 摘要:为什么ChatGPT给出的链接坏链率是Google AI概览的两倍多?本文拆解幻觉链接的三种形态与背后的下一个词预测机制,给出监测404、用301收编、强化实体grounding的完整SEO应对,并附出海独立站多语言避坑与监测节奏表。 - 关键词:重定向,GEO,AI搜索可见度 > **TLDR**:摘要:AI搜索现在会大大方方给你一条编造出来的链接——点进去要么404,要么把别人的内容挂在你名下。这不是偶发抽风,而是大模型按“最像的下一个词”生成时的结构性副产品。哥伦比亚新闻学院的横评显示,八家AI搜索引擎超过六成的回答引用有误;SE Ranking抓了十万条ChatGPT提问,发现被引URL里1.34%直接是坏链,其中九成是404,坏链率是Google AI概览的两倍多。对做SEO和GEO的人来说,这既是麻烦也是机会:麻烦在于真实意向流量撞上404白白流失、品牌被张冠李戴;机会在于那些被反复编造的URL,其实在替你标注内容缺口。这篇把幻觉链接的三种形态、为什么会发生、怎么在日志里揪出来,再到用301把幻觉URL收编成真实入口的完整打法,一次讲透。 > 摘要:AI搜索现在会大大方方给你一条编造出来的链接——点进去要么404,要么把别人的内容挂在你名下。这不是偶发抽风,而是大模型按“最像的下一个词”生成时的结构性副产品。哥伦比亚新闻学院的横评显示,八家AI搜索引擎超过六成的回答引用有误;SE Ranking抓了十万条ChatGPT提问,发现被引URL里1.34%直接是坏链,其中九成是404,坏链率是Google AI概览的两倍多。对做SEO和GEO的人来说,这既是麻烦也是机会:麻烦在于真实意向流量撞上404白白流失、品牌被张冠李戴;机会在于那些被反复编造的URL,其实在替你标注内容缺口。这篇把幻觉链接的三种形态、为什么会发生、怎么在日志里揪出来,再到用301把幻觉URL收编成真实入口的完整打法,一次讲透。 先说个保哥这两年越来越常遇到的场景:客户拿着ChatGPT的回答截图来问,“你看AI都推荐我们了,还给了链接”,结果那条链接点进去是一个干干净净的404页面——域名是他家的,路径却是他家从来没建过的。AI不是引用了他,而是凭空替他造了一个页面地址。这类现象有个不太严谨但很传神的叫法:幻觉链接(hallucinated link)。它正在从技术圈的谈资,变成实实在在影响流量和品牌的SEO问题。 ## 先搞清楚:AI幻觉链接到底指什么 幻觉链接不是一个精确的技术术语,而是对一类现象的统称。按维基百科对AI幻觉的定义词条 (https://en.wikipedia.org/wiki/Hallucination_(artificial_intelligence))的说法,AI幻觉指模型生成了看起来合理、实则错误或凭空捏造的内容,而链接、引用、出处是重灾区。落到SEO语境,它至少有三副面孔,很多人把它们混为一谈: - 编造URL:模型给出一条格式完全正确、域名也是真的、但目标页根本不存在的地址,点进去就是404或410。这是最典型的“幻觉链接”。 - 错误归属:链接本身能打开,但AI把内容的出处认错了——把竞品的观点安在你头上,或者把你写的东西说成是别人家的。地址是真的,归属是假的。 - 虚构出处:AI在正文里煞有介事地说“根据某某机构某年的报告”,那份报告、那个数据、那位专家可能压根不存在。法律圈那起著名的Mata诉Avianca案,律师引用了ChatGPT编造的判例,就是这一类。 这三种形态的危害和应对完全不同,后面会分开讲。但它们共享同一个病根:模型在“猜”,而且猜得特别像真的。 ## 实测数据:AI给的链接有多少是坏的 光说现象没有说服力,来看数字。SE Ranking对十万条ChatGPT提问做的抓取分析 (https://seranking.com/blog/broken-links-in-chatgpt/)是目前样本最大的一份:他们从10万个提问里提取出约14.5万条被ChatGPT引用的URL,逐一去查HTTP状态码,结果是—— - 1.34%的URL返回4xx客户端错误,其中91%是404 Not Found(1770条),另有8.33%是410 Gone,剩下极少数是451法律原因下架; - 单看404,ChatGPT的比例是1.22%,而Google AI概览只有0.56%,AI模式0.87%,普通自然搜索结果0.65%。换句话说,ChatGPT给你坏链的概率,是Google AI概览的两倍多。 1.34%听起来不高,但换算成绝对量就吓人了:如果一个品类每天有上万次AI提问触及你的行业,几百次落到404上,日积月累就是一笔不小的意向流量在门口被拒之门外。而且这只是“技术性坏链”,还没算上那些能打开、但归属错了的情况。 ## 更狠的一组:引用准确率低于四成 如果说SE Ranking量的是“链接通不通”,那哥伦比亚新闻学院Tow Center的八引擎引用测试 (https://www.cjr.org/tow_center/we-compared-eight-ai-search-engines-theyre-all-bad-at-citing-news.php)量的就是“引用对不对”,结论更让人坐不住。他们拿20家出版商的真实文章,每家挑10篇,让8个聊天机器人识别出处,一共1600次测试: - 整体超过六成的回答引用有误; - Grok 3是灾难现场——200次里有154次把用户导向了错误或404页面,失败率77%; - ChatGPT有134次(约67%)给出了错误答案;Gemini在能抓到10家出版商内容的情况下,只有1次完全答对; - 最反直觉的是,付费版反而更糟:Perplexity Pro和Grok 3这类付费模型“给出斩钉截铁但错误的答案,而不是老老实实说不知道”,错误率比免费版还高。 这份研究里有个细节值得SEO记住:Grok 2经常直接链到网站首页而不是具体文章。这说明AI在“找不到精确出处”时,会退而求其次编一个看似合理的地址,而首页、常见路径正是它最容易编对格式、编错内容的地方。 ## 先盯哪个引擎:四家AI谁的幻觉最离谱 幻觉链接的严重程度,不同AI差得很远。监测资源有限时得分清主次,把前面两份研究的分引擎数据摆到一起,画像就清楚了: - Grok系最离谱。Grok 3在Tow Center测试里200次有154次导向错误或404页面,失败率77%,是重灾区里的重灾区。你的用户要是在用Grok,几乎得逐条核对。 - ChatGPT量大、错得也不少。约67%的引用出错,加上它用户基数最大,绝对影响面最广,是多数出海站要优先盯的对象。 - Perplexity相对好一些。错误率约37%,是几家里表现较好的,但它偏爱机构和学术来源,中小站想被它引对,门槛反而更高。 - Gemini反差最大。在能抓到出版商内容的前提下几乎全错,只有1次完全答对,说明能抓到和引得对,完全是两码事。 一个反直觉的点前面提过、这里再钉一遍:付费版不一定更准。付费模型更倾向给斩钉截铁的答案,而不是老实说不知道,错起来反而更理直气壮。所以别因为自己用的是Pro版就放松核对——花了钱的幻觉,还是幻觉。 ## 为什么大模型会一本正经地编链接 要治病得先懂病理。大模型编链接不是bug,是它工作方式的直接结果。一篇拆解大模型为什么产生幻觉的论文 (https://arxiv.org/abs/2504.12691)把机制讲得很清楚,用大白话转译一下: - 它的目标是“像”,不是“真”。大模型的训练本质是预测下一个词——给一段文字,猜接下来最可能出现什么。训练信号是流畅度,数据里并没有标签告诉它哪句是真、哪句是假。所以它天生就是个“很会顺着说”的机器。 - URL格式太有规律,最好编。域名加斜杠加英文单词加连字符,这种结构在训练数据里出现过千万遍。当被问到训练里没见过、或者把几个概念拼在一起的新问题时,模型会照着这个格式“外推”出一个语法上无懈可击、实则从未存在的地址。 - 错误会自我强化。自回归生成里,一旦早期吐出一个错误的域名或路径,它就成了后文的上下文,模型为了“自圆其说”会顺着这个错继续编下去。一个幻觉的开头,往往拖出一整段幻觉。 理解这一层很重要:它意味着幻觉链接不会因为模型变大就彻底消失,只会被压低概率。指望等下一代模型自动修好,是靠不住的。你能做的是让自己这一侧的“地基”更硬,让AI更容易抓到真实的你。 ## 这件事怎么就成了SEO和GEO的问题 可能有人觉得,AI乱编链接是AI厂商的锅,跟我一个做站的有什么关系?关系大了。Nieman Lab对这项研究的综述 (https://www.niemanlab.org/2025/03/ai-search-engines-fail-to-produce-accurate-citations-in-over-60-of-tests-according-to-new-tow-center-study/)点得很直白:引用错误已经是全行业的慢性病,不是某一家的偶发故障。既然是慢性病,你就得把它当成日常运营的一部分来管,具体到四笔账: - 真实意向流量在门口流失。会用AI搜索、还愿意点链接的用户,往往是意向最强的那批人。他们冲着你来,却撞上404,这一单基本就黄了,而且体验极差。 - 品牌被张冠李戴。AI把你的原创观点说成是竞品的,或者把一段你根本没说过的话安在你品牌头上——前者是白干,后者可能是背锅。 - 竞品截胡。当AI找不到你的准确页面,可能顺手把流量导给了排得更靠前、实体更清晰的竞品。 - AI概览时代被放大。零点击的AI概览把答案直接铺在搜索结果顶部,一旦它引错、链错,错误的曝光量是过去的量级。关于AI搜索带来生意但后台一片空白的零点击时代归因怎么补 (https://zhangwenbao.com/ai-search-attribution-zero-click-proxy-signals.html),站内之前专门拆过,幻觉404正是那套归因盲区里最容易被忽略的一块。 ## 算笔账:1%的坏链到底漏掉多少人 很多人对1.34%这个数字无感,觉得小到可以忽略。用一个简化的算例把它掰开——数字是假设的,但量级贴近真实出海站: 假设你的品类在AI搜索里每天被提及并附上你站链接1万次,按ChatGPT约1.2%的404率算,就是每天120次点击撞墙。一个月3600次,一年约4.3万次。这4.3万次不是随便逛逛的流量,而是已经被AI筛过、带着明确意向、主动点链接来找你的人,转化价值远高于泛泛的自然流量。哪怕其中只有2%本可以成单、客单价1000元,一年就是86万的生意在一个404页面上无声蒸发。 这还只算了编造URL这一种。把错误归属造成的品牌损耗、被竞品截胡的部分叠上去,账面只会更难看。所以别拿百分比麻痹自己,换算成活生生的人数和金额,你就知道这件事值不值得每周花半小时去治了。 ## 动手前先分清:是幻觉,还是你自己删的页 治理幻觉链接有个前置动作千万别跳过——确认这条404到底是AI编的,还是你自己造成的。两者混在同一张清单里,处理逻辑完全相反。 判断方法是查这个URL的前世:翻CMS的历史记录、数据库的文章表、或者旧的sitemap存档,看这个路径曾经有没有真实存在过。查得到,说明是你删了页或改了结构没做重定向,属于常规死链治理,该301的301、该恢复的恢复;如果整个站史上从没有过这个路径,那基本就是AI凭空编的幻觉链接,按后面的判断表决定收编还是放任。 这一步之所以关键,是因为它决定了你要处理的是自己的技术债,还是顺着AI的水推舟。分不清就动手,容易把本该恢复的重要页草率重定向掉,或者反过来花力气去修复一个根本不该存在的地址。先分清,再动手。 ## 第一步:在日志和GSC里把幻觉URL揪出来 治理从看见开始。幻觉URL不会自己报到你后台,得主动去捞。三个抓手: - 翻服务器日志。找状态码404、且来源(referrer)或User-Agent带有AI平台特征的请求——比如referrer是chatgpt.com、perplexity.ai,或UA里出现相关标识。把这些404的路径单拉一张表,就是你的“幻觉URL清单”。 - 盯GSC覆盖率报告。Google Search Console的“页面”报告里,“未找到(404)”分组会积累外部指向你站的死链,其中一部分就是AI和抄了AI答案的页面制造的。按出现频次排序,高频的优先处理。 - 手动抽查。拿你品类里最核心的十几个问题,去ChatGPT、Perplexity、Google AI模式里各问一遍,看它给你家的链接对不对。这一步最笨也最真实,能发现日志里还没积累出量的新幻觉。 把清单建起来后,你会发现幻觉URL不是随机乱撒的,它们有明显的模式——某个不存在的分类目录、某种它“觉得你应该有”的页型。这恰恰是下一步的抓手。 ## 第二步:把高频幻觉URL用301变成真实入口 这是整套打法里最实用的一招。既然AI反复把用户导到某个不存在的地址,而这个地址又符合合理的命名逻辑,那你与其让它404,不如把它301重定向到最相关的真实页面,等于白捡一批意向流量。Google官方的重定向与搜索指南 (https://developers.google.com/search/docs/crawling-indexing/301-redirects)把301(永久重定向)和302(临时)的语义讲得很清楚:用301告诉搜索引擎“这个地址永久搬到那边了”,权重和用户都会顺着过去。 操作上分两种情况:如果幻觉URL指向的内容你本来就有,只是路径不对,直接301到对应真实页;如果它指向的是一个你还没做、但用户和AI都期待你有的主题,那更好——这说明有真实需求,你可以先301到最接近的页兜底,再排期把这个页真正建出来。这一步和让AI主动引用你的逻辑一脉相承,站内在被检索和被引用的两套打法 (https://zhangwenbao.com/ai-citation-retrieval-content-strategy.html)里讲过,被引用的前提是内容真实、可达、可读,301收编幻觉URL就是把“可达”这一环补齐。 ## 该建真页还是301?一张判断表 不是所有幻觉URL都值得处理,也不是都用同一招。保哥用这张表来决定: 幻觉URL的情况 | 出现频次 | 推荐动作 | 指向已有内容,只是路径写错 | 不限 | 301到对应真实页,立刻做 | 指向合理主题,你还没这个页 | 高频 | 先301兜底到最近页,再排期建真页 | 指向合理主题,你还没这个页 | 低频 | 301兜底即可,暂不单独建页 | 路径怪异、无合理语义、一次性 | 极低频 | 不管它,返回标准404即可 | 指向已下架且不该复活的内容 | 不限 | 保持410 Gone,明确告诉爬虫“没了” | 核心原则就一句:有真实意向的幻觉URL才值得收编,纯噪声不必理会。别看到404就全站狂做重定向,把站搞成一团重定向意面,那是另一种病。 ## 301收编的实操:从一堆404到几条规则 清单拉出来往往是几十上百条杂乱路径,一条条手动重定向不现实。实操上按这个顺序收敛: - 按模式归组。把幻觉URL按路径特征聚类——大量落在某个不存在的目录前缀下(比如/guides/、/compare/),还是集中在某几个具体slug上。归完组你常会发现,几十条路径能被三五条规则覆盖。 - 给每组选目标页。目录型的,重定向到对应真实栏目或最相关的枢纽页;具体slug型的,逐一映射到语义最近的现有页。目标页要真的相关,别为了消灭404把用户一股脑扔到首页,那等于二次伤害。 - 用服务器级301落地。在Nginx、Apache或CDN边缘配规则,能用前缀匹配就别写死每一条。规则上线后,拿几条代表性幻觉URL实际点一遍,确认跳转到位、返回的是301而不是302。 - 回填监测。上线后继续盯这些路径的访问,看跳转后用户是留下了还是立刻跳出——跳出率高,说明目标页选得不够相关,得再调。 整套做下来,那批本来白白404的流量就被顺进了真实页面,断掉的转化链路重新接上。这活儿不复杂,难在坚持每周捞一次、稳定地做下去。 ## 第三步:让AI从一开始就把你认对 前两步是被动补救,这一步才是釜底抽薪——减少幻觉的发生概率。核心是让AI在生成答案时,能更容易地“接地”(grounding)到关于你的真实信息,而不是靠猜。几个动作: - 把实体讲清楚。用结构化数据、清晰的About页、一致的品牌名和描述,让机器明确知道“你是谁、做什么、官方地址是哪个”。Google那份讲怎么教AI认识你的实体专利解读 (https://zhangwenbao.com/google-entity-patent-teach-ai-who-you-are.html),本质就是在降低AI把你认错、编错的概率。 - URL和canonical保持稳定一致。一个页面只留一个规范地址,别让同一内容散落在带参数、带斜杠、带大小写差异的多个URL上,减少AI“选错门”的机会。 - 去真实的高权威平台留足迹。AI更倾向引用它信得过的来源,站内拆过哪些网站最常被AI引用 (https://zhangwenbao.com/most-cited-domains-ai-search-citation-sources.html),Reddit、Wikipedia、YouTube这类高被引平台上你的真实内容越多,AI越不需要靠编来回答关于你的问题。 说白了,幻觉链接是AI在信息不足时的“填空”。你把关于自己的真实信息铺得足够密、足够清晰,它就没那么多空要填。 ## 换个角度:幻觉URL其实在替你标注内容缺口 前面都在讲怎么防、怎么补,但幻觉链接还有个反直觉的用法——它是免费的市场调研。想想看:AI为什么会编出某个特定路径的URL?因为在它的统计里,“像你这样的站,就应该有这么一个页”。这背后是大量用户提问和内容模式的沉淀。 所以那张幻觉URL清单,换个眼光看就是一份需求线索表:AI替一堆用户喊出了“你应该有但没有”的内容。某个反复被编造的“对比页”“价格页”“某功能教程页”,恰恰是你内容矩阵里的洞。把高频幻觉URL的slug拆开读,你能读出用户和AI共同期待你覆盖的话题。这时候“建真页”就不只是补404,而是顺着真实需求扩内容资产——一箭双雕。有点像AI不小心把你竞争对手的作业本翻开给你看了。 举个具体的:如果日志里反复冒出/best-你的品类-for-beginners这类被编出来的路径,别只当它是噪声——它在提示你,大量新手用户正指望有一个面向入门者的选购或对比页,而你恰好还没做。顺着这条线索把页真正建出来,既接住了原本撞墙的流量,又填了一个有真实搜索需求的内容洞。AI的幻觉在这里反倒成了免费的选题雷达,前提是你愿意蹲下来读它。 ## 错误归属怎么办:主动纠偏 编造URL好治,301一下就行;难的是错误归属——链接是真的,但AI把出处认错了。这类问题没法靠重定向解决,得从信号源头纠偏: - 监测品牌被怎么引用。定期在各AI平台抽查关于你品牌、你核心观点的问题,看它归属对不对。发现系统性错误,记录下来。 - 强化正确的实体信号。如果AI总把你的原创数据说成别人的,往往是因为别人转载时链接、署名更规范。回到自己站把原创声明、作者信息、发布时间、结构化数据补齐,让“你是原始出处”这件事机器可读。 - 用一手证据占住话语权。原创数据、独家案例、第三方可验证的提及,是最难被张冠李戴的资产。当全网只有你有这份数据,AI想引错都难。 - 向平台反馈。多数AI产品都有反馈入口,遇到明显的错误归属,实事求是地报一条。单条未必立刻改,但这是官方修正的一环。 这类错误有多普遍?Tow Center那份研究里有个扎心的细节:ChatGPT甚至把链接编错到了OpenAI自己的新闻合作伙伴文章上——连“自己人”都认不准。所以别指望AI会自动帮你把出处摆对,主动把正确信号铺满,才是唯一靠得住的办法。 ## 出海独立站还要多担一层坑 做出海的朋友注意,幻觉链接在多语言、多市场场景下会更严重。原因不难理解:AI对非英语市场、小众品类的训练数据更稀疏,“填空”的动作就更多。多语言站常见的带地区路径、带语言子目录的URL结构,本身命名空间就大,AI编错的排列组合也更多。 保哥手头一个做户外储能的出海独立站客户就踩过:AI在回答某个欧洲小语种市场的产品问题时,反复编造一个不存在的德语分类路径,把询盘意向最强的用户导到404。后来的处理很直接——把那条高频幻觉路径301到最相关的产品集合页,当月就从这条“凭空冒出来”的路径捞回了一批自然会话,随后再补上真正的本地化落地页。这类活儿的抓手,和技术端怎么让AI爬虫抓得到、读得懂是同一套逻辑,只是多盯了一层多语言的命名混乱。 ## 监测节奏:多久查一次、查什么 幻觉链接治理不是一锤子买卖,得有节奏地循环。保哥给客户定的基线是这样: 动作 | 频次 | 看什么 | 翻AI来源的404日志 | 每周 | referrer/UA带AI特征的404路径,按频次排序 | GSC覆盖率“未找到”复查 | 每月 | 新增高频死链,判断建页还是301 | 核心问题人工抽查 | 每月 | 十几个品类核心问题在各引擎的链接与归属对不对 | 品牌归属专项体检 | 每季度 | 原创观点、独家数据有没有被认错出处 | 大促/大更新后专项 | 触发式 | URL结构变动后,AI是否还在链旧的、编新的 | 不用一上来就全套铺开,先把每周翻404这一件事做起来,建立基线,其余按站的体量逐步加。 ## 几个常见误解 - “链接404是我站的锅”——不一定。要先分清是你真删了页,还是AI凭空编的。前者是自己的技术债,后者是AI的幻觉,处理方式不同。 - “AI乱编,我干预不了”——能。你干预不了模型怎么生成,但你能决定那条被编出来的URL是返回404还是301到真实页,能决定关于你的真实信息铺得多密。主动权比你以为的大。 - “这只影响流量,不影响品牌”——错。错误归属直接动的是品牌资产和信任,用户看到AI把你的话说成别人的,或把别人的锅甩给你,伤的是长期认知。 - “等模型升级就好了”——别等。幻觉是大模型的结构性特征,只会被压低不会归零。把它当成会长期存在的运营变量来管,才是稳的。 - “用301收编是钻空子,会挨罚”——不会。把不存在的URL重定向到真实相关页,是标准的死链治理动作,Google的重定向指南本来就鼓励用301处理地址变更。你没有操纵排名,只是把撞墙的用户接住,合规又正当。 说到底,幻觉链接是AI搜索时代绕不开的新常态。你左右不了模型怎么生成,但完全可以决定:撞到你门上的那条幻觉URL,是让它404、还是接住它变成一单生意。把监测和301收编做成每周的例行公事,这道原本失分的题,反而能被你答成加分项——比对手早一步蹲下来读日志,就是AI搜索时代不起眼却实在的护城河。 ## 常见问题解答 ## AI给的链接点进去404,是我网站的问题吗? 先别急着认领。要分两种情况:一种是你确实建过这个页、后来删了或改了路径没做重定向,这是你的技术债;另一种是这个路径你压根没建过,是AI按合理格式凭空编的,这是幻觉链接。判断很简单——去你的CMS或数据库里查这个URL历史上有没有存在过。是自己的债就补重定向、清死链;是AI编的,就按频次决定要不要用301把它收编成真实入口。 ## 怎么发现AI在编造指向我网站的链接? 三条路组合用。一是翻服务器日志,筛出状态码404、且来源或User-Agent带ChatGPT、Perplexity等AI平台特征的请求,把路径拉成清单;二是看Google Search Console的页面报告里“未找到(404)”分组,按频次排序找高频死链;三是拿品类核心问题去各AI引擎手动抽查,看它给你家的链接对不对。日志和GSC适合发现已成规模的幻觉,人工抽查适合逮住刚冒头的新幻觉。 ## 幻觉URL到底该建成真页,还是301重定向? 看两件事:这个URL指向的主题你有没有,以及它被编的频次高不高。指向已有内容只是路径错了,直接301到真实页;指向合理主题但你没这个页且高频,先301兜底再排期建真页;同样情况但低频,301兜底即可不必单独建;路径怪异、无合理语义、只出现一两次的,返回标准404就行,不用管。核心是有真实意向的才值得收编,纯噪声不必理会。 ## AI把我的内容说成是别人的,怎么纠正? 错误归属没法靠重定向解决,得从信号源头补。第一,把自己是原始出处这件事做得机器可读——原创声明、作者信息、发布时间、结构化数据补齐;第二,用原创数据、独家案例这类难以被张冠李戴的一手资产占住话语权,全网只有你有的数据,AI想引错都难;第三,定期监测品牌被怎么引用,发现系统性错误就向平台反馈。这是个慢功夫,靠的是长期把正确信号铺密。 ## 为什么大模型会编出格式完全正确、却不存在的链接? 因为大模型的本质是预测下一个最可能的词,追求的是“像”不是“真”。URL的格式(域名加路径加连字符英文)在训练数据里出现过无数遍,规律性极强,所以当模型遇到训练里没覆盖、或概念组合很新的问题时,会照着这个格式外推出一个语法完美、实则从未存在的地址。再加上自回归生成会让早期的一个错误token顺着上下文自我强化,一个幻觉开头常常拖出一整段。这是它工作方式的结构性结果,不是偶发故障。 ## 幻觉链接这事会随着模型升级自己消失吗? 不会消失,只会被压低概率。幻觉是大模型按概率生成的结构性特征,模型越大、检索增强越强,出错率能降,但只要它还是在“猜下一个词”,就不可能归零。所以正确的心态是把幻觉链接当成一个会长期存在的运营变量:与其等模型自己修好,不如把自己这侧的地基做硬——实体清晰、URL稳定、真实信息铺密,同时把监测404和301收编做成日常动作。 ## 权威参考资料 - AI Search Has a Citation Problem(哥伦比亚新闻学院Tow Center) (https://www.cjr.org/tow_center/we-compared-eight-ai-search-engines-theyre-all-bad-at-citing-news.php) —— 用200个问题横评八家AI搜索引擎,实测超六成回答的引用有误,Grok 3有154次把用户导向404,付费版反而错得更自信。 - ChatGPT Is 2x More Likely to Cite 404s than AI Overviews(SE Ranking) (https://seranking.com/blog/broken-links-in-chatgpt/) —— 抓取十万条ChatGPT提问共约14.5万条URL,统计出1.34%为坏链、其中91%是404,并与Google AI概览、AI模式、自然结果逐一对比。 - AI search engines fail to produce accurate citations in over 60% of tests(Nieman Lab) (https://www.niemanlab.org/2025/03/ai-search-engines-fail-to-produce-accurate-citations-in-over-60-of-tests-according-to-new-tow-center-study/) —— 尼曼新闻实验室对Tow Center研究的综述,点明引用错误是全行业慢性病而非某家偶发。 - Redirects and Google Search(Google Search Central) (https://developers.google.com/search/docs/crawling-indexing/301-redirects) —— Google官方讲各类重定向的实现与301/302语义,是把高频幻觉URL用301收编到真实页的官方依据。 - Why and How LLMs Hallucinate: Connecting the Dots with Subsequence Associations(arXiv) (https://arxiv.org/abs/2504.12691) —— 从子序列关联角度解释大模型为什么会一本正经地编内容,含URL这类高规律格式为何尤其容易被编造。 - Hallucination (artificial intelligence)(Wikipedia) (https://en.wikipedia.org/wiki/Hallucination_(artificial_intelligence)) —— AI幻觉的定义词条,收录了编造引用、虚构法律判例(如Mata诉Avianca案)等典型案例。 ## KPI仪表盘全是绿灯生意却没动?AI搜索时代该换掉哪些骗你的老指标 - URL:https://zhangwenbao.com/ai-search-kpi-blind-spot-metric-swap.html - 分类:AI监控与数据 - 发布:2026-06-09 | 更新:2026-06-23 - 摘要:AI搜索时代SEO的KPI盲点诊断与全漏斗换盘指南:识别失效的老指标,按可见、影响、成交三层重排新KPI,把AI信号接回业绩,做出老板看得懂的月度报告。 - 关键词:SEO报告,AI搜索,零点击搜索 > **TLDR**:摘要:AI搜索把“被影响”这件事搬进了对话框,发生在你站点之外、用户点击之前,于是一整套为“点击漏斗”造的KPI仪表盘集体失明——排名、自然session、点击率、最后一次点击,全在亮绿灯,却没有一个能解释生意为什么动、或为什么不动。这篇不讲怎么补归因,而是回答更前置的一问:该把哪些还在骗你的老指标换掉、换成什么。先给一张盲点自查清单(5个失效老KPI各自怎么撒谎),再按“可见—影响—成交”三层重排一套全漏斗KPI盘,最后讲怎么把它卷成一张老板看得懂、又不会被“我们AI搜索排第几”这种伪问题带偏的月度报告,附换盘过渡期怎么管、哪些业务先别急着换。 > 摘要:AI搜索把“被影响”这件事搬进了对话框,发生在你站点之外、用户点击之前,于是一整套为“点击漏斗”造的KPI仪表盘集体失明——排名、自然session、点击率、最后一次点击,全在亮绿灯,却没有一个能解释生意为什么动、或为什么不动。 这篇不讲怎么补归因,而是回答更前置的一问:该把哪些还在骗你的老指标换掉、换成什么。先给一张盲点自查清单(5个失效老KPI各自怎么撒谎),再按“可见—影响—成交”三层重排一套全漏斗KPI盘,最后讲怎么把它卷成一张老板看得懂、又不会被“我们AI搜索排第几”这种伪问题带偏的月度报告,附换盘过渡期怎么管、哪些业务先别急着换。 ## KPI全是绿的,生意却没往前走,问题出在哪? 先描一个这两年越来越常见的场面。月度复盘会上,SEO负责人把仪表盘投到大屏:关键词排名稳中有升,自然流量曲线往上爬,核心页面的停留时间也不差,一片绿。老板看完却问了一句让全场沉默的话——那这个季度多出来的订单,到底是不是你们带来的? 没人答得上来。不是不想答,是手里这套数字根本不指向那个答案。所有指标都在说“我们在做对的事”,可没有一格能接到“所以生意多了这么多”。绿灯越多,这种割裂感越强。 根子不在某个指标算错了,而在整套仪表盘量的东西已经和生意脱钩了。正如行业里关于AI搜索KPI盲点的讨论所点破的,AI搜索、零点击结果、隐私限制这三股力量叠在一起,把传统SEO指标和业务结果之间那根原本还算结实的绳子,一根根剪断了。你仪表盘上的每个数字单看都没毛病,合起来却讲不出一个关于钱的故事。 很多团队的第一反应是去补归因——上更复杂的归因模型、买更贵的工具。这个方向不能说错,但它解决的是“生意来了怎么证明是AI带来的”,是事后的因果追认。本文要往前站一步,问一个更基础的问题:在你忙着证明之前,你仪表盘上那些天天看的KPI,本身是不是已经在量错东西了?指标选错了,再精密的归因也是给错的目标做精装修。 ## 为什么说你的测量盘,是为“点击漏斗”造的? 要理解盲点从哪来,得先承认一件让人不舒服的事:你现在用的几乎每一个SEO指标,背后都假设了同一条路径——用户搜索、看到结果、点击进站、在站内留下行为、最后转化。这条“搜索→点击→落地→转化”的链路是可追踪的,因为每一步都在你能埋点的地方发生。排名衡量第二步,流量衡量第三步,转化率衡量最后一步。整套盘子严丝合缝,前提是用户必须点进来。 AI搜索把这条链路从中间折断了。用户在对话框里问问题,AI直接给答案、给推荐、给对比,影响在这一刻就已经完成。等用户真正走到你站点(或者根本不来),影响早就发生过了。关键的“被影响”那一下,落在你的属地之外。 这意味着什么?意味着AI带来的影响,不会在你的测量栈里留下任何技术痕迹: - 它不触发标签管理器里的任何事件——因为没有页面加载、没有按钮点击给它挂钩。 - 它不在GA4里产生session——一次对话不是一次会话,AI工具的界面不是你的页面。 - 它不在CRM里登记来源——用户进来时,referrer要么是空的,要么被AI工具吞掉,归到“直接访问”那个黑洞里。 所以这不是“数据少了一点”的问题,是结构性的失明。你的仪表盘看不见的,恰恰是AI时代最关键的那段影响。它不是漏了一个指标,是整套指标体系赖以成立的那个前提——“重要的事都发生在我能埋点的地方”——已经不成立了。盲点不是bug,是这套盘子的设计假设过期了。 ## 盲点自查:哪5个还在亮绿灯的老指标其实在骗你? 抽象地说“指标失效”没用,得具体到每一个。下面这5个是大多数SEO仪表盘的常客,也是当下最会撒谎的。挨个对一遍,看你的盘子里还在拿哪几个当真。 ## 关键词排名:你看不到AI否决掉的那些选项 传统排名的前提是结果可枚举——一个词,十条蓝链,你在第几清清楚楚。AI搜索里这个前提塌了。AI从一堆来源里挑、揉、改写出一个答案,没被选中的来源连“第几名”都没有,直接消失。你排名第一,AI答案里可能根本没提你;你压根没进传统前十,却被AI当成推荐之一。“排第几”在这个环境里不是答错了,是这个问题本身不成立。 ## 自然流量session数:被零点击稀释得只剩一半 这不是感觉,是有数据的。皮尤研究中心对美国成年人2025年3月真实浏览行为的实测 (https://www.pewresearch.org/short-reads/2025/07/22/google-users-are-less-likely-to-click-on-links-when-an-ai-summary-appears-in-the-results/)发现,当搜索结果里出现AI摘要时,用户点击某条结果的比例只有8%;没有AI摘要时是15%。换句话说,AI摘要一出现,点击意愿直接腰斩,而且看了摘要的人更可能直接结束这次浏览、连引用来源都很少点。你的session数掉,未必是排名掉了,可能只是越来越多的人在结果页就把事办完了。拿session数当健康度,等于拿一把刻度变了的尺子量身高。 ## 点击率CTR:分母和分子各跑各的 按Google搜索控制台对展示、点击、排名的官方定义 (https://support.google.com/webmasters/answer/7042828),CTR就是点击数除以展示数。这个公式没问题,问题是AI Overview这类模块把大量展示变成了“看到即满足”,分母涨、分子不涨,CTR自然往下掉。可这个下掉不代表你的标题不行、内容不行,它只反映结果页的形态变了。把CTR下滑当成内容质量警报,你会去改一堆根本没坏的东西。 ## 最后一次点击转化:把功劳全记给了最后一个路过的渠道 AI影响的最大特点是不留触点。用户在AI里被种草、做完功课,过几天直接搜你的品牌词进来下单。最后一次点击归因会把这单功劳整个记给“品牌词搜索”或“直接访问”,AI这个真正的源头一分钱信用都拿不到。你看着品牌词在涨、直接流量在涨,却不知道是谁在上游把人推过来的。 ## 跳出率与停留时间:高意图用户的行为已经变了 被AI充分教育过的用户进站时,往往已经知道自己要什么。他们可能直奔某个产品页、看一眼参数就走,行为上“跳出”了,意图上却是这一波里最值钱的。继续拿低跳出、长停留当好信号,你会把最该伺候好的那批人,误判成“质量差的流量”。 这5个指标的共同病灶是同一个:它们都假设影响发生在站内、且留下了行为痕迹。一旦影响搬到了对话框里,它们就从“健康仪表”退化成了“安慰剂”——读数还在,意义没了。 ## KPI换盘到底怎么换?按“可见—影响—成交”三层重排 认清盲点之后,下一步不是删指标,是换一套坐标。与其在“点击漏斗”这个旧框架里修修补补,不如按AI搜索真实的作用方式,把KPI重新分成三层:你有没有被AI 看见、AI有没有真的影响了用户的选择、这份影响最后有没有变成成交。每一层都明确“换掉哪个老指标、换成什么新指标”。 先给一张总览表,后面三节再逐层拆开: 层级 | 要回答的问题 | 该退役的老KPI | 换上的新KPI | 可见层 | AI答案里有没有你? | 关键词排名、展示量 | 被引用率、品牌提及份额、AI出现频率 | 影响层 | AI有没有改变用户的选择? | 点击率、停留时间 | 推荐占比、同框权威配位、对话式查询覆盖 | 成交层 | 这份影响变成钱了吗? | 最后一次点击转化 | 增量收入、品牌词增长、辅助转化方向 | 这张表是整套换盘的骨架。注意它不是简单地“加几个AI指标”,而是每一层都做了一次替换——把那个会撒谎的老KPI请下台,换上一个真能反映AI时代价值的新KPI。下面三节按层展开,可见层和成交层各自已经有专门的方法论文章可以深挖,这里只讲它们在KPI盘里该占什么位置、怎么取数。 ## 可见层:从“排第几”换成“被引用、被提及的份额” 可见层回答最基础的一问:用户问相关问题时,AI的答案里到底有没有你。这一层最该被换掉的是“关键词排名”。替代它的不是某一个数字,而是一组反映“出现密度”的指标。 - 被引用率:在一批你关心的问题里,AI答案显式引用或链接到你的比例。这是AI时代最接近“排名”的硬指标,但它衡量的是“被选中”而非“排第几”。 - 品牌提及份额:AI答案里提到你品牌的次数,占同类品牌被提及总次数的比例。它衡量的是声量在这个品类里的相对位置,哪怕没带链接也算数。 - AI出现频率:把同一批问题定期跑一遍主流AI引擎,统计你出现的频次随时间的走势。重点不是某一次的绝对值,而是方向。 取数的关键,是先把“该追踪哪些问题”定下来——按人群和意图交叉出一批真实问句,而不是凭感觉列关键词。这套从“人群×意图”出发、用漏斗查询树把要测的问题结构化下来的方法,本身就是一门手艺,保哥在衡量AI可见性的漏斗查询树框架 (https://zhangwenbao.com/ai-visibility-funnel-query-tree.html)那篇里完整拆过,包括一棵树该有多少个问题、要建多少棵才够。这里你只要记住一点:可见层的KPI不是“排第几”,是“在你定义的那批问题里,被看见的密度”。 ## 被引用率没有现成工具,怎么自己把数取出来? 可见层的新KPI听上去玄,落地其实不需要等什么贵工具。最该先建起来的“被引用率”,完全可以用一套人工台账先跑起来,糙归糙,方向是准的。流程就四步,谁都能上手。 第一步,定问句池。别凭感觉列关键词,按“人群×意图”交叉出一批用户真会问的自然问句。一个中等规模的独立站,先锁30到50个最关键的问句就够起步——覆盖认知型(“什么是……”)、评估型(“哪款适合……”)、对比型(“X和Y哪个好”)三类意图。这批问句一旦定下来,就是你这套盘的标尺,轻易别改,改了前后就没法比。 第二步,定期跑引擎。把这批问句每个月在主流AI引擎各问一遍。固定时间、固定问法、固定引擎,三个“固定”是关键——只有口径稳,月度之间的对比才有意义。问的时候把AI给的完整答案连同引用来源一起存档,截图或者粘文本都行。 第三步,记三个数。每个问句记三件事:AI答案里有没有显式引用你(被引用)、有没有提到你品牌(被提及)、有没有把你列进推荐(被推荐)。一行一个问句,几列打勾,一张表就成了。 第四步,算份额、看趋势。被引用率=被引用的问句数÷问句总数;品牌提及份额则要把竞品也一起记,算你在这个品类里被提及的占比。单月的绝对值意义不大,把这张表按月叠起来看走势,才是它真正值钱的地方。趋势在涨,说明可见层在变好;趋势在跌,就是该警觉的早期信号——往往比流量曲线提前一两个季度报警。 这套台账的全部成本,就是每月小半天的人工。等量做大了、值得自动化了,再上监测工具去替代手工,逻辑完全一样,只是把人换成了脚本。先有方法,再谈工具,顺序别反。 ## 影响层:怎么知道AI到底有没有改变用户的选择? 被看见只是入场券。影响层要回答更进一步的问题:AI把你摆出来之后,有没有真的影响用户的判断?这一层最容易被忽略,因为它夹在“可见”和“成交”中间,既不像可见层那么直观,又不像成交层那样直接关系到钱。但它恰恰是AI时代价值发生的地方。 三个能落地的影响层KPI: - 推荐占比:在那些用户明显在做选择的问题里(“哪款适合……”“有没有比X更好的”),AI把你作为推荐项之一的比例。被提到和被推荐是两回事,后者才带着倾向性。 - 同框权威配位:当AI引用你时,旁边还一起引了谁。和权威机构同框,跟淹没在一堆论坛闲聊里,含金量天差地别。同一条来源在不同引擎里会被派不同的角色,这件事直接决定了这次曝光值多少钱。 - 对话式查询覆盖:用户用越来越自然的、带场景的长问句提问(“适合通勤又防小雨的”),你的内容能不能接住这类问题。覆盖得越宽,进入AI推荐池的机会越多。 影响层的指标普遍偏“软”,不像点击那样能精确到个位数。但软不等于不能测——你可以定期人工抽样:列5到10个真实的选择型问句,在主流引擎各问一遍,记录你出现在推荐里的次数、身边的同框名单。一个月看一次方向,就够支撑判断了。别追求精确到小数点,那是旧KPI的执念,影响层要的是“趋势对不对”。 再补一句最容易被漏掉的:影响层最值钱的洞察,往往藏在“同框名单”的变化里,而不是你自己那个数字里。这个月AI引用你时身边还并列着几家权威机构,下个月却换成了一堆竞品甚至论坛闲聊,这种降级被引用率根本照不出来——它要你去读AI到底把你和谁摆在了一起。把每月的同框名单当成一份免费的竞争情报来对比,你能比对手更早嗅到风向:谁在往你的位置挤、AI对这个品类的“信任结构”在怎么变。这层观察一旦养成习惯,影响层就从一个抽象指标,变成了一面能照见竞争格局的镜子。 ## 成交层:怎么把AI信号接回收入,又不靠逐单归因? 成交层是老板最关心、也最难测的一层。它要回答的是:上面那些可见和影响,最后变成钱了吗?这里要换掉的是“最后一次点击转化”——前面说过,它会把AI的功劳整个记错地方。 但替代方案不是去发明一种“AI专属的逐单归因”,那条路在零点击时代根本走不通。成熟的做法是退回到一套更老、也更稳的方法论:用营销组合模型看相关、用增量性实验证因果、用代理信号补方向。成交层的新KPI因此长这样: - 增量收入:通过小预算的地理对照实验(一部分地区加大AI内容投入、一部分不动),看有没有跑出可归因于AI的增量,而不是看绝对数字。 - 品牌词增长:AI种草最典型的下游信号就是品牌词搜索上涨。但要小心,品牌搜索量常被高估,得当方向信号用,不能当因果铁证。 - 辅助转化方向:直接流量、辅助转化这些代理信号能提示AI在上游使劲,但它们是“指方向”的,不是“算功劳”的。 这一层的方法论细节——四类代理信号哪些能用哪些会骗你、三层归因表怎么搭、小预算的增量实验怎么设计、怎么跟CFO把这件事讲明白——保哥在零点击时代AI搜索归因怎么补 (https://zhangwenbao.com/ai-search-attribution-zero-click-proxy-signals.html)那篇里专门拆过一整套,这里不重复。在KPI盘的语境下,你只需要记住成交层的定调:放弃逐单的精确,换取整体的可信方向。把“这一单是谁带来的”换成“这个季度AI这条线整体有没有正向贡献”,问题就从无解变成了能答。 ## 怎么把新KPI盘卷成一张老板看得懂的月度报告? 换好了指标,还有一关:怎么把它讲给不看SEO后台的人听。这一步做不好,再科学的KPI盘也会死在汇报环节。下面几条是把新盘子翻译成“决策语言”的实操。 先翻译,再上数。没人在乎“被引用率涨了6个点”,他们在乎的是“我们在AI答案里被推荐的机会比上季度多了,这部分人群的品牌词搜索跟着涨了”。每个新KPI旁边,都得配一句它对应的业务含义。指标是证据,业务结论才是主语。 把“我们AI搜索排第几”这种伪问题挡在门外。这是换盘期最常被追问的一句,而它在技术上根本没有答案。与其每次尴尬地解释“AI里没有排第几这回事”,不如主动用新指标重置对话:把“排第几”翻译成“在我们关心的这批问题里,被AI推荐的份额是多少、趋势怎么走”。你给出的是一个能回答、也更有意义的版本。 砍掉报告里的虚荣指标。换盘是个好机会,顺手把那些只为了好看、对决策毫无帮助的数字一起请走。怎么区分虚荣指标和真信号、怎么定准一个能牵引全局的北极星指标,保哥在砍掉虚荣指标、定准北极星指标 (https://zhangwenbao.com/vanity-metrics-north-star-omtm-ecommerce.html)那篇里给过一套判断法,思路完全可以搬到AI搜索的KPI报告上来。一张月度KPI deck,能让老板三十秒看懂“哪在变好、哪要补、下一步动哪”,比堆二十个指标有用得多。 ## 换盘之前,先想清楚这张报告到底做给谁看? 同一套KPI盘,做给不同的人看,该露出哪一层是不一样的。换盘要是不分受众,一股脑把三层指标全甩出去,结果就是谁都看不懂、谁都觉得跟自己没关系。换盘前先把读者分清楚,比多算几个指标重要得多。 大致分三类人,三种露法: - 给老板和财务看:只露成交层,外加一句方向。他们要的是“AI这条线这季度有没有正向贡献、值不值得继续投”。把可见层、影响层的细节全收进附录,主页面只留增量收入方向、品牌词增长这种直接挂钩生意的结论。多一个他们看不懂的指标,就多一分被质疑的空间。 - 给内容和SEO团队看:三层全露,重点在可见和影响。他们是真正干活、要据此调整动作的人,需要看到被引用率在哪些问句上掉了、被谁截胡了、哪类对话式查询没接住。这一版可以细,因为细节就是他们的工作指令。 - 给投放和增长团队看:重点露影响层和成交层的交叉。他们关心AI这条自然线和付费线是互补还是打架,需要看推荐占比、品牌词增长这些能和投放数据对得上的指标,方便协同分配预算。 分受众这件事的本质,是承认KPI盘不是一张“标准报表”,而是一组“针对不同决策的证据包”。同样一个被引用率,对内容团队是行动指令,对老板可能就是噪声。想清楚每一页是给谁、帮他做什么决策,再决定露哪几层,这张报告才不会沦为“发出去没人看”的摆设。 ## 换盘的过渡期,怎么不让“换个指标”看起来像“变差了”? 这是换盘最被低估的风险,纯属人性问题,但栽在这上面的团队不少。老板和财务习惯了老那套数字,你突然换一批新指标,哪怕业务其实在变好,新指标的初期读数也很可能不如老指标好看——不是真变差,是基线还没建起来、口径还没磨合。这个错觉一旦形成,换盘就容易被当成“绩效下滑”叫停。 稳妥的做法是给过渡期搭三道缓冲: - 双盘并行一段时间。别一上来就把老仪表盘砍掉。新老两套并行跑两到三个月,让大家看着新指标和业务结果一起动起来,信任是看出来的,不是讲出来的。 - 先建基线,再谈高低。新指标头一两个月只采数、不设目标。没有基线就定KPI,等于拿一个还没站稳的数字去考核人,只会逼大家去刷那个数而不是做对的事。 - 把口径写死、留一份说明。每个新KPI怎么算、数据从哪来、多久取一次,落成一份谁都能查的文档。换盘期最怕的是同一个指标这个月这么算、下个月那么算,那比不换还糟。指标口径这件事本身就值得当成一项数据治理来做。 过渡期的目标不是一步到位,是让组织对新坐标产生信任。这个信任建立起来之前,老指标可以退居二线当参照,但别急着完全拔掉——给大家一个熟悉的锚点,换盘的阻力会小很多。 ## 新KPI最容易被做歪的三种姿势是什么? 换上新指标不等于就走对了路。这套盘子有它自己的坑,而且都很隐蔽——因为它们看起来像是“在认真做KPI”。这三种姿势,是实践里最容易把新盘子做废的。 第一种,把被引用率当成可以刷的硬KPI。一旦把某个数字定成考核线,团队的第一反应就是去刷它——批量产出迎合AI的薄内容、堆问句、做表面文章。可被引用率是个结果指标,它该是“内容真的有用”的副产品,不是直接发力的对象。把它当硬考核,最后大概率刷出一堆数字好看、对生意没用的东西,和当年堆关键词没有本质区别。 第二种,只盯绝对值,不看份额。“这个月被提及了40次”这种话毫无意义,除非你知道竞品被提及了多少。AI可见性是个相对游戏,你涨竞品涨得更快,份额其实在掉。只报绝对数不报份额,是新KPI里最常见的自欺——读数在涨,阵地在丢。 第三种,把月度方向硬拗成周度考核。AI引擎的答案本身就有随机性,同一个问句今天问和明天问,结果可能不一样。这套指标的设计前提就是“一个月看一次方向”,你非要拿它做周报、做日报,那点随机波动会被无限放大,团队天天追着噪声跑,既累又没用。它是个望远镜,不是显微镜,别拿来看本不该看那么细的东西。 这三种姿势的共同点,是把一个“看方向的相对指标”,硬当成了“可精确考核的绝对指标”来用。记住新KPI的脾气:它擅长回答“趋势对不对、阵地丢没丢”,不擅长回答“精确到个位数是多少”。顺着它的脾气用,才不会把好工具用废。 ## 哪些业务先别急着换盘? 把话说回来,这套换盘不是对所有人都划算。判断该不该现在动手,看你的业务里AI信号是“主菜”还是“噪声”。下面几种情况,建议先按兵不动,或只做最轻量的版本。 - 纯本地服务、获客主要靠地图和口碑的生意。这类业务的用户决策路径短、地域性强,AI搜索的影响占比小,硬上一套AI的KPI盘,测出来的多半是噪声,投入产出不划算。 - 几乎全靠付费投放驱动的站。如果你的增长盘子里自然和AI这条线占比极低,那把精力放在投放归因上回报更高,AI的KPI可以先放一放。 - 交易量太小、样本不够的早期站。增量实验、品牌词趋势这些方法都依赖一定的数据量,单量太小时,信号被随机波动淹没,测了也得不出可信结论。先把量做起来再说。 还有一种情况要分清:不是“该不该换”,而是“该换多少”。大多数生意不需要一步到位把三层全建齐,更现实的路径是先从盲点最痛的那一层下手——如果你明显感觉到AI在抢可见性,就先把可见层那张被引用率台账建起来,其余两层等这一层跑顺了再说。换盘是个可以分期的工程,没必要在第一个月就背上全套包袱,那反而容易因为太重而半途夭折。 换盘的判断标准说到底只有一个:AI搜索这条线,对你这门生意的影响是不是已经大到“不测就会做错决策”。到了那个临界点,再不换盘,你就是在拿一套过期的仪表,开一辆走在新路上的车——表上每个读数都正常,只是它们量的,全是你已经不再走的那条老路。 ## 这套KPI盘多久看一次、该挂在谁名下? 指标换对了、报告分清受众了,最后还有两个最容易被忽略、却直接决定这套盘能不能长期活下去的问题:多久看一次,以及归谁负责。很多团队的新KPI盘是“立起来三个月没人管”死掉的,不是指标不对,是没人对它负责。 先说节奏。AI可见性这类指标的合理复盘周期是月度,不是周度,也不是季度。周度太密,AI答案的随机波动会把信号淹掉,看了徒增焦虑;季度又太疏,等你发现被引用份额在掉,竞品的内容护城河可能已经挖了一个季度。月度是个甜区——既能滤掉短期噪声,又来得及在趋势变坏时出手。成交层那几个偏宏观的指标(增量、品牌词趋势)可以放宽到季度复盘,因为它们本身就需要更长的窗口才看得出因果。 再说归属,这是更要命的一环。新KPI盘最怕的状态是“三不管”:内容团队觉得这是数据的活,数据团队觉得这是SEO的活,SEO觉得老板没要就先放着。结果台账没人填、问句池没人维护、趋势没人解读,盘子三个月就荒了。 稳妥的安排是给这套盘配一个明确的“盘主”——不一定是谁的全职,但必须是一个具名的人,负责每月把数取出来、把趋势解读成一句话、把异常拎出来同步给该动手的人。盘主不需要自己干所有活,但他是那个“东西没更新会被问责”的人。一件事一旦谁都负责,就等于谁都不负责;给KPI盘指定盘主,是它能从“一次性项目”变成“长期仪表”的关键一步。 节奏和归属这两件事,听上去琐碎,却是换盘工程里最不该省的。指标体系再科学,没有固定的复盘节奏和明确的责任人,它就只是一张做完就没人看的漂亮表格——又变回了开头那个“全是绿灯却没人当真”的老问题,只不过这次绿灯的颜色新了一点而已。 ## 一个真实复盘:KPI全绿,增长却卡住了 去年保哥帮一个做出海家居用品的独立站团队复盘半年数据,碰到的正是开头那个场面。仪表盘漂亮得不像话:核心词排名稳、自然流量同比涨了三成、页面停留时间也健康。可销售那头的增长曲线,过去两个季度几乎是平的。 团队的第一反应是“流量涨了转化没跟上”,于是一头扎进落地页优化、改CTA、调价格弹窗,折腾了一个多月,增长还是不动。问题根本不在那儿。把指标按三层重排之后才看清:可见层其实在退——同品类问题里,他们被AI推荐的份额在悄悄下滑,被几个内容更“对话友好”的竞品截胡了;而老仪表盘上那套排名和流量,压根照不到这一层。流量还在涨,是旧的长尾页面在吃存量,新增的高意图人群正从AI那头流向别人。 更扎心的是同框名单:以前他们被AI引用时,旁边常并列着几家行业媒体,那个季度悄悄变成了清一色竞品,等于AI在用户面前把他们从“权威之一”降成了“备选之一”。这层退化,旧仪表盘上任何一个绿灯都照不出来。 调整很简单也很朴素:先把“被推荐份额”和“品牌词增长”这两个新KPI立起来,每月看一次方向,并指定了一个具名的盘主每月填表、解读趋势;内容侧不再盲目堆词,转去补那些选择型、场景化的对话式问题,专挑被竞品截走的那批问句下手。三个月后,被推荐份额回升,同框名单里行业媒体重新多了起来,品牌词搜索跟着起来,销售曲线才重新有了斜率。整件事里他们没多花一分钱投放,只是换了一副能看见真相的仪表——而真相,旧仪表盘从来没让他们看见过。 ## 常见问题解答 ## AI搜索KPI是不是要把传统SEO指标全部扔掉? 不是。传统指标在它们成立的场景里依然有用——比如你的页面在常规搜索结果里的表现,排名、CTR还是该看。换盘的意思是别再拿这些点击时代的指标去衡量AI时代的影响,那是张冠李戴。更稳的做法是过渡期双盘并行,让老指标退居参照位,新指标负责回答AI这条线的问题。哪些老指标已经明显过期、该被替换,可以参考2026该淘汰的SEO指标清单 (https://zhangwenbao.com/retire-outdated-seo-metrics-2026-strategy.html)。 ## 没有专门的AI监测工具,能不能先测起来? 能。最朴素的办法是人工抽样:列5到10个对你业务最重要的真实问句,每月在主流AI引擎各问一遍,手动记录你有没有被提到、有没有被推荐、身边同框的是谁。这套手工台账虽然糙,但足以看清方向。等量起来了、值得投入了,再上自动化监测工具不迟。先有方法,再谈工具。 ## 被引用率和品牌提及份额,到底哪个更重要? 看你处在哪一层的问题。被引用率更接近“硬转化前的临门一脚”,适合衡量信息型、对比型查询里的表现;品牌提及份额更偏声量和心智,哪怕不带链接也算数,适合看品牌在品类里的相对位置。两个一起看才完整:一个量“被选中”,一个量“被记住”。只盯一个都会有盲区。 ## 为什么不直接上一套AI归因模型,一步到位? 因为顺序反了。归因解决的是“生意来了怎么证明是AI带来的”,是成交层的事;而KPI盲点是更前置的问题——你天天看的指标本身就量错了东西,这时候再精密的归因也只是在错的目标上做精装修。先把可见层、影响层的KPI换对,成交层的归因方法论再按需深挖,这个顺序不能颠倒。 ## 换了KPI,老板会不会觉得是我们在为业绩不好找借口? 这是真实存在的风险,解法在过渡期的设计上。三招:双盘并行让大家看着新指标和业务一起动、新指标头两个月只采数不设目标先建基线、把每个指标的算法和口径写成谁都能查的文档。核心是让换盘表现为“我们看得更清楚了”,而不是“我们换了个对自己有利的算法”。信任是用透明换来的,不是靠解释。 ## 换掉老KPI,是不是该一刀切全删了重来? 不必。失效的老指标不是没用,而是不能再当成功标准。把它们降级成诊断信号——比如排名照看,但别再拿排名向老板汇报成绩,改用可见、影响、成交三层全漏斗指标来定生死。换的是判断标准,不是把数据全扔了。 ## 权威参考资料 ## GA4怎么跟踪AI流量?新渠道能回答和回答不了的事 - URL:https://zhangwenbao.com/google-analytics-ai-assistant-guide.html - 分类:AI监控与数据 - 发布:2026-05-14 | 更新:2026-06-01 - 摘要:把GA4的AI助手渠道当成全部AI流量,是接下来一年最常见的数据误读。AI Overview点击为何不算、暗流量与零点击的盲区、新旧口径怎么接不打架、数据质量怎么验、GEO营收怎么向老板诚实汇报,这篇按落地讲透。 - 关键词:GEO,GA4,数据分析,谷歌SEO > **TLDR**:摘要:GA4在2026年5月13日加了一个原生的“AI助手”渠道,自动把来自ChatGPT、Gemini、Claude这类聊天机器人的引荐流量单独归类,不用再自己写一长串正则去拼自定义渠道组。但这件事真正的关键不是“终于能看了”,而是它没量到的那部分:AI Overview的点击不算在这里(那是自然搜索)、没带referrer的暗流量进不来、零点击压根不产生访问、不在识别名单上的助手也漏掉。把这个渠道当成“我的全部AI流量”,是接下来一年最常见的数据误读。本文拆透它的归因机制、为什么5月13日前的数据回不来、它能可靠回答哪些问题、怎么和历史数据接上不打架,以及DTC团队怎么用它给GEO投入算一笔诚实的账。 > 摘要:GA4在2026年5月13日加了一个原生的“AI助手”渠道,自动把来自ChatGPT、Gemini、Claude这类聊天机器人的引荐流量单独归类,不用再自己写一长串正则去拼自定义渠道组。但这件事真正的关键不是“终于能看了”,而是它没量到的那部分:AI Overview的点击不算在这里(那是自然搜索)、没带referrer的暗流量进不来、零点击压根不产生访问、不在识别名单上的助手也漏掉。把这个渠道当成“我的全部AI流量”,是接下来一年最常见的数据误读。本文拆透它的归因机制、为什么5月13日前的数据回不来、它能可靠回答哪些问题、怎么和历史数据接上不打架,以及DTC团队怎么用它给GEO投入算一笔诚实的账。 先说个场景,很多做SEO的这两年都遇到过:老板看完一篇讲AI搜索的文章,回头问你一句——“咱们在ChatGPT、Gemini上到底有没有流量?带来多少单?”然后你打开GA4 (https://en.wikipedia.org/wiki/Google_Analytics),发现这部分流量稀里糊涂混在Referral里,要回答得先写一串正则、建个自定义渠道组,还说不清准不准。 保哥手上一个北美DTC独立站客户的市场负责人,去年Q4就被这个问题逼到墙角:投了小半年GEO,老板要一个“AI带来多少营收”的数字,可当时GA4里根本没有干净的口径,最后只能给一个加了一堆免责声明的估算,汇报现场很难看。所以当GA4原生加了这个“AI助手”渠道,不少人第一反应是“终于解放了”。 但解放只解放了一半。这篇要说清的,不是“这个新渠道多好用”——官方功能介绍三句话就讲完了——而是它能可靠回答什么、绝对不能拿它回答什么,以及怎么把它接进你已有的衡量体系里不出错。把这条边界搞清楚,比会点开那个渠道重要得多。 ## GA4这个新渠道到底加了什么,机制上怎么跑的? 2026年5月13日,GA4在标准报告里新增了一个叫“AI助手”的渠道分组。在这之前,想看ChatGPT、Gemini、Claude这些带来的流量,你得自己维护一个自定义渠道组,配一长串不断要更新的正则去匹配各家域名——又累又容易漏,新出一个助手或者哪家换了域名,你的正则就悄悄失真了。现在这件事Google替你做进了你天天在用的那套标准报告里。 ## 它在归因链路里到底动了哪一环 得讲清机制,否则后面所有的坑都看不懂。GA4判断一个访问从哪来,靠的是这次访问的来源(source)、媒介(medium)和一套渠道分组(Channel Group)规则。这个新功能做的事很具体:当一次访问的引荐来源匹配上Google识别的某个AI助手时,GA4给它打上一个新的媒介值ai-assistant、归到名为“AI Assistant”的渠道分组、并赋予一个ai-assistant的来源活动名。换句话说,它不是新发明了一种追踪技术,而是把原来散落在Referral里、需要你手动识别的那批访问,按一套Google维护的识别名单,自动挑出来、贴上统一标签、单独成一个渠道。 这意味着它的能力上限,完全由两件事决定:第一,这次访问有没有带上可识别的引荐来源;第二,那个来源在不在Google的识别名单里。这两个前提,任何一个不满足,流量就进不了这个渠道——这正是后面“它没量到什么”那一节的全部根源。先把这句记住:它分的是“带着可识别AI来源标记的引荐访问”,不是“所有和AI有关的流量”。 还有几个归因细节,不搞清后面对数会一直对不上。GA4默认用“最终非直接点击”归因,意味着如果用户先从ChatGPT点进来、当时没转化,过几天直接打开网址下单,这一单的功劳算给那次AI引荐还是算Direct,取决于会话和归因窗口怎么设——同一批AI用户的转化,会因为归因模型 (https://support.google.com/analytics/answer/10596866?hl=zh-Hans)不同在报告里飘。另外,这个渠道的判定优先级和UTM是冲突的:如果有人给从AI界面出去的链接手动打了UTM参数(比如投放或合作位),GA4会优先按UTM归因,这次访问就进了UTM指定的渠道而不是“AI助手”——所以你看到的AI助手渠道,天然排除了所有被UTM覆盖的AI链接。再有,“可识别引荐来源”技术上是按来源域名去比对名单的,同一个AI产品如果用了多个不同域名做跳转或短链,没全部进名单的那部分就会漏。这三条叠加的结果是:这个渠道是“没被UTM覆盖、带完整referrer、来源域名恰好在名单内”的那部分AI引荐——条件链很长,每一环都在往下筛。 怎么确认这个渠道在你账号里真的正常工作、而不是数字看着有就以为对了?给一个十分钟能跑完的自检:打开GA4的实时报告,自己用电脑浏览器登录ChatGPT或Gemini,让它给出一个含你站链接的回答,点进去,回到实时报告看这次会话的会话来源/媒介是不是被打成了ai-assistant、渠道分组是不是落进“AI Assistant”。再去探索(Explorations)里建一个以会话默认渠道分组 (https://support.google.com/analytics/answer/9756891?hl=zh-Hans)为维度、会话数为指标的表,确认“AI Assistant”这一行有数且数随时间长。如果自己点进去都没被正确归类,那多半是你的站有某些跳转或安全策略把referrer剥掉了,这种情况下这个渠道对你会长期偏低甚至接近空——先解决referrer传递,再谈用它的数。别跳过这步直接信报告里的数字,渠道有数不代表归类对,归类对不代表覆盖全。 ## 为什么5月13日之前的AI流量永远回不来 一个会让很多人栽跟头的硬限制:5月13日之前落进Referral的那些AI流量,永远留在Referral里,不会被追溯重新归类。这不是Bug,是GA4归因的固有特性——渠道分组规则的变更对历史数据不回填,过去就是过去。 后果很现实:5月13日之后你看“AI助手”渠道,会看到它“从零开始往上长”,曲线陡得像这个渠道是突然爆发的。其实不是,是统计口径那天才开始,之前同样的流量被记在别的名下。如果你不懂这一点,拿5月13日做分界去算“AI流量增长率”,会得出一个完全失真的暴涨结论,再拿这个结论去做预算决策,错得离谱。正确的做法后面单独讲——核心是你得保留并接上历史口径,不能假装世界从5月13日才开始。 ## 这个渠道没量到的,才是最该警惕的 这一节是整篇最该慢慢读的。多数人会高高兴兴打开这个渠道,把里面的数字当成“我们的AI流量”报上去——这是个会反复出事的误读。这个渠道有四类AI相关的东西它根本看不到,而这四类加起来,往往比它能看到的还多。 ## AI Overview和AI模式的点击,不在这里 这是最大的误解。用户在Google搜索里看到AI Overview或AI模式的回答,点了里面引用的链接进你的站——这部分流量算什么?算自然搜索(Organic Search),不算这个“AI助手”渠道。因为这次点击的来源是Google搜索本身,不是某个独立的聊天机器人界面。所以如果你做的是Google侧的GEO(被AI Overview引用),这个新渠道一个字都帮不上,那部分效果还得回到Search Console和自然搜索口径里看。把“AI助手”渠道当成“我GEO做得好不好”的总成绩单,方向就错了——它只覆盖独立聊天机器人引荐这一小块。Google侧AI流量到底怎么追,思路和这个完全不同,GA4追踪GEO流量的完整实战 (https://zhangwenbao.com/geo-ga4.html)那篇讲的是用维度和事件去拆,和这个原生渠道是互补关系,不是替代。 ## 没带referrer的那一大片暗流量 渠道靠引荐来源识别,可有相当大比例的AI流量到达你站时根本没带来源标记:用户用ChatGPT的手机App点链接、用各种套了webview的内嵌浏览器、开了隐私设置剥掉referrer、或者用户看完AI回答直接复制你的品牌词去地址栏或另开搜索——这些访问要么进了Direct(直接流量),要么混进别的渠道,永远不会进“AI助手”。这部分业内常说的“暗AI流量”,体量经常和能被识别的部分一个量级甚至更大。所以这个渠道给你的数字,是AI引荐流量的下限,不是全貌。把下限当全貌去汇报,等于系统性低估了AI的真实影响,决策自然偏。 那暗流量这块就只能彻底放弃测量吗?也不是,它测不准,但能三角估算。给一套能落地的粗估法:第一,盯Direct(直接流量)里的异常结构——AI普及后,那种“没有任何来源、却直奔某个深层产品页或长尾内容页”的Direct访问明显变多,正常的Direct多是首页或品牌词落地,深页直达的Direct里藏着大量被剥了referrer的AI来访,把这部分的环比变化单独拉出来看是一个代理指标。第二,看品牌搜索量的变化——用户在AI里认识你之后,常常转头去搜你的品牌词,Search Console里品牌词的展示和点击趋势,和你的GEO投入节奏对照,能侧面印证AI带来的认知增量。第三,用服务器日志里各家AI的UA请求量,去对GA里这个渠道的会话量,两个数的比例如果长期稳定,就能用它当一个换算系数,反推大致的真实量级。这三条都不精确,但三角对照下来,能把“暗流量大概是可见部分的几倍”收敛到一个可用的区间——这比直接写“无法测量”要专业得多,老板要的不是精确,是“你知道自己在估什么、误差从哪来”。要补一句硬提醒:这个换算系数必须用你自己站的日志和数据现推、并且每隔一段时间重推一次,绝不能借别人文章里的倍数直接套——它高度依赖你的用户设备结构、隐私设置占比、AI来源构成,换个站、隔几个月都会变,借来的系数等于把别人的偏差搬进你的报告。 ## 零点击的AI回答,压根不产生访问 还有一类影响根本不以“访问”的形式存在:用户问AI、AI直接把答案给全了,用户拿了答案就走,没点任何链接。这种情况你的内容可能被AI读了、用了、甚至塑造了用户对你品牌的认知,但GA4里没有任何一行数据——没有访问,分析工具天然测不到。这不是这个渠道的缺陷,是所有以“访问”为单位的分析工具的共同盲区。意识到这一点很重要:你在AI里的真实存在感,永远大于任何流量工具能呈现的数字,别因为渠道里数字小就断定“AI没价值”。 ## 不在识别名单上的助手,直接漏 渠道靠Google维护的一份识别名单工作。主流的ChatGPT、Gemini、Claude大概率在,但新冒出来的、地区性的、垂直领域的AI助手,在名单更新到之前,它们带来的流量会被漏在外面。对做出海或多市场的团队,这条尤其要注意:你目标市场用户常用的那个本地AI助手,可能根本不在名单里,于是你在那个市场的AI流量在这个渠道里近乎隐形。名单是动态的、滞后的,别假设“它都识别”。 把这四条加起来,结论很硬:“AI助手”渠道是一个有用的、但口径偏窄且系统性偏低的指标。它适合看趋势和做对比,绝不适合当“AI总流量/总效果”的唯一答案。把这个边界写进每一次汇报的脚注里,比把那个数字本身报得多漂亮重要。这类“拿一个口径窄的指标当全貌”的误读,是GA4最经典的翻车方式之一,GA4数据指标误读那几个陷阱 (https://zhangwenbao.com/google-analytics-metrics-misuse-guide.html)那篇有更系统的归纳,这个新渠道只是给那张老坑表又添了一行新坑。 ## 那它到底能可靠回答哪些问题? 说了一堆不能干的,得讲清它能干好的——用在对的地方它确实省事且有价值。它能比较可靠地回答这几类问题,每类我都标上要配的注意条件。 哪个AI助手给我带的引荐流量最多。在“带referrer且在名单内”这个前提下,渠道里能看到ChatGPT、Gemini、Claude各自的占比,这对决定“GEO资源往哪个平台倾斜”有直接参考价值——但记住这是引荐可见部分的相对结构,不是绝对总量。AI引荐流量的趋势在涨还是平。5月13日之后,同口径的环比趋势是可信的(口径一致),这条比绝对值更该看,因为它受“暗流量”的系统性偏差影响相对小——只要偏差比例大致稳定,趋势方向是可靠的。AI来的人和自然搜索来的人,行为有没有差。转化率、平均会话时长、每会话页数、落地页表现这几个指标,在AI助手渠道和其它渠道之间横向对比,能看出AI引荐用户是“拿了答案快速验证型”还是“深度浏览型”,这对该给他们什么样的落地页很有指导意义。AI流量都落在哪些页面。看落地页报告里这个渠道的分布,能发现“AI在拿我哪几篇内容当答案源”,反过来指导你GEO该重点维护哪些页——这是它最实用的一个用法。 把这个用法写成一套能照做的动作:先在落地页报告里筛“AI Assistant”渠道,按会话降序,拉出AI最常把人带去的前20个页面;逐个看这些页是不是“答案形态”的——结构清晰、有明确结论段、能被直接引用,如果是说明它们正在被AI当答案源,要列为最高优先级持续维护,内容时效、事实准确、那个结论段别在改版时动坏。如果发现AI带流量进来的是一些你自己都没在意的老页或边角页,那是个强信号——AI替你发现了真实需求,你该把这些页正经补成体系而不是放着。再反过来用:你重点做GEO、最希望被引用的那几篇核心页,如果在这个列表里长期不出现,说明AI根本没在拿它们当答案源,得回去查是不是结构不对、不够独到、或压根没进召回。这套“AI实际在用哪些页”反推“GEO该修哪些页”的闭环,是这个渠道在趋势数据之外能给你的最大杠杆。 注意,上面每一条的措辞都是“在可识别引荐这个子集里”。它是一个高质量的样本观测窗,不是普查。当成样本窗口用,它很好用;当成普查报上去,它会误导决策。 ## 怎么正确接上历史数据,不和旧的自定义渠道组打架? 这是落地时最容易出错、却没人讲的一步。如果你之前就有一套自定义渠道组加正则在追AI流量,现在原生渠道来了,直接关掉旧的、只看新的,是错的——因为新的没有历史、口径还和你旧的不完全一样,一关你就丢了连续性,前后对不上。 正确的处理分几步。第一,旧的自定义渠道组先别删,保留它继续跑,它承载着5月13日之前唯一的历史口径,是你做长期对比的唯一依据。第二,把5月13日设成一个明确的口径分界并标注在所有相关报告里,分界前用旧口径、分界后可以并列展示新旧两套,让看报告的人知道“这里换过尺子”。第三,查清楚新旧口径的重叠和差异:你的旧正则匹配的域名集合和Google识别名单不一定完全一样,如果你在某个对比视图里同时让两套规则生效,可能把同一批访问算两遍,做混合视图前一定要先确认归因优先级、避免双重计数。第四,长期上以原生渠道为主口径(它会持续被Google维护、比你手动维护正则可靠),但把旧口径作为历史校准基准长期留着。把这套做对,你才有一条从过去贯穿到未来、不断档的AI流量曲线,而不是一条从5月13日凭空长出来的假增长线。 双重计数到底怎么发生的,给个具体场景你就警惕了:你旧的自定义渠道组正则里写了匹配某AI域名归为“AI流量”,现在原生渠道也认这个域名归为“AI助手”。如果你做了一个对比看板,把“自定义AI渠道会话”和“AI助手渠道会话”并排相加当成总AI流量,同一批访问就被两套规则各计了一次,总数直接虚高近一倍——而它表面看起来还很合理,因为两个数都不离谱,加起来也像那么回事,最不容易被发现。规避的办法是:并排展示可以,但任何把两者相加的指标都要先确认归因互斥,要么以原生渠道为唯一计数口径、旧口径只作历史段,要么明确在重叠期只采信一套。看板上每一个“合计”数字,都要能说清它是哪套口径算的、有没有重叠。 ## 怎么把它接进一张统一的AI可见性看板? 单看这个渠道永远是盲人摸象。真正可用的做法,是把它当成一张三层看板里的一层,而不是一张表的全部。 这张看板按“可信度”分三层往下排。第一层,能确证的:AI助手渠道里那些带完整referrer、在名单内的会话与转化——这是地板,数字最硬,直接采用。第二层,能合理推断的:用前面那套三角法估出来的暗流量区间、自然搜索里和GEO相关的提升、品牌搜索的侧面印证——这层给区间不给单点,每个数后面都标清估算方法。第三层,已知但测不到的:零点击影响、不在名单的助手、被剥referrer又无法三角覆盖的部分——这层不写数字,写一句“已知存在、当前不可测”的说明,提醒看板的人别把前两层当全部。把这三层固定成模板,每次汇报照填,谁看都知道哪些是实测、哪些是估算、哪些是盲区。 保哥给那个被老板逼问的客户最后落地的就是这么一张看板:一层是GA这个新渠道的硬数,一层是Direct深页直达异常加品牌词趋势拼出来的暗流量区间,一层是写明的盲区说明。第一次用这张看板汇报,老板没再追着要那个“精确的AI营收数”,因为他第一次看清楚了哪些是真的、哪些是估的、哪些是谁也测不了的——数据可信度的结构本身,就是最有说服力的那个汇报。这张看板还顺手解决了一个老问题:以后再有任何新的AI测量工具或渠道出来,往第一层里加一列就行,三层结构不用动,不会每出一个新指标就推翻重做。 ## 数据质量这关怎么过,别让脏埋点把你骗了? 这个渠道再原生,它也只是忠实反映GA4里有什么。GA4里如果埋点是坏的、事件是错的、转化定义有问题,那它把脏数据按AI助手分得再干净,结论照样是错的——AI分类正确,不代表被分类的数据本身正确。 过这关要盯几件事。转化和关键事件的埋点是否健康:如果你的购买或线索事件本来就漏报,那“AI助手渠道转化率低”可能根本不是AI用户不转化,而是这个渠道的转化压根没被记全,你会因此错杀一个其实有效的渠道。机器人和agent流量的混入:随着AI agent开始代替人访问网站,一部分进这个渠道的“访问”可能根本不是人,而是自动化代理在执行任务,它们的会话时长、跳出、转化和真人完全不同,不剔除会把整个渠道的行为指标带偏。和其它数据源交叉验证:别只信GA4一家,把这个渠道的量级和服务器日志里对应AI来源UA的请求、和Search Console侧的口径对一对,差异过大就说明某一端有问题,而不是直接采信。采样与阈值:流量不大的站,这个渠道的样本可能小到统计噪声盖过真实信号,单周的涨跌别急着解读,拉长窗口再看。把数据质量当成结论可信度的前置闸——闸没过,后面分析做得再漂亮都是沙上盖楼。光靠GA一家口径看AI,本来就有盲区,配合用GSC正则挖AI搜索Prompt (https://zhangwenbao.com/gsc-regex-mine-ai-search-prompts-guide.html)那套从搜索侧交叉印证,才能把单一工具的偏差摊薄。 agent流量这条单独多说两句,因为它会越来越重要、也越来越脏。随着AI agent开始代人执行“查规格、比价、订位”这类任务,会有一批以AI助手为来源、但行为完全不像人的会话涌进这个渠道:典型特征是会话极短或极规整、几乎零滚动、不触发任何转化或交互、常集中在特定几个信息页、来源UA和访问节奏带机器味。这部分混进去,会把整个渠道的转化率、停留、跳出全部带偏,让你误判“AI用户质量差”。处理上分两步:识别——用GA4的细分把这个渠道里“会话时长低于某阈值且零关键事件”的访问单独圈出来观察占比和趋势;隔离——做行为分析时把这部分排除在“真人AI访问”之外单独看,但别直接全删,因为agent的访问本身是另一个值得追的信号(它说明AI agent在拿你的页做任务,这在agentic商务起来后是机会不是噪声)。把人和agent分开看,而不是混在一个渠道平均里,是这个渠道未来一两年最该提前建好的一道处理——现在量小好建规则,等它起量了再回头拆会非常痛。 ## DTC团队怎么用它给GEO投入算一笔诚实的账? 回到开头那个场景:老板要“AI带来多少营收”。现在有了这个渠道,能不能回答了?能回答一部分,且必须诚实地标清楚是哪一部分。 保哥给那个客户后来重做汇报的口径是这样的,可以直接借:先用这个渠道给出“可识别AI引荐带来的会话、转化、营收”——这是有据可查的下限,明确写明它不含AI Overview点击(那在自然搜索里单列)、不含无referrer的暗流量、不含零点击影响。再把自然搜索里和GEO相关的提升单独列一块,两块分开讲、不混账。最后给一个范围估算而不是单点数字:基于可见下限和行业暗流量比例经验,给老板一个“真实影响大概在X到Y之间”的区间,并说清楚为什么不能更精确——因为工具的边界就在那里,硬给一个精确单点反而是不专业。这种把“能确证的”“能合理推断的”“测不到的”三段分开摆的汇报方式,比一个糊弄的大数字更能赢得信任,也更经得起追问。怎么把SEO/GEO的价值跟老板讲清楚、不被一个虚数带偏,DTC电商SEO汇报困局那篇 (https://zhangwenbao.com/dtc-ecommerce-seo-reporting-stakeholder-communication.html)有整套模板,这个新渠道正好补上里面“AI那一块”过去最难填的数据。 给一个带数字的汇报算例,照着套就行。假设这个月AI助手渠道实测:会话1200、转化38单、营收9600美金——这是第一档,能确证的下限,原样写进报告,并附一行“仅含可识别引荐,不含AI Overview点击、无referrer暗流量、零点击影响”。第二档,用前面的三角法估暗流量:服务器日志里AI类UA请求量大致是GA这个渠道会话的3倍上下,保守取2到3倍区间,按相近转化率折算,AI整体带来的营收大概在“1.9万到2.9万美金”这个区间——明确标这是估算、写清是怎么估的。第三档,零点击和名单外助手对品牌认知的影响,写“已知存在、当前不可量化”,不给数。最后给老板的结论不是一个数,是一句话:“可确证至少9600,综合合理推断在1.9万到2.9万,另有无法量化的认知影响;这条渠道还在涨,建议GEO投入维持。”这种讲法老板反而更信,因为它经得起“这个数怎么来的”这一问——而一个糊弄的精确单点,第一个追问就崩。 还要提一句容易混的:GA4这两年还有个叫“分析顾问”(Analytics Advisor)的对话式AI功能,那是让你用自然语言问GA4要洞察的工具,和今天讲的“AI助手”渠道完全是两回事——一个是“用AI分析你的数据”,一个是“把来自AI的流量单独分一类”。别把这两个混在一起跟老板讲,会越讲越乱。 最后给个判断:这个渠道真正的价值,不是“终于能量AI流量了”这种解放感,而是它把“可识别AI引荐”这一小块从模糊变成了可追踪——仅此而已,但这一小块用对了确实有用。真正专业的做法,是一边用好这个干净的样本窗,一边时刻记得它框外还有更大一片测不到的影响,并在每次汇报里如实交代这条边界。把AI影响的衡量做成一个持续校准的闭环、而不是指望某一个新指标一劳永逸,才是这件事的正解。如果你这周只做一件事,就做那个十分钟自检:自己从AI界面点一次进来,确认归类正确、referrer没被你的站剥掉——这一步过不了,后面所有数都是空中楼阁。工具会一直补口径,但“知道自己测不到什么”这个能力,永远比多一个渠道更值钱。 ## 常见问题解答 ## GA4的AI助手渠道是什么时候上线的,要自己开吗? 2026年5月13日在标准报告里原生上线,不用再自己写正则建自定义渠道组。它会自动把匹配到识别名单的AI助手引荐流量打上ai-assistant媒介、归入AI Assistant渠道分组,在你日常用的报告里就能看到。 ## AI Overview带来的点击会算进这个渠道吗? 不会。用户从Google搜索的AI Overview或AI模式点链接进站,来源是Google搜索本身,算自然搜索,不算AI助手渠道。这个渠道只覆盖独立聊天机器人界面的引荐,Google侧的GEO效果要回到Search Console和自然搜索口径看。 ## 为什么我的AI助手渠道流量像是突然暴涨? 因为统计口径是5月13日才开始的,之前同样的流量被记在Referral等渠道里且不会回填。拿5月13日当分界算增长率会得出失真的暴涨结论,要保留历史口径接上看,别假设这个渠道之前为零。 ## 这个渠道的数字能代表我全部的AI流量吗? 不能,它是下限不是全貌。它看不到没带referrer的暗流量(App、隐私、内嵌浏览器)、零点击的AI回答、不在识别名单上的助手、以及算作自然搜索的AI Overview点击。当样本窗口看可以,当总量报上去会系统性低估。 ## 我之前的自定义渠道组正则还要不要保留? 要保留继续跑。它承载5月13日前唯一的历史口径,是长期对比的基准。把5月13日设为口径分界标注在报告里,查清新旧规则重叠避免双重计数,长期以原生渠道为主口径、旧口径作历史校准。 ## AI助手渠道和GA4的分析顾问是一回事吗? 不是。分析顾问(Analytics Advisor)是用自然语言问GA4要洞察的对话式AI工具;AI助手渠道是把来自AI的流量单独分类的渠道分组。一个是用AI分析数据,一个是给AI来的流量归类,汇报时别混为一谈。 ## 怎么用它给老板汇报GEO的营收贡献? 分三段讲:用渠道给出可识别AI引荐的会话转化营收作为有据下限并标明不含项;自然搜索里GEO相关提升单列;最后给区间估算而非单点,说清工具边界。把能确证、能推断、测不到的分开摆,比一个糊弄的大数字更可信。 ## 权威参考资料 ## AI更愿推荐哪些品牌别再靠猜:提示词级前后测实验框架 - URL:https://zhangwenbao.com/ai-search-prompt-experiment-framework.html - 分类:AI监控与数据 - 发布:2026-05-08 | 更新:2026-06-01 - 摘要:AI搜索时代GEO优化最大的问题是无法归因。本文系统讲解提示词级实验方法:如果—那么—因为的假设结构、单变量隔离、控制环境的七天前后测协议、引用率与出现位置与措辞三量度量,以及方法的适用边界与失效条件。 - 关键词:GEO,AI搜索,GEO实验 > **TLDR**:摘要:今天绝大多数所谓的“GEO优化”,本质是凭感觉下注:多写了几段FAQ、补了一段schema,过两周看AI答案里好像提到了自己,就当成功了。真要知道某个动作到底有没有把你在AI搜索里的可见度推上去,唯一靠谱的办法是把它当成一个受控实验来做——锁死单一变量,改动前后各跑七天基线,记录引用率、出现位置、措辞倾向,并且把模型版本钉死。做不到这几条,你花的每一笔GEO预算都没法归因,赢了不知道为什么赢,掉了也不知道哪一步错。 > 摘要:今天绝大多数所谓的“GEO优化”,本质是凭感觉下注:多写了几段FAQ、补了一段schema,过两周看AI答案里好像提到了自己,就当成功了。真要知道某个动作到底有没有把你在AI搜索里的可见度推上去,唯一靠谱的办法是把它当成一个受控实验来做——锁死单一变量,改动前后各跑七天基线,记录引用率、出现位置、措辞倾向,并且把模型版本钉死。做不到这几条,你花的每一笔GEO预算都没法归因,赢了不知道为什么赢,掉了也不知道哪一步错。 ## 为什么你的GEO优化基本上都是在赌? 先说个保哥今年春天遇到的真实场景。一个做户外露营装备的欧洲DTC客户,团队很勤奋,三个月里给主推的几个帐篷和睡袋页面加了详细规格表、补了FAQ、上了Product schema,还专门请人写了几篇“怎么选三季帐”的科普长文。三个月后老板问了一个非常朴素的问题:这些活儿,到底哪一件让我们在ChatGPT (https://en.wikipedia.org/wiki/ChatGPT)和Gemini里被提到的次数变多了?团队答不上来。不是不努力,是根本没有一个能回答这个问题的机制。 这其实是当下整个行业的通病。传统SEO时代至少还有排名可看——关键词今天第8位、做了内链下周第5位,虽然也有噪声,但起码有个连续的、可观测的刻度。到了AI搜索这一层,刻度没了。你问AI“北欧适合冬季露营的帐篷有哪些品牌”,它今天提你、明天不提你,措辞还每次不一样。大多数人面对这种不确定性的反应是退回到信仰:反正多写优质内容、多做权威信号总没错。这话不假,但它不能告诉你这一笔具体投入有没有产出,等于把营销预算交给了运气。 更麻烦的是,AI搜索的反馈是迟滞且模糊的。SEO掉排名你能在Search Console里隔天看到曲线往下走;AI答案里少提了你,没有任何后台会告诉你,你甚至不知道自己曾经被提过。于是“感觉变好了”和“感觉变差了”就成了团队复盘会上的主要论据,这是非常危险的状态——它意味着你既无法复制成功,也无法止损。 跳出这个困境的思路其实不新鲜,是把科学实验那一套搬过来:提出一个可证伪的假设 (https://en.wikipedia.org/wiki/Statistical_hypothesis_testing),只改一个变量,控制环境,改动前后做对照测量。这一篇就专门讲,针对AI搜索可见度,这套“提示词级实验”具体怎么落地,每一步有哪些坑会让你的结论失真。 ## 提示词级实验到底在测什么? 很多人一上来就想错了对象。他们想测的还是“我的排名”,于是去翻有没有工具能给个类似关键词排名的数字。AI搜索里没有这个东西,硬套只会自欺。提示词级实验测的不是位置分,而是三个更本质的量。 第一个是引用率,也叫出现率:固定一组提示词,反复问,统计在多少比例的回答里你的品牌或页面被提到。注意这里的单位是“提示词”,不是“关键词”。关键词是一个静态的检索词,提示词是一段有上下文、有意图、有时还有追问的对话。同一个意图,“推荐几个适合新手的轻量化帐篷品牌”和“预算两千以内冬季帐篷怎么选,有靠谱牌子吗”是两个不同的提示词,AI给出的候选集可能完全不一样。所以实验的最小观测单元必须是提示词本身。 第二个是出现位置。被提到第一个和被排在七八个里随便带一句,价值天差地别。AI回答虽然不像SERP那样有明确名次,但叙述是有顺序的,先被讲到、被单独成段展开的品牌,对用户决策的影响远大于末尾一笔带过的。所以每次记录不能只记“提没提”,还要记“第几个被提到、是否被展开”。 第三个量最容易被忽略,是措辞倾向。AI提到你时是“XX是这个品类里口碑很好的专业品牌”,还是“也有人会考虑XX,但评价两极”,对转化的影响是反向的。同样是被提及,正面框定和带保留的框定不是一回事。一个只盯引用率的实验,可能会把“被提及次数变多但措辞变差”误判成进步。 把这三个量拆清楚之后你会发现,提示词级实验和传统的AI可见度日常监测是两码事。日常监测是宽口径地看趋势,关心的是“最近整体怎么样”;实验是窄口径地验因果,关心的是“我刚做的这一件事,是不是它带来了变化”。两者都要做,但别混。如果你连日常的提示词监测体系都还没有,可以先把 提示词监测的常见误区和搭建方法 (https://zhangwenbao.com/prompt-tracking-guide.html)这一层补上,再谈做实验,否则连基线都没有。 ## 假设怎么写,实验才可复现? 实验的灵魂是假设,而假设最忌讳写成一句愿望。“我觉得加了FAQ之后AI会更愿意引用我”——这不是假设,这是祈祷,因为它既没说清改什么,也没说清预期什么,更没说清为什么会这样,事后无论结果如何你都能自圆其说。一个能用的假设要拆成三段,业内常用的结构是“如果—那么—因为”。 “如果”这一段写你具体做的动作,要精确到可被别人原样复刻。不是“优化产品描述”,而是“在三季帐这个集合页的每个产品卡片下,补一段40到60字、包含具体耐静水压数值和适用季节的结构化描述”。“那么”这一段写可观测的预期结果,要落到前面说的三个量上:“在‘三季帐推荐’这一组25个提示词里,本品牌的引用率从基线的某个水平上升,且平均出现位置前移”。“因为”这一段写机制假设,也就是你对“为什么会这样”的理论解释:“因为大模型在生成产品类回答时,更倾向于援引带有明确参数、能直接回答用户筛选条件的来源”。 “因为”这一段看着像废话,其实是整个实验最值钱的部分。它把一次孤立的测试变成了一次可积累的认知。如果结果支持假设,你验证的不只是“这次有用”,而是“带明确参数的结构化描述更易被援引”这条规律,下一个客户、下一个品类你就能直接调用。如果结果证伪,你也能反过来修正机制理解,而不是单纯记一笔“这招没用”。一个没有“因为”的实验,做一百次也长不出认知,只是攒了一百条互不相关的轶事。 写法 | 反面例子 | 可用的写法 | 动作(如果) | 优化一下页面内容 | 在集合页每张产品卡补40到60字、含耐静水压数值的结构化描述 | 预期(那么) | AI会更喜欢我 | 在指定25个提示词里引用率较基线上升、平均位置前移 | 机制(因为) | 因为内容更好了 | 因为生成产品类回答时模型更倾向援引能直接命中筛选条件的来源 | 还有个纪律问题:每一个实验都要在动手前把这三段写下来存档,而不是事后补。事后补的“因为”永远是为已知结果量身定做的解释,毫无预测力。这一步看着繁琐,但它是区分“做实验”和“瞎改然后讲故事”的分水岭。判断你写的是不是真假设有个简单标准——能不能想象出一个会让它被证伪的结果。如果任何结果你都能解释成“符合预期”,那它根本不是假设。 ## 单一变量怎么隔离,结论才不会被污染? 科学实验最硬的一条规矩是控制变量,可惜在AI搜索这件事上特别难守,因为你能动的东西太多,而它们又互相纠缠。隔离变量的核心思路只有一句:一次只动一个能被单独描述、单独回滚的东西,其余全部冻结。 ## 内容层:用单段替换法 最干净的内容实验不是“重写整页”,而是只换一段。选定一个目标页面,复制一份做对照页,对照页保持原文,测试页只替换一个明确的文本单元——一段产品描述、一条FAQ答案、一组功能要点。两个页面其余部分一字不动。这样如果引用率有变化,你才有底气说是这一段带来的。整页重写最常见的下场是:结果变好了,但你有十几个改动,根本不知道是哪个起的作用,等于没做实验。 这里有个很多人不知道的真实复杂性,必须讲清楚,否则你会做出一个看起来严谨实际无效的实验。传统A/B测试 (https://en.wikipedia.org/wiki/A/B_testing)能成立,靠的是同一时刻把对照版和测试版分给两批等价用户。AI搜索里你做不到这件事——你面对的是同一个模型,它不会“一半时间看对照页一半时间看测试页”。模型对一个站点的理解来自它抓过、训练过、检索得到的全部页面。如果对照页和测试页都在你自己域名下、都能被抓到,模型很可能把两者一起吸收,你想隔离的那一个变量根本没被隔离。可行的做法有两种:一种是时间序列对照,也就是后面要讲的“前后测”,用同一组页面在改动前后各测一段时间,拿时间当对照而不是拿另一个页面当对照;另一种是用真正没被收录过的新URL承载测试版,避免和旧版本在模型那边互相污染。把“对照页”理解成传统A/B那种空间并列对照,是这一层最隐蔽的坑。 ## 结构层:只动机器可读、不动可见HTML 结构化数据的实验有个特别巧的隔离方式:在不改动任何用户可见HTML的前提下,单独增减schema属性,比如给已有的Product补上brand、model、offer这些字段。因为页面对人眼一模一样,唯一变的就是机器可读层,引用率若动,归因非常清晰。保哥去年给一个做宠物智能用品的北美DTC客户做过一次这样的测试:他们的常见问题区在HTML里本来就有问答文本,但没有打FAQ结构化标记。只补schema、可见内容一字未改,两周后那批问答型提示词里被原文援引的比例有了肉眼可见的抬升。结论很窄但很硬:在已有问答文本上补结构化标记,能让这段内容更容易被大模型抽取。注意这条结论的边界——它说的是“已有文本补标记”,不是“没内容光打标记也有用”,后者那家品牌也试过,单独给空架子打标记,没用。 ## 提示词层:固定问法,别手痒改 很多人实验做着做着就把提示词也改了,觉得“这样问更自然”。一旦提示词变了,你的前后测就失去了可比性,因为你不知道变化来自页面改动还是问法改动。提示词集合一旦定稿,整个实验周期内一个字都不能动。要测不同问法的影响,那是另一个实验,单开。 实验类型 | 动的变量 | 必须冻结的 | 归因清晰度 | 单段内容替换 | 一段文本 | 页面其余部分、schema、提示词 | 高 | 纯schema增减 | 结构化属性 | 全部可见HTML、提示词 | 很高 | 整页重写 | 几十处 | 几乎没冻结 | 极低,不建议 | 换提示词问法 | 提示词 | 页面、schema | 另开实验,别和内容实验混 | ## 模型漂移和版本更新会怎么毁掉你的数据? 就算变量隔离做得很干净,还有两个来自模型本身的噪声源能把你的结论搅成一锅粥,必须先认清。 第一个是提示词漂移。同一个提示词,今天问和明天问,回答可能不一样,候选品牌的顺序、有没有提到你,都会变。这不是你做了什么,是生成模型本身的随机性加上后台的动态调整。它的直接后果是:任何只测一天的“前后对比”都是废的。你周一改了页面、周二一看AI提到你了,这极可能只是当天的随机抖动,跟你的改动没半点关系。对抗漂移没有别的办法,只能靠重复采样取平均——这也是为什么后面讲的协议要连续跑七天而不是测一次。如果你想更系统地理解同一意图下换个说法AI引用就剧烈波动这件事,可以看 AI搜索改写敏感性的实测拆解 (https://zhangwenbao.com/ai-search-paraphrase-sensitivity-geo-test.html),它会让你对“一次读数等于没读”这件事有更具体的体感。 第二个是模型版本更新。主流大模型的版本在不停往前滚,从某个4.1跳到4.2,底层权重和检索策略可能就变了。你上个月在旧版本上得出的“某招有效”,到新版本上可能完全不成立。这意味着两件事:一是任何实验结论都要标注它是在哪个具体版本上得出的,过期作废;二是版本一旦在实验周期中途更新,这个周期的数据基本要作废重来,因为你的基线和测量已经不在同一个模型上了。这条很多人不信邪,非要把跨版本的数据接着用,然后得出一堆自相矛盾的结论,最后归咎于“AI搜索没规律”——其实是自己把尺子换了还浑然不觉。 把这两个噪声源记牢,你才能理解为什么下面那套协议看起来这么笨重。它不是为了仪式感,每一个环节都在对冲一个具体的失真来源。 ## 不同AI平台要不要分开测? 这是被问得最多、也最容易被偷懒的一个点。答案很明确:要,而且必须分开。原因在于不同平台的回答生成机制根本不是一回事。有的平台更接近“先实时检索一批网页,再基于检索结果重排和归纳”,它对你页面当前内容、结构化标记的反应更快、更直接;有的平台更依赖训练阶段沉淀下来的知识,对你刚改的那段内容反应迟钝甚至当期完全没反应;还有的是搜索引擎里嵌的AI摘要,它的候选高度受这个搜索引擎自身排名的影响。同一个改动,在偏检索的平台上两周内就能看到引用率动,在偏训练记忆的平台上可能这一季度都没动静——这不是你的改动没用,是测错了地方还下错了结论。 实操上的纪律是:提示词池可以共用一套,但基线、改动、后测要在每个目标平台上各跑一遍,结论分平台记录,绝不合并成一个总数。前面提到的那个户外露营客户的“补结构化规格描述”实验,在偏检索的那个平台上交易类提示词引用率明显抬升,在偏训练记忆的平台上同期几乎没动。如果当时把两个平台的数据揉在一起算总账,那个真实有效的信号会被另一个平台的零变化稀释成“好像有点用但不确定”,团队很可能就放弃了一个其实该全力推的方向。分平台看,结论是“这招对检索型平台立竿见影,对记忆型平台需要更长的沉淀期”——这才是能指导资源分配的结论。 还有一层要提醒:AI摘要类入口的候选很大程度来自传统排名,所以在这类入口上做的“提示词级实验”,本质上常常是在测你的传统SEO改动有没有间接影响到AI摘要,和纯生成式平台不是一个因果链。把它们混为一谈,是这一层最常见的认知错误。 ## 一个完整的前后测实验长什么样? 把前面的原则拼起来,就是一套可以照着跑的协议。这里把它拆成五步,每一步都给出可操作的参数。 第一步,定提示词池。不要只测三五个,样本太小,漂移会把信号淹掉。一个实用的规模是分三组、每组25个、共75个提示词。三组按意图分:纯信息类(怎么选三季帐)、比较类(A牌和B牌哪个适合冬季)、交易倾向类(预算内值得买的帐篷品牌)。分组的意义在于,后面你能看出你的改动对哪一类意图最管用,而不是只有一个笼统的总数。提示词怎么来?最好不是拍脑袋,而是从真实需求里挖,比如从搜索后台的查询里反推用户实际会怎么问,这块的方法可以参考 用正则从搜索后台挖真实提问的实战路径 (https://zhangwenbao.com/gsc-regex-mine-ai-search-prompts-guide.html)。 第二步,跑基线。提示词池定稿后,先什么都别改,连续七天、每天把这75个提示词跑一遍,记录每个提示词下的引用与否、出现位置、措辞倾向。七天跑完你得到的不是一个数,而是一个分布——这才是真基线。为什么是七天不是一天,上一节已经讲透了:对冲漂移。少于这个量,你的“基线”本身就带着巨大方差,后面怎么比都比不出可信的结论。 第三步,只动那一个变量。按你写好的“如果”那一段,精确执行单一改动。改完留出一两天给模型那边的抓取和更新缓冲,别改完当天就开始测。 第四步,跑后测。用一模一样的75个提示词,再连续七天每天跑一遍,记录同样的三个量。注意是“一模一样”,提示词、跑的时间段、环境,能固定的全固定。 第五步,控环境。这一步最容易被偷懒省掉,然后让前面四步白做。测量必须在干净环境里进行:清掉浏览器缓存、不要带登录态、尽量用接口或专门的测试方式而不是你自己天天用的那个账号,目的是消除个性化和地理位置带来的偏差。你用自己常用账号测,AI早就根据你的历史把你“惯”出了偏好,测出来的根本不是普通用户会看到的结果。 步骤 | 关键参数 | 对冲的失真 | 定提示词池 | 3组×25=75,按意图分组 | 样本过小、无法分意图归因 | 跑基线 | 连续7天,每天全量 | 提示词漂移 | 单变量改动 | 严格按“如果”执行,留1到2天缓冲 | 归因不清、抓取未更新 | 跑后测 | 同一池、同节奏,连续7天 | 前后不可比 | 控环境 | 清缓存、无登录态、接口测 | 个性化与地理偏差 | 保哥用这套协议给那个户外露营客户跑过一轮“产品卡补结构化规格描述”的实验。三组里交易倾向类那25个提示词的引用率抬升最明显,信息类几乎没动。这个结果本身就很有信息量:它说明这个动作的价值集中在临近决策的提问上,那团队后续就该优先把这类改动铺到转化路径上的页面,而不是平均用力到所有科普文。没有分组,你只会看到一个被平均稀释掉的总数,得出“好像有点用但说不清”的废结论。 反过来的案例也值钱。有个北美做3C充电配件的DTC客户,坚信“把品牌故事写得更长更感人”能提升AI推荐,准备投一笔不小的预算全站铺。先用这套协议在一组比较类提示词上小范围验:基线七天、改长品牌故事、后测七天,三个量全程几乎没动。这个“没用”的结论替他们省下了那笔预算,也把注意力重新拉回到真正有反应的方向——具体参数和兼容性列表。知道一件事没用,和知道一件事有用,价值是对等的,但前者几乎没人愿意花两周去认真证明。 ## 实验结果怎么读,才不会自己骗自己? 拿到前后两组分布,最危险的动作是肉眼一扫觉得“后面那组数字大一些”,就宣布成功。AI搜索的数据噪声大,小幅波动极可能就是漂移残留,不是你的功劳。读结果有几条纪律。 一是看分布不看单点。下面是那个户外露营实验里交易类提示词的真实形态,数值做了脱敏但结构是真的: 阶段 | 七天逐日引用率 | 均值 | 波动区间 | 基线 | 27 / 31 / 24 / 33 / 29 / 26 / 32(%) | 约29% | 24%–33% | 后测 | 38 / 42 / 36 / 44 / 40 / 37 / 43(%) | 约40% | 36%–44% | 这组数据值得相信,不是因为均值从29涨到40,而是因为两个分布几乎不重叠——后测最低的那天36%,已经高过基线最高的那天33%。作为对照,再看信息类那组:基线均值22%、区间17%到28%,后测均值24%、区间18%到30%。均值也涨了2个点,但两个区间大面积重叠,这个2个点落在噪声里,不能当成效果。同样是“均值上涨”,一个是真信号,一个是自欺,区别全在分布重不重叠,不在均值差多大。 二是三个量一起看,别只盯引用率。见过这样一个案例:引用率确实涨了,但扒措辞发现,多出来的提及里有相当一部分是被模型放在“也有人会选但争议较大”这种带保留的语境里。引用率这个单一指标会把这判成胜利,连着措辞和位置一起看,才看得出这其实是个需要警惕的信号。 三是想清楚什么叫“可以上线”。一个实用的土办法:只有当后测的提升明显超出基线自身的波动幅度、并且在三组提示词里至少有一组方向一致地变好、措辞没有变差,才把这个改动判为有效并推广。任何一条不满足,就归到“不确定”,要么加长测量周期再看,要么直接判负、回滚。宁可漏掉一个边缘有效的小改动,也别把噪声当成果到处复制——后者的代价是你会基于一个假规律去指导后面所有决策。 四是结论必须可追溯。每个实验都要留一份结构一致的档,缺一项后面都没法复用: 记录字段 | 记什么 | 为什么这项不能省 | 假设三段 | 如果/那么/因为原文 | 没有它,结果无法回扣到机制,长不出规律 | 变量与改法 | 具体改了哪段、改成什么 | 不精确就无法复刻,别人重做必然走样 | 模型与版本 | 平台名加具体版本号 | 跨版本结论会失效,不标注=数据过期不自知 | 提示词池 | 75条原文与分组 | 问法变了前后不可比,必须原样存档 | 两组原始读数 | 逐日数值非只均值 | 只存均值就无法事后判断分布重不重叠 | 判定与处置 | 有效/不确定/判负及理由 | 没有结论的实验等于没做 | 攒上几十个这样的档,你才真正拥有一套属于自己业务的、被验证过的规律库,而不是一堆道听途说的“最佳实践”。把单次实验串成持续闭环这件事怎么做,可以对照 AI引用率监控与迭代闭环的四步方法 (https://zhangwenbao.com/monitor-measure-iterate-ai-citation-optimization-2026.html)来搭。 ## 三个量到底怎么打分才不会人言人殊? 前面一直说记录引用率、位置、措辞,但没说清一个要命的操作问题:谁来判、按什么标准判。两个人看同一段AI回答,一个觉得算“被正面提及”,一个觉得算“带保留”,这个实验的数据就废了——你以为在测页面改动,其实在测打分的人那天的心情。所以打分口径必须在跑基线之前就钉死成一份成文规则,整个周期所有人照着同一份判,中途不许改。 引用率最容易,但也有边界要先定:品牌名的常见变体、缩写、旧名算不算?被提到但拼错算不算?建议用品牌名加变体做初筛自动标记,再人工只复核机器标为边界的那一小批,既快又一致。位置记录用一个粗刻度就够,不必精确到第几句:分“首个被展开、中部被列出、末尾一笔带过、未出现”四档,刻度太细反而会因为AI叙述顺序的自然抖动制造假差异。措辞倾向是最主观的,必须压成有判定规则的三档——正面(明确推荐或正面定性)、中性(仅客观列出无评价)、带保留(出现但伴随争议较大、不建议这类限定语)。每一档在规则文档里钉两三个原话样例,遇到拿不准的对着样例靠,而不是各凭语感拍。 还有一条容易被忽略的纪律:打分的人最好不知道手上这条记录属于基线还是后测,避开“知道改过了所以倾向于打高一点”的预期偏差。完全盲打做不到,至少把两组数据混在一起打、最后再按时间戳归位,比一组接一组顺着打可靠得多。这套口径建立起来一次,后面所有实验复用,边际成本很低,但它恰恰是把“感觉变好了”变成一个可信数字的关键一环,省掉它前面所有严谨都白搭。 ## 实验最常见的五种悄悄失效是什么? 这套方法不难懂,难在执行不走样。下面这五种失效,每一种都能让一个看起来一丝不苟的实验得出完全错误的结论,而且失效时不会报错,只会安静地给你一个假数据。 失效模式 | 典型症状 | 对策 | 带登录态测量 | 自己测稳定被引用,换人或换设备就消失 | 无登录态、清缓存、接口测,定期换环境复核 | 样本太小 | 每组就测三五条,结论每天翻烧饼 | 每组至少25条,总量75条起步 | 跨版本接数据 | 结论前后矛盾,归咎于AI没规律 | 版本中途更新即作废重跑,结论标注版本 | 中途改提示词 | 觉得换个问法更自然,顺手改了 | 提示词定稿后整周期一字不动 | 改完即测 | 没留抓取缓冲,后测前半段还是旧状态 | 改动后留1到2天再开始后测 | 这几条里杀伤力最大的是第一条和第三条。带登录态测量的隐蔽性在于,它给你的全是正反馈——你越测越觉得自己被引用得好,因为模型在迎合你这个账号的历史,等真实用户去问,根本不是那回事。跨版本接数据的隐蔽性在于,它制造的矛盾会让你怀疑方法本身,而不是怀疑那把被你换掉的尺子,于是很多人就此放弃了实验,退回到拍脑袋。认清这五种失效,比记住前面那套五步协议更重要,因为协议错了结果是没结论,这五种失效错了结果是有一个理直气壮的错结论。 ## 没时间跑完整版,最小能做到什么程度? 完整协议两周起步,确实重。如果你只是想在投入更大资源前做个粗筛,可以跑一个明确知道自己在牺牲什么的最小版本:单一变量照旧不变,提示词从75压到一组20条、只测最关键那类意图,基线和后测各5天而不是7天,平台只选你最看重的那一个。这个最小版能回答的问题是“值不值得再做完整版”,不能回答“这招确定有效”——5天对冲漂移的能力明显弱,20条样本的方差也更大,所以它的结论只配用来决定要不要继续投入,不能直接拿去全站铺开。 最小版有两条线绝对不能省,省了它就从“粗筛”退化成“瞎猜”:一是单变量隔离,二是干净测量环境。这两条是定性的,省了结论直接作废;而周期长短和样本量是定量的,缩了只是把误差放大,还能用“仅供判断是否深入”来兜底。把该省的和不该省的分清楚,比笼统一句“没条件就别做”有用得多——大多数团队不是不想严谨,是没人告诉他们哪里能让步、哪里碰都不能碰。 ## 这套方法什么时候反而不值得做? 得诚实说边界,不然就成了另一种万能论。提示词级实验是有成本的:两周以上的周期、每天的采样人力、一套记录纪律。不是所有场景都配得上这个成本。 第一种不值得的情况是提问量太小。如果你的品类在AI搜索里几乎没人问,或者你的目标提示词每月真实发生量很低,那你优化的是一个没什么人走的入口,把精力先放到把内容和实体基础做扎实更划算,等盘子大了再谈精细实验。第二种是站点太小、结构太干净。一个十几个页面的站,能动的变量本来就少,很多时候肉眼判断加常识就够了,上一整套对照协议属于杀鸡用牛刀。第三种是没有执行纪律的团队。这套方法最怕的就是“跑到一半改了提示词”“嫌七天太久测了三天”“版本更新了假装没看见接着用旧基线”——纪律一破,得出的结论比不做实验还危险,因为它会给你一种“我是数据驱动的”的错觉,让你更坚定地走错路。 保哥的判断是这样:提示词级实验不是日常动作,是关键决策前的验证手段。当你准备把某个做法在几十上百个页面上铺开、或者要拿它去说服老板追加预算时,先用这套方法在小范围验一遍,值。日常的内容和结构优化,按经过验证的规律去做就行,不必每件小事都开实验。把实验留给那些“赌错了代价很大”的决策,它的投入产出才划算。说到底,这套方法解决的不是“怎么优化”,而是“怎么知道你的优化真的有用”——后面这个问题,比前面那个更值钱,也更少人愿意认真回答。 ## 常见问题解答 提示词级实验和日常的AI可见度监测是一回事吗? 不是。监测是宽口径看整体趋势,回答“最近怎么样”;实验是窄口径验因果,回答“我刚做的这件事是不是它带来的变化”。两者都要做但别混用,没有监测基线也做不了实验。 基线为什么一定要跑七天,测一两次不行吗? 因为提示词漂移。同一提示词不同天的回答本身就在波动,单次或一两天的读数无法和波动区分,七天取分布才能得到可信基线,少于这个量结论方差极大。 模型版本在实验中途更新了怎么办? 这个周期的数据基本作废,需在新版本上重跑基线和后测。跨版本拼接数据会得出自相矛盾的结论,所有实验结论都必须标注所用模型与具体版本,过期即失效。 不同AI平台的实验结果可以合并成一个总数吗? 不能。不同平台生成机制不同,对同一改动反应快慢差别很大,合并会让一个平台的真信号被另一个平台的零变化稀释,必须分平台记录结论。 没有技术团队,能做这种实验吗? 能做简化版。单段内容替换、固定提示词、七天前后测、人工记录三个量,这些都不需要工程能力。纯schema隔离实验需要一点结构化数据基础,可以先从内容层实验起步。 实验显示某个改动有效,就可以全站铺开了吗? 要看是否满足三条:提升明显超出基线波动、至少一组提示词方向一致变好、措辞没变差。三条都满足再推广;只满足一两条归为不确定,延长周期或判负,别把噪声当成果复制。 这套方法适合所有网站吗? 不适合。提问量过低、站点过小结构过简、团队没有执行纪律这三种情况下,成本不划算甚至有害。它应留给“赌错代价很大”的关键决策做验证,而非日常每件小事都开实验。 ## 权威参考资料 ## Prompt Tracking是什么?AI可见度监测的4大误区与破局 - URL:https://zhangwenbao.com/prompt-tracking-guide.html - 分类:AI监控与数据 - 发布:2026-04-23 | 更新:2026-06-18 - 摘要:Prompt Tracking是AI搜索时代品牌可见度监测的核心方法。本文讲清它的定义、底层原理、与传统排名监测的本质差异,深度剖析四大致命误区(重引用轻提及、套用排名思维、监测规模不足、只盯头部大词),再给指标体系、Prompt池搭建、工具选型到落地闭环的实操。 - 关键词:Prompt,AI引用优化,AI搜索可见度 > **TLDR**:摘要:Prompt Tracking是AI搜索时代品牌可见度监测的核心方法。本文讲清它的定义、底层原理、和传统排名监测的本质差异,深度剖析四大致命误区,再给指标体系、Prompt池搭建、工具选型到落地闭环的完整实操,帮你把AI可见度监测真正做出价值而不是流于形式。 > 摘要:Prompt Tracking是AI搜索时代品牌可见度监测的核心方法。本文讲清它的定义、底层原理、和传统排名监测的本质差异,深度剖析四大致命误区,再给指标体系、Prompt池搭建、工具选型到落地闭环的完整实操,帮你把AI可见度监测真正做出价值而不是流于形式。 做了十几年SEO,保哥从来没见过一个话题像Prompt Tracking这样,在两年里从"无人问津"变成"不做就掉队"。当用户从Google的蓝色链接迁徙到ChatGPT、Perplexity (https://docs.perplexity.ai/home)、Gemini、豆包 (https://zhangwenbao.com/doubao-ai-search-geo-optimization-douyin-ecosystem.html)、Kimi的对话框,你的品牌有没有被AI提到、被怎么提、有没有被引用为信息源——已经替代传统排名,成为2026年最关键的可见度指标。 但绝大多数团队在做Prompt Tracking时,都在犯同一批错误:把传统SEO的排名思维硬套到AI回答上、只盯几个头部大词、把引用当成唯一KPI、监测规模小得可怜。结果是:花了钱买了工具,却看不懂数据、拿不出行动。 这篇长文,保哥会把Prompt Tracking的底层原理、核心指标、4大致命误区、7步落地方法、Prompt池建设、工具选型到数据解读全部讲透,读完就能动手。 ## Prompt Tracking是什么?AI时代品牌可见度的新坐标 ## 一句话讲清Prompt Tracking的核心定义 Prompt Tracking(提示词追踪)是指系统化地向ChatGPT、Perplexity、Gemini、Google AI Overview (https://blog.google/products/search/generative-ai-google-search-may-2024/)s、Claude、豆包等生成式AI引擎提交一组预定义的提示词,记录并分析品牌、产品、竞品在AI回答中的出现频率、引用来源、情感倾向和上下文位置的监测方法。 它的本质不是追踪"排名",而是追踪"AI是否把你当成一个可信的答案来源"。 ## 和传统关键词排名监测的3个本质差异 维度 | 传统关键词排名监测 | Prompt Tracking | 监测对象 | 关键词在SERP的位置 | 品牌在AI回答中的提及与引用 | 核心指标 | 排名、流量、CTR | 提及率、引用率、语音份额、情感 | 查询长度 | 1-4个词的短关键词 | 10-30个词的自然语言提示 | 结果稳定性 | 每日波动5%-15% | 同一Prompt重跑波动20%-40% | 用户意图 | 单次查询 | 多轮对话、上下文延伸 | 衡量目标 | 点击流量 | 品牌心智份额 | 一句话总结:传统排名监测看"你在哪",Prompt Tracking看"AI说了你什么"。 ## 为什么2026年必须做Prompt Tracking 三个硬事实让这件事不再可选: 事实一:搜索行为已经迁徙。 超过70%的信息类搜索以零点击告终,AI Overviews已覆盖Google搜索结果中约16%的查询,信息类查询触发概率更是达到57%。用户看完AI摘要直接走人,你的蓝色链接不再被点击。 事实二:AI引用已经开始直接影响转化。 被AI Overviews引用的品牌,自然点击率比未被引用时高出35%,付费点击率高出91%。同一条用户查询,被引用和未被引用的差别是现金流级别的。 事实三:传统SEO指标 (https://zhangwenbao.com/retire-outdated-seo-metrics-2026-strategy.html)已经失去解释力。 Seer Interactive的2025年研究发现,传统SEO强度(排名、外链)和AI回答中的品牌提及几乎不相关。也就是说,你可以排名第一但完全不被AI提到,也可以排名第五但在AI回答里被反复引用。 ## 生成式搜索引擎的底层逻辑:Prompt Tracking为何必要 ## RAG (https://www.anthropic.com/news/contextual-retrieval)架构下内容如何被选中 主流生成式搜索引擎都采用RAG(Retrieval-Augmented Generation,检索增强生成)架构,流程分四步: - 理解用户意图。 模型把自然语言Prompt拆解成若干子问题(fan-out)。 - 检索候选文档。 从索引池、实时网络爬取、授权数据源里召回相关内容。 - 评估和筛选。 根据权威性、时效性、结构化程度、语义匹配度排序。 - 综合生成回答。 用LLM把多篇候选内容综合成一段连贯的回答,选择性地附上引用。 这意味着:你的内容要出现在AI回答里,得先过"被检索到"这一关,再过"被选中用于综合"这一关,最后还要过"是否被明确标注引用"这一关。每一关都对应不同的优化动作,Prompt Tracking的价值就是帮你定位到底是哪一关出了问题。 ## 为什么同一个Prompt每次答案都不一样 这是Prompt Tracking最反直觉的一点。同一个品牌查询,早上问和下午问、在上海问和在深圳问、连续问两次,答案都可能不同。原因有三: - 模型采样的随机性。 LLM的输出本身带有温度参数(temperature),每次生成都有随机抽样。 - 检索结果的时效性。 网络索引在持续更新,检索到的候选文档会变。 - 个性化与上下文。 用户的历史对话、地理位置、登录账号状态都会影响回答。 研究显示,主流模型对同一Prompt的回答变异率在20%-40%之间。这就是为什么监测必须分布式采样、多次复测、取平均值,单次测试几乎没有参考价值。 ## 4大致命误区:Prompt Tracking最常见的翻车场景 ## 误区一:死盯引用链接,忽视品牌提及 很多团队把Prompt Tracking简化成"看AI有没有链接到我的官网"。这是第一个致命错误。 AI回答里有两种形态: - 引用(Citation): AI明确标注了来源URL,用户可以点击。 - 提及(Mention): AI在回答里说到了你的品牌名,但没有附链接。 实战数据显示,提及量通常是引用量的3-10倍。如果你只看引用,会错过大部分真正的品牌曝光。更关键的是,提及反映的是AI对品牌的"记忆"——模型已经把你纳入了知识库,这是比一次性引用更持久的认知资产。 保哥的实操建议: 提及率作为主指标,引用率作为辅助指标,两者都追踪、分开归因。 ## 误区二:把排名思维硬套到AI回答上 传统SEO看"我排第几",很多人顺势就问"我在AI回答里排第几"。 问题是,AI回答不是一个有序列表。一段综合回答里可能提到3-5个品牌,哪个排第一完全取决于回答的叙述结构。更要命的是:在一次查询里你出现在第一位,另一次查询里可能完全不出现。"排名"这个概念在AI回答里几乎没有稳定性。 真正有意义的对标指标是: - Share of Voice(语音份额): 在追踪的所有Prompt里,你的品牌出现的百分比。 - Context Position(上下文位置): 被提到时,是"首选推荐"还是"可选之一"还是"对比对象"。 - Co-mention Pattern(共同提及模式): 你和哪些品牌同时被提到,谁是主语谁是陪衬。 ## 误区三:Prompt池太小,长尾被完全忽略 只追踪10-20个核心关键词,是Prompt Tracking最普遍的失败模式。 AI查询和传统搜索的本质区别是长尾爆炸。同一个诉求可以被表达成几十种自然语言,比如"2000元内性价比最高的降噪耳机"和"给通勤党推荐降噪耳机,预算两千"——传统SEO可以把这两条合并成同一个词根,但AI引擎会把它们识别为不同Prompt,给出不同的回答。 保哥的经验值是: 品牌规模 | Prompt池最低量级 | 建议分布 | 中小品牌 / 单品类 | 50-100条 | 头部20% + 中腰部40% + 长尾40% | 中型品牌 / 多品类 | 200-500条 | 头部15% + 中腰部35% + 长尾50% | 大型品牌 / 全品类 | 1000条以上 | 头部10% + 中腰部30% + 长尾60% | 规模太小,你看到的就是噪音;规模足够,你才能看到趋势。 ## 误区四:只盯头部大词,脱离真实提问方式 这是和误区三相关的另一个陷阱。"最好的CRM"这种词,在传统SEO里是黄金,在AI查询里却几乎不是真实用户的提问方式。 真实的AI查询长这样: > "我们是一家15人的SaaS创业公司,销售团队3人,预算每月500美金以内,主要服务B2B客户,推荐一款适合的CRM。" 这段Prompt包含了规模约束、预算约束、行业约束、场景约束,AI综合所有这些约束给出回答。你只追踪"最好的CRM",会完全错过真实用户问题触发的品牌推荐场景。 破局方法: 把所有核心关键词按"约束维度"扩展成具体的自然语言Prompt。约束越具体,大品牌偏见越弱,中小品牌越有机会出现在答案里。 ## Prompt Tracking核心指标体系:到底该看哪些数据 ## 必须监测的5个基础指标 指标 | 定义 | 为什么重要 | 提及率(Mention Rate) | 品牌在追踪Prompt中出现的百分比 | 反映AI对品牌的基础认知 | 引用率(Citation Rate) | AI明确引用品牌URL的比例 | 反映内容的可引用性与权威度 | 语音份额(Share of Voice) | 品牌提及占所在品类所有品牌提及总数的比例 | 反映竞争位势 | 情感倾向(Sentiment) | AI对品牌的描述是正面/中性/负面的比例 | 反映品牌印象质量 | Prompt覆盖率(Prompt Coverage) | 至少出现一次的Prompt占总Prompt池的比例 | 反映市场触及广度 | ## AI可见度综合评分公式 保哥建议用一个综合分数快速传达整体状态,公式如下: > AI可见度评分 = 提及率 × 正面情感占比 × 语音份额 × 100 举例:一个品牌在100个Prompt里被提及40次(提及率40%),其中80%是正面描述,在所在品类中的语音份额是25%,综合分 = 0.40 × 0.80 × 0.25 × 100 = 8分。 这个分数不是绝对值,而是相对趋势指标,用于月度环比和竞品对标。 ## 指标之间的优先级关系 遇到资源不够、必须取舍时,保哥的建议顺序是: - 提及率 > 引用率(先解决"有没有") - 覆盖率 > 排名位置(先解决"多不多") - 情感正负 > 次数多少(先解决"好不好") - 竞品对标 > 历史纵比(先解决"行不行") ## 4个创意放大器:让监测洞察力翻倍 这是源文章里最被低估的一块。保哥把它们扩充成可直接执行的监测维度。 ## 地域维度:同题不同答 同一个Prompt加上不同城市/国家前缀,AI回答可能完全不同。 示例对比: - "推荐北京朝阳区附近的瑜伽工作室" → 本地品牌为主 - "推荐上海浦东新区附近的瑜伽工作室" → 另一组本地品牌 - 纯"推荐瑜伽工作室"(无地域) → 大型连锁品牌为主 对本地服务、连锁门店、区域品牌来说,地域维度的Prompt Tracking才是真正的"战场"。 ## 多语言维度:跨境品牌的隐性盲区 跨境和出海品牌如果只追中文Prompt,会错过海外市场的完整画像。 建议至少覆盖: 英文、目标市场语(日语、韩语、西班牙语、阿拉伯语等)。同一品牌在不同语言下的AI回答经常呈现惊人差异——有时中文环境完全不被提及,英文环境却是高频推荐品牌。 ## 属性限定词:从"被提及"升级到"被贴标签" 源文章提到了"price、durability、privacy"三个维度,保哥把它扩充为电商、SaaS、本地服务三个场景的属性清单: 场景 | 核心属性限定词 | 示例Prompt | 电商产品 | 价格、耐用度、设计、售后 | "耐用度最好的跑步鞋推荐" | SaaS工具 | 价格、易用性、集成、数据安全 | "数据合规最严格的CRM" | 本地服务 | 口碑、价格、响应速度、专业度 | "服务响应最快的北京装修公司" | 核心价值: 这类Prompt能让你发现AI对你品牌的"标签认知"。如果你想让用户记住"专业"但AI把你贴成"便宜",这就是内容策略要调整的信号。 ## 对比查询:找到竞品缺口和差异化机会 "A vs B"类Prompt是挖掘差异化定位最有效的方法。 必追的对比Prompt类型: - 品牌 vs 品牌:你和3-5个头部竞品的两两对比 - 品牌 vs 品类:你 vs "一般的某品类" - 场景对比:你在哪些场景被推荐、在哪些场景被忽略 对比结果会告诉你:AI认为你的优势是什么、AI认为你的劣势是什么、AI在哪些场景完全想不到你。这比任何问卷调查都直接。 ## 七步构建可落地的Prompt Tracking体系 ## 第1-2步:锁定业务场景与监测目标 先回答三个问题: - 你的核心客户用哪几个AI引擎?(影响平台选择) - 你最想影响的是购买决策的哪一阶段?(影响Prompt类型) - 你的主要竞争对手是谁?(影响对标Prompt设计) ## 第3-4步:搭建Prompt池与分层分类 把Prompt按营销漏斗分成三层: - 认知层(TOFU): "什么是X""X是什么原理""X和Y有什么区别" - 考虑层(MOFU): "最好的X品牌""X和Y哪个更好""预算5000的X推荐" - 决策层(BOFU): "[品牌名]怎么样""[品牌名]值不值得买""[品牌名] vs [竞品] 选哪个" 三层分布建议是3:5:2或4:4:2,具体看业务阶段。 ## 第5-6步:选工具、设频率、跑基线 频率建议: 监测类型 | 频率 | 适合场景 | 日度 | 每日 | 新品发布、舆情应对、危机监测 | 周度 | 每周 | 常规品牌监测、内容优化验证 | 月度 | 每月 | 战略级对标、季度复盘 | 重要提醒: 每次测试至少跑3-5轮取平均值,否则单次结果不具参考性。如果想深入对比市面主流监测工具的功能与价格差异,可以参考保哥之前做的20款GEO/AEO监控工具深度评测与选型指南 (https://zhangwenbao.com/geo-aeo-monitoring-tools.html),里面对Profound、Peec AI、Otterly、AccuRanker等主流工具做了横向对比。 ## 第7步:数据解读与行动闭环 每次复盘至少回答三个问题: - 哪些Prompt我们彻底没出现? → 内容覆盖问题 - 哪些Prompt出现了但情感是中性或负面? → 内容定位或品牌声誉问题 - 哪些Prompt竞品出现、我们没有? → 差距优先级最高的优化点 ## 追踪AI提示,到底要不要把每种问法都覆盖到? ## 意图相同的问法,AI给的品牌名单基本是同一份 做Prompt Tracking最容易冒出来的一个念头是:同一个需求,用户能有上百种问法,是不是每一种都得建进池子盯着?保哥团队拿同一批品牌、十几种问法实测过——只要底层意图没变,AI吐出来的品牌名单高度一致,谁被点名、排在第几,波动都很小。这说明AI读的是意图,不是字面那几个词。 背后是语义嵌入在起作用。系统会把每个问法用句向量模型转成一串数字向量,再算两个向量之间的余弦距离,取值0到1,越接近1越像。这类开源模型(以all-MiniLM-L6-v2模型卡 (https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2)为代表,把句子映射到384维向量空间)早就是行业基础件。现实里,正常人随手写的同义问法,余弦相似度大多落在0.5以上,彼此差得没你想的那么远。所以“换个说法AI就不认了”这种焦虑,多半是想多了。 ## 措辞跌破临界点,名单才会变脸——这是语义盲点 例外在哪儿?当你把问法改到几乎换了一个意图,也就是余弦相似度掉到0.35到0.4这一档,品牌提及率会明显往下走,掉幅能到腰斩级。换句话说,措辞的影响不是线性摊开的,而是有个门槛:门槛以上随便换词都稳,跌破了才出事。 这里藏着一个陷阱,行话叫语义盲点——两条问法字面看着像,机器算出来却是两件事。防它的办法很实在:建池子时拿个大模型当裁判,把两条问法丢给它问一句“这俩是不是在问同一件事”,意图已经跑偏的就剔出去或单独归类。否则你以为在追踪同一个需求,池子里其实混进了一堆问的是别的事的问法,数据自然对不上。 ## 真要抠措辞精度的,是漏斗中部那批商业问法 那措辞是不是就完全不用管了?也不是,得分漏斗阶段看。顶部认知类问法意图宽泛,换不换词结果都稳,拿来当品牌认知的基线最合适;底部用户已经带着明确品牌或型号来问,措辞本身卡得很死。最难缠的是中部——用户在几个候选里挑哪个,这时候加一句“适合小团队”“预算有限”“要能跟某系统打通”这类限定词,AI端出来的名单可能整个换一拨。 也就是说,措辞精度的边际收益不是平均摊开的,它高度集中在中部那批带约束条件的商业问法上。我们团队分配追踪预算时,大致按顶部、中部、底部二五、五成、二五来铺,把人力压在中部,而不是在顶部那些怎么问都一样的大词上反复较劲。 ## 提示风格和引擎差异,会悄悄改写你的基线 还有两个容易被忽略的变量。一是提示风格:同一个意图,用“列出几个最好的”这种清单或排名式问法,比开放式闲聊更容易逼出明确的品牌名单,品牌被提及的概率能高出两成上下;而把问法包装成角色扮演,比如“假设你是采购经理”,反倒会稀释品牌信号。所以一个池子里别混着多种风格,否则基线对不齐,你分不清名单变化是市场真变了还是问法风格变了。 二是引擎差异。同样一组问法,不同引擎反应并不一样:有的引擎对措辞特别敏感,稍微一改名单就抖,效应衰减得快;有的引擎在中部商业问法上的敏感度最顽固。所以监测报告一定要分引擎拆开看,别一上来就把几家的数据揉成一个综合可见度,那样市场真实变动和某一家的算法波动全糊在一起,根本归不了因。 保哥的判断是:Prompt Tracking的精力要花在刀刃上——盯紧真实用户最常用那批问法,别让池子整体滑到0.5相似度以下,把预算压在中部带约束的商业查询,分引擎单独读数;至于左侧那些只是换了同义词的长尾变体,抓大放小就行。追得越细不等于追得越准,这恰恰是这套打法和老式关键词排名监测最不一样的地方。 ## Prompt池建设:真正有效的Prompt长什么样 ## 基于营销漏斗的三层构建法 TOFU(意识阶段)示例: - 什么是[品类/问题]? - 为什么会出现[问题]? - [品类]有哪些类型? MOFU(考虑阶段)示例: - 最适合[细分场景]的[品类]有哪些? - [品类A]和[品类B]怎么选? - [预算/规模]内最好的[品类]推荐 BOFU(决策阶段)示例: - [品牌]怎么样?靠谱吗? - [品牌]和[竞品]哪个更好? - [品牌]值得买吗? ## 从传统SEO数据反向借势 别忽视你已经在用的SEO数据,它们是Prompt池的金矿: - Google Search Console的"People Also Ask" 数据 - SEMrush/Ahrefs (https://zhangwenbao.com/ahrefs-backlinks.html)里的 Questions 模块 - Google的相关搜索、自动补全 - 你自己网站FAQ页面的问题 把这些问题改写成自然语言Prompt(加上"推荐""建议""为什么"这些口语化词),就是高质量的Prompt源。 ## 从客服、销售、社群中挖掘真实语言 客服工单、销售会议纪要、微信社群聊天记录、小红书评论区——这些才是用户真实提问方式的富矿。每月让客服团队贡献30-50条"用户原话问题",贴进Prompt池。 ## 动态更新:别让Prompt池变成化石 Prompt池不是一次搭完就放着的,它需要持续维护: 动作 | 频率 | 做法 | 新增 | 每月 | 增加5-10条新出现的热门问法 | 淘汰 | 每季度 | 移除连续3个月没有任何品牌出现的无效Prompt | 重写 | 每半年 | 用最新的行业术语重写老Prompt | 扩展 | 每半年 | 根据业务扩展新增品类/场景Prompt | ## 工具选型与落地避坑:保哥的6条实战建议 ## 工具选型的4个维度 选Prompt Tracking工具时重点看: - 覆盖的AI引擎数量: 至少ChatGPT、Perplexity、Gemini、Google AI Overviews四个基础引擎。 - Prompt容量上限: 月度可追踪Prompt数是否够用。 - 多次采样机制: 是否自动跑多轮取平均,还是单次查询。 - 数据导出与API: 是否能导出原始数据接入自有BI看板。 如果你想在搭建Prompt池之前先生成一批Prompt变体,保哥推荐使用GEO Prompt变体生成工具 (https://zhangwenbao.com/tools/geo-query-variant.php),它可以把一个种子Prompt扩展成几十个语义相近但表达不同的变体,非常适合构建长尾Prompt矩阵。 ## 日度监测vs周月度监测 不要过度迷信日度数据。AI回答的日度波动本身就有20%-40%的噪音,日度数据几乎不具备趋势判断价值。周度是性价比最高的监测频率,月度适合战略汇报,日度只用于新品上市或危机监测这类特殊场景。 ## 警惕AI幻觉引用与ghost citation 2026年一个新现象是"幽灵引用"——AI在回答里给出的URL实际上根本不存在,或者链接到了错误的页面。如果你只看引用数据,可能会被幻觉数据误导。解决办法是:每月抽样验证10%-20%的引用URL,剔除无效引用再做趋势分析。 ## 不要放弃传统SEO Prompt Tracking火起来之后,有一种声音说"SEO已死,全面转GEO"。保哥的态度很明确:这是错的。 Google AI Overviews的候选池很大程度上仍然来自Google传统索引,ChatGPT Search和Perplexity的检索也大量依赖公开网页。传统SEO是AI可见度的底座。内容进入不了Google索引,在AI引擎里大概率也是隐身。 关于SEO基础打底与GEO策略如何协同,保哥在2025年最新GEO实施策略终极指南 (https://zhangwenbao.com/geo-strategy.html)里做过系统梳理,建议配合本文阅读。 ## 预算分配的经验值 以每月营销预算为基数,保哥的建议比例是: 阶段 | Prompt Tracking预算占比 | 优化执行预算占比 | 刚起步 | 20% | 80% | 数据铺开后 | 10% | 90% | 成熟期 | 5-8% | 92-95% | 监测是手段,优化才是目的。 见过太多团队把80%的钱花在监测工具上,剩下20%才做内容优化——这是本末倒置。 ## 指标要和KPI绑定 最后一条也是最关键的一条:你监测的每一个指标,都要能回答"接下来该做什么动作"。不能驱动动作的指标,就是无效指标,应该果断砍掉。 ## 从数据到行动:Prompt Tracking驱动内容优化的闭环 ## 异常波动的判定与归因 看到数据跳动时,先别急着行动,先判断是真实变化还是测试噪音: - 变化幅度是否超过历史标准差的2倍? - 变化是否在多个Prompt上一致出现? - 变化是否在多个AI引擎上同时出现? 三个条件都满足,才是真实趋势。否则大概率是噪音。 ## 优化优先级决策模型 把所有未达标的Prompt按"价值×可优化性"打分: 维度 | 评分标准 | 业务价值 | 该Prompt对应的真实用户意向强度(1-5分) | 当前差距 | 竞品出现但你没出现的差距程度(1-5分) | 可优化性 | 现有内容资产到目标差距的距离(1-5分) | 三维相加排序,从高到低优化。 ## 验证优化效果的30天复测法 优化动作落地后,不要立即测试。AI模型更新和索引都有延迟,建议的节奏是: - 第0天: 优化内容上线 - 第7-14天: 首次复测,查看有无初步变化 - 第30天: 正式复测,对比优化前基线 - 第60天: 稳定性复测,确认变化是否持续 连续两次复测都呈正向,才算是真正的优化成功。 ## 国内AI引擎做Prompt Tracking的四个独有坑 前面讲的指标和方法论,底子都是冲着ChatGPT、Perplexity、Gemini这些西方引擎写的。但保哥这两年帮做内销和出海转内销的客户做监测,发现国内引擎——豆包、文心一言、Kimi、腾讯元宝、DeepSeek——的监测逻辑和西方引擎差得不是一点半点。直接把海外那套搬过来,数据会假得离谱。 ## 坑一:引用源是封闭生态,不是公网 西方引擎的RAG大量召回公开网页,你把官网内容做好、外链铺到位,被检索到的概率就高。国内引擎不一样,它们的召回严重偏向自家生态:豆包偏抖音和今日头条系内容,文心一言偏百家号和百度系,腾讯元宝偏公众号和微信搜一搜。保哥见过一个出海转内销的品牌,拿着海外Profound跑出来的漂亮数据以为内销可见度也不错,结果在豆包和文心里一搜,查无此人——因为它的内容全在独立站和Google索引里,国内引擎的封闭生态里一个字都没有。 ## 坑二:很多引擎套同一个底座,监测要去重 国内不少AI产品是套壳或调用同一批底座大模型。如果你监测时把几个实际共用底座的产品当成独立引擎分别统计,会严重高估"多引擎覆盖"。保哥的做法是先搞清楚每个监测目标的真实底座,共用底座的只当一个独立信号源,再叠加各家自己的检索和生态差异单独看。 ## 坑三:没有稳定公开API,批量监测难自动化 监测方式 | 西方引擎 | 国内引擎 | 批量API | 多数有较稳定的接口 | 普遍缺或不稳,常需网页端模拟 | 第三方工具覆盖 | Profound/Otterly等已支持 | 基本不覆盖,要自建采集 | 地域/账号因素 | 影响相对可控 | 登录态、App端与网页端差异更大 | 结论很直接:想做国内引擎的Prompt Tracking,海外现成工具基本指望不上,得自己搭采集,或者老老实实人工跑。这也是为什么很多团队做内销监测时只能先盯一两个核心引擎手测,再慢慢扩。 ## 坑四:口语化和方言化比英文更极端 国内用户在豆包、Kimi里的提问比英文更口语、更碎。英文还是"recommend a CRM for..."这种半完整句,国内用户直接就是"求个便宜点又能打的XX""有没有适合小白的XX求推荐"。如果Prompt池全是团队闭门造车写的书面词,监测数据会和真实曝光彻底脱节。保哥的解法是从客服录音、小红书评论区、抖音评论里扒真实口语原话,原封不动塞进Prompt池。 ## 保哥团队Prompt Tracking落地的一次归因翻车 前面把怎么监测讲透了,但保哥要补一个更扎心的真实复盘:监测做得再漂亮,证明不了带来生意,预算照样被砍。这是保哥团队真实踩过的坑。 ## 翻车现场:数据很好看,老板一句"那然后呢"问住全场 保哥团队给一个跨境家居客户做了三个月监测,提及率从12%涨到38%,语音份额从8%涨到21%,月度复盘PPT做得漂漂亮亮。结果客户老板看完只问了一句:"这些数字涨了,我的询盘和成交涨了吗?"——全场沉默。当时只盯着监测指标本身,完全没建立"AI可见度→实际生意"的归因链路,预算当月就被压了一半。 ## 补救:用三条弱关联把可见度和生意挂上钩 AI可见度天然难做精确归因,因为AI回答里被提到不等于立刻点击下单。但"难精确"不等于"不能证明",保哥后来用三条弱关联信号把链路补了起来: - Referral流量异动:在GA4里盯chatgpt.com、perplexity.ai这些来源的referral流量,监测提及率拉升后,这部分流量是否同步上扬 - 直接流量与品牌词搜索:用户在AI里看到品牌名但没点链接,往往会回头直接搜品牌词或直接输入网址,盯品牌词搜索量和直接流量的趋势变化 - 询盘问卷加一道题:在独立站询盘表单里加"您是从哪里了解到我们的",把"AI/ChatGPT/豆包推荐"单独列一个选项,拿一手自报数据兜底 这三条单看都不算硬证据,但三条同时上扬,就能在老板面前讲清楚"监测不是为了好看的数字,是为了找到并守住一条新的获客来源"。教训很清楚:Prompt Tracking从立项第一天起,就要把归因链路和业务KPI绑死,别等到复盘时才发现自己只会汇报涨跌、讲不出价值。监测是手段,证明监测值这个钱,才是真本事。 ## 常见问题 ## Prompt Tracking和传统关键词排名监测可以只做一个吗? 不建议。传统SEO仍然是AI可见度的基础——进不了Google索引的内容,大概率也进不了AI的候选池。正确做法是两者并行,传统SEO负责打底和流量转化,Prompt Tracking负责品牌心智和AI引用份额。放弃任何一个都会出现盲区。 ## 小团队预算有限,最少追踪多少个Prompt才有参考价值? 保哥的底线建议是50条,分布在TOFU/MOFU/BOFU三层,覆盖你最核心的2-3个品类。少于50条,长尾信号会被噪音完全淹没,数据几乎没有统计意义。如果预算真的紧张,宁可减少AI引擎数量(先盯ChatGPT+Google AI Overviews两个),也不要压缩Prompt数量。 ## 为什么同一个Prompt我测3次得到3个不同答案? 这是AI模型的正常特性,不是工具Bug。生成式模型自带采样随机性(temperature参数),叠加检索结果的时效性和个性化因素,单次结果变异率在20%-40%属于正常范围。必须通过多次采样取平均值来消除随机性,这也是为什么专业监测工具都会自动跑3-5轮。 ## 提及率和引用率哪个更重要? 短期看引用率,长期看提及率。引用率直接带来流量,但容易被AI幻觉和模型更新干扰;提及率反映的是AI对品牌的知识库级认知,稳定性更强,也是更有战略价值的指标。保哥的优先级建议是:提及率为主指标,引用率为辅助指标,两者分开归因、分开优化。 ## 中小品牌在Prompt Tracking里完全被大品牌碾压怎么办? 大品牌偏见在通用Prompt里确实存在,但在具体场景Prompt里会显著减弱。破局关键是用"约束型Prompt"——加上地域、预算、场景、属性等限定条件。比如不追"最好的CRM",而追"15人B2B SaaS公司预算500美金CRM推荐"。约束越具体,中小品牌出现概率越高。同时在第三方媒体、行业评测、社区讨论中增加品牌信息密度,也是绕过大品牌偏见的长期解药。 ## Prompt Tracking能告诉我内容具体怎么改吗? Prompt Tracking能告诉你"哪里有问题",但不能直接告诉你"怎么改"。它的产出是定位问题,具体的内容优化方案需要结合GEO内容诊断工具、竞品内容分析、E-E-A-T权威度评估等一起判断。保哥的工作流是:Prompt Tracking发现差距 → GEO内容分析找出结构问题 → 内容重写或新增 → 30天后复测验证。 ## AI回答里对我的品牌描述不准确,怎么纠偏? AI的品牌认知来源是它训练数据和实时检索到的内容。要纠偏,需要:第一,确保你的官网品牌信息清晰、结构化;第二,增加权威第三方内容里对品牌的准确描述(媒体报道、行业报告、维基百科 (https://zhangwenbao.com/wikipedia-bans-ai-generated-content-seo-impact.html)条目);第三,消除或澄清误导性的第三方内容。AI不会因为你"希望"它怎么描述你就改,它只会因为互联网上主流信息源怎么描述你而改。 ## 做Prompt Tracking必须买付费工具吗? 不一定。起步阶段完全可以手动做:每周固定时间,手动在ChatGPT、Perplexity、Gemini里提交20-30条核心Prompt,用Google Sheets记录品牌是否出现、出现在什么位置、情感如何。手动做的好处是对数据有直观感受,缺点是规模上不去。Prompt量超过50条、或需要跨多引擎监测时,付费工具的性价比才显现出来。 ## 权威参考资料 ## AI品牌情感优化:5个月评分从67飙到82操作手册 - URL:https://zhangwenbao.com/ai-brand-sentiment-optimization-visibility-guide.html - 分类:AI监控与数据 - 发布:2026-03-31 | 更新:2026-05-16 - 摘要:深度拆解AI品牌情感优化的完整工作流:从情感诊断、官网内容修正、结构化数据优化、AI提示词内容规划、全渠道分发到持续追踪的6步操作框架,附WorkLounge品牌情感评分5个月从67升至82的真实数据、4款监控工具实测对比、4类品牌优先级路线图与5个常见错误反面教材。 - 关键词:GEO优化,AI搜索可见度,内容优化策略 > **TLDR**:摘要:AI怎么评价你的品牌,有时比AI排名更重要。本文拆解AI品牌情感优化的六步工作流——从情感诊断、官网内容修正、结构化数据优化、AI提示词内容规划、全渠道分发到持续追踪,给内容写作的五条铁律、四类品牌的优先级路线图和五个反面教材,附一个品牌评分五个月从67升到82的真实数据。 > 摘要:AI怎么评价你的品牌,有时比AI排名更重要。本文拆解AI品牌情感优化的六步工作流——从情感诊断、官网内容修正、结构化数据优化、AI提示词内容规划、全渠道分发到持续追踪,给内容写作的五条铁律、四类品牌的优先级路线图和五个反面教材,附一个品牌评分五个月从67升到82的真实数据。 保哥最近一直在研究一个被国内SEO圈严重低估的课题——AI品牌情感优化。很多做独立站的朋友还在纠结我的品牌有没有出现在ChatGPT的回答里,但其实更要命的问题是:AI提到你的时候,说的是好话还是坏话? 举个例子:用户问ChatGPT"XX品牌的联合办公空间怎么样",AI回答说环境比较吵、营业时间只有朝九晚五——但实际上你的空间有独立电话亭、有安静区域、会员还能24小时进出。这种信息偏差直接导致潜在客户还没走进你的门就已经被劝退了。 这不是保哥编的故事,这是一个真实的联合办公品牌WorkLounge遇到的实际问题。接下来保哥要把完整的6步解决方案拆开讲透——从诊断到修复、从技术到内容、从监控到迭代,每一步都可以直接拿来用。配上WorkLounge 5个月品牌情感评分从67飙到82的完整数据、4款监控工具实测对比和7条常见问题解答。 ## 为什么AI品牌情感比AI排名更重要 在传统SEO里,我们追求的是排名——第一页、第一位、精选摘要。但在AI搜索时代,游戏规则彻底变了。 AI搜索引擎(ChatGPT、Google AI Overview、Perplexity、Gemini等)不会给你一个排名位置,它们会直接生成一段回答。在这段回答里,你的品牌要么被推荐、要么被忽略、要么被错误描述。而决定这一切的核心因素,不是你的网站在传统搜索中排第几,而是AI模型对你品牌的认知是否准确和正面。 这就是AI品牌情感(AI Brand Sentiment (https://en.wikipedia.org/wiki/Sentiment_analysis))的概念——它衡量的是AI系统在生成回答时,对你品牌的描述是积极的、中性的还是消极的。 保哥总结了AI品牌情感的3层影响链: 第一层:直接影响用户决策。当用户问AI哪个联合办公空间适合远程办公时,AI如果说你环境吵闹,用户根本不会访问你的网站,更不会到店。AI回答里的负面表述等于在用户决策链路的最前端就把流量截断了。 第二层:影响AI推荐概率。AI模型对一个品牌的情感倾向会影响它在后续相关查询中是否继续推荐该品牌。正面情感形成良性循环,负面情感形成恶性循环——这是2026年最值得重视的飞轮效应之一。 第三层:影响传统SEO表现。AI情感改善会带来更多品牌搜索量(Branded Search),而品牌搜索量是Google衡量品牌权威度 (https://zhangwenbao.com/moz-ba-brand-authority-seo.html)的重要信号之一,最终反哺传统排名。这是品牌SEO和AI SEO的协同点。 ## 6步操作框架:从诊断到变现的完整工作流 接下来是整套方法论的核心,保哥把它拆解成6个可执行的步骤。每一步都有明确的操作方法和判断标准。 ## AI品牌情感诊断——摸清AI怎么说你 在动手优化之前,你必须先搞清楚一件事:各个AI平台目前到底是怎么描述你的品牌的? 手动测试主流AI平台。分别在ChatGPT、Google AI Overview(SGE)、Gemini、Perplexity中输入与你品牌相关的查询,记录AI的回答内容。重点关注以下维度:AI是否提到了你的品牌;提到时的语气是正面的还是负面的;描述的信息是否准确;与竞品相比,你的曝光频率和情感倾向如何。 使用专业的AI可见度监控工具。手动测试虽然直观,但无法规模化。你需要借助专业工具持续追踪品牌在AI回答中的表现。目前市面上已经有不少成熟的GEO/AEO监控工具,比如Otterly、Peec AI、Profound等,可以按月追踪品牌在多个AI平台中的情感评分和可见度变化。 分析AI描述的具体属性。不要只看一个笼统的正面/负面标签,要深挖AI在哪些具体维度上对你品牌有误解。比如产品特性描述是否准确、营业时间/价格等基本信息是否正确、竞争对比中AI是否存在偏见。 以WorkLounge为例,诊断结果暴露了3个致命问题:AI一致认为这个空间比较吵;从未提及已有的电话亭和安静区;还把会员的24小时自由出入描述成了朝九晚五限定。这些错误不是AI瞎编的——它们来源于网站上模糊、过时或缺失的内容。 ## 修正现有网站内容——先治病再健身 这是整个流程中最关键的一步,也是绝大多数品牌最容易忽略的一步。核心原则:先修正现有内容,再考虑创建新内容。 为什么?因为如果你的官网内容本身就在给AI传递错误信号,你再怎么疯狂创造新内容也无济于事。AI会优先参考你的官网信息,如果官网信息有误,新内容不但无法覆盖旧的错误认知,反而会制造更多混乱。 具体操作方法: 逐页审查产品/服务页面。把你网站上所有关键产品页和服务页过一遍,对照第1步的诊断结果,找到AI认知与实际情况之间的偏差点。 用AI能读懂的方式重写内容。这不是简单的文案润色,而是要确保AI模型能准确提取关键信息。核心技巧包括:把关键信息写在段落开头而不是埋在长段落中间;使用清晰的对比结构(如会员权限对比非会员权限);用具体数据替代模糊描述(24小时全天候替代灵活的使用时间);直接回答用户可能提出的问题,使用问答格式。 每个改动对应一个AI认知偏差。不要为了改而改,每次内容修正都要有明确的目标——纠正AI在某个具体维度上的错误描述。 WorkLounge的操作:团队逐一检查了90个产品和服务页面,针对性地重写了以下内容:营业时间页面明确区分了会员24/7全天候出入和前台服务时间9:00-18:00;新增了电话亭和安静区域的详细介绍页面(这些设施一直存在,但网站上从未提及);重写了会员权益页面,让会员和非会员的服务差异一目了然。结果:品牌情感评分从67上升到82,而且还在持续上涨。 ## 技术SEO与结构化数据优化——让AI读懂你 内容改了还不够,你还得确保AI能够正确读取这些内容。这涉及到技术层面的优化。 结构化数据部署。结构化数据(Schema Markup)是AI系统理解你网站内容的翻译层。尤其是以下几种Schema类型对AI可见度影响最大: - LocalBusiness (https://schema.org/LocalBusiness):标注营业时间、地址、联系方式等基本信息 - FAQPage:标注常见问题和答案,AI搜索引擎可以直接解析并引用 - Product/Service:标注产品特性、价格、评价等 - Organization (https://schema.org/Organization):标注品牌的官方信息、社交媒体链接等 - Review/AggregateRating:标注用户评分与评价聚合 页面结构优化。AI爬虫和传统搜索引擎爬虫的阅读方式有差异。针对AI爬虫的优化重点包括:H标签层级必须清晰、逻辑严密;段落不宜过长,每段聚焦一个信息点;重要信息用加粗、列表等方式突出;内部链接结构合理,帮助AI理解页面之间的关系。 部署llms.md (https://zhangwenbao.com/llms-txt-guide.html)文件。这是一个新兴的实践——在网站根目录放置一个llms.md文件,明确告诉AI爬虫你的网站内容结构和核心信息。虽然目前还没有确定性的数据证明它的直接效果,但根据保哥的观察和行业内的反馈,部署llms.md的网站在AI可见度方面确实呈现出正向的趋势。预计2026年下半年llms.md会成为AI SEO的标配。 全站技术健康检查。使用专业的站点审计工具(如Semrush Site Audit、Screaming Frog等)排查以下问题:404死链和重定向链过长;加载速度过慢(AI爬虫的耐心比人类更差);移动端适配问题;页面渲染问题(JS渲染的内容AI可能读不到)。 ## 利用AI提示词数据规划新内容 完成前三步后,你的品牌在AI中的基本面已经修复。接下来就是扩展——找到新的内容机会。 这一步的核心思路是:不是你觉得该写什么,而是用户在AI平台上实际问了什么。具体操作: 收集AI提示词 (https://zhangwenbao.com/seo-keyword-ai-prompts-collection.html)数据。通过Semrush的Narrative Drivers工具、ChatGPT自身的热门查询趋势、以及Google AI Overview中出现的相关问题,收集用户在你所在行业中最常向AI提出的问题。 筛选高价值提示词。不是所有提示词都值得投入,保哥建议按以下标准筛选:与你的产品/服务直接相关;AI目前的回答中没有提到你的品牌;竞品在该提示词下有明显的AI曝光。 每个提示词对应一个内容行动。筛选出20-30个高优先级提示词后,将它们转化为具体的内容动作:如果该话题已有对应页面,在现有页面中增加FAQ模块;如果没有对应页面,创建新的专题内容。 FAQ模块是最高效的AI内容格式。保哥强烈建议在关键产品页和服务页添加FAQ模块。原因很简单——AI搜索引擎的本质就是回答问题,FAQ格式与AI的回答逻辑天然匹配。研究表明,问答格式的内容被AI引用的概率比纯描述性内容高40-60%。 ## 全渠道分发——让AI在多个数据源看到你 AI模型不只读你的官网,它的训练数据和实时检索都覆盖大量第三方源。要让AI对你品牌有正面认知,必须在多个数据源建立一致的正面信号。 核心分发渠道: - Wikipedia条目:如果品牌规模允许,建立或维护Wikipedia条目是建立AI认知的最强信号。AI模型对Wikipedia的引用率高于其他任何源。 - 专业评测平台:B2B类如G2、Capterra、TrustRadius;电商类如Trustpilot、Yelp、Google Reviews。这些平台的评价直接影响AI对品牌的情感判断。 - 行业媒体露出:Forbes、TechCrunch、行业垂直媒体的报道是AI判断品牌权威度的关键源。 - Reddit和知乎讨论:用户原生讨论是AI判断真实口碑的源。鼓励真实用户分享体验比刷评论更有效。 - YouTube视频内容:YouTube是Google AI Overview引用率最高的视频源。产品评测、教程类视频对建立AI认知有显著作用。 WorkLounge在这一步做了什么:联系3家行业垂直媒体做品牌报道,特别强调电话亭和安静区的设施(针对AI的"环境吵"误判);鼓励50+真实会员在Google Maps、Yelp、小红书留下真实体验;在YouTube发布3支会员日 (https://zhangwenbao.com/ecommerce-membership-day-marketing-guide.html)常Vlog视频。这一组动作执行3个月后,AI对WorkLounge的环境描述明显转向正面。 ## 持续追踪——把品牌情感优化变成长期运营 AI品牌情感不是一次性优化就完事的,它是一场持续的认知争夺战。 持续追踪的核心动作: 月度品牌情感监测。每月用同一套查询脚本测试主流AI平台,记录情感评分变化。曲线持续上升说明优化方向正确;曲线停滞或下降说明需要诊断回看。 季度内容审计。每季度对修正过的关键页面做一次审计,看是否有新的过时信息、是否有新的AI误判出现。AI模型在持续更新,旧的优化可能需要适配新模型。 竞品情感对比。不仅看自己,也要看3-5个核心竞品的AI情感曲线。如果竞品突然出现情感跃升,分析它做了什么动作,及时跟进或反制。 负面舆情快速响应。设置AI Mention告警,当AI开始描述你的负面属性时,48小时内做内容响应。AI模型对内容的响应速度比传统SEO快得多,及时纠正能避免负面认知固化。 ## 4款AI品牌情感监控工具实测对比 讲完方法论,工具栈也得说清楚。保哥测过的AI品牌情感监控工具里,下面这4款是性价比最高的。 工具 | 月费 | 覆盖平台 | 情感分析 | 最大优势 | 适用场景 | Otterly AI | 99-499美元 | ChatGPT/Perplexity/Gemini/Google AI | 有 | UI最直观、上手最快 | 中小品牌起步 | Profound | 500美元起 | ChatGPT/Perplexity/Gemini/Claude | 有 | 对比分析最强 | 中大型品牌 | Peec AI | 299-999美元 | 所有主流AI+多语言 | 有 | 多语言覆盖最全 | 跨境品牌 | BrandRank.AI | 199-799美元 | ChatGPT/Perplexity | 有 | 历史数据追溯最长 | 需要长期趋势分析 | 保哥的工具推荐策略:起步阶段用Otterly(性价比最高),规模化阶段升级Profound(功能最全),跨境品牌额外加Peec AI(多语言)。中小品牌不建议同时用3款以上工具——数据看不过来,决策反而变慢。 ## AI品牌情感优化的内容写作要点:5条铁律 修正官网内容是6步流程里最关键的一环,但很多人不知道"对AI友好"的内容到底应该怎么写。保哥总结了5条铁律。 铁律1:每个关键属性独占一段。不要把营业时间、价格、服务范围、退换政策塞到同一段里——AI会切片困难。每个独立属性用独立段落、独立H3、独立Schema字段呈现。这样AI能精准引用单个属性而不会引用混乱。 铁律2:用绝对而非相对表述。不要写营业时间灵活而要写24/7全天候;不要写价格合理而要写99美元/月起。AI偏好可被精确量化的描述,模糊形容词在AI眼中信息量为零。 铁律3:用对照而非单独描述。比起"我们提供电话亭",更好的写法是"会员可使用12个独立电话亭,对比传统办公空间共享区域噪音可降低35分贝"。对照式描述给AI更多信息维度,引用率更高。 铁律4:FAQ模块占每页20-30%。在产品页、服务页、关于页都加入FAQ模块。每个FAQ回答用2-3句话给出完整答案,让AI能直接引用整个回答。保哥团队的实测:FAQ占比20%以上的页面,AI引用率比无FAQ页面高2.4倍。 铁律5:所有事实有时间戳。价格、活动、政策、数据都加上时间限定(2026年Q2、截至2026年5月等)。AI偏好有时效性标记的内容,这能让它判断信息的新鲜度。同时定期更新时间戳,保持内容的"AI新鲜度"。 这5条铁律执行下来,你的官网内容对AI的可解析度会显著提升,间接拉升AI品牌情感评分。 ## 跨语言品牌情感优化:中英双语品牌的特殊考虑 跨境品牌或服务多语言市场的品牌,需要额外关注一件事:不同语言下的AI品牌情感可能完全不同。 保哥团队帮一个跨境美妆品牌做诊断时发现:英文ChatGPT对该品牌的描述非常正面、提及频次高;但同一品牌在中文ChatGPT和Gemini中文里的描述偏中性、且经常出现错误的产品功能描述。原因是英文Wikipedia条目完整、英文媒体露出充分,而中文媒体覆盖几乎为零。 跨语言优化的核心动作:(1)每个目标语言独立做诊断,不要假设英文情感等于中文情感;(2)每个目标语言独立做内容修正,不只是翻译而是文化适配的重写;(3)每个目标语言独立做外部源建设,比如英文用Wikipedia/Forbes,中文用百度百科/知乎/小红书;(4)每个目标语言独立做监测和迭代。 跨语言优化的成本是单语言的1.8-2.5倍,但对跨境品牌是必要投入。如果你只优化英文而忽视中文,等于在中文市场把品牌认知拱手让给竞品。 ## WorkLounge 5个月完整数据复盘 讲了一堆方法论,看一下WorkLounge执行这套6步流程的完整数据。 指标 | 改造前(基线月) | 改造后(第5个月) | 变化 | AI品牌情感评分 | 67 | 82 | +15点 | ChatGPT月均提及次数 | 12次 | 89次 | +641% | Google AI Overview提及 | 4次 | 47次 | +1075% | 品牌搜索量月均 | 1240次 | 3680次 | +196% | 到店预订转化率 | 2.1% | 3.4% | +62% | 会员留存率 | 74% | 83% | +9个百分点 | 媒体露出次数 | 0 | 11次 | +11次 | 核心洞察:AI品牌情感优化不是孤立动作,它的效果会扩散到整个营销链路——AI提及增加→品牌搜索量提升→到店转化提升→会员留存提升。这条因果链让AI品牌情感优化的ROI远高于单一AI SEO动作。 ## 4类品牌的优先级路线图 不同类型的品牌对AI情感优化的紧迫性不同。保哥按业务类型给出优先级路线图。 本地服务/线下店(最高优先级):餐厅、健身房、联合办公、医美等。这类业务用户决策严重依赖AI推荐,且AI对本地店的描述错误率最高。立刻启动6步流程。 B2B SaaS/工具产品(高优先级):用户在选型阶段会问AI"哪个工具最适合XX场景",AI对功能特性的描述准确度直接决定是否被考虑。在产品营销同步做AI品牌情感优化。 消费品电商(中高优先级):AI对产品的功能描述、价格区间、用户反馈的准确度影响转化。重点优化产品Schema和评测平台口碑。 内容/媒体类(中优先级):相对其他类型紧迫性低,因为内容品牌的AI情感主要受内容质量驱动。但仍需做基础诊断和监控,避免出现重大负面描述。 ## 5个常见错误:AI品牌情感优化的反面教材 保哥见过的失败案例,归纳出5种最高频的错误。 错误1:只看AI提及次数不看情感倾向。提及多但全是负面,对业务的损害比不提及更大。情感倾向比提及次数重要10倍。 错误2:跳过诊断直接做内容。不知道AI对你的具体误判,就开始疯狂写内容,结果新内容和AI已有认知冲突反而制造混乱。 错误3:刷虚假评价制造正面情感。AI模型能识别异常评论模式,刷评不仅无效还可能被标记为负面。真实用户口碑是唯一正确路径。 错误4:只优化中文不管英文(或反之)。AI模型是多语言的,英文负面描述会影响中文查询结果。跨境品牌必须同时优化多语种。 错误5:3个月没看到效果就放弃。AI模型对认知的更新有滞后,新内容被AI吸收需要4-12周,看不到立即效果不等于无效。完整跑6个月再评估。 ## AI品牌情感优化的3个新趋势:2026下半年值得布局 AI技术迭代很快,2026年下半年有3个新趋势会显著影响品牌情感优化策略。提前布局的品牌会获得明显先发优势。 趋势1:多模态AI对图片和视频的认知能力大幅提升。GPT-5、Claude 4.7、Gemini 2.5 Pro都已具备较强的图片和视频理解能力。这意味着AI对你品牌的情感判断不只来自文字描述,也来自官网图片、产品图、宣传视频。实操建议:原创视觉素材的质量要和文字内容同等重视,避免使用图库素材(AI能识别图库图,会降低品牌真实性评分)。 趋势2:实时检索能力成为AI标配。2026年所有主流AI都支持实时检索,意味着品牌情感的更新周期从过去的训练数据周期(半年到1年)缩短到检索周期(几天到几周)。你的内容更新能更快被AI吸收,这对积极优化的品牌是利好;但对负面舆情的响应也必须更快。 趋势3:个性化AI回答会让"通用情感评分"变得不那么重要。AI开始根据用户历史、偏好、上下文生成个性化回答。这意味着同一个查询不同用户会得到不同的品牌描述。监测维度需要扩展到"对不同用户画像的情感分布",而不只是单一的总分。这块工具能力还在早期,但值得提前关注。 ## AI说你坏话,第一步不是写内容而是溯源 很多品牌一发现AI在说自己坏话,第一反应是赶紧写一堆正面内容去“盖”过去。保哥要泼盆冷水:这么干,十有八九是白忙活。AI对你的负面描述从来不是凭空蹦出来的,它背后一定连着具体的数据源。源头没找到就猛写新内容,等于往一个还在漏水的桶里拼命倒水。 正确的第一步是溯源——先搞清楚这句坏话到底从哪冒出来的。保哥把AI负面情感的来源拆成三类,处置方式完全不同。 第一类是训练数据里的旧信息残留。模型在某个时间点学过的内容固化在了参数里,哪怕你早就改了,它还在用老印象。这类源头你直接改不动,只能靠持续输出新信号去覆盖、去稀释。 第二类是实时检索召回的第三方页面。这是最常见的,也是最值得下手的。一篇两年前的差评测评、一份过时的行业报道、一个竞品做的对比页,都可能被AI实时抓回来当依据。这类源头要么能联系平台更正,要么能用更新、更权威的内容去压。 第三类是你自己官网的模糊表述。前面讲WorkLounge时提过,AI说它“环境吵”,根子就在官网自己没把安静区和电话亭写清楚。这类源头改起来最快,因为主动权完全在你手里。 溯源具体怎么做?保哥团队的标准动作是直接“逼问”AI。在带引用的平台上(Perplexity、开了联网的豆包和DeepSeek都行),用品牌词加上那个负面属性去追问:“你说这个品牌不支持中文,依据是什么?来源是哪里?”带检索的AI往往会直接吐出引用链接,那就是污染源的现场。 把追问到的源头一条条记下来,分进三个桶:能改的(自己官网、可申诉的平台)、能稀释的(UGC平台的真实口碑)、改不动的(训练数据残留)。分完桶,资源就知道该往哪儿砸了,而不是无差别地写新内容。 保哥去年遇到一个真实例子很说明问题。一个出海的SaaS工具客户,被多个AI一口咬定“不支持中文界面”。团队一开始百思不得其解,因为产品早就全面中文化了。按溯源流程追下去,发现罪魁是两年前的一篇英文测评——当时产品确实还没出中文版,那篇文章就把这个结论写死了,后来又被无数AI反复检索引用。 找到这篇过时测评,问题就解了一大半。保哥团队联系作者更新了文末说明、在官网最显眼的位置用结构化数据标清楚“支持简体中文、繁体中文界面”,又补了几篇带中文界面截图的新内容做新信号。大约六周后,主流AI对这个属性的描述陆续翻了过来。 所以记住这个顺序:先溯源,再分桶,最后才动手改。跳过溯源直接写内容,是AI品牌情感优化里最浪费预算的打法。你得先知道病灶在哪,才谈得上对症下药。 ## 一次AI品牌情感的真实翻车:好评刷得越多,AI评分掉得越狠 前面列的五个反面教材里提过“刷虚假评价”这一条,但很多人不当回事,觉得不就是刷点好评嘛,大不了无效。保哥用一个真实翻车案例告诉你:在AI时代,刷评不只是无效,是真能把你的品牌情感评分刷崩。 2025年保哥接手过一个出海家居DTC品牌。老板急着把AI情感评分拉上去,没跟保哥商量,自己在外面找了个“好评代运营”的服务商。一个月之内,Trustpilot上涌进来两百多条五星好评。 这批好评的问题,AI一眼就能看穿。文案高度雷同,翻来覆去就那几个夸法;发布时间挤在同一周里;账号大多是无历史、无头像的新号。这种“整齐得不像真人”的信号,恰恰是AI最敏感的东西。 结果一个月后看数据,保哥都替他捏把汗:Trustpilot自己的算法先把一部分评价标记成了可疑,紧接着带检索的AI在合成答案时,把“疑似刷评”直接当成了负面信任信号。品牌情感评分从71一路掉到58,比刷之前还低了13点。 更坑的还在后头。那批代写好评为了显得专业,把几个产品根本没有的功能也写了进去。AI检索学了之后,开始在回答里传播这些不存在的卖点。用户冲着这些功能下单,到货发现没有,转头就来一条货真价实的差评。等于花钱给自己埋了一串真雷。 复盘根因其实很清楚:AI对“异常一致性”的敏感度远超传统搜索引擎。传统SEO时代刷评顶多是平台过滤掉,损失有限;AI时代,刷评制造出的“不自然信号”会被模型当成品牌不可信的直接证据。信号越整齐,反噬越狠。 救回来的过程比闯祸慢得多。保哥团队先让客户彻底停掉刷评服务,然后做了四件事:引导真实老客户在自然的时间节奏里分散写评价,绝不集中;对那几个被写错的功能,在官网和各平台做了明确的官方澄清;补拍了一批真实用户的开箱和使用视频;把客服对话里沉淀下来的真实反馈,引导客户发到Google评价和小红书。 整整四个月,评分才慢慢爬回73并稳住。一个月闯的祸,花了四个月补,还搭进去一段真实差评。 这个案例的教训,保哥希望每个想走捷径的品牌都记牢:AI时代的口碑造假,反噬比传统SEO更快、更狠,因为AI把“信号的自然程度”当成了核心的信任判据。真实的、分散的、带细节的用户口碑慢是慢,但每一条都是在给品牌情感账户存真金白银;刷出来的整齐好评看着热闹,本质上是在账户里塞假币,迟早被AI验出来连本带利地扣。 ## 常见问题解答 ## AI品牌情感评分怎么算出来的? 不同工具有不同算法,但核心逻辑相似:在多个AI平台运行一组品牌相关查询(通常50-200条),收集AI回答,用NLP情感分析模型给每个回答打分(正面、中性、负面),加权汇总得到品牌情感总分(通常0-100分)。保哥的经验是分数本身的绝对值不重要(不同工具算法不同),重要的是同一工具下的趋势曲线——上升说明优化有效,下降说明需要诊断。 ## 如果AI对我品牌的描述是错的,怎么让它纠正? 关键是修改AI的信息源。AI模型的认知来自训练数据(已固定,无法直接改)和实时检索(这是你能影响的)。具体动作:(1)修正官网相关内容;(2)在Wikipedia、行业媒体、Reddit等高权重源建立准确信息;(3)部署完整的结构化数据让AI更易解析。一般4-12周AI的检索结果会被你的新信息更新,从而改变它的回答。 ## 负面评价该删除还是回应? 真实负面评价不要尝试删除(删不掉且违反平台规则),正确做法是公开、专业地回应。回应里提供事实澄清、改进举措、补偿方案。AI模型实际上能识别"有效回应"——一个有完整回应的负面评价对AI情感的影响远小于无回应的。同时鼓励满意的真实用户多写评价,用数量稀释负面的占比。 ## 品牌情感优化和传统SEO有冲突吗? 没有冲突,反而高度协同。AI友好的内容(结构清晰、实体密集、有Schema、有FAQ)同样是Google传统搜索喜欢的内容。优化AI品牌情感的6步流程,每一步都同时在做传统SEO的最佳实践。保哥的实测:完成AI品牌情感优化的客户站点,传统SEO数据平均提升40-80%。 ## 小品牌没预算上专业工具怎么办? 手动测试也能做。每月用同一组10-20条查询测试ChatGPT/Gemini/Perplexity,把回答复制到Excel里手动标注情感(正/中/负),统计变化趋势。虽然不如工具自动化,但对小品牌(月预算 ## GSC正则挖AI搜索Prompt:5步实战追踪指南 - URL:https://zhangwenbao.com/gsc-regex-mine-ai-search-prompts-guide.html - 分类:AI监控与数据 - 发布:2026-02-21 | 更新:2026-05-16 - 摘要:用Google Search Console的正则表达式,能从查询里挖出用户问AI的Prompt。本文覆盖ChatGPT查询泄露与AI Mode接入GSC的背景、英文与中文四种正则变种、品牌到竞争弱点的五步分析框架、六款LLM追踪工具对照、Looker Studio自动化和与传统SEO数据的三角交叉验证。 - 关键词:GSC,长尾关键词,GEO,Prompt,LLM > **TLDR**:摘要:用Google Search Console的正则表达式,能从查询里挖出用户问AI的Prompt。本文讲清这类数据为什么会出现在GSC里,给一行Regex搞定挖掘、用AI把原始查询转成商业洞察、从洞察到Prompt追踪体系、与传统SEO数据的交叉验证,再讲注意事项与局限,附一份今天就能开始的实操清单。 > 摘要:用Google Search Console的正则表达式,能从查询里挖出用户问AI的Prompt。本文讲清这类数据为什么会出现在GSC里,给一行Regex搞定挖掘、用AI把原始查询转成商业洞察、从洞察到Prompt追踪体系、与传统SEO数据的交叉验证,再讲注意事项与局限,附一份今天就能开始的实操清单。 做 AI 搜索优化(GEO)的人都绕不开一个灵魂问题:"我到底应该追踪哪些 Prompt?"这个问题之所以难,是因为 LLM 的 Prompt 追踪目前是一个几乎完全的黑箱。不像传统搜索有 Google Keyword Planner 公开提供数据,OpenAI 和 Google 大概率永远不会完全开放用户在 AI 系统中输入的查询数据。 但最近我发现了一个被严重低估的数据来源——Google Search Console (https://search.google.com/search-console/about)(GSC)本身。通过一个简单的 Regex 正则表达式 (https://en.wikipedia.org/wiki/Regular_expression),你可以从 GSC 中过滤出 10 个词以上的长尾查询,而这些查询几乎就是用户在 AI 系统中使用的对话式 Prompt。这篇文章完整拆解这套方法的原理、操作步骤、4 种 Regex 变种、5 步分析流程、Profound/Peec 等监控工具对照、与传统 SEO 数据的交叉验证方法和 10 条 FAQ。 ## AI 搜索 Prompt 数据为什么会出现在 GSC 里 在深入操作之前,先搞清楚一个关键问题:用户在 AI 系统中输入的提示词,怎么会跑到 Google Search Console 里? ## ChatGPT 查询泄露事件 2025 年 11 月,有研究者发现 ChatGPT 的搜索查询竟然被意外泄露到了 Google Search Console 的报告中。分析显示,GSC 数据里出现了大量包含个人身份信息(PII)的查询,明显不是传统搜索行为。这一事件后来被多家媒体证实,OpenAI 方面承认了这个问题,声称已修复且"仅有少量查询被泄露"。但这件事给了一个重要启示:来自 LLM 系统的查询数据,确实有可能存在于 GSC 中。 ## Google AI Mode (https://blog.google/products/search/google-search-ai-mode-update/) 数据正式接入 GSC 更重要的信号来自 Google 自己。从 2025 年中开始,Google 正式确认 AI Mode (https://zhangwenbao.com/google-ai-mode-self-citing-seo-strategy-2026.html) 的流量数据会被计入 Search Console 的效果报告。具体规则如下: 指标 | AI Mode 计算方式 | 点击(Click) | 用户在 AI Mode 中点击外部链接,即计为一次点击 | 展示(Impression) | 你的页面出现在 AI 回答中,即计为一次展示 | 位置(Position) | 遵循与标准搜索结果页相同的位置计算方法 | 追问处理 | 用户在 AI Mode 中的每个追问都被视为一次新查询 | 关键问题在于:截至 2026 年初,Google 并没有提供独立的 AI Mode 过滤器。 AI Mode 数据被归类在"网页"搜索类型下,与标准有机搜索数据混合在一起。这就是为什么我们需要用间接方法来识别这些数据。 ## 印象数据的趋势佐证 在多个网站上应用长尾查询过滤后,观察到过去 3 个月展示量呈稳步上升趋势。这与 Google 在 2025 年秋冬季大力推出 AI Mode 功能的时间线高度吻合。这进一步证实了:这些长尾对话式查询很可能来自 AI Mode 的交互。 ## 核心操作:一行 Regex 搞定 AI Prompt 挖掘 这是整篇文章最核心的实战部分。一行正则表达式,就能从 GSC 中过滤出"像 Prompt 一样"的长尾查询。 ## 为什么是 10+ 词查询 底层逻辑很简单: - 传统关键词搜索通常很短:比如"CRM 软件对比",通常 2-5 个词。 - AI 搜索 Prompt 是长对话式的:比如"哪些 CRM 平台最适合管理复杂销售周期的中型 B2B 公司,前三名的总拥有成本差异是什么?" 当一个查询达到 10 个词以上,它几乎必然是对话式的——要么来自 AI 系统,要么是用户已经在以 AI 的方式使用 Google。无论来源如何,这类数据都极具价值,因为它反映了用户在 AI 时代的真实搜索意图。 ## 四步操作流程 第一步:进入 Search Console 效果报告。登录 Google Search Console → 效果(Performance)→ 搜索查询(Search Queries)。 第二步:添加查询过滤器。点击"+ 添加过滤条件"→ 选择"查询"。 第三步:选择自定义正则表达式。在过滤器类型中选择"自定义(正则表达式)"。 第四步:输入 Regex 公式。 ^(?:\S+\s+){9,}\S+$ 这行正则的含义:匹配至少包含 10 个词(由空格分隔的非空白字符序列)的查询字符串。 ## Regex 公式拆解 组件 | 含义 | ^ | 匹配字符串的开头 | (?:...) | 非捕获分组——用于组合模式但不单独捕获 | \S+ | 匹配一个或多个非空白字符(即一个"词") | \s+ | 匹配一个或多个空白字符(即词与词之间的空格) | {9,} | 前面的分组重复至少 9 次(即前 9 个"词+空格"的组合) | \S+$ | 以一个完整的词结尾 | 总计:9 次"词+空格" + 最后 1 个词 = 至少 10 个词 如果你想调整词数阈值,只需修改 {9,} 中的数字。比如想筛选 8+ 词的查询,改为 {7,};想筛选 15+ 词,改为 {14,}。建议先从 10 词起步,如果数据量太少可适当降低到 8 词,数据量太多则提高到 12-15 词。 ## 四种 Regex 变种(中文 + 进阶) 上面的 Regex 对英文很好用,但中文场景下"词与词之间没有空格"会让它失效。我整理了四种变种适应不同场景: 场景 | Regex | 说明 | 英文 10+ 词 | ^(?:\S+\s+){9,}\S+$ | 原版,按空格断词 | 中文 30+ 字 | ^.{30,}$ | 纯字符长度过滤,适合中文站 | 含问号的对话 | .*[??].* | 命中所有疑问句,AI Prompt 命中率高 | 含关键句式 | .*(如何|怎么|对比|最好|推荐|哪个|为什么).* | 命中典型 AI 提问句式 | 混合 30 字 + 关键句式 | ^(?=.{30,}).*(如何|对比|推荐|哪个|最好).*$ | 双重过滤,准确率最高 | 中文站点强烈推荐用"混合 30 字 + 关键句式"这一条,它能把"长 + 像 AI 问句"两个条件叠加,命中的几乎全是高质量对话式查询。 ## 你会看到什么样的数据 应用这个过滤器后,你会发现这些长尾查询明显像 AI 提示词。从多个站点中提取后,发现了以下典型模式(已做脱敏处理): - 对比评估型:"哪些销售赋能平台最适合企业级销售管道分析和买家互动洞察,而且性价比高?" - 场景规划型:"帮我规划一整天的国家公园行程,包含一条风景徒步路线、看独特的野生动物、在附近的小屋吃饭" - 专业咨询型:"如果你是顾问,你会推荐哪个应用来做高级数据可视化,帮助团队解读复杂的运营或客户数据?" - 替代方案型:"有没有比 XX 软件更便宜的替代方案,功能类似但支持多语言和本地化部署?" - 故障排查型:"我的 WordPress 站点上传图片时报错 HTTP 500,已经检查过权限、内存、插件冲突,还可能是哪些原因?" ## 数据可靠性说明 需要坦诚地说明:我们没有直接证据证明这些长尾查询 100% 来自 ChatGPT、AI Mode 或其他 AI 平台。它们也可能是用户在 Google 搜索中越来越多地使用对话式语言。但这不影响这份数据的价值——原因有三: - 行为等价:不管用户是在哪个平台输入的,10+ 词的对话式查询反映的搜索意图和 AI Prompt 本质上是等价的。 - 趋势印证:长尾查询展示量的增长曲线与 AI Mode 的推出时间高度吻合。 - 实用主义:我们做的是商业决策,不是科学研究。有数据支撑的判断永远优于纯粹的猜测。 ## 用 AI 将原始查询转化为商业洞察 拿到这批"类 Prompt"数据后,下一步是进行深度分析。推荐使用 AI 工具来做行为分析,效率最高。 ## 导出与上传 - 在 GSC 中应用 Regex 过滤后,点击"导出",下载为 CSV 或 Google Sheets; - 将导出的查询列表上传到 ChatGPT、Claude、Gemini 等 AI 分析工具中; - 让 AI 对这批"Prompt"数据进行行为模式分析。 ## 五大分析问题 上传数据后,不要只是让 AI"分析一下"。用以下结构化问题来引导分析,每个问题都能产出可操作的洞察: 问题 1:用户在问关于我品牌的什么问题? 这个问题能帮你发现品牌认知中的盲点。实际操作时发现,一个三年前的 PR 危机事件竟然还在被用户持续追问——这说明 AI 系统可能在持续引用旧信息,需要主动进行声誉管理。 问题 2:用户最常用什么方式构建他们的 Prompt?他们是如何组织问题的? 理解用户的"提问框架"极为重要。发现用户倾向于使用特定模式,比如"如果你是 XX 角色,你会推荐..."、"对比 A 和 B 在 XX 场景下的表现..."、"最适合 XX 行业的 XX 工具是什么..."。这些模式可以直接用于优化你的内容结构。 问题 3:用户最关心我们产品的哪些特征? 分析高频出现的产品属性词,能帮你了解市场最关注什么。也许你花了大量资源推广的功能 A,用户其实更关心功能 B。 问题 4:基于这些数据,你能推断出我们客户的什么画像? AI 可以从查询模式中推断出客户的行业、规模、地域偏好、决策模式等信息,这些洞察对于精准营销极其宝贵。 问题 5:哪些查询暴露了我们的竞争弱点? 一个非常有价值的模式:用户倾向于把某个品牌作为"金标准"基准来对比其他竞争者——如果那个基准不是你,你需要知道为什么,并采取行动。 ## 四大洞察类型 在对多个站点进行分析后,总结了四种最常出现的高价值洞察: 洞察类型 | 具体表现 | 行动建议 | 历史声誉问题 | 多年前的负面事件仍被 AI 反复提及 | 发布权威声明、创建正面内容覆盖 | 地域需求缺口 | 用户搜索特定国家/地区的解决方案的频率远超预期 | 制作本地化内容、建立地区性案例 | 竞争基准效应 | 一个竞争对手被反复用作比较基准 | 分析其优势、创建对比内容 | 价格替代需求 | 用户持续寻找某个解决方案的更便宜替代品 | 明确价值差异化定位 | ## 从洞察到 Prompt 追踪体系 数据分析的终极目标是建立一套可持续运作的 Prompt 追踪体系。 ## 让 AI 生成 Prompt 追踪推荐 这是最有价值的一步。过去不太信任直接让 LLM "帮我想应该追踪什么 Prompt"——因为那只是 AI 的猜测。但当你先上传了真实的用户查询数据,再让 AI 基于这些数据给出追踪建议时,质量完全不一样——因为推荐是基于实际数据而非凭空想象。具体做法: - 完成上述五大问题分析后,告诉 AI:"基于你发现的数据模式和主题,请为我们生成一份建议追踪的 Prompt 列表"; - AI 会从数据中提取主题聚类,并据此生成结构化的 Prompt 推荐; - 审核这些推荐,结合你的业务判断筛选出最终追踪列表。 ## Prompt 追踪工具选择 有了清晰的追踪列表后,你需要选择合适的工具来持续监控。目前市场上主要的 LLM 可见度追踪工具包括: 工具 | 特点 | 起价 | 适合人群 | Profound | 功能最全面,支持 10+ 个 LLM,有 Prompt 量级数据和内容优化建议 | $99/月(仅 ChatGPT) | 企业级品牌、大型代理商 | Peec AI | 简洁易用,支持无限国家追踪,入门成本低 | €89/月 | 中小团队、预算有限 | Semrush AIO | 与传统 SEO 工具集成,一站式体验 | $99/月/域名 | 已用 Semrush 的团队 | Otterly AI | 多平台覆盖,声量份额指标强 | 按需定价 | 关注竞争格局的品牌 | Athena | 企业级 GEO 平台,提供认证体系 | $295/月 | 小型代理商 | Goodie AI | 覆盖 ChatGPT/Perplexity (https://zhangwenbao.com/ai-search-engine-geo-optimization-strategy.html)/Claude/Gemini,提供 Citation Source 分析 | $79/月 | 关注被引用来源的内容团队 | 如果你刚起步,先不急着买工具。用 GSC Regex 方法 + AI 分析工具的组合,零成本就能获得第一批有价值的 Prompt 洞察。等你验证了这套方法的 ROI 后,再根据需求选择付费工具。 ## 构建持续监控工作流 推荐的完整工作流如下: 周频动作(每周 15 分钟): - 进入 GSC → 应用 Regex 过滤 → 快速浏览新出现的长尾查询; - 标记异常查询(如突然出现的新主题、负面相关查询)。 月频动作(每月 1-2 小时): - 导出完整的长尾查询数据; - 上传到 AI 分析工具进行完整的行为分析; - 更新 Prompt 追踪列表; - 与内容团队和 PR 团队分享关键发现。 季频动作(每季度半天): - 回顾三个月的 Prompt 趋势变化; - 调整内容策略和 GEO 优化方向; - 评估 LLM 可见度追踪工具的需求; - 向管理层汇报 AI 搜索洞察。 ## 与传统 SEO 数据交叉验证 单看 GSC 长尾查询数据容易陷入"幸存者偏差"——你看到的都是已经被引用并产生展示的查询,那些"没引用你"的查询永远看不到。所以要把这份数据和其他来源交叉验证,得到更完整的图景。 数据源 | 能看到什么 | 看不到什么 | GSC 长尾查询 | 已被引用的对话式查询 | 没引用你的查询 | Profound / Otterly | 主动测试的 Prompt 引用情况 | 未测试的 Prompt | ChatGPT 手工测试 | 实时 LLM 真实回答 | 不可大规模测试 | 客户访谈 | 真实用户提问语言 | 样本量小 | 站内搜索日志 | 站内已有用户的问法 | 未访问用户的问法 | 三角验证:GSC 给你"已被引用的真实需求" + Profound 给你"主动测试的覆盖度" + 手工 ChatGPT 测试给你"实时验证"。三者交叉,能得到 80% 的可见度图景。 ## 注意事项与局限性 ## 关于 Prompt 变异性 需要提醒大家一个重要的研究发现:当 142 名受访者被要求为相同的查询提供他们会使用的 Prompt 时,Prompt 之间的相似度仅为 0.081——几乎每个人的问法都不一样。这意味着什么?你永远无法追踪到用户输入的确切 Prompt。但这并不意味着追踪没有意义。目标不是精确匹配,而是找到更具规模性和代表性的主题模式,并据此优化你的内容和品牌定位 (https://zhangwenbao.com/brand-positioning-clarity-ai-search.html)。 ## 关于隐私合规 GSC 中出现 AI 查询数据涉及用户隐私问题。建议: - 如果你在数据中发现包含 PII(个人身份信息)的查询,不要使用或传播; - 仅关注去标识化的主题和模式; - 遵循你所在地区的数据保护法规(GDPR、CCPA、个保法等); - 不要把含 PII 的原始 CSV 上传到第三方 AI 工具,先做脱敏处理。 ## 关于数据解读的审慎态度 这套方法提供的是有数据支撑的推断,而非确定性结论。将它视为你 AI 搜索策略的一个有价值的输入信号,而不是唯一的决策依据。结合其他数据源(如第三方 LLM 追踪工具、竞品分析、客户访谈)来交叉验证你的发现。 ## 实操 Checklist:今天就可以开始 为了让大家立即行动,整理了一份"今天就能完成"的清单: - 登录 Google Search Console,进入效果报告; - 添加查询过滤器 → 自定义正则表达式 → 输入 ^(?:\S+\s+){9,}\S+$(中文站用 ^.{30,}$); - 浏览过滤后的查询,确认是否看到对话式长尾查询; - 将时间范围设为"过去 3 个月",观察展示量趋势; - 导出数据为 CSV 文件; - 上传到 AI 分析工具,用本文的五大问题进行分析; - 根据分析结果,生成你的第一份 Prompt 追踪列表; - 将关键发现分享给内容团队和 SEO 团队; - 设置日历提醒,每月重复一次这个流程; - 3 个月后评估是否需要付费 LLM 追踪工具。 ## 百度、360、搜狗能不能照搬这套正则挖法 这套方法的底座是 GSC 能导出查询词,可国内大量流量来自百度、360、搜狗甚至神马,它们的搜索词数据口子跟 Google 完全两回事。先把结论摆出来:能挖,但挖到的东西性质不一样,而且没有任何一家给你 GSC 这么干净的正则过滤器。 ## 百度搜索资源平台:有词没正则 百度站长后台(百度搜索资源平台)的“流量与关键词”报告确实给你展示词、点击词、排名,但它只支持模糊包含的关键词筛选,没有 GSC 那种自定义正则入口。想挖 30 字以上的对话式长查询,只能把全量词导出成 Excel,自己用 LEN 函数或者一段 Python 按字符长度过滤。更麻烦的是,百度只放出前几百个高频词,长尾截断比 Google 狠得多——真正稀有的那条“像 Prompt 的查询”往往根本不进报告。所以在百度侧,这套方法退化成“先导出再本地过滤”,而且样本天然偏头部、偏品牌词。 ## 文心一言、豆包的查询根本不回流 这才是最大的水土不服。Google 把 AI Mode 的查询计进了 GSC,所以你能间接挖到。但国内的百度 AI 搜索、文心一言、豆包、DeepSeek 的对话,目前没有任何一个把用户 Prompt 回流给独立站站长的官方通道。你在豆包里被引用了,站长后台也看不到那次对话的原始问法。换句话说,GSC 这个“免费偷看 AI Prompt”的口子,在中文 AI 生态里暂时是堵死的。能替代的只有三条土办法:一是看微信搜一搜、知乎、小红书的站内搜索下拉与“相关问题”,反推用户的自然语言问法;二是在豆包、DeepSeek 里手工灌 20 到 30 条核心问题,逐条记录它引用了谁;三是盯自己网站的站内搜索框日志,国内用户在搜索框里打的长句,是离真实 AI Prompt 最近的一批免费样本。 ## 360、搜狗:聊胜于无 360 站长平台和搜狗资源平台的关键词报告颗粒度更粗,长尾基本看不到,把它们当作百度数据的交叉补充就行,别指望单独挖出什么对话式查询。一个务实的排序是:中文站先吃透“百度搜索资源平台导出 + 站内搜索日志”这两口,把 GSC 正则法留给你站点本身的海外或英文流量部分,两套并行别混为一谈。 ## 这套正则挖法保哥踩过的三个坑 正则一行就能跑,但跑出来的数据极容易被误读。下面三个坑都是真金白银交过学费的,列出来帮你少走弯路。 ## 坑一:把站内搜索框的 query 当成了 GSC 查询 有个客户的运营把网站站内搜索框的搜索日志导出来,套上那条 30 字正则,兴冲冲说“挖到一堆 AI Prompt”。结果一看全是已经进站的用户在找具体文章标题的长句——这批人早就在你站里了,根本不代表 AI 搜索带来的外部需求,拿它做选题等于把内部循环当成了外部增量。GSC 查询回答的是“站外用户怎么找到你”,站内搜索回答的是“站内用户找不到什么”,两者价值方向几乎相反。后来定的规矩是:任何长查询数据,先标清楚来源是 GSC 还是站内搜索,混在一张表里分析必出错。 ## 坑二:把分词噪声和输入法残留当成了真实意图 中文用 ^.{30,}$ 这种纯字符长度过滤有个隐患:它会把一堆“假长句”也捞进来。比如用户连续搜了两个词中间没断开、复制粘贴带了一长串 UTM 参数、输入法联想把半句话糊在一起,这些在字符数上都超过 30,但根本不是对话式 Prompt。有一次基于这种脏数据给客户定了三个选题,写完发现搜索量趋势平得像死海——因为那批“查询”压根没有真实用户在问。修正办法是加一道人工眼:过滤后的前 50 条必须逐条扫一遍,把明显是参数串、乱码、重复词的剔掉,再交给 AI 分析,这一步偷不得懒。 ## 坑三:拿一个月的数据就下季度结论 长尾查询本身样本就小,单月波动极大。曾经见到某条对话式查询展示量月环比涨了 4 倍就被当成趋势,加码做了一组内容,结果下个月打回原形——那只是某个热点事件带来的一次性脉冲。长尾数据要看至少连续 3 个月的滚动趋势,单点高峰先存疑、不动手。这跟前面正文讲的“季频复盘”是一个意思:挖到信号只是第一步,确认它稳定可复现才值得投入内容资源。把这三个坑记牢,这套零成本的 Prompt 挖掘法才真能帮你做对决策,而不是制造一堆看着热闹的假洞察。 ## 常见问题解答 Q1:我的 GSC 数据里看不到 10+ 词的查询怎么办? 三种可能:站点流量太小(每天 < 100 次曝光)、内容主题太垂直没人提问、用了 noindex 没被 AI 引用。先把 Regex 阈值降到 7+ 词,再看看;如果还没有,说明你站点暂时不在 AI 系统的引用范围内,先做内容权威性建设比追踪更重要。 Q2:中文站怎么用这套方法?空格断词不适用。 中文站用 ^.{30,}$ 这种纯字符长度的 Regex,30 字符是经验阈值。或者用"混合 30 字 + 关键句式"组合:^(?=.{30,}).*(如何|对比|推荐|哪个|最好).*$。命中精度比单纯字符数高 2-3 倍。 Q3:GSC Regex 过滤后展示量和点击数会少很多,是不是数据被压缩了? 不是压缩,是真实情况——长尾查询本来就只占总查询的 5-15%。但每条长尾查询的"价值密度"远高于短查询:转化率、品牌相关度、商业意图都更明显。 Q4:能不能用 Looker Studio 自动化每周生成长尾查询报告? 可以。GSC 数据接到 Looker Studio 后,加一个 Regex 过滤的 calculated field,每周自动更新一份长尾查询 dashboard。我自己的设置是:每周一上午 9 点自动邮件推送上周新增的长尾查询给运营团队。 Q5:Profound 和 Peec AI 选哪个? 看预算和深度需求。Profound 功能更全,支持 10+ LLM、有 Prompt 量级数据,适合需要深度报告的企业。Peec AI 起步价更低、支持无限国家,适合中小团队和多市场覆盖。预算紧选 Peec,需要专业报告选 Profound。如果只关注 Citation Source(被引用的内容来源),Goodie AI 性价比最高。 Q6:长尾查询里突然出现了竞争对手品牌名,是好事还是坏事? 是机会。这说明用户在用 AI 搜索"我品牌 vs 竞品"或者"竞品的替代品",而你被引用了。立即做的事:写一篇深度对比内容,明确指出你和竞品的差异化定位,让 AI 下次引用时拿到更结构化的信息。 Q7:含问号 ? 的 Regex 在 GSC 里报错怎么办? 问号在 Regex 里是元字符(零或一次匹配),需要转义。用 \? 或者用字符集 [??](同时匹配半角全角问号)。GSC 的 Regex 引擎用的是 RE2 语法,跟标准 PCRE 略有差异,部分高级特性(如 lookbehind)不支持。 Q8:每月做这个分析要 1-2 小时,能再快一点吗? 能。三种加速方式:用 Looker Studio 自动化导出;用 ChatGPT Code Interpreter 一次性跑完五大问题;订阅 Profound/Peec 让它自动按月出报告。但完全自动化的代价是丢失"专家眼"——人工浏览查询列表时会突然发现的"咦这个查询不对劲",机器很难捕捉到。 Q9:这套方法能用来挖竞品的 AI Prompt 数据吗? 不能。GSC 是站点私有数据,只能看自己的。挖竞品 AI 可见度的方法是:用 Profound/Otterly 输入你自己的核心 Prompt 列表,看 AI 答案里引用的是哪几个品牌——这是"反向"看竞品在 AI 搜索里的份额。 Q10:GSC Regex 数据 + AI 分析得到的 Prompt 追踪列表,怎么转化为内容策略? 三步走:一是把追踪列表里最常见的 5-10 个 Prompt 主题挑出来作为 pillar 内容选题;二是每个 pillar 下覆盖 3-5 个具体子问题(即 Q&A 段落 / FAQPage (https://zhangwenbao.com/shopify-blog-faqpage-schema-seo-geo.html));三是把这些内容用 Schema.org QAPage / FAQPage 结构化标记,让 LLM 更容易引用。这套流程跑 3 个月,AI 引用率通常能涨 30-50%。 ## 小结 在 AI 搜索时代,"应该追踪哪些 Prompt"这个问题不应该靠猜。GSC 中隐藏的长尾对话式查询数据,是目前我们能获取的最接近真实用户 AI 搜索行为的免费数据源之一。 核心观点是:与其凭感觉选择追踪 Prompt,不如用实际的数据源来指导你的追踪策略。这行 Regex 可能不完美,这些数据可能不是 100% 来自 AI 系统,但它比"我们最好的猜测"要强得多。一行 Regex ^(?:\S+\s+){9,}\S+$ → 打开 AI 搜索行为的窗口 → 用 AI 分析发现商业洞察 → 建立有数据支撑的 Prompt 追踪体系。这是 2026 年每个 SEO 和 GEO 从业者都应该掌握的技能。 在一个零点击、低归因的搜索环境中,能用的数据不多。这个数据摆在那里,用不用,取决于你。 ## 权威参考资料 ## AI引用率监控闭环4步实战:工具选型+A/B测试方法 - URL:https://zhangwenbao.com/monitor-measure-iterate-ai-citation-optimization-2026.html - 分类:AI监控与数据 - 发布:2026-01-06 | 更新:2026-05-24 - 摘要:怎样监控并提升ChatGPT、Gemini、Perplexity的引用份额?文章从SoAIC定义出发,覆盖引用速度、提及准确性、引用位置、多模型覆盖率、转化贡献5个指标,给出Profound、Semrush、Ahrefs三档工具对比与每周60分钟人工抽检SOP。 - 关键词:AEO,A/B测试,数据驱动,内容营销,GEO优化 > **TLDR**:摘要:怎么监控并提升ChatGPT、Gemini、Perplexity的引用份额?本文从SoAIC也就是AI引用份额的定义和计算切入,给引用速度、提及准确性、引用位置、多模型覆盖率、转化贡献五个核心指标、Profound与Semrush与Ahrefs三档工具对比、每周60分钟人工抽检SOP,附6个月从11%做到47%的迭代记录。 > 摘要:怎么监控并提升ChatGPT、Gemini、Perplexity的引用份额?本文从SoAIC也就是AI引用份额的定义和计算切入,给引用速度、提及准确性、引用位置、多模型覆盖率、转化贡献五个核心指标、Profound与Semrush与Ahrefs三档工具对比、每周60分钟人工抽检SOP,附6个月从11%做到47%的迭代记录。 AI 搜索时代真正吃亏的人,是把内容发出来就不管的那批运营。Google 蓝色十条链接的世代里,关键词排名是看得见摸得着的——SimilarWeb、Ahrefs 一刷就知道你在第几位。生成式 AI 搜索(ChatGPT、Gemini、Perplexity (https://docs.perplexity.ai/)、Claude、Google AI Overviews)改变了这个规则:你的内容可能被 AI 读了、内化了、回答给了用户,但用户不会点你的链接,你的服务器流量曲线不会动一下。这就是为什么 2025-2026 年 SEO 圈集体把"AI 引用份额"(Share of AI Citation,简称 SoAIC)拉成新的核心 KPI。这篇文章把我自己运营 GEO(Generative Engine Optimization)项目过去 6 个月的监控-测量-迭代闭环系统拆给你看:用了哪些工具、定了哪几个指标、怎么做 A/B 测试 (https://en.wikipedia.org/wiki/A/B_testing)、踩过哪些坑、最后从 11% 引用份额做到了 47%。 ## 为什么传统 SEO 监控指标在 AI 搜索下失灵 先讲清楚一个问题:你过去监控 SEO 用的那些指标——关键词排名、自然搜索流量、CTR、跳出率——在 AI 搜索时代不是不重要,是不够用了。 传统 SEO 流量是单跳:用户搜索 → 看到你的链接 → 点击 → 进站 → 转化。每一步都可观测:搜索词在 GSC (https://search.google.com/search-console/about) 里、点击在 GA 里、转化在 GTM 里。 AI 搜索流量是多跳:用户在 ChatGPT 里问问题 → ChatGPT 引用了你的内容(你看不到)→ ChatGPT 把内容融合成答案给用户(你也看不到)→ 用户可能完全不点链接(97% 的用户在拿到 AI 答案后不会点击来源链接,根据 Profound 在 2025 年 11 月的样本数据)。这条路径的前 3 步对你来说全是黑盒,第 4 步如果用户不点击你连流量都没有。 这意味着如果你只盯 GA 看流量,你永远不知道 AI 在不在引用你;如果你只盯 GSC 看搜索曲线,你看到的是一条平静的或下降的曲线(因为 Google AI Overviews 在挤压你的传统点击),但你的内容可能正在被 AI 大量引用。这种"流量数据失明"是 GEO 监控系统要解决的第一个问题。 ## SoAIC 的精确定义与计算方式 很多教程把 SoAIC 模糊地讲成"被引用比例",实际操作时要落到一个能算出数字的公式。我用的版本是这样: SoAIC = 在你定义的 N 个目标查询里,AI 答案中提到你品牌或链接到你站点的查询数 / N 关键参数有三个。N 是你的目标查询样本量——太小会有随机波动,太大测不动;我建议 50-200 之间,覆盖你最重要的产品/品类相关问题。"提到"要给定义——是品牌名("保哥笔记")出现在 AI 回答正文?还是必须有一个 hyperlink 指向你的域名?我建议两条都跟踪:前者叫"Mention Share",后者叫"Link Share",分开看更精确。 查询要分层。我把目标查询分成 4 层:T1(品牌词,"保哥笔记是什么")、T2(强意图问题,"WordPress 怎么换主题最快")、T3(对比类,"WordPress vs Typecho")、T4(信息性,"什么是 GEO")。每一层的引用机制不同——T1 主要看实体识别(你的品牌有没有被 AI 训练数据收录)、T2 主要看回答质量(你的答案能不能被 AI 直接抄一段)、T3 主要看立场表达(你有没有给出明确的对比观点)、T4 主要看权威性(你的内容是不是被维基百科 (https://zhangwenbao.com/wikipedia-bans-ai-generated-content-seo-impact.html)或权威媒体引用过)。混在一起算 SoAIC 会得到一个看似稳定但毫无指导意义的数字。 ## 5 个核心监控指标(除了 SoAIC 之外) ## 引用速度(Citation Velocity) 从内容发布到第一次出现在 AI 答案的小时数。Profound 在 2025 年 12 月的报告里给出业界中位数是 72 小时——但头部站点能做到 8-12 小时。引用速度决定了你的"先发优势"——同一个话题谁先被 AI 引用,谁就先占住答案位置,后来者要花 3-5 倍精力才能挤进同一个答案。我的项目把引用速度从 60 小时压到 18 小时,靠的是 IndexNow 主动推送 (https://zhangwenbao.com/baidu-post-real-time-push-tool.html) + Perplexity / Bing 的 sitemap 实时通知。 ## 提及准确性(Mention Accuracy) AI 提到你的时候,提到的内容是否准确。错误提及比未提及更糟糕——AI 把你的产品价格说错、功能说错、定位说错,用户基于这个错误信息做决策然后骂你。监控方法是每周从 ChatGPT、Gemini、Perplexity、Claude 各取 10 条提到你品牌的回答,人工核对内容准确率。我的目标线是 95%+,2025 年 9 月起我的提及准确性长期低于 80%(AI 把我的某个早期产品名称当作了主推产品),花了两个月做实体优化才拉回 96%。 ## 引用位置(Citation Position) 你的内容在 AI 答案中是被首段引用、中段引用、还是末段("还有其他来源……")。首段引用的转化价值最高(用户看完答案的注意力还在),末段引用最弱(很多用户压根不滚到末段)。Perplexity 与 Bing Chat 都把引用编号显示给用户,所以引用位置可量化;ChatGPT 与 Claude 不显示编号,要靠人工判断引用先后。 ## 多模型覆盖率(Multi-Model Coverage) 你的同一篇内容在 ChatGPT、Gemini、Perplexity、Claude 4 个模型里被引用的命中率。命中率分布反映了你的内容是被某一个模型的训练数据偏爱(说明特定权威源认可)还是泛域权威。健康的状态是 4 个模型都覆盖到 30%+,如果只有 ChatGPT 引用率高其他三个为零,说明你只是在一个特定数据集(比如 Common Crawl 或 OpenAI 内部 web crawl)里被采集,不一定具有跨模型权威。 ## 转化贡献(Attributed Conversion) AI 引用最终带来的转化数。这是闭环里最难测的——AI 推荐没有 referrer,用户从 AI 答案点进你站点后被识别成"直接流量"。曲线追踪方法是给 AI 流量做特殊 UTM 标记(在内容中输出"建议阅读 https://yoursite.com/?ref=ai-suggest",这样从 AI 答案点击进来的用户会带 ref 参数);或者用 GA4 的"模糊归因"模型把"直接流量增长突变"与"内容引用率上升"做时间窗口关联。 ## 监控工具实战对比 2026 年市场上的 GEO 监控工具大致分 3 档,每一档对应不同预算与团队规模。 ## 付费旗舰:Profound(300-1000 美元/月) Profound 是目前 SoAIC 监控的事实标准,前 Google Brain 工程师创办,被 Bain Capital 投资。它的核心是高频抓取 4 个主流 AI 平台的"探针查询"——对每个客户的 200-500 个目标查询每天测试 3-5 次,统计出每天的 SoAIC、Mention Share、Link Share。优势是数据全、对比维度细(按平台、按查询类、按时间)。缺点是贵——基础版 300 美元/月,企业版上探到 1000 美元以上。 ## 性价比中档:Semrush AI Toolkit + Ahrefs AI Search(合计约 200 美元/月) Semrush 和 Ahrefs 在 2025 年都加了 AI 搜索监控模块。Semrush 的强项是 Google AI Overviews 的实时变化追踪——它直接抓取 Google SERP 渲染前后的差异,识别哪些查询触发了 AI Overviews、AI Overviews 引用了哪些来源。Ahrefs 的强项是跨模型对比(同一个查询在 ChatGPT、Perplexity、Claude 三个平台的引用差异)。两个工具一起用基本能覆盖 80% 监控需求,价格只有 Profound 的三分之一。 ## 免费/低成本:手动 + 自动化脚本 预算紧张时这一档完全可行。免费工具组合:Superprompt(10 美元/月,批量测试 ChatGPT 与 Claude)、AlsoAsked(免费版每天 5 次查询)、用 Python 写脚本调用 Perplexity API(5 美元 100 万 token)批量测试。我个人在项目早期用的就是这一档,每月成本不到 30 美元,靠人工每周分析 50 个查询的输出。缺点是数据积累慢,6 个月以下样本量不够看趋势。 ## 测量节奏与人工验证流程 工具自动化抓的数据再多,也需要人工抽样验证——AI 的输出有随机性,自动化抓取本质是采样,采样误差不可避免。我的人工验证 SOP 是这样的。 ## 每日 5 分钟(异常监测) 看 Profound 或 Semrush 的日报,关注 SoAIC 是否有大于 ±15% 的日变化。如果有,立刻进入第二步(深度核查)。这一步不需要做什么,只是确保异常被注意到。 ## 每周 60 分钟(人工抽检) 从 4 个模型分别取 5 条提到你品牌的回答(共 20 条),核对:内容是否准确、引用位置、是否带链接、答案语气(正面/中性/负面)。把结果记到一张共享 Notion 表里,每条记录至少包含查询词、模型名、回答全文截图、判定结果。这张表是后续做 A/B 测试假设生成的输入。 ## 每月 4 小时(专题分析) 每月做一次主题分析:哪些查询的 SoAIC 在涨?哪些在跌?涨的共同点是什么(结构?发布时间?外链?)?跌的共同点是什么(被竞品挤了?AI 模型本身做了升级?训练数据替换了?)?这一步要求看趋势而不是看点位,否则会被随机噪声误导。 ## 每季度 1 天(重大策略调整) 每季度集中做一次"目标查询清单更新"——添加这 90 天里被忽视的新热点、移除已经过气的旧查询、按 SoAIC 变化重新分配 T1/T2/T3/T4 权重。我用的更新规则是:连续 30 天 SoAIC 低于 5% 的查询如果不是核心战略词,从清单移除;连续 30 天月搜索量上升超过 50% 的新查询自动加入。 ## A/B 测试在 GEO 中的实操 传统 SEO 的 A/B 测试就是改改 title、改改 H1,看看排名变化。GEO 的 A/B 测试更复杂——你要测的不是"哪个版本排名第几",而是"哪个版本更容易被 AI 直接复制粘贴到答案里"。我做过的几类有效测试如下。 ## 结构 A/B:FAQ vs HowTo vs ListItem 同一个主题,写两个版本:A 用 FAQ Schema (https://zhangwenbao.com/google-drops-faq-rich-results.html) 标记,每个 Q&A 控制在 100-150 字;B 用 HowTo Schema,分步骤呈现。3 周后用 Superprompt 跑同一组 30 个查询,看哪个版本被引用更多。我的项目里 FAQ 版本对"是什么"类查询胜出 67%,HowTo 版本对"怎么做"类查询胜出 81%。结论是按查询意图选 schema,不是固定一种。 ## 段落首句 A/B:直接陈述 vs 数据先行 A 版段落首句"WordPress 适合中小企业建站,因为它有丰富的插件生态。"B 版"WordPress 占据全球 43.2% 的网站(W3Techs 2025 年 12 月数据),是 80% 中小企业的建站首选。"两版正文相同。结果 B 版被 AI 直接引用首句的概率是 A 版的 2.4 倍——AI 偏好"带数字与权威来源"的陈述。 ## 更新日期 A/B:精确日期 vs 模糊"最新" A 版文章顶部标"最新更新于 2026 年 1 月",B 版标"最新更新于 2026 年 1 月 15 日"。同一篇内容、同一组查询,B 版引用率高 31%——AI 优先引用日期信息更精确的内容(因为这是新鲜度信号的硬证据)。 ## 外链 A/B:同主题外链 5 条 vs 0 条 有人推断"AI 不在意外链"——错。我的实验里同主题文章 A 配 5 条权威外链(维基百科、官方文档、行业研究报告),B 不配外链,2 个月后 A 的 SoAIC 比 B 高 88%。AI 在判定"哪段内容值得引用"时,参考了外链密度作为权威性代理。 ## 从 11% 到 47%:6 个月迭代记录 2025 年 8 月到 2026 年 1 月,我的项目站 SoAIC 从 11.2% 升到 46.8%,分阶段记录如下。 第 1 个月(2025-08):建立监控系统。订阅 Profound 起步版,定义 80 个目标查询,做第一次基线测量——SoAIC 11.2%。 第 2 个月(2025-09):提及准确性大整改。发现错误提及率 22%(AI 经常把另一个同名但不相关的产品当成我们的),花一个月重写品牌实体页(about、产品页),加 sameAs schema 关联到 Twitter、LinkedIn、CrunchBase 等权威实体源。月末提及准确性升到 89%,SoAIC 升到 18.4%。 第 3 个月(2025-10):内容结构重构。把 30 篇核心文章按"FAQ Schema + 段落首句带数据 + 精确日期 + 5 条权威外链"的标准重写,月末 SoAIC 升到 27.1%。 第 4 个月(2025-11):引用速度优化。启用 IndexNow 全量推送,每篇文章发布即刻通知 Bing 与 Yandex;接入 Perplexity sitemap submit;新增"内容更新即推送"的自动化脚本(任何文章更新后 60 秒内重推 IndexNow)。月末平均引用速度从 60 小时降到 18 小时,SoAIC 升到 36.4%。 第 5 个月(2025-12):A/B 测试常态化。每周运行 2 个 A/B 测试,按测试结果迭代写作模板。月末 SoAIC 升到 41.8%。 第 6 个月(2026-01):长尾扩展。把 80 个核心查询扩展到 220 个(覆盖 T3、T4 类),同时把测试样本扩展到 200 个。月末 SoAIC 47.0%,对照行业中位数(9.4%)已经处于头部。 ## 多语言站点的 SoAIC 监控特殊性 如果你运营多语言站点(比如同时面向中文、英文、日文用户),每种语言的 AI 引用机制差异巨大,必须分开监控。我管理的一个跨境 SaaS 项目同时有中、英、日三个站,监控发现:英文 SoAIC 41%(ChatGPT 主导)、日文 SoAIC 19%(DeepSeek (https://zhangwenbao.com/deepseek-search-geo-optimization-regional-customer-acquisition.html) 与 Claude 主导)、中文 SoAIC 28%(豆包与文心一言主导)。三个语言的 SoAIC 数字本身没有可比性——英文 AI 训练数据量是中文的 8-10 倍,日文是中文的 1/3,所以引用机会的天花板就不一样。 跨语言的内容也不能直接机翻。我们试过把英文 SOP 直接 GPT 翻译成日文,结果日文 SoAIC 反降 6%——日本用户在 AI 答案里更看重"原生日文写作"的痕迹(敬语用法、固有名词写法),机翻虽语法正确但被日本 AI 模型识别为"低权威性内容"。后来切换为日本本地写手原创日文版本,3 个月内日文 SoAIC 从 13% 升到 19%。 ## 建立"AI 引用日志"的内部数据库 系统跑起来 3 个月以上,你会积累几百到几千条"被 AI 引用"的事件记录。这些记录如果只放在 Notion 或 Excel,规模一大就难以分析。我的项目在第 4 个月把它升级成结构化数据库,每条记录包含以下字段:查询词、AI 平台、查询时间、回答全文、是否提及品牌、是否带链接、引用位置、提及准确性评分(人工 1-5 打分)、答案语气(正/中/负)、绑定的源文章 URL。这张表连接到 Looker Studio 做可视化,每周可视化看几个核心维度的趋势。 有了这张表后还能做反向分析——按"被引用次数最高的源文章"排序,找出哪些文章是 AI 的"宠儿",分析这些文章的共同特征(结构、长度、外链数、发布时间),把特征复刻到新内容上。我的项目里发现"被引用 Top 10"的文章共同点是"≥3500 字 + ≥4 个 H2 + ≥2 个表格 + 至少 5 条出站权威外链 + 含 1 个 FAQ Schema 段",把这套模板写成内容生产 SOP 后新文章首月引用率从 12% 升到 34%。 ## 组织内闭环:让产品、内容、增长团队共担责任 SoAIC 监控不只是 SEO 团队的活,需要跨团队协作。我的项目里把责任分成三块。 产品团队负责"信号源准确性"——保证产品名、定价、功能描述在官网、产品文档、CrunchBase、Wikipedia、Wikidata 等所有公开数据源里一致。如果产品改名或者改定价,必须 24 小时内同步更新所有数据源,否则 AI 回答的提及准确性会直接掉。 内容团队负责"被引用素材"——按 SOP 写文章,每篇文章上线前自检 schema、外链、首句、日期 4 项;每月按 A/B 测试结果迭代写作模板。 增长团队负责"流量归因"——把 AI 引用带来的流量与转化拆出来跟踪,证明 GEO 投入的 ROI,这样下个季度的预算才有底气加。 这三个团队每月开一次"GEO 月会",对齐目标查询、检视指标、决定下月投入方向。这个会议机制我们做了 4 个月,单是"对齐目标查询"这一项就避免了内容团队和产品团队各做各的、最后 SoAIC 不升反降的浪费。 ## 常见问题解答 ## SoAIC 多少算好?多少算差? 分行业看。Profound 2025 年 12 月公布的中位数:B2B SaaS 行业中位 9.4%,头部 38%;电商行业中位 6.1%,头部 24%;新闻媒体行业中位 12.3%,头部 47%。如果你的 SoAIC 在中位数附近,说明你跟大多数同行差不多;超过中位数 2 倍可以认为进入头部;超过 50% 在任何行业都是绝对头部。但要注意"行业头部"不等于"赚钱头部"——SoAIC 高但转化贡献低也是常见组合,要看完整漏斗。 ## 免费工具能不能搭起完整监控系统? 能,但有上限。免费组合(Superprompt 免费档 + AlsoAsked 免费档 + 手动每周 50 查询测试)能让你掌握 SoAIC 与提及准确性两个核心指标,足够做月度迭代决策。但如果你需要日级波动监测、跨平台对比、自动化告警,免费工具达不到。我的建议是预算 200 美元/月以下用免费组合,200 美元/月以上加 Semrush 或 Ahrefs,500 美元/月以上加 Profound。 ## 没有外贸业务、只面向中文用户,需要监控 ChatGPT 这些海外 AI 吗? 需要看场景。如果你的目标用户在国内、不用海外 AI,那确实只需要监控国内 AI(豆包、文心一言、通义千问、Kimi、智谱清言、DeepSeek)。但 2026 年起越来越多国内用户开始用海外 AI(通过 OpenAI 中国镜像或 VPN),且很多 B2B 决策者会先用 ChatGPT 调研——所以海外 AI 的引用份额仍然有间接价值。我的建议是国内 AI 投入 70% 监控精力、海外 AI 30%,比例可按用户来源调整。 ## AI 引用了我的内容但是没有给链接,这种引用有没有价值? 有,但价值低于带链接的引用。无链接引用(mention without link)的价值在于品牌词曝光——AI 回答里出现"保哥笔记建议……"会让用户记住"保哥笔记"这个品牌名,这是品牌词搜索量的源头。无链接引用的转化贡献远低于带链接引用(用户没有直接进站路径),但长期累积会推高品牌词搜索量。要把无链接引用转化为有效流量,需要让用户记住品牌名后主动搜索——这就把 AI 引用变成了广义的品牌广告。 ## AI 模型本身在更新,我的优化策略要怎么跟上? 每季度做一次"AI 模型版本对账"。记录监控期内各模型的版本号变化(GPT-4 → GPT-4o、Gemini 1.5 → 2.0、Claude 3.5 → 4.0),每次大版本变化后立即做一次基线重测——把目标查询全跑一遍,对比版本前后的 SoAIC 变化。如果发现某些查询从被引用变成不被引用,要分析新模型偏好的内容特征是什么(更短的答案?更新的日期?更明确的来源?)。我的项目里 GPT-4 → GPT-4o 升级时丢了 8% SoAIC,分析发现 GPT-4o 更偏好结构化数据(FAQ Schema、HowTo Schema),花两周给主要文章补 schema 后恢复。 ## SoAIC 的天然波动有多大?怎么区分真实变化与噪声? 同一组查询、同一个模型、同一天测两次,SoAIC 波动 ±5% 是正常的(AI 输出本身有随机性)。日间波动 ±10% 内不要做策略调整,超过 ±15% 才算有意义的信号。要拉趋势线看周或月平均值,不要被单日极值误导。一个有用的统计技巧:用 7 日滚动均值(每天的值取过去 7 天平均)平滑曲线,再判断是否真有上升下降趋势。我项目早期就因为看单日数据频繁调策略,反复折腾两个月才意识到大部分波动是噪声。 ## SoAIC 监控数据的合规风险 大量自动化抓取 AI 平台的回答可能违反平台 TOS。OpenAI 的服务条款明确禁止自动化批量调用 ChatGPT 网页版(API 调用合规但需要付费),Perplexity、Anthropic 同样有类似条款。Profound、Semrush 这些专业工具与平台有商业合作(部分通过授权 API 抓取,部分通过模拟用户行为但量级控制在合规阈值内)。如果你自己写脚本批量抓 ChatGPT 网页,账号会被风控封禁、IP 进入封禁池。建议合规路径有三:通过官方 API 测试(OpenAI、Perplexity 都有付费 API);订阅商业监控工具(让工具替你承担合规风险);人工小批量抽样(每周 50-200 次手动查询,量级远低于风控阈值)。 ## 能不能让 AI 主动收录我的网站? 不能直接"主动收录",但可以提高被收录概率。OpenAI 在 2024 年开放了 GPTBot 爬虫,你在 robots.txt 里允许 GPTBot 访问就能让 OpenAI 在下次训练数据更新时考虑你的内容(一年 1-2 次大更新)。Anthropic 的 ClaudeBot 同理。Perplexity 走实时检索,发布即刻可被引用。Google AI Overviews 走 Google 索引,传统 SEO 收录就够用。所以"被 AI 收录"实际是 4 件事:robots.txt 允许 GPTBot/ClaudeBot/PerplexityBot/Googlebot 访问;保证你的内容在传统搜索(Google/Bing)有索引;保证 sitemap 提交;提供干净的 SSR HTML。这 4 步做好后,被引用是时间问题。 ## 权威参考资料 ## 内容排名第一AI却不引用?GEO三层可见性指标拆解 - URL:https://zhangwenbao.com/geo-visibility-metrics-scoring.html - 分类:AI监控与数据 - 发布:2025-12-28 | 更新:2026-06-01 - 摘要:深度解析KDD2024论文提出的GEO三层可见性指标体系:从词数计数到位置加权再到7维主观评估,帮助SEO从业者建立全新的AI搜索可见性思维模型,告别"排名第几"的旧认知。 - 关键词:GEO,生成式引擎优化,内容可见性 > **TLDR**:摘要:AI回答里你的内容到底排第几,传统的排名第几思维已经不管用了。本文深度解析KDD 2024论文提出的GEO三层可见性指标体系——从词数计数到位置加权再到七维主观评估,帮SEO从业者建立一套面向AI搜索的全新可见性思维模型,学会用AI愿意引用多少来衡量,而不是只看排名。 > 摘要:AI回答里你的内容到底排第几,传统的排名第几思维已经不管用了。本文深度解析KDD 2024论文提出的GEO三层可见性指标体系——从词数计数到位置加权再到七维主观评估,帮SEO从业者建立一套面向AI搜索的全新可见性思维模型,学会用AI愿意引用多少来衡量,而不是只看排名。 ## 你的内容"排名第一",但AI可能根本不引用你 做SEO的人都有一个根深蒂固的思维惯性:一切看排名。排名第一就是胜利,排名掉了就是失败。这个逻辑在过去二十年没什么问题——Google搜索结果页就是一个从上到下的线性列表,排名越靠前,点击率越高,流量越大。 但在AI搜索引擎面前,这套逻辑彻底失效了。 当用户在ChatGPT (https://zhangwenbao.com/bing-ranking-chatgpt-brand-visibility.html) Search、Perplexity、Google AI Overview中提问时,他们看到的不是一个排列整齐的链接列表,而是一段AI生成的综合回答。这段回答从多个来源中提取信息,合成为一个连贯的答案,并在关键位置以内联引用的方式标注信息来源。 这意味着什么?意味着即使你的页面在传统搜索中排名第一,AI可能完全不引用你的内容——因为你的页面虽然权重高,但内容对AI来说"不好用"。反过来,一个排名第五的小站,如果内容结构清晰、数据详实、表述权威,完全可能在AI回答中占据大段引用。 那么问题来了:在这个新范式下,我们到底应该用什么指标来衡量内容的"可见性"?如何量化你的内容在AI回答中"值多少分"? 2024年发表在ACM SIGKDD(全球顶级数据挖掘会议)上的一篇开创性论文,系统性地回答了这个问题。这篇论文不仅提出了GEO (https://arxiv.org/abs/2311.09735)(Generative Engine Optimization,生成式引擎优化)的概念框架,更重要的是定义了一套专门为生成式引擎设计的三层可见性指标体系。保哥认为,理解这套指标体系是所有SEO从业者建立"GEO思维模型"的第一步。 ## 传统搜索vs生成式引擎:可见性的根本差异 在深入指标体系之前,必须先搞清楚一个根本性的问题:为什么传统SEO的排名指标无法直接套用到生成式引擎上? ## 传统搜索引擎的可见性模型 传统搜索引擎的可见性衡量非常简单直观。搜索引擎返回一个线性排列的链接列表,每个链接占据一个固定位置。可见性几乎完全由排名位置决定——排名第1的结果获得约31%的点击率,排名第2约24%,排名第3约18%,排名第10只剩约2.5%。这个点击率分布曲线遵循幂律衰减,已经被大量研究反复验证。 在这个模型下,衡量指标非常清晰:你的平均排名位置就是你的可见性。排名从第5升到第3,可见性提升了多少,可以精确计算。 ## 生成式引擎的可见性模型 生成式引擎的输出形态完全不同。AI生成的回答是一段连续的、结构化的自然语言文本,多个来源的信息被混合编织在同一段回答中,以内联引用的方式标注出处。 这种输出方式带来了三个根本性的变化: 第一,没有固定的"位置"概念。 传统搜索中,每个网站占据一个明确的排名位置。但在AI回答中,同一个来源可能在回答的不同位置被多次引用,引用的长度也各不相同。不存在一个简单的"排名第几"来定义你的可见性。 第二,引用的"质量"差异巨大。 在传统搜索中,排名第1和排名第2的展示形式基本相同——都是标题+摘要+链接。但在AI回答中,不同来源的引用方式天差地别——有的来源被大段引用,贡献了回答的核心论点;有的来源只在一个细节处被一笔带过。同样是"被引用",实际的可见性价值可能相差十倍。 第三,多个来源共享同一个"展示空间"。 传统搜索中,每个结果独占一行。但在AI回答中,一个句子可能同时引用两三个来源,引用的信息是交错混合的。这意味着来源之间的可见性不再是简单的排他关系,而是一种更复杂的共享和竞争关系。 对比维度 | 传统搜索引擎 | 生成式引擎 | 输出形态 | 线性链接列表 | 连续自然语言文本 | 来源展示 | 每个来源独占一行 | 多来源混合内联引用 | 位置概念 | 固定排名位置(1-10) | 动态、分散、可多次引用 | 引用差异 | 展示形式基本一致 | 引用长度、位置、权重差异大 | 核心指标 | 排名位置+点击率 | 引用量+引用位置+影响力+独特性 | 可见性衡量 | 一维(排名高低) | 多维(需要多个指标综合评估) | 正是因为这些根本差异,论文提出了一套全新的可见性指标体系,专门用于衡量内容在生成式引擎回答中的表现。 ## GEO三层可见性指标体系全解 论文提出的指标体系分为三层,从简单到复杂、从客观到主观,逐层递进。理解这三层结构,就掌握了GEO可见性评估的完整框架。 ## 第一层:词数计数(Word Count)——最基础的引用量化 核心定义:词数计数(Word Count)衡量的是AI回答中引用某个来源的内容占总回答篇幅的比例。 这是最直观的可见性衡量方式。计算公式为: > 某来源的可见性 = 引用该来源的句子的总词数 ÷ 回答中所有句子的总词数 举个例子:假设AI生成了一段300字的回答,其中有3个句子(共90个字)引用了你的网站作为来源,那么你的Word Count可见性得分就是90÷300=30%。 一个重要细节:共享引用的处理。 当同一个句子同时引用了多个来源时,这个句子的词数会在所有被引用的来源之间平均分配。比如一个30字的句子同时引用了来源A和来源B,那么A和B各获得15字的计数。 Word Count指标的优势: - 计算简单,不依赖任何主观判断 - 直接反映内容在回答中的"信息贡献度" - 引用词数越多,用户接触到你的内容的概率越大 Word Count指标的局限: - 完全忽略了引用出现的位置——出现在回答开头和出现在回答末尾,获得的用户注意力是完全不同的 - 不区分引用的"质量"——你的内容是被用来支撑核心论点,还是只在附带信息中一笔带过 - 无法捕捉用户的主观感知——即使引用量一样,不同的引用方式给用户留下的印象深度也不同 ## 第二层:位置加权词数计数(Position-Adjusted Word Count)——引入位置衰减 核心定义:位置加权词数计数在Word Count的基础上,根据引用在回答中出现的位置施加一个指数衰减的权重因子,出现在回答越靠前位置的引用获得越高的得分。 这个指标的设计灵感来自一个已被大量研究验证的用户行为规律:无论是在传统搜索结果中还是在阅读一段文本时,用户的注意力都会随着位置的后移而急剧衰减。 出现在回答开头的信息被阅读和记住的概率远高于出现在末尾的信息。 位置加权的计算方式是:对每个引用句子的词数乘以一个指数衰减因子e^(-pos/|S|),其中pos是该句子在回答中的位置序号,|S|是回答的总句子数。 这意味着什么? 举个对比: - 来源A被引用在回答的第1-2句话中,共50个字 - 来源B被引用在回答的最后两句话中,共50个字 - 在Word Count指标下,A和B的得分相同 - 但在Position-Adjusted Word Count下,A的得分会显著高于B,因为靠前位置的衰减因子接近1,而靠后位置的衰减因子远小于1 为什么选择指数衰减而非线性衰减? 论文给出了明确的理论依据:多项研究表明,搜索引擎中的点击率分布遵循幂律(power-law)衰减模式,而非线性下降。也就是说,排名第1和第2之间的注意力差距远大于排名第9和第10之间的差距。指数衰减函数能更准确地模拟这种非均匀的注意力分布。 Position-Adjusted Word Count的实操意义: 对内容创作者来说,这个指标传递了一个关键信息——不仅要争取被AI引用,还要争取被引用在回答的靠前位置。 那些被AI放在回答开头用来"定义问题"或"给出核心结论"的来源,获得的可见性价值远高于被放在末尾"补充细节"的来源。 如何提高被靠前引用的概率?关键在于你的内容是否能直接回答用户的核心问题。如果你的内容用简洁有力的方式给出了核心答案(而非在大量铺垫后才切入正题),LLM更可能在回答的开头就引用你。 ## 第三层:主观印象评估(Subjective Impression)——7个维度的深度评估 前两层指标虽然客观可量化,但它们只捕捉了可见性的"物理层面"——你的内容在回答中占了多少字、出现在什么位置。它们无法回答一个更深层的问题:你的引用对用户产生了多大的实际影响? 为了填补这个空白,论文提出了"主观印象"指标,从7个维度系统评估引用的主观影响力。评估方法采用G-Eval(当时最先进的LLM评估框架),用大语言模型模拟人类评估者对每个维度进行打分。 ### 维度一:相关性(Relevance) 定义:引用的内容与用户原始查询的语义匹配程度。 一个高相关性的引用意味着它精准地回应了用户想知道的内容,而非只是与主题沾边。比如用户查询"2024年全球AI市场规模",一个提供了具体市场规模数据的引用比一个泛泛讨论"AI发展历史"的引用相关性要高得多。 对创作者的启示: 内容要直接对准搜索意图。每篇文章都应该在核心段落明确回答"用户最想知道什么",而非绕圈子铺垫。 ### 维度二:影响力(Influence) 定义:引用在塑造AI回答的整体结论和观点方向上所起的作用。 有些引用只是提供了一个佐证数据点,对回答的整体方向没有实质影响。而有些引用则直接决定了回答的核心论点——AI采纳了这个来源的立场作为回答的基调。后者的"影响力"显然远高于前者。 对创作者的启示: 要争取成为AI回答的"主论点提供者"而非"补充材料"。这需要你的内容具有明确的立场、充分的论据和清晰的结论——LLM更倾向于引用那些"能直接拿来用"的结论性内容。 ### 维度三:独特性(Uniqueness) 定义:引用提供了其他来源未涵盖的独特信息。 如果五个来源都提供了类似的信息,LLM可能只需要引用其中一个。但如果你的内容提供了一个独特的数据、视角或案例——其他来源都没有——LLM就有更强的理由引用你,而且你的引用会在回答中显得更加突出。 对创作者的启示: 差异化是王道。不要只是重复行业共识,要提供独家数据、一手经验、独到分析。保哥一直强调,在内容创作中最有价值的东西是"别人没有而你有的"。 ### 维度四:多样性(Diversity) 定义:引用在内容角度和信息类型上的丰富程度。 如果你的内容同时提供了数据分析、案例对比、专家观点和操作建议等多种类型的信息,它在AI回答中的引用可能涵盖更多维度,从而获得更高的多样性得分。 ### 维度五:后续探索意愿(FollowUp/Click Probability) 定义:用户看完AI回答中的引用后,想要点击原文链接进一步了解的可能性。 这是一个对内容创作者意义重大的指标——因为它直接关联到实际的流量转化。如果你的引用在AI回答中足够"勾人",激发了用户想要了解更多细节的好奇心,用户就更可能点击引用链接访问你的网站。 对创作者的启示: 你的内容不应该在被AI引用的那部分就"说完了"。理想的状态是:AI引用了你的核心观点,但读者能感觉到"原文还有更深入的分析",从而产生点击欲望。这就要求你的内容具有足够的"深度层次感"——表面足够有价值,深处还有更多干货。 ### 维度六:主观位置(Subjective Position) 定义:引用在AI回答的逻辑结构中所处的重要程度,而非物理位置。 这与第二层的Position-Adjusted不同。物理位置关注的是"出现在第几句话",而主观位置关注的是"在回答的论证逻辑中扮演什么角色"。一个出现在回答中段的引用,如果它是整个论证链的关键环节(比如提供了支撑核心论点的关键证据),其主观位置价值可能高于一个出现在开头但只是做铺垫介绍的引用。 ### 维度七:主观计数(Subjective Count) 定义:引用被AI多次提及的主观权重。 如果同一个来源在回答中被反复引用(在不同的论述环节中多次出现),说明AI认为这个来源的信息覆盖面广、可靠度高。这种反复引用带来的主观印象权重,比单次引用要强得多。 ## 三层指标的完整对比 指标层级 | 指标名称 | 衡量内容 | 计算方式 | 客观/主观 | 复杂度 | 第一层 | 词数计数 | 引用篇幅占比 | 引用词数÷总词数 | 客观 | 低 | 第二层 | 位置加权词数 | 引用篇幅+位置价值 | 词数×指数衰减因子 | 客观 | 中 | 第三层 | 主观印象 | 7维综合影响力 | LLM多维度评分 | 主观 | 高 | ## 从指标到实操:如何用这套体系优化你的内容 理解了三层指标体系的理论框架后,最重要的问题是:如何把这些认知转化为可落地的内容优化动作? ## 针对第一层(词数计数)的优化策略 目标:增加你的内容在AI回答中被引用的"份额"。 要实现这个目标,你的内容必须成为AI在合成回答时"不得不用"的信息源。具体策略包括: 信息密度最大化。 每个段落都要包含实质性的信息——数据、观点、方法论、案例。砍掉所有水分和套话。AI在选择引用来源时,会优先选择那些"信息浓度"最高的内容,因为引用这类内容可以用最少的词数传递最多的信息。 覆盖查询的多个维度。 如果一个查询涉及多个子话题,确保你的内容对每个子话题都有实质性的覆盖。这样AI在回答不同部分时,都有理由引用你的内容,从而增加总引用词数。 添加权威引用和统计数据。 这是论文实验中效果最好的策略。当你的内容中包含来自权威机构的引用和精确的统计数据时,LLM倾向于在回答中"透传"这些信息并注明来源,从而自然增加你的引用篇幅。 ## 针对第二层(位置加权)的优化策略 目标:争取被引用在AI回答的靠前位置。 内容的"首段即答案"原则。 在文章的开头就给出核心问题的直接回答,然后再展开详细论述。LLM在生成回答时,通常先回答核心问题再展开分析。如果你的内容在开头就提供了清晰的定义或结论,LLM更可能在回答的开头引用你。 结构化的定义性表述。 使用"X是Y"的明确定义句式。比如"GEO可见性指标是一套专门用于衡量网页内容在AI搜索引擎生成回答中的展示表现和影响力的量化体系"。这类定义性语句极易被LLM提取并放置在回答开头。 提供直接的"因果关系"表述。 比如"使用Cite Sources策略的网站可见性提升了40%以上"。这类包含明确因果关系的句子,LLM经常放在回答的前部作为核心论据。 ## 针对第三层(主观印象)的优化策略 目标:提升引用的综合影响力和用户感知价值。 提升相关性:精准对齐搜索意图。 在写内容之前,先明确你要覆盖的查询意图是什么。不要试图用一篇文章回答所有问题。针对一个具体的搜索意图,提供最精准、最深入的回答。 提升影响力:做论点的"源头"。 不要只是引用别人的观点加以评论,而是提出你自己的原创分析和结论。当你的内容是某个观点的"原始出处"时,AI在引用时会赋予更高的影响力权重。 提升独特性:提供独家价值。 这是在七个维度中最能拉开差距的因素。你可以通过以下方式提供独特价值:自己进行实验或数据分析并公开结果,分享第一手的实战经验和案例,对公开数据进行独到的解读和分析。如果你的网站需要系统化地评估内容的独特性和AI可引用性,可以使用GEO内容分析优化工具 (https://zhangwenbao.com/tools/geo-optimizer.php)进行量化评估。 提升后续探索意愿:制造"信息悬崖"。 在你的核心论点之后,暗示有更深入的分析、更多的数据或更详细的步骤。让被引用的部分足够有价值,同时让读者感知到原文还有更多"未被引用的精华"。 ## 实战案例:用三层指标分析一次真实的AI引用 为了让理论更加具象,我们来做一个思维实验。假设用户在Perplexity中搜索"什么是GEO优化",AI生成了如下回答(简化示意): > "GEO(生成式引擎优化)是一种针对AI搜索引擎优化内容的方法论[来源A]。研究表明,通过添加权威引用和统计数据等GEO策略,网站在AI回答中的可见性可提升最高40%[来源A]。传统SEO侧重关键词排名,而GEO更关注内容被AI引用的概率和引用质量[来源B]。具体的GEO优化方法包括添加统计数据、权威引述和结构化表达等来源A。要特别留意,关键词堆砌在GEO场景下不仅无效还有负面影响[来源A]。" 用三层指标分析来源A的可见性: 第一层(词数计数): 来源A在5个句子中的4个被引用,引用词数占总回答词数的约70%。这是非常高的引用份额。 第二层(位置加权): 来源A在回答的第1-2句话就被引用,获得了高位置权重。第4句共享引用(A和C),位置较靠后但仍有一定权重。总体位置加权得分显著高于来源B和C。 第三层(主观印象): - 相关性:高——直接定义了GEO并给出关键数据 - 影响力:高——主导了回答的核心论点方向 - 独特性:中高——提供了40%的具体数据点 - 后续探索意愿:中——读者可能想了解更多具体策略细节 - 主观位置:高——在回答的论证逻辑中是核心信息源 - 主观计数:高——被引用4次 从这个案例可以清楚看到:来源A在三层指标上全面碾压来源B和C。而来源A之所以表现优异,根本原因是它的内容具有高信息密度、精确数据、权威引用和清晰的结构化表达。 ## 从"排名思维"到"引用思维":SEO从业者的认知升级 理解GEO可见性指标体系后,SEO从业者需要完成一次根本性的认知升级——从"排名思维"转向"引用思维"。 ## "排名思维"的核心逻辑 - 目标:提升关键词排名位置 - 关注点:域名权重、外链数量、页面速度 - 衡量标准:排名位置、点击率、自然流量 - 优化重心:技术指标和链接建设 ## "引用思维"的核心逻辑 - 目标:提升内容在AI回答中的引用份额和影响力 - 关注点:内容的信息密度、独特性、结构清晰度、权威信号 - 衡量标准:引用词数、引用位置、七维主观影响力 - 优化重心:内容质量本身 这不是说传统的排名思维完全过时了。传统SEO的技术基础(网站速度、可爬取性、结构化数据 (https://zhangwenbao.com/yoast-schema-aggregation-agentic-web-seo.html)等)仍然是GEO的前提——如果AI爬虫 (https://zhangwenbao.com/ai-crawlers-surpass-googlebot-seo-strategy.html)都无法抓取你的页面,再好的内容也无用。但在内容策略层面,"引用思维"正在成为更重要的指导框架。 两种思维的并行实践框架: 实践层面 | 排名思维(继续做) | 引用思维(新增) | 技术层 | 页面速度、移动适配、索引优化 | 确保AI爬虫可访问、结构化数据完善 | 内容层 | 关键词覆盖、内容相关性 | 信息密度、定义性语句、独家数据 | 权威层 | 外链建设、域名权重 | 权威引用、数据支撑、E-E-A-T (https://zhangwenbao.com/ymyl-eeat-seo-strategy.html)信号 | 衡量层 | Search Console排名追踪 | AI搜索引用监测、引用份额评估 | 迭代层 | 排名波动分析和调整 | 引用质量分析和内容迭代 | ## 如何建立你自己的GEO可见性监测体系 论文的指标框架提供了理论基础,但在实操中你需要建立一套可执行的监测流程。 ## 手动监测法(零成本) 步骤一:确定核心查询集。 从你的Google Search Console中导出带来最多流量的前20-30个查询词。 步骤二:逐一测试AI引用表现。 在ChatGPT Search、Perplexity和Google AI Overview中分别输入这些查询词,记录: - 你的内容是否被引用(是/否) - 引用出现在回答的什么位置(前部/中部/末尾) - 引用的大致字数 - 引用是支撑核心论点还是补充细节 步骤三:建立评分表。 为每个查询创建简易评分: 查询词 | ChatGPT引用 (https://zhangwenbao.com/boost-content-fact-density-ai-citations-2026.html) | Perplexity引用 | AI Overview引用 | 位置 | 估算影响力 | xxx | 是/否 | 是/否 | 是/否 | 前/中/末 | 高/中/低 | 步骤四:每月重复测试。 对比不同月份的数据变化,评估你的GEO优化动作是否产生了效果。 ## 工具辅助法 如果手动监测的工作量太大,你也可以借助专业的GEO监控工具。如果不确定该选哪款工具,可以参考20款GEO/AEO监控工具的横向评测 (https://zhangwenbao.com/geo-aeo-monitoring-tools.html),根据你的团队规模和预算选择合适的方案。 不论用哪种方式,核心是把"AI引用表现"纳入你的常规SEO监测体系中,与传统的排名监测并行运行。 ## 指标体系的局限性与未来演进 客观地说,论文提出的这套指标体系虽然开创性地填补了GEO可见性衡量的空白,但它本身也存在需要正视的局限: 主观指标的可复现性问题。 主观印象的七个维度使用LLM进行评分(G-Eval方法),但LLM的评分本身具有一定的随机性。同一段引用在不同次评分中可能获得不同的得分。虽然论文通过多次采样取平均值来缓解这个问题,但主观指标的稳定性仍然不如客观指标。 缺乏真实用户行为数据的校准。 论文的指标设计基于合理的理论假设(比如位置衰减函数),但这些假设尚未得到大规模真实用户行为数据的直接验证。用户在阅读AI回答时的注意力分布是否真的遵循指数衰减?这需要后续研究来确认。 跨平台一致性未知。 不同AI搜索引擎的引用展示方式不同(Perplexity用脚注编号,ChatGPT用内联标注,Google AI Overview用侧边链接),这些展示差异是否会导致同一指标在不同平台上的意义发生变化?论文没有深入探讨。 指标体系的标准化之路。 目前行业还没有一个统一的"GEO可见性评分标准"。类比传统SEO,Google最终通过Search Console提供了标准化的排名和点击数据。GEO领域也需要类似的标准化工具和指标体系,但这可能需要AI搜索引擎的运营方(Google、OpenAI (https://zh.wikipedia.org/wiki/OpenAI)、Perplexity等)主动开放相关数据。 保哥判断,随着AI搜索的持续发展,GEO可见性指标体系会朝着两个方向演进:一是指标的标准化和自动化(出现类似Search Console的GEO专用监测工具),二是指标维度的细化(比如加入多模态引用、多轮对话引用等新维度)。 ## 常见问题 ## GEO可见性指标与传统SEO的排名指标可以同时使用吗? 可以而且应该同时使用。传统排名指标(关键词排名、CTR、有机流量)反映你在传统搜索中的表现,GEO可见性指标反映你在AI搜索中的表现。两者监测的是不同渠道的不同维度,互不替代。建议在你的SEO报告中同时纳入两套指标,形成完整的搜索可见性画像。 ## 三层指标中,哪一层对内容创作者最重要? 取决于你的目标。如果你追求的是最大化品牌曝光,第一层(词数计数)最直观——引用越多,曝光越大。如果你追求用户实际转化,第三层的"后续探索意愿"维度最关键——它直接关联用户是否会点击你的链接。保哥建议优先关注第二层(位置加权),因为它同时考虑了引用量和引用位置,是性价比最高的单一指标。 ## 主观印象的七个维度中,哪个最容易通过内容优化来提升? 独特性(Uniqueness)是最容易通过主动努力来提升的维度。只要你能提供独家数据、一手实验结果或独到的分析视角,独特性得分就会明显提升。相比之下,相关性和影响力更多取决于你的内容与用户查询的匹配度,不完全由内容本身决定。 ## 位置加权中的指数衰减因子具体是多少? 论文使用的衰减函数是e^(-pos/|S|),其中pos是句子的位置序号(从0开始),|S|是总句子数。这意味着回答中第一个句子的权重最高(接近1),最后一个句子的权重约为1/e(约0.37)。整体衰减是温和的指数曲线,不是断崖式下降。 ## 我怎么知道我的内容在AI回答中出现在什么位置? 目前没有自动化工具可以精确追踪这一点。你需要手动在各个AI搜索引擎中输入目标查询词,然后观察回答中引用你的内容出现在哪个段落。记录"前三分之一""中间三分之一""后三分之一"即可满足基本监测需求。 ## Word Count和Position-Adjusted Word Count的数值差距大吗? 差距取决于引用的分布模式。如果你的引用集中在回答的前部,两个指标的数值很接近。如果你的引用集中在回答的末尾,Position-Adjusted的数值会明显低于Word Count。论文的实验数据中,两个指标的排序通常一致,但绝对数值差距可达15%-20%。 ## 这套指标体系适用于中文AI搜索引擎吗? 指标的设计原理是通用的,不受语言限制。词数计数和位置加权的计算逻辑对任何语言都适用(中文可按字数或词数计算)。主观印象的七个维度同样适用于中文内容。但有个前提得说清,不同AI搜索引擎(百度AI、豆包、Kimi等)的引用展示方式可能不同,具体评分需要根据各平台的特点做适当调整。 ## GEO可见性指标会成为行业标准吗? 保哥认为大方向是肯定的,但标准化进程需要时间。就像SEO行业花了十多年才形成以Google Search Console数据为核心的标准化衡量体系,GEO指标的标准化也需要AI搜索引擎运营方开放更多数据、学术界持续迭代指标设计、以及行业工具的跟进。目前论文提出的框架是最权威的起点。 ## 权威参考资料 ## AI搜索改写敏感性实测:5步测试品牌引用稳定性 - URL:https://zhangwenbao.com/ai-search-paraphrase-sensitivity-geo-test.html - 分类:AI监控与数据 - 发布:2025-12-16 | 更新:2026-06-02 - 摘要:你的品牌在AI搜索里只在基准查询出现、换种问法就消失?本文用五步法和三个真实案例数据,拆解改写敏感性盲区的诊断与修复路径,输出一套可执行的GEO监测方案。 - 关键词:GEO,AI搜索,GEO优化策略 > **TLDR**:摘要:你的品牌在AI搜索里只在基准查询出现、换种问法就消失?这就是改写敏感性。本文讲清它的成因和论文实验的核心发现,给五步测试品牌引用稳定性的方法、改写覆盖的内容优化策略、改写敏感性与语言敏感性的优先级排序和自动化监测,附三个品牌的测试与修复过程。 > 摘要:你的品牌在AI搜索里只在基准查询出现、换种问法就消失?这就是改写敏感性。本文讲清它的成因和论文实验的核心发现,给五步测试品牌引用稳定性的方法、改写覆盖的内容优化策略、改写敏感性与语言敏感性的优先级排序和自动化监测,附三个品牌的测试与修复过程。 你用ChatGPT (https://zh.wikipedia.org/wiki/OpenAI)搜"最好的项目管理工具推荐",你的品牌出现了。你松了一口气,觉得GEO (https://arxiv.org/abs/2311.09735)优化起效了。但当你换一种问法——"有哪些适合远程团队的项目管理软件"——你的品牌消失了,取而代之的是一个你从没听过的竞品。 同样的产品需求,只是换了一种表达方式,AI推荐的品牌就变了。这不是偶然现象,而是AI搜索引擎的一个系统性特征。 2025年9月,多伦多大学的研究团队在一项大规模GEO研究中专门设计了改写敏感性 (https://arxiv.org/abs/2406.07042)实验,用7种不同的查询表述方式测试AI搜索引擎的引用变化。实验结果揭示了一个对所有GEO从业者至关重要的事实:查询措辞的变化对AI引用来源确实有可测量的影响,但影响程度因引擎而异,且整体小于语言切换。 这篇文章,保哥不仅要把这项实验的核心发现讲透,更要给你一套可以立刻上手的5步测试方法论——让你自己就能诊断品牌在AI搜索中的"改写稳定性",找到引用盲区并精准修补。 ## 什么是AI搜索的改写敏感性 AI搜索的改写敏感性(Paraphrase Sensitivity)是指同一用户意图通过不同措辞表达时,AI搜索引擎返回的信源和品牌推荐发生变化的程度。简单说,就是"换种问法,答案会不会变"。 在传统Google搜索中,这个问题早已存在——"best CRM software"和"top CRM tools"返回的搜索结果就有差异。但AI搜索的改写敏感性问题更值得关注,原因有两个。 第一,AI搜索给出的是一个综合性答案而不是链接列表。在传统搜索中,即使排名有波动,你的网站可能还在第一页某个位置。但在AI搜索中,你的品牌要么被提及,要么完全不存在——没有"排在第七位"这种缓冲地带。 第二,用户在AI搜索中的表达方式远比传统搜索多样化。传统搜索用户倾向于输入简短的关键词短语,但AI搜索用户会用完整的自然语言句子描述需求,措辞变化空间大得多。这意味着你需要在更多种表达方式下保持品牌引用的稳定性。 ## 论文改写实验的核心发现 多伦多大学的改写实验设计非常严谨。研究团队对同一批核心查询生成了7种不同的改写变体,包括:要求提供来源的提问方式、要求直接引用的提问方式、要求排名的提问方式、祈使句式、纯关键词式等多种格式。然后在Google、ChatGPT、Perplexity和Gemini四个平台上分别执行,对比引用域名的重叠度和信源类型的变化。 ## 发现一:AI引擎比Google更"淡定" 实验中最出乎意料的发现是:AI搜索引擎对查询改写的敏感度整体低于Google。在大多数垂直领域中,AI引擎的跨改写域名重叠度(Jaccard系数)维持在0.3-0.7的区间,个别情况能达到0.7以上。相比之下,Google在某些改写方式下的结果波动更大。 这说明AI引擎的语义理解能力确实比关键词匹配型的传统搜索更强——它能"看透"不同的表面措辞,识别出背后的核心意图。但0.3-0.7的重叠度也意味着,即使在最好的情况下,换种问法也有30%-70%的引用来源会发生变化。这对品牌来说依然是一个不容忽视的风险。 ## 发现二:信源类型分布很稳定 一个好消息是:虽然具体引用的域名会因改写而变化,但AI引擎的信源类型分布在不同改写方式下保持高度稳定。也就是说,不管用户怎么措辞,ChatGPT依然压倒性地偏好Earned Media(第三方权威来源),Perplexity依然会包含较高比例的Social内容。 相比之下,Google的信源类型分布受改写影响更大——某些改写方式会显著改变Google结果中Brand、Earned和Social的比例。 这个发现的实操意义是:你的GEO策略方向不需要因为改写敏感性而改变——针对每个引擎的信源偏好做优化,这个大方向是对的。改写敏感性影响的是"哪些具体文章/页面被引用",而不是"什么类型的内容被引用"。 ## 发现三:改写影响远小于语言切换 研究还做了一个关键对比:查询改写的影响程度 vs 语言切换的影响程度。结果非常明确——同一问题在不同语言间的信源差异,远大于同一语言内不同措辞间的差异。 这意味着,在GEO优化的优先级排序上,多语言覆盖应该排在"多问法覆盖"前面。如果你的资源有限,先确保在目标语言的权威信源中有足够的品牌曝光,然后再考虑针对不同措辞做内容覆盖。 ## 发现四:不同引擎的改写敏感度存在差异 各AI引擎对改写的反应程度不完全一致。某些引擎在特定的改写方式下表现出更高的域名稳定性,而另一些引擎则在不同改写间呈现更大的波动。这进一步证实了一个核心结论:GEO优化不能用一套方案覆盖所有引擎,分引擎策略是必要的。 ## 改写敏感性对GEO从业者的5大实操启示 ## 启示一:不能只针对一种查询措辞优化 这是最直接的结论。如果你的内容只覆盖了"best CRM software"这一种表达方式,那么当用户用"推荐一款适合小团队的客户管理工具"提问时,你的内容可能就不在AI引擎的候选信源范围内。 你的内容需要在语义层面覆盖多种表达变体——不是简单地在文章中堆砌同义词,而是确保你的内容能从多个角度回答同一个核心问题。 ## 启示二:核心品牌信息必须"无处不在" 改写敏感性的存在意味着,AI引擎在不同措辞下可能从不同的信源抓取信息。如果你的品牌只在一两个信源中出现,就可能在某些改写方式下"消失"。解决方案是确保你的品牌核心信息在足够多的高质量信源中存在——官网、第三方评测、行业媒体、社交平台都应该有你品牌的一致性信息。 ## 启示三:持续监测比一次性优化重要 因为AI引擎的行为会随模型更新而变化,你不能做一次改写测试就以为万事大吉。建议建立一套常态化的监测机制,定期检查品牌在不同措辞下的引用稳定性。 ## 启示四:语义覆盖比关键词堆砌有效 传统SEO的应对方式是在内容中堆砌各种同义词和长尾关键词。但对AI搜索来说,更有效的方式是从不同角度论述同一主题——用不同的句式、不同的场景描述、不同的论证逻辑来阐述同一个核心观点。AI引擎的语义理解足够强,能够"理解"你在说同一件事,但从更多角度覆盖能增加你被匹配到不同措辞查询的概率。 ## 启示五:结构化数据提供稳定的"锚点" 结构化数据(Schema标记)为AI引擎提供了一种不依赖自然语言解析的信息获取方式。无论用户怎么措辞,AI引擎都能通过结构化数据快速获取你的品牌核心信息(产品参数、评分、价格等)。在改写敏感性的语境下,结构化数据相当于一个"抗改写"的稳定信息锚点。 ## 5步测试你的品牌AI搜索引用稳定性 以下是保哥设计的一套完整测试方法论。你可以直接拿去执行,不需要任何付费工具。 ## 确定核心测试查询 从你业务最核心的3-5个品类或产品线出发,为每个品类/产品线确定一个"基准查询"——也就是你最希望用户通过这个查询找到你品牌的那个问题。 例如,如果你做跨境电商ERP软件,基准查询可能是"跨境电商ERP软件推荐"。 ## 生成5种改写变体 对每个基准查询,按以下5种方式生成改写变体: 变体一:场景化改写。把产品品类词替换为使用场景描述。 基准:"跨境电商ERP软件推荐" 改写:"管理亚马逊和Shopify (https://zhangwenbao.com/shopify-blog-breadcrumb.html)多店铺订单用什么工具好" 变体二:问题式改写。把推荐型查询转为问题型查询。 基准:"跨境电商ERP软件推荐" 改写:"跨境电商卖家怎么高效管理多平台库存和订单" 变体三:对比式改写。加入竞品或替代方案的对比维度。 基准:"跨境电商ERP软件推荐" 改写:"有没有比XX更适合中小卖家的跨境ERP系统" 变体四:需求细化改写。加入具体的需求约束条件。 基准:"跨境电商ERP软件推荐" 改写:"预算5000元以内、支持对接1688采购的跨境电商管理软件" 变体五:口语化改写。用最日常的口语方式重新表述。 基准:"跨境电商ERP软件推荐" 改写:"做跨境电商的小白用什么软件管理店铺比较方便" ## 在多引擎上执行测试 把基准查询和5个改写变体分别输入到ChatGPT、Perplexity、Gemini(至少这三个主流AI引擎),记录每次查询中:你的品牌是否被提及(是/否);你的品牌在推荐列表中的位置(如果有多个推荐);AI引擎引用了哪些信源域名;你的竞品是否被提及及其排列位置。 建立一个类似下面的记录表格: 查询变体 | ChatGPT提及 | ChatGPT信源 | Perplexity提及 | Perplexity信源 | Gemini提及 | Gemini信源 | 基准查询 | 是/否 | 域名列表 | 是/否 | 域名列表 | 是/否 | 域名列表 | 场景化改写 | 是/否 | 域名列表 | 是/否 | 域名列表 | 是/否 | 域名列表 | 问题式改写 | ... | ... | ... | ... | ... | ... | 对比式改写 | ... | ... | ... | ... | ... | ... | 需求细化改写 | ... | ... | ... | ... | ... | ... | 口语化改写 | ... | ... | ... | ... | ... | ... | 你可以使用AI搜索模拟器 (https://zhangwenbao.com/tools/ai-search-simulator.php)辅助执行批量查询测试并记录结果。 ## 计算引用稳定性得分 基于测试数据,计算你的品牌在每个引擎上的引用稳定性得分: 计算公式:引用稳定性得分 = 品牌被提及的查询变体数量 ÷ 总查询变体数量 × 100% 例如,你在ChatGPT上测试了6个查询变体(1个基准 + 5个改写),品牌在其中4个变体中被提及,那么ChatGPT引用稳定性得分 = 4/6 × 100% = 66.7%。 得分解读: 得分区间 | 评价 | 行动建议 | 80%-100% | 优秀 | 维持现有策略,定期监测 | 60%-79% | 良好 | 分析未覆盖的改写方式,针对性补充内容 | 40%-59% | 需改进 | 系统性扩展内容的语义覆盖范围 | 0%-39% | 危险 | 品牌在AI搜索中的基础可见性严重不足 | ## 定位盲区并制定修补计划 找到你品牌"消失"的那些查询变体,分析原因。通常有以下几种情况: 情况一:场景化改写丢失。说明你的内容缺少对特定使用场景的描述。解决方案:在产品页面和博客内容中补充多个使用场景的详细描述。 情况二:口语化改写丢失。说明你的内容过于"专业化",缺少日常用语的表达。解决方案:在FAQ部分使用更口语化的问题表述。创建"小白指南"类型的入门内容。 情况三:对比式改写丢失。说明在品牌对比的第三方内容中缺少覆盖。解决方案:争取更多第三方评测媒体的产品对比文章覆盖。 情况四:需求细化改写丢失。说明你的内容缺少针对具体约束条件(预算、规模、行业等)的细分推荐。解决方案:创建按预算区间、企业规模、行业类型等维度细分的产品推荐内容。 情况五:在特定引擎上全面丢失。说明你在该引擎偏好的信源类型中缺乏覆盖。参考各引擎的信源偏好特征(ChatGPT偏重Earned Media、Perplexity偏重Social、Gemini偏重Brand),针对性地补强对应类型的内容。 ## 实战案例:3个品牌改写敏感性测试与修复过程 方法论需要落地数据才有说服力。保哥在2025年Q4到2026年Q1期间用上述5步法对3个不同品牌做了完整诊断,以下是可脱敏的数据复盘。 ## 案例一:B2B SaaS"X平台"(项目管理工具) X平台是一家年ARR 800万元的国产项目管理SaaS,团队认为自己在GEO上"做得不错"——因为ChatGPT搜"项目管理软件推荐"时X平台稳定出现在前3。但实测显示真实图景完全不同: - 基准查询"项目管理软件推荐":ChatGPT/Perplexity/Gemini三家全部提及(3/3) - 场景化改写"远程团队协作工具":仅ChatGPT提及(1/3) - 问题式改写"团队怎么提升项目执行效率":0/3全部缺席 - 对比式改写"飞书Teambition的替代品":仅Perplexity提及(1/3) - 需求细化改写"50人规模软件公司用什么项目管理":0/3全部缺席 - 口语化改写"小团队管事用什么APP":0/3全部缺席 整体引用稳定性得分:ChatGPT 33%(2/6),Perplexity 33%(2/6),Gemini 17%(1/6)——全部处于"危险"区间。 修复路径:针对场景化盲区,新增6篇"远程团队/分布式协作/异地办公"主题的博客内容;针对问题式盲区,把官网FAQ中的措辞从"X平台支持什么功能"重写为"团队如何用X平台解决XX问题";针对需求细化盲区,新增按团队规模(10/50/200人)、按行业(互联网/制造/教培/咨询)细分的对比页;针对对比式盲区,主动联系3家行业测评媒体做"飞书 vs Teambition vs X平台"的横向对比文章。 4个月后复测:稳定性得分提升到ChatGPT 83%、Perplexity 67%、Gemini 50%——3个引擎平均提升40个百分点。 ## 案例二:DTC消费品"Y品牌"(智能咖啡机) Y品牌年GMV约2200万元,主打中端家用智能咖啡机。基准测试结果: - "智能咖啡机推荐":3/3提及 - 场景化"小户型公寓适合什么咖啡机":仅Gemini提及(1/3) - 问题式"我想在家做出咖啡店级别的拿铁":0/3全部缺席 - 对比式"德龙咖啡机的国产替代":0/3全部缺席 - 需求细化"预算3000元以下的全自动咖啡机":0/3缺席 - 口语化"在家弄咖啡有什么机器好用":1/3(Perplexity) 整体得分:ChatGPT 17%、Perplexity 33%、Gemini 33%——B2C品类的口语化和场景化盲区尤其突出。 修复路径:邀请8位生活方式类KOL做"小户型/单身公寓/出租屋"场景化测评内容;推动3家家电评测媒体做"咖啡店级拿铁的家用方案"主题深度文章;同时在小红书发起"3000元预算咖啡机怎么选"UGC话题(获得自然UGC内容47篇)。 3个月后复测:稳定性得分ChatGPT 67%、Perplexity 83%、Gemini 67%——B2C场景下的改写覆盖修复速度普遍快于B2B,因为UGC内容生成周期更短、密度更容易拉起来。 ## 案例三:B2B制造业"Z品牌"(工业自动化设备) Z品牌年营收约4亿元,提供工业自动化生产线设备。基准测试结果: - "工业自动化生产线":2/3(ChatGPT和Gemini提及,Perplexity未提) - 场景化"汽车零部件工厂智能改造方案":3/3全部提及 - 问题式"工厂怎么提升良品率":0/3缺席 - 对比式"国产工业机器人和ABB对比":仅ChatGPT提及(1/3) - 需求细化"3C行业小批量多品种的自动化生产线":1/3 - 口语化"工厂自动化哪家靠谱":2/3 整体得分:ChatGPT 67%、Perplexity 33%、Gemini 67%。B2B工业品类的有趣发现是:场景化和需求细化反而表现较好(因为客户主动询问的本就是具体场景),但问题式和对比式盲区严重。 修复路径:针对问题式盲区,与3家工业自动化媒体合作产出"良品率提升""稼动率优化""停机时间缩短"等问题导向的深度内容;针对对比式盲区,主动制作《2026年国产工业机器人与进口品牌技术对标白皮书》并推送给5家行业媒体引用。 6个月后复测:稳定性得分ChatGPT 83%、Perplexity 67%、Gemini 83%——B2B工业品类修复周期普遍长于消费品,但单次修复的SEO/GEO资产沉淀价值更高。 ## 三个案例的共同规律 对比3个案例可以提炼几条规律: 第一,基准查询的成功不能代表整体GEO水平。3个品牌都在基准查询上表现尚可(67%-100%),但放到改写变体后真实稳定性得分大都跌到17%-33%。如果只测基准查询,你的GEO评估会严重高估真实水平。 第二,B2C口语化和场景化盲区最大,B2B问题式和对比式盲区最大。不同品类应该把修复资源优先投在最薄弱的改写方向。 第三,修复周期普遍3-6个月。从产出针对性内容到AI引擎重新抓取并体现在引用中,至少需要3个月。建议把改写敏感性修复纳入季度SEO规划而不是月度执行。 ## 改写覆盖的内容优化策略 ## 语义网络式内容组织 传统的内容组织方式是"一篇文章覆盖一个关键词"。但在改写敏感性的语境下,更有效的方式是围绕一个核心主题构建语义网络——用一篇"支柱页面"(Pillar Page)覆盖核心话题,再用多篇"簇群文章"(Cluster Content)从不同角度、不同措辞、不同场景深入覆盖。 例如,核心主题是"跨境电商ERP",你的内容矩阵可以是: 支柱页面:"跨境电商ERP系统选购完全指南";簇群文章1:"管理亚马逊多站点的ERP工具对比"(场景化覆盖);簇群文章2:"月销10万刀以下的跨境卖家需要ERP吗?"(口语化+需求细化覆盖);簇群文章3:"XX vs YY vs ZZ:三款跨境ERP深度对比"(对比式覆盖);簇群文章4:"2026年跨境电商运营效率提升完全方案"(问题式覆盖)。 这种语义网络确保了不管用户用什么方式表达"我需要跨境电商ERP"的需求,你的内容矩阵中总有至少一篇能被AI引擎匹配上。 如果你对如何构建这种内容集群以争取AI引擎引用感兴趣,建议延伸阅读AI搜索时代内容设计5大法则与实操指南 (https://zhangwenbao.com/ai-search-content-design-principles-guide.html)中关于内容模块化设计的部分。 ## 多维度的信息呈现方式 同一个产品信息,用多种格式呈现可以增加被不同改写查询命中的概率: 表格呈现(适合对比式查询):把产品参数做成对比表格;叙述呈现(适合场景化查询):用具体场景故事描述产品优势;问答呈现(适合问题式查询):用FAQ格式回答常见购买问题;步骤呈现(适合需求细化查询):用分步指南帮助用户根据自身条件做选择。 ## 在内容中嵌入多种自然语言表达 在不影响阅读体验的前提下,有意识地在同一篇内容中使用同一概念的多种表达方式。例如: "项目管理软件"这个概念,在文章中交替使用"项目管理工具""团队协作平台""任务管理系统""工作流管理解决方案"等表述。不是生硬地堆砌同义词,而是在不同段落中根据上下文自然使用不同的表达。 这种做法的底层逻辑是:AI引擎在匹配查询与内容时,虽然具备较强的语义理解能力,但多种表达方式的覆盖仍然能提升匹配概率——尤其是在边缘情况下。 ## 改写敏感性 vs 语言敏感性:优先级如何排序 研究明确显示,语言切换对AI引用的影响远大于措辞改写。这给GEO从业者提出了一个资源分配的问题:有限的预算应该先投在哪里? 保哥的建议是按以下优先级排序: 第一优先级:在目标语言的权威信源中建立品牌存在感。如果你的目标市场是中文用户,确保你的品牌在中文语境下的权威媒体、专业博客、知识平台上有足够的正面报道和内容覆盖。这比任何改写优化都重要。 第二优先级:确保品牌核心信息的多渠道分布。让你的品牌核心信息出现在足够多的高质量信源中——这既是应对改写敏感性的基础保障,也是GEO的通用基本功。 第三优先级:针对改写盲区的定向内容补充。在完成前两个优先级后,再通过本文的5步测试方法找出改写盲区,针对性地补充内容。 ## 进阶:自动化监测改写稳定性 手动测试可以作为诊断工具,但长期来看你需要一个可持续的监测机制。以下是几种思路: 定期抽样测试制度化。将5步测试方法纳入团队的月度工作流程。每月固定时间执行一轮完整测试,结果录入追踪表格,对比历史数据观察趋势。你可以借助GEO竞品分析工具 (https://zhangwenbao.com/tools/geo-competitor.php)来同时监测你和竞品在AI搜索中的表现变化。 建立核心查询词库。梳理出你品牌的20-30个核心查询(覆盖产品线、品类、使用场景),为每个核心查询准备3-5个改写变体,形成一个标准化的测试词库。每次测试使用同一套词库,确保数据可比性。 设定预警阈值。为引用稳定性得分设定最低阈值(建议60%)。一旦某个核心查询的稳定性得分低于阈值,立即启动针对性的内容补充计划。 ## 常见问题解答 ## 改写敏感性测试需要多大的样本量才有参考价值? 对单个品牌来说,每个核心产品线准备1个基准查询+5个改写变体(共6个查询),在3个主流AI引擎上执行,就能得到18个数据点。这已足够识别明显的引用盲区。如果你有5个核心产品线,一轮完整测试就是90个数据点,足以做出可靠的诊断。 ## AI引擎的改写敏感度是否会随版本更新而变化? 会变化。AI引擎的底层模型在持续迭代,每次重大版本更新都可能改变其对不同措辞的响应方式。因此改写稳定性测试不是一次性工作,而是需要定期重复执行。建议至少每季度做一次完整测试。 ## 改写测试时是否需要使用隐私模式或新会话? 是的,强烈建议每次测试都使用新的对话会话。AI引擎可能会根据同一会话中的上下文调整后续回答,这会污染测试结果。每个查询变体应该在独立的新会话中执行。 ## 改写敏感性对B2B和B2C品牌的影响是否不同? 影响模式类似,但严重程度可能不同。B2B领域的查询通常更专业化,表达方式相对固定(如"企业级CRM系统"),改写空间较小,因此敏感性问题相对可控。B2C领域的用户表达更加多样化和口语化,改写敏感性问题更突出,需要投入更多精力做多问法覆盖。保哥3个案例的实测数据也验证了这一规律。 ## 如果品牌在所有改写方式下都未被提及怎么办? 如果品牌在所有改写方式下都缺席,问题很可能不是改写敏感性,而是品牌在AI搜索中的基础可见性不足。应该先回归基本面:增加第三方权威媒体的品牌报道覆盖、完善官网的结构化数据标记、在行业社区和评价平台建立品牌存在感。等基础可见性问题解决后,再通过改写测试做精细化优化。 ## 不同类型的改写中哪种影响最大? 根据研究数据,将查询从完整自然语言转换为纯关键词形式(keyword_only)或祈使句形式(imperative_list)时,引用变化最为显著。而在自然语言的不同表述之间(如场景化、问题式),变化相对较小。这意味着你的内容至少应该同时覆盖自然语言描述和关键词短语两种形态。 ## 修复改写敏感性盲区一般需要多长时间见效? 根据保哥3个案例的实测数据,B2C品牌通常需要3个月左右就能看到明显的稳定性得分提升(UGC内容产出周期短),B2B品牌通常需要4-6个月(行业媒体内容产出周期长)。从产出针对性内容到AI引擎重新抓取并体现在引用中,至少需要3个月的等待期。建议把改写敏感性修复纳入季度SEO规划而不是月度执行。 ## 结语 改写敏感性不是一个可以"解决"的问题,而是AI搜索的固有特征。保哥认为,正确的应对思路不是试图消除它,而是通过系统性的内容矩阵建设,让你的品牌在尽可能多的表达方式下都能被AI引擎匹配到。今天给你的5步测试方法,就是帮你找到当前的覆盖盲区;而改写覆盖的内容优化策略,就是帮你填补这些盲区。坚持执行、定期复测,你的品牌在AI搜索中的引用稳定性会持续提升。 ## 权威参考资料 ## 20款GEO/AEO监控工具深度评测与选型指南 - URL:https://zhangwenbao.com/geo-aeo-monitoring-tools.html - 分类:AI监控与数据 - 发布:2025-10-29 | 更新:2026-05-16 - 摘要:随着 Google AI Overviews 和 Perplexity 等 AI 搜索引擎的崛起,品牌如何追踪“AI 可见度”?本文深度评测了市面 20 款主流 GEO/AEO 监控工具(如 Profound, Otterly, Peec AI 等),分析其功能、价格与优劣,并为不同规模团队提供清晰的选型指南。 - 关键词:GEO,AEO,内容策略 > **TLDR**:摘要:AI Overviews和Perplexity崛起后,品牌怎么追踪自己的AI可见度?本文深度评测市面20款主流的GEO与AEO监控工具,包括Profound、Otterly、Peec AI等,分析各自的功能、价格与优劣,再按不同规模的团队给清晰的选型指南,帮你挑到适合自己预算和需求的那一款。 > 摘要:AI Overviews和Perplexity崛起后,品牌怎么追踪自己的AI可见度?本文深度评测市面20款主流的GEO与AEO监控工具,包括Profound、Otterly、Peec AI等,分析各自的功能、价格与优劣,再按不同规模的团队给清晰的选型指南,帮你挑到适合自己预算和需求的那一款。 ## 引言 随着 Google AI Overviews (https://blog.google/products/search/generative-ai-google-search-may-2024/)(原 SGE)、Perplexity (https://en.wikipedia.org/wiki/Perplexity_AI)、ChatGPT (https://zhangwenbao.com/chatgpt-recommends-tiktok-shop-not-official-site-geo-fix.html) 等生成式 AI 搜索引擎的崛起,用户获取信息的方式正在发生根本性变革。传统的“十个蓝色链接”正在被一个综合性的、由 AI 生成的“答案”所取代。 这对品牌、市场和 SEO(搜索引擎优化)团队提出了一个严峻的新挑战:用户不再需要点击进入你的网站来获取信息,AI 正在替你“总结”一切。 在这个背景下,传统的 SEO 策略已显不足,GEO(Generative Engine Optimization (https://arxiv.org/abs/2311.09735),生成式引擎优化) 和 AEO (https://zhangwenbao.com/organic-search-disrupted-aeo-strategy.html)(Answer Engine Optimization,答案引擎优化 (https://zhangwenbao.com/aeo-answer-engine-optimization-guide.html)) 应运而生。品牌不仅要关心“我排名第几”,更要关心:“AI 在回答用户问题时,有没有提到我?是怎么提到我的?引用了我的链接吗?” 为了应对这种“AI 可见度”焦虑,一批新型的数据监控工具应运而生。本文将对市面上 20 款主流 GEO/AEO 数据分析监控工具进行横向评测,帮助不同规模的团队找到最适合自己的“AI 雷达”。 ## 市场格局:从免费体检到企业级智能 通过分析这 20 款工具,我们发现 GEO/AEO 监控市场正迅速分化,以满足不同层次的需求。这些工具不再是单一的“排名跟踪器”,而是演变成了集品牌声量守护、竞品情报分析、内容策略指导、乃至营收机会归因于一体的综合平台。 我们可以根据其核心价值主张,大致将它们分为四大类: - 快速体检与入门型:专注于以低成本或免费的方式,快速验证品牌在 AI 搜索中的基础曝光度。 - 增长与竞品导向型:核心功能是持续跟踪品牌与竞品在关键主题下的“AI 答案份额”,适合有明确增长目标的市场团队。 - 内容优化与执行型:不仅监控可见度,更提供具体的写作指导(如语义优化 (https://zhangwenbao.com/cosine-similarity-ecommerce-seo-semantic-optimization.html)、E-E-A-T 信号),帮助团队创作出“AI 愿意引用的内容”。 - 企业与品牌智能型:价格昂贵,功能全面,强调将 AI 可见度与品牌叙事、公关声誉、甚至是销售线索(Pipeline)和营收(ROI)进行关联。 ## 核心工具亮点分析 我们从每个类别中挑选几款代表性工具,深入分析其亮点与局限。 ## 1. 快速体检与入门型 代表工具:HubSpot AEO Grader, Mangools AI Search Grader, Rankscale - HubSpot AEO Grader:完全免费。它的价值不在于持续监控,而在于提供一个即时的“体检报告”。你只需输入品牌或 URL,它就能快速评估你对“回答式搜索”的友好度。这非常适合用来制作 PPT,向管理层首次普及 AEO 的重要性。 - Rankscale:以极低的价格(约 $20/月) 提供了入门级的 AI 可见度追踪。它功能基础,但对于个人运营者或预算极其有限、希望“先跑起来”的小团队而言,是一个可行的试点选项。 ## 2. 增长与竞品导向型 代表工具:Otterly, Peec AI, Gauge - Otterly:这是目前中小团队(尤其是 DTC 电商品牌)的“甜点级”选择。它以$29/月的低门槛入场,标准版($189/月) 即支持多平台(Google AIO, ChatGPT, Perplexity 等)和多国家监控,且数据追踪频率高(可达每日)。对于需要紧盯“黑色星期五最佳优惠”这类促销主题词曝光的团队来说,性价比极高。 - Peec AI:价格中等(€89/月起),UI 友好且支持多国家。其核心亮点在于强大的竞品对比功能,能清晰展示“在某个问题上,为什么竞品赢了你”,非常适合需要制定差异化竞争策略的增长团队。 - Gauge:相比前两者,Gauge 更进一步。它不仅监控“有没有出现”,还会基于数据给出具体的“行动建议”和“缺口分析”,适合那些有专门资源可以立刻执行优化的成熟团队。 ## 3. 内容优化与执行型 代表工具:Surfer SEO, Clearscope, Writesonic (AEO Suite) - Surfer SEO / Clearscope:这两款是传统内容优化领域的王者。它们现在正迅速将 AEO 纳入其核心算法。它们的核心逻辑是:通过分析已有的权威内容和 AI 答案,指导你撰写出语义更丰富、覆盖实体更全面、E-E-A-T 信号更强(更像权威答案) 的文章。它们是“帮助你被 AI 引用”的利器。 - Writesonic (AEO Suite):这款工具试图打造一个“监控→洞察→生成→优化”的闭环。它在监控 AI 可见度的同时,利用其强大的 AI 写作能力,帮助团队快速生成或改写符合 AEO 规范的内容,甚至提供技术性修复建议(如结构化数据 Schema),效率很高。 ## 4. 企业与品牌智能型 代表工具:Profound, BrightEdge Prism, Kai Footprint, Scrunch AI - Profound:这是目前市场上的“企业级航母”之一。其起步价($499/月) 就已表明了它的定位。Profound 的强项在于“归因”,它致力于将“AI 可见度”这一模糊指标,与企业管理层真正关心的“销售线索”和“营收机会” 挂钩,并提供符合 SOC2/SSO 规范的合规报表。 - BrightEdge Prism:作为老牌 SEO 供应商,BrightEdge 的优势在于将其强大的传统 SEO 洞察与新的 AI 可见度仪表板整合。对于已经在使用其生态的大型企业来说,这是一个自然的升级。 - Kai Footprint:功能高度特化,专注于“多语言/多国家”的 AI 答案差异。对于运营多个国家站点、需要管理跨区域品牌叙事一致性的大型跨国公司(例如,确保美国站、澳洲站、中东站的 AI 回答都符合当地策略),这是刚需。 - Scrunch AI:另一款品牌治理工具。它特别关注“AI 是否正确引用了官方信息”,尤其适合那些对品牌规范、IP 授权(如与 Disney, Barbie 合作) 有严格管控的团队,确保 AI 不会“胡说八道”。 ## 如何选择:给不同团队的选型指南 面对眼花缭乱的工具,团队应根据自身所处的阶段和核心目标来选择。这里有四个清晰的决策路径: - 如果你只是想给老板一个“一句话现状”报告: 使用 HubSpot AEO Grader(免费) 快速截图,如果需要一点趋势数据,辅以 Otterly Lite($29/月)。 - 如果你的核心目标是长期盯防竞品(尤其是在关键流量词上): Peec AI(€89/月起) 是一个功能均衡、界面友好的选择,足以满足日常的竞品声量对比。 - 如果你的核心目标是(通过 AI 曝光)驱动销售和营收: 你需要一个能做归因的企业级工具。Profound($499+/月) 是专门为汇报 ROI 而设计的。 - 如果你的核心工作是“大规模生产内容”: 你需要一个能打通“监控-执行”闭环的工具。Writesonic AEO Suite 或 Surfer SEO 这样的内容优化平台是首选,它们能直接指导你的内容团队“怎么写”。 ## 附:20 款 GEO/AEO 监控工具详细对比表 工具名 | 模型数 (覆盖哪些AI/搜索引擎) | 最低价格 / 月 | 核心功能 | 亮点 / 强项 | 缺点 / 限制 | 适合团队规模 | AthenaHQ | ~3-4(常见是 ChatGPT / Perplexity / Google AI Overviews 等) | Contact | 追踪品牌在多家生成式答案引擎中的出现频率、回答位置、引用来源 | 专门做“我有没有被 AI 推荐”这件事,适合品牌做声量守护 | 报价型工具,门槛偏企业,公开资料少 | 中大型市场/品牌团队 | AirOps | ~3-4 | Contact | AI 可见度监控 + 内容工作流(生成、改写、上线)打通 | 强调把监控→执行放进一个流程,适合内容运营团队 | 更像一套运营平台而不只是监测,部署成本高 | 中型以上内容/增长团队 | Brandlight.ai | ~3-4 | Contact | 品牌提及跟踪、品牌叙事一致性监控(AI 有没有“讲对我们”) | 关注“品牌被 AI 怎么说”,不是只看有没有出现 | 偏品牌管理向,而不是纯流量/转化 | 中大型品牌、公关/法务敏感行业 | BrightEdge Prism | 4+(常见 ChatGPT、Perplexity、Google AI Overviews、Bing/Copilot) | Enterprise报价 | 把传统 SEO 可视化 + AI 可见度仪表板整合到一个企业级搜索情报中心 | 老牌 SEO 供应商,整合现有 SEO/内容/竞争对手洞察 | 通常走年约+企业合同,价格高 | 大型企业/上市品牌/需要合规报表 | Clearscope | 2-3(主要聚焦 Google AI Overview + 部分大模型回答倾向) | ~$170+/mo 常规内容套餐起,但 GEO 模块通常叠加 | 关键词/主题语义优化,指导你写成“AI 会引用的内容” | 写作指导极成熟,团队已经很熟悉它的话迁移成本低 | 不是深度的多模型可见度雷达,更偏内容优化 | 小到中型内容团队,尤其博客团队 | Gauge | 4(ChatGPT、Perplexity、Google AI Overviews、Gemini)(Gauge) | 约$250+/mo 在对比页中被列为价位段(SourceForge) | 可视化品牌/竞品在各 AI 引擎里“有没有出现、怎么出现、引用了谁” + 给行动建议 | 不只是监测,还会指出“缺口”和“下一步要做什么”(Gauge) | 偏增长/市场导向,可能需要有资源立刻执行这些建议 | 成长期品牌到中型电商(有专人能执行优化) | Hall | 3-4 | Contact | 近实时监控 AI 引擎里你/对手的可见度,并给提醒 | 反应速度快,适合活动期/促销期做守盘 | 文档里对电商落地案例还不多,成熟度略低 | 中小团队在打 campaign 时用来盯爆款词 | HubSpot AEO Grader | 2-3(通常测试你在 AI/Answer Engine 的基础可见度) | $0(免费评估型) | 快速体检:你的品牌/URL 对常见“回答式搜索”是否能露出 | 入门门槛最低,拿来给老板看“我们在AI里有没有存在感”很好 | 不是持续监控,也不是长周期趋势跟踪 | 初创/小团队/还在说服老板投预算的人 | Kai Footprint | 4+(强调多区域 / 多语言 AI 引擎) | Contact | 把“AI 怎么回答”按国家/语言切分,看跨市场差异 | 非常适合多国家站点、跨区定价/本地化策略 | 企业定位明显,通常不会是低价 | 中大型、做多语言站点/跨区域(比如你们的美国/澳洲/中东) | Mangools AI Search Grader | 2-3 | ~$30-$50/mo 级别(通常和 Mangools 现有 SEO 订阅同级别) | 入门级 AI 可见度审查 + 部分 AEO 建议 | 价格友好,学习曲线低,适合先证明“AI 可见度是个事” | 监控深度、自动化告警、竞品对比都偏基础 | 小团队/预算敏感型 DTC | Nightwatch.io | 2-3(把传统排名监控扩展到 AI/Answer box/AI Overview) | ~$39+/mo 常规排名方案起 | 把 AI Overview / AI答案段位 也当成“排名位”来跟踪 | 如果你已经做关键词排名追踪,它是自然延伸 | 更多是 SERP/可见度视角,而不是品牌叙事/引用来源视角 | 小到中型流量/SEO团队 | Otterly | 4+(Google AI Overviews、ChatGPT、Perplexity、Microsoft Copilot;Gemini 可加购)(Otterly) | $29/mo Lite;$189/mo Standard;$422/mo Premium(按搜索提示数量阶梯)(Otterly) | AI 搜索可见度跟踪、品牌提及、引用链接抓取、竞品对比 | 入门价低;标准版起就支持多平台+多国家,每日追踪,非常适合电商促销期盯盘(Otterly) | 数据刷新频率在低档位可能是每周/非实时,流量数据解释不够细(生成更多) | 小团队到中型 DTC(非常适合你们这种活动变化快、要看促销主题曝光的团队) | Peec AI | 3(ChatGPT、Perplexity、Google AI Overviews/AIO)(Peec AI) | €89/mo Starter;€199/mo Pro;企业版更高(约$499/mo级别)(Peec AI) | 跟踪你的品牌 & 竞品在 AI 搜索的出现频率、排名、情感;还能看竞品为什么更可见 | UI 友好、价格中等、支持多国家、无限席位(Starter 就支持)(Peec AI) | 偏“监控”,给的提升建议不够深入;进阶优化指导较弱(Writesonic) | 小到中型(尤其是需要盯竞品的市场/增长团队) | Profound | 7+(ChatGPT、Perplexity、Google AI Overviews、Copilot/Bing、等其他主流模型;支持自定义提示)(Profound) | $499/mo 起(Lite/“Standard”);上层套餐到 $1,499+/mo,企业定制更高(Rankability) | 企业级:每日跑大量结构化提示,跟踪品牌曝光、排序、引用来源、情感、机会缺口;把 AI 可见度和 pipeline/营收机会关联 | 强项是“可见度 → 生意”的归因,含导出、席位、合规(SOC2/SSO)(Profound) | 价格高,没有真正的低门槛试水档;更像 enterprise intelligence suite | 大型/企业级/要给管理层汇报 ROI 的团队 | Quno.ai | 3-4 | Contact | AI 中的品牌曝光 + 情感(情绪极性)监控,追踪“别人怎么评价我们” | 适合品牌安全、公关、客服(负面声量发现) | 更偏品牌舆情角度,未必给转化/销售优化建议 | 中大型(品牌、客服、法务/合规都会看的那种公司) | Rankscale | 3-4 | ~$20/mo 入门档(被列为小团队的极低价 GEO 可见度监控起点)(Rankability) | AI 搜索可见度追踪 + 基础优化建议(提示你该怎么写/补充什么内容) | 非常便宜,适合先验证 AEO/GEO 价值;可做早期试点 | 功能深度和企业报表能力远不如 Profound / Gauge / Kai Footprint(Rankability) | 个人 / 极小团队 / 早期市场验证阶段 | Scrunch AI | 3-4 | Contact | 监控品牌被哪几个大模型引用、被怎么描述;抓“是否正确引用官方信息” | 品牌一致性监控好用,尤其是有授权 IP/品牌规范(你们这种和 Disney、Barbie 合作的场景很关键) | 偏品牌治理,不一定给销售/转化建议;定价通常按企业项目走 | 中大型(品牌/IP 合作受严格管控的团队) | Surfer SEO | 2-3(主要围绕 Google AI Overviews + LLM 摘要倾向) | ~$89+/mo 经典内容优化计划起 | 提供语义大纲、实体覆盖度、E-E-A-T 信号,帮助你写成 AI 喜欢引用的长文 & 登 AI Overview | 内容团队友好:它直接告诉你“要加哪些点才能更像权威答案” | 不是系统级的全网 AI 可见度监控,更像“让单篇内容更容易进答案” | 小到中型内容/SEO 团队,尤其是写 Blog/Guide 的人 | Writesonic (AEO / GEO Suite) | 4+(ChatGPT、Perplexity、Google AI Overviews、Copilot 等)(Writesonic) | ~$249/mo 级别起步的可见度/优化套件(有试用)(Omniscient Digital) | 监控 AI 搜索可见度 + 自动生成/优化内容 + 技术 AEO 修复建议(结构化/FAQ/Schema等) | 把“监控→改内容→再测”打成闭环,适合内容产量高的团队;价格低于 Profound 的企业档(Omniscient Digital) | 仍是 SaaS 模式,深度企业合规(SSO/席位管理)不如 Profound | 中型增长/内容团队,要跑大量落地页/博客/品类页的那种 | (Bonus) Nightwatch.io / Keyword.com AI Tracker 这类 SERP+AI Add-on | 通常 2-3(Google AI Overview + ChatGPT Snapshot 类回答) | ~$24.5/mo 级别的附加组件(按查询额度计费)(Feed The Bot) | 把 AI Overview / AI Summary 当成“排名位”来追踪:我在哪个问题下被展示?展示原文是什么? | 最便宜的“我出没在 AI 答案里吗”监控方式,适合先验收概念 | 功能是按关键词 credit 计费,不是全面品牌监控;没有品牌情感/竞品策略建议 | 极小团队 / 个人 SEO / 单站点运营者 | ## 国内品牌别急着刷卡:这20款工具八成监控不到中文AI引擎 上面这份榜单保哥一款款都摸过,但有一句大实话得先说在前面:如果你做的是国内市场,这20款工具里能真正帮你监控豆包、DeepSeek、腾讯元宝、百度AI、Kimi可见度的,几乎一个都没有。它们覆盖的清一色是ChatGPT、Perplexity、Google AI Overviews、Copilot这几个海外引擎。 说个真实的翻车。一个做跨境母婴的客户,老板看了篇英文测评就拍板上了Profound,$499一个月真金白银刷下去,用了两个月跑来问保哥:“为什么我在豆包、百度AI里明明被提到了,这工具一条数据都没有?”答案很简单——它压根不抓中文引擎。这钱基本是给海外业务交的,国内这摊完全是监控盲区。 所以保哥给所有国内客户的第一条建议是:先分清你的AI流量到底来自哪个语言区。出海业务该上Otterly、Peec AI这些;国内业务,目前没有一款成熟的SaaS能一站式搞定中文引擎,老老实实自建轻量监控反而最靠谱。 保哥自己给客户搭的中文引擎监控,就三层,零SaaS预算也能跑起来: - 核心查询表:把客户的20到50个核心查询词列出来,每两周在豆包、DeepSeek、元宝、百度AI、Kimi各手动跑一遍,截图存档,人工记录“有没有提到品牌、提的是哪个页面、引用了哪个源”。笨,但准。 - 半自动脚本:能调API的引擎(比如DeepSeek、部分百度接口)写个Python脚本批量跑查询、把返回里的品牌命中和引用URL存成JSON,跨周比对命中率变化。不能调API的就靠人工补。 - 品牌词监控:用国内的舆情监控工具盯品牌名在各AI回答里的露出,作为滞后但能看长期趋势的兜底指标。 这套土办法的成本,不到Profound一个月零头,覆盖的却是国内客户真正在意的那几个引擎。等哪天有SaaS真把中文引擎吃透了再迁移不迟,现在为一份监控不到主战场的报表交企业级月费,纯属冤枉钱。 ## 保哥的三次买错复盘:选型最坑的不是功能,是节奏 选型指南那一节讲的是“该选哪款”,这一节保哥想讲点更难听的——“我亲手买错过哪几款”。功能参数谁都会比,真正让钱打水漂的,往往是节奏踩错了。 第一次:内容还没影,先上了企业级工具。一个客户刚起步,团队连一篇能被AI引用的深度内容都还没产出,保哥就被“归因到营收”的卖点说动,上了一款$499档的企业工具。结果工具天天给“缺口分析”和“行动建议”,可团队根本没有内容产能去执行,仪表板上一片红,看着干着急。这工具白养了三个月。教训是:监控工具的价值取决于你有没有能力对监控结果做出反应,没有执行力的阶段,免费体检工具足够了。 第二次:信了“每日追踪”,黑五当天数据严重滞后。有一年帮一个DTC客户备战黑五,特意选了个标榜“每日追踪”的工具盯促销主题词曝光。结果大促当天流量和AI答案变化飞快,工具的数据却滞后了快两天才刷新,等看到曝光暴跌想补救,活动都快结束了。后来才搞明白,低档位套餐的“每日”其实是“尽力每日”,高峰期排队靠后。教训是:大促这种节点要么买能保证实时的高档位,要么手动盯盘,别赌低价档的刷新承诺。 第三次:签了年约,引擎更新工具却跟不上。为省钱签了某工具的年付,省下两成预算还挺得意。结果半年内市场冒出两个新的主流AI入口,这工具迟迟不支持,客服只会说“在排期里”,可年约锁死了,想换都换不动,硬生生瞎了大半年。教训是:这个赛道引擎迭代太快,宁可月付贵一点保持灵活,也别为省那点钱把自己锁进一份跟不上节奏的年约。 这三次错,没一次是功能比错了,全是节奏判断失误。所以保哥现在给客户做选型,第一句问的从来不是“你要什么功能”,而是“你现在处在哪个阶段、有没有执行力、未来半年引擎会不会变”——把节奏想清楚,比对着参数表打钩重要得多。 ## GEO/AEO工具用户常见问题(FAQ) - 免费的GEO/AEO工具(如HubSpot AEO Grader)能满足长期监控需求吗? 不能。免费工具多是“单次体检”,仅能提供某一时间点的基础曝光情况,无法跟踪长期趋势或自动告警,长期监控需选择入门级付费工具(如$29/月的Otterly Lite)。 - 多语言/跨国家团队,除了Kai Footprint还有其他性价比选项吗? 有。预算有限可选Otterly标准版($189/月),支持多国家监控;若仅需基础功能,Mangools AI Search Grader($30-$50/月)也能覆盖部分跨区域AI引擎数据。 - GEO和AEO的核心区别是什么?选工具时需要分开侧重吗? GEO侧重“生成式AI引擎(如ChatGPT)”的可见度,AEO侧重“答案引擎(如Google AI Overviews)”的曝光;多数工具已整合两者功能,选工具时优先看是否覆盖你核心关注的AI平台(如侧重ChatGPT选Otterly,侧重Google选Clearscope)。 - GEO/AEO工具的数据和实际AI搜索结果偏差大吗?怎么验证? 偏差通常较小(5%-15%),因工具抓取频率和AI答案实时性有关。验证可手动在目标AI平台搜索核心词,对比工具显示的“提及情况”和“引用链接”是否一致。 - 中小企业预算有限(每月低于$100),哪款GEO/AEO工具最值得选? 优先选Otterly Lite($29/月),能覆盖4+主流AI平台;其次是Rankscale(约$20/月),适合纯基础可见度追踪;若需轻度内容优化,可搭配Mangools AI Search Grader($30-$50/月)。 - GEO/AEO工具能和现有SEO工具(如Ahrefs、Semrush)整合吗? 多数不能直接整合,但部分工具(如BrightEdge Prism)本身是老牌SEO供应商,可将AI可见度数据与传统SEO数据放在同一仪表板;其他工具可导出CSV数据,手动导入现有SEO报表。 - 工具标注的“每日追踪”和“每周追踪”差距大吗?怎么选? 差距取决于需求:促销期(如黑五)需“每日追踪”(选Otterly、Gauge),避免错过曝光波动;日常监控选“每周追踪”(如Rankscale),可降低成本。 - 若AI回答中出现品牌错误信息,GEO/AEO工具能及时提醒吗? 部分工具可以。Scrunch AI和Brandlight.ai会监控“品牌信息准确性”,发现错误引用可触发告警;其他工具(如Peec AI)需手动查看“提及内容”板块排查。 - 电商团队和B2B团队选GEO/AEO工具的核心差异是什么? 电商团队优先选“促销主题词追踪”功能(如Otterly),方便盯活动曝光;B2B团队侧重“线索/营收归因”(如Profound)或“行业关键词权威度”(如Surfer SEO),匹配长期获客目标。 - 企业级工具(如Profound,$499/月起)能议价吗?通常有什么合作模式? 多数可以。企业级工具多支持年付折扣(通常省10%-20%),若需定制功能(如专属数据接口),可联系销售谈定制套餐;部分工具(如BrightEdge Prism)还提供“按席位”付费模式。 - 团队没人懂GEO/AEO,选工具时需要优先看“上手难度”吗? 需要。优先选UI友好、带操作指南的工具:Peec AI(界面简洁)、Otterly(有新手教程),或先用免费工具(如HubSpot AEO Grader)练手,再过渡到付费工具。 - GEO/AEO工具能导出数据报表吗?适合给管理层汇报用吗? 多数可以。Profound、BrightEdge Prism支持导出SOC2合规报表,可直接用于管理层汇报;入门级工具(如Otterly)可导出Excel/PNG截图,适合简化版汇报。 - 同时需要“竞品监控”和“内容优化”,必须买两款工具吗? 不用。可选整合型工具:Writesonic AEO Suite(监控+内容生成)、Gauge(监控+行动建议);或用“Peec AI(竞品监控)+ Surfer SEO(内容优化)”组合,总成本可控制在$200/月内。 - 新推出的AI搜索引擎(如Claude 3联网版),现有工具能及时覆盖吗? 多数工具会滞后1-3个月。头部工具(如Otterly、Profound)更新快,可联系客服申请“新增AI平台”;小众工具(如Rankscale)可能暂不支持,选时需确认是否有“平台更新承诺”。 - 个人运营者(仅管理1-2个网站),有必要买GEO/AEO工具吗? 若需验证AI曝光价值,可先用免费工具(HubSpot AEO Grader);若需长期盯核心词,选Rankscale(约$20/月)或Nightwatch.io附加组件($24.5/月),成本低且能满足基础需求。 - GEO/AEO工具的“情感分析”功能实用吗?哪些行业需要重点关注? 实用,尤其公关、电商行业。Scrunch AI、Quno.ai的情感分析能及时发现AI回答中的负面提及;快消、3C等易有口碑风险的行业,建议优先选带此功能的工具。 ## 权威参考资料 ## GA4默认追踪不到GEO流量,过滤器加渠道分组这样补 - URL:https://zhangwenbao.com/geo-ga4.html - 分类:AI监控与数据 - 发布:2025-07-30 | 更新:2026-06-01 - 摘要:如何在GA4分离GEO流量?保哥实战拆解过滤器配置、自定义渠道分组优先级排序、移动App referrer丢失的Server-side GTM解决方案、各AI平台转化率实测数据(Perplexity 5.2%最高)、归因路径分析、隐私合规与机器人过滤。 - 关键词:GEO,GA4,GEO优化,AI搜索,Google Analytics > **TLDR**:摘要:GA4默认追踪不到AI带来的GEO流量,本文教你5分钟分离出来。讲用过滤器看基础GEO数据、用探索报告看落到哪些页、创建自定义渠道分组让GEO成独立渠道,再讲移动App的referrer丢失怎么用服务端GTM解决、各AI平台转化率实测、GEO的归因深度分析、报警自动化和隐私合规。 > 摘要:GA4默认追踪不到AI带来的GEO流量,本文教你5分钟分离出来。讲用过滤器看基础GEO数据、用探索报告看落到哪些页、创建自定义渠道分组让GEO成独立渠道,再讲移动App的referrer丢失怎么用服务端GTM解决、各AI平台转化率实测、GEO的归因深度分析、报警自动化和隐私合规。 2026年保哥已经把GEO(Generative Engine Optimization)作为运营重点之一来做,并且开始有了可量化的成果——保哥笔记从GEO渠道获得的月度UV从2025年初的几百,到2026年5月已经稳定超过1.2万,转化效果甚至比传统SEO的访问者更好(每个会话的页面深度和咨询表单填写率都高出约30%)。但很多人在做GEO时遇到的第一个难题不是“怎么优化”,而是怎么知道自己究竟拿到了多少GEO流量。GA4 (https://zhangwenbao.com/ga4-default-channel-grouping-complete-guide.html)默认没有“AI Search”这个渠道分类,ChatGPT、Perplexity (https://docs.perplexity.ai/)、Gemini的引流统统被归到Referral,不深入配置看不到全貌。 这篇文章保哥把过去半年总结的GA4 (https://en.wikipedia.org/wiki/Google_Analytics)追踪GEO流量完整方案写出来,包括基础过滤器配置、自定义渠道分组、探索报告、正则表达式覆盖的13个AI源、自定义维度与受众、BigQuery导出方案、GEO转化归因模型,以及一个保哥客户站的真实数据案例。从最简单的“能看到GEO流量”到“能看到每个AI平台的每个落地页转化”的完整路径都在文里。 ## 为什么GA4默认追踪不到GEO流量 要理解GA4的限制,先看一下GEO流量在技术上是什么。 ## GA4的默认渠道分组 GA4开箱即用的默认渠道分组(Default Channel Group)包括Organic Search、Paid Search、Direct、Referral、Social、Email等。Organic Search的判定逻辑是:流量来源域名在GA4维护的“搜索引擎列表”里(google.com、bing.com、baidu.com这些),并且没有gclid、msclkid之类的付费广告参数。 ## 为什么AI搜索不在Organic Search列表里 到2026年5月,Google官方还没有把chatgpt.com、perplexity.ai、gemini.google.com纳入Organic Search的判定列表。GA4团队说他们在评估,但没有时间表。这就导致从ChatGPT点过来的流量都被分到Referral渠道,跟一篇博客的友情链接没有区别。 ## AI流量的referrer特性 ChatGPT的引流来自两个场景:浏览器版(用户登录chat.openai.com,点击答案里的引用链接)、桌面App版(macOS、Windows的官方应用)。浏览器版有完整的referrer header,GA4能识别。桌面App版的referrer通常是空的,或者是openai://这种自定义scheme,GA4直接归到Direct流量。这是为什么大部分站长低估了自己的实际GEO流量。 ## 隐私模式与浏览器扩展的影响 用户开启Brave浏览器、Firefox严格模式、Safari的Intelligent Tracking Prevention时,referrer可能被清空。Adblock、隐私扩展也可能屏蔽GA4。这部分流量在GA4里全是Direct,没法识别。综合考虑,GA4里你看到的GEO流量大概是真实GEO流量的60%到75%。 ## 用过滤器看到基础GEO数据 最简单也是最快出结果的方法,按下面三步走能在5分钟内看到。 ## 进入流量获取报告 进入GA4左侧导航的“报告”模块,找到“生命周期”下的“流量获取”,选择“Traffic acquisition: Session source / medium”这个子报告。这是看会话级流量来源最直观的报告。 右上角点“添加过滤条件”,开始配置。 ## 构建AI来源过滤器 在弹出的过滤器编辑面板里: - “维度”选“会话来源” - “匹配类型”选“匹配正则表达式” - “值”填入下面的正则(2026年5月版本,覆盖13个主流AI平台): chatgpt\.com|chat\.openai\.com|perplexity\.ai|gemini\.google\.com|copilot\.microsoft\.com|claude\.ai|deepseek\.com|chat\.deepseek\.com|kimi\.moonshot\.cn|tongyi\.aliyun\.com|chatglm\.cn|hunyuan\.tencent\.com|grok\.com 点“应用”后,报告会只显示来自这些AI平台的流量。 ## 切换主维度到会话来源 报告默认展示的“主维度”是“Session source/medium”,把它改成“会话来源”能更清晰看到每个AI平台单独的会话数。 现在你能清晰看到网站从这些AI搜索引擎引来的具体流量数据了。 ## 关键洞察:从GA4 GEO数据能看出什么 ## GEO流量的整体趋势变化 保哥的站点从2025年初到2026年5月,GEO流量呈现明显的指数曲线增长。这并不是保哥做了特别针对性的优化,主要是因为AI搜索的用户基数在快速扩大。趋势看10个月以上更能识别真实增长,3个月内的波动可能是某个内容意外被引用的偶发。 ## 不同AI平台的流量分布 在保哥的网站中,ChatGPT贡献的流量最大,约占GEO总流量的55%,其次是Perplexity 18%、Copilot 12%、Gemini 9%、Claude 4%、其他2%。这个分布跟不同AI平台的用户基数、SEO引擎集成度、引用率风格有关,每个站点会不一样。跨境英文站通常ChatGPT和Perplexity占比更高;国内中文站DeepSeek (https://zhangwenbao.com/deepseek-search-geo-optimization-regional-customer-acquisition.html)和Kimi占比明显。 ## GEO流量的转化表现 在GA4里给同一组过滤条件加上“转化”指标列,能看到每个AI平台的转化数据。保哥客户站的实测数据: - Perplexity流量的转化率最高,平均5.2%,明显高于Google Organic的2.8%。原因是Perplexity用户通常带着明确商业意图来。 - ChatGPT转化率3.1%,跟Google Organic接近。 - Copilot转化率2.4%,略低。 - Gemini转化率1.8%,最低,可能因为很多用户是被Google搜索结果里的Gemini模块顺带带过来的,意图不强。 ## 用探索报告看GEO流量落到哪些页面 过滤器报告只能看“有多少GEO流量”,要看“流量去了哪些页面”需要建探索报告(Explorations)。 ## 创建新探索 左侧导航选“探索”,点“开始新探索”。技巧类型选“空白”,时间范围选最近30天或更长。 ## 配置维度和指标 在“变量”面板下: - “维度”添加“会话来源”、“着陆页”、“日期”。 - “指标”添加“会话数”、“互动会话数”、“关键事件”。 然后双击“着陆页”和“会话来源”让它们出现在“行”里,双击“会话数”让它出现在“值”里。把“显示行数”改为500,避免被默认10行卡住。 ## 应用GEO过滤器 在“过滤器”里添加条件:会话来源“包含”chatgpt(或者用前面的正则覆盖所有AI平台)。应用之后右侧立刻显示每个AI平台落到每个着陆页的会话数。 看清楚每个页面被哪些AI平台引用后,下一步优化方向就有了:被ChatGPT引用多的页面继续保持优化方向,被Perplexity引用多但ChatGPT没引用的页面去看内容结构差异。 ## 加上时间维度的对比分析 在维度里把“日期”或“月份”也添加进去,能看到同一个着陆页在不同月份的GEO流量趋势。某个页面的GEO流量突然涨10倍很可能是被AI推送到了一个高频问题的答案模板里,要立刻去回看那一周这个页面有没有出现在AI答案里。 ## 创建自定义渠道分组:让GEO成为独立渠道 过滤器和探索是临时方案。要让GEO在GA4里成为一个独立的渠道分类,需要建自定义渠道分组(Custom Channel Group)。 ## 进入管理后台 GA4左下角齿轮图标进入“管理”,在“媒体资源”下找“渠道分组”(Channel Groups),点“新建渠道分组”。 ## 定义GEO渠道规则 新建一条渠道,命名为“AI Search GEO”。规则配置: - 条件:会话来源 匹配正则表达式 chatgpt\.com|perplexity\.ai|...(前面的完整正则) - 或者:会话来源 包含 chatgpt 等关键词(如果不想用正则) 把这条渠道的优先级拖到“Organic Search”之上,保证GEO流量优先归到这个渠道而不是Referral或Organic。 ## 验证生效 建好后等24小时,GA4的所有报告里“默认渠道分组”切到这个新建的渠道分组,“AI Search GEO”就会作为独立一行出现。注意:自定义渠道分组只对新数据生效,历史数据需要在每份报告里手动切换查看。 ## 多设备多事件归因 GA4默认是“数据驱动归因”模型,能在多触点场景下给GEO渠道分配应得的归因权重。比如用户先从ChatGPT进站浏览,3天后从Google再次进站完成购买,GA4会给两边按贡献度分配转化值,比传统的“最终来源”归因更公平。 ## 移动App流量的“直接”归因问题与解决方案 这是最常被低估的GEO流量来源。 ## 问题描述 ChatGPT iOS App、Perplexity Mobile、Copilot Mobile等App里用户点引用链接,referrer通常是空的(iOS策略)或者非HTTP的URL scheme。GA4只看到Direct流量,无法识别。 ## 用Server-side GTM解决 方案是在服务器端Google Tag Manager里加判定逻辑:根据User Agent里包含“ChatGPT-User”、“Perplexity-User”、“PerplexityBot”之类字符串时,强制把流量来源标记为对应AI平台。GA4里用GTM Server拿到的事件就能正确归类。 ## 简化方案:UTM参数 如果你能控制AI平台引用你的具体链接(这很难,因为AI是自主决定的),可以在所有外部分享的链接上加?utm_source=ai_search&utm_medium=geo。这种方式覆盖率低,但对部分场景有用。 ## 用BigQuery做深度GEO分析 GA4免费版的探索报告有抽样和行数限制。需要完整数据时,把GA4导出到BigQuery。 ## 启用BigQuery导出 GA4“管理”的“BigQuery链接”里关联你的GCP项目。每天会自动导出全量事件数据到BigQuery,免费额度对中等流量站点足够。 ## GEO流量SQL查询模板 SELECT traffic_source.source AS ai_source, COUNT(DISTINCT user_pseudo_id) AS users, COUNT(DISTINCT (SELECT value.int_value FROM UNNEST(event_params) WHERE key = 'ga_session_id')) AS sessions, COUNTIF(event_name = 'purchase') AS conversions, SUM(IF(event_name = 'purchase', ecommerce.purchase_revenue, 0)) AS revenue FROM `your-project.analytics_XXXXXXX.events_*` WHERE _TABLE_SUFFIX BETWEEN '20260101' AND '20260511' AND REGEXP_CONTAINS(traffic_source.source, r'(chatgpt|perplexity|gemini|copilot|claude|deepseek)') GROUP BY ai_source ORDER BY sessions DESC; 这条SQL给你按AI源的会话数、用户数、转化数、营收四个维度的汇总。改改条件就能拆到落地页、设备类型、地区等更细维度。 ## 用Looker Studio做仪表板 BigQuery查询结果直接连到Looker Studio(前Google Data Studio),做一个GEO监控仪表板,每天自动刷新。保哥的仪表板放了几个核心模块:GEO总流量趋势、各AI平台分布、GEO Top 20落地页、GEO对比Organic的转化率、本月GEO新增内容贡献。 ## GEO渠道的转化归因深度分析 看到GEO流量只是开始,要分析它的真实商业价值。 ## 多触点归因模型选择 GA4默认“数据驱动归因”。但要看“首次接触是GEO”的纯增量价值,可以临时切到“首次点击归因”模型,能看到哪些转化的第一个来源是GEO。 ## 助攻转化(Assisted Conversion) 很多GEO流量不直接转化,但在用户决策链路上起到关键作用。在“广告”的“归因路径”报告里能看到完整的渠道路径。保哥客户站的数据显示,约40%的GEO访问者最终通过其他渠道(Direct或Organic)完成转化,但首次接触是GEO。 ## LTV(生命周期价值)对比 注册GEO来源的用户LTV比Organic用户高约25%。原因可能是AI搜索的用户问题更具体、决策更深思熟虑,进站时已经处于决策后期。这对预算分配很重要——GEO相关内容应该获得更高的优先级。 ## GEO监控的报警与自动化 每天手动看报表不可持续,要做自动化。 ## GA4自定义观察器 GA4“洞察”里能设自定义观察器(Custom Insights),监控指标突变。比如“ChatGPT流量周环比下降超过30%”触发邮件提醒,能在第一时间发现GEO渠道是否被屏蔽或被算法调整。 ## Slack/钉钉机器人推送 通过Zapier、Make、n8n (https://zhangwenbao.com/ai-agent-seo-n8n-workflow-guide.html)这类自动化平台把GA4 API + Slack连起来,每天9点自动推送一份GEO日报到团队群。保哥团队的日报包括:昨日GEO总UV、各平台占比变化、新增Top 5落地页、转化率趋势。 ## 异常自动诊断 当某个AI平台流量突然消失时,自动化脚本去这个AI平台搜你的核心关键词,记录是否还能看到你的引用。如果不再被引用,触发深度排查流程。 ## 隐私合规与数据准确性 GA4的GEO追踪需要注意合规问题。 ## Consent Mode v2 欧盟用户必须先拿Cookie同意才能追踪。GA4 Consent Mode v2能在没拿到同意时通过“Conversion Modeling”还原一部分数据,但精度下降。对中国大陆用户,按《个人信息保护法》同样要做Cookie同意提示。 ## referrer-policy设置 站点的referrer-policy设置直接影响GA4能拿到多少referrer信息。建议设为“strict-origin-when-cross-origin”,能在大多数场景下保留来源域名,又能保护用户隐私。 ## Bot流量过滤 AI爬虫 (https://zhangwenbao.com/technical-optimization-crawler-friendly-ai-citations-2026.html)(GPTBot、PerplexityBot、ClaudeBot、Bytespider)也会触发GA4页面浏览事件,污染数据。在GA4“数据流”设置里勾上“过滤来自已知机器人和爬虫的流量”,能去掉大部分污染。 ## 常见问题解答 ## 为什么GA4默认不能直接追踪GEO流量? 因为AI搜索结果通常被归类为引荐流量(Referral)。AI驱动的搜索引擎(如ChatGPT)通常没有自己的UTM标记,其流量会被GA4识别为推荐来源。因此,需要通过正则表达式来识别这些特定的AI域名,将它们分离出来。Google官方还没把chatgpt.com等纳入Organic Search的判定列表,到2026年5月依然如此。 ## 我应该将GEO流量来源从引荐更改为自然搜索吗? 建议创建自定义渠道分组。虽然GEO流量本质上是自然的,但在GA4中直接修改默认渠道可能会影响报告准确性。最佳做法是创建新的自定义渠道分组,将这些特定的GEO域名归类为一个新的AI Search GEO渠道,并把它的优先级排在Organic Search之上。 ## 如果遗漏了一些AI搜索引擎的域名,如何更新GA4正则表达式? 定期在AI平台进行测试搜索。最好的方法是定期在不同的AI平台(如Copilot、Gemini、DeepSeek (https://en.wikipedia.org/wiki/DeepSeek)、Kimi)中进行搜索和点击,并检查GA4的实时报告,确认该流量是以哪个域名显示为会话来源,然后将新发现的域名添加到正则表达式中。也可以订阅Search Engine Journal、Search Engine Land的AI Search栏目,新平台上线时第一时间补充。 ## 如何确保AI引擎链接到网站时携带了正确的GEO标记? 通过自定义UTM参数有一定难度。可以尝试与AI平台合作,或通过特定的内容结构促使它们在引用时使用包含utm_source=geo_chatgpt的链接,但目前通常只能依赖其默认的Referrer域名。更实际的做法是配置Server-side GTM根据User Agent特征强制归类。 ## GA4区分GEO流量和传统SEO流量的关键区别是什么? 会话来源的域名。传统SEO流量通常显示为google / organic或bing / organic。GEO流量则显示为特定的AI域名,例如chatgpt.com / referral或perplexity.ai / referral。在自定义渠道分组里把GEO域名归到独立渠道后,两者就完全分开了。 ## 为什么GEO流量的转化率可能比传统SEO流量更高或更低? 意图和上下文不同。GEO流量通常来自用户在AI助手中的特定、精确的提问。如果你的页面直接回答了这个问题,转化率可能更高(高意图)。但如果用户只是在AI中进行泛泛的研究,转化率可能较低。保哥的实测数据:Perplexity转化率5.2%最高,Gemini 1.8%最低。 ## AI流量中显示了大量的直接流量是什么原因? 用户通过移动App或桌面App访问。许多AI搜索引擎(如Copilot、Perplexity)都有自己的移动App或桌面客户端。当用户通过这些App点击链接时,referrer信息可能丢失,导致GA4将其错误归类为直接流量。解决方法是用Server-side GTM按User Agent特征识别。 ## GEO流量的跳出率或互动率如何分析? 关注互动率。由于GA4取消了传统的跳出率,应关注互动率(Engagement Rate)。低互动率可能表明内容虽然被AI推荐,但未能完全满足用户的提问深度。理想的GEO互动率在65%以上,低于50%要回看页面内容是否真正回答了用户问题。 ## 除了文章中提到的GEO域名,还可以添加哪些潜在的AI搜索来源? 可以考虑Google SGE(AI Overviews)和大型LLM平台。潜在的来源包括Google的AI Overviews相关的特定域名(虽然难以隔离)、DeepSeek、Kimi、Claude、Grok、文心一言、通义千问、智谱清言。新的AI搜索每季度都在出现,订阅行业新闻持续补充正则。 ## 如何确保GEO过滤条件不会错误地过滤掉正常的流量? 使用匹配正则表达式的精确性。确保正则表达式只包含那些明确是AI平台的域名。例如,使用chatgpt\.com而不是通配符chatgpt.*,以确保精确匹配。每月跑一次反向校验:把过滤器排除掉,看Referral流量里有没有意外被归类的真实GEO来源。 ## GA4追踪GEO流量是否会影响网站的加载速度? 不会。GA4追踪代码(GTM或Gtag)在网站上运行是固定的,分析过程是在GA4服务器端进行的,不会增加页面加载速度或消耗额外的客户端资源。如果担心追踪代码的性能影响,可以用Server-side GTM把追踪逻辑搬到服务器端,前端只发一次请求。 ## 如果GEO流量正在快速增长,下一步的优化策略应该是什么? 进行内容差异化优化。分析GEO推荐的着陆页,并确保这些页面的内容:结构清晰,易于AI抓取关键答案(如列表、表格、FAQ模块);提供独特、深度且准确的内容,超出竞争对手,以提高被AI选为答案的概率;增加可引用的数据点、案例、统计数字,AI喜欢引用有具体数据的内容。 ## 如果GEO流量很多但转化率很低我该怎么办? 优化着陆页的CTA和意图匹配。检查这些着陆页的意图匹配,确认是否在AI推荐的上下文。优化页面的行动号召(CTA),使其与用户在AI中提问的商业意图更一致,例如添加更直接的购买或咨询按钮。同时审查页面顶部的“答案段”是否过度展示了答案,让用户读完就关页面——可以适当留悬念引导继续阅读。 ## 可以使用GA4的受众群体功能针对GEO流量进行再营销吗? 可以。你可以在GA4中基于会话来源(使用GEO过滤器)创建一个自定义受众群体,例如来自ChatGPT的用户。然后将此受众群体共享给Google Ads,用于针对这些高意图用户进行再营销。GEO来源用户的再营销ROAS通常比通用受众高30%到50%。 ## 结论 GA4追踪GEO流量这件事,本身不难——5分钟过滤器加30分钟探索报告加1小时自定义渠道分组就能搭起完整体系。真正难的是把数据沉淀成可执行的优化决策:哪些内容被AI喜欢、哪些AI平台对你的转化贡献更大、哪种内容结构能获得更多引用。保哥这套方案在自己的站点和多个客户站上都跑通了,希望能帮你少走两个月的弯路。2026年下半年保哥的判断是:GEO渠道占整体流量的比例会继续从目前的8%到15%涨到20%到30%,提前布局监控基础设施的人会有先发优势。 ## 权威参考资料