AI可见度排名为什么每次查都不一样?2961次实测说名次是噪声
本文目录
- 同一个问题问一百遍,AI会给出多少份不同的名单?
- 但先别急着说“AI完全没规律”
- 为什么“稳的是核心圈、不稳的是排序”这件事这么关键?
- 真人问同一件事,措辞能差多少?
- 那份论文给的量化门槛是多少?
- 顺手固化一套厂商研究的读法
- 判定一个排名可信,要同时满足哪两个条件?
- 33到94次,这个区间是怎么来的
- 把这些数字翻译成一份能执行的采样方案
- 为什么不同引擎需要不同的采样预算?
- 前十名的误差有多大,什么时候才该往上报?
- 这份论文没有证明什么?
- 换到中文场景,这件事会更好还是更糟?
- 那到底还要不要测?测到什么程度该停?
- 不买工具的话,怎么自己跑一次最小可行的采样?
- 出现率之外,还有什么值得记?
- 自己动手测的时候,最容易犯哪几个错?
- 老板要一个名次,你怎么解释才不像在找借口?
- 这套统计规律对内容策略有什么直接影响?
- 一份不自欺的AI可见度周报,长什么样?
- 一个宠物用品站的两轮测量,前后差了多少?
- 常见问题解答
- AI可见度工具给的排名,是不是完全不能用?
- 要跑多少次才能相信一份数据?
- 为什么同一个问题问两次,AI给的品牌名单会不一样?
- 该多准备问法,还是该多跑几次?
- 那份说排名是统计噪声的论文,可信吗?
- 中文场景下测AI可见度,会比英文更难吗?
- 比起名次,更该盯什么指标?
- 周报里到底该怎么写才不算糊弄?
- 权威参考资料
摘要:你在AI可见度工具里看到的那个名次,多半没有你以为的那么实在。一项600人参与、跑了2961次的实测给出的结论是:同一个提示词问100次,拿到完全相同推荐名单的概率不到百分之一;连顺序都一样的,大约要跑一千次才碰得上一回。
但事情还有另一半:被推荐的核心品牌其实相当稳。某家代理商在95条回答里出现了85次,某家医院在71条里出现69次。不稳的是排序和长尾,稳的是核心圈——这决定了该测的是出现率,不是名次。另一份论文进一步给出量化门槛:要让排名的顺序稳定、且头部差距超出误差,需要33到94条带引用的回答,有3组跑到125个问题仍分不出高下。下面拆这套统计逻辑、中文场景的额外折扣、以及一份不自欺的周报该怎么写。
同一个问题问一百遍,AI会给出多少份不同的名单?
先从一个你现在就能自己验证的观察说起。
SparkToro在2025年11月到12月做过一次规模不小的实测:600名志愿者,12个不同的提示词,分别在ChatGPT、Claude和谷歌AI概览上跑,合计2961次。结论相当粗暴:
- 问100次,拿到完全相同那份名单的概率不到1次。
- 要碰上两份不仅内容相同、连顺序都一致的名单,大约得跑一千次。
这个结果动摇的是一个很基本的假设:我们默认“查询到结果”是一个稳定映射,像查字典一样。传统搜索大体满足,同一个词今天查明天查,前十名不会大变。生成式回答不满足——它每次都在重新生成,而生成本身带着随机性。
Rand Fishkin给的建议因此毫不客气:任何给你一个“AI里的排名位置”的工具,都是在胡扯。他另外那句更该被贴在办公室墙上:在为AI可见度追踪花一分钱之前,先确认服务商能回答这些问题、并且把它的计算过程亮出来。
这个要求听起来很基本,但你真的拿去问,很多工具的回答会突然变得含糊:一个数字背后跑了多少次?怎么聚合的?误差多大?这份研究把该问的问题一条条列了出来,拿它当验收清单最省事。
但先别急着说“AI完全没规律”
如果只看上面那两条,容易滑到另一个极端:既然全是随机的,那这事没法测了。恰恰相反。同一份研究里还有另一半结果,而这一半被转述得少得多:
| 被测对象 | 出现情况 | 出现率 |
|---|---|---|
| 某数字营销代理商 | 95条回答里出现85次 | 约89% |
| 某医院 | 71条回答里出现69次 | 97% |
| 某位影响力人物 | 73条回答里出现36次 | 约49% |
| 某几个耳机品牌 | 反复测试中 | 55%到77% |
| 某几家品牌设计代理商 | 反复测试中 | 30%到40%区间 |
看出来了吗?名次每次都在洗牌,但“谁会被提到”这件事相当稳定。一家97%出现率的机构,你问一百次它出现九十七次,这个数字可靠得能拿去做决策;而它这一百次里排第几,纯属看运气。
所以正确的结论不是“测不了”,而是测错了对象。研究本身也是这么说的:跨数十到数百次运行统计出来的出现率,是一个合理的指标。名次不是。
为什么“稳的是核心圈、不稳的是排序”这件事这么关键?
因为它直接决定了你该往哪儿使劲。
如果不稳定是全局的,那唯一的策略就是广撒网碰运气。但既然核心圈是稳的,那真正的分水岭就落在你在不在那个圈里——进了圈,出现率就在七八成上下浮动;没进圈,你在长尾里被偶尔提到一次,看起来像是有排名,实际上是噪声。
这也解释了一个常见的困惑:为什么有的品牌“查得到但抓不住”。你的工具显示这周第5、下周第9、再下周没了,团队以为是排名在波动,实际情况多半是你压根没进核心圈,每次出现都是抽签抽中的。这种状态下讨论怎么从第9升到第5,是没有意义的。
判断自己在不在圈里,方法很土但有效:同一个问题跑二三十次,数出现了几次。七成以上,你在圈里,接下来该做的是巩固和扩品类;三成以下,你在长尾,接下来该做的是想办法被更多可信来源提及,而不是优化名次。四五成之间是最难受的中间态,通常意味着你只在某些问法下才被想起来。
真人问同一件事,措辞能差多少?
同一份研究里还有个数字,单独拎出来很有意思。
他们让142个真人各自写提示词去问同一类问题,收了994条回答,然后算这些提示词之间的语义相似度:平均只有0.081。几乎可以说,真人在问同一件事的时候,措辞彼此毫不相似。
但结果呢?尽管措辞五花八门,模型给出的推荐集合却经常高度重叠——它能识别出这些说法背后是同一个意图。
这两件事放在一起,推翻了很多人正在做的事情。目前主流做法是拼命扩充提示词池:同义词、长尾问法、各种句式,攒到几百条,然后每条问一次。可研究告诉我们:意图相同的不同问法,结果高度重叠;而同一个问法的不同次运行,结果差异巨大。
结论就有点反直觉了:你不需要穷举问法,你需要穷举次数。与其准备300个问法各问一次,不如挑30个真正有代表性的问法各问十次。前者给你一堆互相重复的信息加上满满的噪声,后者才给得出能算出置信度的分布。
保哥见过好几个团队在这件事上花了冤枉钱,问题池做得极其精美,每个问法却只跑一次——等于把预算全花在了信息重复的那个维度上。改写问法带来的引用敏感性确实存在、也值得单独测,但它和“重复采样”是两件不同的事,不能互相替代。
那份论文给的量化门槛是多少?
2026年4月发表的另一篇论文,把这件事从“感觉不稳”推进到了“需要多少次才够”。作者是Ron Sielinski,来自IQRush,这篇报道把它的关键数字整理得比较全。
先把利益关系摆出来:IQRush卖的正是按论文主张的方式去测量AI可见度的软件。一份论证“你需要测更多次”的研究,出自一家靠帮你测更多次赚钱的公司,这个组合天然需要打折看待。作者自己也做了披露。
但有个情况让它没法被简单打发:同在4月,一支与之毫无关联的团队用独立数据集得出了同方向的结论——单次读数不可靠,必须对引擎重复采样。那篇的作者是Julius Schulte、Malte Bleeker与Philipp Kaufmann,来自圣加仑大学。
这就构成了一个还算健康的证据结构:有商业动机的一方提出了具体数字,无商业动机的一方独立验证了方向。你可以怀疑具体阈值定得偏高,但很难再说“不稳定”是厂商编出来卖软件的。
顺手固化一套厂商研究的读法
- 先问它的结论指向谁的钱包。结论如果正好推荐了发布方自己卖的东西,不必愤怒,只需提高证据门槛。
- 再找有没有无关联的复现。方向被独立验证过的部分可以采信,只有单一来源的具体数值当参考值。
- 最后看它主动承认了什么。一份肯把局限写清楚的研究,通常比一份处处都是漂亮结论的研究可信得多。
判定一个排名可信,要同时满足哪两个条件?
论文给的判据很朴素,也正因为朴素才好用。一份排名值得相信,需要同时满足两条:
第一,顺序必须已经停止变动。你继续增加采样,前几名的次序不再发生变化。如果每加十条回答名次就换一轮,说明你还在噪声里。
第二,头部之间的差距必须大于各自的误差范围。两家的份额是9.5%和6.0%,看着差了不少,但如果各自误差都有正负3个百分点,这3.5个百分点的差距就没有意义——它们的可信区间是重叠的。
论文里给的正是这个例子:用某个引擎测跑步装备类问题,Tom's Guide约占引用的9.5%,Runner's World约6.0%。仪表盘上前者明显更高,任何人看了都会得出“前者更强”的结论。可这3.5个百分点落在误差范围内,单次采样不足以支撑谁赢了这个判断。
这个例子的价值在于它足够普通。9.5%对6.0%不是什么胶着局面,看上去差了将近六成,仍然不够。如果连这种量级的差距都可能是噪声,那周报里那些“我们从第7升到第5”的表述,含金量可想而知。
33到94次,这个区间是怎么来的
论文的核心数字是:在30组“平台乘主题”的测试中,让上述两个条件同时成立所需的回答数在33到94之间,且只计入带引用的回答。
更值得注意的是失败案例:30组里有3组,即使跑到125个问题仍然没能达标,全部出现在同一个引擎上,原因是头部几家太接近,怎么采样都分不出先后。论文因此明确表示:不存在一个通用阈值。
“只计带引用的回答”还藏着一笔损耗。某个主题下125个问题只产出104条可用回答,缺失率17%——有些回答压根没给引用,直接作废。所以实际要提交的问题数比目标数字还得往上抬一截。
把这些数字翻译成一份能执行的采样方案
| 要素 | 建议做法 | 理由 |
|---|---|---|
| 问法数量 | 30到50个有代表性的问法即可 | 意图相同的问法结果高度重叠,多了浪费 |
| 每个问法跑几次 | 至少10次,核心问法跑到30次 | 差异主要来自重复运行,不是来自换问法 |
| 问法来源 | 优先真实客服与销售记录里的原话 | 真人措辞的语义相似度只有0.081,自己编的覆盖不到 |
| 采样频率 | 月度全量,周度只跑核心子集 | 周度数据本来就不该用来下结论 |
| 主指标 | 出现率,不是名次 | 出现率跨多次运行才稳定,名次不稳定 |
| 结论粒度 | 只判断梯队,不报精确名次 | 中后段名次误差大到没有意义 |
这套方案会比很多工具的默认采样密度更重,也更贵。但它至少给了一个诚实的选项:要么按这个强度测、拿一个站得住的结论,要么承认自己只是在看大致方向、别拿它做重大决策。最糟的是花了钱、拿了个精确到小数点的数字、然后据此调整了半年的内容策略。
为什么不同引擎需要不同的采样预算?
论文里有个观察挺有意思:不同引擎的引用行为差别很大,因此同样的回答条数在它们身上买到的确定性并不相同。
一类引擎倾向于把引用集中堆在同一小撮站点上,同一条回答里的多个引用其实提供的是高度重复的信息;另一类每条回答给的引用更少,但来源更分散,因此每条回答携带的独立信息反而更多。
后果很直接:在引用集中的引擎上够用的采样量,搬到引用分散的引擎上可能仍然是在猜。如果你的报告是跨引擎横向对比的,这一点尤其要命——你可能在一个引擎上得到了可信结论,在另一个引擎上得到的只是噪声,然后把两者并排放进了同一张表。
对策不复杂:按引擎分别设采样量,而不是全局设一个统一次数。哪个引擎的结论迟迟不收敛,就给它加量;加到某个程度还是分不出来,就在报告里如实写“该引擎暂无法区分”,而不是硬凑一个名次出来。
前十名的误差有多大,什么时候才该往上报?
还有一组数字,直接决定周报该怎么写。
论文指出,排名的可信度是从头部往下递减的:头部最稳、最可防守,越往中后段误差越大,到某个位置之后相邻名次的差别形同抛硬币。具体量级是,即便前十名,典型误差范围也约为5个位次,其中五分之一的站点误差大于10个位次。
五个位次是什么概念?你看到的“第6名”,真实位置可能在第1到第11之间的任何地方。而“从第6进步到第4”这种喜讯,在统计上跟没发生过区别不大。
| 你观察到的变化 | 能不能写进周报 | 怎么表述才诚实 |
|---|---|---|
| 名次在前十内小幅移动 | 不能 | 不提,或写“仍在头部梯队” |
| 出现率从三成升到七成 | 能,这是最该报的 | 直接报出现率与采样次数 |
| 从榜外进入头部梯队 | 能 | 说梯队变化,不说具体名次 |
| 从头部彻底消失 | 能,且该警觉 | 先复测确认不是单次异常 |
| 中后段名次变化 | 不能 | 这个区间本来就是噪声区 |
| 被引用的来源类型变了 | 能 | 比名次稳定得多,信号更强 |
最后一行值得额外强调:与其盯名次,不如盯“AI是从哪里知道你的”。引用来源的构成比名次稳定得多,也更能指导动作——发现对手大量来自某类垂直媒体,你就知道下一步该去哪儿;发现自己的引用全集中在官网一个来源,你就知道风险在哪。想系统地扒对手的引用来源,AI可见度竞品分析那套流程可以直接套用。
这份论文没有证明什么?
这一节比前面所有节都重要,因为它决定了你能把结论推到多远。论文自己列出的局限有这么几条:
- 它是预印本,没有经过同行评审。方向可信不等于每个数字都经得起推敲。
- 只覆盖3个引擎、30组平台与主题的组合。你的行业、语言、问题类型都可能不在其中。
- 问题是由模型生成的,不是真实用户的搜索记录。这条影响最大,下面单独说。
- 只在单一时间段采集。引擎在不断更新,今天的稳定性结论未必适用于半年后。
- 方法学自检是内部的:论文拿自己所谓的早期排名去比同一批数据的最终排名,而不是任何外部真值。
“问题由模型生成”这条为什么最要命?因为模型生成的问法往往比真人问得更规整、更完整、更书面。真实用户会打错字、用行话、问半截、带一堆无关前提。前面那个0.081的语义相似度已经说明了真人的措辞有多离散。规整的问题池测出来的稳定性,很可能比真实场景下更乐观——也就是说,真实世界大概率比论文说的还要更不稳。
换到中文场景,这件事会更好还是更糟?
两份研究测的都是英文引擎,直接搬到中文语境要打几个折扣,而且多数是往坏了打。
第一,中文问法的离散度只会更高。同一个需求,用户可能用完全不同的词组表达,还夹杂简称、行业黑话和地域说法。要覆盖同样的语义空间,中文需要的问法数量通常更多。
第二,引擎池更碎。除了国际引擎,还要考虑本土的几家AI产品,各自引用行为差异很大。按“按引擎分别设采样量”的原则,总成本是乘上去的。
第三,中文内容的可引用源结构不同。英文环境里社区问答和垂直媒体承担了大量被引用的角色,中文这边不少高质量内容锁在需要登录的平台里,模型取不到。这会让某些行业的引用来源高度集中在少数几个源上,进而让排名看起来比实际更稳定——这是一种假稳定,一旦那个源的内容变了,整个名单会跟着翻天。
所以中文场景下更该先做的一件事,是搞清楚模型到底在从哪几个源取材,再谈名次。关于哪些站在AI回答里被引用得最频繁,被引来源榜单那份数据是个不错的起点。
那到底还要不要测?测到什么程度该停?
看到这里可能会有点泄气:测不准,那还测什么。这个反应可以理解,但结论下反了。
不稳定不等于不可测,只等于不能用单次读数下结论。体重每天上下浮动两斤,不妨碍你通过月度趋势判断自己是胖了还是瘦了——前提是别拿今天早上那一次称重去跟上周三比。
更实际的问题是:测量要花钱花时间,什么时候该收手去干正事?三条停止规则:
- 当结论不会改变你的动作时,停。如果无论测出七成还是三成出现率,你下个季度都是同一套内容计划,那这次测量的唯一产出就是一张图。
- 当加大采样量已经不再改变梯队判断时,停。再往下追求精确名次是浪费,那个精度本来就不存在。
- 当你连续两轮都在讨论名次、没人讨论引用来源时,停。这通常说明团队已经把手段当成了目的。
不买工具的话,怎么自己跑一次最小可行的采样?
预算有限、或者只是想先验证一下工具给的数字靠不靠谱,完全可以自己手动跑一轮。花不了一天。
第一步,挑问法。去客服记录、销售通话、售前咨询里翻真实原话,挑出10到15个最常被问到的。不要自己编,也不要用那种“最好的XX品牌推荐”这类过分标准的句式——真人不那么说话,前面那个0.081的相似度就是证据。
第二步,定引擎。先别贪多,挑你的客户最可能用的两个。做外贸B2B的,办公套件自带的那个不能漏;做消费品的,对话式产品优先。
第三步,跑起来并记录。每个问法在每个引擎上跑10次,每次开新会话,别在同一个对话里连着问——上下文会污染结果,这是自测里最常见的错误。每次记四件事:
| 记录项 | 怎么记 | 为什么记它 |
|---|---|---|
| 有没有提到你 | 是或否 | 算出现率,这是主指标 |
| 还提到了谁 | 列全 | 这才是你真正的对手名单 |
| 提到你时说了什么 | 抄原句 | 看它替你选了哪个卖点 |
| 引用了哪些来源 | 记域名 | 模型是从哪儿认识你的 |
第四步,只算三个数。你的出现率、每个对手的出现率、引用来源的域名分布。就这三个,别算名次,也别算加权分。
跑完这一轮,多数人会有两个意外发现。一是对手名单和自己以为的不一样——市场部盯的那几家常常根本不在AI的候选池里,而池子里冒出来的几家你可能都没听过。二是模型描述你的方式和你的定位不一致,它可能一直在夸你的次要卖点。这两条都不需要精确统计就能看出来,价值却比一个名次高得多。
出现率之外,还有什么值得记?
出现率是主指标,但只记它会漏掉不少信息。下面三项是保哥觉得性价比最高的补充,记录成本几乎为零。
第一是位置。同样是被提到,出现在回答的第一句、和出现在“其他还可以考虑”那一串里,含义完全不同。不必精确到第几个字,粗分成首选、并列提及、附带一提三档就够用了。出现率高但全是附带一提,说明你进了池子但没进第一梯队。
第二是描述准确度。模型提到你的时候,说的对不对?有没有把别家的功能安在你头上、把停售的产品当在售的讲、把价格说错?这类问题的杀伤力比排名靠后大得多——一个被准确描述的第三选择,胜过一个被描述错误的首选。发现描述错误,该做的是补充和纠正公开信息,而不是加大投放。
第三是有没有给链接。被提到但没给链接,意味着这次曝光很难变成访问。哪些回答会给链接、给谁的链接,通常和内容是否可被检索到直接相关,这跟纯粹的品牌提及是两条不同的路径。
这三项加上出现率,构成一个比“第几名”信息量大得多的四元组。更重要的是它们都不需要跑到统计显著才能用——描述错了就是错了,跑三次看到两次错就该去处理,不必等攒够94条回答。
自己动手测的时候,最容易犯哪几个错?
见过的翻车基本都集中在这五条上,每一条都会让结果作废。
- 在同一个对话里连着问十次。上下文会互相污染,模型记得你上一轮问过什么,第二次开始的回答已经不独立了。必须每次开新会话。
- 用带品牌名的问法去测。问“XX品牌怎么样”,模型当然会提到你,这测的是它认不认识你,不是它会不会推荐你。要测推荐,问法里就不能有你的名字。
- 只测自己想被问到的那些问法。团队挑问法时会不自觉地挑对自己有利的场景,测出来自然好看。挑问法这一步最好交给不做优化的人,或者干脆从客服记录里随机抽。
- 只记自己有没有出现,不记还有谁。这是最可惜的一种浪费——同样一次采样,记全对手名单几乎不增加成本,拿到的信息却翻倍。
- 拿工具的默认设置当结论。多数工具的默认采样密度是为了出图快,不是为了统计可靠。用之前先问清楚一个数字背后跑了几次。
还有个不算错误但值得提的现象:不同类型的AI产品,稳定性本身就不一样。绑定在搜索结果上的那类,因为要受检索结果约束,回答的波动通常小一些;纯对话式产品的自由度更大,波动也更大。所以跨产品比较出现率的时候,别把差异全算到自己头上,有一部分是产品形态带来的。
老板要一个名次,你怎么解释才不像在找借口?
这可能是最现实的问题。你讲了半天统计误差,对方一句“那我们到底第几”就把你打回原点。
硬讲置信区间通常没用,换个说法效果会好很多:把它类比成民意调查。没有人会问“这次民调里我们精确排第几”,大家都接受支持率是一个带误差的区间,也都接受两家差三个点等于打平。AI可见度是同一类东西——它测的不是一个客观存在的排名,而是一群随机回答里的分布。
然后给出替代品,别只说不能给什么。可以承诺的是这三个数:本季度出现率从多少到多少、对手的出现率各是多少、我们被提到时模型说的是哪个卖点。这三个都能给出明确数值,也都能跟动作挂钩。多数管理者要的其实不是“第几名”这三个字,而是“我们是在变好还是变差、下一步做什么”,后者你完全答得上来。
最后留一句实话给自己:如果你的汇报里必须有一个精确名次才过得去,那问题不在测量方法上,在汇报文化上。这事解决不了统计问题,但至少你知道自己在跟什么较劲。
这套统计规律对内容策略有什么直接影响?
说了这么多测量的事,最后落到该干什么上。三条推论:
第一,目标应该是进核心圈,而不是提升名次。既然名次是噪声、出现率才稳定,那所有优化动作的验收标准就该换成出现率有没有从三成走到七成。这个转换会让很多动作的优先级重排:让三个新的可信来源提到你,比把官网某个页面再优化一遍有用得多。
第二,节奏该按季度而不是按周。单次读数的波动大于多数真实变化,这意味着周度对比在数学上没有意义。硬要按周汇报,团队会被迫为噪声编故事,久而久之报告就变成了创作。提示词追踪里那几个常见误区,多半也是被汇报节奏逼出来的。
第三,别为一次掉出就大改。这条最花钱。某周发现自己没了,团队紧急调整内容方向,两周后又回来了——回来跟那次调整可能毫无关系。正确动作是先复测:同样的问法再跑二三十次,看是真的掉出核心圈,还是这次抽签没抽中。复测的成本,永远低于误判之后的方向调整成本。
一份不自欺的AI可见度周报,长什么样?
| 板块 | 写什么 | 不写什么 |
|---|---|---|
| 出现率 | 核心问题集里提到你的比例,附采样次数 | 不写名次 |
| 梯队位置 | 头部、中部、未出现三档 | 不写具体第几名 |
| 引用来源 | 模型是从哪几类源知道你的,占比如何 | 不写单条来源的排名 |
| 缺席清单 | 哪些该出现你却没出现的问题 | 不写“暂无异常”了事 |
| 采样说明 | 本轮跑了多少条、缺失多少 | 不隐藏样本量 |
| 结论强度 | 标注哪些可采信、哪些仅供参考 | 不让所有数字看起来同样确定 |
最后那行“结论强度”是整张表里最容易被砍掉、也最不该砍的一栏。一份把不确定性标出来的报告,短期显得没那么有力,长期却能救你一次。因为总有一天某个数字会被拿去做一个真正花钱的决定,那时候你会庆幸自己当初写清楚了它有多虚。
顺带说一句工具选型:市面上的产品在采样透明度上差别很大,各家对可见度指标的定义并不统一,另一家给同一概念的追踪口径又是另一套算法,同一个词在不同工具里算出来的数字可能完全不可比。选之前把“跑多少次、怎么聚合、误差多少”这三个问题当成硬性验收条件,答不上来的直接排除。
一个宠物用品站的两轮测量,前后差了多少?
保哥接触过一个做宠物智能用品的出海站,他们的经历挺能说明问题。
第一轮,他们用工具默认设置测了一批核心问题,拿到一份排名,自己排第4,一家竞品排第2。团队据此判断差距不大,决定加大内容投入去追那两个位次,季度计划就这么定了。
第二轮是三周后,同一批问题、同一个工具、什么都没改。结果自己变成第7,那家竞品变成第3,另外冒出来两个之前根本没见过的品牌。
这时候他们才意识到,第一轮那份排名根本没到能下结论的采样量。后来把每个问法从跑一次改成跑十次、只保留30个有代表性的问法,才发现真实情况是:自己的出现率在四成上下,那家竞品在五成上下,两家其实长期在同一个梯队里反复交换位置;而真正稳定压着他们的是另一家出现率接近九成、之前两次都被当成偶然的品牌。
更有价值的发现来自引用来源那一栏——那家稳定领先的品牌,引用大量来自几个海外宠物垂直媒体的评测文章,而他们自己的引用几乎全部来自官网和一个电商平台的商品页。这条信息比任何名次都有用,因为它直接告诉了他们下个季度该去敲谁的门。顺带说一句,如果当初按第一轮那份排名去追两个位次,这半年大概率会花在一件根本不存在的事情上。
常见问题解答
AI可见度工具给的排名,是不是完全不能用?
名次基本不能用,出现率可以用。研究显示同一个提示词问100次,拿到完全相同名单的概率不到1次;但被推荐的核心品牌相当稳定,某家机构在71条回答里出现了69次。所以把工具当出现率统计器用,别当排行榜用。
要跑多少次才能相信一份数据?
没有通用数字。一篇论文在30组测试里得到的区间是33到94条带引用的回答,其中3组跑到125个问题仍未收敛。实操上建议挑30到50个有代表性的问法,每个至少跑10次,核心问法跑到30次,并按引擎分别设定采样量。
为什么同一个问题问两次,AI给的品牌名单会不一样?
因为生成式回答每次都是重新生成的,过程本身带随机性,不像传统搜索那样存在稳定的查询与结果映射。实测中连顺序都相同的两份名单,大约要跑一千次才碰得上一次。
该多准备问法,还是该多跑几次?
多跑几次。真人问同一件事的措辞其实极度离散,实测语义相似度只有0.081,但模型能识别背后的相同意图,所以不同问法的结果高度重叠。真正造成差异的是同一问法的重复运行,把预算花在次数上比花在扩充问法池上划算得多。
那份说排名是统计噪声的论文,可信吗?
方向可信,具体数值当参考。它是未经同行评审的预印本,作者所在公司正好卖相关测量软件,存在利益关系。但同期另一支无关联的团队用独立数据集得出了同方向结论,所以“单次读数不可靠”这个判断本身站得住。
中文场景下测AI可见度,会比英文更难吗?
通常更难。中文问法的表达离散度更高,需要更多问法才能覆盖同样的语义空间;需要盯的引擎更碎;而且不少优质内容锁在登录墙里模型取不到,容易造成引用来源过度集中的假稳定。
比起名次,更该盯什么指标?
盯出现率和引用来源构成。出现率跨多次运行是稳定的,能支撑决策;引用来源告诉你模型是从哪儿认识你的,直接指向下一步动作。另外“该出现却没出现”的缺席清单,实用性也远高于排名本身。
周报里到底该怎么写才不算糊弄?
写出现率并附上采样次数,写梯队不写名次,写引用来源构成,写缺席清单,并如实标注结论强度。把不确定性标出来短期显得没那么有力,但能避免某个虚的数字被拿去做花钱的决定。
权威参考资料
本文标题:《AI可见度排名为什么每次查都不一样?2961次实测说名次是噪声》
本文链接:https://zhangwenbao.com/ai-visibility-ranking-statistical-noise.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0