AI流量来源漏掉九成:日志里带人来的是夸克和通义

AI流量来源漏掉九成:日志里带人来的是夸克和通义
张文保 62 分钟阅读 4,179 阅读
本文目录
  1. 你后台那个直接访问,到底装了些什么?
  2. 先看这张全景表
  3. 来源为空的六种真实成因
  4. 这个桶是怎么一年年变大的
  5. 这个比例是不是这个站特殊
  6. 顺便说一句为什么不能只看统计脚本
  7. 两边差多少才算正常
  8. 那个桶的构成会随时间变吗
  9. 那个桶里到底有多少是AI带来的
  10. 为什么不能直接拿行业平均比例来套
  11. 为什么外推的那个假设一定不成立
  12. 按英文清单去数AI流量,会漏掉多少?
  13. 先说数出来的结果
  14. 这张表里最该盯的是那条分界线
  15. 为什么这件事对做中文站的人格外重要
  16. 一个容易被忽略的推论
  17. 那些没听说过的名字往往最有意思
  18. 把视野再放宽,整张外部来源榜是什么样
  19. 怎么认出一个陌生域名是不是AI入口
  20. 把入口按性质分三档,比按品牌分更耐用
  21. 清单该多久更新一次,怎么更新
  22. 同一份日志,三把尺子为什么给出三个完全不同的数?
  23. 第一把尺子:关键词包含匹配
  24. 第二把尺子:按域名精确判定
  25. 第三把尺子:只认带标记的链接
  26. 三个数字放在一起
  27. 第一把尺子错在哪里,值得展开讲
  28. 第三把尺子为什么低得离谱
  29. 还有第四把尺子,但它有前提
  30. 三把尺子该怎么配合
  31. 报表里那句口径说明该怎么写
  32. 从零写一份统计规则,需要处理的字段就这几个
  33. 规则写在哪一层,决定了它能活多久
  34. 写完之后必做的一次自检
  35. 还有一个建议:把中间结果留下来
  36. 那些国内入口分别是谁,各自带来什么样的人?
  37. 通义那260次的构成
  38. 夸克与神马系那149次的构成
  39. 为什么国内这几个入口的域名这么碎
  40. 归并到主域名之后要注意什么
  41. 顺带说一个容易误判的情况
  42. 不同入口带来的人,落点差别很大
  43. 被引最多的那批页面有什么共同点
  44. 这个分布对内容规划意味着什么
  45. 有一个细节值得单独说
  46. 为什么这批入口的绝对量都不大
  47. 那这个小数字的意义在哪
  48. 为什么带参数的那个标记只覆盖到零头?
  49. 参数是善意,不是义务
  50. 一次改版就能让你的曲线断掉
  51. 参数会在哪些地方掉
  52. 那还要不要做参数追踪
  53. 这些人来了之后,落在了哪一页?
  54. 先说英文那边的数据
  55. 这个站的数据是反的
  56. 为什么会差这么多
  57. 怎么判断自己属于哪一类
  58. 两类站的承接动作完全不一样
  59. 把落地页清单变成一份月度作业
  60. 顺带解决一个长期没人管的问题
  61. 落地页承接的一个最小动作
  62. 静态资源和大小写,怎么悄悄把统计搞乱?
  63. 图标请求占了六成
  64. 大小写让本站变成了外站
  65. 攻击流量混进了来源维度
  66. 一份可以照着跑的自检清单
  67. 还有一类更难察觉的污染:你自己人
  68. 内部访问还会污染另一个指标
  69. 什么时候该怀疑自己的数据
  70. 三条一起构成的教训
  71. 还有三个次一级的坑,一并记下
  72. 不靠技术链路,怎么把来源问出来?
  73. 最有效的一招是直接问
  74. 这一栏解决的是哪个问题
  75. 它当然也有毛病
  76. 怎么问才不掉转化
  77. 拿到答案之后怎么用
  78. 自述那一栏的答案该怎么归类
  79. 一个能立刻用的对账动作
  80. 一张能长期跑下去的来源账,该怎么记?
  81. 卡点是一栏自述,不是一套系统
  82. 这张账表长什么样
  83. 第一个月、第三个月、第六个月分别该看什么
  84. 这张表最容易被砍掉的时刻
  85. 什么时候可以停下来
  86. 第一次做的四个动作
  87. 这张表放在哪里,谁来看
  88. 报给上级的时候,说三句话就够
  89. 一个真实的客户案例
  90. 这件事在他们内部是怎么推进的
  91. 他们中间还走了一段弯路
  92. 这个案例里最值得抄的一步
  93. 这件事带来的一个意外收益
  94. 他们后来遇到的一个新问题
  95. 换个规模看,小团队怎么做
  96. 这套账记下来之后,第一步该改什么?
  97. 第一优先:修那些被引用的过期页面
  98. 第二优先:给这些页面加出口
  99. 第三优先:把移动端那份副本对齐
  100. 第四优先:补自述来源那一栏
  101. 不该做的三件事
  102. 顺便说说,AI来的这批人跟搜索来的有什么不一样
  103. 把这件事讲给不看数据的人听,该怎么说?
  104. 先把问题变成一个他熟悉的比喻
  105. 然后给一个他能验证的动作
  106. 最后把结论收在一个动作上
  107. 有一种反对意见要提前准备
  108. 这份日志还能顺手回答哪几个问题?
  109. 你的哪些老页面还在被外部引用
  110. 有多少访问撞上了失败页面
  111. 你的移动端与桌面端流量结构
  112. 有没有人在批量抓你的内容
  113. 你的站被哪些工具在监测
  114. 常见问题解答
  115. 直接访问占八成多,是不是说明我的统计装错了?
  116. 那我到底该不该继续用那个直接访问的数字?
  117. 怎么快速知道自己漏了哪些AI入口?
  118. 国内那些入口带来的流量值得专门优化吗?
  119. 自述来源那一栏,用户会不会乱填?
  120. 能不能用第三方的AI可见度工具替代这套?
  121. 加速页那批老页面到底该怎么处理?
  122. 这些数字会不会过一段时间就全变了?
  123. 我的站量太小,一个月才几十个外部来源,值得做这个吗?
  124. 服务器日志会不会有隐私合规问题?
  125. 如果我用的是托管建站平台,拿不到原始日志怎么办?
  126. AI引荐的量这么小,会不会根本不值得花时间?
  127. 为什么不直接看第三方流量分析平台给的AI渠道数据?
  128. 把带AI来路的访问单独打标签,值得做吗?
  129. 我的站有多语言版本,这个统计要不要分开做?
  130. 这批数据能不能用来判断内容做得好不好?
  131. 如果发现某个入口带来的访问全都秒退呢?
  132. 这套方法用在客户的站上,第一次沟通该说什么?
  133. 权威参考资料

摘要:把51天、230万条访问日志按来源字段拆开之后,真正能看出来路的浏览器请求只有4.92%,八成半落进了没有来源那一栏。而在能看出来路的那部分里,来自AI入口的575次访问里有527次来自夸克、通义、豆包这些国内产品,按英文教程那份清单去数,你只能数到48次。

先说结论:如果你现在打开分析后台,看那个叫直接访问或者直接流量的渠道,它不是一个渠道。它是一个桶,凡是没能带上来路标记的访问,全都掉进去。

这个桶有多大?在保哥这个站51天的日志里,浏览器发出的请求一共1814230次,其中1533721次的来源字段是一个横杠,占84.54%。剩下的里面,191212次来自站内自己的页面跳转,89297次带着外站来路,占全部的4.92%。

也就是说,你能看清来路的访问,二十个里只有一个。其余十九个在报表里长得一模一样,而它们的真实来路可能是搜索、可能是社交、可能是某个AI对话框、可能是有人把网址发在了群里。这些完全不同的事,在你的报表里坍成了同一个词。

你后台那个直接访问,到底装了些什么?

把这个桶拆开是有意义的,因为它决定了你接下来所有的判断。

先看这张全景表

来源类型51天请求数占浏览器请求
来源字段为空153372184.54%
站内跳转19121210.54%
外站带来路892974.92%

想知道分析工具把访问分进哪个渠道靠的是什么条件,默认渠道分组那份完整说明值得先读一遍,它决定了你后面所有报表的读法。

来源为空的六种真实成因

成因典型场景能不能补救
直接输入或书签老读者、老客户不需要补救,这是真的直接
应用内打开聊天工具、笔记应用里点链接难,多数应用不传来路
协议降级从加密页面跳到非加密页面全站上加密之后基本消失
来源策略限制对方站点设了严格的来源策略不由你决定
客户端主动剥离部分AI产品与隐私浏览器只能靠别的办法识别
脚本没跑起来统计代码被拦、页面没加载完能,属于自己的问题

直接流量这个词在SEO圈还有另一段公案,它到底算不算排名因子那篇把相关文件翻出来讲过一次。

顺带说一句,分析工具怎么把一次访问归进某个渠道,是有明确判定条件的,官方那份默认渠道分组说明把每一档的条件都写了出来。读一遍你会发现,直接这一档的定义本身就是兜底:不符合其他任何条件的,都归这里。

六种成因里,只有第一种和最后一种是你能处理的。剩下四种意味着,无论你把埋点做得多完美,那个桶都不会明显变小。这不是技术水平问题,是这条链路本身的设计就没打算告诉你。

这个桶是怎么一年年变大的

十几年前,来源字段基本是可靠的:从哪个页面点过来,浏览器就老老实实带上哪个地址。后来发生了几件事,一件比一件影响大。

当点击本身都在减少,衡量方式也得跟着换,零点击时代品牌影响力怎么衡量给了几条替代路径。

变化对来源字段的影响
全站加密普及从加密页跳到非加密页时来源被抹掉
搜索引擎隐藏查询词还能看到来自搜索,但看不到搜的什么
浏览器默认收紧来源策略跨站时只传域名,不传完整路径
移动应用成为主要入口应用内打开的链接多数不带来源
对话式产品兴起各家处理方式不一,很多干脆不传

五件事的方向完全一致:能看到的越来越少,而且没有一件是可逆的。指望这个趋势掉头是不现实的,所以早点建立不依赖它的测量方式,是一件迟早要做的事。

这个比例是不是这个站特殊

这是个必须先说清楚的问题,否则后面的数字对你没有参考价值。

不同站型的流量曲线本来就长得不一样,三种曲线各自的健康标准可以帮你先认清自己属于哪一种。

不算特殊,但要说明背景。这个站的读者以从业者为主,回访比例高,很多人是从收藏夹或者聊天记录里点进来的,这会推高来源为空的比例。如果你的站主要靠搜索获客,这个比例通常会低一些,六到七成是常见区间。

但方向是一致的:所有站的这个桶都在变大,而不是变小。隐私保护的加强、聊天类入口的增多、AI产品对来路的处理方式,三件事同时在往一个方向推。

顺便说一句为什么不能只看统计脚本

很多团队的数据只来自前端统计脚本。脚本被广告拦截插件挡掉、页面没加载完就跳走、用户禁用了脚本,这几类访问在你的报表里干脆不存在——不是归到直接访问,是压根没有。服务器日志的好处就在这里:只要请求打到了服务器,它就有一行记录,不管前端发生了什么。两边的数字对不上是正常的,值得关心的是差多少。

报表失真还有另一个大来源是机器流量,怎么把它揪出来再拦掉那篇写了完整的识别与过滤办法。

两边差多少才算正常

差值区间通常意味着要不要处理
日志比脚本多一到三成正常范围,主要是拦截插件与爬虫残留不用
多三到五成可能有一批页面没埋上代码抽查模板
多五成以上要么埋点漏了大片,要么日志里混着大量机器请求先分客户端类型再比
脚本比日志多几乎只有一种可能:重复触发立即查

指标读错比数据缺失更常见,四个最容易误用的核心指标挨个拆过一遍,对账之前值得过一眼。

比之前有一步不能省:先把日志里的机器请求剔干净。这个站51天230万条请求里,浏览器发出的只占七成多,其余是各类爬虫、监控与扫描。不剔就比,两边永远对不上,而且会得出一个错误结论——以为自己的埋点漏了一半。

那个桶的构成会随时间变吗

会,而且能看出来。把无来源比例按周画一条线,正常情况下它应该是平的。什么时候它会跳?三种:站点上线了新的入口方式,比如做了小程序或者应用内嵌;某个大流量来源改了来源策略;你自己动了跳转规则或者协议配置。

判断一条曲线是季节性还是真出事,季节曲线的量化方法给了可操作的判据,别看到掉就慌。

这条线的价值不在于绝对值,在于它跳的那一天。它跳了,说明这段时间有件事改变了你的流量构成,而这件事往往不在你的变更记录里——因为改的人不是你。

那个桶里到底有多少是AI带来的

这是最想知道、也最没法直接回答的问题。但可以估个范围,方法是从两头夹。

分析工具后来也加了AI渠道,它能回答和回答不了的事单独写过,读完你会知道该指望它多少。

下限好定:能看到来路的那575次就是下限,这部分板上钉钉。上限要靠推算——把带来路的AI访问占带来路访问总数的比例算出来,再假设无来路那部分的构成与之相似,就能推出一个上限值。这个假设当然不成立,但它给出的是一个不会被突破的天花板。

估算方式结果可信度
只数能看到来路的575次确定,是下限
按可见部分的比例外推约一万次假设太强,只当天花板
用自述来源反推需要积累样本最接近真实,但要时间

下限和上限差了将近二十倍,这个区间大到没法用来做决定——这正是为什么必须补那条不依赖技术链路的通道。在拿到自述数据之前,任何关于AI带来多少流量的精确说法,都是在这个二十倍的区间里挑了一个自己喜欢的数。

为什么不能直接拿行业平均比例来套

网上能查到不少关于AI流量占比的行业数字,从千分之几到百分之几都有。这些数字之所以差这么远,是因为它们的分母口径根本不一样:有的按会话算,有的按请求算,有的只统计几个海外入口。把一个不知道口径的比例乘到自己的流量上,得到的是一个假装精确的猜测。

要用别人的数字,先问三个问题:分子是怎么判定的、分母包含哪些流量、样本站是什么类型。三个问题里只要有一个答不上来,这个数就只能当谈资,不能当依据。

为什么外推的那个假设一定不成立

因为剥离来路这件事在不同来源上的发生概率完全不同。搜索引擎基本都会传来路,聊天类应用基本都不传,AI产品各家不一样。会不会被看见,跟来源是谁强相关,所以拿可见部分的比例去推不可见部分,从统计上就站不住。

刚开始做数据分析容易犯的几个基础错,三类工具与排名追踪习惯那篇适合当入门底子。

知道这一点有个实际好处:当有人拿着一个精确到小数点后一位的AI流量占比来跟你讨论时,你可以直接问他这个数是怎么算的。八成答不上来,或者答案是某个工具算的。

按英文清单去数AI流量,会漏掉多少?

接下来是这次翻日志最意外的一段。

先说数出来的结果

把浏览器请求里带着外站来路、且来路属于AI类产品的挑出来,51天一共575次。按域名归类之后,分布是这样的:

这些入口各自是什么产品、面向什么人,十款主流工具的实测对比可以当一份认名字的索引用。

来源51天次数归属
通义相关域名合计260国内
夸克与神马系合计149国内
一个第三方AI助手工具45国内
某AI创作平台33国内
豆包10国内
其余国内小入口合计30国内
Perplexity18海外
Claude13海外
ChatGPT9海外
Copilot5海外
其余海外入口3海外

这张表里最该盯的是那条分界线

国内入口合计527次,海外入口合计48次。国内占91.7%,海外占8.3%。

国内搜索早就不是一家独大,五个战场各自的接入方式那篇把碎片化的现状拆得比较清楚。

而你能在英文行业媒体上读到的每一份AI流量监测指南,给的清单都是ChatGPT、Perplexity、Gemini、Copilot、Claude这几个。照着那份清单配规则,你会数到48次,然后得出一个结论:AI带来的流量可以忽略不计。

真实情况是它已经有575次,只是十分之九来自你没配进规则里的域名。这不是流量少,是你的量具只认得一种货币。

为什么这件事对做中文站的人格外重要

因为这两年绝大部分关于AI流量的方法论都是英文世界写的,样本是英文站,用户是英文用户,入口清单自然也是英文产品。这些方法论本身没错,但它们的默认前提在国内不成立。

两套生态的差别不只在算法,从备案到时效的五维对比能解释很多方法论水土不服的原因。

做出海独立站的人可能会说,我的用户就是海外用户,那份清单对我够用。这话对一半。如果你的站同时有中文内容、或者服务华人客户、或者产品在国内被讨论,你的AI入口构成会比你想的复杂得多。成本极低的验证办法:把日志里的外站来路按域名排个序,从上往下扫一遍,看有没有你没听说过的名字。

一个容易被忽略的推论

如果国内入口占了九成,那么另一件事也跟着成立:你在国内做的那些内容动作,效果会先出现在这批入口上,而不是在你天天盯的那几个海外产品里。很多团队感觉做了半天没反应,其实是没在正确的地方看。

验证成本很低:把最近三个月发的内容标一下,看这批入口带来的落地页里有没有它们。有,说明动作是有效的,只是反馈渠道你之前没打开。

那些没听说过的名字往往最有意思

这次扫出来的几个域名,之前保哥自己也没注意过:一个做浏览器侧边栏AI助手的产品带来了8次;一个AI创作平台带来33次;还有一个专门做AI搜索优化服务的站点带来8次访问,看起来是同行在研究这个站。

国内那几个AI入口各有各的脾气,本地化落地的三类对策给了分平台的具体动作。

这些数字都不大,但它们说明了一件事:AI入口不是几个大厂的事,它是一片正在长出来的杂树林。用固定清单去数,清单更新一次的周期是几个月,而新入口冒出来的周期是几周。

把视野再放宽,整张外部来源榜是什么样

来源51天次数类型
谷歌各区域域名合计68000以上搜索
必应中国站与国际站合计8300以上搜索
某内容聚合站2144导流
百度移动端与桌面端合计713搜索
AI类入口合计575对话与AI搜索
某新标签页推荐位213内容分发
隐私搜索引擎合计约270搜索
社交平台合计约250社交

流量涨了生意没起色是另一个常见困境,从点击到成交的断点排查那篇按环节逐个查过。

放在一起看,AI入口的量级已经超过了社交平台,也超过了百度带来的访问,跟隐私类搜索引擎在同一个数量级。它当然还远不能和主流搜索相比,但已经不是可以四舍五入掉的数字了。问题在于它散落在十几个域名上,任何一个单看都不起眼。

怎么认出一个陌生域名是不是AI入口

排行榜上冒出一个没见过的域名,判断它属于哪一类,有四个信号可以看,从便宜到贵排:

不同引擎的取源方式差别不小,分引擎的优化策略可以帮你判断某个入口值不值得单独对待。

信号怎么看能判断什么
落地页分布它带来的访问都落在哪几页集中在几个事实型页面,多半是问答类入口
来源路径来源字段里除了域名还有没有路径带搜索路径的是搜索类,只有域名的多为对话类
访问节奏是持续小量还是集中爆发集中爆发通常是被某篇内容引用了一次
直接打开看浏览器访问这个域名最准,但要花一分钟

多数时候前两条就够用了。真正需要打开看的,是那些量突然变大又叫不出名字的——这类往往是新上线的产品,早点认出来,你就比同行早几个月知道它存在。

把入口按性质分三档,比按品牌分更耐用

品牌会变、域名会改,但入口的性质相对稳定。按性质分档,规则的寿命会长很多:

按查询类型分类同样比按平台分类耐用,十二类查询的内容布局是一个可以直接抄的框架。

档位特征该怎么对待
对话型来源只有域名,落地散关注落地页的事实准确度
AI搜索型来源带查询路径,落地集中当搜索渠道优化,看得见查询词
插件与助手型量小但持续,用户代理常有特征只做监控,量级通常撑不起投入

这三档对应的用户状态完全不同,混在一起算成一个AI流量,等于把三种人当成一种人。分档之后你会发现,值得单独做承接的往往只有其中一档。

清单该多久更新一次,怎么更新

不建议维护一份静态清单,建议维护一个流程:每周把外部来源域名按次数排序,只看那些第一次出现、且次数超过某个门槛的域名。门槛按自己站的量级定,小站设3次,大站设20次。让新名字自己从榜单上冒出来,比你去追行业新闻靠谱得多。

关键词研究这件事本身也在变,从选词转向需求研究的六步说的是同一个方向上的转变。

这个流程能顺带解决另一个问题:不少AI产品的来源域名跟它的品牌名对不上,光看域名根本认不出来是谁。这次扫出来的几个都是这样,得点进去看一眼才知道。指望用品牌名做关键词匹配去认AI入口,从一开始就走错了路。

同一份日志,三把尺子为什么给出三个完全不同的数?

这一段是本文的核心,也是最容易在自己团队里复现的一个坑。

第一把尺子:关键词包含匹配

最省事的写法是:来源字段里只要包含chatgpt、claude、perplexity这些词,就算AI来源。这样跑出来的数字是4979。

工具给的数和你自己查的对不上,是老问题了,六步排查法那篇给过一套定位口径差异的顺序。

第二把尺子:按域名精确判定

把来源字段解析成域名,先排除本站,再按域名清单匹配。这样跑出来是575。

想在分析工具里单独看这批流量,用过滤器加渠道分组补上那篇给了具体的配置步骤。

第三把尺子:只认带标记的链接

部分AI产品在跳出链接上带了来源参数。只数带这个参数的访问,一共23次。

追踪参数带来的另一类麻烦是被搜索引擎当成重复地址,能不能用抓取规则屏蔽它讲过正确做法。

三个数字放在一起

口径结果相对第二把尺问题出在哪
关键词包含匹配4979高8.7倍把本站网址里含这些词的自跳转全算进来了
域名精确判定575基准依赖清单完整度,会漏掉没听说过的入口
只认参数标记23低25倍只有少数产品会带,多数链接没有

单一指标撑不住判断,把聚合自然流量当主口径那篇实测了三类站点的效果差异。

第一把尺子错在哪里,值得展开讲

这个站写了几十篇讨论AI工具的文章,网址里自然带着这些产品的名字。读者在站内从一篇跳到另一篇,来源字段就是这些带着产品名的本站网址。包含匹配把这些站内跳转,全部算成了从AI产品来的访问。

品牌词与非品牌词混算会得出同样荒唐的结论,这两类流量该怎么分开读写得比较细。

更妙的是,写这类文章写得越多,这个虚高的数字就越好看。一个用来衡量AI带来多少流量的指标,实际上在衡量你自己写了多少篇讲AI的文章。

第三把尺子为什么低得离谱

带来源参数是产品方的选择,不是标准。同一个产品,网页版可能带、客户端可能不带;这个月带、下个月改版就可能不带。所以这个数字只能当下限用,不能当结论。

想从现有后台里挖出更多线索,用正则挖提示词的五步是目前少数还能用的办法。

能用参数标记数到的,永远只是真实数量的零头,而这个零头占多大比例,你无法预先知道。

还有第四把尺子,但它有前提

如果你能拿到会话级的数据,可以按会话去数,而不是按请求。一个人从AI入口点进来、在站内翻了五页,按请求算是六次,按会话算是一次。这把尺子给出的数字最接近人的概念,但它要求你的统计能正确把请求串成会话,而串会话本身又依赖前端脚本或者登录状态。

要做会话级的分析通常绕不开数据仓库,三个平台怎么关联起来那篇有逐项操作。

换句话说,最贴近业务含义的那把尺子,恰好也是最依赖那条会断的链路的。这就是这类测量的根本困难:越准的口径越脆,越结实的口径越粗。

三把尺子该怎么配合

正确用法是三个一起报,各标各的口径。参数标记那个数当地板,域名判定那个数当主口径,包含匹配那个数直接扔掉。只报一个数的报表,读的人无从判断它的可信度;报三个数并注明口径,反而没人质疑。

多口径并存最后一定要对账,七个动作点的对账清单是跟数据同事协作时的现成模板。

报表里那句口径说明该怎么写

一句话就够:本数按来源域名判定,已剔除静态资源与站内跳转,统计区间为某月某日至某月某日,未包含无来源访问中可能存在的部分。

流量下降的时候怎么跟老板解释,八个维度的完整说法比临时找理由体面得多。

这句话看着啰嗦,但它把三件事钉死了:怎么算的、算了哪段时间、哪部分没算。三个月后有人拿这个数来质疑你,你不用重新解释一遍,指着这句话就行。更重要的是,写这句话的过程会逼你把自己的口径想清楚——很多口径问题就是在写说明的时候暴露出来的。

从零写一份统计规则,需要处理的字段就这几个

字段处理动作不做会怎样
用户代理先分出浏览器、搜索引擎爬虫、AI客户端、脚本工具四类爬虫混进人类流量,比例全错
请求路径切掉参数与锚点,剔除静态资源图标请求让数字虚高数倍
来源字段解析出域名,转小写,去端口本站被当外站,同域被拆成多个
状态码只统计成功与跳转,失败单独看把打不开的访问也算成到达
时间统一时区,按周聚合跨时区的日界线会造成假波动

这类脚本迟早要接进日常流程,自动化该在哪个环节介入那篇讲了工程化的取舍。

五个字段,五个动作。这套规则写一次能用很久,因为它处理的是数据本身的形态,跟业务无关。真正需要维护的只有那份域名归类表,而前面说过,那份表最好交给排行榜自己生长。

规则写在哪一层,决定了它能活多久

同样一条规则,写在分析工具的界面里、写在数据仓库的查询里、写在一段独立脚本里,寿命完全不同。界面配置最快但最脆,换个工具就没了;查询语句次之;独立脚本最耐用,因为它只依赖日志格式,而日志格式十年没怎么变过。

如果你打算长期做这件事,把核心规则写成一段能独立运行的脚本,比配在任何平台里都划算。平台会改版、会涨价、会下线,日志不会。

写完之后必做的一次自检

随手挑一个具体路径,用最笨的方法数一遍——直接在日志里搜这一行,人工确认条数。然后拿脚本跑同一个路径,看两个数一不一致。不一致就查规则,别怀疑日志。

统计口径的欠账和技术债是一回事,五步排查与还债的顺序可以照着排优先级。

任何统计脚本第一次跑出来的数都不该被相信,除非它通过了一次你能手工验证的对照。

还有一个建议:把中间结果留下来

不要只输出最终那张汇总表,把分类之后的中间数据也存一份。三个月后有人问某个数字是怎么来的,有中间结果你能十分钟给出答案,没有就得重跑一遍,而那时候日志可能已经被轮转掉了。日志是有保质期的,结论不是——所以结论要连着它的原料一起存。

把这类分析做成可复现的脚本并不难,用命令行工具做自定义报表那篇给了一个完整例子。

那些国内入口分别是谁,各自带来什么样的人?

光有总数不够用,得看结构。

通义那260次的构成

来自三个不同的子域名,主站占231次,另外两个是移动端与预发布环境。预发布环境这个细节挺有意思——它说明有产品侧的人在测试环境里访问过这个站,这类访问严格说不该算作用户流量。

这批入口背后是几家在抢同一块蛋糕,八家龙头各自的打法能解释它们为什么长成现在这样。

夸克与神马系那149次的构成

这一组域名最杂,光是能识别出来的就有七八个不同前缀,有主站、有移动搜索、有调试环境,还有一个看起来是内部工具的域名。如果你的规则只写了主站域名,这一组你会少数掉将近一半。

国内搜索这块到底还值不值得投,该不该投怎么投的决策框架给了一套算账方法。

为什么国内这几个入口的域名这么碎

这跟产品形态有关。国内几家的AI能力多数是长在已有产品里的——搜索里加一个AI答案区、浏览器里加一个侧边栏、输入法里加一个助手。它们不是独立的新站点,所以来源域名沿用的是原产品的各种子域名,移动端、桌面端、内测环境各有一套。

内容平台的入口同样碎,问答社区这条路还有没有戏那篇的五步实战可以参考。

海外那几家反过来,多数是从零起的独立产品,域名干净,一个牌子基本就一两个域名。这个差别直接决定了你的统计规则该怎么写:对海外入口列域名清单够用,对国内入口必须按主域名归并,否则一定漏。

归并到主域名之后要注意什么

归并会带来一个新问题:不同子域名代表的场景可能完全不同。搜索里的AI答案区和浏览器侧边栏,虽然是同一个品牌,用户状态却不一样。所以合理做法是双层:报表上按主域名归并给总数,明细里保留子域名。总数用来判断量级,明细用来判断场景。

归并这件事在索引侧也有对应问题,索引膨胀的诊断与处置讲的是同一类归并逻辑。

顺带说一个容易误判的情况

日志里有几条来源是调试或者预发布环境的域名。这类访问严格说不是用户流量,是产品方自己的测试。量很小,但如果你的站量级也小,它可能足以让某个月的曲线看起来涨了一截。凡是域名里带着测试、预发、调试这类字样的,单独归一档,别混进主表。

第三方统计留下的痕迹也常被误读,这些图标怎么处理才合规顺手写过一份做法。

不同入口带来的人,落点差别很大

入口最集中的落地页类型说明
夸克工具型与查询型页面用户在找一个具体答案
通义分布较散更像是对话中顺手点开
神马移动搜索移动端加速页版本移动场景占绝对多数
Claude与ChatGPT技术类与限额查询类用户多为从业者

不同入口对品牌大小的偏好也不同,中小品牌的六条突围路径针对的正是这种不对称。

被引最多的那批页面有什么共同点

把AI引荐落地最多的十几个页面摊开看,它们几乎全是同一类:回答一个具体事实问题的页面。免费邮箱怎么选、某地手机卡资费、某个州收不收税、某个产品的限额是多少、某种技术方案的实测数据。

哪类页面既能被引用又能赚钱,底部漏斗内容的页型清单给了先建哪个的顺序。

而站上那些几千字的策略长文、方法论文章,在这张表上几乎看不见。这个分布跟很多人的预期是反的:不是内容越深越容易被引,而是问题越具体越容易被引。

页面类型在AI引荐里的表现原因
事实查询型占绝大多数对话里被追问的就是这类问题
工具与计算型次多模型给不了结果,只能给地址
实测数据型有一定占比数字是模型自己编不出来的东西
观点与方法论很少模型自己就能生成一份差不多的

这个分布对内容规划意味着什么

不是让你放弃写深度内容,而是说:如果你的目标之一是被AI引用,那么至少要有一批内容承担事实提供者的角色。具体的数字、具体的对比、具体的实测结果,这三类东西模型自己造不出来,只能来找你。

原创视角这件事在这条路径上尤其值钱,八个信号与十四周的实操账本记录了具体做法。

反过来,纯观点类内容在这条路径上天然吃亏,因为模型自己就是生产观点的机器。这话说得直白了点,但看着那张表,很难得出别的结论。

有一个细节值得单独说

夸克带来的访问里,有19次落在了移动端加速页版本上,占它带来流量的相当一部分。这意味着如果你的加速页版本内容陈旧、或者没有转化入口,那么这批人看到的是一个你早就不再维护的页面。

首页的角色这两年也在变,信息架构重新成为入口那篇讨论的是同一个变化。

保哥自己就是翻到这一行才想起来,站上还留着一批几年前生成的加速页。这类东西平时完全不在视野里,只有按来源拆一遍落地页才会浮出来。

为什么这批入口的绝对量都不大

看完明细会有个疑问:加起来五百多次,单个入口最多两百多,这个量级实在算不上多。原因有三层,值得说清楚,免得把小量误读成没价值。

这批产品的规模受限于更底层的东西,算力这个真变量解释了为什么增长没那么快。

第一层是点击本身就少。对话式产品的设计目标是在对话里把问题解决掉,用户点开来源链接的比例本来就低,有研究给出的数字是百分之一量级。零点击不是缺陷,是这类产品的设计意图。

第二层是能被看到的更少。前面说过,来源字段会丢,各家处理方式不同,所以你数到的永远只是实际点击的一部分。

第三层是站型限制。一个中文技术内容站,能被问到的场景本来就集中在几类具体问题上。如果换成一个消费品品牌,被问到的频率和场景会完全不同。

那这个小数字的意义在哪

在于它的方向和结构,不在于它的大小。五百多次告诉你的不是有多少流量,是有哪些入口正在把人送过来、送到哪几页、这些页面的内容还准不准。这三件事的价值跟量级无关,一次访问就能暴露一个过期页面。

老内容悄悄掉量同样是靠小信号发现的,内容衰退的识别与分级给了一套分档方法。

换个说法:这批数据的用途是诊断,不是计量。拿它去算收入贡献没有意义,拿它去找该修的页面非常有效。

为什么带参数的那个标记只覆盖到零头?

这一节是给还在指望技术手段一劳永逸的人看的。

参数是善意,不是义务

产品方在跳出链接上带来源参数,本质上是主动告诉你人是从它那儿来的。它没有义务这么做,也随时可以停。把自己的测量体系建立在别人的善意上,是一件很脆的事。

平台给什么数据从来是它说了算,品牌词过滤器怎么用那篇正好是一个平台给了之后的用法示例。

一次改版就能让你的曲线断掉

行业里已经出现过这种情况:某家产品调整了回答里展示来源的数量,很多站点的相关流量应声下跌,一个月后又改回去,数字再涨回来。整个过程里,这些站点什么都没做。

曲线突然断掉先别慌,四类原因的诊断决策树能帮你几分钟内定位到大方向。

凡是完全由对方决定、你一点都影响不了的数字,只适合监控,不适合当考核目标。把它写进季度目标,等于把自己的绩效交给别人的产品经理。

官方渠道给的数据同样受这条约束。新增的生成式AI表现报告就明确写了它有哪些维度、没有哪些维度,而且一开始只对一部分站点开放。看这类公告的时候,最该读的永远是那份不提供清单,它比提供清单更能说明你能做什么。

参数会在哪些地方掉

场景参数还在吗后果
用户直接点击跳转正常记录
页面做了跳转到规范地址多数会丢这次访问变成无来源
用户复制链接再打开看他复制的是哪一版不确定
站内再点一次导航后续页面全部归到站内
被缓存或加速服务改写可能丢取决于配置

跳转规则改动引发的连锁反应最难查,迁移不掉流量的六维路线图里有一整节讲这个。

第二行是最常见也最容易自己修的:很多站的跳转规则会把带参数的地址跳到干净地址,跳的那一刻参数就没了。如果你在做参数追踪,这条规则得留个例外,把追踪参数保留下来。

那还要不要做参数追踪

要做,但摆正位置。它的价值不在于总量,在于它是唯一能百分之百确认来路的那部分样本。用它去校准别的口径:如果参数标记的数占域名判定数的比例长期稳定,那么当这个比例突然变化时,你就知道要么是产品改了,要么是你的规则漏了。

流量与转化之间的交接点最容易掉数据,边界与交点的五步实战讲了两边怎么对齐口径。

这些人来了之后,落在了哪一页?

这一段的结论跟英文世界流行的说法正好相反,所以要格外小心地说清楚。

先说英文那边的数据

今年有几份被广泛引用的研究给出过这样的结构:模型引用的网址里,六成以上位于站点的二三级目录深处;而实际点进来的人,接近六成落在首页。把这个现象概括成机器读得深送人送得浅的那篇分析还补了一个更扎心的数字:将近三成的引荐直接落在了站内搜索结果页上,也就是那个几乎没人维护的页面。

两条路径的流量结构确实在分裂,分裂的定量证据与内容矩阵那篇拿数据做过一次切分。

这个站的数据是反的

剔掉图标之类的静态资源请求之后,能确认来路的AI引荐访问一共210次左右,其中落在具体文章页的197次,落在首页的5次。深页占九成以上,首页只占2.4%。

品牌被当作实体来处理时,落点会变,实体主页这个地基怎么搭解释了背后的机制。

为什么会差这么多

站型被引用的是什么点进来落在哪
品牌电商站产品页、评测页常被替换成品牌首页链接
内容站某一篇具体文章就是那篇文章本身
工具站某个具体工具页那个工具页

品牌定位清不清晰会直接影响模型怎么处理你,四个动作重塑清晰度给了具体做法。

差别的根源在于,AI产品对品牌类查询会做一件事:把答案里的品牌指向品牌的主入口。而内容型站点没有品牌指向这一说,被引用的就是那一篇。

所以那条机器读得深送人送得浅的规律,不是普遍规律,是站型决定的。直接把它套到自己站上,可能会让你去优化一个根本不存在的问题。

怎么判断自己属于哪一类

三十秒就能查:把带AI来路的访问按落地页分组,看首页占比。超过三成,你就是被当品牌处理的那一类,要重点做首页承接;低于一成,你的落地页是深页,要重点做单页的转化路径。别看别人的结论,看自己那张表。

行业不同打法也不同,七个行业的方法矩阵可以先找到自己那一行再动手。

两类站的承接动作完全不一样

落地位置访客状态页面要提供什么最常见的失误
首页已被说服,只想找到那个东西一条最短的直达路径还在从头介绍品牌故事
具体内容页正在核对某个事实把那个事实说准,顺便给下一步页面只有信息,没有任何出口
已下架的老页面拿到了一个过期答案明确说明并给替代项放着不管,或者直接删掉变404

承接这件事本质是转化设计,八模块九十天的实战路线可以当一份长期改造清单。

第三行是最容易被忽略、代价却最实在的一类。模型的答案有滞后性,它可能一直在拿你两年前的页面当依据。这批人不是走错了路,是被送到了一个正确但过期的地址。

把落地页清单变成一份月度作业

光看一次没用,得让它进流程。做法是每月导出一次AI引荐落地页排行,取前二十,逐个过三件事:内容还准不准、有没有出口、移动端排版有没有问题。三件事各打个勾,不合格的排进当月内容排期。

检查项不合格的典型表现修复成本
内容准确度价格、政策、版本号已经变了十分钟到半天
是否有出口整页读完没有一个下一步十分钟
移动端呈现表格横向溢出、关键数字被截断视模板而定

二十个页面,一个人半天能过完。这半天的产出通常比同样时间写一篇新文章的收益高,因为这些页面已经有确定的人在看。

顺带解决一个长期没人管的问题

做这件事会附带发现一批僵尸页面:还有访问、内容却早已过期、没人认领。它们平时不会出现在任何一张报表上,因为量小;但正是这些页面在替你回答着别人的问题。

处理原则很简单:有访问就必须有人负责,没人负责就该下线。介于两者之间的那种状态——挂着、不管、也不删——是成本最高的一种,因为它一直在以你的名义给出过时的答案。

落地页承接的一个最小动作

这一步的门槛低到几乎没有借口不做,而它带来的变化往往是整套动作里最直接的。

想验证这一句话加得有没有用,三十个可直接抄的测试方案里有现成的对照设计。

不必大改。在被AI引荐最多的那五到十个页面上,各加一句指向下一步的话就行——相关产品、更详细的说明、或者一个咨询入口。这批访客已经带着明确目的来了,他们缺的不是说服,是一个出口。一句话的成本,可能比你重做一版首页的收益还高。

静态资源和大小写,怎么悄悄把统计搞乱?

这一节全是坑,都是这次实测踩出来的。

图标请求占了六成

带AI来路的请求一共575次,其中365次请求的是网站图标文件,占63.5%。也就是说,如果你直接数带AI来路的请求条数,会把数字放大到真实访问的将近三倍。

第三方脚本带来的杂音不止统计这一处,五个场景的治理办法那篇顺带解决了性能告警。

原因不复杂:浏览器打开一个页面时会顺带请求图标,这个请求同样带着来路。凡是要数会话或者访问,必须先把静态资源剔掉,只留页面请求。这条规则听起来是常识,但在自己写脚本的时候特别容易漏。

大小写让本站变成了外站

有649次请求的来源字段写的是全大写的本站域名。规则里如果按小写去比对本站域名,这649次会被判成外部来源,堂堂正正地进入外链带来的流量那一栏。

自己写统计的时候这类细节最容易翻车,五层实现方案的对比里有不少可复用的写法。

域名是不区分大小写的,但字符串比对区分。这个细节在任何一份教程里都不会写,因为它太基础了,基础到没人提。

攻击流量混进了来源维度

日志里有好几组来源字段根本不是网址,而是数据库注入测试用的字符串,每一组都出现了六百多次。这些东西一旦进入按来源分组的统计,就会以外部来源的身份出现在你的排行榜上,排名还相当靠前。

这类字符串扎堆出现有时是更坏消息的前兆,被黑与负面攻击的分诊救法值得先存着。

处理方式很简单:解析不出合法域名的来源,一律归到无效那一档,别让它进主表。顺带一提,这类字符串的出现频率还能当一个安全指标看,它们扎堆出现的那几天,通常也是服务器负载异常的那几天。

一份可以照着跑的自检清单

检查项怎么验通过标准
静态资源是否剔干净看落地页排行里有没有图片、脚本、图标一个都没有
本站是否被误判成外站在外部来源榜里搜自己的域名搜不到
非法来源是否已隔离看榜单里有没有不像网址的字符串没有
同域是否已归并看有没有同一个名字带不同前缀反复出现只出现一次
机器请求是否已分开看浏览器类请求占总请求的比例与经验值相符
时间口径是否统一看跨日的数据有没有异常锯齿曲线平滑

落地页体验也有一份官方及格线,质量白皮书里的具体要求可以当另一份自检表用。

六项全过,这份数据才值得拿去开会。六项里任何一项没过,你算出来的比例都可能有数倍的偏差,而偏差的方向还不固定。

还有一类更难察觉的污染:你自己人

团队成员、外包同事、客服每天都在访问自己的站,这批访问同样会进日志,而且因为他们常从内部文档或者聊天工具点链接,来源字段五花八门。站点越小,这个比例越吓人——保哥见过一个刚上线的站,前两周有超过三成的访问来自内部。

处理办法有两种:按办公网出口地址排除,或者给内部访问加一个固定参数。前者一劳永逸但需要固定出口,后者依赖大家配合,通常两个都得用。做不了排除也没关系,至少在解读数据时把它记在心里,别把自己人的访问当成市场反馈。

内部访问还会污染另一个指标

比来源更受影响的是页面停留和跳出。自己人打开一个页面查资料,可能停留十几分钟;客服为了核对信息一天点开同一页七八次。这些行为混进平均值里,会让某些页面的数据好得不像话。凡是某个页面的停留时长明显高于同类,先怀疑是不是自己人在贡献。

什么时候该怀疑自己的数据

现象大概率原因
某个渠道占比整齐得像人为设定规则里有硬编码或者兜底分类
周末和工作日曲线一模一样混进了大量机器请求
某天数字突然翻倍又立刻回落一次采集、一次扫描或者一次自己人的批量操作
新入口一出现就贡献很多先确认不是测试环境或者监控服务

四条里任何一条出现,先别急着写结论,回去看明细。数据分析里最贵的时间,都花在为一个错误数字编解释上。

三条一起构成的教训

统计口径出错的地方,往往不在业务逻辑里,在你没想过要处理的那些边角上:一个图标、一次大小写、一串攻击字符。

很多经验都是被事故教出来的,十年算法史里的那些教训读起来比方法论更有画面感。

还有三个次一级的坑,一并记下

表现处理
带端口的来源同一个域名因为带了端口号被当成两个解析域名时统一去掉端口
加速页与主版本分开算同一篇内容的两个路径各算各的按内容归并,别按路径归并
锚点与查询参数同一页因为带了不同参数被拆成十几行分组前先把参数与锚点切掉

改版引发的连锁问题同样藏在细节里,不掉流量的完整防护清单可以在动手前过一遍。

这三条都不难,难的是你得先知道它们存在。判断自己有没有踩到,只要看排行榜里有没有同一个名字反复出现的行——有,就说明归并没做干净。

不靠技术链路,怎么把来源问出来?

前面全是拆问题,这一节讲解法。

最有效的一招是直接问

在表单里加一个字段:你是怎么知道我们的。不做必填,不做下拉选项,就一个输入框。那份关于AI可见度该测什么的讨论里把这一招放在了最高优先级,理由很直白:它是唯一一条不经过任何技术链路的信息通道。来源字段会被剥离,参数会丢失,脚本会被拦,但用户自己写下的那句话不会。文中还提到一个具体数字,有团队实测发现,通过AI平台进来的线索里有八到九成被系统错误地标成了自然搜索或者直接访问。

把这批人接到询盘上还有别的动作,获客三步指南讲了从可见到成交的衔接。

这一栏解决的是哪个问题

回到最开头那张表:八成半的访问看不出来路。技术手段能做的,是把那4.92%里的信息榨得更干净——把域名归并对、把静态资源剔掉、把新入口认出来。但它对那84.54%无能为力,因为信息在到达你之前就没了。

可见度做出来了询盘却不来,从被看见到被信任的全链路那篇拆过中间断在哪。

自述来源不是把那个桶变小,是绕开它。它不依赖来源字段、不依赖参数、不依赖脚本能不能加载,它依赖的只有一件事:人愿不愿意回答。这是整条链路上唯一一个不受技术条件影响的环节。

当一条通道系统性地丢信息,正确做法不是把它修得更密,是另外开一条不经过它的路。

它当然也有毛病

人的记忆不可靠,会把最近一次接触当成第一次接触,也有人随手填两个字。这些偏差是真实存在的,谁也没法消除。但它的价值不在于精确,在于它能发现你完全不知道存在的渠道——有从业者分享过,加了这个字段之后才发现有相当比例的注册来自某个AI产品,而他们此前在这个方向上什么都没做过。

任何单一信息源都有偏差,四层逆向拆解对手的框架说的是怎么用多个来源互相校正。

怎么问才不掉转化

做法效果备注
放在提交后的感谢页不影响转化,回答率中等推荐从这里开始
放在表单里做选填回答率高,略增加填写负担字段要放最后一个
放在表单里做必填数据全,但会掉转化只在高价值表单上用
做成下拉选项好统计,但会限制发现新渠道与输入框结合使用

在关键页面上加字段是要算账的,退换货政策页怎么写那篇讨论的是同一种取舍。

如果只能选一种,选感谢页那种。它的成本几乎为零,而且拿到的答案质量意外地高——人在完成一件事之后,比在中途更愿意多说两句。

拿到答案之后怎么用

存下来只是第一步,真正有用的是拿它跟系统记录做对比。

自述数据最终要接进归因体系,多触点模型怎么选那篇给了不被最后一次点击骗走的办法。

把自述来源和后台记录的渠道并排放,看两边差多少。差得越多,说明你的技术口径漏得越厉害。这个差值本身就是一个值得长期跟踪的指标,它比任何单一渠道的数字都更能说明你的测量体系状况如何。

自述那一栏的答案该怎么归类

别急着做成标准化选项。前两三个月保持自由文本,把答案原样存下来,每个月人工读一遍。这个阶段的价值全在那些你没想到的答案里:有人写朋友推荐、有人写在某个群里看到、有人写不记得了但确实听说过。这些答案没法归进任何一个预设分类,但它们描述的是真实的传播路径。

怎么把一句话问得让人愿意答,也是文案功夫,八个实战技巧里有几条能直接用上。

读满两三个月,再把高频答案固化成选项,同时保留一个其他加输入框。顺序反了会有个后果:一开始就给选项,你只能收到你已经知道的那些渠道。

一个能立刻用的对账动作

取最近三个月成交或者留资的客户名单,把他们的自述来源和系统记录的渠道逐个对一遍。这个动作看着笨,但样本量通常也就几十到几百个,一下午能做完。做完你会得到一个非常具体的数字:系统记录对了多少个。这个数字比任何渠道占比都更能说明问题,而且没人能跟你争。

跟财务对账是另一场硬仗,七个动作的账本给了从预算到归因的完整交接方式。

一张能长期跑下去的来源账,该怎么记?

说到这里,可以给一个能落地的东西了。

卡点是一栏自述,不是一套系统

这批问题的根子在于所有技术手段都依赖同一条会断的链路。解法不是把那条链路修得更结实,是在旁边另开一条完全不依赖它的通道。一栏自述来源就是那条通道,它简单到不需要任何技术投入,也正因为简单,它能长期活着。

在这个阶段,底层逻辑比工具更值得先想清楚,内容优化的底层框架五步可以对照着排序。

这张账表长什么样

数据来源更新频率
无来源占比服务器日志每周
外部来源域名排行服务器日志,剔静态资源每周
AI入口合计与明细同上,按域名判定每周
带参数标记数同上,当地板值每周
自述来源分布表单字段每月
两边差值后两列相减每月

表格里的数最终要接到生意上,四维公式怎么把渠道换算成生意那篇给了折算方法。

第一个月、第三个月、第六个月分别该看什么

阶段重点典型产出
第一个月把口径跑通,把域名认全一份能复现的统计脚本与一张域名归类表
第三个月看趋势,看新入口的出现节奏知道哪些入口在长、哪些在退
第六个月把自述来源与技术口径对账一个说明测量体系可信度的差值

分阶段推进比一次做完靠谱,四步实战框架的节奏安排可以直接借用。

三个阶段的共同点是每一步都不需要新工具。拖住多数团队的从来不是工具,是没人把第一个月那件枯燥的事做完。

这张表最容易被砍掉的时刻

是它连续几周没变化的时候。有人会说这东西没什么可看的,要不停了吧。这时候正确的回应不是坚持每周看,是把频率降下来但别停——没变化本身就是一个有效读数,停了之后你连没变化都不知道。

什么时候可以停下来

这套东西不需要永远跑。当你的AI入口构成连续三个月没有新名字出现、且总量占比稳定,就可以把频率从每周降到每月。监测的目的是发现变化,变化停了,监测的价值自然就下降了。别为了看板好看而维持一个已经没有信息量的流程。

判断一件事还值不值得投,行业基准与投入产出测算那篇给了可算的口径。

第一次做的四个动作

拿到日志、剔掉静态资源与非法来源、按域名分组排序、把没见过的域名手动认一遍。第四步是唯一需要动脑的,也是每次能有新发现的那一步。这张排行榜的价值恰恰在于它会不断冒出你没配过的名字,而固定清单永远不会。

把这类操作工程化能省下大量重复劳动,站点验证与接口申诉的工程化做法是一个可参照的例子。

这张表放在哪里,谁来看

补一句更实际的:这张表最好跟现有的周报合并,别新开一个文档。团队里每多一份需要单独打开的文件,被遗忘的概率就翻一倍,这条经验在任何规模的团队里都成立。

把职责写清楚能避免大半扯皮,达标定义与责任划分的模板虽然是合同用,思路是通的。

放在团队每周都会打开的那个文档里,不要单独建一个新看板。看的人最好是同时懂内容和懂业务的那一位——技术同事能把数字跑出来,但判断某个新入口值不值得关注,需要知道公司在卖什么给谁。

这类监测最常见的死法不是没人做,是做的人和能判断的人不是同一个人。数字每周准时出现,却没有人对它做出反应,三个月后自然就停了。

报给上级的时候,说三句话就够

第一句:我们能看清来路的访问只有百分之几,其余在报表里都是直接访问。第二句:在能看清的那部分里,AI入口的量级大概相当于某个你熟悉的渠道。第三句:基于这个数,我们打算做的是修几个页面,不是上一套新系统。

汇报里最容易被追问的是流量质量,信息词流量过大的六大危害那篇提前准备了答案。

三句话分别对应现状、量级、动作。多数汇报翻车不是因为数字不好,是因为只报了现状没给动作,于是听的人只能自己脑补一个昂贵的动作。

一个真实的客户案例

保哥有个做露营与户外炊具的客户,市场在欧洲和日本,团队13个人。去年他们的投放负责人在复盘会上说了一句,我们在AI这块基本没有流量,可以先不投入。依据是分析后台里那个AI相关渠道分组常年是个位数。

这类站的信息型页面往往是流量主力,配送政策页怎么写那篇算过它的两头收益。

后来他们按上面这套做了一次,结果有两处出乎意料。第一,把静态资源剔掉、把域名清单补上之后,实际数字是后台显示的十几倍;第二,也是更要命的一条,他们发现有一批带AI来路的访问落在了一个已经下架产品的页面上——那个产品页因为外部还有引用,一直没做跳转,模型也就一直拿它当答案。

修的动作很小:给那个页面做了跳转,加了一句替代产品的说明,改完花了不到两小时。三个月后这条路径带来的咨询变成了一个稳定的小数字,不多,但比之前的零好。

这件事在他们内部是怎么推进的

过程比结果更值得说。最开始提出要查一下的是他们的内容同事,理由很朴素:她在几个AI产品里搜自己家的品类词,发现有几次回答里提到了他们,但后台从来看不到对应的流量,两件事对不上。

跨团队推进这类事有固定的卡点,四阶段协作框架把每一步该谁做写清楚了。

技术同事第一反应是没有这回事,因为后台的AI渠道分组确实是个位数。两边僵了两周,最后是运维顺手导了一份日志,按域名排了个序,事情才清楚。争论卡住的时候,多数不是因为谁不讲道理,是因为双方看的是同一件事的两个不同侧面,而没人去看第三个。

他们中间还走了一段弯路

拿到数字之后,第一版方案是给每个AI入口配一个专门的落地页,做一整套承接。做了两周,落地页做出来了,量却撑不起——单个入口一周十几次访问,专门做页面完全不划算。

照搬别的打法是最常见的弯路,为什么流量涨了询盘不动那篇拆过一个典型例子。

最后收缩成前面说的那个动作:只修被引最多的那几个既有页面。他们自己的复盘是,看到一个从未见过的数字时,很容易高估它,因为它是新的。新和大是两件事,中间隔着一次冷静的量级判断。

这个案例里最值得抄的一步

不是他们修了什么,是他们先把数字量清楚了才决定修什么。在量清楚之前,他们打算做的事是投一笔预算去做AI可见度优化;量清楚之后,实际要做的只是修一个页面。这两件事的成本差了两个数量级。

先诊断再动手这条原则适用面很广,三个诊断案例里能看到没诊断就动手的代价。

这件事带来的一个意外收益

他们做完之后,内容同事第一次拿到了一份按外部真实需求排序的页面清单。以前排内容计划靠的是关键词工具和拍脑袋,现在多了一条依据:哪些页面正在被机器当作答案引用。这条依据的好处是它反映的是别人已经在问的问题,而不是你猜别人会问什么。

他们后来遇到的一个新问题

这套跑了两个月之后,他们的运营同事提了一个很实在的问题:排行榜每周都会冒出新域名,一个个点开看太费时间。解决办法比想象的简单——设一个门槛,一周内出现少于5次的新域名先不管,攒到月底一起看。监测这类事情,把频率降下来通常比把流程做复杂更管用。

有些东西一旦跑起来会自己积累,流量资产的持久化机制那篇做过三十个维度的实测。

另外他们还犯过一个错,值得写出来:有段时间他们把这张表交给了实习生维护,结果连着三周没人发现某个入口的量翻了一倍,因为那位同事只负责把数字填进去,没人告诉他哪些变化算异常。看板可以交给任何人维护,但异常判断得留给知道业务的人。

换个规模看,小团队怎么做

如果只有一两个人,别做表,做一件事就够:每月最后一个工作日,把外部来源域名排一次序,只看前五十行,把没见过的名字点开。二十分钟。这个动作的价值不在于精确,在于它保证了每个月至少有一次,你的视野是被真实数据刷新过的。

小站有小站的打法,九种不被大站剃光的策略针对的正是资源有限的情况。

这套账记下来之后,第一步该改什么?

数据摆出来之后最怕的是没有下一步。这一节把动作按投入产出排一遍。

第一优先:修那些被引用的过期页面

把带AI来路的落地页按次数排序,逐个打开看内容还准不准。这个动作没有技术含量,但它是唯一一件必然有收益的事——你不知道模型什么时候会重新读这些页面,但你知道它现在给出的就是这些地址。

老内容怎么改才算改到位,十二步把旧版更新成可信来源给了逐步的操作顺序。

判断标准也简单:一个不熟悉你的人打开这一页,能不能在十秒内确认自己找对了地方。确认不了,就是要改的。

第二优先:给这些页面加出口

出口不是一个按钮那么简单,它得跟这一页的内容有关。查资费的页面,出口是更详细的对比;讲某个故障怎么修的页面,出口是相关的工具或者服务。出口跟内容不搭,效果还不如没有——它只会显得这一页是个诱饵。

出口写什么可以借用现成素材,把用户评论变成产品描述那篇的做法能省不少时间。

第三优先:把移动端那份副本对齐

如果你的站有加速页或者独立的移动版本,先看这批访问里有多少落在上面。有量就必须对齐内容,没量可以合并掉。这件事的麻烦在于它通常不属于任何人:内容同事不知道有这份副本,技术同事觉得它是历史遗留。

移动端副本这类历史遗留最容易被忘掉,一次跳转方案下线引发的连锁问题是前车之鉴。

第四优先:补自述来源那一栏

前面三件都是修存量,这一件是建增量。它见效慢,要攒够样本才有意义,所以排在第四,但越早开始越好——今天不加,三个月后你还是只有一个装满东西的桶。

补数据和补选词是同一种思路,缺口分析怎么找高价值机会可以当方法上的类比。

不该做的三件事

动作为什么先别做
先买一套可见度监测工具它测的是曝光侧,而你连到达侧还没量清楚
为AI流量单独做一套落地页量级还撑不起,且和现有页面的差异说不清
把某个AI渠道写进季度目标这个数完全由对方产品决定,写进去等于自找麻烦

在没想清楚之前先别大改内容,五大设计法则能帮你判断哪些改动是真需求。

三件事的共同点是:都在还没搞清楚现状的时候,就先给出了一个昂贵的解法。这是这两年最常见的一种浪费。

顺便说说,AI来的这批人跟搜索来的有什么不一样

数完之后总要回答一个问题:这批人值不值得单独对待。

想更细地理解他们为什么来,五步拆解响应模式那篇做过一次完整的行为分析。

他们到达时的状态不一样

从搜索结果点进来的人,通常还在比较阶段,同一个问题他可能开了五个标签页。从对话里点进来的人,比较那一步已经在对话里做完了,他点进来是为了核对某个具体说法,或者确认这个来源靠不靠谱。

不同阶段的用户对应不同的词,低竞争词的挖掘策略里有按意图分层的思路。

前者需要你说服他,后者需要你别让他失望。这两件事对页面的要求完全不同:前者要论证,后者要证据和明确的下一步。

他们的来路对你意味着不同的信息

还有一层容易被忽略:搜索来的人,你能大致知道他搜了什么;对话里来的人,你完全不知道他问的是什么。查询词这个东西在搜索时代已经被隐藏了大半,在对话时代干脆不存在。

查询词看不到的时候,长尾思路要换,十种挖词渠道与意图分类还能提供一部分线索。

能补回来的只有间接信息:他落在哪一页,说明模型认为这一页能回答他的问题。落地页就是你唯一能拿到的意图线索,所以按落地页分组去看AI引荐,比按来源分组更有信息量。

他们的数量小但密度高

行业里已经有几份数据指向同一个方向:AI引荐的流量占比很小,但转化密度明显高于平均。有工具类站点披露过,AI来的访客只占其流量的极小一部分,却贡献了超过一成的注册。这个结构和几年前的邮件渠道有点像——量少,但来的都是已经认识你的人。

这个占比还会继续变,七个策略抢回可见性那篇给出了一份可以跟着调整的清单。

他们对页面的判断标准也不一样

搜索来的人会用整个页面来判断你靠不靠谱:排版、深度、更新时间、有没有广告。对话里点进来的人已经在对话中拿到了初步答案,他打开你这一页是为了验证一件具体的事,所以他的目光是扫描式的,直奔那个数字或者那句话。

让机器读得懂和让人读得下去要同时满足,五个维度的写作方法把两边的要求并在了一起。

这意味着页面里那些为了说服而写的铺垫段落,对这批人是纯粹的噪音。不需要为他们重写页面,但把关键事实往前放、给它一个明确的位置,对两类人都有好处。

他们不会给你第二次机会

这一点最需要注意。一个人在对话里问了问题,模型给了答案和来源,他点进来发现页面答非所问或者已经下架,他不会在你站里继续找,他会退回对话框继续问。你和他之间的那次接触只有一页的长度。

做到位了却还是不被选中,十八个常见盲区里可能有你正踩着的那一条。

所以该做的事其实很收敛

动作成本为什么值得
把被引最多的十个页面的事实核对一遍半天这批人来就是为了核对
给这十个页面各加一个明确出口两小时他们只看这一页
处理掉已下架却仍被引用的页面视数量而定过期答案的代价最直接
把加速页版本与主版本对齐一天移动入口占比不低

要判断先补哪一块,覆盖率与声量的三维分析比拍脑袋排序可靠得多。

四件事加起来两天以内能做完,且都不依赖任何新工具。比起去买一套AI可见度监测,先把这四件事做了,性价比高得多。

把这件事讲给不看数据的人听,该怎么说?

这套东西的最大障碍往往不在技术,在于怎么让不看数据的同事和老板接受结论。

先把问题变成一个他熟悉的比喻

保哥常用的一个说法是:你的报表像一个只装了监控探头的商场,但探头只覆盖了正门,侧门、地库、员工通道全是黑的。现在有人从侧门进来了一批客人,你的探头拍不到,于是你的报表说侧门没人。

跟人解释这类机制时,共识这个概念很好用,共识层的六个信号那篇把它讲得比较具体。

比喻的作用不是让对方懂技术,是让他明白看不见和不存在是两件事。这一点明白了,后面的数字才有人愿意听。

然后给一个他能验证的动作

说一百句不如让他自己试一次:让他在手机上用某个AI产品搜一次你们的品类词,看看回答里有没有你们,有没有链接。这个动作三十秒,效果比任何图表都好。亲眼看到之后,他会主动问你我们这块有多少流量,这时候你的数字才有落点。

让对方亲自搜一次之后,接下来该做什么,五大策略让品牌被主动推荐可以接着往下看。

最后把结论收在一个动作上

不要停在现状描述。给一个具体、便宜、有时间点的动作:这个月修五个页面,下个月看这几页的访问有没有变化。凡是没有配动作的分析,最终都会变成一次没人记得的分享。

动作要具体到内容层面,怎么让内容被优先引用那篇给的清单足够具体。

有一种反对意见要提前准备

会有人说,这点量做了也没用。这个反对是合理的,别硬顶。正确回应是把它拆成两句:从量级看,你说得对,它现在撑不起单独投入;从风险看,它暴露了几个页面内容已经过期,而那几个页面对搜索来的人同样重要。把动作挂在对所有渠道都成立的理由上,这个分歧就不用争了。

量小的时候,外部提及往往比自有内容更划算,五个实战法则解释了为什么。

这份日志还能顺手回答哪几个问题?

既然日志已经摊开了,有几件事顺手就能查,成本几乎为零。

你的哪些老页面还在被外部引用

按来源域名分组,看有哪些外站在给你带流量。这份名单里通常会有几个你完全不知道的站——有人转载了你的内容并留了链接,有人把你的页面收进了某个资源清单。这批链接是现成的关系入口,值得挨个看一眼。

这份名单还能反过来用,反链差距分析怎么挖那篇讲了怎么从中找出可复制的机会。

有多少访问撞上了失败页面

按状态码分组,把404和403单独拉出来,再看它们的来源。如果一个404页面有稳定的外部来源,那说明外面有一条活链接指向了一个已经不存在的地址——这是最容易捡的一类修复,做个跳转就行。

抓取失败与不收录经常被混为一谈,抓取与索引机制的拆解能帮你分清是哪一环出了问题。

你的移动端与桌面端流量结构

用户代理里能看出设备类型。这个数字很多团队以为自己知道,实际查一遍常有出入,尤其是当站上有独立移动版本或者加速页的时候,两边的统计口径往往对不上。

设备与可访问性这两件事常被一起忽略,十八个改动带来的实测变化说明了它们的价值。

有没有人在批量抓你的内容

看同一个来源地址在短时间内的请求密度。正常读者不会一分钟请求几十个页面。这件事的价值不只是安全,也关系到统计——采集流量如果没被剔掉,它会让你的访问量看起来很健康,而这份健康是假的。

被恶意盯上还有更麻烦的后果,三大平台的拦截申诉入口建议提前存好。

你的站被哪些工具在监测

各类SEO工具、外链分析工具、内容监测服务都有自己的用户代理。看看有哪些在定期抓你的站,能大致判断出有多少同行在关注这个方向。这条纯属八卦,但确实有意思。

这些工具你自己也可以用起来,从建项目到看懂核心指标那篇适合当上手指南。

常见问题解答

直接访问占八成多,是不是说明我的统计装错了?

不一定。先看服务器日志和统计脚本两边的总量差多少,如果差得离谱,那多半是脚本被拦或者没加载完;如果两边接近,那就是真实情况——来源信息在链路上就丢了,跟你的配置无关。

那我到底该不该继续用那个直接访问的数字?

可以用,但只当基数看,别当渠道看。它的变化趋势有意义,比如某周突然涨了三成,那通常意味着有某个入口开始给你带量了;它的绝对值没有意义,因为里面装的东西太杂。

怎么快速知道自己漏了哪些AI入口?

把日志里的外部来源域名按次数排序,从上往下看前一百个。凡是你叫不出名字的都点开看一眼。这个动作十分钟能做完,通常能发现两到三个没配进规则的入口。

国内那些入口带来的流量值得专门优化吗?

要看你的用户在哪。如果你的客户主要在海外,这些数字对你就是背景信息;如果你的产品在国内也有讨论、有采购、有代理商,那它们的量级足以支撑一次单独的内容规划。判断依据永远是自己的那张表,不是别人的结论。

自述来源那一栏,用户会不会乱填?

会有一部分,但比例远低于预期。真正会填的人多数是认真的,因为他们已经完成了提交动作,没有理由再敷衍。真正需要注意的是别做成必填,必填会显著增加乱填的比例。

能不能用第三方的AI可见度工具替代这套?

可以互补,不能替代。那类工具测的是你在AI回答里出现的频率,属于曝光侧;这里说的是有多少人真的点了进来,属于到达侧。两件事都要看,但只有到达侧的数据在你自己手里。

加速页那批老页面到底该怎么处理?

先按来源分组看还有多少访问落在上面。有量就更新内容并补上转化入口,没量就做跳转合并到主版本。最怕的是既不更新也不下线,让它挂着当一个静默的旧答案。

这些数字会不会过一段时间就全变了?

会,而且变得比你想的快。国内AI入口这一年一直在洗牌,几个月前排前面的域名今天可能已经改名了。所以这套东西的重点从来不是那几个具体数字,是那张会自己冒出新名字的排行榜。

我的站量太小,一个月才几十个外部来源,值得做这个吗?

值得,而且更简单。量小的时候你可以把所有外部来源逐条看完,不需要排序也不需要门槛。真正的门槛是拿到日志,跟量级没关系。反过来说,量小的时候一个新入口带来十次访问就足以被你注意到,大站反而容易被淹没。

服务器日志会不会有隐私合规问题?

访问日志属于常规运维数据,本身就是服务器默认记录的内容。做这类分析只需要路径、来源、用户代理和状态码四个字段,不涉及任何用户身份信息。要注意的是别把带着个人信息的查询参数原样存进分析表,处理时把参数切掉就行。

如果我用的是托管建站平台,拿不到原始日志怎么办?

先问平台客服有没有日志导出或者访问记录下载,多数平台是有的,只是没放在显眼的位置。实在没有,退一步用分析工具里的来源报告,虽然会漏掉被拦截的那部分,但域名排行这一项通常还能看。能看到排行就能发现新入口,这是整套方法里最关键的一步。

AI引荐的量这么小,会不会根本不值得花时间?

看你怎么算这笔账。整套动作里最花时间的是第一次拿日志和写规则,之后每周十分钟。而它能防住的是另一类成本:在没量清楚的情况下,基于一个错误的数字做出昂贵决定。省下一次错误决定,就够回本很多次了。

为什么不直接看第三方流量分析平台给的AI渠道数据?

那类平台的渠道分组同样基于来源字段判定,面对的是同一批问题,而且它们的域名清单往往比你自己维护的更新得慢,对国内入口的覆盖尤其薄。它可以当交叉验证用,但把它当唯一口径,你会重复本文开头那个错误:以为AI流量可以忽略。

把带AI来路的访问单独打标签,值得做吗?

值得,而且成本很低。在服务器层面按来源域名给这批请求打一个标记,后续无论是看落地页、看停留、看转化,都能单独筛出来。关键是要在数据进入分析系统之前打标,进去之后再补通常就补不上了。

我的站有多语言版本,这个统计要不要分开做?

要。不同语言版本的AI入口构成差别可能非常大,中文页面的引荐来源和英文页面的引荐来源基本是两套。混在一起算,会得到一个哪边都不像的平均数,这个数对哪个市场的决策都没用。

这批数据能不能用来判断内容做得好不好?

能用一点点,但要小心。被引用多说明这个页面在回答某类高频问题上是够格的,这确实是一种质量信号。但反过来不成立——没被引用不等于内容差,可能只是没人在对话里问这类问题。把它当发现器用可以,当评分器用不行。

如果发现某个入口带来的访问全都秒退呢?

先别怪流量质量差,先打开那个落地页自己看一眼。这种情况多半有具体原因:内容和问题对不上、页面在移动端排版崩了、或者需要登录才能看到关键内容。秒退是结果,原因几乎总能在那一页上找到。

这套方法用在客户的站上,第一次沟通该说什么?

就说三句:我们先看看你后台那个直接访问里装了什么;这件事只需要一份访问日志,不改任何代码;结论出来之前,任何关于AI流量的判断都先放一放。第三句最重要,它把这次分析从一个可做可不做的活,变成了后面所有决定的前置条件。

权威参考资料

分享到
标签
版权声明

本文标题:《AI流量来源漏掉九成:日志里带人来的是夸克和通义》

本文链接:https://zhangwenbao.com/ai-referral-source-domestic-entries-gap.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交