专题索引

SEO数据与度量指南:手上这个数出自哪儿、准不准、归因给谁、怎么折成钱

按手上那个数字查:它出自哪个源、准到什么程度、该归因给谁、怎么折成钱。角标标的就是第一件事,十二个分区从定指标一路排到出月报。

收录文章
197
分区
12

摘要:这一页不教你怎么用某个分析工具,它解决的是另一件事——手上那个数字到底能不能拿去做决定。十二组按数据链路排开:先定量什么,再分头看搜索后台、行为分析、服务器日志、第三方工具这四个源,接着是两边对不上怎么对账、哪些波动值得动手、功劳该算给谁、改动怎么证明有效,最后落到算账和出月报。197条每条先给一句结论,后面挂一个角标标明这个数字打哪儿来。两个数打架的时候,直接跳第六组。

为什么按数据链路排,而不是按工具排

站内已经有一个分类专门收分析工具的文章,那里按发布时间倒序排,适合看有什么新东西。这一页不重复它,换了一根轴:数据本身走过的那条路。

换轴的理由来自一个反复出现的场景。有人拿着两张截图问,搜索后台说这个月点击涨了两成,分析平台说自然会话跌了一成,到底信谁。这个问题在任何一个工具的教程里都找不到答案,因为它根本不是工具问题,是口径问题——两个平台计数的时刻不一样,一个在点击发生时记账,一个要等页面脚本跑起来才记,中间掉的那部分谁也没撒谎。

按工具组织回答不了这类问题,按链路可以。数字从产生到被拿去做决定,中间要过好几道关:来源、口径、对账、判读、归因、验证、折算、表达。每一关都有它特有的翻车方式,也都有对应的一组文章。你手上卡在哪一关,就从哪一组进。

那个角标是这一页真正多出来的东西

数据类文章最容易给人一种错觉:只要照着做,就能得到一个可靠的数。实际上不同来源的数字硬度差得非常远,而这件事几乎没人在文章开头讲清楚。

所以四个数据源、对账、归因、AI度量和算账这八组里,每个条目后面都挂了一个角标,只有四个值。平台自有指搜索或分析平台给的第一方数据,口径由平台定义、也会随平台改版而变,好处是可复现,坏处是你没得商量。第三方估算指外部工具的建模结果,看趋势和相对位置可以,拿绝对值去汇报迟早出事。自建测量指日志、埋点、接口和自己跑的实验,口径自己说了算,代价是得自己维护。业务口径指钱和管道那一侧的数字,定义必须和财务对齐才作数。

开篇的指标体系、判读波动、实验和看板那四组不标角标,因为那里讲的是动作和方法,不是某个具体数字的出处。这条边界是刻意划的:混着标只会让角标失去含义。

没有数据团队的话,这一页怎么用

先看第一组。指标体系没定就去接工具,是这一行最贵也最常见的返工,埋点铺满一年才发现量的东西和生意没关系,返工的不只是配置,还有那一年积下来的历史数据。

然后按现实情况取舍。一个人能落地的其实不少:把渠道分组和参数规范定死,能消掉一半归因噪声;给关键转化补上服务器端回传,绕开浏览器侧的拦截;用增量测试回答有没有用这个问题,比争论归因模型的权重实在得多。真正需要一整个数据团队的是跨渠道身份打通那一层,多数中小站可以先放着。

正文之后还有一段,讲看任何一份报告都该先问的四个问题。如果你正准备拿一份数据去开会,那段值得先看,它能帮你判断这份数据经不经得起追问。

01

先定清楚要量什么,再去接工具

12篇

这一组解决的是最贵的一类返工——埋点全铺完了才发现量的不是生意关心的东西。顺序是从测量框架到指标治理,再到该淘汰哪些老指标,建议按顺序走一遍再进后面的分区。

团队分工与能力这一侧还有2篇
02

Search Console的数字到底在说什么

22篇

顺序是从整体判读到单项报告,再到接口批量取数。GSC是SEO唯一的第一方搜索数据,也是最容易被读错的一份——这一组每一条都对着一个具体的误读。

想再抠具体报告的还有4篇
03

GA4与站内行为:把流量接到生意上

21篇

顺序是先修口径再谈分析。渠道分组、机器流量、参数污染这三件事不先处理干净,后面所有的行为分析都建在流沙上。

埋点与合规的边角问题2篇
04

日志与抓取数据:搜索引擎到底看到了什么

14篇

顺序是从怎么读日志,到怎么用它判抓取预算,再到怎么验证爬虫真伪。这是唯一不依赖任何平台施舍的数据源,也是排查收录问题时最后能说了算的那份证据。

抓取与索引的基础机制3篇
05

第三方工具与外部基准:这些数字准不准

21篇

顺序是先建立对估算数据的判断力,再谈具体选型。外部工具给的每一个数都是估的——知道它是怎么估出来的,才知道什么时候能用、什么时候只能当参照系。

免费与轻量方案4篇
06

同一个指标为什么两边对不上

11篇

顺序是从最常见的两源打架,到跨设备跨位置的采样差异,再到怎么把差异固化成可复现的对账流程。发现两个数不一样的时候先来这一组,别急着信任何一边。

口径争议里的两个具体案例2篇
07

哪些波动值得动手,哪些是噪声

12篇

顺序是先分清波动性质,再谈监控告警怎么搭。这一组的目的只有一个——把动手的门槛提高到值得动手为止,多数掉量在第一步就该被判成噪声。

08

这笔生意的功劳到底算给谁

17篇

顺序是从模型选型到零点击时代的代理信号,再到跨渠道的协同与内耗。归因永远不可能完全准确,这一组要的是让偏差稳定且已知,而不是消灭偏差。

归因链路上的协作与合规3篇
09

怎么证明这次改动真的有效

14篇

顺序是从实验设计的统计基础,到SEO场景下的具体做法,再到几个已经跑完的实测复盘。没有对照组的前后对比只能算观察,这一组讲的是怎么把观察升级成证据。

几篇值得当参照系的实测4篇
10

AI搜索:被引用和零点击怎么量

20篇

顺序是先解决量什么,再解决怎么持续量。这一组只收测量口径与监测方法,怎么优化被引用属于生成式引擎优化那一页,正文最后的下一步里给了入口。

还在变化中的几个判断4篇
11

把SEO折成钱:ROI、预算与目标

17篇

顺序是从ROI模型到预算分配,再到怎么把这套账讲给不懂SEO的人听。这一组决定的不是数据准不准,而是这份数据能不能换来下一个季度的资源。

投入产出的其他角度2篇
12

看板与汇报:数据怎么变成决策

16篇

顺序是从报表工程到汇报语言,再到把重复取数变成流水线。这一组的判据只有一条——看的人能不能据此决定下一步做什么,看不出来的图表再漂亮也该删掉。

数据处理的手工活6篇
13

一份SEO数据报告,值得质疑的只有四个地方

数据这一行最常见的翻车不是算错,是拿一个自己都没搞清定义的数去做了一个不可逆的决定。看任何一份报告,包括自己做的,都先问下面这四个问题,问不倒再谈结论。四个问题按被问倒的概率排过序,越靠前的越常出事。

第一问,这个数出自哪个源。同一个自然流量,搜索后台、分析平台、服务器日志给的是三个不同的数,因为它们计数的时刻根本不同——一个在点击时、一个在脚本跑起来时、一个在请求落到服务器时。差两三成是常态不是故障。角标标的就是这件事,一份报告里如果四种来源的数被混在同一张图上比大小,后面不用看了。

第二问,分母是什么、时间窗口多长。转化率的分母是会话还是用户,同比的对照期有没有对齐节假日,移动端的数据是不是被单独拆过。这三处任意一处没说清,涨跌的方向都可能是反的。第六组那几篇讲的都是这类事,看着琐碎,却是绝大多数报告争议的真实来源。

第三问,这个变化有没有对照。改版之后涨了三成,如果同期同行业都涨了三成,那三成跟你的改动没关系。没有对照组的前后对比只能算观察,写进报告的时候要标明这是观察不是结论——第九组整组都在解决这件事,其中增量测试那条路对多数站点来说比A/B更现实。

第四问,看的人据此能决定什么。这一问最简单也最狠。一张图如果读完之后没有任何动作会因此改变,它就该被删掉,无论做得多漂亮。第十二组把这条判据落成了可操作的写法:每条发现后面挂一个能派工的下一步,挂不上的那条本身就是可疑的。

14

常见问题解答

7问
  • 这一页和站内的SEO数据分析工具分类有什么区别?

    那个分类回答的是这个话题有哪些文章,按发布时间倒序排,你得自己一篇篇点开找。这一页换了一根轴:按数据链路组织,从先定量什么开始,经过四个数据源、对账、判读、归因、实验,一直到算钱和汇报。每条文章前面挂一句结论,后面挂一个角标告诉你这个数字打哪儿来。更要紧的是它跨了六个以上的分类——日志类文章在技术SEO里、AI可见度在GEO里、LTV和管道在独立站运营里,分类页物理上没法把它们拉到一起对照,这一页可以。

  • 条目后面那个角标是什么意思,怎么用?

    它回答的是数据工作里最要紧的一个问题:这个数字有多硬。平台自有指搜索或分析平台的第一方数据,口径由平台定义、会随平台改版而变,好处是可复现,坏处是你没得商量。第三方估算指外部工具的建模结果,只能当参照系用来看趋势和相对位置,拿它的绝对值汇报迟早出事。自建测量指日志、埋点、接口和自己跑的实验,口径自己说了算,代价是得自己维护。业务口径指钱和管道那一侧的数字,必须和财务对齐定义才作数。角标只标在四个数据源、对账、归因、AI度量和算账这八组上,开篇的指标体系、判读波动、实验和看板那四组不标——那里讲的是动作和方法,不是某个具体数字的出处。

  • 十二个分区该按顺序读还是挑着读?

    看你手上有没有具体问题。有问题就挑着读:两个数对不上去第六组,掉量了先去第七组判断值不值得动手,老板问回报去第十一组,要出月报去第十二组。没有具体问题、想把这块补齐的,建议按顺序走前三组——第一组定清楚量什么,第二三组把两个最主要的第一方数据源读明白,这三组走完,后面九组随便从哪儿切进去都不会晕。唯一建议别跳过的是第一组,指标体系没定就去接工具,是这一行最常见也最贵的返工。

  • GSC和GA4的自然流量数字对不上,到底该信哪个?

    先接受一个前提:这两个数永远对不上,因为它们量的根本不是同一件事。GSC记的是搜索结果页上的点击,在用户落地之前就已经计数;GA4记的是页面加载后跑起来的那段脚本,中间会掉一批——广告拦截、同意横幅拒绝、脚本加载失败、跳出太快都算。所以正常情况下GSC的点击会明显高于GA4的自然会话,差两三成是常态。该信谁取决于问题:问搜索表现和曝光点击排名信GSC,问站内行为和转化信GA4,问总量趋势两个都看但只比自己的历史曲线、不跨工具比绝对值。第六组第一篇讲的就是这套对账方法,第三组里渠道分组那几篇则解释了差异是怎么被进一步放大的。

  • 没有数据团队,SEO一个人能把归因做到什么程度?

    能做到的比多数人以为的多。三件事一个人就能落地:第一是把渠道分组和参数规范定死,这一步不花钱,却能消掉一半的归因噪声;第二是给关键转化补上服务器端回传,绕开浏览器侧的拦截,这是目前性价比最高的一项工程;第三是用增量测试代替归因模型回答有没有用这个问题——挑一批页面停掉或改掉,看整体有没有动,比争论模型权重实在得多。真正需要数据团队的是跨渠道身份打通和客户数据平台那一层,那是第八组最后一篇讨论的事,多数中小站可以先不上。

  • AI搜索的可见度数据现在能不能拿去汇报?

    能,但要标清楚口径和不确定度,不能当成排名那样的确定数字用。现在的问题是同一个问题问同一个引擎,隔一天答案就能变,第六组那篇2961次实测给的结论很直白:名次本身很大程度上是噪声。可行的汇报方式是三条:只报趋势不报单次名次,样本量和提问清单一起附上,同时给出被提及率和被引用率两个数而不是合并成一个可见度分。第十组收的十六篇里,前三篇讲的都是怎么把测量做得可复现,这是能不能拿去汇报的前提。至于优化那一侧,属于生成式引擎优化那个专题,这一页只管量。

  • 这一页和SEO学习路径、SEO故障诊断那两个专题重复吗?

    有交叉,分工不一样。学习路径那一页是按依赖关系排的教学顺序,从认知到选词到内容到技术,数据只是最后一段里的一节,目的是让你从零建立完整认知。故障诊断那一页按症状组织,回答的是坏了怎么修,用到数据也只是为了定位故障。这一页的组织轴是数据本身:一个数字从哪儿来、准不准、归因给谁、怎么折成钱、怎么讲给别人听。同一篇文章在三个页面里承担的角色不同,进来的路径也不同——从学习阶段进学习路径,从症状进故障诊断,从手上那个说不清的数字进这一页。

15

数看明白之后,接下来干什么?

这一页只负责把数字理清楚。真要动手,下面四个入口比继续往下读更有用。