有人把ChatGPT挑源的内部字段扒了出来:定价页解析不了,它就转头引第三方

有人把ChatGPT挑源的内部字段扒了出来:定价页解析不了,它就转头引第三方
张文保 42 分钟阅读 4,226 阅读
本文目录
  1. 两种研究方法,为什么会指向相反的方向?
  2. 什么叫结构性事实,什么叫方向性数字?
  3. 这份观察的边界在哪,先说清楚
  4. 想看清引擎的内部动作,为什么抓包这条路走不通?
  5. 那到底该从哪一层读?
  6. 有两条弯路,别跟着走一遍
  7. 每一条来源上都贴着一个标签,它叫什么?
  8. serp、labrador、bright、oxylabs,这四个值分别意味着什么?
  9. labrador那一层,为什么普通站根本进不去?
  10. bright和oxylabs是谁?这件事为什么值得多想一层?
  11. 一次天气查询内部,两家抓取商是怎么分工的?
  12. 你多半只在被抓取的那一层竞争,这意味着什么?
  13. 四条管线,各自该用什么打法?
  14. 被抓取商拿走内容,和被搜索引擎收录,是同一件事吗?
  15. 有些问题根本不会去联网,这是怎么判定的?
  16. 落进text桶的问题,为什么再好的页面也挤不进去?
  17. 一个高风险的例子:连治疗指南这种问题都没搜网
  18. 决定进哪个桶的是措辞,不是主题,这有什么用?
  19. 那你该怎么先判断一个词值不值得做页面?
  20. 六个桶各自对应什么内容策略?
  21. 那些不联网的问题,就彻底没机会了吗?
  22. 一个问题会扇出成多少次搜索?
  23. 它会直接对着你的定价页发site:探测
  24. 既然它会定点访问,URL结构该怎么安排?
  25. 价格调整之后,怎么让它尽快被纠正过来?
  26. 它会先猜一个价格,再去搜索确认,这说明什么?
  27. 它读页面的方式有多“字面”?
  28. 被抓取、被引用、被提及,为什么是三件事?
  29. 这三件事,分别该怎么监测?
  30. YouTube被抓了两百多次,为什么一次都没被引用?
  31. Reddit凭什么成了被引最多的那一个?
  32. 结果按域名去重,这对内容策略意味着什么?
  33. 按域名去重,对多品牌和多子域的站意味着什么?
  34. 厂商自己的页面能不能被引用?能引到什么份上?
  35. 自己的事实该怎么组织,才算“一读就懂”?
  36. 竞品在这条链路上的表现,能不能顺手看出来?
  37. 这件事在团队里该归谁管?
  38. 这条链路和传统SEO,资源该怎么分?
  39. 关于这份观察,最常见的三个误读是什么?
  40. 引用绑定到具体一句话,而不是整篇,这句话怎么落地?
  41. 模型自己是怎么描述它的取源策略的?
  42. 它想读你的定价,读不到的时候会做什么?
  43. 你的事实、别人的页面:这件事的代价有多大?
  44. 排名分数在哪?为什么谁都拿不到
  45. 个性化那一层,为什么你永远优化不了?
  46. 本地查询只返回两个结果,这个上限意味着什么?
  47. 这套东西自己怎么跑一遍?
  48. 不想动手的话,有没有现成的路子?
  49. 跑完之后,先看哪几个数?
  50. 如果连抓都没抓到,该按什么顺序排查?
  51. 这套东西会改变内容排期吗?
  52. 有没有一份能直接贴墙上的自查清单?
  53. 从这些字段里,能推出哪几条真正可执行的动作?
  54. 纯HTML这件事,为什么在这里比在SEO里更硬?
  55. 出海独立站做这套,还要多考虑哪几层?
  56. 一个出海SaaS工具站的定价页改造,三周发生了什么?
  57. 那次判断失手:以为被抓得多就等于被引得多
  58. 这份观察的保质期有多久?该多久重跑一次?
  59. 老一套建议到底还成不成立?
  60. 从这周开始,先做哪三件事?
  61. 常见问题解答
  62. result_source这个字段普通人能自己看到吗?
  63. 知道ChatGPT用了第三方抓取公司,对我有什么实际用处?
  64. 怎么判断一个查询到底会不会触发搜索?
  65. 为什么YouTube被抓了很多次却一次都没被引用?
  66. 把价格做成图片或者用脚本加载,后果到底有多严重?
  67. 结果按域名去重,是不是意味着不该做多个页面?
  68. 本地查询只返回两个结果,中小商家还有机会吗?
  69. 这些发现会不会很快就失效?
  70. 权威参考资料

摘要:有人没去问ChatGPT喜欢什么,而是打开开发者工具,读它发回浏览器的原始JSON,把引擎自己给每条来源贴的标签扒了出来。每条来源上挂着一个result_source字段,只有四个取值:开放网络、老牌出版商白名单、以及两家商业抓取公司Bright Data和Oxylabs。每个问题还会先被归进一个turn_use_case桶,落进text那个桶的问题压根不联网,你的页面再好也挤不进去。最扎心的一段是模型自己的思考记录:它想读某家产品的定价,发现价格是脚本加载的读不到,于是转头引用了第三方评测站——你的数字,别人的页面。本文把这些字段逐个讲清楚,附自己动手复现的方法和该改哪几处。

“怎么才能在ChatGPT里露脸”这个问题,保哥被问了不下上百次。标准答案永远是那三句:写好内容,做清单体,去Reddit发言。

问题在于,这三句话谁都在说,可谁也没证明过。它们靠的是转述——一个人引另一个人,另一个人再引更前面的一个人,追到源头往往是某次会议上的一句感想。

然后有人换了个做法:不去猜,直接读ChatGPT发回自己浏览器的东西。

两种研究方法,为什么会指向相反的方向?

这件事得先讲清楚,否则你没法判断该信谁。

市面上那些大规模可见度研究,做法是打几千条提问,记录哪些品牌出现在答案里,汇总成声量份额报告。样本大,但它是黑箱——它只能看到成品答案,中间那台机器怎么运转的,只能靠输出反推。

这份来自Suganthan Mohanadasan的观察正好反过来:读网络流量,也就是引擎发给自己浏览器的JSON,把引擎自己的内部标签直接捞出来——它给每条结果盖的result_source、它给每次提问归的turn_use_case、供应商的名字、它自己改写出来的搜索词、它实际调用的模型。

这不是在测量某件事发生的频率,而是在记录这台机器有什么零件、这些零件它自己叫什么名字。

什么叫结构性事实,什么叫方向性数字?

这个区分决定了这篇里哪些能拿去用、哪些只能当参考,作者本人分得很清楚,我照搬过来:

结构性事实频率观察
是什么字段存在、叫什么名、有哪几个取值百分比、排名、谁最多
凭什么成立看见一次就作数,且反复看到要看样本够不够、有没有偏
可信度高,可以拿去做判断只当方向,别当测量
例子result_source有四个值、text桶不搜网七成走某家抓取商、Reddit被引最多

这个态度本身就值得学。多少行业结论是把一次小样本的百分比当成定律往外传的,读的时候没人问一句样本从哪来。

这份观察的边界在哪,先说清楚

一个人、一个登录的付费账号、几天的流量,大约1,240条来源记录、几十次搜索。查询偏向软件和科技类。

所以那些百分比天然带偏——正因为问的是软件和科技,Reddit和科技评测站才会冒头;换一批健康或时尚的问题,榜首会换人。字段结构不受这个影响,因为一个字段只要出现过一次,它就是真的存在。

把这段读进去,后面所有内容你才知道该用几分力气。

想看清引擎的内部动作,为什么抓包这条路走不通?

很多人第一反应是抓包,然后卡在那里放弃。原因很实在:传输内容是加密的,抓下来是一堆乱码。

抓包能拿到的只有元数据:目标主机名、IP,以及一个有意思的事实——客户端走的是QUIC,不是普通的TCP。所以工具能显示出握手里的服务器名,那读的是未加密的那一小段,不是对话内容。

真正的请求和响应躺在后面受保护的载荷里,一直是不可读的。

那到底该从哪一层读?

浏览器本身。解密之后,在开发者工具的网络面板里,查询、答案和全部元数据都是明文JSON躺在那儿。

说白了这是HTTP检查,不是抓包。这个区别值得强调,因为一半想动手的人是从抓包工具开始的,然后就放弃了。

有两条弯路,别跟着走一遍

作者踩过两个,写出来省你的时间:

  • 用自动化控制的干净浏览器去跑,几次查询之内就被人机验证墙挡住,而且在自动化环境里那道墙会一直循环,过不去。最后只能回到真实浏览器、真实登录态。
  • 一开始答案根本不出现在捕获里,因为答案走的是页面加载时就建立的长连接,中途才挂上去的钩子看不见它。

第一条顺带解释了另一件事:这类平台对自动化访问的容忍度极低,想批量跑数据的工具,多半也在跟同一堵墙搏斗。这也是为什么各家可见度工具报出来的数差异那么大,这一点在名次为什么每次查都不一样里从统计角度算过一遍。

每一条来源上都贴着一个标签,它叫什么?

打开网络面板,开着保留日志,跑一次正常查询,然后在响应里搜看起来像标签的东西——冒出来的是result_source

它挂在ChatGPT拉取的每一条网页结果上,你在答案里永远看不到它,而它只有四个取值。

serp、labrador、bright、oxylabs,这四个值分别意味着什么?

取值是什么常出现在哪
serp开放网络的基线多见于新闻类
labrador老牌出版商白名单路透、卫报、华尔街日报、金融时报、维基百科,甚至预印本站
brightBright Data,一家商业抓取公司购物、金融、天气、本地,占了大头
oxylabsOxylabs,前者的直接竞争对手区域和本地媒体,部分开放网络

labrador这一层的摘要长度能到一千多字符,基本等于整篇文章的抽取,而不是搜索结果里那种两行摘要。

labrador那一层,为什么普通站根本进不去?

看名单就明白了:里面那几家有不少已经和模型公司签过内容协议。这更像一个授权层,门票是你得拥有一家全国性大报。

对绝大多数站来说,这一层是关着的,接受这个事实,然后把力气放到能使上的地方去。

bright和oxylabs是谁?这件事为什么值得多想一层?

这两个名字指向两家商业抓取公司,而且它们是直接竞争对手。流量里看不到合同,所以不能断言谁付了谁钱,但可以确定的是:ChatGPT对开放网络的抓取,是通过这两家在跑的,而且字段会告诉你每条结果具体是谁抓回来的。

这件事的含义比它听起来大。它意味着你面对的不是一个统一的爬虫,而是一条外包出去的取数链路。你的站对这两家抓取公司友不友好,直接决定了你的内容进不进得了那个上下文。

站内讲爬虫行为的那篇从日志里逆向AI爬虫的真实偏好是从你自己服务器那一侧看谁来抓了,跟这里正好凑成一对——那边看来的是谁,这边看的是它替谁抓。

一次天气查询内部,两家抓取商是怎么分工的?

有个例子特别直观。一次天气查询里,两家的分工是这样的:

来源管线
全球气象数据站(气象局、天气服务、时间日期类)bright
当地报纸与本地生活媒体oxylabs

同一个问题内部,全球数据走一家,本地媒体走另一家。这说明取数链路是按内容类型分工的,不是随机分配。

你多半只在被抓取的那一层竞争,这意味着什么?

把三层摊开:授权层基本关着,开放网络基线只在少数场景出现,剩下的绝大部分是抓取层。

所以结论很直接:把自己做成干净可抓的。事实和数字要放在纯HTML文本里,不要藏在脚本后面,不要放进PDF,更不要做成图片。至于能不能进那些抓取商实际会去到的页面,靠的是第三方覆盖——公关、品牌提及、外链、社区讨论。

四条管线,各自该用什么打法?

既然管线是分工的,打法也该分开。把四个取值翻译成动作,大致是这样:

管线你能不能进该做什么
labrador基本不能放弃直接进入,改为争取被这一层的媒体报道
bright能,主战场页面纯文本可解析,商业与产品信息尤其重要
oxylabs能,偏区域目标市场的本地媒体与行业目录上要有身影
serp能,偏新闻有新闻价值的动作才会被这一层带到

值得单独说一句labrador那一行。进不去不等于用不上——那一层的媒体如果报道了你,你的信息就以它们的身份进入了这个高权重通道。所以对中小品牌来说,公关不是锦上添花,它是唯一能借道那一层的方式。

另外三条里,最该下功夫的是bright,因为商业、购物、产品类查询主要走它,而这些正是离成交最近的查询。

被抓取商拿走内容,和被搜索引擎收录,是同一件事吗?

不是,差别还不小,值得掰开说。

  • 搜索引擎的爬虫会遵守你在robots里的声明,会按自己的节奏回访,会处理渲染。抓取商更接近于按需取一次原始页面,拿到什么算什么。
  • 搜索引擎有索引,一次抓取的结果能被反复使用。这条链路更像现取现用,页面当时是什么样,模型看到的就是什么样。
  • 搜索引擎会给你反馈,收录状态、覆盖率报告都能看到。这条链路没有任何后台,你不主动去查就完全不知道。

第三条最要命。你的页面在这条链路上被读成了什么样,没有任何人会来通知你,所以主动自查是唯一的办法——这也是为什么前面那套开发者工具的动作值得每个团队学会。

有些问题根本不会去联网,这是怎么判定的?

接下来这个发现更有杀伤力:有些查询完全不产生任何网络搜索。

在搜之前,ChatGPT会先把你的问题归进一个桶,字段叫turn_use_case。观察到的有六个:即时搜索、购物、纯文本、本地、思考、图像生成。

落进text桶的问题,为什么再好的页面也挤不进去?

因为它压根不搜。归进这个桶之后,模型直接用训练语料回答,然后停下,网络面板一片空白。

典型的例子不意外:怎么换备胎、写一段合并有序列表的代码、把这段翻译成四种语言——全都落在这里。

含义很硬:如果一个查询根本不触发搜索,那么再好的页面也没有入口。你为这类词做的所有内容优化,在这条路径上是零回报。想在这类问题里被提到,只能走另一条更慢的路——把品牌权威做起来,等着被写进未来的训练数据,这也意味着你得让公共抓取项目能看到你的站。

一个高风险的例子:连治疗指南这种问题都没搜网

真正该让人后背发凉的是这个:“某种慢性病的最新治疗指南”这样一个时效性强、风险也高的问题,同样被归进了纯文本桶,没有联网,直接从训练语料里答了。

十个刻意设计的时效性问题里,有三个是这么处理的。

这里没有什么权威性可言,也没有内容质量的较量,因为压根没有页面参与。作为内容方,你能做的不是把页面写得更好,而是先判断这个问题到底走不走搜索。

决定进哪个桶的是措辞,不是主题,这有什么用?

这是可操作性最强的一条。几个实测的例子:

  • “附近哪家咖啡好”会翻进本地管线。
  • “值得买的4K电视”会打开购物模式。
  • “有评测的4K电视”反而走普通搜索。
  • 一道数学题会悄悄跳到思考模型。
  • 问某只股票这周的价格,留在即时搜索。

同一个主题,换个说法就换一条管线。这解释了为什么很多人测自己的可见度时结果飘忽——他们以为在测同一件事,实际上问的两句话走的是两条完全不同的路。

那你该怎么先判断一个词值不值得做页面?

动手做页面之前,先花两分钟确认这个问题到底搜不搜网。方法就是前面那套:开着网络面板问一遍,看有没有请求发出去。

判断标准可以粗暴一点:

  • 纯操作类、纯定义类、纯翻译换算类,大概率不搜,页面挤不进去。
  • 带时间、带地点、带品牌、带价格、带比较的,大概率会搜,值得投入。
  • 拿不准的,先测三五个变体,看哪一种措辞能触发搜索,然后照着那种措辞去组织内容。

最后一条其实是把关键词研究往前推了一步:以前研究的是人怎么问,现在还要研究机器把这句话归成了哪一类。

六个桶各自对应什么内容策略?

把桶和动作对起来,规划的时候就不容易乱:

会不会联网内容侧的重点
即时搜索常规主战场,事实清晰、结构可抽取
购物会,走商品通道价格、规格、库存必须是纯文本,商品结构化数据要全
本地会,名额极少集中资源打有把握的场景,第三方佐证是关键
思考会,且大量扇出经得起多条子查询交叉核对,别怕被翻旧账
纯文本不会页面无入口,只能走长期品牌与训练数据
图像生成不涉及与内容策略无关

思考那一行值得多说一句。既然它会跑十几到几十条子查询交叉核对,那么内容里任何前后矛盾的地方都更容易暴露——比如你官网写着支持某功能,帮助文档里却写着该功能已下线。人不会同时翻这两页,机器会。

那些不联网的问题,就彻底没机会了吗?

不是彻底没有,只是路径完全不同,而且慢得多。

这类问题的答案来自训练语料,所以要被提到,你的内容得先进入语料。可做的事情有限但清晰:

  • 确保公共抓取项目能访问到你的站,别在防护层里把它们一并拦了。
  • 把能长期存在的内容做扎实,训练语料偏爱稳定存在过一段时间的页面,昙花一现的活动页没有意义。
  • 争取被那些必然会进语料的地方提到——大型媒体、行业百科、公开的技术文档。
  • 接受时间尺度:这条路以季度和年计,不要用月度指标去考核它。

说实话,对多数中小站而言,与其在这条路上砸钱,不如把力气放在会联网的那些查询上,那里的反馈周期短得多,也可验证得多。

一个问题会扇出成多少次搜索?

ChatGPT其实会把它替你跑的那些搜索暴露出来,只要你能把完整会话取回来。

快模型很敷衍:一条改写后的查询,跑完就结束,明显是拿深度换速度。思考模型完全是另一个物种——让它比较几款产品,它会围绕这一个问题跑出大约十五到四十条子查询,数量随问题复杂度变化。

关于一个问题怎么被拆成一串子问题,站内查询扇出的底层机制那篇讲的是这套逻辑,这里看到的是它在真实流量里的样子。

它会直接对着你的定价页发site:探测

子查询里最值得注意的是这一类:直接用限定站点的写法去打厂商的定价页。

换句话说,它不是在漫无目的地搜,它知道自己要什么,也知道该去哪一页找。你的定价页会被当成一个明确的目标去访问,而不是碰巧被搜出来。

这条对做产品的站意义很大:定价页从一个转化页,变成了一个会被机器定点查阅的事实源。

既然它会定点访问,URL结构该怎么安排?

被定点访问的前提是它能猜对地址。这件事有一半是靠约定俗成的:

  • 关键事实页用最常见的路径命名,定价就叫定价那个词,别用营销化的自造词。
  • 一类事实固定在一个地址上,别让它今天在这个页面明天挪到那个页面。
  • 如果历史上换过地址,旧地址要有稳定的跳转,因为模型的旧印象里可能还存着老路径。
  • 别把关键事实分散在多个页面上,让一次访问就能拿全。

这几条听着像十年前的老生常谈,但它们在这条链路上的权重变了:以前地址不规范只是不好看,现在它直接决定一次定点访问能不能落到你身上。

价格调整之后,怎么让它尽快被纠正过来?

既然模型会带着旧印象来核对,那么调价之后的动作就有讲究了:

  • 调价当天就把页面上的数字改掉,别等营销物料一起上线。页面是唯一被核对的那一个。
  • 在页面上写明生效日期。有明确日期的数字更容易被判断为当前值。
  • 历史价格别留在同一个页面上。新旧两个数字并存的时候,机器不一定挑对。
  • 如果第三方站上挂着你的旧价,主动去联系更新。那些页面是它读不到你时的退路。

最后一条常被忽略。你自己的页面修好了,但如果第三方的旧价还在,某些查询下模型仍然可能引到那边去。做过一轮改造之后顺手把主要的第三方对比页扫一遍,成本很低。

它会先猜一个价格,再去搜索确认,这说明什么?

更有意思的动作在这里:它会先根据训练里的印象猜出一个价格,然后再发一条搜索去确认这个猜测。

两层含义。第一,它脑子里对你的价格已经有一个旧印象,那个印象来自过去的数据;第二,它会去核对。

所以如果你的价格改过而页面没跟上,或者页面上的价格机器读不到,那个旧印象就没有被纠正的机会——它会带着一个过时的数字继续往下走。

它读页面的方式有多“字面”?

非常字面。它会在页面里查找货币符号、查找数字、查找像“代理商”这样的字眼,然后用浏览工具自带的打开和点击命令把想要的内容调出来,整个过程跑在服务端,不是在你屏幕上跑一个代理。

这解释了一个让很多人困惑的现象:为什么把价格做成一张漂亮的图,机器就完全读不到。因为它是在文本里找符号,图里的字不在它查找的范围内。

被抓取、被引用、被提及,为什么是三件事?

这三个词被混着用的频率最高,而流量里它们是三个独立的结果:

发生了什么读者看得见吗
被抓取你的页面被拉进了模型的上下文看不见
被引用你的页面作为某一句话的出处被挂上去看得见,可点
被提及你的品牌名出现在答案里看得见,但不是出处

三件事各自可以单独赢或输。你可以被提及却没被引用,也可以被引用却没被提及。这一层的差距怎么补,站内提及和引用之间那道差距讲的就是这件事。

这三件事,分别该怎么监测?

既然是三个独立结果,监测手段也得分开,混着看只会得出糊涂结论:

怎么看成本
被抓取开发者工具里查响应,或看服务器日志里的抓取商访问低,但要自己动手
被引用答案下方的出处里有没有你的域名,多次采样取比例中,需要重复问
被提及答案正文里有没有你的品牌名中,同上

顺序也有讲究。先确认被抓取,再看被引用,最后才看被提及。因为如果连抓都没抓到,后面两项讨论什么都是空的;而如果抓到了却不被引,问题就落在页面内容本身,跟曝光量无关。

多次采样这件事绕不开,单次结果没有诊断价值,具体要跑多少次才够,AI可见度竞品分析全流程里有可直接照搬的采样方案。

YouTube被抓了两百多次,为什么一次都没被引用?

这是整份观察里最漂亮的一个发现。在那批商业和推荐类查询里,Reddit被抓取278次、被引用11次;YouTube被抓取201次、被引用0次

原因是机械的,不是偏好问题:引用必须绑定到模型真正拿到的文本上。搜索时抓一个视频页,拿到的是元数据,不是那段话本身;而一个社区帖子,内容整个就在页面上。

这不只是单个样本的结论。Ahrefs对140万条提问的研究里,Reddit的被引比例是1.93%,YouTube是0.51%;Profound对社媒引用的分析也发现了同样的差距。三份来源、三种方法,指向同一个机制。

需要说明的是,这跟视频没价值不是一回事。视频在别的界面里照样被大量引用,YouTube正被AI概览大量引用那篇讲的就是另一个入口。同一个平台在不同引擎、不同界面里的待遇可以完全相反,这恰恰说明按平台一刀切地下注是危险的。

Reddit凭什么成了被引最多的那一个?

把上面那条反过来读就是答案:它是纯文本、内容全在页面上、有具体经验、有多个人的说法互相碰撞。这几条正好凑齐了一段可被引用的素材该有的样子。

但别急着去发广告。社区这类来源不能靠硬发拿下,正经做法在社区信号该怎么攒里写过,核心是长期参与而不是投放。

结果按域名去重,这对内容策略意味着什么?

另一个机制同样硬:结果会按域名去重,你站上二十个薄页会塌缩成一个。

这一条直接推翻了一种很流行的做法——针对扇出的每一条子查询各做一个页面,铺一大堆。铺得再多,在去重之后也只剩一个名额,而那个名额会给最能支撑那句话的那一页。

所以正确的做法是每个主张配一个强页,而不是一堆弱页。规模化铺薄页现在的代价,薄内容不是字数少那篇算得更细。

按域名去重,对多品牌和多子域的站意味着什么?

这条规则还有个容易被漏掉的推论:如果你手上有多个站或多个子域,它们在去重时的处理方式并不一样。

独立域名之间通常被当成不同来源,各自有名额;子域的情况要看具体实现,不能想当然认为一定被当成独立来源。这带来一个现实的取舍:

  • 如果你已经有一个权威主站,把内容集中在主站上,好处是每一页都更强,坏处是一个查询里你只能占一个名额。
  • 如果分散在多个独立品牌站上,理论上能占多个名额,但每个站的权威度都被摊薄,能不能被抓到都成问题。

对绝大多数出海团队,答案还是集中。原因很简单:占两个名额的前提是两个站都够强,而多数团队连一个站都还没做到够强。多域名该合还是该拆,站内实体覆盖缺口怎么找提供的方法可以用来判断你的内容到底有没有覆盖全。

厂商自己的页面能不能被引用?能引到什么份上?

能,但有明确的边界:厂商页会被引用,前提是引的是它自己的事实——价格、参数、政策。至于“哪一个最好”这种判断,引用几乎总是落到第三方头上。

这个分工非常清楚,也很公平:你说自己的价格是可信的,你说自己最好是不可信的。

推论是:你需要两条腿。一条是把自己的事实做到机器一读就懂,另一条是让第三方替你说好话。缺哪条都不行——只有事实没有评价,你的数字被读走,推荐给了别人;只有评价没有事实,别人替你说的那些又没有可核对的依据。

自己的事实该怎么组织,才算“一读就懂”?

这里有个常见的误会:以为把结构化数据标全了就等于机器能读懂。实际上这条链路读的主要是页面上的可见文本,结构化数据是辅助而不是替代。

比较稳的组织方式是三层都做,但优先级分明:

  • 第一优先是可见文本。价格、参数、条件用普通段落或表格写出来,人能看见的机器才读得到。
  • 第二是结构化标注。它帮助机器确认这个数字是什么含义,但前提是页面上真的有这个数字。
  • 第三才是各种接口和数据文件。它们对特定场景有用,但不能指望它替代页面本身。

顺序反过来做的团队不少:结构化数据标得漂漂亮亮,页面上的价格却是脚本渲染的。结果是标注和实际内容对不上,两头都不落好。

竞品在这条链路上的表现,能不能顺手看出来?

能,而且几乎是免费的。你跑自查的时候,那批被抓和被引的来源里本来就有竞品。

值得记下来的有三样:竞品自己的页面有没有被引、被引的是哪一类内容、以及哪些第三方站在替它们背书。第三样最有价值——那份第三方名单基本就是这个品类的事实源清单,你该出现在同一批地方。

还有一种情况值得留意:如果竞品的官网被引而你的没有,两边页面结构一对比,问题往往一眼就能看出来,通常就是可解析性的差别。这种对照比任何抽象的优化建议都直接。

这件事在团队里该归谁管?

这是个很现实的问题,因为它横跨了三拨人。

环节谁来做典型卡点
定期自查与解读SEO或内容负责人不熟悉开发者工具,第一次要人带
页面可解析性改造前端不理解为什么要改,觉得现在挺好
事实的准确与及时产品或运营调价、改政策时不记得同步页面
第三方覆盖市场或公关不知道该盯哪些站

最容易卡的是第二行。跟前端说“要做SEO优化”通常推不动,但把开发者工具打开,让他亲眼看见价格在源码里是一片空白、而模型在推理里写着“可能是脚本加载的”,这件事就变得非常具体了。保哥的经验是,这段演示比任何需求文档都管用,因为它是他们自己的工具、自己熟悉的界面。

这条链路和传统SEO,资源该怎么分?

不用分,因为大部分动作是重合的。

可解析的HTML、清晰的信息架构、稳定的地址、准确及时的事实、第三方覆盖——这几件事在传统搜索里同样是基本功。真正新增的只有两块:一是判断查询走不走搜索这个前置动作,二是定期打开开发者工具做一次自查。

两块加起来,一个人每月两三个小时就能覆盖。所以这件事不该被当成一个新项目去立项,它更像是给现有流程加了一道检查。

反倒要提防另一种情况:为了所谓的AI优化去做一批只给机器看的页面或文件。这类投入很难验证,而且和前面那条“别铺薄页”的机制直接冲突。

关于这份观察,最常见的三个误读是什么?

这份东西传播得挺广,跟着传开的误读也有几个,值得点破:

  • 误读一:以为那几个百分比是定论。作者自己反复强调那是单账号小样本、偏软件科技类的结果。结构可信,数字只当方向。
  • 误读二:以为发现了排名算法。恰恰相反,作者明确说没找到任何排名分数,因为那部分跑在服务端。这份观察揭示的是取数管线,不是排序逻辑。
  • 误读三:以为视频没用了。结论只说明在这个引擎的这条路径上视频拿不到引用,换个界面、换个引擎,结论可能完全不同。

第三条尤其值得提醒。把一个特定场景下的机制推广成普遍规律,是这个行业最常犯的错,而且往往就发生在一份好研究刚出来的时候。

引用绑定到具体一句话,而不是整篇,这句话怎么落地?

因为引用要挂在某个具体的论断底下,所以“主题相关”是不够的,你得是支撑那一句话的最佳来源。

落到写法上,意味着几件事:

  • 把关键论断写成独立、完整、可以被单独抽走的一句或一段,别让它埋在长段落中间。
  • 论断旁边就近给出依据,数字、时间、条件都写清楚,别让机器还得跨段落去凑。
  • 一页只主打少数几个论断,贪多会让每个论断都不够强。

这套按块组织内容的思路,站内AI为什么按块而不是按页检索那篇有完整方法。

模型自己是怎么描述它的取源策略的?

思考模型的推理过程会被存进会话里,而它在里面用大白话描述了自己怎么挑源。这段是整份观察里最有价值的部分,因为它不是外人的推测,是机器自己的说法。

对于事实类的信息——价格、参数——它明确表示先去官方页面。比较某款工具时,它读了官方页,记下各档位分别是多少钱,然后判断官方定价页看起来更新,所以应该引这一个。

它要的是自己信得过的、并且是当前的那个源。这个偏好对做产品的站来说是个好消息:在自己的事实上,你天然有优先权。

它想读你的定价,读不到的时候会做什么?

然后就撞墙了。

面对另外两款工具,它在推理里写道:定价没有直接出现在搜索结果里,可能是用脚本加载的。同样的情况又出现了一次。

于是它放弃了,转而写道:既然官方页难以解析、又不显示价格,那可以引用第三方来源,并且注明适当的时候用某个评测平台的引用。

整件事就浓缩在这一段里:模型本来想要这两家自己的数字,价格藏在脚本后面读不到,于是它引用了第三方评测站。

你的事实、别人的页面:这件事的代价有多大?

把这个结果说白了就是:你的数字,出现在别人的页面上,因为你自己的页面解析不了。

代价至少有三层:

  • 归属没了。用户看到价格,点开的是第三方,不是你。
  • 准确性没了。第三方那份数据可能是半年前抄的,你调过价它不知道。
  • 叙事权没了。第三方的页面上,你的价格旁边通常还并排着竞品的价格。

一个脚本加载的定价表,代价不只是排名差一点,它是把自己的数字连同解释权一起送了出去。这跟前端渲染吃掉页面内容是同一类问题,SPA站AI爬不到的真相那篇有实测对照。

排名分数在哪?为什么谁都拿不到

作者一开始是奔着找一个隐藏的排名分数去的——某种域名权重、信任分、打分公式。找了一圈,没有。

原因很朴素:那类逻辑跑在服务器上,根本不会发到你的浏览器里。

所以有一条判断可以直接拿走:任何声称拿到了ChatGPT排名因素的说法,都不必再往下听。那个东西不在传输里,第三方拿不到,这跟另一件事同源——平台愿意给你什么、不愿意给你什么,从来由它的商业模式决定,AI搜索的归因数据为什么不会给你那篇把这套逻辑讲透了。

个性化那一层,为什么你永远优化不了?

流量里还露出了一个字段,装着个人来源,取值包括历史对话、邮箱、文件。

在一个和作者本人工作相关的查询里,模型把他过去的对话拉了进来,而且只在三次会话里的一次这么做——正好是与他历史相关的那一次。

含义是:有些答案里有一部分是用用户的私有数据拼出来的,你永远无法优化那一块。这也是为什么两个人问同一个问题会得到不同答案,以及为什么各家工具报出来的可见度分数总在抖。

接受这一点会让你少走很多弯路:不要试图去解释每一次结果差异,把精力放在你能影响的那部分上。

本地查询只返回两个结果,这个上限意味着什么?

还有一个配置值直接写死了本地结果的数量上限,它是2。

问附近哪家咖啡好,返回的是两家,不是十家。本地这条路上,你要么在前二,要么等于不存在。

这个数字比传统本地包的三个位置还要狠,而且没有下滑到第四第五还能捞点曝光的余地。本地商家该怎么应对,站内门店在地图排第一但AI不推荐你评论得先搬到机器进得去的地方两篇合起来是一套完整打法。

这套东西自己怎么跑一遍?

不需要任何特殊权限,用你自己的浏览器就行。最小步骤是这样:

  1. 打开ChatGPT,调出开发者工具,切到网络面板。
  2. 勾上保留日志,避免翻页时记录被清掉。
  3. 正常问一个问题。
  4. 在响应里搜索result_source这个词。

光是这一步,你就能看到每条链接背后是哪条管线取回来的。想继续往深处看扇出、引用和推理过程,可以在控制台里针对一次已经联网搜索过的会话,把完整会话数据取回来再解析——这类脚本只读你自己的会话,数据不出本机。

不想动手的话,有没有现成的路子?

有。已经有人根据这份研究做了免费的浏览器扩展,把其中三个信号抓出来:问题被归进了哪个turn_use_case桶、答案里的引用分别是什么类型、以及每条被引结果背后的result_source管线,并且能直接导出表格。

它同样跑在你自己的会话上。对不想碰代码的团队来说,这是最省事的入口。

但保哥还是建议第一次手动跑一遍。亲眼在响应里翻出那个字段,和看别人整理好的图表,理解深度完全不是一回事。

跑完之后,先看哪几个数?

别一上来就统计百分比,样本不够的时候那些数只会误导你。先看这四件结构性的事:

看什么能得出什么结论
这个问题搜没搜网决定这个词值不值得做页面
它被归进了哪个桶决定该按哪条管线的规则去准备内容
你的域名出没出现在被抓列表里被抓到是被引用的前提
被抓了却没被引,是哪一类页面多半是内容解析不出来或者不够支撑论断

第四行是最有价值的一行。被抓却不被引,说明你已经进了门却没被选中,这类页面改起来的投入产出比,比从零去争一个新来源高得多。

如果连抓都没抓到,该按什么顺序排查?

被抓不到通常不是玄学,按这个顺序查,多数情况能定位:

  1. 页面本身能不能被匿名访问。登录才能看的、地区限制的、要同意弹窗才显示内容的,先排除掉。
  2. 源码里有没有正文。用查看源代码的方式看,不是用开发者工具的元素面板——后者显示的是脚本执行完的结果,会骗你。
  3. 防护层有没有误伤。这是最常见的一类,为了防采集设的规则把商业抓取商一并挡了,而你完全不知情。
  4. 页面在不在任何被抓取的来源里被提到。如果整个开放网络上没人链你、没人提你,抓取商也没有路径找到你。
  5. 内容是不是太新。刚上线的页面需要时间进入各条链路的视野。

第二步值得单独强调一次,因为它是最容易自欺的一步。元素面板显示得好好的,源码里却什么都没有,这种情况保哥见过太多次了,团队还会理直气壮地说“我们检查过了”。检查的姿势不对,检查一百遍也是白搭。

第三步的排查方式是看服务器日志里那些访问的来源,如果有被拒绝的记录,问题就清楚了。要注意的是,被拒绝这件事在页面上完全没有痕迹,用户访问一切正常,只有日志里那一行状态码会告诉你真相。所以这一步没法靠肉眼替代,必须真的去翻日志。托管环境下这类拦截还可能是服务商默认开启的,你自己都没配置过,站内托管主机可能正悄悄拦AI爬虫那篇写过一个完整案例。

这套东西会改变内容排期吗?

会,而且改的是顺序而不是总量。

过去排内容通常按搜索量和难度来。现在要在前面插一道筛子:这个问题触不触发搜索。触发的往前排,不触发的往后放或者干脆不做。

实际排下来,往往会发现两类内容的优先级变了:

  • 那些搜索量很大的基础定义类和操作类内容,优先级要往下调,因为它们大概率落在不联网的那个桶里。这类内容在传统搜索里仍然有价值,但如果你的目标明确是AI可见度,它的回报会低得多。
  • 带具体条件、具体品牌、具体价格、具体比较的内容,优先级要往上提。它们不但会触发搜索,而且正是扇出时那些子查询要找的东西。

这个调整对内容团队来说是个好消息:后一类内容本来就更接近成交,只是过去因为搜索量看着小而排在后面。

有没有一份能直接贴墙上的自查清单?

把全文收敛成一张表,每季度对着过一遍:

检查项合格标准不合格的典型表现
关键事实可解析查看源代码能看到价格与参数源码里是空容器,元素面板才有
不依赖交互不切换标签也能看到默认值切换后才加载,初始为空
地址稳定事实页地址一年内没变改版换了路径且无跳转
事实及时调价当天页面同步页面还是上个版本的价
论断可抽取关键结论是独立成段的结论埋在长段落中间
第三方覆盖主要评测与目录站有你只有自己的页面在说自己
抓取未被误伤日志里没有被拒记录防护规则一刀切
自查有记录每季度存档一次原始结果凭印象说“最近好像好点了”

最后一行是最容易被跳过、也最容易让前面七行白做的一行。没有存档就没有对照,没有对照就永远说不清改动到底有没有用。

从这些字段里,能推出哪几条真正可执行的动作?

把前面所有发现收敛成一张清单:

  • 关键事实——价格、参数、政策、可用性——一律放进纯HTML文本,不用脚本加载,不做成图片,不塞进附件。
  • 定价页要能扛住一次定点访问,也就是说别人直接冲着这一页来的时候,价格得在那儿。
  • 避开需要交互才展开的数据,比如切换标签才加载的价格表。
  • 每个论断配一个强页,别为扇出的每条子查询各铺一页。
  • 第三方覆盖当成必修项来做,因为对你的判断永远由别人的页面提供。
  • 做词之前先确认它触不触发搜索,不搜的那些别投钱。
  • 本地场景按只有两个名额来规划,把资源集中到最有把握的那个点位上。

纯HTML这件事,为什么在这里比在SEO里更硬?

传统搜索引擎对脚本渲染的内容有比较成熟的处理能力,慢一点,但多数情况下能拿到。

这条链路不一样。中间隔着第三方抓取商,它们更接近于取原始HTML,而模型在读到之后是用字面查找的方式去找符号和数字的。链路上任何一环没把文本交出来,最终就是读不到。

更关键的是它读不到之后的行为不是放弃,而是去别人那儿找。传统搜索里内容读不到,代价是你不排名;这里读不到,代价是竞品的对比页替你回答了这个问题。技术端整体该怎么配,GEO技术端怎么优化才抓得到读得懂那篇是完整清单。

出海独立站做这套,还要多考虑哪几层?

几个额外的坎:

  • 货币与格式。模型是按符号去找价格的,多币种切换如果靠脚本实现,很可能所有价格都读不到。至少要有一个默认币种的价格以纯文本形式存在。
  • 区域抓取商的偏向。不同区域的媒体走不同的管线,你在目标市场的本地媒体上有没有覆盖,会实打实地影响你进不进得了那批候选。
  • 语言。当地语言的第三方评测才是当地问题会匹配到的,中文内容在那些问题上基本不参与。
  • 拦爬策略。如果你为了防采集把商业抓取商的特征一起拦了,等于把自己从这条链路上摘了出去。这个取舍要算清楚再动手。

最后一条是个真实的两难:防采集和被AI读到,用的是同一个入口。想清楚哪些页面必须被读到,别一刀切。

一个出海SaaS工具站的定价页改造,三周发生了什么?

保哥手上有个做跨境选品分析工具的客户,订阅制,四个档位,主要打北美和东南亚市场。他们的问题很典型:在AI里问“有哪些选品工具、分别多少钱”,答案里会提到他们的名字,但价格数字全部来自第三方的对比文章,而且是两个版本之前的旧价。

第一周做诊断。按前面那套方法跑了一轮,在响应里翻到自己域名时发现:页面被抓了,但引用挂在一家评测站上。再看推理记录,模型的说法几乎和研究里一模一样——价格没在页面里直接出现。

回去查代码,原因是定价表做了按月按年切换,两套价格都是切换时才从接口拉的,初始HTML里一个数字都没有。人眼看着一切正常,机器拿到的是一张空表。

第二周改造。把默认档位的价格改成服务端直接输出,切换仍然保留但不再是唯一入口;同时把各档位包含什么写成纯文本列表,不再用图标矩阵表示;页面上还加了一句明确的更新日期。

第三周开始复测。再问同样的问题,价格开始来自他们自己的页面,而且是当前价。有意思的是“哪个更适合新手”这类判断,引用仍然落在第三方——这正好印证了那条分工:事实归你,判断归别人。

诚实说一句,同期他们也在几个社区里做了内容,所以被提及的频次变化不能全算到定价页改造上。要拆开这两件事得跑对照实验,方法在增量这一层怎么自己证里。

那次判断失手:以为被抓得多就等于被引得多

同一个客户,前面还有一段弯路值得说。

最早发现自己在AI里存在感低的时候,团队的判断是“抓取量不够”,于是花了不少力气去做外链和目录收录,希望被更多地抓到。保哥当时也支持这个方向,理由听起来很顺:被抓得多,被引的机会自然多。

三个月后回看,抓取确实上去了,被引用几乎没动。

后来读到YouTube那组数据才想明白:被抓两百次、被引零次是完全可能的,因为这两件事卡在不同的关口上。抓取解决的是“进不进得了上下文”,引用解决的是“页面上有没有一句能被挂上去的话”。前一个关口过了,后一个关口不会自动打开。

这次失手的代价是三个月和一笔外链预算,换来一条判断规则:先确认自己被抓了没有;已经被抓还不被引,问题就不在曝光,而在页面能不能支撑一个具体论断。

这份观察的保质期有多久?该多久重跑一次?

作者自己说得很实在:结构是稳的,数字是动的。

字段名、桶的划分、去重规则这类结构性的东西,改动没那么频繁;而各管线的占比、哪个域名被引最多,这些每周都可能变。

建议的节奏是:结构性的自查一个季度跑一次,看看字段有没有变、有没有冒出新桶;针对自家核心问题的抽查每月一次,主要看自己有没有被抓、被引。

还有一点值得留个心眼:这类观察一旦流传开,被观察的一方通常会做些调整。所以别把某一次的发现当成永久成立的规律,把方法学会比把结论背下来重要得多。

老一套建议到底还成不成立?

回到开头那三句话:写好内容、做清单体、去社区发言。

大体上成立。社区确实拿到了最多的引用,清单体和评测站占了剩下的大半。但有一句得补上:好内容仍然重要,只不过只有机器读得到的那一半算数,另一半它是从别人的页面上读的。

更根本的一句是:ChatGPT不是搜索引擎,别再照着搜索引擎那套去优化它。它在问题值得一搜的时候才搜,搜的时候读你自己的页面拿事实——前提是解析得了,读别人的页面拿观点。照着这个来。

从这周开始,先做哪三件事?

成本都很低,这周就能开工:

  1. 把开发者工具打开跑三个核心问题。看它们搜不搜网、被归进哪个桶、有没有抓到你。这一步只要二十分钟,得到的信息比读十篇分析都多。
  2. 查一遍关键事实是不是纯文本。价格、参数、政策,用查看源代码的方式确认它们真的在HTML里,而不是脚本填进去的。
  3. 挑一个核心论断,配一个强页。论断写成能被单独抽走的一段,依据就近给全,别指望机器跨段落拼。

做完这三件,你至少知道自己是卡在没被抓,还是被抓了没被引。这两种情况的解法完全不同,而大多数团队从来没分清过自己在哪一种里。

常见问题解答

result_source这个字段普通人能自己看到吗?

能。打开浏览器的开发者工具,切到网络面板,勾上保留日志,正常问一个问题,然后在响应里搜索这个字段名就行。不需要任何特殊权限,看的是你自己会话里的数据。整个过程属于HTTP检查,不是抓包,用抓包工具反而做不到,因为传输内容是加密的。

知道ChatGPT用了第三方抓取公司,对我有什么实际用处?

它说明你面对的不是一个统一的爬虫,而是一条外包出去的取数链路。实际用处有两个:一是内容必须是干净可抓的纯HTML文本,链路上任何一环拿不到文本,最终就是读不到;二是如果你的防采集策略把商业抓取商的特征一起拦了,等于主动把自己从这条链路上摘出去,这个取舍要算清楚。

怎么判断一个查询到底会不会触发搜索?

开着网络面板问一遍,看有没有请求发出去,这是最直接的办法。经验上,纯操作类、纯定义类、纯翻译换算类大概率不搜;带时间、地点、品牌、价格、比较的大概率会搜。关键是决定归类的是措辞而不是主题,同一个话题换个说法可能走完全不同的管线,所以值得多测几个变体。

为什么YouTube被抓了很多次却一次都没被引用?

因为引用必须绑定到模型真正拿到的文本上。搜索时抓一个视频页,得到的是元数据而不是内容本身,没有可绑定的文本就挂不上引用。社区帖子则是内容整个都在页面上。需要注意这不代表视频没价值,在别的界面和引擎里视频照样被大量引用,这恰恰说明按平台一刀切下注是危险的。

把价格做成图片或者用脚本加载,后果到底有多严重?

后果不是排名差一点,而是模型读不到之后会转头引用第三方评测站。也就是说你的价格数字会出现在别人的页面上,还可能是过时的版本,旁边通常并排着竞品报价。它读页面的方式是字面查找货币符号和数字,图里的字不在查找范围内。

结果按域名去重,是不是意味着不该做多个页面?

不是不做多个页面,是不要为同一个论断铺一堆薄页。去重之后你的站只留一个名额,那个名额会给最能支撑那句话的页面,铺得多不会增加名额,只会稀释质量。正确做法是每个独立的主张配一个强页。

本地查询只返回两个结果,中小商家还有机会吗?

有,但策略要变。名额只有两个意味着广撒网没有意义,资源应该集中到最有把握的那个点位上——通常是你真正有优势的那个具体场景,而不是宽泛的品类词。同时要把可被抓取的第三方佐证做起来,因为进入候选靠的是别人的页面。

这些发现会不会很快就失效?

结构性的部分相对稳定,字段名、桶的划分、去重规则改动没那么频繁;频率类的数字每周都可能变。而且这类观察流传开之后,被观察的一方通常会做调整。所以把方法学会比把结论背下来重要,建议结构性自查一个季度一次,自家核心问题的抽查每月一次。

权威参考资料

分享到
标签
版权声明

本文标题:《有人把ChatGPT挑源的内部字段扒了出来:定价页解析不了,它就转头引第三方》

本文链接:https://zhangwenbao.com/chatgpt-source-selection-network-traffic-fields.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交