AI水印怎么检测?测到不等于它写的,测不到也不等于不是

AI水印怎么检测?测到不等于它写的,测不到也不等于不是
张文保 81 分钟阅读 1,376 阅读
本文目录
  1. 8月2日之后,Claude写出来的每一段字都带着一个记号
  2. 它不是隐藏字符,也不是元数据
  3. 为什么读者一点都察觉不到
  4. 检测器还没交到你手上
  5. 200个词以下,这套机制根本不工作
  6. 和图片水印完全不是一回事
  7. 为什么这件事挑在这个时间点做
  8. 测出了水印,能证明这段字是AI写的吗?
  9. “经过”和“写的”是两回事
  10. 三次会议之前,我们就吃过一次这个亏
  11. 那条74% 的研究结论,值得单独看一眼
  12. 完整改写能去掉,可去掉之后它还算AI写的吗
  13. 内容团队的四种常见姿势,各自会怎样
  14. 这对做多语言站的人尤其要紧
  15. 那反过来呢?测不出水印,能证明这段字是人写的吗?
  16. 官方自己列了五条测不出来的理由
  17. 别家模型完全不在这套体系里
  18. 碎片化会带来什么后果
  19. 行业里已经出现的一个苗头
  20. 欧盟那条法规要的到底是什么
  21. 那排名会不会受影响
  22. 做个思想实验:如果明天全行业都打上记号
  23. 不过有一类场景确实会变
  24. 把镜头拉远:“谁写的”从来就是一栏自己填的字段
  25. 规则要生效,先得给你分类
  26. SEO里的自填字段,比你以为的多得多
  27. 为什么大多数规则最后都挂在了自填字段上
  28. 三种字段,三种命运
  29. 观察者的应对方式高度一致
  30. 被绕过之后,那一栏会怎么样
  31. 真实站点上,身份自证的链条到底有多薄?
  32. 样本和口径先交代清楚
  33. 先看总量:六成站有,四成站连声明都没有
  34. 那条顺着可核验度往下掉的曲线
  35. 掉得最陡的那一段在哪
  36. 为什么这条曲线值得SEO从业者认真看
  37. 为什么量首页,不量“关于我们”页
  38. 这条曲线在别的数据上也出现过
  39. 把这条曲线用成自查工具
  40. 这次测量没做到的几件事
  41. 如果要复现这套测量
  42. sameAs是唯一一栏能被外部核验的,它被填成了什么样?
  43. 347条指针,指向哪里
  44. 真正做了外部锚定的,只有12个站
  45. 顺带看到的两件小事
  46. 这一栏怎么填才算真有用
  47. 一个反常识的小结论
  48. “我们用什么建的站”这一栏几乎没人填,为什么没人在乎?
  49. 自称的比例:6.6%
  50. 旁证的比例:82.4%
  51. 有意思的是,填了的那9个其实都很诚实
  52. 插一句:这次的尺子自己先失效了一次
  53. 还有哪些字段正在走同一条路
  54. 对日常工作的一个直接推论
  55. 文章页上的署名,两处自填字段能对上吗?
  56. 样本比预想的小,原因得先说
  57. 两处都写了作者的,26篇里只有4篇
  58. 署名栏里填的不一定是人
  59. 时间戳这一栏也没好到哪去
  60. 把署名做对,其实只有四步
  61. 时间戳该怎么处理才不给自己挖坑
  62. 那内容团队现在应该做什么,不应该做什么?
  63. 三件不值得做的事
  64. 三件现在就该做的事
  65. 工作流排一排,误伤概率能降不少
  66. 什么情况下应该干脆放弃自证
  67. 如果只能做一件事,做哪件
  68. 最小可行的留痕方案长什么样
  69. 留痕还有一个附带好处
  70. AI搜索会怎么对待这些记号?
  71. 目前的公开状态
  72. 往前推,可能走哪两条路
  73. 对GEO实操的三条影响
  74. 三条路各自该怎么应对
  75. 顺便说说被动引用这件事
  76. 如果客户明天就要你证明“这是人写的”,你拿得出什么?
  77. 拿不出手的四样东西
  78. 拿得出手的五样东西
  79. 把这份清单反过来用
  80. 拿它去挑供应商,比拿它去挑内容更有用
  81. 最后留一个问题给读者
  82. 一份能拿出手的说明长什么样
  83. 最后回到那136个站
  84. 常见问题解答
  85. Claude的水印能被普通用户检测出来吗?
  86. 把AI写的稿子人工改一遍,水印还在吗?
  87. 没检测出水印,能证明内容是人写的吗?
  88. 带水印的内容会被搜索引擎降权吗?
  89. 我的独立站需要在页面上声明内容是否由AI生成吗?
  90. 结构化数据里的author字段填品牌名可以吗?
  91. 如果客户要求提供“非AI生成”的证明,我该给什么?
  92. 权威参考资料

摘要:把136个品牌独立站的首页快照拆开数了一遍,代表公司身份的那段结构化声明里,纯自述的name字段有94% 的站填了,而能拿去官方登记处一查就知道真假的vatID与leiCode,各自只有1个站填过——填写率顺着可核验程度一路往下掉,掉了78倍。8月2日起Claude的输出全部带上水印,这件事值得单独写一篇,不是因为世上多了一个检测工具,而是因为它把一个被绕开很久的老问题重新摆上了桌面。

先说清楚发生了什么。2026年8月2日起,Anthropic给Claude的输出加了一层看不见的记号,理由写得很直白,是为了对上欧盟人工智能法案第50条第2款关于机器可读标识的要求。消息出来之后,中文圈的讨论几乎立刻跑偏成了两种,一种是“完了,以后AI写的稿子会被查出来”,另一种是“无所谓,改一改不就没了”。

这两种说法都不算错,但都不重要。真正要紧的那句话藏在Anthropic自己的说明里:检出记号只能说明这段文字经过了Claude,不能说明这段文字是Claude 的。这两件事之间的距离,比大多数人以为的远得多。

保哥这两天把这条新闻和手头一批品牌站的抓取数据放在一起看,越看越觉得它们说的是同一件事。水印想解决的问题,是“这段内容的来源能不能被独立核实”。而独立站上关于身份和来源的那一整套声明——公司叫什么、注册在哪、谁写的、什么时候写的——本来就全是页面自己填的,没有一栏需要向任何人交代。水印不过是把这个老毛病挪到了内容层,顺便让它变得刺眼了一点。

8月2日之后,Claude写出来的每一段字都带着一个记号

要判断这件事对内容团队意味着什么,得先搞清楚这个记号到底是什么东西。市面上流传的猜测大多是错的,而错的方向出奇一致:都以为它是“藏进去的”。

内容进模型不止一条路,robots.txt挡不住AI训练的四条路径是更早的一次拆解。

说到披露这件事,AI内容披露该怎么写早就讨论过一轮,结论是不做什么的清单比做什么的更可核查。

它不是隐藏字符,也不是元数据

最常见的猜测是零宽字符。这类字符在网页上不显示,复制粘贴时跟着走,很多人第一反应就是它。第二常见的猜测是文件元数据,就像照片里的EXIF那样,藏在正文之外的角落。

顺手说一句,一个尾逗号就能让整页结构化数据失效,写之前先校验。

更早一轮尝试走的是另一条路,可验证出处正在变成新的信任货币,做法不同但想解决的是同一件事。

两个都不是。按 Anthropic关于文本水印的官方说明,这个记号既不是特殊字符,也不是附在文件上的额外信息,而是选词过程本身的一种统计模式

模型生成文字时,每写一个词都要从一堆候选里挑一个,这个挑选带随机性。水印做的事是把随机性的来源换掉:不再用一个跟谁都无关的随机数,而是用一把密钥加上前面几个词,共同决定下一个词该选哪个。

单看任何一处选择,都完全正常,因为它本来就正常,模型确实可以选这个词。但把几百个词连起来看,这串选择呈现出的模式就很难用巧合解释了。手里有那把密钥的人能把模式认出来,没有密钥的人连有没有记号都看不出来。

这个设计有个直接后果,很多人没意识到:你没法靠肉眼、靠去掉不可见字符、靠另存为纯文本来清掉它。它不在字符里,它在词与词之间的选择关系里。你把文本从Word复制到记事本再贴回来,一个字节都没变,记号原封不动。

为什么读者一点都察觉不到

有人担心加了水印之后文字会变味。理论上确实会有影响——被限制的随机选择总归比自由选择少一点余地。但实际读起来的差别,按公开说法接近于零。

读感之外更该盯的是事实密度,提升引用率的七招里那把尺子更实在。

靠读感判断的老办法另说,AI内容检测工具的12项语言特征至今仍是多数第三方产品的实际依据。

原因在于自然语言里可替换的词太多了。同一个意思,模型有十几种说法都成立,水印只是把这十几种里的选择偏向某一部分,而这一部分本身也都是通顺的。这就像有人规定你走路必须先迈左脚,你走出来的样子跟平时没什么两样,只是步伐节奏里多了一条别人能算出来的规律。

所以指望“读起来怪怪的就是AI写的”这条经验来识别,方向从一开始就错了。真正能识别的只有算法,而算法要拿到密钥。

检测器还没交到你手上

这是最容易被漏掉的一环。Anthropic说了会开放检测接口,但在写这篇的时候,公开可用的检测能力还没铺开。

工具自己编东西这件事也要防,AI幻觉引用怎么查有一套排查动作。

顺带提醒一句,AI写的内容会不会被谷歌惩罚这个问题,官方从没给过肯定答案。

这意味着一个尴尬的中间状态:记号已经在所有输出里了,能读懂记号的工具还不在多数人手上。于是市面上必然会出现一批号称能检测的产品,它们检测的其实是别的东西——文字的困惑度、句式的规整程度、用词的分布——那些是旧的AI检测思路,和水印毫无关系。

这里的判断很简单:接下来半年,凡是宣称能查Claude水印的第三方工具,先默认它查的不是水印。判据也简单,问它一句“你用的密钥从哪来的”,答不上来就是在拿旧办法套新概念。

200个词以下,这套机制根本不工作

还有一条硬门槛。统计模式要显现出来需要足够的样本量,文本太短,模式和巧合就分不开。目前公开的门槛是200个token左右,换算成中文大约是一两百字。

短文案能改到什么程度还看平台,哪些页面元素能改哪些被平台锁死

短文案里最典型的是标题,SEO标题的模板与长度阈值决定了它注定短到测不出。

这条门槛的现实意义比听上去大。想想内容团队日常真正让模型生成的东西:标题、商品描述、按钮文案、meta description、FAQ的一问一答、社交贴文。这些东西绝大多数都不到200个token。也就是说,电商站上最密集使用AI的那部分文字,恰好落在水印覆盖不到的区间里。

内容类型典型长度是否可能带上可检出的记号
商品标题10到30字否,远低于门槛
meta description60到155字符
商品详情段落100到300字边缘,多半否
FAQ单条回答50到200字
博客长文1500字以上是,但取决于改动幅度
邮件营销正文200到600字边缘

这张表其实回答了一个很现实的问题:如果你担心自己站上的AI痕迹被查出来,那么最该担心的不是那些短文案,而是长文。而长文恰恰是最可能被人工大幅改写的类型。两头一夹,真正会被稳定检出的内容,比想象中窄。

和图片水印完全不是一回事

因为都叫水印,很多人会拿图片水印来类比,这个类比会把人带偏。

视频那边的收录规则也改过一轮,老打法正在悄悄失效

图片这条线另有讲究,原创配图怎么把自然流量拉高一倍是完全不同维度的问题。

图片水印的做法是在像素里嵌入信息,改动的是内容本体,理论上你可以逐像素去找、去抹、去覆盖。压缩、裁剪、加滤镜都可能损坏它,所以图片水印的攻防重点在“怎么让它扛住加工”。

文本水印的路子完全相反。它没有往内容里加任何东西,它改的是生成过程中的选择倾向。你拿到的每一个字符都是正常字符,删掉哪个都不会“破坏水印”,因为水印不在任何一个字符里。

对比项图片水印这套文本水印
藏在哪像素数据里选词的统计模式里
能否逐点定位不能
格式转换后可能保留纯文本复制照样保留
削弱它的方式压缩、裁剪、滤镜改写、翻译、缩写
长度要求基本没有需要足够长的样本

这个差别的实际后果是:你惯用的那些“去水印”手段,在文本上一个都不管用;而真正管用的手段——大幅改写——恰好是内容团队本来就该做的事。某种意义上,这套机制惩罚的是不动脑子的复制粘贴,而不是使用AI本身。

为什么这件事挑在这个时间点做

不是技术突然成熟了,是法规到期了。

合规这根弦得一直绷着,海外社媒营销的五类雷区红线可以当发布前自检。

合规驱动的产品变更不是头一回,隐私法规的同意架构当年也是被同一股力量推着落地的。

欧盟那部人工智能法案里关于透明度的条款有明确的生效节奏,涉及生成合成内容的系统必须让输出可被机器识别。对模型厂商来说这是硬约束,不做就没法在欧盟市场提供服务。

所以这一轮标记的落地,从一开始就是合规驱动,不是产品驱动。理解这一点能帮你判断后续走向:合规驱动的功能通常做到刚好达标就停,不会主动往外扩展能力;配套设施(比如检测接口)的优先级也会排在合规要求之后。

另一个可以预期的结果是:各家厂商会各做各的。合规要求的是“可被机器识别”,没要求“各家互通”。于是很可能出现一堆互不兼容的标记体系,谁也读不了谁的。对内容方来说,这意味着不存在一个统一的检测入口,也就不存在一个可以一劳永逸应付的合规动作。

测出了水印,能证明这段字是AI写的吗?

不能。这不是外界的推测,是Anthropic自己在说明里写的,而且写得相当克制。

关于人机之别,42000篇实测的AI内容排名对比给过一组更冷静的数字。

“经过”和“写的”是两回事

把一段人写的稿子丢给模型,让它改错别字,让它把英文段落译成中文,让它把三千字压成三百字,让它把PDF里的文字整理成表格——这些操作的输出全都会带上记号。

工序怎么排,AI内容创作的六要素与八步流程是一份现成模板。

怎么用又不丢掉自己的声音,把AI当创作工具的八种写法讲的正是这一层分寸。

可是这些场景里,内容的来源是谁?是那个人。模型只是一把工具,作用相当于拼写检查器和翻译软件。Search Engine Journal那篇专门讨论水印与作者身份的分析把这一点讲得很清楚:检出记号能确认的只有一件事,就是这段文字在某个环节被模型处理过。

这个区别在实务上会立刻变成麻烦。设想一个场景:你团队里有位英语不好的产品经理,写完中文稿让模型翻成英文发到海外站。半年后有人拿检测器一扫,说这篇是AI生成的。他冤不冤?观点是他的,事实是他核的,结构是他搭的,模型干的活是把中文换成英文。可从记号的角度看,他和一个把提示词丢进去就复制粘贴的人,没有任何区别。

更麻烦的是反过来的情况。一段真正由模型从头生成的文字,只要有人认真改写过,记号就会变弱甚至消失。于是这套机制天然对认真的人不利:改得越少的越容易被抓,改得越多的越容易漏网,而改得多正是我们希望大家做的事。

三次会议之前,我们就吃过一次这个亏

保哥去年给一个做精品咖啡器具的独立站做内容体检,那家客户的团队很小,三个人,文案主力是一位在意大利待过几年的姑娘。她的稿子有个特点,句子长、从句多、喜欢用破折号,读起来相当有个人味道。

这类经历要写成对外案例也有讲究,客户案例研究怎么写才有人信里有完整框架。

结果那年他们接的一个渠道合作方要求所有投放素材附一份“非AI生成声明”,对方拿自己的检测工具扫,她那几篇被判成高度疑似机器生成,反倒是另一位同事用模型草拟、只改了几个词的短文案,因为太短没被判出来。

那次的解决办法很土:把她写作时的版本历史导出来,从第一版一百多字的提纲,到中间七八次修改,到定稿,时间戳连成一条线,附给对方。对方看完就不提了。这件事留下的印象很深,能说服人的从来不是一个判定结果,而是一条能被复查的过程。今天水印这件事,本质上还是同一个问题。

那条74% 的研究结论,值得单独看一眼

水印能不能被绕过,学术圈早就试过。关于这套机制如何被击破的公开分析里提到几组数字,值得抄下来贴在墙上。

改写敏感性可以单独测,五步测出品牌引用稳不稳

看到高得离谱的比例先别急,给那条建议配一个注定无效的对照组是最省事的验伪办法。

一组是苏黎世联邦理工的研究,在2024年的机器学习顶会上发表,结论是绕过水印的成本大约50美元,成功率超过八成。另一组是2025年的后续研究,七种主流水印方法全部被攻破,把文本改写到去掉记号的成本降到每百万token不到1美元。

但真正扎眼的是第三个数字:在测试中,74% 未加水印的改写文本被判定成带水印。这是假阳性,而且是高得离谱的假阳性。

把这三个数字放在一起,结论相当难堪。想去掉记号的人花不到一杯咖啡的钱就能去掉;而老老实实自己写、只是碰巧改写风格与机器接近的人,有很大概率被冤枉。一套证据机制如果对造假者宽松、对守规矩的人严苛,它作为证据的价值就很可疑。

研究结论数值对内容团队的含义
绕过水印的一次性成本约50美元刻意规避的门槛极低
绕过成功率80% 以上决心去掉就能去掉
大规模改写成本每百万token不到1美元批量洗一遍毫无压力
未加水印文本的误判率74%老实人反而更容易被冤
可靠检出的最短长度约200 token短文案天然免检

完整改写能去掉,可去掉之后它还算AI写的吗

这里有个有意思的悖论。公开说明承认,轻度编辑大概去不掉记号,但把每个词都换掉的彻底重写可以。

改写幅度这件事,机器翻译直接上线省下的那道审校那篇里有过非常相似的度量困境。

可是当一段文字的每个词都被人换过一遍之后,它还能被叫做机器生成的内容吗?这个问题没有标准答案,但它暴露了一件事:水印度量的其实不是“作者是谁”,而是“机器参与的程度还剩多少”。参与程度低到一定份上,记号自己就消失了,这在逻辑上反而是自洽的。

只是这套自洽对使用者一点也不友好。你没法事先知道自己改到什么程度才算“干净”,因为门槛不透明;你也没法证明自己没改过,因为记号消失和从来没有过,看起来一模一样。

内容团队的四种常见姿势,各自会怎样

把日常工作里真实存在的用法列一遍,对号入座会比讲原理清楚。

六阶段那套流程,从选题到SEO加工怎么跑通写得更细。

四种姿势对应四套质检,AI内容写完谁来质检那份人机分工清单可以直接照搬。

第一种,直接生成直接发。提示词丢进去,输出复制出来,排版发布。这种情况下记号最完整,检出概率最高。同时它也是内容质量最差的一种,会不会被检出其实是最小的问题。

第二种,生成后人工重写。拿模型输出当素材,自己重新组织结构、换掉表达、补充自己的判断。这种情况下记号会大幅削弱,改得彻底的话会消失。而这恰恰是负责任的用法。

第三种,人写完让模型润色。观点、结构、事实全是人的,模型只负责把句子理顺、把错别字挑出来。这种情况下记号照样会出现,而内容的来源明明是人。这是最容易产生冤案的一种。

第四种,人写完让模型翻译。和第三种同理,输出会带记号,而原始创作完全是人的工作。做外贸和多语言站的团队,这种用法最普遍,也最容易被误伤。

把这四种排一排就能看出问题所在:检出概率的高低顺序,和内容质量、人的投入程度,几乎没有正相关关系。第一种和第三种都会被检出,但两者的性质天差地别。一个信号如果不能区分这两者,它作为质量判据就是失效的。

这对做多语言站的人尤其要紧

多说一句第四种。做出海和多语言独立站的团队,机器翻译是刚需,没有人会为了几十个语种去养一支翻译队伍。

多语言页面的标记有个反直觉之处,正文越本地化结构化数据越要写回国际格式

多语言站还有个更早的坑,翻译内容为什么在AI检索里吃亏

结果就是:一个用心做本地化的站,恰恰是记号密度最高的站。原文是人写的,每一个语种版本都经过模型,每一个版本都带记号。而一个偷懒的站,可能只有一个英文版,反倒干净。

这个倒挂大概是这套机制最需要被讨论的部分。目前还没有哪家平台把“翻译”和“生成”区分开来处理,技术上也很难区分——从记号的角度看,它们的确是同一件事。

能给的建议只有一条:如果你做多语言,把原文版本的创作痕迹留好。当有人拿译文的记号说事时,你要能指出原文在哪、什么时候写的、由谁写的。原文站得住,译文自然站得住。

那反过来呢?测不出水印,能证明这段字是人写的吗?

更不能。而且这个方向的漏洞比前一个方向大得多,大到几乎让“没检出”这个结果失去意义。

反过来的风险也真实存在,AI内容流水线为什么六个站掉了四个复盘过三处必须留人的节点。

官方自己列了五条测不出来的理由

Anthropic在说明里主动列举了记号可能不出现的情形,一共五种。这份清单读起来有点像免责声明,但它其实是这套机制最诚实的部分。

多因排查的通用打法,页面不被收录的症状分诊与急救可以照抄它的顺序。

这种多因一果的排查最费时间,可索引性一键体检是同类思路的工具化版本。

测不出来的原因具体情形在电商内容里常不常见
模型版本太老用的是加水印之前的模型常见,很多团队的工作流没更新
改动幅度太大大幅改写、转述、翻译、融进已有稿子非常常见,正规流程都会改
文本太短不到200 token的片段极常见,短文案是主力
格式转换丢失转成图片、截图、过一遍别的格式常见,设计稿、社媒图都算
载体不支持输出形式本身承载不了这种标记视场景而定

把这张表反过来读一遍就明白了:一段文字没有记号,可能是因为人写的,也可能是因为它太短、被改过、换过格式、或者用的是别家模型。五条里只有一条对应“真的是人写的”,其余四条都是技术性缺席。

所以“扫了一遍没问题”这句话,作为证据的分量接近于零。这一点值得内容主管们提前想明白,因为迟早会有人拿一份没检出的报告来当免责凭据。

别家模型完全不在这套体系里

还有一个更基础的漏洞:这个记号只属于一家。用别家的模型生成的内容,扫Claude的水印当然扫不出来,因为压根不是一套标准。

跨平台看份额才有意义,AI可见度竞品分析的全流程

各家路数差别不小,十款主流AI搜索工具实测可以先建立一个大致印象。

各家现在的进度参差不齐。图像和音频领域的标记方案铺得更早一些,文本这块反而是最慢的。到写这篇时为止,几家主要厂商在文本标记上的公开状态大致是:有的已经落地,有的只做了非文本形态,有的干脆没有公开政策。

这就带来一个荒谬的推论:如果你的目的是让内容测不出记号,最省事的办法不是改写,是换一家模型。成本为零,效果百分之百。任何一套只有一家参与的标识体系,都会遇到这个问题。

碎片化会带来什么后果

标识体系分散在各家手里,会引出几个连锁问题,值得提前想清楚。

引擎各行其是不是新鲜事,三大AI引擎偏好规则的45条对照就是碎片化的另一个切面。

第一,不存在统一的检测入口。要判断一段文字有没有记号,理论上得拿去每一家分别验一遍。而各家开放检测能力的节奏不同、接口形态不同、政策不同,实际上没有哪个第三方能把这件事做全。

第二,缺席无法解释。如果只有一家的记号能验,那么“没验出来”这个结果就有太多种可能——用了别家、用了老版本、文本太短、改写过。当一个结果有四种解释时,它就不构成证据。

第三,容易被误用成竞争工具。可以想见接下来会出现这样的场景:有人拿检测结果去质疑竞争对手的内容,或者在采购谈判里当筹码。而由于前两条,这类质疑在技术上几乎总是站不住的,但它在舆论上的杀伤力不小。

更稳妥的做法是,提前想好被这样质疑时怎么回应。回应的重点不是去自证清白(做不到),而是把过程材料摆出来,把话题从“有没有记号”换到“这篇是怎么做出来的”。后面这个问题你有答案,前面那个没人有答案。

行业里已经出现的一个苗头

顺着说一个观察。这一两年,出海圈子里对“内容是不是AI写的”这个问题的态度,已经明显松动了。

预期管理同样要靠可核验的东西,SEO要多久才见效的真实时间线

合同条款怎么写才执行得下去,SEO服务合同的达标定义与违约责任有现成的范式可抄。

两年前还有不少客户在合同里写死不许用AI,现在更常见的写法是要求披露使用范围和保证质量。这个转变的原因很朴素:禁止条款没法执行,执行不了的条款写进合同只会制造纠纷。

这个转变的方向和本文的结论是一致的——当一个判据无法核验时,成熟的做法是换一个能核验的判据,而不是加大处罚力度。合同里从“不许用”改成“说清楚怎么用的”,正是从不可核验向可核验的迁移。

欧盟那条法规要的到底是什么

值得把源头翻出来看一眼。欧盟人工智能法案的正式文本第50条要求的是,生成合成内容的系统要让输出以机器可读的方式被标识出来,并且要能被检测为人工生成或操纵。

欧盟市场的主体资格也要提前想,美国、英国与香港三地架构对照

做欧洲市场绕不开的另一件事,是同意管理平台该怎么选

注意这条义务落在提供模型的一方身上,不是落在用模型的人身上。厂商必须给输出打标记,这是他们的合规动作。至于你作为使用者要不要披露自己用了AI,那是另一套规则在管,取决于内容形态和你所在的行业。

这个区别经常被混淆。见过不止一家出海企业把“模型要加水印”理解成“我们发内容要标注AI生成”,然后在页脚加了一行声明,结果既没解决合规问题,又白白给自己贴了个标签。欧盟官方对这套监管框架的说明页把义务主体分得比较清楚,做欧洲市场的团队值得读一遍原文,别听二手解读。

那排名会不会受影响

这是所有SEO从业者最关心的一问,答案目前是:没有证据表明会。

质量判据一直在变,从熊猫算法到AI模式这十四年能看清方向。

近一轮核心更新的走向也支持这个判断,聚合站重伤而品牌站受益

Ahrefs在这轮讨论里放出过一组数据,来自对大量排名页面的统计。他们那篇面向营销人员的解读里提到几个数字:排名靠前的页面里,完全由AI生成的占5.3%;AI含量高的页面被收录的比例是40%,含量低的是49%;而在每一个排名位置上,都有8% 到12% 的页面AI含量超过八成。

这几个数字里,最值得琢磨的是40% 对49% 这一组。差距存在,但没有大到能称为惩罚。更合理的解释是:AI含量高的页面里,凑数的比例本来就高一些,被筛掉的是质量不是来源。

这件事一直可以这么看:搜索引擎对内容怎么产生的没有兴趣,它有兴趣的是这一页值不值得排在那个位置。水印不会改变这个逻辑,它只是给平台多了一个可选信号,而平台要不要用、怎么用,到现在一个字都没说。

做个思想实验:如果明天全行业都打上记号

假设所有厂商明天统一了标准,所有输出都带可互认的记号,检测能力人人可用。会发生什么?

标注失去区分度之后会怎样,用的人越来越多信的人却越来越少是个现成的参照。

第一波,市面上大量内容被检出。这个比例会高到让所有人尴尬,因为按现在的使用密度,说八成商业内容经过某种模型处理都不夸张。

第二波,标注开始失去区分度。当一个标签贴在八成内容上时,它就不再是标签了,等于没贴。用户会迅速学会忽略它,就像现在没人会因为一篇文章下面写着“广告”就真的不看一样。

第三波,注意力转移到别处。平台会去找新的区分维度,而那个维度大概率还是内容里有没有别处得不到的东西——一手数据、真实经历、可复现的方法。

这个思想实验的意义在于:即使这套机制百分之百成功,最终的落点仍然是内容本身的独特性。所以现在把力气花在应对检测上,不如花在让内容值得被检测出来也无所谓。

不过有一类场景确实会变

说了这么多“影响有限”,得公平地指出一个真会受影响的场景:供应链上的内容采购。

交付物也可以顺手做成资产,白皮书怎么做成能换反链又被引用的内容

供应链上的口径对齐一向难,联盟客抢走品牌词还要你付佣金是同类问题的另一种形态。

如果你是外包写手、内容代理商,或者你在采购这类服务,那么记号会成为一个新的验收条件。甲方要求交付物不带记号,写手就得改到记号消失,这是一个可执行的验收标准,尽管它衡量的东西未必是甲方真正想要的。

这件事已经在发生,只是还没形成规范。这里的建议是,如果你在采购内容,别把“不带记号”写进合同,写“提供创作过程材料”更有意义,前者可以通过洗稿满足,后者不行。

反过来如果你是供应方,提前把过程材料的交付变成标准动作,这在未来一两年会是一个真实的竞争优势——因为大多数同行给不出来。

把镜头拉远:“谁写的”从来就是一栏自己填的字段

写到这里,该说这篇文章真正想说的那件事了。水印之所以显得别扭,不是因为它做得不好,而是因为它试图去解决一个结构上就解决不了的问题。

最典型的自填标记是链接属性,nofollow与赞助标记到底传不传权重把这套机制讲透过。

规则要生效,先得给你分类

任何一条规则要落到具体对象上,都得先回答“这算哪一类”。禁止AI生成内容,得先判定什么算AI生成;广告必须标注,得先判定什么算广告;跨境商品要交税,得先判定它属于哪个税号。

分类这件事在商品数据里最较真,页面标记和数据源的分类终于对上了

站内搜索页算哪一类,四种处理方案的对比给过判据。

分类先行这件事在筛选页上最明显,电商筛选网址要不要写禁止抓取得先判它算哪一类。

问题在于,这些分类所依据的那个字段,绝大多数情况下是被管的一方自己填的

给某条外链标上赞助属性,是站长自己标的,没人能验证这条链接到底有没有收过钱。结构化数据里写着这是一件商品,是页面自己声明的。语言标记里写着这页是德语,也是自己填的。规则挂在哪一栏,你能改的就是哪一栏,遵守和规避在动作上完全一样——填另一个值。

这就是本篇想立住的那句话:一条规则的执行力,天花板不是罚则有多重,而是它所依赖的那个分类字段有多容易被独立核实。

SEO里的自填字段,比你以为的多得多

把日常打交道的字段列一遍,会发现整个技术SEO有相当大的比例建立在自我声明之上。

有些字段还没被用起来,用结构化数据标注重要内链就是个例子。

哪些字段真有人填,Schema官方第一次公开的全网使用数据给了一份可对照的底表。

字段它声明了什么谁能推翻
canonical这一页的正式地址是哪个搜索引擎,它有自己选定的一版
hreflang这一页是给哪个语言地区看的能,读一读正文就知道
noindex这一页不要收录基本不能,通常照办
链接的赞助与免责属性这条链接是广告还是自然推荐很难,除非查到交易
结构化数据类型这一页是商品、文章还是问答能,与页面实际内容比对
自填评分与评价数我们得了多少分,多少人评的难,除非平台去抽查
作者与发布时间谁写的,什么时候写的几乎不能
generator这个站用什么建的能,看资源痕迹

这张表里的字段可以分成两拨。能被推翻的那一拨,自填权其实名存实亡——你写什么无所谓,观察者有自己的判断路径。搜索引擎会自己选定一个正式地址,会自己判断这一页到底是什么语言,会自己认出这个站用什么建的。

不能被推翻的那一拨,才是真正的自填字段:这条链接收没收钱、这段字是谁写的、这个日期是不是真的。它们的共同点是,证据不在页面上,在页面之外的世界里,而观察者到不了那里。

水印这件事之所以值得关注,是因为它是第一次有人尝试把“谁写的”从第二拨挪到第一拨。尝试的方向是对的,只是挪的距离比宣传里听起来短。

为什么大多数规则最后都挂在了自填字段上

还有个问题值得问一句:既然自填这么不可靠,规则制定者为什么还要挂在上面?

一个字段被滥用之后会怎样,FAQ富结果被砍掉就是最近的一次示范。

关键词标签的兴衰是最好的例子,旧的关键词公式为什么失效那篇里有完整脉络。

答案很现实:因为便宜。要求你自己声明,成本几乎为零,规则第二天就能生效;要建立一套独立核验体系,成本极高,可能永远建不起来。

于是就形成了一种默契:规则挂在自填字段上,同时假定大多数人不会撒谎。这个假定在多数时候成立,因为撒谎的收益通常不够大。真正的问题出在收益变大的时候——比如某一天平台真的开始按“是不是AI写的”来分配流量,那一刻起,这一栏的可信度就会归零。

这不是危言耸听,是已经反复发生过的事。关键词标签当年就是这么废掉的:只要它对排名有用,它就会被填满关键词;等它被填满关键词,它就再也没用了。任何一个自填字段,一旦被用作分配资源的依据,它的信息价值就开始自我毁灭。

三种字段,三种命运

按可核实程度分,自填字段大致有三类,命运完全不同。

评分这类数值最典型,怎么给评论加上星级结构化数据要先想清楚数据从哪来。

第三类的典型是价格,被划掉的那个原价只有你自己的价格历史能证明

第一类,压根无从核实。比如“这段话是我写的”。除非有人全程盯着,否则没有任何外部证据能确认或否定。水印想干的就是把这一类往上提一格,但它只提了半格——检出时有一定说服力,检不出时毫无说服力。

第二类,可以被内容本身推翻。比如页面自称是德语。观察者读一读正文就能自己判断,你填什么不重要。这一类字段的自填权其实早就名存实亡了。

第三类,只能被结果反推,而且要等。比如你回传给广告平台的转化价值。短期内平台只能照单全收,长期靠实际成交去校准。这一类的特点是撒谎当时有效,事后失效。

三类里,第一类最脆弱,也最容易被绕开。而“内容是谁写的”,很不幸正是第一类。

观察者的应对方式高度一致

面对不可核实的自填字段,所有平台的做法都一样:找一个你伪造不了的旁证,然后不再看你填的那一栏。

按行为拦截也有代价,防火墙到底拦不拦得住AI爬虫没那么简单。

按行为不按名字,真假Googlebot该怎么验证是这条原则最成熟的一次落地。

搜索引擎判断一个页面用什么建的,不看你声明的建站平台,看资源路径上的指纹。风控判断一笔订单风险,不看你填的地址,看设备、行为和历史。反作弊判断流量真假,不看来路标记,看行为曲线。

这个规律在下一节会有非常具体的数字支撑。保哥用136个品牌站的首页量了一遍,自称和旁证之间的差距大到出乎意料。

被绕过之后,那一栏会怎么样

值得多说一句自填字段的结局。它不会被删掉,它会被留在那里,然后没人再看。

被降级不等于被删除,分层索引会把页面丢进哪一层是同一种处置方式。

被废掉的信号不会消失只会失效,PageRank退役之后权威信号怎么演变是一整条完整轨迹。

这个过程有个固定的三步。第一步,字段被创造出来,用来承载某个判断。大家老老实实填,信息有效。第二步,字段的取值开始影响利益分配。填法出现策略化,有人开始按最有利的方式填,信息开始失真。第三步,观察者找到旁证,改用旁证。字段留着不删(删了会破坏兼容性),但权重降到接近零。

技术SEO里走完这三步的字段已经有一串了。当年的关键词标签走完了,页面自称的更新频率和优先级走完了,各种“我很重要请优先抓取”的信号也基本走完了。它们至今还能写,写了也没人拦你,只是不再有任何作用。

判断一个字段处在哪一步,有个简单办法:看它有没有官方文档明确说“我们不使用这个信号”。被正式宣告不用的,说明已经走完第三步;还在被强调要填的,多半停在第一步或第二步之间。

按这个标准看,“内容是不是AI生成的”这件事,现在连第一步都还没走完——因为承载它的字段刚刚被造出来,而且造它的人和用它的人还不是同一批。

真实站点上,身份自证的链条到底有多薄?

光讲道理不解渴,得有数。手头正好有一批品牌独立站的首页快照,是之前做别的测量时抓下来的,一共187份。这次换个角度重新拆了一遍,专门看一件事:这些站在页面上关于“我们是谁”说了些什么,其中有几句是外人能查证的。

同一层还有个更细的坑,商家名称禁止双语重复,112个站里17个在犯

同一个方向的另一次测量结论更狠,71家审计揭开平均84%的身份泄漏

样本和口径先交代清楚

187份原始快照里,有些是挑战页、有些是跳转残骸、有些体积小得根本不是完整页面。按“字节数超过一万且确实是一份HTML文档”这条筛下来,剩136份可用。下面所有比例的分母都是这个136,不是187。

样本怎么取决定结论有多硬,按页面模板抽样把百天审计压到半天讲的就是这件事。

看的是页面里的JSON-LD结构化数据,从中找出代表公司或商店的那个实体,然后逐个字段清点。清点的不是内容对不对,只是填没填。这一点很重要——本次测量完全不评价真假,只统计有无,因为“有没有填”这一层的结论已经足够说明问题了。

先看总量:六成站有,四成站连声明都没有

136个站里,有93个站页面上带JSON-LD,占68.4%。其中能找出组织或商店实体的有83个,占61%。

没有的赶紧补,结构化数据生成器的13种类型够覆盖绝大多数页面。

结构化数据到底有没有用,官方说法加实测给过一个不含糊的答案。

换句话说,接近四成的品牌独立站,首页上根本没有一段机器可读的自我介绍。这些不是小作坊,是国际上叫得出名字的DTC品牌和零售商。

这个数字本身不算意外,意外的在后面。

那条顺着可核验度往下掉的曲线

把83个有组织实体的站按字段拆开,一个个数填写率,结果排出来是这样的。

主题权威做到位也还不够,AI搜索为什么还是不选你列了18个盲区。

把这些字段汇到一处,就是实体主页这块品牌身份地基该有的样子。

字段填了的站数占有实体的站的比例外人能不能查证
name名称7894.0%不能,纯自述
url网址7691.6%能,一点就知道
logo标志6274.7%能,图片在不在
sameAs关联主页6173.5%能,去对面看有没有
contactPoint联系方式2631.3%能,可以打过去
address地址2327.7%能,可以实地核
legalName法定名称1619.3%能,登记处可查
telephone电话1315.7%能,可以拨
email邮箱1214.5%能,可以发信
vatID税号11.2%能,官方库可查
leiCode法人识别码11.2%能,全球库可查

这张表读一遍就够了,不需要解释太多。越是外人能一查就知道真假的字段,填的人越少;越是纯粹自述、说什么算什么的字段,填的人越多。从name的94.0% 到vatID的1.2%,中间掉了78倍。

而且这条曲线是单调的,中间没有反例。这一点有点意外——本来以为会看到某几个字段因为建站平台默认填上而突起,结果没有,它平平整整地一路往下走。

掉得最陡的那一段在哪

看拐点比看两端更有意思。从sameAs的73.5% 掉到contactPoint的31.3%,一步跌掉了42个百分点,是整条曲线上最陡的一段。

看着像装饰的那几个信任元素,在小语种市场恰恰是搜索量最高的购买词

说了就要负责的信息才值钱,独立站信任的七层落地按的是同一个逻辑。

这两个字段的区别是什么?sameAs填的是你自己的社交主页,那些账号本来就是你开的,写上去等于把已经公开的东西再说一遍,零成本零风险。contactPoint填的是能找到你的方式,一旦填了就得有人接。陡降发生在“说说而已”和“说了要负责”的交界处。

再往下,legalName到vatID之间又是一次断崖,从19.3% 掉到1.2%。法定名称还算半公开信息,写错了顶多显得不专业;税号和法人识别码则是一填就能被人拿去官方库里比对的东西。全球法人识别码可以在 GLEIF的公开查询库里直接搜到注册主体、注册国和状态,填了就等于把自己摆上台。136个站里,愿意这么做的只有1个。

为什么这条曲线值得SEO从业者认真看

因为它说明了一件事:结构化数据在实践中被当成了展示工具,不是核验工具。

实体权威要靠协作,SEO与内容团队的四阶段协作框架

字段填满了关系却没审,AI可见性审计总漏的那一层说的正是这个盲区。

大家填name、url、logo,是因为这几栏能换来搜索结果里的品牌卡片和标志展示,有肉眼可见的回报。而legalName、vatID这些换不来任何展示位,纯粹是把可核验的信息交出去,于是就没人填。

这个取舍完全理性,给客户做的时候也是这个优先级。但它的后果是:当有一天平台真的想核实“你是谁”的时候,它在你的页面上找不到任何可以核的东西。剩下的全是你自己说的。

如果你正在做AI搜索可见度这件事,这条曲线值得贴在工位上。生成式引擎在决定要不要引用一个来源时,最缺的恰恰是可核验的实体锚点,而绝大多数站在这一层是空的。

为什么量首页,不量“关于我们”页

有人会问,公司信息不是应该在关于我们那一页吗,量首页是不是找错地方了。

页脚也是身份信息的收口,页脚怎么设计才是信任的最后一关

给人看的那一页也别荒废,关于我们页面怎么写才被认成可信实体是另一半功课。

这个问题问得对,但答案是:机器可读的组织声明,绝大多数站是放在全站模板里的,也就是每一页都有一份,首页当然也有。这是各大建站平台的默认做法,因为它要服务的是搜索结果里的品牌展示,不是给人看的介绍页。

实际抓取也印证了这一点。在有组织实体的83个站里,这段声明的内容在首页、分类页、商品页上基本一致,说明它出自同一处模板。所以量首页等于量全站。

反过来,关于我们那一页上的信息虽然更丰富——创始故事、团队照片、工厂地址——但那些是给人读的散文,机器要从里面提取出结构化的身份信息,难度和可靠性都是另一回事。我们要考察的是“可被机器核验的身份声明”,这个东西的载体就是模板里那一段。

这条曲线在别的数据上也出现过

可核验度越高、填写率越低,这个规律不是这一次才见到。

政策页也有同样的取舍,退换货政策页怎么写里能看到具体怎么权衡。

做站点体检时经常遇到类似形态。商品页上,描述性的卖点文案写得满满当当,而尺码表、材质成分、原产地这些一填就可能被投诉的字段,缺失率高得多。联系页面上,在线表单人人都放,而具体到人的直拨电话很少见。招聘页面上,企业文化写三屏,具体薪资范围写的没几家。

共同点是:越具体、越可被追究的信息,公开意愿越低。这不是道德问题,是理性选择——公开可核验信息带来的收益不确定,带来的风险很确定。

但对SEO和AI可见度来说,这个理性选择正在变成劣势。当机器需要判断一个来源可不可信时,它只能依赖那些可被交叉验证的具体信息,而那恰好是所有人都不愿意填的部分。谁先跨过这个心理门槛,谁就在这一层拿到了几乎没有竞争的位置。

把这条曲线用成自查工具

这套方法可以直接搬到自己站上。做法是把你页面上关于身份的所有声明列出来,逐条问一句:一个完全不认识你的人,能不能在不联系你的前提下,独立确认这一条是真的?

想找得更细一点,用向量嵌入把AI认不全你的地方挖出来

把自查扩成体系,企业网站SEO审计到底该查什么有一份可裁剪的框架。

能,这一条就有核验价值。不能,它就只是自我介绍。然后数一数,两类各有多少条。

拿这个法子扫过几家客户站,结果都差不多:可核验的那一类通常是零到两条,全是网址和标志这种最浅的层次。补起来其实不难,难的是意识到这一层是空的——因为页面看上去内容很满,满的全是自述。

这次测量没做到的几件事

把局限写清楚,读者才好判断该信到什么程度。这次有三件事没做。

让AI来做审计有前提,数据、方法与人工复核这三条缺一不可。

不设对照就会高估,量出74%的差异补上对照之后只剩2.2%是最近一次教训。

第一,没有核验填写内容的真假。统计的只是填没填,一个站写了法定名称,没有去登记处比对过它是否属实。所以上面所有比例都应该读成“愿意公开可核验信息的比例”,而不是“公开信息属实的比例”。真实率只会比填写率更低,不会更高。

第二,没有跟踪时间变化。这是某个时点的一次快照,看不出这些字段是在变多还是变少。凭经验判断应该在缓慢变多,因为结构化数据的普及度这几年一直在涨,但没有数据支撑,不写进结论。

第三,样本有明显的地域和品类偏向。这批站以欧美的消费品品牌为主,服饰、家居、户外、消费电子占了大头。做工业品、做本地服务、做新兴市场的站,情况可能完全不同——尤其是欧盟本土企业,因为法定信息披露要求更严,填写率大概率高于这个样本。

还有一个更基础的偏差要说明:抓取是从中国境内的一台服务器发出的,部分站点会因为地区分流返回不同版本,也有一批站直接拒绝了请求。187到136的损耗里,有一部分就来自这里。所以样本不是随机的,是“愿意对这个来源开门的那批站”。

如果要复现这套测量

方法本身很简单,任何有基础脚本能力的人都能重跑一遍。

嵌套解析这块,@graph与知识图谱怎么搭那篇讲过结构长什么样。

不想自己写脚本,结构化数据审计工具可以一次扒清一个页面里的五种格式。

核心只有三步:把目标站的首页抓下来存成文件;从中提取机器可读的结构化数据块;把代表组织的那个实体找出来,逐字段清点有无。整套逻辑不到两百行。

唯一需要留神的是解析要能处理嵌套。结构化数据常常层层包裹,组织实体可能出现在很深的位置,也可能出现在一个集合节点里。只在顶层找,会漏掉相当一部分,这也是很多现成检测工具报出的覆盖率偏低的原因。

建议做的时候顺手把每个站的字段明细也落成一份表格,而不是只留汇总数字。这次几个最有意思的发现——比如某个站列了十个语种的百科条目、某个站的名称带变音符号——全是在翻明细的时候看到的,汇总数字里完全看不出来。

sameAs是唯一一栏能被外部核验的,它被填成了什么样?

在整套组织声明里,sameAs的地位很特殊。它是唯一一个把指针指向站外的字段——你说你是谁,然后给出几个别处的地址,让人自己去对。理论上,这是自填字段里最接近“可核验”的一栏。

实体之间的关联怎么量化,实体关联分析器与它那套打分算法给过一种做法。

347条指针,指向哪里

61个站一共填了347条sameAs。把它们按目标域名归类之后,分布是这样的。

本地场景的实体识别另有一套,商家资料的实体识别五步排查

社媒之外还有一类可用锚点,未链接的品牌提及怎么转成反链

目标类型条数占比核验价值
自己开的社交账号32593.7%低,账号本身也是自己申请的
第三方百科与登记库226.3%高,条目由第三方维护

325比22。这个比例几乎回答了所有问题。

指向社交主页当然不是错,那些链接对品牌展示有用。但从核验的角度看,用一个你自己申请的账号去证明另一个你自己搭的网站,逻辑上是在原地打转。两头都是你,中间没有第三方。

具体分布上,Instagram出现在53个站里,Facebook 51个,YouTube 41个,TikTok 26个,Twitter 25个,Pinterest 19个,LinkedIn 17个。这是一份非常标准的社媒清单,也说明这一栏在大多数团队眼里的定位就是“把社媒链接再放一遍”。

真正做了外部锚定的,只有12个站

把指向维基百科、维基数据、Crunchbase这类第三方条目的站单独挑出来,一共12个,占136个站的8.8%。

这件事的底层逻辑,这份专利说透了SEO新目标是教AI认识你是谁

第三方数据这件事容易被误读,网站权威这个数谷歌到底认不认也是一个常见误会。

而且这12个站的贡献极不均匀。其中一家运动品牌一口气列了10个语种的维基百科条目,光它一家就占了22条里的10条。另一家户外服饰品牌列了维基数据和英文维基两条。剩下十家,基本是一家一条。

也就是说,136个品牌站里,真正把自己锚定到一个第三方维护的实体上的,去掉重复语种之后大概只剩十来条有效声明。

这些站是谁?名单本身挺说明问题:一家上市的电商SaaS、一家瑞士跑鞋品牌、一家美国宠物电商、一家德国刀具老厂、一家婴童用品制造商、一家手机壳品牌、一家地毯DTC。共同点是它们本来就在第三方数据库里有条目,写上去只是把已有的事实指出来,而不是凭空创造一个证明。

顺带看到的两件小事

清点过程中还撞见两个细节,跟主题相关,一并记下来。

名字对不上还牵扯消歧,实体消歧的六类信号管控

品牌名的写法差异不只是好看,西里尔和片假名会让数提及的脚本一个都认不出

第一件,组织名称和域名对不上的有5个站,但全部是无害的差异:品牌名带变音符号或特殊排版,比如域名里写成babybjorn,声明里写成带圈上加点的正式写法;域名wusthof,声明里是全大写带变音的正式商标写法。这类差异不是错误,反而说明这一栏填的是品牌真名。顺便一提,如果你的品牌名带非英文字符,这一栏是少数几个能把正式写法交代清楚的地方,值得填对。

第二件,136个站里,结构化数据中出现过具体自然人的只有9个站,占6.6%。出现的清一色是创始人——某某夫妇、某某兄弟、以创始人名字命名的品牌。换句话说,在这批品牌站的机器可读声明里,除了创始人,没有任何一个人是有名有姓的。

这一条和水印那件事扣得很紧。我们正在讨论“怎么证明内容是人写的”,而现实是,绝大多数商业站点的页面上,连一个人的名字都没有。证明的前提是先有个被证明的对象,这个对象在多数站上根本不存在。

这一栏怎么填才算真有用

既然sameAs是自填字段里最接近可核验的一栏,那就值得把它填对。判断标准只有一条:指过去之后,对面认不认得你。

第三方条目之外,术语库定义页怎么织成主题权威也是可被引用的锚点。

指向百科要留神一件事,维基百科正式禁掉AI内容之后,条目审核只会更严。

社交主页当然认得你,那是你的账号。但这种“认得”是自证式的,它只能确认账号归属,不能确认你声称的任何事实。真正有价值的是那些由第三方维护、你改不动的条目

指向类型你能不能改对面的内容核验价值
自家社交账号能,随便改只能确认账号归属
应用商店页面部分能可确认产品确实存在
第三方百科条目基本不能高,有编辑审核
结构化知识库条目基本不能高,有标识符体系
企业信息数据库部分能,需审核中高
行业协会或认证机构不能很高,但门槛也高

实操建议按这个顺序来:先把已经存在的第三方条目找出来指过去,这一步零成本,很多品牌其实早就有条目,只是没人想起来在页面上指向它。然后才是社交账号,作为补充。

要提醒的是,别为了填这一栏去凭空创造条目。第三方条目之所以有核验价值,正是因为它的产生不由你控制;你自己去建一个,价值就没了,而且很多平台对这种行为有明确限制。

一个反常识的小结论

数据里还藏着一句话,值得单独拎出来:sameAs填得最多的那个站,核验价值不一定最高。

聚合方式也影响可读性,Schema聚合怎么接入智能体网络

与其堆条数,不如看看给AI的实体声明文件要不要现在就配一份。

那个填了20条的站,绝大部分是各个地区的社交账号分号,本质上是同一个东西的十几份副本。而某个只填了两条的站,两条全是第三方结构化条目,核验价值反而更高。

这提醒我们,衡量这一栏不能看条数,要看指向的多样性和外部性。一条指向不受你控制的第三方记录,胜过十条指向你自己的账号矩阵。做结构化数据优化时,很多人习惯性地追求“字段填满”,这一栏是个例外——填得对比填得多重要得多。

“我们用什么建的站”这一栏几乎没人填,为什么没人在乎?

前面说过,面对不可核实的自填字段,观察者的做法是找旁证、绕过自称。这话听着像推测,但它可以被量出来,而且量出来的差距大得离谱。

顺带回答一个老问题,谷歌到底偏不偏爱某个建站平台

网页里有一栏叫generator,作用就是让页面自报家门:我是用什么工具生成的。这是一个百分之百的自填字段,写什么都行,没有任何机制去验证。它和“这段内容是谁写的”属于同一类:纯自述,无从核实,全靠自觉。

自称的比例:6.6%

136个站里,填了generator的只有9个。

平台痕迹多半来自装了太多东西,应用栈精简与冲突排查能顺手减掉一批。

选平台本身是另一场决策,托管型、自建还是纯代码各有各的账要算。

9个站分别自称用的是:两个静态站生成器、两个前端框架、三个内容管理系统、一个电商框架、还有一个填的是内部代号,外人完全看不懂那是什么。

换算成比例是6.6%。也就是说,九成三的站根本懒得回答“你是用什么建的”这个问题。这不奇怪,因为回答了也没好处,不回答也没坏处。典型的自填字段命运。

旁证的比例:82.4%

但是,不回答不等于查不出来。

自称可以被冒用,品牌被仿冒抢排名的五步应对是它最坏的一种后果。

旁证优先在日志层同样成立,每五次Googlebot抓取就有一次IP不属于谷歌

建站平台会在页面上留下大量痕迹:资源路径的前缀、静态文件的域名、特定的类名、初始化脚本的变量名。这些东西不是给外人看的,是系统自己要用的,所以没人会去清理。

把十几种主流平台的特征串写成规则,扫一遍那136份快照,能认出至少一种平台的有112个站,占82.4%。其中能同时认出两种技术栈的有15个(典型情况是电商后端配一个现代前端框架),只有24个站什么都没认出来。

路径覆盖站数比例数据来源
页面自己声明96.6%generator字段
从痕迹推断11282.4%资源路径与脚本特征

6.6% 对82.4%,差12.5倍。观察者需要知道的事,早就不靠你告诉他了。

有意思的是,填了的那9个其实都很诚实

这里有个反直觉的发现。既然这一栏没人管,会不会有人乱填?

页面到底给出了什么,拿样本页跑一遍语义化HTML就知道

自称与实际对不对得上,渲染对比器能揪出爬虫和用户看到的差异

结果是没有。9个填了的站里,8个能被痕迹独立确认——它说自己用某个静态站生成器,页面上确实有那套生成器特有的数据目录;它说自己用某个内容管理系统,页面上确实有那套系统的设置脚本。剩下1个填的是内部代号,没法对照,但也谈不上撒谎。

其中一个站的组合特别有意思:它自称用某个静态站生成器,而痕迹显示它同时挂着一套电商后端。两条信息都对,只是各说了一半。

这个发现值得停一下。自填字段的问题从来不是“大家都在撒谎”,而是“大家都懒得填,于是它作为信号毫无覆盖率”。一个只有6.6% 覆盖率的字段,就算100% 真实,观察者也不可能拿它当判据。水印面临的是同一个困境:就算它准确无误,覆盖不到的地方仍然是大多数。

插一句:这次的尺子自己先失效了一次

这次测量里翻过一次车,值得写下来,因为它正好是同一个逻辑的反面教材。

工具口径不一致时该信谁,收录数据到底信site命令还是信后台做过一次三源校准。

第一版规则跑完,某个老牌电商系统的识别率高达92.6%,一百多个站全中。这个数字荒谬到不用验证就知道错了——那套系统在DTC品牌里根本不是主流。

查了一下,原因很低级:特征串里写了一个三字母的片段,而这个片段恰好是image这个词的一部分。凡是页面上出现过图片路径的站,全部被误判。修掉之后,真实识别率是2.9%,四个站。

从92.6% 掉到2.9%,全是尺子本身造成的。这件事的教训不是“要小心正则”,而是:当你用旁证去替代自述时,旁证本身也需要被验证一次。否则你只是把“相信对方的自称”换成了“相信自己的规则”,可靠性未必更高。

顺带说,第一版还有一个更隐蔽的错误。原本统计了“自称与痕迹对不上”的比例,结果是9个里9个都对不上,看着像个重磅发现。实际上是因为那9个站自称的平台,压根不在第一版的特征表里——它们说的是真话,只是工具不认识而已。把特征表补全之后,对不上的从9个变成0个。一个纯粹由测量工具造成的假结论,差点就写进结论里了。

这两个错误的形态不一样,但根子是同一个:旁证之所以可靠,前提是你认得全。认不全的时候,旁证给出的不是“不知道”,而是一个错误的确定答案。这一点在做任何自动化审计时都值得警惕,工具不会告诉你它有盲区,它只会给你一个数字。

还有哪些字段正在走同一条路

把视野放宽,可以看到一批字段处在这条路的不同阶段。

没有头部标签的地址怎么表态,接口和订阅源拿什么说自己不想被收录

noindex是少数仍被照办的自填指令,加上之后多久从结果里消失实测过六种场景。

已经走完的:页面自称的关键词、自称的更新频率与优先级、自称的内容评级。这些现在写不写都一样,早就没有权重了。

正在走的:页面自称的正式地址。搜索引擎会参考你的声明,但它有自己选定的一版,两者不一致时以它的为准。这就是典型的“你的自填从判据降级成建议”。

正在走的:页面自称的语言与地区。观察者完全有能力读一读内容自己判断,你填的那个值更像是一个提示而不是事实。

还没开始走的:内容的作者与创作时间。到今天为止,几乎没有任何独立核验手段,所以你写什么就是什么。水印是第一次有人试图撬动这一栏。

规律很清楚:一个字段能撑多久,取决于旁证什么时候变得足够便宜。当读懂一整页内容的成本高到不现实时,语言标记是有用的;当机器能轻松读懂全文之后,它就变成了参考。

按这个规律推,作者这一栏的自填期限,取决于什么时候出现一种低成本的创作过程核验方式。水印显然还不是,但它是一个信号:有人已经开始惦记这一栏了。

对日常工作的一个直接推论

这套观察可以变成一条很实用的判断:当你要决定某个字段值不值得花力气去优化时,先问问它属于哪一类。

把内容当结构化数据来生产,这门新手艺正好接住这条推论。

落到动作上,结构化数据怎么配合SEO落地那份避坑清单可以对着改。

如果它是一个观察者有能力自己判断的字段,那你的工作重点应该放在让内容本身对得上,而不是把标记写得多漂亮。语言标记写得再规范,内容写得不像那个语言,一样白搭。

如果它是一个观察者暂时没法判断的字段,那这一栏就是你为数不多能主动提供信息的地方,值得认真填,而且要填得能被交叉验证——填一个别人可以顺着查下去的值,比填一个漂亮但封闭的值有用得多。

这两条加起来,其实就是一句话:你能贡献的信息价值,等于观察者自己拿不到的那部分。其余的都是重复劳动。

文章页上的署名,两处自填字段能对上吗?

首页说的是公司身份,文章页说的才是内容来源。既然主题是“这段内容谁写的”,那就得看文章页。

高风险行业对署名的要求更硬,YMYL怎么靠E-E-A-T稳住排名

署名要被认可是有前置条件的,作者署名怎么做才被谷歌和AI认可列过六个信号。

样本比预想的小,原因得先说

本来想抓两百篇。实际操作时撞了一堵墙:从187个站里能识别出内容板块入口的有72个,抓到列表页的53个,再往下钻到具体文章页时,大批站开始返回限流状态码。降速到每次间隔四秒、换个身份重试,仍然是全军覆没——说明那不是速率问题,是这个出口地址已经被长期标记了。

被限流这件事有两面,拦AI爬虫怎么才不误伤Googlebot是站方视角的同一个问题。

最后拿到手的是13个站的26篇文章。样本小,所以下面的数字只当观察不当统计,比例都用绝对数写出来,方便你自己判断分量。

两处都写了作者的,26篇里只有4篇

一篇文章要说清楚谁写的,通常有两个地方:一个是页面上肉眼可见的署名,一个是结构化数据里的author字段。前者给人看,后者给机器看。理想情况下两处一致。

调试这类不一致,把JSON-LD调试这件事讲透里有顺手的工具。

两处不一致往往是插件和主题各写一份,两个规范网址两套结构化数据怎么归一

情形篇数说明
可见署名与机器可读署名都有4唯一算完整的情况
只有可见署名,机器读不到6人看得见,程序看不见
只有机器可读署名,页面上看不见4程序看得见,读者不知道
两处都没有12接近一半

26篇里12篇两处都没有,占了将近一半。这些不是随便找的小站,是有正经内容板块、专门做内容营销的品牌。

更值得看的是中间那两行。有4篇文章在结构化数据里写着某个人的名字,页面上却一个字都不显示。其中两篇来自同一个智能家居品牌,署的是同一个人;另外两篇来自一个户外装备品牌,署的也是同一个人。读者读完全文都不知道作者是谁,只有爬虫知道。

反过来的6篇也一样别扭:页面上明明白白印着作者名,机器读的那份数据里却没有这个人。同一件事,在同一个页面上有两个版本的答案,取决于你是人还是程序。

署名栏里填的不一定是人

还有一个细节。26篇里有2篇的author字段填的是品牌名本身——不是某某,就是品牌自己的名字。

品牌当作者也不是全无道理,品牌力到底算不算排名因子有实证可看。

作者名这件事在小语种市场更复杂,本地媒体里早就有另一种拼法

这在技术上完全合法,一个组织确实可以作为作者。但它把“谁写的”这个问题原地消解了:你问是谁写的,答案是“本公司”。这和不回答的区别不大。

把这个现象和水印那件事并排放,就有意思了。一边是模型厂商花力气给内容打上无法察觉的记号,试图让来源变得可追溯;另一边是内容发布方在明明可以写清楚作者的字段里,填了一个等于没填的答案。两头使的劲儿方向相反。

时间戳这一栏也没好到哪去

顺便看了发布时间和修改时间。26篇里有12篇写了发布时间,8篇写了修改时间。

时间之外还有版本问题,决定收录哪一版的可能是十分钟前路过的那个用户

时间字段的坑不止一处,从站点地图的更新时间到结构化数据的日期都得对得上。

写了修改时间的这8篇里,有几个组合值得看。一篇发布于2020年1月,修改时间标到2025年4月,中间隔了五年多。一篇发布和修改是同一天。还有一篇发布于8月12日,修改标在8月14日,两天之内改过。

这几个时间戳的可信度完全不同,但页面上一视同仁地写着,没有任何办法区分哪个是真改过、哪个是模板自动刷的。时间戳是另一个典型的自填字段:改一个数字的成本是零,而它承担的信任却不小。

顺带一提,只有4篇的作者名是可以点开的——链到一个作者页,上面有这个人的其他文章。剩下的作者名只是一串文字。能点开的那一下,是整条署名链路上唯一带一点核验意味的动作。

把署名做对,其实只有四步

既然大多数站在这一层是空的,那把它补上就是一个成本很低的差异化动作。四步就够。

作者体系可以和知识库一起搭,帮助中心的索引控制与AI引用

一手观点比汇总更值钱,专家观点汇总还值不值得做给过明确判断。

第一步,页面上和结构化数据里写同一个名字。听起来是废话,但前面26篇里做到的只有4篇。最常见的失败是内容管理系统里填了作者,模板没把它输出到页面上;或者反过来,模板里硬编码了一个署名,数据里是空的。

第二步,让这个名字可以点开。作者页上放这个人的简介、专业背景、其他文章。这一页的作用不是给读者看的(说实话没几个读者会点),是给机器一个可以聚合的对象。

第三步,在作者信息里给出对外可查的轨迹。这个人在别处的公开身份——行业协会的会员页、公开演讲的记录、发表过的东西。这一步的逻辑和sameAs完全一样:用一个你控制不了的地方,来支撑你控制得了的地方。

第四步,别在一个人身上堆全站内容。见过一些站为了做作者体系,把三百篇文章全挂在同一个人名下,那个人一天要发两篇。这种做法在数据上一眼可见,反而制造了新的可疑点。宁可留白,别造假。

时间戳该怎么处理才不给自己挖坑

修改时间这一栏,可以简单粗暴一点:要么认真维护,要么干脆别输出。

旧内容要更新就认真更新,让旧版变成AI可信来源的12步

新鲜度要做成真的,内容新鲜度的五条实战法则说的是怎么改而不是怎么刷。

最糟的做法是让它自动跟着任何一次数据库写入更新。这样一来,改个标签、调个分类、系统跑个批量任务,时间戳就往前跳一次。页面内容一个字没变,机器看到的却是“这篇一直在更新”。

短期看这样似乎有利,长期看是在消耗信任。一个总在更新却从不变化的页面,和一个从不更新的页面,前者更容易被降低权重,因为后者只是陈旧,前者是不诚实。

正确的做法是把内容层面的实质修改和数据层面的写入区分开,只有前者才刷新对外输出的修改时间。多数内容管理系统都能做到这一点,只是默认配置往往不是这样。

那内容团队现在应该做什么,不应该做什么?

讲了这么多机制和数据,落到手上得有动作。先说不应该做的,因为踩坑的成本更高。

顺带一提,自己写内容夸自家产品AI买不买账用9886条答案给过结论。

三件不值得做的事

第一,不要去买号称能检测AI水印的工具。理由前面说过,密钥不在第三方手里,它检测的是别的东西。真到了需要的时候,官方接口会开放,那才是唯一可信的来源。在此之前掏钱买的,大概率是一个包装成新概念的旧检测器。

投机路子的代价越来越高,站点声誉滥用与寄生SEO的三方防御

另一类风险是被投毒,三条攻击路径与三层防御值得提前看一眼。

买工具之前先分清路数,白帽做法与快排服务商怎么辨别有一份判据。

第二,不要在页面上加“本文非AI生成”这类声明。这句话本身就是自填字段,没有任何核验价值;更糟的是它会引起注意,让读者开始琢磨你为什么要特意说明。真正需要披露的场景由法规和平台规则界定,不需要你自己发明一套。

第三,不要为了躲检测去做无意义的改写。把通顺的句子改拧巴,把准确的表述改模糊,只为了让某个分数下降——这件事在SEO行业里已经上演过好几轮了,每一轮的结局都一样:分数确实降了,内容也确实变差了,然后过一阵检测口径一变,白折腾。

三件现在就该做的事

第一,把过程留痕这件事变成流程的一部分。这是最有价值的一条,也是前面那个咖啡器具客户的经历给出的答案。写作过程中的版本记录、修改时间线、素材来源清单、访谈录音、原始数据表——这些东西的共同特点是伪造成本远高于伪造一段文字,因而反过来具备了证据价值。

信号强化有具体做法,E-E-A-T信号怎么把引用率从12%做到67%

一手材料本身就是资产,把数据做成持续吸外链的磁铁讲的是同一件事的另一面。

实操上不需要多复杂。文档工具本身就带版本历史,别关掉;素材和一手数据存在固定位置,别每次换地方;重要的稿子留一份提纲原件。真到了要自证的那天,你拿出来的是一条时间线,不是一个分数。

第二,把可核验的实体字段补齐。就是前面那条曲线掉得最狠的那几栏。具体到动作:法定名称写上,联系方式写上,地址写上,如果有第三方条目就在sameAs里指过去。

这几栏不会给你带来任何肉眼可见的排名提升,短期看毫无回报。但它们是你的页面上仅有的几个能被外部独立确认的锚点,在生成式引擎越来越挑来源的今天,这个价值只会往上走,不会往下走。

第三,让作者成为一个真实存在的对象。不是随便署个名,而是让这个名字能点开、有页面、有其他作品、有可核对的背景。前面那26篇里只有4篇做到了这一点。

动作成本短期回报可核验性
买检测工具
页面加非AI声明
为躲检测改写
保留写作过程留痕
补齐实体核验字段
建立可点开的作者体系中高

这张表里的规律很清楚:短期回报和可核验性是两条不同的曲线,而大多数团队只跟着第一条走。前面那136个站的字段填写率,就是这个选择在数据上的样子。

工作流排一排,误伤概率能降不少

前面说过,最容易被冤枉的是那种“人写完让模型润色”的用法。这个问题其实可以靠调整工序来缓解,而且调整之后内容质量通常还会变好。

让它提意见而不是替你写,SEO写作提示词的四大类模板里有可直接改用的问法。

常见的工序是:人写初稿,模型润色,直接发布。问题出在最后一步——模型的输出成了定稿,所以定稿里带着完整的记号。

换个顺序:人写初稿,模型给修改意见而不是改写文本,人根据意见自己动手改,然后发布。这样定稿的每一个字都出自人手,模型的作用退回到编辑顾问的位置。

这个调整听起来只是换了个用法,实际效果差别不小。让模型直接改,你拿到的是一个看起来更顺但失去个人痕迹的版本;让它提意见,你拿到的是问题清单,改不改、怎么改由你决定。前者是替你写,后者是帮你看。

翻译场景也有类似的处理办法。如果目标语种你有基本判断力,可以让模型出译稿,然后自己逐段核对修订,把最终定稿变成人工产物。如果完全不懂那个语种,那就老老实实认下来——译文由机器完成是事实,没必要遮掩,重要的是原文那一份站得住。

什么情况下应该干脆放弃自证

还有一种情况值得单独说:有些场合的自证要求本身就是不合理的,硬去满足反而吃亏。

有些问题不在SEO这一层,流量暴跌的七大元凶里能对号入座。

跟法务对齐口径有章可循,法务与SEO协作的七个动作点

判断标准是看对方要的是什么。如果对方要的是“过程可查”,那是合理要求,值得配合。如果对方要的是“保证百分之百没有机器参与”,那是一个技术上无法验证、法律上无法承诺的东西,签下去就是给自己埋雷。

遇到后者,正确做法是把它翻译成前者:明确说明工具在流程里用在哪一步、不用在哪一步,提供可查证的过程材料,同时拒绝那句无法验证的绝对承诺。把不可核验的承诺换成可核验的说明,这既是保护自己,也是在教对方怎么提要求。

这套沟通方式在实践中很有用,尤其是对接欧美客户的合规部门时。他们真正需要的是一份能归档、能应对审计的说明,而不是一句空头保证。

如果只能做一件事,做哪件

做第一件,过程留痕。

流程能自动化就别靠自觉,用工作流把独立站SEO自动化的四个场景可以直接套。

理由是它同时解决三个问题:客户或渠道方要求自证时你拿得出东西;内部对稿子质量有争议时能追溯是哪一步走偏了;将来任何一种新的来源核验机制出现时,你的原始材料都还在。而另外两件事都只解决一个问题。

更实际的理由是它不花钱。补字段要开发排期,建作者体系要人力,而留痕只需要不删东西。

最小可行的留痕方案长什么样

怕的是一说留痕,就有人去搭一套复杂系统,最后没人用。给一个真正能跑起来的最小方案。

日志本身也是一种留痕,五千站的爬虫伪造与抓取预算实战

归档这类事交给定时任务最稳,用cron把备份、站点地图与日志一条龙

一个固定的目录,按年月分文件夹。每篇内容一个子文件夹,里面放三样东西:提纲的第一版、用到的原始素材(数据表、截图、访谈记录)、定稿。命名规则统一,别用中文空格和特殊符号。

文档工具的版本历史别关。主流的在线文档默认就有,什么都不用做,只要别为了省空间去清理。这一条几乎是零成本,却是整套材料里时间线最完整的部分。

一手数据的原始文件单独存。如果内容里有你自己跑的测量、自己整理的表格,把原始文件和处理脚本一起留下。这个东西的说服力最强,因为别人可以拿去复算。

留什么存在哪需要额外做什么
提纲第一版内容目录写完顺手另存一份
版本历史文档工具自带不清理即可
原始数据与脚本内容目录跑完别删
沟通与访谈记录内容目录或邮箱归档时带上
发布前后的截图内容目录发布时截一张

整套东西的维护成本大概是每篇多花五分钟。五分钟买的是:任何时候有人质疑来源,你有一条完整的时间线可以摆出来。这个交换非常划算,尤其是在做外贸和出海业务、合作方合规要求越来越细的当下。

留痕还有一个附带好处

这一条不在原计划里,是做着做着发现的:留痕会显著提高内容复用的效率。

素材够了就好办,清单体文章怎么写才能拿排名又被引用

复用要成体系,内容再利用地图怎么画能把一篇主资产拆成十种。

因为原始材料都在,半年后想把一篇长文拆成几条社媒内容、或者把当时的数据更新一版重发,不用从头再来。相反,如果只留了最终的成品,等于每次复用都要重新做一遍研究。

这也是建议把留痕当成流程而不是当成合规动作的原因——纯粹为了合规做的事,团队执行不下去;顺手能提高效率的事,才留得住。

AI搜索会怎么对待这些记号?

这是所有做GEO和AEO的人真正关心的问题,而诚实的答案是:没人知道,因为没有一家平台表过态。

谁在被引用其实是可以查的,一亿条引用数据看清被引源榜单

目前的公开状态

把已知信息摆一摆。模型厂商这边,文本标记刚刚落地,配套的检测接口还在路上。搜索平台这边,没有任何一家公开说过会把标记纳入排序或引用的考量。中间还隔着一层:搜索平台要用这个信号,得先能读懂它,而读懂需要模型厂商开放能力。

有一条路其实已经开了,怎么被用户标成优先来源

平台的边界表态值得逐字读,谷歌给第三方工具和GEO划的信任边界

所以短期内,这个信号在搜索侧是不存在的。任何声称“带水印的内容会被降权”的说法,现在都没有依据。

往前推,可能走哪两条路

往前推有两种可能,而且它们的后果差别巨大。

不管走哪条路,小品牌都得单独想办法,AI搜索的大品牌偏见与六条突围路径

官方指南已经叫停过几个动作,AEO和GEO到底还是不是SEO那篇整理过。

第一条路,标记被当成披露信号使用。也就是平台读到标记后,在结果里标注“此内容可能由AI辅助生成”,把判断权交给用户。这条路对内容方影响有限,因为标注不等于降权,而且覆盖率问题会让标注本身显得随机——同样是AI写的,改过的没标注,没改的标注了,用户很快会发现这个标注不可靠。

第二条路,标记被当成质量信号的输入之一。这条路麻烦得多,因为它会把前面说的所有偏差放大:认真改写的人漏网,老实用工具的人被算进去,短文案全部免检。一个偏差如此明显的信号,被当成质量输入是不负责任的,倾向于认为主流平台不会这么做。

还有第三种可能,也是概率最高的:标记主要在合规和版权场景里被使用,搜索侧基本忽略它。因为搜索平台已经有更好用的判据了——它能看到内容的实际表现、引用情况、用户行为,这些信号比一个覆盖率不完整的标记有用得多。

对GEO实操的三条影响

不管走哪条路,有三件事现在就可以确定。

挑源的内部字段被人扒出来过,定价页解析不了它就转头引第三方

被检索和被引用要分开打,这两套打法怎么分讲得比较细。

一是来源可核验性的权重会往上走。生成式引擎在组织答案时需要给出出处,而给出处就要承担风险,因此它会偏好那些身份清楚、可以追溯的来源。这跟内容是不是AI写的没关系,跟“你是谁、能不能被查证”关系很大。

二是一手材料的价值会继续放大。模型能生成的东西不构成差异,模型生成不出来的东西才构成差异。自己跑的测量、自己的客户数据、自己踩的坑,这些既是内容护城河,也恰好就是过程留痕的天然产物。

三是同质化内容的处境会更难,但原因不是水印。是因为当答案可以被直接生成时,一篇没有任何独有信息的综述文章,存在价值本来就在下降。关于这套文本标记方法本身的技术讨论里有一句话说得挺好:真正的问题不是用了AI,是用它做出了更差的东西。

三条路各自该怎么应对

与其猜哪条路会发生,不如准备一套无论哪条路都不吃亏的做法。

准备好了也要能测,引用率监控闭环的四步含工具选型。

面对还没定的规则,AI搜索可见度的六个预测里也说清了哪些该打折。

如果走这条路受影响最大的是你该提前做的
标记当披露信号纯生成、未经改写的内容保证发布前有实质编辑环节
标记当质量输入长文占比高的站把一手材料密度提上去
搜索侧基本忽略没有人受影响什么都不用改

看这张表会发现一件事:三条路要求你做的准备高度重合,都是“别直接把生成结果发出去”和“让内容里有别人没有的东西”。这两件事本来就该做,跟水印无关。

这也是不建议为这件事专门调整策略的原因。凡是需要你为某个尚未确定的规则专门做一套动作的建议,多半都是在贩卖焦虑。真正稳的做法永远是那几条,只是它们不够新鲜,所以没人愿意反复说。

顺便说说被动引用这件事

还有一个角度容易被忽略:你的内容被别人喂给模型之后会怎样。

说错了还能纠,从溯源到纠错的完整流水线

原创归属被顶掉怎么办,谷歌怎么判定原创内容有过一次系统梳理。

现在的常见场景是,别人把你的文章丢进模型让它总结,或者要求它改写成另一种风格。输出的那份东西会带上模型的记号,而内容来源是你。

这意味着未来可能出现一种奇怪的情形:市面上流传的、带着机器记号的文本,实际内容源头是你写的原创。如果哪天有人凭记号来判断原创归属,方向就完全反了。

目前还没有成熟机制处理这个问题,能做的只有一件事:让你的原始版本在公开渠道有更早、更清晰的时间痕迹。正常发布、正常被收录、正常有外部引用,这条路径本身就是最好的原创声明,比任何标记都可靠。

如果客户明天就要你证明“这是人写的”,你拿得出什么?

这一节把前面所有东西收成一份可操作的清单。场景很具体:合作方、平台方或者客户法务,要求你为一篇已经发布的内容提供来源说明。

可核验这件事有个很直观的例子,九条查得到出处八条数字对不上

拿不出手的四样东西

先排除掉没用的。

拿不出手的东西通常也换不来记忆,该盯的其实是品牌识别度

举证门槛由措辞决定,一句比较级要你拿出整套对比测试

第三方检测器的报告拿不出手,因为对方也可以跑一个,结论未必一样。页面上的作者署名拿不出手,因为那是你自己写的。发布时间戳拿不出手,同上。“我们公司规定不许用AI”这类制度文件也拿不出手,制度证明不了具体这一篇。

这四样恰好是大多数团队第一反应会拿出来的东西。它们的共同点还是那句话:全是自己说的。

拿得出手的五样东西

材料为什么有说服力准备成本
版本历史时间线伪造要重建整条修改轨迹不删就有
原始素材与数据文件数据本身可被复算存起来即可
访谈或沟通记录涉及第三方,单方伪造困难随手保存
可追溯的作者身份有对外可查的公开轨迹需长期积累
内容里的独有事实只有做过的人才写得出做事的副产品

证据要变成机器读得懂的,从交付现场到机器可读有完整路径。

原始出处一直在被悄悄奖励,原创报道到底指什么梳理过这条线。

最后一样最容易被忽略,但它的分量最重。一篇文章里如果有别处查不到的具体数字、具体过程、具体失败,这件事本身就是最强的来源证明——因为模型编不出你没做过的测量,而做过测量的人一定留得下痕迹。

这也是这几年写东西越来越偏向自己动手量一遍的原因之一。一开始是为了内容差异化,后来发现它顺带解决了可信度问题,现在看,它还顺带解决了来源自证的问题。

把这份清单反过来用

最后一个角度。上面这份清单,你也可以拿去衡量别人。

评估别人这件事早有范本,质量评估手册怎么读那套打分逻辑值得借。

评估工具也用同一套问法,二十款GEO监控工具的选型对照可以直接拿来试。

当你评估一个信息源值不值得引用、一家服务商的案例可不可信、一份行业报告的数据要不要采信时,问的是同一组问题:这里面有没有一条是外部可以核验的?有没有具体到能被复算的数字?作者是不是一个可以查到的人?

这三问不需要任何工具,也不受任何技术变化影响。水印会迭代,检测器会更新,平台政策会反复,但“可核验的东西比自称的东西可信”这条判据不会变。

拿它去挑供应商,比拿它去挑内容更有用

这套判据最实用的场景其实是选人选服务商,因为那里的信息不对称最严重。

挑完还要会拆,四层逆向把对手拆透变成自己的行动清单。

服务商的风险还会连坐,最该防的是被服务商牵连降权

做外贸和独立站的团队,每年都要评估一堆服务方:内容代理、建站商、投放公司、数据工具。对方的宣传材料里通常有三类东西——案例、数据、资质。用可核验度过一遍,立刻能分出层次。

案例里有没有可以自己去看的站?说做过某某品牌,那个站现在在不在,能不能看到当时的痕迹。说不出具体域名的案例,价值接近于零。

数据是自己报的还是能对上公开来源的?说帮客户提升了多少流量,这是自报;说某个关键词现在排在第几,这是可以当场搜的。前者听听就好,后者可以验。

资质是发证机构可查的吗?很多所谓认证,发证方的官网上根本没有可查询的名录。可查的和不可查的,中间隔着的正是这篇文章说的那条线。

用这三问筛一遍,通常能砍掉大半候选,而且砍得有理有据。更重要的是,这个过程会反过来教你怎么包装自己——你希望别人用什么来判断你,就先把那些东西准备好。

最后留一个问题给读者

写完这篇,其实有个问题一直没有答案,放在这里当作结尾。

下一个周期的筹码在哪,被引用一次到底顶多少条传统外链给过一次估算。

窗口期什么时候关上不好说,上一次这样的空场被围起来是在2013年

如果有一天,来源核验真的变成了排序或引用的重要因素,那么先做这件事的人是拿到红利,还是白白多花力气?这取决于变化什么时候来、来得有多突然。

能确定的只有一点:补齐可核验信息这件事,成本很低,副作用为零,而且它在任何一种未来里都不会变成负资产。相比之下,为躲避某个检测而做的改动,几乎在每一种未来里都会作废。

在不确定性这么高的时候,选那些无论如何都不亏的动作,本身就是一种策略。

一份能拿出手的说明长什么样

把上面的东西组装起来,一份合格的来源说明大概是这样的结构,一页纸就够。

别把它写成口号,E-E-A-T怎么落到可执行清单

对外交付的文档能模板化,SEO月报季报的模板与数据管线可以借它的结构。

开头一段讲流程:这篇内容由谁负责,经过哪几个环节,各环节分别做了什么,是否使用了辅助工具以及用在哪一步。这一段要写得具体到动作,别写成制度条文。

中间一段列证据:版本记录的时间跨度和修改次数、原始素材清单、一手数据的采集方式与时间、可对外核对的引用来源。每一条都要能应对一句追问——如果对方说“给我看看”,你拿得出来。

结尾一段讲边界:明确说清楚哪些部分使用了辅助工具、程度如何。这一段反而最能建立信任,因为在今天的环境里,声称完全没用过任何工具,可信度不如坦率交代用在了哪里。

保哥给客户处理过几次类似的要求,能过关的那几份都有一个共同点:它们回答的是“这篇是怎么做出来的”,而不是“这篇不是AI写的”。前者是可查证的事实陈述,后者是一句无法被验证的断言,而对方要的从来是前者。

最后回到那136个站

写完这一圈,再看那条从94.0% 掉到1.2% 的曲线,感受和刚拿到数据时不太一样了。

投入产出算不清的时候,零点击时代品牌影响力怎么衡量能补上一半答案。

真要填法定标识,美国税号怎么申请是绕不开的第一步。

它其实不是在说这些品牌不严谨。恰恰相反,它们在每一个能带来回报的字段上都填得很认真——名称、网址、标志、社交主页,一栏不落。它们只是理性地跳过了那些只承担义务、不带来回报的字段。

问题在于,随着答案越来越多地由机器组织,判断来源可不可信这件事的权重正在上升,而所有人在这一层的储备都接近于零。这既是风险,也意味着这一层的竞争几乎不存在。

说到底,8月2日那件事真正的价值不是给了行业一个新工具,而是逼着所有人重新面对一个一直被绕开的问题:关于来源,我们习惯性地相信页面自己说的话,而页面从来没有义务说真话。

常见问题解答

Claude的水印能被普通用户检测出来吗?

目前不能。这个记号是一种统计模式,识别它需要一把只有模型提供方掌握的密钥。官方说过会开放检测接口,但在此之前,任何第三方工具都没有能力真正读取这个记号。市面上号称能检测的产品,实际检测的是文本困惑度、句式规整度这类旧指标,与水印本身无关。

把AI写的稿子人工改一遍,水印还在吗?

取决于改动幅度。轻度编辑,比如改标点、调个别词,记号大概率还在;把每个词都换掉的彻底重写,记号会消失。但这里有个悖论:当一段文字被逐词改写之后,它是否还算机器生成的内容,本身就成了问题。另外要注意反方向的风险,人工从头写的稿子如果被大幅改写过,在测试中有相当高的比例会被误判成带记号。

没检测出水印,能证明内容是人写的吗?

不能,而且这个方向的漏洞更大。官方列出的五种测不出的原因里,只有一种对应“确实是人写的”,其余四种分别是模型版本太老、改动幅度太大、文本长度不足200个token、格式转换过程中丢失。更根本的是,用别家模型生成的内容压根不在这套标识体系里,扫也扫不出来。

带水印的内容会被搜索引擎降权吗?

目前没有任何证据支持这个说法,也没有平台公开表过态。已有的统计显示,排名靠前的页面里完全由AI生成的约占5.3%,AI含量高的页面收录比例是40%,含量低的是49%,差距存在但远达不到惩罚的程度。更合理的解释是筛掉的是质量而不是来源。

我的独立站需要在页面上声明内容是否由AI生成吗?

欧盟法案里那条机器可读标识的义务落在提供模型的一方身上,不是使用者。使用者是否需要披露,取决于内容形态、所在行业和具体平台规则,不能一概而论。不建议主动在页面上加“本文非AI生成”这类声明,它既没有核验价值,又容易引起不必要的注意。

结构化数据里的author字段填品牌名可以吗?

技术上合法,一个组织确实可以作为作者。但从来源核验的角度看,这等于没有回答“谁写的”这个问题。更好的做法是让作者成为一个真实存在的对象:有名字、有可以点开的页面、有其他作品、有可对照的公开背景。在抓到的26篇文章里,做到这一点的只有4篇。

如果客户要求提供“非AI生成”的证明,我该给什么?

给过程,不要给结论。有说服力的材料是版本历史时间线、原始素材与数据文件、访谈或沟通记录、可追溯的作者身份,以及内容里那些别处查不到的独有事实。检测器报告、页面署名、发布时间戳、公司制度文件这四样都拿不出手,因为它们全都是自己说的。

权威参考资料

分享到
标签
版权声明

本文标题:《AI水印怎么检测?测到不等于它写的,测不到也不等于不是》

本文链接:https://zhangwenbao.com/ai-watermark-detection-authorship-self-declared.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交