AI水印怎么检测?测到不等于它写的,测不到也不等于不是
本文目录
- 8月2日之后,Claude写出来的每一段字都带着一个记号
- 它不是隐藏字符,也不是元数据
- 为什么读者一点都察觉不到
- 检测器还没交到你手上
- 200个词以下,这套机制根本不工作
- 和图片水印完全不是一回事
- 为什么这件事挑在这个时间点做
- 测出了水印,能证明这段字是AI写的吗?
- “经过”和“写的”是两回事
- 三次会议之前,我们就吃过一次这个亏
- 那条74% 的研究结论,值得单独看一眼
- 完整改写能去掉,可去掉之后它还算AI写的吗
- 内容团队的四种常见姿势,各自会怎样
- 这对做多语言站的人尤其要紧
- 那反过来呢?测不出水印,能证明这段字是人写的吗?
- 官方自己列了五条测不出来的理由
- 别家模型完全不在这套体系里
- 碎片化会带来什么后果
- 行业里已经出现的一个苗头
- 欧盟那条法规要的到底是什么
- 那排名会不会受影响
- 做个思想实验:如果明天全行业都打上记号
- 不过有一类场景确实会变
- 把镜头拉远:“谁写的”从来就是一栏自己填的字段
- 规则要生效,先得给你分类
- SEO里的自填字段,比你以为的多得多
- 为什么大多数规则最后都挂在了自填字段上
- 三种字段,三种命运
- 观察者的应对方式高度一致
- 被绕过之后,那一栏会怎么样
- 真实站点上,身份自证的链条到底有多薄?
- 样本和口径先交代清楚
- 先看总量:六成站有,四成站连声明都没有
- 那条顺着可核验度往下掉的曲线
- 掉得最陡的那一段在哪
- 为什么这条曲线值得SEO从业者认真看
- 为什么量首页,不量“关于我们”页
- 这条曲线在别的数据上也出现过
- 把这条曲线用成自查工具
- 这次测量没做到的几件事
- 如果要复现这套测量
- sameAs是唯一一栏能被外部核验的,它被填成了什么样?
- 347条指针,指向哪里
- 真正做了外部锚定的,只有12个站
- 顺带看到的两件小事
- 这一栏怎么填才算真有用
- 一个反常识的小结论
- “我们用什么建的站”这一栏几乎没人填,为什么没人在乎?
- 自称的比例:6.6%
- 旁证的比例:82.4%
- 有意思的是,填了的那9个其实都很诚实
- 插一句:这次的尺子自己先失效了一次
- 还有哪些字段正在走同一条路
- 对日常工作的一个直接推论
- 文章页上的署名,两处自填字段能对上吗?
- 样本比预想的小,原因得先说
- 两处都写了作者的,26篇里只有4篇
- 署名栏里填的不一定是人
- 时间戳这一栏也没好到哪去
- 把署名做对,其实只有四步
- 时间戳该怎么处理才不给自己挖坑
- 那内容团队现在应该做什么,不应该做什么?
- 三件不值得做的事
- 三件现在就该做的事
- 工作流排一排,误伤概率能降不少
- 什么情况下应该干脆放弃自证
- 如果只能做一件事,做哪件
- 最小可行的留痕方案长什么样
- 留痕还有一个附带好处
- AI搜索会怎么对待这些记号?
- 目前的公开状态
- 往前推,可能走哪两条路
- 对GEO实操的三条影响
- 三条路各自该怎么应对
- 顺便说说被动引用这件事
- 如果客户明天就要你证明“这是人写的”,你拿得出什么?
- 拿不出手的四样东西
- 拿得出手的五样东西
- 把这份清单反过来用
- 拿它去挑供应商,比拿它去挑内容更有用
- 最后留一个问题给读者
- 一份能拿出手的说明长什么样
- 最后回到那136个站
- 常见问题解答
- Claude的水印能被普通用户检测出来吗?
- 把AI写的稿子人工改一遍,水印还在吗?
- 没检测出水印,能证明内容是人写的吗?
- 带水印的内容会被搜索引擎降权吗?
- 我的独立站需要在页面上声明内容是否由AI生成吗?
- 结构化数据里的author字段填品牌名可以吗?
- 如果客户要求提供“非AI生成”的证明,我该给什么?
- 权威参考资料
摘要:把136个品牌独立站的首页快照拆开数了一遍,代表公司身份的那段结构化声明里,纯自述的name字段有94% 的站填了,而能拿去官方登记处一查就知道真假的vatID与leiCode,各自只有1个站填过——填写率顺着可核验程度一路往下掉,掉了78倍。8月2日起Claude的输出全部带上水印,这件事值得单独写一篇,不是因为世上多了一个检测工具,而是因为它把一个被绕开很久的老问题重新摆上了桌面。
先说清楚发生了什么。2026年8月2日起,Anthropic给Claude的输出加了一层看不见的记号,理由写得很直白,是为了对上欧盟人工智能法案第50条第2款关于机器可读标识的要求。消息出来之后,中文圈的讨论几乎立刻跑偏成了两种,一种是“完了,以后AI写的稿子会被查出来”,另一种是“无所谓,改一改不就没了”。
这两种说法都不算错,但都不重要。真正要紧的那句话藏在Anthropic自己的说明里:检出记号只能说明这段文字经过了Claude,不能说明这段文字是Claude 写的。这两件事之间的距离,比大多数人以为的远得多。
保哥这两天把这条新闻和手头一批品牌站的抓取数据放在一起看,越看越觉得它们说的是同一件事。水印想解决的问题,是“这段内容的来源能不能被独立核实”。而独立站上关于身份和来源的那一整套声明——公司叫什么、注册在哪、谁写的、什么时候写的——本来就全是页面自己填的,没有一栏需要向任何人交代。水印不过是把这个老毛病挪到了内容层,顺便让它变得刺眼了一点。
8月2日之后,Claude写出来的每一段字都带着一个记号
要判断这件事对内容团队意味着什么,得先搞清楚这个记号到底是什么东西。市面上流传的猜测大多是错的,而错的方向出奇一致:都以为它是“藏进去的”。
内容进模型不止一条路,robots.txt挡不住AI训练的四条路径是更早的一次拆解。
说到披露这件事,AI内容披露该怎么写早就讨论过一轮,结论是不做什么的清单比做什么的更可核查。
它不是隐藏字符,也不是元数据
最常见的猜测是零宽字符。这类字符在网页上不显示,复制粘贴时跟着走,很多人第一反应就是它。第二常见的猜测是文件元数据,就像照片里的EXIF那样,藏在正文之外的角落。
顺手说一句,一个尾逗号就能让整页结构化数据失效,写之前先校验。
更早一轮尝试走的是另一条路,可验证出处正在变成新的信任货币,做法不同但想解决的是同一件事。
两个都不是。按 Anthropic关于文本水印的官方说明,这个记号既不是特殊字符,也不是附在文件上的额外信息,而是选词过程本身的一种统计模式。
模型生成文字时,每写一个词都要从一堆候选里挑一个,这个挑选带随机性。水印做的事是把随机性的来源换掉:不再用一个跟谁都无关的随机数,而是用一把密钥加上前面几个词,共同决定下一个词该选哪个。
单看任何一处选择,都完全正常,因为它本来就正常,模型确实可以选这个词。但把几百个词连起来看,这串选择呈现出的模式就很难用巧合解释了。手里有那把密钥的人能把模式认出来,没有密钥的人连有没有记号都看不出来。
这个设计有个直接后果,很多人没意识到:你没法靠肉眼、靠去掉不可见字符、靠另存为纯文本来清掉它。它不在字符里,它在词与词之间的选择关系里。你把文本从Word复制到记事本再贴回来,一个字节都没变,记号原封不动。
为什么读者一点都察觉不到
有人担心加了水印之后文字会变味。理论上确实会有影响——被限制的随机选择总归比自由选择少一点余地。但实际读起来的差别,按公开说法接近于零。
读感之外更该盯的是事实密度,提升引用率的七招里那把尺子更实在。
靠读感判断的老办法另说,AI内容检测工具的12项语言特征至今仍是多数第三方产品的实际依据。
原因在于自然语言里可替换的词太多了。同一个意思,模型有十几种说法都成立,水印只是把这十几种里的选择偏向某一部分,而这一部分本身也都是通顺的。这就像有人规定你走路必须先迈左脚,你走出来的样子跟平时没什么两样,只是步伐节奏里多了一条别人能算出来的规律。
所以指望“读起来怪怪的就是AI写的”这条经验来识别,方向从一开始就错了。真正能识别的只有算法,而算法要拿到密钥。
检测器还没交到你手上
这是最容易被漏掉的一环。Anthropic说了会开放检测接口,但在写这篇的时候,公开可用的检测能力还没铺开。
工具自己编东西这件事也要防,AI幻觉引用怎么查有一套排查动作。
顺带提醒一句,AI写的内容会不会被谷歌惩罚这个问题,官方从没给过肯定答案。
这意味着一个尴尬的中间状态:记号已经在所有输出里了,能读懂记号的工具还不在多数人手上。于是市面上必然会出现一批号称能检测的产品,它们检测的其实是别的东西——文字的困惑度、句式的规整程度、用词的分布——那些是旧的AI检测思路,和水印毫无关系。
这里的判断很简单:接下来半年,凡是宣称能查Claude水印的第三方工具,先默认它查的不是水印。判据也简单,问它一句“你用的密钥从哪来的”,答不上来就是在拿旧办法套新概念。
200个词以下,这套机制根本不工作
还有一条硬门槛。统计模式要显现出来需要足够的样本量,文本太短,模式和巧合就分不开。目前公开的门槛是200个token左右,换算成中文大约是一两百字。
短文案能改到什么程度还看平台,哪些页面元素能改哪些被平台锁死。
短文案里最典型的是标题,SEO标题的模板与长度阈值决定了它注定短到测不出。
这条门槛的现实意义比听上去大。想想内容团队日常真正让模型生成的东西:标题、商品描述、按钮文案、meta description、FAQ的一问一答、社交贴文。这些东西绝大多数都不到200个token。也就是说,电商站上最密集使用AI的那部分文字,恰好落在水印覆盖不到的区间里。
| 内容类型 | 典型长度 | 是否可能带上可检出的记号 |
|---|---|---|
| 商品标题 | 10到30字 | 否,远低于门槛 |
| meta description | 60到155字符 | 否 |
| 商品详情段落 | 100到300字 | 边缘,多半否 |
| FAQ单条回答 | 50到200字 | 否 |
| 博客长文 | 1500字以上 | 是,但取决于改动幅度 |
| 邮件营销正文 | 200到600字 | 边缘 |
这张表其实回答了一个很现实的问题:如果你担心自己站上的AI痕迹被查出来,那么最该担心的不是那些短文案,而是长文。而长文恰恰是最可能被人工大幅改写的类型。两头一夹,真正会被稳定检出的内容,比想象中窄。
和图片水印完全不是一回事
因为都叫水印,很多人会拿图片水印来类比,这个类比会把人带偏。
视频那边的收录规则也改过一轮,老打法正在悄悄失效。
图片这条线另有讲究,原创配图怎么把自然流量拉高一倍是完全不同维度的问题。
图片水印的做法是在像素里嵌入信息,改动的是内容本体,理论上你可以逐像素去找、去抹、去覆盖。压缩、裁剪、加滤镜都可能损坏它,所以图片水印的攻防重点在“怎么让它扛住加工”。
文本水印的路子完全相反。它没有往内容里加任何东西,它改的是生成过程中的选择倾向。你拿到的每一个字符都是正常字符,删掉哪个都不会“破坏水印”,因为水印不在任何一个字符里。
| 对比项 | 图片水印 | 这套文本水印 |
|---|---|---|
| 藏在哪 | 像素数据里 | 选词的统计模式里 |
| 能否逐点定位 | 能 | 不能 |
| 格式转换后 | 可能保留 | 纯文本复制照样保留 |
| 削弱它的方式 | 压缩、裁剪、滤镜 | 改写、翻译、缩写 |
| 长度要求 | 基本没有 | 需要足够长的样本 |
这个差别的实际后果是:你惯用的那些“去水印”手段,在文本上一个都不管用;而真正管用的手段——大幅改写——恰好是内容团队本来就该做的事。某种意义上,这套机制惩罚的是不动脑子的复制粘贴,而不是使用AI本身。
为什么这件事挑在这个时间点做
不是技术突然成熟了,是法规到期了。
合规这根弦得一直绷着,海外社媒营销的五类雷区红线可以当发布前自检。
合规驱动的产品变更不是头一回,隐私法规的同意架构当年也是被同一股力量推着落地的。
欧盟那部人工智能法案里关于透明度的条款有明确的生效节奏,涉及生成合成内容的系统必须让输出可被机器识别。对模型厂商来说这是硬约束,不做就没法在欧盟市场提供服务。
所以这一轮标记的落地,从一开始就是合规驱动,不是产品驱动。理解这一点能帮你判断后续走向:合规驱动的功能通常做到刚好达标就停,不会主动往外扩展能力;配套设施(比如检测接口)的优先级也会排在合规要求之后。
另一个可以预期的结果是:各家厂商会各做各的。合规要求的是“可被机器识别”,没要求“各家互通”。于是很可能出现一堆互不兼容的标记体系,谁也读不了谁的。对内容方来说,这意味着不存在一个统一的检测入口,也就不存在一个可以一劳永逸应付的合规动作。
测出了水印,能证明这段字是AI写的吗?
不能。这不是外界的推测,是Anthropic自己在说明里写的,而且写得相当克制。
关于人机之别,42000篇实测的AI内容排名对比给过一组更冷静的数字。
“经过”和“写的”是两回事
把一段人写的稿子丢给模型,让它改错别字,让它把英文段落译成中文,让它把三千字压成三百字,让它把PDF里的文字整理成表格——这些操作的输出全都会带上记号。
工序怎么排,AI内容创作的六要素与八步流程是一份现成模板。
怎么用又不丢掉自己的声音,把AI当创作工具的八种写法讲的正是这一层分寸。
可是这些场景里,内容的来源是谁?是那个人。模型只是一把工具,作用相当于拼写检查器和翻译软件。Search Engine Journal那篇专门讨论水印与作者身份的分析把这一点讲得很清楚:检出记号能确认的只有一件事,就是这段文字在某个环节被模型处理过。
这个区别在实务上会立刻变成麻烦。设想一个场景:你团队里有位英语不好的产品经理,写完中文稿让模型翻成英文发到海外站。半年后有人拿检测器一扫,说这篇是AI生成的。他冤不冤?观点是他的,事实是他核的,结构是他搭的,模型干的活是把中文换成英文。可从记号的角度看,他和一个把提示词丢进去就复制粘贴的人,没有任何区别。
更麻烦的是反过来的情况。一段真正由模型从头生成的文字,只要有人认真改写过,记号就会变弱甚至消失。于是这套机制天然对认真的人不利:改得越少的越容易被抓,改得越多的越容易漏网,而改得多正是我们希望大家做的事。
三次会议之前,我们就吃过一次这个亏
保哥去年给一个做精品咖啡器具的独立站做内容体检,那家客户的团队很小,三个人,文案主力是一位在意大利待过几年的姑娘。她的稿子有个特点,句子长、从句多、喜欢用破折号,读起来相当有个人味道。
这类经历要写成对外案例也有讲究,客户案例研究怎么写才有人信里有完整框架。
结果那年他们接的一个渠道合作方要求所有投放素材附一份“非AI生成声明”,对方拿自己的检测工具扫,她那几篇被判成高度疑似机器生成,反倒是另一位同事用模型草拟、只改了几个词的短文案,因为太短没被判出来。
那次的解决办法很土:把她写作时的版本历史导出来,从第一版一百多字的提纲,到中间七八次修改,到定稿,时间戳连成一条线,附给对方。对方看完就不提了。这件事留下的印象很深,能说服人的从来不是一个判定结果,而是一条能被复查的过程。今天水印这件事,本质上还是同一个问题。
那条74% 的研究结论,值得单独看一眼
水印能不能被绕过,学术圈早就试过。关于这套机制如何被击破的公开分析里提到几组数字,值得抄下来贴在墙上。
改写敏感性可以单独测,五步测出品牌引用稳不稳。
看到高得离谱的比例先别急,给那条建议配一个注定无效的对照组是最省事的验伪办法。
一组是苏黎世联邦理工的研究,在2024年的机器学习顶会上发表,结论是绕过水印的成本大约50美元,成功率超过八成。另一组是2025年的后续研究,七种主流水印方法全部被攻破,把文本改写到去掉记号的成本降到每百万token不到1美元。
但真正扎眼的是第三个数字:在测试中,74% 未加水印的改写文本被判定成带水印。这是假阳性,而且是高得离谱的假阳性。
把这三个数字放在一起,结论相当难堪。想去掉记号的人花不到一杯咖啡的钱就能去掉;而老老实实自己写、只是碰巧改写风格与机器接近的人,有很大概率被冤枉。一套证据机制如果对造假者宽松、对守规矩的人严苛,它作为证据的价值就很可疑。
| 研究结论 | 数值 | 对内容团队的含义 |
|---|---|---|
| 绕过水印的一次性成本 | 约50美元 | 刻意规避的门槛极低 |
| 绕过成功率 | 80% 以上 | 决心去掉就能去掉 |
| 大规模改写成本 | 每百万token不到1美元 | 批量洗一遍毫无压力 |
| 未加水印文本的误判率 | 74% | 老实人反而更容易被冤 |
| 可靠检出的最短长度 | 约200 token | 短文案天然免检 |
完整改写能去掉,可去掉之后它还算AI写的吗
这里有个有意思的悖论。公开说明承认,轻度编辑大概去不掉记号,但把每个词都换掉的彻底重写可以。
改写幅度这件事,机器翻译直接上线省下的那道审校那篇里有过非常相似的度量困境。
可是当一段文字的每个词都被人换过一遍之后,它还能被叫做机器生成的内容吗?这个问题没有标准答案,但它暴露了一件事:水印度量的其实不是“作者是谁”,而是“机器参与的程度还剩多少”。参与程度低到一定份上,记号自己就消失了,这在逻辑上反而是自洽的。
只是这套自洽对使用者一点也不友好。你没法事先知道自己改到什么程度才算“干净”,因为门槛不透明;你也没法证明自己没改过,因为记号消失和从来没有过,看起来一模一样。
内容团队的四种常见姿势,各自会怎样
把日常工作里真实存在的用法列一遍,对号入座会比讲原理清楚。
六阶段那套流程,从选题到SEO加工怎么跑通写得更细。
四种姿势对应四套质检,AI内容写完谁来质检那份人机分工清单可以直接照搬。
第一种,直接生成直接发。提示词丢进去,输出复制出来,排版发布。这种情况下记号最完整,检出概率最高。同时它也是内容质量最差的一种,会不会被检出其实是最小的问题。
第二种,生成后人工重写。拿模型输出当素材,自己重新组织结构、换掉表达、补充自己的判断。这种情况下记号会大幅削弱,改得彻底的话会消失。而这恰恰是负责任的用法。
第三种,人写完让模型润色。观点、结构、事实全是人的,模型只负责把句子理顺、把错别字挑出来。这种情况下记号照样会出现,而内容的来源明明是人。这是最容易产生冤案的一种。
第四种,人写完让模型翻译。和第三种同理,输出会带记号,而原始创作完全是人的工作。做外贸和多语言站的团队,这种用法最普遍,也最容易被误伤。
把这四种排一排就能看出问题所在:检出概率的高低顺序,和内容质量、人的投入程度,几乎没有正相关关系。第一种和第三种都会被检出,但两者的性质天差地别。一个信号如果不能区分这两者,它作为质量判据就是失效的。
这对做多语言站的人尤其要紧
多说一句第四种。做出海和多语言独立站的团队,机器翻译是刚需,没有人会为了几十个语种去养一支翻译队伍。
多语言页面的标记有个反直觉之处,正文越本地化结构化数据越要写回国际格式。
多语言站还有个更早的坑,翻译内容为什么在AI检索里吃亏。
结果就是:一个用心做本地化的站,恰恰是记号密度最高的站。原文是人写的,每一个语种版本都经过模型,每一个版本都带记号。而一个偷懒的站,可能只有一个英文版,反倒干净。
这个倒挂大概是这套机制最需要被讨论的部分。目前还没有哪家平台把“翻译”和“生成”区分开来处理,技术上也很难区分——从记号的角度看,它们的确是同一件事。
能给的建议只有一条:如果你做多语言,把原文版本的创作痕迹留好。当有人拿译文的记号说事时,你要能指出原文在哪、什么时候写的、由谁写的。原文站得住,译文自然站得住。
那反过来呢?测不出水印,能证明这段字是人写的吗?
更不能。而且这个方向的漏洞比前一个方向大得多,大到几乎让“没检出”这个结果失去意义。
反过来的风险也真实存在,AI内容流水线为什么六个站掉了四个复盘过三处必须留人的节点。
官方自己列了五条测不出来的理由
Anthropic在说明里主动列举了记号可能不出现的情形,一共五种。这份清单读起来有点像免责声明,但它其实是这套机制最诚实的部分。
多因排查的通用打法,页面不被收录的症状分诊与急救可以照抄它的顺序。
这种多因一果的排查最费时间,可索引性一键体检是同类思路的工具化版本。
| 测不出来的原因 | 具体情形 | 在电商内容里常不常见 |
|---|---|---|
| 模型版本太老 | 用的是加水印之前的模型 | 常见,很多团队的工作流没更新 |
| 改动幅度太大 | 大幅改写、转述、翻译、融进已有稿子 | 非常常见,正规流程都会改 |
| 文本太短 | 不到200 token的片段 | 极常见,短文案是主力 |
| 格式转换丢失 | 转成图片、截图、过一遍别的格式 | 常见,设计稿、社媒图都算 |
| 载体不支持 | 输出形式本身承载不了这种标记 | 视场景而定 |
把这张表反过来读一遍就明白了:一段文字没有记号,可能是因为人写的,也可能是因为它太短、被改过、换过格式、或者用的是别家模型。五条里只有一条对应“真的是人写的”,其余四条都是技术性缺席。
所以“扫了一遍没问题”这句话,作为证据的分量接近于零。这一点值得内容主管们提前想明白,因为迟早会有人拿一份没检出的报告来当免责凭据。
别家模型完全不在这套体系里
还有一个更基础的漏洞:这个记号只属于一家。用别家的模型生成的内容,扫Claude的水印当然扫不出来,因为压根不是一套标准。
跨平台看份额才有意义,AI可见度竞品分析的全流程。
各家路数差别不小,十款主流AI搜索工具实测可以先建立一个大致印象。
各家现在的进度参差不齐。图像和音频领域的标记方案铺得更早一些,文本这块反而是最慢的。到写这篇时为止,几家主要厂商在文本标记上的公开状态大致是:有的已经落地,有的只做了非文本形态,有的干脆没有公开政策。
这就带来一个荒谬的推论:如果你的目的是让内容测不出记号,最省事的办法不是改写,是换一家模型。成本为零,效果百分之百。任何一套只有一家参与的标识体系,都会遇到这个问题。
碎片化会带来什么后果
标识体系分散在各家手里,会引出几个连锁问题,值得提前想清楚。
引擎各行其是不是新鲜事,三大AI引擎偏好规则的45条对照就是碎片化的另一个切面。
第一,不存在统一的检测入口。要判断一段文字有没有记号,理论上得拿去每一家分别验一遍。而各家开放检测能力的节奏不同、接口形态不同、政策不同,实际上没有哪个第三方能把这件事做全。
第二,缺席无法解释。如果只有一家的记号能验,那么“没验出来”这个结果就有太多种可能——用了别家、用了老版本、文本太短、改写过。当一个结果有四种解释时,它就不构成证据。
第三,容易被误用成竞争工具。可以想见接下来会出现这样的场景:有人拿检测结果去质疑竞争对手的内容,或者在采购谈判里当筹码。而由于前两条,这类质疑在技术上几乎总是站不住的,但它在舆论上的杀伤力不小。
更稳妥的做法是,提前想好被这样质疑时怎么回应。回应的重点不是去自证清白(做不到),而是把过程材料摆出来,把话题从“有没有记号”换到“这篇是怎么做出来的”。后面这个问题你有答案,前面那个没人有答案。
行业里已经出现的一个苗头
顺着说一个观察。这一两年,出海圈子里对“内容是不是AI写的”这个问题的态度,已经明显松动了。
预期管理同样要靠可核验的东西,SEO要多久才见效的真实时间线。
合同条款怎么写才执行得下去,SEO服务合同的达标定义与违约责任有现成的范式可抄。
两年前还有不少客户在合同里写死不许用AI,现在更常见的写法是要求披露使用范围和保证质量。这个转变的原因很朴素:禁止条款没法执行,执行不了的条款写进合同只会制造纠纷。
这个转变的方向和本文的结论是一致的——当一个判据无法核验时,成熟的做法是换一个能核验的判据,而不是加大处罚力度。合同里从“不许用”改成“说清楚怎么用的”,正是从不可核验向可核验的迁移。
欧盟那条法规要的到底是什么
值得把源头翻出来看一眼。欧盟人工智能法案的正式文本第50条要求的是,生成合成内容的系统要让输出以机器可读的方式被标识出来,并且要能被检测为人工生成或操纵。
欧盟市场的主体资格也要提前想,美国、英国与香港三地架构对照。
做欧洲市场绕不开的另一件事,是同意管理平台该怎么选。
注意这条义务落在提供模型的一方身上,不是落在用模型的人身上。厂商必须给输出打标记,这是他们的合规动作。至于你作为使用者要不要披露自己用了AI,那是另一套规则在管,取决于内容形态和你所在的行业。
这个区别经常被混淆。见过不止一家出海企业把“模型要加水印”理解成“我们发内容要标注AI生成”,然后在页脚加了一行声明,结果既没解决合规问题,又白白给自己贴了个标签。欧盟官方对这套监管框架的说明页把义务主体分得比较清楚,做欧洲市场的团队值得读一遍原文,别听二手解读。
那排名会不会受影响
这是所有SEO从业者最关心的一问,答案目前是:没有证据表明会。
质量判据一直在变,从熊猫算法到AI模式这十四年能看清方向。
近一轮核心更新的走向也支持这个判断,聚合站重伤而品牌站受益。
Ahrefs在这轮讨论里放出过一组数据,来自对大量排名页面的统计。他们那篇面向营销人员的解读里提到几个数字:排名靠前的页面里,完全由AI生成的占5.3%;AI含量高的页面被收录的比例是40%,含量低的是49%;而在每一个排名位置上,都有8% 到12% 的页面AI含量超过八成。
这几个数字里,最值得琢磨的是40% 对49% 这一组。差距存在,但没有大到能称为惩罚。更合理的解释是:AI含量高的页面里,凑数的比例本来就高一些,被筛掉的是质量不是来源。
这件事一直可以这么看:搜索引擎对内容怎么产生的没有兴趣,它有兴趣的是这一页值不值得排在那个位置。水印不会改变这个逻辑,它只是给平台多了一个可选信号,而平台要不要用、怎么用,到现在一个字都没说。
做个思想实验:如果明天全行业都打上记号
假设所有厂商明天统一了标准,所有输出都带可互认的记号,检测能力人人可用。会发生什么?
标注失去区分度之后会怎样,用的人越来越多信的人却越来越少是个现成的参照。
第一波,市面上大量内容被检出。这个比例会高到让所有人尴尬,因为按现在的使用密度,说八成商业内容经过某种模型处理都不夸张。
第二波,标注开始失去区分度。当一个标签贴在八成内容上时,它就不再是标签了,等于没贴。用户会迅速学会忽略它,就像现在没人会因为一篇文章下面写着“广告”就真的不看一样。
第三波,注意力转移到别处。平台会去找新的区分维度,而那个维度大概率还是内容里有没有别处得不到的东西——一手数据、真实经历、可复现的方法。
这个思想实验的意义在于:即使这套机制百分之百成功,最终的落点仍然是内容本身的独特性。所以现在把力气花在应对检测上,不如花在让内容值得被检测出来也无所谓。
不过有一类场景确实会变
说了这么多“影响有限”,得公平地指出一个真会受影响的场景:供应链上的内容采购。
交付物也可以顺手做成资产,白皮书怎么做成能换反链又被引用的内容。
供应链上的口径对齐一向难,联盟客抢走品牌词还要你付佣金是同类问题的另一种形态。
如果你是外包写手、内容代理商,或者你在采购这类服务,那么记号会成为一个新的验收条件。甲方要求交付物不带记号,写手就得改到记号消失,这是一个可执行的验收标准,尽管它衡量的东西未必是甲方真正想要的。
这件事已经在发生,只是还没形成规范。这里的建议是,如果你在采购内容,别把“不带记号”写进合同,写“提供创作过程材料”更有意义,前者可以通过洗稿满足,后者不行。
反过来如果你是供应方,提前把过程材料的交付变成标准动作,这在未来一两年会是一个真实的竞争优势——因为大多数同行给不出来。
把镜头拉远:“谁写的”从来就是一栏自己填的字段
写到这里,该说这篇文章真正想说的那件事了。水印之所以显得别扭,不是因为它做得不好,而是因为它试图去解决一个结构上就解决不了的问题。
最典型的自填标记是链接属性,nofollow与赞助标记到底传不传权重把这套机制讲透过。
规则要生效,先得给你分类
任何一条规则要落到具体对象上,都得先回答“这算哪一类”。禁止AI生成内容,得先判定什么算AI生成;广告必须标注,得先判定什么算广告;跨境商品要交税,得先判定它属于哪个税号。
分类这件事在商品数据里最较真,页面标记和数据源的分类终于对上了。
站内搜索页算哪一类,四种处理方案的对比给过判据。
分类先行这件事在筛选页上最明显,电商筛选网址要不要写禁止抓取得先判它算哪一类。
问题在于,这些分类所依据的那个字段,绝大多数情况下是被管的一方自己填的。
给某条外链标上赞助属性,是站长自己标的,没人能验证这条链接到底有没有收过钱。结构化数据里写着这是一件商品,是页面自己声明的。语言标记里写着这页是德语,也是自己填的。规则挂在哪一栏,你能改的就是哪一栏,遵守和规避在动作上完全一样——填另一个值。
这就是本篇想立住的那句话:一条规则的执行力,天花板不是罚则有多重,而是它所依赖的那个分类字段有多容易被独立核实。
SEO里的自填字段,比你以为的多得多
把日常打交道的字段列一遍,会发现整个技术SEO有相当大的比例建立在自我声明之上。
有些字段还没被用起来,用结构化数据标注重要内链就是个例子。
哪些字段真有人填,Schema官方第一次公开的全网使用数据给了一份可对照的底表。
| 字段 | 它声明了什么 | 谁能推翻 |
|---|---|---|
| canonical | 这一页的正式地址是哪个 | 搜索引擎,它有自己选定的一版 |
| hreflang | 这一页是给哪个语言地区看的 | 能,读一读正文就知道 |
| noindex | 这一页不要收录 | 基本不能,通常照办 |
| 链接的赞助与免责属性 | 这条链接是广告还是自然推荐 | 很难,除非查到交易 |
| 结构化数据类型 | 这一页是商品、文章还是问答 | 能,与页面实际内容比对 |
| 自填评分与评价数 | 我们得了多少分,多少人评的 | 难,除非平台去抽查 |
| 作者与发布时间 | 谁写的,什么时候写的 | 几乎不能 |
| generator | 这个站用什么建的 | 能,看资源痕迹 |
这张表里的字段可以分成两拨。能被推翻的那一拨,自填权其实名存实亡——你写什么无所谓,观察者有自己的判断路径。搜索引擎会自己选定一个正式地址,会自己判断这一页到底是什么语言,会自己认出这个站用什么建的。
不能被推翻的那一拨,才是真正的自填字段:这条链接收没收钱、这段字是谁写的、这个日期是不是真的。它们的共同点是,证据不在页面上,在页面之外的世界里,而观察者到不了那里。
水印这件事之所以值得关注,是因为它是第一次有人尝试把“谁写的”从第二拨挪到第一拨。尝试的方向是对的,只是挪的距离比宣传里听起来短。
为什么大多数规则最后都挂在了自填字段上
还有个问题值得问一句:既然自填这么不可靠,规则制定者为什么还要挂在上面?
一个字段被滥用之后会怎样,FAQ富结果被砍掉就是最近的一次示范。
关键词标签的兴衰是最好的例子,旧的关键词公式为什么失效那篇里有完整脉络。
答案很现实:因为便宜。要求你自己声明,成本几乎为零,规则第二天就能生效;要建立一套独立核验体系,成本极高,可能永远建不起来。
于是就形成了一种默契:规则挂在自填字段上,同时假定大多数人不会撒谎。这个假定在多数时候成立,因为撒谎的收益通常不够大。真正的问题出在收益变大的时候——比如某一天平台真的开始按“是不是AI写的”来分配流量,那一刻起,这一栏的可信度就会归零。
这不是危言耸听,是已经反复发生过的事。关键词标签当年就是这么废掉的:只要它对排名有用,它就会被填满关键词;等它被填满关键词,它就再也没用了。任何一个自填字段,一旦被用作分配资源的依据,它的信息价值就开始自我毁灭。
三种字段,三种命运
按可核实程度分,自填字段大致有三类,命运完全不同。
评分这类数值最典型,怎么给评论加上星级结构化数据要先想清楚数据从哪来。
第三类的典型是价格,被划掉的那个原价只有你自己的价格历史能证明。
第一类,压根无从核实。比如“这段话是我写的”。除非有人全程盯着,否则没有任何外部证据能确认或否定。水印想干的就是把这一类往上提一格,但它只提了半格——检出时有一定说服力,检不出时毫无说服力。
第二类,可以被内容本身推翻。比如页面自称是德语。观察者读一读正文就能自己判断,你填什么不重要。这一类字段的自填权其实早就名存实亡了。
第三类,只能被结果反推,而且要等。比如你回传给广告平台的转化价值。短期内平台只能照单全收,长期靠实际成交去校准。这一类的特点是撒谎当时有效,事后失效。
三类里,第一类最脆弱,也最容易被绕开。而“内容是谁写的”,很不幸正是第一类。
观察者的应对方式高度一致
面对不可核实的自填字段,所有平台的做法都一样:找一个你伪造不了的旁证,然后不再看你填的那一栏。
按行为拦截也有代价,防火墙到底拦不拦得住AI爬虫没那么简单。
按行为不按名字,真假Googlebot该怎么验证是这条原则最成熟的一次落地。
搜索引擎判断一个页面用什么建的,不看你声明的建站平台,看资源路径上的指纹。风控判断一笔订单风险,不看你填的地址,看设备、行为和历史。反作弊判断流量真假,不看来路标记,看行为曲线。
这个规律在下一节会有非常具体的数字支撑。保哥用136个品牌站的首页量了一遍,自称和旁证之间的差距大到出乎意料。
被绕过之后,那一栏会怎么样
值得多说一句自填字段的结局。它不会被删掉,它会被留在那里,然后没人再看。
被降级不等于被删除,分层索引会把页面丢进哪一层是同一种处置方式。
被废掉的信号不会消失只会失效,PageRank退役之后权威信号怎么演变是一整条完整轨迹。
这个过程有个固定的三步。第一步,字段被创造出来,用来承载某个判断。大家老老实实填,信息有效。第二步,字段的取值开始影响利益分配。填法出现策略化,有人开始按最有利的方式填,信息开始失真。第三步,观察者找到旁证,改用旁证。字段留着不删(删了会破坏兼容性),但权重降到接近零。
技术SEO里走完这三步的字段已经有一串了。当年的关键词标签走完了,页面自称的更新频率和优先级走完了,各种“我很重要请优先抓取”的信号也基本走完了。它们至今还能写,写了也没人拦你,只是不再有任何作用。
判断一个字段处在哪一步,有个简单办法:看它有没有官方文档明确说“我们不使用这个信号”。被正式宣告不用的,说明已经走完第三步;还在被强调要填的,多半停在第一步或第二步之间。
按这个标准看,“内容是不是AI生成的”这件事,现在连第一步都还没走完——因为承载它的字段刚刚被造出来,而且造它的人和用它的人还不是同一批。
真实站点上,身份自证的链条到底有多薄?
光讲道理不解渴,得有数。手头正好有一批品牌独立站的首页快照,是之前做别的测量时抓下来的,一共187份。这次换个角度重新拆了一遍,专门看一件事:这些站在页面上关于“我们是谁”说了些什么,其中有几句是外人能查证的。
同一层还有个更细的坑,商家名称禁止双语重复,112个站里17个在犯。
同一个方向的另一次测量结论更狠,71家审计揭开平均84%的身份泄漏。
样本和口径先交代清楚
187份原始快照里,有些是挑战页、有些是跳转残骸、有些体积小得根本不是完整页面。按“字节数超过一万且确实是一份HTML文档”这条筛下来,剩136份可用。下面所有比例的分母都是这个136,不是187。
样本怎么取决定结论有多硬,按页面模板抽样把百天审计压到半天讲的就是这件事。
看的是页面里的JSON-LD结构化数据,从中找出代表公司或商店的那个实体,然后逐个字段清点。清点的不是内容对不对,只是填没填。这一点很重要——本次测量完全不评价真假,只统计有无,因为“有没有填”这一层的结论已经足够说明问题了。
先看总量:六成站有,四成站连声明都没有
136个站里,有93个站页面上带JSON-LD,占68.4%。其中能找出组织或商店实体的有83个,占61%。
没有的赶紧补,结构化数据生成器的13种类型够覆盖绝大多数页面。
结构化数据到底有没有用,官方说法加实测给过一个不含糊的答案。
换句话说,接近四成的品牌独立站,首页上根本没有一段机器可读的自我介绍。这些不是小作坊,是国际上叫得出名字的DTC品牌和零售商。
这个数字本身不算意外,意外的在后面。
那条顺着可核验度往下掉的曲线
把83个有组织实体的站按字段拆开,一个个数填写率,结果排出来是这样的。
主题权威做到位也还不够,AI搜索为什么还是不选你列了18个盲区。
把这些字段汇到一处,就是实体主页这块品牌身份地基该有的样子。
| 字段 | 填了的站数 | 占有实体的站的比例 | 外人能不能查证 |
|---|---|---|---|
| name名称 | 78 | 94.0% | 不能,纯自述 |
| url网址 | 76 | 91.6% | 能,一点就知道 |
| logo标志 | 62 | 74.7% | 能,图片在不在 |
| sameAs关联主页 | 61 | 73.5% | 能,去对面看有没有 |
| contactPoint联系方式 | 26 | 31.3% | 能,可以打过去 |
| address地址 | 23 | 27.7% | 能,可以实地核 |
| legalName法定名称 | 16 | 19.3% | 能,登记处可查 |
| telephone电话 | 13 | 15.7% | 能,可以拨 |
| email邮箱 | 12 | 14.5% | 能,可以发信 |
| vatID税号 | 1 | 1.2% | 能,官方库可查 |
| leiCode法人识别码 | 1 | 1.2% | 能,全球库可查 |
这张表读一遍就够了,不需要解释太多。越是外人能一查就知道真假的字段,填的人越少;越是纯粹自述、说什么算什么的字段,填的人越多。从name的94.0% 到vatID的1.2%,中间掉了78倍。
而且这条曲线是单调的,中间没有反例。这一点有点意外——本来以为会看到某几个字段因为建站平台默认填上而突起,结果没有,它平平整整地一路往下走。
掉得最陡的那一段在哪
看拐点比看两端更有意思。从sameAs的73.5% 掉到contactPoint的31.3%,一步跌掉了42个百分点,是整条曲线上最陡的一段。
看着像装饰的那几个信任元素,在小语种市场恰恰是搜索量最高的购买词。
说了就要负责的信息才值钱,独立站信任的七层落地按的是同一个逻辑。
这两个字段的区别是什么?sameAs填的是你自己的社交主页,那些账号本来就是你开的,写上去等于把已经公开的东西再说一遍,零成本零风险。contactPoint填的是能找到你的方式,一旦填了就得有人接。陡降发生在“说说而已”和“说了要负责”的交界处。
再往下,legalName到vatID之间又是一次断崖,从19.3% 掉到1.2%。法定名称还算半公开信息,写错了顶多显得不专业;税号和法人识别码则是一填就能被人拿去官方库里比对的东西。全球法人识别码可以在 GLEIF的公开查询库里直接搜到注册主体、注册国和状态,填了就等于把自己摆上台。136个站里,愿意这么做的只有1个。
为什么这条曲线值得SEO从业者认真看
因为它说明了一件事:结构化数据在实践中被当成了展示工具,不是核验工具。
实体权威要靠协作,SEO与内容团队的四阶段协作框架。
字段填满了关系却没审,AI可见性审计总漏的那一层说的正是这个盲区。
大家填name、url、logo,是因为这几栏能换来搜索结果里的品牌卡片和标志展示,有肉眼可见的回报。而legalName、vatID这些换不来任何展示位,纯粹是把可核验的信息交出去,于是就没人填。
这个取舍完全理性,给客户做的时候也是这个优先级。但它的后果是:当有一天平台真的想核实“你是谁”的时候,它在你的页面上找不到任何可以核的东西。剩下的全是你自己说的。
如果你正在做AI搜索可见度这件事,这条曲线值得贴在工位上。生成式引擎在决定要不要引用一个来源时,最缺的恰恰是可核验的实体锚点,而绝大多数站在这一层是空的。
为什么量首页,不量“关于我们”页
有人会问,公司信息不是应该在关于我们那一页吗,量首页是不是找错地方了。
页脚也是身份信息的收口,页脚怎么设计才是信任的最后一关。
给人看的那一页也别荒废,关于我们页面怎么写才被认成可信实体是另一半功课。
这个问题问得对,但答案是:机器可读的组织声明,绝大多数站是放在全站模板里的,也就是每一页都有一份,首页当然也有。这是各大建站平台的默认做法,因为它要服务的是搜索结果里的品牌展示,不是给人看的介绍页。
实际抓取也印证了这一点。在有组织实体的83个站里,这段声明的内容在首页、分类页、商品页上基本一致,说明它出自同一处模板。所以量首页等于量全站。
反过来,关于我们那一页上的信息虽然更丰富——创始故事、团队照片、工厂地址——但那些是给人读的散文,机器要从里面提取出结构化的身份信息,难度和可靠性都是另一回事。我们要考察的是“可被机器核验的身份声明”,这个东西的载体就是模板里那一段。
这条曲线在别的数据上也出现过
可核验度越高、填写率越低,这个规律不是这一次才见到。
政策页也有同样的取舍,退换货政策页怎么写里能看到具体怎么权衡。
做站点体检时经常遇到类似形态。商品页上,描述性的卖点文案写得满满当当,而尺码表、材质成分、原产地这些一填就可能被投诉的字段,缺失率高得多。联系页面上,在线表单人人都放,而具体到人的直拨电话很少见。招聘页面上,企业文化写三屏,具体薪资范围写的没几家。
共同点是:越具体、越可被追究的信息,公开意愿越低。这不是道德问题,是理性选择——公开可核验信息带来的收益不确定,带来的风险很确定。
但对SEO和AI可见度来说,这个理性选择正在变成劣势。当机器需要判断一个来源可不可信时,它只能依赖那些可被交叉验证的具体信息,而那恰好是所有人都不愿意填的部分。谁先跨过这个心理门槛,谁就在这一层拿到了几乎没有竞争的位置。
把这条曲线用成自查工具
这套方法可以直接搬到自己站上。做法是把你页面上关于身份的所有声明列出来,逐条问一句:一个完全不认识你的人,能不能在不联系你的前提下,独立确认这一条是真的?
想找得更细一点,用向量嵌入把AI认不全你的地方挖出来。
把自查扩成体系,企业网站SEO审计到底该查什么有一份可裁剪的框架。
能,这一条就有核验价值。不能,它就只是自我介绍。然后数一数,两类各有多少条。
拿这个法子扫过几家客户站,结果都差不多:可核验的那一类通常是零到两条,全是网址和标志这种最浅的层次。补起来其实不难,难的是意识到这一层是空的——因为页面看上去内容很满,满的全是自述。
这次测量没做到的几件事
把局限写清楚,读者才好判断该信到什么程度。这次有三件事没做。
让AI来做审计有前提,数据、方法与人工复核这三条缺一不可。
不设对照就会高估,量出74%的差异补上对照之后只剩2.2%是最近一次教训。
第一,没有核验填写内容的真假。统计的只是填没填,一个站写了法定名称,没有去登记处比对过它是否属实。所以上面所有比例都应该读成“愿意公开可核验信息的比例”,而不是“公开信息属实的比例”。真实率只会比填写率更低,不会更高。
第二,没有跟踪时间变化。这是某个时点的一次快照,看不出这些字段是在变多还是变少。凭经验判断应该在缓慢变多,因为结构化数据的普及度这几年一直在涨,但没有数据支撑,不写进结论。
第三,样本有明显的地域和品类偏向。这批站以欧美的消费品品牌为主,服饰、家居、户外、消费电子占了大头。做工业品、做本地服务、做新兴市场的站,情况可能完全不同——尤其是欧盟本土企业,因为法定信息披露要求更严,填写率大概率高于这个样本。
还有一个更基础的偏差要说明:抓取是从中国境内的一台服务器发出的,部分站点会因为地区分流返回不同版本,也有一批站直接拒绝了请求。187到136的损耗里,有一部分就来自这里。所以样本不是随机的,是“愿意对这个来源开门的那批站”。
如果要复现这套测量
方法本身很简单,任何有基础脚本能力的人都能重跑一遍。
嵌套解析这块,@graph与知识图谱怎么搭那篇讲过结构长什么样。
不想自己写脚本,结构化数据审计工具可以一次扒清一个页面里的五种格式。
核心只有三步:把目标站的首页抓下来存成文件;从中提取机器可读的结构化数据块;把代表组织的那个实体找出来,逐字段清点有无。整套逻辑不到两百行。
唯一需要留神的是解析要能处理嵌套。结构化数据常常层层包裹,组织实体可能出现在很深的位置,也可能出现在一个集合节点里。只在顶层找,会漏掉相当一部分,这也是很多现成检测工具报出的覆盖率偏低的原因。
建议做的时候顺手把每个站的字段明细也落成一份表格,而不是只留汇总数字。这次几个最有意思的发现——比如某个站列了十个语种的百科条目、某个站的名称带变音符号——全是在翻明细的时候看到的,汇总数字里完全看不出来。
sameAs是唯一一栏能被外部核验的,它被填成了什么样?
在整套组织声明里,sameAs的地位很特殊。它是唯一一个把指针指向站外的字段——你说你是谁,然后给出几个别处的地址,让人自己去对。理论上,这是自填字段里最接近“可核验”的一栏。
实体之间的关联怎么量化,实体关联分析器与它那套打分算法给过一种做法。
347条指针,指向哪里
61个站一共填了347条sameAs。把它们按目标域名归类之后,分布是这样的。
本地场景的实体识别另有一套,商家资料的实体识别五步排查。
社媒之外还有一类可用锚点,未链接的品牌提及怎么转成反链。
| 目标类型 | 条数 | 占比 | 核验价值 |
|---|---|---|---|
| 自己开的社交账号 | 325 | 93.7% | 低,账号本身也是自己申请的 |
| 第三方百科与登记库 | 22 | 6.3% | 高,条目由第三方维护 |
325比22。这个比例几乎回答了所有问题。
指向社交主页当然不是错,那些链接对品牌展示有用。但从核验的角度看,用一个你自己申请的账号去证明另一个你自己搭的网站,逻辑上是在原地打转。两头都是你,中间没有第三方。
具体分布上,Instagram出现在53个站里,Facebook 51个,YouTube 41个,TikTok 26个,Twitter 25个,Pinterest 19个,LinkedIn 17个。这是一份非常标准的社媒清单,也说明这一栏在大多数团队眼里的定位就是“把社媒链接再放一遍”。
真正做了外部锚定的,只有12个站
把指向维基百科、维基数据、Crunchbase这类第三方条目的站单独挑出来,一共12个,占136个站的8.8%。
这件事的底层逻辑,这份专利说透了SEO新目标是教AI认识你是谁。
第三方数据这件事容易被误读,网站权威这个数谷歌到底认不认也是一个常见误会。
而且这12个站的贡献极不均匀。其中一家运动品牌一口气列了10个语种的维基百科条目,光它一家就占了22条里的10条。另一家户外服饰品牌列了维基数据和英文维基两条。剩下十家,基本是一家一条。
也就是说,136个品牌站里,真正把自己锚定到一个第三方维护的实体上的,去掉重复语种之后大概只剩十来条有效声明。
这些站是谁?名单本身挺说明问题:一家上市的电商SaaS、一家瑞士跑鞋品牌、一家美国宠物电商、一家德国刀具老厂、一家婴童用品制造商、一家手机壳品牌、一家地毯DTC。共同点是它们本来就在第三方数据库里有条目,写上去只是把已有的事实指出来,而不是凭空创造一个证明。
顺带看到的两件小事
清点过程中还撞见两个细节,跟主题相关,一并记下来。
名字对不上还牵扯消歧,实体消歧的六类信号管控。
品牌名的写法差异不只是好看,西里尔和片假名会让数提及的脚本一个都认不出。
第一件,组织名称和域名对不上的有5个站,但全部是无害的差异:品牌名带变音符号或特殊排版,比如域名里写成babybjorn,声明里写成带圈上加点的正式写法;域名wusthof,声明里是全大写带变音的正式商标写法。这类差异不是错误,反而说明这一栏填的是品牌真名。顺便一提,如果你的品牌名带非英文字符,这一栏是少数几个能把正式写法交代清楚的地方,值得填对。
第二件,136个站里,结构化数据中出现过具体自然人的只有9个站,占6.6%。出现的清一色是创始人——某某夫妇、某某兄弟、以创始人名字命名的品牌。换句话说,在这批品牌站的机器可读声明里,除了创始人,没有任何一个人是有名有姓的。
这一条和水印那件事扣得很紧。我们正在讨论“怎么证明内容是人写的”,而现实是,绝大多数商业站点的页面上,连一个人的名字都没有。证明的前提是先有个被证明的对象,这个对象在多数站上根本不存在。
这一栏怎么填才算真有用
既然sameAs是自填字段里最接近可核验的一栏,那就值得把它填对。判断标准只有一条:指过去之后,对面认不认得你。
第三方条目之外,术语库定义页怎么织成主题权威也是可被引用的锚点。
指向百科要留神一件事,维基百科正式禁掉AI内容之后,条目审核只会更严。
社交主页当然认得你,那是你的账号。但这种“认得”是自证式的,它只能确认账号归属,不能确认你声称的任何事实。真正有价值的是那些由第三方维护、你改不动的条目。
| 指向类型 | 你能不能改对面的内容 | 核验价值 |
|---|---|---|
| 自家社交账号 | 能,随便改 | 只能确认账号归属 |
| 应用商店页面 | 部分能 | 可确认产品确实存在 |
| 第三方百科条目 | 基本不能 | 高,有编辑审核 |
| 结构化知识库条目 | 基本不能 | 高,有标识符体系 |
| 企业信息数据库 | 部分能,需审核 | 中高 |
| 行业协会或认证机构 | 不能 | 很高,但门槛也高 |
实操建议按这个顺序来:先把已经存在的第三方条目找出来指过去,这一步零成本,很多品牌其实早就有条目,只是没人想起来在页面上指向它。然后才是社交账号,作为补充。
要提醒的是,别为了填这一栏去凭空创造条目。第三方条目之所以有核验价值,正是因为它的产生不由你控制;你自己去建一个,价值就没了,而且很多平台对这种行为有明确限制。
一个反常识的小结论
数据里还藏着一句话,值得单独拎出来:sameAs填得最多的那个站,核验价值不一定最高。
聚合方式也影响可读性,Schema聚合怎么接入智能体网络。
与其堆条数,不如看看给AI的实体声明文件要不要现在就配一份。
那个填了20条的站,绝大部分是各个地区的社交账号分号,本质上是同一个东西的十几份副本。而某个只填了两条的站,两条全是第三方结构化条目,核验价值反而更高。
这提醒我们,衡量这一栏不能看条数,要看指向的多样性和外部性。一条指向不受你控制的第三方记录,胜过十条指向你自己的账号矩阵。做结构化数据优化时,很多人习惯性地追求“字段填满”,这一栏是个例外——填得对比填得多重要得多。
“我们用什么建的站”这一栏几乎没人填,为什么没人在乎?
前面说过,面对不可核实的自填字段,观察者的做法是找旁证、绕过自称。这话听着像推测,但它可以被量出来,而且量出来的差距大得离谱。
顺带回答一个老问题,谷歌到底偏不偏爱某个建站平台。
网页里有一栏叫generator,作用就是让页面自报家门:我是用什么工具生成的。这是一个百分之百的自填字段,写什么都行,没有任何机制去验证。它和“这段内容是谁写的”属于同一类:纯自述,无从核实,全靠自觉。
自称的比例:6.6%
136个站里,填了generator的只有9个。
平台痕迹多半来自装了太多东西,应用栈精简与冲突排查能顺手减掉一批。
选平台本身是另一场决策,托管型、自建还是纯代码各有各的账要算。
9个站分别自称用的是:两个静态站生成器、两个前端框架、三个内容管理系统、一个电商框架、还有一个填的是内部代号,外人完全看不懂那是什么。
换算成比例是6.6%。也就是说,九成三的站根本懒得回答“你是用什么建的”这个问题。这不奇怪,因为回答了也没好处,不回答也没坏处。典型的自填字段命运。
旁证的比例:82.4%
但是,不回答不等于查不出来。
自称可以被冒用,品牌被仿冒抢排名的五步应对是它最坏的一种后果。
旁证优先在日志层同样成立,每五次Googlebot抓取就有一次IP不属于谷歌。
建站平台会在页面上留下大量痕迹:资源路径的前缀、静态文件的域名、特定的类名、初始化脚本的变量名。这些东西不是给外人看的,是系统自己要用的,所以没人会去清理。
把十几种主流平台的特征串写成规则,扫一遍那136份快照,能认出至少一种平台的有112个站,占82.4%。其中能同时认出两种技术栈的有15个(典型情况是电商后端配一个现代前端框架),只有24个站什么都没认出来。
| 路径 | 覆盖站数 | 比例 | 数据来源 |
|---|---|---|---|
| 页面自己声明 | 9 | 6.6% | generator字段 |
| 从痕迹推断 | 112 | 82.4% | 资源路径与脚本特征 |
6.6% 对82.4%,差12.5倍。观察者需要知道的事,早就不靠你告诉他了。
有意思的是,填了的那9个其实都很诚实
这里有个反直觉的发现。既然这一栏没人管,会不会有人乱填?
页面到底给出了什么,拿样本页跑一遍语义化HTML就知道。
自称与实际对不对得上,渲染对比器能揪出爬虫和用户看到的差异。
结果是没有。9个填了的站里,8个能被痕迹独立确认——它说自己用某个静态站生成器,页面上确实有那套生成器特有的数据目录;它说自己用某个内容管理系统,页面上确实有那套系统的设置脚本。剩下1个填的是内部代号,没法对照,但也谈不上撒谎。
其中一个站的组合特别有意思:它自称用某个静态站生成器,而痕迹显示它同时挂着一套电商后端。两条信息都对,只是各说了一半。
这个发现值得停一下。自填字段的问题从来不是“大家都在撒谎”,而是“大家都懒得填,于是它作为信号毫无覆盖率”。一个只有6.6% 覆盖率的字段,就算100% 真实,观察者也不可能拿它当判据。水印面临的是同一个困境:就算它准确无误,覆盖不到的地方仍然是大多数。
插一句:这次的尺子自己先失效了一次
这次测量里翻过一次车,值得写下来,因为它正好是同一个逻辑的反面教材。
工具口径不一致时该信谁,收录数据到底信site命令还是信后台做过一次三源校准。
第一版规则跑完,某个老牌电商系统的识别率高达92.6%,一百多个站全中。这个数字荒谬到不用验证就知道错了——那套系统在DTC品牌里根本不是主流。
查了一下,原因很低级:特征串里写了一个三字母的片段,而这个片段恰好是image这个词的一部分。凡是页面上出现过图片路径的站,全部被误判。修掉之后,真实识别率是2.9%,四个站。
从92.6% 掉到2.9%,全是尺子本身造成的。这件事的教训不是“要小心正则”,而是:当你用旁证去替代自述时,旁证本身也需要被验证一次。否则你只是把“相信对方的自称”换成了“相信自己的规则”,可靠性未必更高。
顺带说,第一版还有一个更隐蔽的错误。原本统计了“自称与痕迹对不上”的比例,结果是9个里9个都对不上,看着像个重磅发现。实际上是因为那9个站自称的平台,压根不在第一版的特征表里——它们说的是真话,只是工具不认识而已。把特征表补全之后,对不上的从9个变成0个。一个纯粹由测量工具造成的假结论,差点就写进结论里了。
这两个错误的形态不一样,但根子是同一个:旁证之所以可靠,前提是你认得全。认不全的时候,旁证给出的不是“不知道”,而是一个错误的确定答案。这一点在做任何自动化审计时都值得警惕,工具不会告诉你它有盲区,它只会给你一个数字。
还有哪些字段正在走同一条路
把视野放宽,可以看到一批字段处在这条路的不同阶段。
没有头部标签的地址怎么表态,接口和订阅源拿什么说自己不想被收录。
noindex是少数仍被照办的自填指令,加上之后多久从结果里消失实测过六种场景。
已经走完的:页面自称的关键词、自称的更新频率与优先级、自称的内容评级。这些现在写不写都一样,早就没有权重了。
正在走的:页面自称的正式地址。搜索引擎会参考你的声明,但它有自己选定的一版,两者不一致时以它的为准。这就是典型的“你的自填从判据降级成建议”。
正在走的:页面自称的语言与地区。观察者完全有能力读一读内容自己判断,你填的那个值更像是一个提示而不是事实。
还没开始走的:内容的作者与创作时间。到今天为止,几乎没有任何独立核验手段,所以你写什么就是什么。水印是第一次有人试图撬动这一栏。
规律很清楚:一个字段能撑多久,取决于旁证什么时候变得足够便宜。当读懂一整页内容的成本高到不现实时,语言标记是有用的;当机器能轻松读懂全文之后,它就变成了参考。
按这个规律推,作者这一栏的自填期限,取决于什么时候出现一种低成本的创作过程核验方式。水印显然还不是,但它是一个信号:有人已经开始惦记这一栏了。
对日常工作的一个直接推论
这套观察可以变成一条很实用的判断:当你要决定某个字段值不值得花力气去优化时,先问问它属于哪一类。
把内容当结构化数据来生产,这门新手艺正好接住这条推论。
落到动作上,结构化数据怎么配合SEO落地那份避坑清单可以对着改。
如果它是一个观察者有能力自己判断的字段,那你的工作重点应该放在让内容本身对得上,而不是把标记写得多漂亮。语言标记写得再规范,内容写得不像那个语言,一样白搭。
如果它是一个观察者暂时没法判断的字段,那这一栏就是你为数不多能主动提供信息的地方,值得认真填,而且要填得能被交叉验证——填一个别人可以顺着查下去的值,比填一个漂亮但封闭的值有用得多。
这两条加起来,其实就是一句话:你能贡献的信息价值,等于观察者自己拿不到的那部分。其余的都是重复劳动。
文章页上的署名,两处自填字段能对上吗?
首页说的是公司身份,文章页说的才是内容来源。既然主题是“这段内容谁写的”,那就得看文章页。
高风险行业对署名的要求更硬,YMYL怎么靠E-E-A-T稳住排名。
署名要被认可是有前置条件的,作者署名怎么做才被谷歌和AI认可列过六个信号。
样本比预想的小,原因得先说
本来想抓两百篇。实际操作时撞了一堵墙:从187个站里能识别出内容板块入口的有72个,抓到列表页的53个,再往下钻到具体文章页时,大批站开始返回限流状态码。降速到每次间隔四秒、换个身份重试,仍然是全军覆没——说明那不是速率问题,是这个出口地址已经被长期标记了。
被限流这件事有两面,拦AI爬虫怎么才不误伤Googlebot是站方视角的同一个问题。
最后拿到手的是13个站的26篇文章。样本小,所以下面的数字只当观察不当统计,比例都用绝对数写出来,方便你自己判断分量。
两处都写了作者的,26篇里只有4篇
一篇文章要说清楚谁写的,通常有两个地方:一个是页面上肉眼可见的署名,一个是结构化数据里的author字段。前者给人看,后者给机器看。理想情况下两处一致。
调试这类不一致,把JSON-LD调试这件事讲透里有顺手的工具。
两处不一致往往是插件和主题各写一份,两个规范网址两套结构化数据怎么归一。
| 情形 | 篇数 | 说明 |
|---|---|---|
| 可见署名与机器可读署名都有 | 4 | 唯一算完整的情况 |
| 只有可见署名,机器读不到 | 6 | 人看得见,程序看不见 |
| 只有机器可读署名,页面上看不见 | 4 | 程序看得见,读者不知道 |
| 两处都没有 | 12 | 接近一半 |
26篇里12篇两处都没有,占了将近一半。这些不是随便找的小站,是有正经内容板块、专门做内容营销的品牌。
更值得看的是中间那两行。有4篇文章在结构化数据里写着某个人的名字,页面上却一个字都不显示。其中两篇来自同一个智能家居品牌,署的是同一个人;另外两篇来自一个户外装备品牌,署的也是同一个人。读者读完全文都不知道作者是谁,只有爬虫知道。
反过来的6篇也一样别扭:页面上明明白白印着作者名,机器读的那份数据里却没有这个人。同一件事,在同一个页面上有两个版本的答案,取决于你是人还是程序。
署名栏里填的不一定是人
还有一个细节。26篇里有2篇的author字段填的是品牌名本身——不是某某,就是品牌自己的名字。
品牌当作者也不是全无道理,品牌力到底算不算排名因子有实证可看。
作者名这件事在小语种市场更复杂,本地媒体里早就有另一种拼法。
这在技术上完全合法,一个组织确实可以作为作者。但它把“谁写的”这个问题原地消解了:你问是谁写的,答案是“本公司”。这和不回答的区别不大。
把这个现象和水印那件事并排放,就有意思了。一边是模型厂商花力气给内容打上无法察觉的记号,试图让来源变得可追溯;另一边是内容发布方在明明可以写清楚作者的字段里,填了一个等于没填的答案。两头使的劲儿方向相反。
时间戳这一栏也没好到哪去
顺便看了发布时间和修改时间。26篇里有12篇写了发布时间,8篇写了修改时间。
时间之外还有版本问题,决定收录哪一版的可能是十分钟前路过的那个用户。
时间字段的坑不止一处,从站点地图的更新时间到结构化数据的日期都得对得上。
写了修改时间的这8篇里,有几个组合值得看。一篇发布于2020年1月,修改时间标到2025年4月,中间隔了五年多。一篇发布和修改是同一天。还有一篇发布于8月12日,修改标在8月14日,两天之内改过。
这几个时间戳的可信度完全不同,但页面上一视同仁地写着,没有任何办法区分哪个是真改过、哪个是模板自动刷的。时间戳是另一个典型的自填字段:改一个数字的成本是零,而它承担的信任却不小。
顺带一提,只有4篇的作者名是可以点开的——链到一个作者页,上面有这个人的其他文章。剩下的作者名只是一串文字。能点开的那一下,是整条署名链路上唯一带一点核验意味的动作。
把署名做对,其实只有四步
既然大多数站在这一层是空的,那把它补上就是一个成本很低的差异化动作。四步就够。
作者体系可以和知识库一起搭,帮助中心的索引控制与AI引用。
一手观点比汇总更值钱,专家观点汇总还值不值得做给过明确判断。
第一步,页面上和结构化数据里写同一个名字。听起来是废话,但前面26篇里做到的只有4篇。最常见的失败是内容管理系统里填了作者,模板没把它输出到页面上;或者反过来,模板里硬编码了一个署名,数据里是空的。
第二步,让这个名字可以点开。作者页上放这个人的简介、专业背景、其他文章。这一页的作用不是给读者看的(说实话没几个读者会点),是给机器一个可以聚合的对象。
第三步,在作者信息里给出对外可查的轨迹。这个人在别处的公开身份——行业协会的会员页、公开演讲的记录、发表过的东西。这一步的逻辑和sameAs完全一样:用一个你控制不了的地方,来支撑你控制得了的地方。
第四步,别在一个人身上堆全站内容。见过一些站为了做作者体系,把三百篇文章全挂在同一个人名下,那个人一天要发两篇。这种做法在数据上一眼可见,反而制造了新的可疑点。宁可留白,别造假。
时间戳该怎么处理才不给自己挖坑
修改时间这一栏,可以简单粗暴一点:要么认真维护,要么干脆别输出。
旧内容要更新就认真更新,让旧版变成AI可信来源的12步。
新鲜度要做成真的,内容新鲜度的五条实战法则说的是怎么改而不是怎么刷。
最糟的做法是让它自动跟着任何一次数据库写入更新。这样一来,改个标签、调个分类、系统跑个批量任务,时间戳就往前跳一次。页面内容一个字没变,机器看到的却是“这篇一直在更新”。
短期看这样似乎有利,长期看是在消耗信任。一个总在更新却从不变化的页面,和一个从不更新的页面,前者更容易被降低权重,因为后者只是陈旧,前者是不诚实。
正确的做法是把内容层面的实质修改和数据层面的写入区分开,只有前者才刷新对外输出的修改时间。多数内容管理系统都能做到这一点,只是默认配置往往不是这样。
那内容团队现在应该做什么,不应该做什么?
讲了这么多机制和数据,落到手上得有动作。先说不应该做的,因为踩坑的成本更高。
顺带一提,自己写内容夸自家产品AI买不买账用9886条答案给过结论。
三件不值得做的事
第一,不要去买号称能检测AI水印的工具。理由前面说过,密钥不在第三方手里,它检测的是别的东西。真到了需要的时候,官方接口会开放,那才是唯一可信的来源。在此之前掏钱买的,大概率是一个包装成新概念的旧检测器。
投机路子的代价越来越高,站点声誉滥用与寄生SEO的三方防御。
另一类风险是被投毒,三条攻击路径与三层防御值得提前看一眼。
买工具之前先分清路数,白帽做法与快排服务商怎么辨别有一份判据。
第二,不要在页面上加“本文非AI生成”这类声明。这句话本身就是自填字段,没有任何核验价值;更糟的是它会引起注意,让读者开始琢磨你为什么要特意说明。真正需要披露的场景由法规和平台规则界定,不需要你自己发明一套。
第三,不要为了躲检测去做无意义的改写。把通顺的句子改拧巴,把准确的表述改模糊,只为了让某个分数下降——这件事在SEO行业里已经上演过好几轮了,每一轮的结局都一样:分数确实降了,内容也确实变差了,然后过一阵检测口径一变,白折腾。
三件现在就该做的事
第一,把过程留痕这件事变成流程的一部分。这是最有价值的一条,也是前面那个咖啡器具客户的经历给出的答案。写作过程中的版本记录、修改时间线、素材来源清单、访谈录音、原始数据表——这些东西的共同特点是伪造成本远高于伪造一段文字,因而反过来具备了证据价值。
信号强化有具体做法,E-E-A-T信号怎么把引用率从12%做到67%。
一手材料本身就是资产,把数据做成持续吸外链的磁铁讲的是同一件事的另一面。
实操上不需要多复杂。文档工具本身就带版本历史,别关掉;素材和一手数据存在固定位置,别每次换地方;重要的稿子留一份提纲原件。真到了要自证的那天,你拿出来的是一条时间线,不是一个分数。
第二,把可核验的实体字段补齐。就是前面那条曲线掉得最狠的那几栏。具体到动作:法定名称写上,联系方式写上,地址写上,如果有第三方条目就在sameAs里指过去。
这几栏不会给你带来任何肉眼可见的排名提升,短期看毫无回报。但它们是你的页面上仅有的几个能被外部独立确认的锚点,在生成式引擎越来越挑来源的今天,这个价值只会往上走,不会往下走。
第三,让作者成为一个真实存在的对象。不是随便署个名,而是让这个名字能点开、有页面、有其他作品、有可核对的背景。前面那26篇里只有4篇做到了这一点。
| 动作 | 成本 | 短期回报 | 可核验性 |
|---|---|---|---|
| 买检测工具 | 高 | 无 | 无 |
| 页面加非AI声明 | 低 | 负 | 无 |
| 为躲检测改写 | 中 | 负 | 无 |
| 保留写作过程留痕 | 低 | 无 | 高 |
| 补齐实体核验字段 | 低 | 低 | 高 |
| 建立可点开的作者体系 | 中 | 中 | 中高 |
这张表里的规律很清楚:短期回报和可核验性是两条不同的曲线,而大多数团队只跟着第一条走。前面那136个站的字段填写率,就是这个选择在数据上的样子。
工作流排一排,误伤概率能降不少
前面说过,最容易被冤枉的是那种“人写完让模型润色”的用法。这个问题其实可以靠调整工序来缓解,而且调整之后内容质量通常还会变好。
让它提意见而不是替你写,SEO写作提示词的四大类模板里有可直接改用的问法。
常见的工序是:人写初稿,模型润色,直接发布。问题出在最后一步——模型的输出成了定稿,所以定稿里带着完整的记号。
换个顺序:人写初稿,模型给修改意见而不是改写文本,人根据意见自己动手改,然后发布。这样定稿的每一个字都出自人手,模型的作用退回到编辑顾问的位置。
这个调整听起来只是换了个用法,实际效果差别不小。让模型直接改,你拿到的是一个看起来更顺但失去个人痕迹的版本;让它提意见,你拿到的是问题清单,改不改、怎么改由你决定。前者是替你写,后者是帮你看。
翻译场景也有类似的处理办法。如果目标语种你有基本判断力,可以让模型出译稿,然后自己逐段核对修订,把最终定稿变成人工产物。如果完全不懂那个语种,那就老老实实认下来——译文由机器完成是事实,没必要遮掩,重要的是原文那一份站得住。
什么情况下应该干脆放弃自证
还有一种情况值得单独说:有些场合的自证要求本身就是不合理的,硬去满足反而吃亏。
有些问题不在SEO这一层,流量暴跌的七大元凶里能对号入座。
跟法务对齐口径有章可循,法务与SEO协作的七个动作点。
判断标准是看对方要的是什么。如果对方要的是“过程可查”,那是合理要求,值得配合。如果对方要的是“保证百分之百没有机器参与”,那是一个技术上无法验证、法律上无法承诺的东西,签下去就是给自己埋雷。
遇到后者,正确做法是把它翻译成前者:明确说明工具在流程里用在哪一步、不用在哪一步,提供可查证的过程材料,同时拒绝那句无法验证的绝对承诺。把不可核验的承诺换成可核验的说明,这既是保护自己,也是在教对方怎么提要求。
这套沟通方式在实践中很有用,尤其是对接欧美客户的合规部门时。他们真正需要的是一份能归档、能应对审计的说明,而不是一句空头保证。
如果只能做一件事,做哪件
做第一件,过程留痕。
流程能自动化就别靠自觉,用工作流把独立站SEO自动化的四个场景可以直接套。
理由是它同时解决三个问题:客户或渠道方要求自证时你拿得出东西;内部对稿子质量有争议时能追溯是哪一步走偏了;将来任何一种新的来源核验机制出现时,你的原始材料都还在。而另外两件事都只解决一个问题。
更实际的理由是它不花钱。补字段要开发排期,建作者体系要人力,而留痕只需要不删东西。
最小可行的留痕方案长什么样
怕的是一说留痕,就有人去搭一套复杂系统,最后没人用。给一个真正能跑起来的最小方案。
日志本身也是一种留痕,五千站的爬虫伪造与抓取预算实战。
归档这类事交给定时任务最稳,用cron把备份、站点地图与日志一条龙。
一个固定的目录,按年月分文件夹。每篇内容一个子文件夹,里面放三样东西:提纲的第一版、用到的原始素材(数据表、截图、访谈记录)、定稿。命名规则统一,别用中文空格和特殊符号。
文档工具的版本历史别关。主流的在线文档默认就有,什么都不用做,只要别为了省空间去清理。这一条几乎是零成本,却是整套材料里时间线最完整的部分。
一手数据的原始文件单独存。如果内容里有你自己跑的测量、自己整理的表格,把原始文件和处理脚本一起留下。这个东西的说服力最强,因为别人可以拿去复算。
| 留什么 | 存在哪 | 需要额外做什么 |
|---|---|---|
| 提纲第一版 | 内容目录 | 写完顺手另存一份 |
| 版本历史 | 文档工具自带 | 不清理即可 |
| 原始数据与脚本 | 内容目录 | 跑完别删 |
| 沟通与访谈记录 | 内容目录或邮箱 | 归档时带上 |
| 发布前后的截图 | 内容目录 | 发布时截一张 |
整套东西的维护成本大概是每篇多花五分钟。五分钟买的是:任何时候有人质疑来源,你有一条完整的时间线可以摆出来。这个交换非常划算,尤其是在做外贸和出海业务、合作方合规要求越来越细的当下。
留痕还有一个附带好处
这一条不在原计划里,是做着做着发现的:留痕会显著提高内容复用的效率。
素材够了就好办,清单体文章怎么写才能拿排名又被引用。
复用要成体系,内容再利用地图怎么画能把一篇主资产拆成十种。
因为原始材料都在,半年后想把一篇长文拆成几条社媒内容、或者把当时的数据更新一版重发,不用从头再来。相反,如果只留了最终的成品,等于每次复用都要重新做一遍研究。
这也是建议把留痕当成流程而不是当成合规动作的原因——纯粹为了合规做的事,团队执行不下去;顺手能提高效率的事,才留得住。
AI搜索会怎么对待这些记号?
这是所有做GEO和AEO的人真正关心的问题,而诚实的答案是:没人知道,因为没有一家平台表过态。
谁在被引用其实是可以查的,一亿条引用数据看清被引源榜单。
目前的公开状态
把已知信息摆一摆。模型厂商这边,文本标记刚刚落地,配套的检测接口还在路上。搜索平台这边,没有任何一家公开说过会把标记纳入排序或引用的考量。中间还隔着一层:搜索平台要用这个信号,得先能读懂它,而读懂需要模型厂商开放能力。
有一条路其实已经开了,怎么被用户标成优先来源。
平台的边界表态值得逐字读,谷歌给第三方工具和GEO划的信任边界。
所以短期内,这个信号在搜索侧是不存在的。任何声称“带水印的内容会被降权”的说法,现在都没有依据。
往前推,可能走哪两条路
往前推有两种可能,而且它们的后果差别巨大。
不管走哪条路,小品牌都得单独想办法,AI搜索的大品牌偏见与六条突围路径。
官方指南已经叫停过几个动作,AEO和GEO到底还是不是SEO那篇整理过。
第一条路,标记被当成披露信号使用。也就是平台读到标记后,在结果里标注“此内容可能由AI辅助生成”,把判断权交给用户。这条路对内容方影响有限,因为标注不等于降权,而且覆盖率问题会让标注本身显得随机——同样是AI写的,改过的没标注,没改的标注了,用户很快会发现这个标注不可靠。
第二条路,标记被当成质量信号的输入之一。这条路麻烦得多,因为它会把前面说的所有偏差放大:认真改写的人漏网,老实用工具的人被算进去,短文案全部免检。一个偏差如此明显的信号,被当成质量输入是不负责任的,倾向于认为主流平台不会这么做。
还有第三种可能,也是概率最高的:标记主要在合规和版权场景里被使用,搜索侧基本忽略它。因为搜索平台已经有更好用的判据了——它能看到内容的实际表现、引用情况、用户行为,这些信号比一个覆盖率不完整的标记有用得多。
对GEO实操的三条影响
不管走哪条路,有三件事现在就可以确定。
挑源的内部字段被人扒出来过,定价页解析不了它就转头引第三方。
被检索和被引用要分开打,这两套打法怎么分讲得比较细。
一是来源可核验性的权重会往上走。生成式引擎在组织答案时需要给出出处,而给出处就要承担风险,因此它会偏好那些身份清楚、可以追溯的来源。这跟内容是不是AI写的没关系,跟“你是谁、能不能被查证”关系很大。
二是一手材料的价值会继续放大。模型能生成的东西不构成差异,模型生成不出来的东西才构成差异。自己跑的测量、自己的客户数据、自己踩的坑,这些既是内容护城河,也恰好就是过程留痕的天然产物。
三是同质化内容的处境会更难,但原因不是水印。是因为当答案可以被直接生成时,一篇没有任何独有信息的综述文章,存在价值本来就在下降。关于这套文本标记方法本身的技术讨论里有一句话说得挺好:真正的问题不是用了AI,是用它做出了更差的东西。
三条路各自该怎么应对
与其猜哪条路会发生,不如准备一套无论哪条路都不吃亏的做法。
准备好了也要能测,引用率监控闭环的四步含工具选型。
面对还没定的规则,AI搜索可见度的六个预测里也说清了哪些该打折。
| 如果走这条路 | 受影响最大的是 | 你该提前做的 |
|---|---|---|
| 标记当披露信号 | 纯生成、未经改写的内容 | 保证发布前有实质编辑环节 |
| 标记当质量输入 | 长文占比高的站 | 把一手材料密度提上去 |
| 搜索侧基本忽略 | 没有人受影响 | 什么都不用改 |
看这张表会发现一件事:三条路要求你做的准备高度重合,都是“别直接把生成结果发出去”和“让内容里有别人没有的东西”。这两件事本来就该做,跟水印无关。
这也是不建议为这件事专门调整策略的原因。凡是需要你为某个尚未确定的规则专门做一套动作的建议,多半都是在贩卖焦虑。真正稳的做法永远是那几条,只是它们不够新鲜,所以没人愿意反复说。
顺便说说被动引用这件事
还有一个角度容易被忽略:你的内容被别人喂给模型之后会怎样。
说错了还能纠,从溯源到纠错的完整流水线。
原创归属被顶掉怎么办,谷歌怎么判定原创内容有过一次系统梳理。
现在的常见场景是,别人把你的文章丢进模型让它总结,或者要求它改写成另一种风格。输出的那份东西会带上模型的记号,而内容来源是你。
这意味着未来可能出现一种奇怪的情形:市面上流传的、带着机器记号的文本,实际内容源头是你写的原创。如果哪天有人凭记号来判断原创归属,方向就完全反了。
目前还没有成熟机制处理这个问题,能做的只有一件事:让你的原始版本在公开渠道有更早、更清晰的时间痕迹。正常发布、正常被收录、正常有外部引用,这条路径本身就是最好的原创声明,比任何标记都可靠。
如果客户明天就要你证明“这是人写的”,你拿得出什么?
这一节把前面所有东西收成一份可操作的清单。场景很具体:合作方、平台方或者客户法务,要求你为一篇已经发布的内容提供来源说明。
可核验这件事有个很直观的例子,九条查得到出处八条数字对不上。
拿不出手的四样东西
先排除掉没用的。
拿不出手的东西通常也换不来记忆,该盯的其实是品牌识别度。
举证门槛由措辞决定,一句比较级要你拿出整套对比测试。
第三方检测器的报告拿不出手,因为对方也可以跑一个,结论未必一样。页面上的作者署名拿不出手,因为那是你自己写的。发布时间戳拿不出手,同上。“我们公司规定不许用AI”这类制度文件也拿不出手,制度证明不了具体这一篇。
这四样恰好是大多数团队第一反应会拿出来的东西。它们的共同点还是那句话:全是自己说的。
拿得出手的五样东西
| 材料 | 为什么有说服力 | 准备成本 |
|---|---|---|
| 版本历史时间线 | 伪造要重建整条修改轨迹 | 不删就有 |
| 原始素材与数据文件 | 数据本身可被复算 | 存起来即可 |
| 访谈或沟通记录 | 涉及第三方,单方伪造困难 | 随手保存 |
| 可追溯的作者身份 | 有对外可查的公开轨迹 | 需长期积累 |
| 内容里的独有事实 | 只有做过的人才写得出 | 做事的副产品 |
证据要变成机器读得懂的,从交付现场到机器可读有完整路径。
原始出处一直在被悄悄奖励,原创报道到底指什么梳理过这条线。
最后一样最容易被忽略,但它的分量最重。一篇文章里如果有别处查不到的具体数字、具体过程、具体失败,这件事本身就是最强的来源证明——因为模型编不出你没做过的测量,而做过测量的人一定留得下痕迹。
这也是这几年写东西越来越偏向自己动手量一遍的原因之一。一开始是为了内容差异化,后来发现它顺带解决了可信度问题,现在看,它还顺带解决了来源自证的问题。
把这份清单反过来用
最后一个角度。上面这份清单,你也可以拿去衡量别人。
评估别人这件事早有范本,质量评估手册怎么读那套打分逻辑值得借。
评估工具也用同一套问法,二十款GEO监控工具的选型对照可以直接拿来试。
当你评估一个信息源值不值得引用、一家服务商的案例可不可信、一份行业报告的数据要不要采信时,问的是同一组问题:这里面有没有一条是外部可以核验的?有没有具体到能被复算的数字?作者是不是一个可以查到的人?
这三问不需要任何工具,也不受任何技术变化影响。水印会迭代,检测器会更新,平台政策会反复,但“可核验的东西比自称的东西可信”这条判据不会变。
拿它去挑供应商,比拿它去挑内容更有用
这套判据最实用的场景其实是选人选服务商,因为那里的信息不对称最严重。
挑完还要会拆,四层逆向把对手拆透变成自己的行动清单。
服务商的风险还会连坐,最该防的是被服务商牵连降权。
做外贸和独立站的团队,每年都要评估一堆服务方:内容代理、建站商、投放公司、数据工具。对方的宣传材料里通常有三类东西——案例、数据、资质。用可核验度过一遍,立刻能分出层次。
案例里有没有可以自己去看的站?说做过某某品牌,那个站现在在不在,能不能看到当时的痕迹。说不出具体域名的案例,价值接近于零。
数据是自己报的还是能对上公开来源的?说帮客户提升了多少流量,这是自报;说某个关键词现在排在第几,这是可以当场搜的。前者听听就好,后者可以验。
资质是发证机构可查的吗?很多所谓认证,发证方的官网上根本没有可查询的名录。可查的和不可查的,中间隔着的正是这篇文章说的那条线。
用这三问筛一遍,通常能砍掉大半候选,而且砍得有理有据。更重要的是,这个过程会反过来教你怎么包装自己——你希望别人用什么来判断你,就先把那些东西准备好。
最后留一个问题给读者
写完这篇,其实有个问题一直没有答案,放在这里当作结尾。
下一个周期的筹码在哪,被引用一次到底顶多少条传统外链给过一次估算。
窗口期什么时候关上不好说,上一次这样的空场被围起来是在2013年。
如果有一天,来源核验真的变成了排序或引用的重要因素,那么先做这件事的人是拿到红利,还是白白多花力气?这取决于变化什么时候来、来得有多突然。
能确定的只有一点:补齐可核验信息这件事,成本很低,副作用为零,而且它在任何一种未来里都不会变成负资产。相比之下,为躲避某个检测而做的改动,几乎在每一种未来里都会作废。
在不确定性这么高的时候,选那些无论如何都不亏的动作,本身就是一种策略。
一份能拿出手的说明长什么样
把上面的东西组装起来,一份合格的来源说明大概是这样的结构,一页纸就够。
别把它写成口号,E-E-A-T怎么落到可执行清单。
对外交付的文档能模板化,SEO月报季报的模板与数据管线可以借它的结构。
开头一段讲流程:这篇内容由谁负责,经过哪几个环节,各环节分别做了什么,是否使用了辅助工具以及用在哪一步。这一段要写得具体到动作,别写成制度条文。
中间一段列证据:版本记录的时间跨度和修改次数、原始素材清单、一手数据的采集方式与时间、可对外核对的引用来源。每一条都要能应对一句追问——如果对方说“给我看看”,你拿得出来。
结尾一段讲边界:明确说清楚哪些部分使用了辅助工具、程度如何。这一段反而最能建立信任,因为在今天的环境里,声称完全没用过任何工具,可信度不如坦率交代用在了哪里。
保哥给客户处理过几次类似的要求,能过关的那几份都有一个共同点:它们回答的是“这篇是怎么做出来的”,而不是“这篇不是AI写的”。前者是可查证的事实陈述,后者是一句无法被验证的断言,而对方要的从来是前者。
最后回到那136个站
写完这一圈,再看那条从94.0% 掉到1.2% 的曲线,感受和刚拿到数据时不太一样了。
投入产出算不清的时候,零点击时代品牌影响力怎么衡量能补上一半答案。
真要填法定标识,美国税号怎么申请是绕不开的第一步。
它其实不是在说这些品牌不严谨。恰恰相反,它们在每一个能带来回报的字段上都填得很认真——名称、网址、标志、社交主页,一栏不落。它们只是理性地跳过了那些只承担义务、不带来回报的字段。
问题在于,随着答案越来越多地由机器组织,判断来源可不可信这件事的权重正在上升,而所有人在这一层的储备都接近于零。这既是风险,也意味着这一层的竞争几乎不存在。
说到底,8月2日那件事真正的价值不是给了行业一个新工具,而是逼着所有人重新面对一个一直被绕开的问题:关于来源,我们习惯性地相信页面自己说的话,而页面从来没有义务说真话。
常见问题解答
Claude的水印能被普通用户检测出来吗?
目前不能。这个记号是一种统计模式,识别它需要一把只有模型提供方掌握的密钥。官方说过会开放检测接口,但在此之前,任何第三方工具都没有能力真正读取这个记号。市面上号称能检测的产品,实际检测的是文本困惑度、句式规整度这类旧指标,与水印本身无关。
把AI写的稿子人工改一遍,水印还在吗?
取决于改动幅度。轻度编辑,比如改标点、调个别词,记号大概率还在;把每个词都换掉的彻底重写,记号会消失。但这里有个悖论:当一段文字被逐词改写之后,它是否还算机器生成的内容,本身就成了问题。另外要注意反方向的风险,人工从头写的稿子如果被大幅改写过,在测试中有相当高的比例会被误判成带记号。
没检测出水印,能证明内容是人写的吗?
不能,而且这个方向的漏洞更大。官方列出的五种测不出的原因里,只有一种对应“确实是人写的”,其余四种分别是模型版本太老、改动幅度太大、文本长度不足200个token、格式转换过程中丢失。更根本的是,用别家模型生成的内容压根不在这套标识体系里,扫也扫不出来。
带水印的内容会被搜索引擎降权吗?
目前没有任何证据支持这个说法,也没有平台公开表过态。已有的统计显示,排名靠前的页面里完全由AI生成的约占5.3%,AI含量高的页面收录比例是40%,含量低的是49%,差距存在但远达不到惩罚的程度。更合理的解释是筛掉的是质量而不是来源。
我的独立站需要在页面上声明内容是否由AI生成吗?
欧盟法案里那条机器可读标识的义务落在提供模型的一方身上,不是使用者。使用者是否需要披露,取决于内容形态、所在行业和具体平台规则,不能一概而论。不建议主动在页面上加“本文非AI生成”这类声明,它既没有核验价值,又容易引起不必要的注意。
结构化数据里的author字段填品牌名可以吗?
技术上合法,一个组织确实可以作为作者。但从来源核验的角度看,这等于没有回答“谁写的”这个问题。更好的做法是让作者成为一个真实存在的对象:有名字、有可以点开的页面、有其他作品、有可对照的公开背景。在抓到的26篇文章里,做到这一点的只有4篇。
如果客户要求提供“非AI生成”的证明,我该给什么?
给过程,不要给结论。有说服力的材料是版本历史时间线、原始素材与数据文件、访谈或沟通记录、可追溯的作者身份,以及内容里那些别处查不到的独有事实。检测器报告、页面署名、发布时间戳、公司制度文件这四样都拿不出手,因为它们全都是自己说的。
权威参考资料
本文标题:《AI水印怎么检测?测到不等于它写的,测不到也不等于不是》
本文链接:https://zhangwenbao.com/ai-watermark-detection-authorship-self-declared.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0