Google-Extended挡不住AI概览:77家法国媒体,84%的摘要授权没设上限
本文目录
- 法国媒体在抓取规则里挡了谷歌的AI,挡住的是哪一个?
- 页面上那行“摘要不限长”,是哪一年写下的?
- 这行授权现在管到了哪里?
- 77家实测,摘要授权写成了什么样?
- 一半的写法,是模板和插件写的
- 没写摘要长度指令的那7家
- 挡了Google-Extended又不限摘要的,有多少家?
- 真想让AI概览少用正文,要付什么代价?
- 签了授权协议的,页面上的设置还算数吗?
- 规则文件里看得出谁和谁签了约
- 《世界报》说流量没掉,这句话量的是哪一层?
- 这次测量漏了哪些?
- 做中文站和出海站的人,能从这里带走什么?
- 常见问题解答
- 在抓取规则里屏蔽Google-Extended,能阻止内容进入AI概览吗?
- 哪些设置会影响AI概览使用我的内容?
- 页面上写着摘要长度为-1是什么意思?
- 一个页面写了两个不同的摘要长度,以哪个为准?
- 和谷歌签了新闻授权协议,页面上的摘要设置还有用吗?
- 这个结论对中文站适用吗?
- 为什么这次有21家媒体没测到?
- 权威参考资料
摘要:法国发行审计机构八月排行里的98个媒体品牌,能测到页面的77家中,65家的文章页写着摘要长度不设上限,新闻类39家里占35家。能取到抓取规则文件的74家里,33家在规则里挡住了谷歌的AI训练令牌,其中30家的页面仍然允许不限长摘要。谷歌文档写得清楚:那个令牌不影响搜索,而摘要长度设置直接决定正文能被AI概览拿去多少。这行授权大多是2019年法国邻接权法生效时为了保住搜索摘要写下的,14家页面上带着同一款SEO插件的默认写法。
2026年7月22日,AI概览和AI模式在法国上线。三周后,法国综合新闻出版联盟向竞争管理机构提起申诉,理由之一是出版商被放到了一个两难的位置:要么接受对现有授权合同的一次简单更新,要么做技术性退出,代价是在搜索里失去可见度。
“技术性退出”具体指什么,这件事值得落到页面上去看。这篇把法国主流媒体的抓取规则文件(robots.txt)和页面头部的摘要指令(robots meta里的max-snippet等)一家家翻出来,看它们挡了什么、放了什么,以及挡住的那个东西,到底管不管得到AI概览。
站内搜索控制台里屏蔽AI的几种开关各管什么已经把控件逐个讲过,那篇是说明书;这篇是把说明书拿到一个真实行业里对账,而这个行业恰好在2019年就被这些开关改写过一次。
法国媒体在抓取规则里挡了谷歌的AI,挡住的是哪一个?
样本来自法国媒体发行与流量审计机构ACPM公布的2026年8月数字品牌排行,这份排行里受审计的数字媒体品牌当月合计74亿次访问。从排行前175名里,剔除社交平台、分类信息网站这类非媒体,挑出98个有独立网站的媒体品牌,按内容分成三组:新闻类54个(全国性23个、地方报26个、财经5个),服务类29个(生活方式、健康、科技、汽车、育儿、美食等),其他15个(文化、娱乐、体育、财经资讯)。
先看抓取规则文件。98家里有81家能正常取回,按“对整站根目录禁止”来判断(只挡部分目录的不算,站内两条规则撞车时谁赢讲过为什么不能只看第一行),各类AI爬虫令牌被挡的家数是:
| 令牌 | 归属与用途 | 81家里整站挡住的 |
|---|---|---|
| CCBot | Common Crawl公开抓取 | 48 |
| GPTBot | OpenAI训练抓取 | 38 |
| Google-Extended | 谷歌AI训练与Gemini应用的内容使用许可 | 37 |
| ClaudeBot | Anthropic抓取 | 31 |
| PerplexityBot | Perplexity抓取 | 26 |
| Applebot-Extended | 苹果AI训练许可 | 20 |
| Meta-ExternalAgent | Meta抓取 | 18 |
| OAI-SearchBot | ChatGPT搜索抓取 | 16 |
| Googlebot | 谷歌搜索抓取 | 0 |
挡谷歌搜索爬虫的是0家,这很好理解,没有媒体愿意从搜索里消失。有个细节:不少站给AI令牌单独开了分组,而分组之间不会互相继承,给某个令牌开了专属分组,通用规则就不再管它,所以判断挡没挡必须按令牌逐个查。挡Google-Extended的有37家,分组看差别很大:能测到页面的新闻类36家里29家挡了它,服务类24家里一家都没有。
问题出在Google-Extended管的范围上。谷歌爬虫文档对它的定义是:用来控制谷歌抓到的内容能否用于训练未来的Gemini模型,以及能否在Gemini应用和Vertex AI里做实时检索增强;紧接着一句是,Google-Extended不影响网站在谷歌搜索中的收录,也不是搜索排名信号。AI概览和AI模式都在谷歌搜索里面。
也就是说,这29家新闻站在规则文件里写下的那一行,挡的是Gemini,不是AI概览。站内抓取规则为什么挡不住AI训练那篇拆过这个令牌定义里的两个限定词,这里是那两个限定词在一个真实行业里的后果。
还要补一句:这个令牌没有自己的抓取程序,谷歌用现有的搜索爬虫抓页面,令牌只起许可开关的作用,所以在服务器日志里永远看不到它。挡了它,日志里什么都不会变,想确认效果也无从下手。站内规则写着放行、爬虫却进不去那篇讲的是反方向的同一类错位:规则文件上写的,和实际发生的,是两回事。
页面上那行“摘要不限长”,是哪一年写下的?
要回答AI概览到底受什么管,得先回到2019年。
那年7月,法国成为第一个把欧盟版权指令里出版商邻接权写进本国法律的国家,10月生效。谷歌的回应是不付费,改变展示方式:据搜索引擎大陆当年的报道,谷歌在法语博客里写明,法律生效后,除非出版商明确表示愿意,谷歌在法国不再为欧洲新闻出版商展示内容预览,适用于所有谷歌服务。
出版商表达“愿意”的办法,就是谷歌同年9月24日推出的几个页面指令:摘要最多显示多少字符、图片预览最大多大、视频预览最长几秒,以及不让某段文字进摘要的属性。这几个指令从当年10月中下旬开始生效。一行“摘要长度设为-1”,意思是不设上限。
当时对法国媒体来说,这是一道选择题:不写,搜索结果里只剩标题和链接;写上,摘要和缩略图回来,但等于免费放弃了这部分授权收费。后来的故事是竞争管理机构介入,2020年要求谷歌善意谈判,2021年因谷歌没执行禁令罚款5亿欧元,2022年6月接受谷歌的整改承诺并赋予强制力,期限5年,可续一次。
这行指令被写上去的那一刻,它管的是搜索结果里那两三行灰色摘要。七年后,同一行字还在页面上,管的东西多了一样。
这行授权现在管到了哪里?
谷歌现行的页面抓取与展示指令规范里,对这几个指令的适用范围写得很具体:
| 指令 | 规范里写的作用范围 | 和AI概览的关系 |
|---|---|---|
| 不显示摘要 | 网页搜索、图片、发现、AI概览、AI模式等所有搜索结果形态 | 同时阻止内容被用作AI概览和AI模式的直接输入 |
| 摘要最多多少字符 | 网页搜索、图片、发现、助手、AI概览、AI模式 | 同时限制内容能被AI概览和AI模式直接使用多少 |
| 不让某段文字进摘要 | 页面内指定的片段 | 该片段不作摘要;谷歌AI功能说明页把它和前两个指令并列为控制内容在搜索里如何展示的手段 |
| 多条指令冲突 | 以更严格的那条为准 | 两行写法打架时,小的数字生效 |
规范里还有一句限定:如果出版商另外授予了使用许可,比如提供了页面内的结构化数据,或者和谷歌签有授权协议,摘要长度设置不会中断那些更具体的许可用途。这句话在后面讲授权协议的时候还要用到。
表里有一个容易漏看的词:发现。摘要指令同样作用于谷歌发现信息流,而据法国媒体行业报道,发现是法国新闻出版商来自谷歌的流量里占大头的那部分。同一篇报道提到,一项研究发现在美国、墨西哥和巴西,最多有一半用户已在发现信息流里看到过AI生成的摘要,法国暂时还没有。一旦发现也上了AI摘要,页面上那行“不限”管到的范围还会再大一圈。
把两份文档放在一起读,结论很直接:挡Google-Extended管不到AI概览,页面上的摘要指令管得到。而法国媒体页面上的摘要指令,绝大多数写的是“不限”。
77家实测,摘要授权写成了什么样?
98家里,直接请求能取回文章页的66家;被防护挡住的,用真浏览器补抓,又拿到7家的文章页、1家的首页;另有3家首轮只拿到首页。文章页和首页的指令在同时拿到两者的站点里,66家有64家完全一致,所以首页可以作为少数站点的替补。21家始终打不开,下面单独交代。
| 摘要设置 | 家数 | 占77家 |
|---|---|---|
| 不设上限 | 65 | 84.4% |
| 页面上没写摘要长度指令 | 7 | 9.1% |
| 同一页写了两个互相冲突的值 | 2 | 2.6% |
| 限定为140、300或320字符 | 3 | 3.9% |
| 整页不显示摘要 | 0 | 0 |
分组看:新闻类39家里35家不设上限(89.7%),服务类24家里18家(75.0%),其他14家里12家。77家里没有一家用整页不显示摘要,用“不让某段文字进摘要”属性的,文章页上只找到两家科技网站,分别用了5处和4处。图片预览同样放得很开,直接取到的66个文章页全部允许大图预览。
设了上限的三家是:一家地方报把摘要限在140字符,一家财经周刊限在300,一家医学专业媒体限在320。
一半的写法,是模板和插件写的
77家页面上的指令字符串,去掉空格后一共只有22种。最常见的一种,“摘要不限、大图预览、视频不限”这一串,一字不差地出现在23个文章页上,其中13家是地方报,3家是全国性媒体,其余是美食、科技、时尚、育儿和体育网站。第二常见的一串多了“收录、跟踪”两个词打头,图片预览排在摘要前面;源码里带着同一款主流SEO插件标记的页面一共14个,全部以这一串开头,和这款插件默认输出的格式一致。
这说明一件事:这些页面上的授权,相当一部分不是编辑部为AI概览做的决定,而是建站模板和插件在某个版本里替它们写好的。这和站内抓取规则文件里那87行是谁写的量出来的情况如出一辙,那次是33个站一个字都没改过平台出厂的规则。
最有意思的是插件用户里的两家例外:一家女性时尚杂志和一家汽车媒体,在插件默认那行之后又加了一行,分别写着摘要最多160和150字符。按规范,冲突时以更严格的为准,所以这两家实际生效的是160和150。这是14家插件用户里仅有的两家动过这一项的。
没写摘要长度指令的那7家
7家里有两家是国际广播集团旗下的新闻网站,一家体育网站,一家财经门户,还有三家健康、育儿类媒体。没写指令,在今天的规范下意味着谷歌自行决定摘要长度,并不等于不给用。至于2019年那套“法国新闻出版商不写就不显示预览”的做法今天是否还原样适用,谷歌的现行文档里没有找到对应说明,这里不下结论。
挡了Google-Extended又不限摘要的,有多少家?
把抓取规则和页面指令合起来看。两样都能取到的74家里:
- 规则文件里挡了Google-Extended的33家;
- 这33家里,页面摘要不设上限的30家;
- 剩下3家,两家是没写摘要长度指令的国际广播网站,一家是把摘要限在300字符的财经周刊。
新闻类单独算,挡了Google-Extended的29家里,26家页面不限摘要。这26家的共同处境是:规则文件上写着不许谷歌拿内容训练AI,页面头部写着摘要多长都行,而后者才是AI概览读的那一行。
有一家全国性日报的规则文件做得相当细。训练类令牌整站挡住;ChatGPT的用户触发抓取、ChatGPT搜索抓取、Claude的搜索抓取、谷歌的笔记本和深度研究等十来个令牌,默认也是整站禁止,只开几个栏目的口子:给ChatGPT的两个令牌放行旅行、文化、时尚、美妆、珠宝、钟表、男装和优惠导购,给其余令牌只放行旅行、优惠导购和选举结果。大部分新闻不给AI搜索看,能带货的生活栏目放进去,算盘打得很清楚。
可它的文章页上,写的也是那串“摘要不限”。规则文件越写越长,挡住的越来越多,唯独没挡到自家搜索结果里那块AI回答。
真想让AI概览少用正文,要付什么代价?
按规范,页面层面能用的就三个工具,每一个都会同时作用于普通搜索摘要:
| 做法 | 对AI概览 | 对普通搜索结果 |
|---|---|---|
| 整页不显示摘要 | 不作直接输入 | 只剩标题和链接,也不在发现等入口显示摘要 |
| 把摘要限到很短 | 限制可用的长度 | 普通摘要同样被截短 |
| 给正文部分段落加不进摘要属性 | 这些段落不作直接输入 | 这些段落也不会出现在摘要里 |
| 挡Google-Extended | 无影响 | 无影响 |
这就是出版联盟投诉里说的“技术性退出会失去可见度”:没有一个开关能只关AI概览、保留普通摘要。站内不想被抠去做精选摘要要怎么退出那节讲过同样的代价,只是那时候损失的是精选摘要,现在连AI回答一起算进来了。
那两家科技网站用段落属性的做法,是这三个工具里伤害最小的一种:只把少数段落排除在外,其余照常。但它需要编辑在每篇文章里决定哪几段不给,对日更几百篇的新闻站,这是一笔实打实的人力账。
签了授权协议的,页面上的设置还算数吗?
谷歌为欧盟版权指令第15条设了一个扩展新闻预览授权计划,在搜索控制台里签约。说明页写着:链接和非常短的摘录不需要授权;超出这个范围的摘要和缩略图,谷歌以支付授权费的方式取得许可;不签也可以留在搜索里;签了之后,仍然可以用页面指令对单个页面显示、不显示或限制预览。另外,谷歌只和根域名签约,频道子域名或子目录单独签不了。
这里就用到前面那句限定了:规范说,出版商和谷歌签有授权协议时,摘要长度设置不会中断协议里更具体的许可用途。协议里具体许可了什么,是否包括AI概览,公开文档里看不到。出版联盟投诉里的说法是,谷歌在AI概览上线前给出版商的,是对现有授权合同的一次更新。
所以对签了协议的媒体,页面头部那一行未必是最终的授权边界,合同才是,而合同外人看不到。
规则文件里看得出谁和谁签了约
没有合同,规则文件里倒是有痕迹。法国《世界报》在规则里挡了Google-Extended、CCBot、ClaudeBot,以及苹果、Mistral和字节跳动的相关令牌,却没有给GPTBot和PerplexityBot设任何分组。它和OpenAI在2024年3月签了内容合作,和Perplexity在2025年5月签了约,这两个令牌正好是放行的。
规则文件和《世界报》几乎出自同一个模板的赫芬顿邮报法国版,挡了Google-Extended,却和《世界报》相反地挡了PerplexityBot,同样没给GPTBot设分组。另有两家全国性媒体反过来,挡了GPTBot却没挡Google-Extended。抓取规则文件在这里读起来,更像一份商务合作的对外公示,而不是一份技术配置。
《世界报》说流量没掉,这句话量的是哪一层?
《世界报》集团总经理在9月8日发表的一次访谈里说,AI概览上线以来,除了季节性波动,他们没看到受众突然下滑,七八月各新增2.4万订户,创了纪录。这篇访谈被广泛转引,常被读成“AI概览没伤到媒体”。把他自己给的几个数放在一起看,这句话量的层级是清楚的:
| 访谈里的数字 | 它说明的是什么 |
|---|---|
| 出版联盟引用的33%到38%流量损失,指的是来自谷歌搜索的流量,不是总受众 | 比较对象要先分清是搜索流量还是全部访问 |
| 搜索引擎只占大型新闻网站约一半访问 | 搜索掉三成,总受众大约掉一成多 |
| 8月应用贡献了集团36%的流量,AI概览主要影响网页流量 | 《世界报》暴露在AI概览下的流量比例,比网页为主的媒体更小 |
| 英文版上半年流量同比涨7%,而其主要读者市场早已有AI概览 | 是总流量同比,没有拆出搜索来源 |
| 从ChatGPT来的访客转化为订户的比率,是脸书来源的26倍、发现来源的260倍 | 只有倍数,没有基数和访问量 |
| 与其交流的英、意、西同行说,健康、美食、汽车这类服务型内容受众跌幅可达50% | 转述,不是公开数据 |
另一份说法来自法国一家研究机构,称8月法国前50家新闻媒体的网站和应用流量同比少了17%;发行审计机构随即表示从未提供过这类数据,也不做涨跌分析,并说8月太特殊,9月的数字更有参考价值。
放回这篇的样本里,有一个值得记下的对照:访谈里说跌得狠的是健康、美食、汽车这类服务型内容,而本次实测里,服务类媒体24家挡了Google-Extended的是0家,页面上不设摘要上限的占75%。它们对AI的防线,整体比新闻类更松。这不能证明跌幅来自哪里,只能说明两类媒体在同一个问题上的准备程度差得很远。站内AI概览拿走维基百科多少流量那篇拆过同一类问题:一个流量损失数字,先要问清是哪个口径下的损失。
至于26倍和260倍这种只有倍数的数字,站内AI来的流量转化率是自然搜索好几倍那篇已经讨论过它为什么差异悬殊,这里只提醒一句:倍数再大,乘的是一个没公布的基数和一个没公布的访问量,绝对订户数可能很大,也可能很小,访谈里判断不了。
这次测量漏了哪些?
- 最大的几家没测到。21家始终打不开,其中包括排行前列的几家全国性和地方大报,以及生活方式、健康、消费和天气类媒体各一两家。它们对自动化请求设了防护,这本身也是一种立场,但它们页面上写了什么,这次不知道。
- 每家只取一篇文章页。同一站点不同栏目可能用不同模板,比如付费文章和免费文章。
- 4家用首页替补文章页。同时取到两者的站点里,首页和文章页一致的是66家中的64家,替补有少量误差风险。
- 抓取规则只按“对整站根目录禁止”判断,只挡部分目录的不算挡,所以挡住的家数是保守数字。
- 授权合同的有无和内容完全不可见。页面指令和合同冲突时以哪个为准,只能依据谷歌规范的那句限定推断。
- 测量时间是2026年9月13日,出版联盟的投诉正在进行,媒体随时可能调整设置。
做中文站和出海站的人,能从这里带走什么?
法国媒体的处境有特殊性,邻接权和授权谈判不是每个站都会碰到。但有三件事是通用的。
第一,先看自己页面头部那一行是谁写的。打开任意一篇文章的源码,搜摘要长度指令,如果看到“-1”,大概率是主题或插件的默认值。它当初是为了让搜索摘要完整显示,今天同时意味着AI概览能完整使用这一页。愿不愿意,是需要重新做一次的决定。
第二,别把Google-Extended当成AI概览的开关。它管的是Gemini训练和Gemini应用里的使用,想影响谷歌搜索里的AI回答,只有页面上的摘要指令这一条路,而这条路会连带普通摘要。站内照抄爬虫黑名单之前先看266个令牌里多少真来过那篇,也提醒过规则文件里的令牌和实际效果之间的距离。
第三,按页面类型决定,而不是全站一刀切。对靠品牌和订阅变现的内容,AI概览的引用可能是引流;对“看完摘要就不用点”的服务型答案页,比如健康问答、菜谱配料、车型参数,限制摘要可能换来点击,也可能直接换来消失。这笔账每个站不一样,但算账之前,至少先确认那一行写的是你自己的意思。
如果还没想好,可以先看数据。站内内容有没有被AI训练过的几种检测办法和优先来源扩进AI概览之后怎么被用户标记,一篇讲怎么查被用了多少,一篇讲被引用之后能换回什么,放在一起权衡。
常见问题解答
在抓取规则里屏蔽Google-Extended,能阻止内容进入AI概览吗?
不能。谷歌文档写明,Google-Extended用于控制内容是否用于训练Gemini模型以及在Gemini应用和Vertex AI里的检索使用,不影响网站在谷歌搜索中的收录。AI概览和AI模式属于谷歌搜索,受页面上的摘要指令约束。
哪些设置会影响AI概览使用我的内容?
按谷歌现行规范,整页不显示摘要会阻止内容作为AI概览和AI模式的直接输入;摘要最多多少字符会限制可用长度;给段落加不进摘要属性会把这些段落排除。三者都会同时作用于普通搜索摘要。
页面上写着摘要长度为-1是什么意思?
表示不设上限。这个指令2019年为配合法国邻接权法推出,最初用于让出版商选择是否在搜索结果里显示完整摘要。现在同一个指令也决定内容能被AI概览和AI模式使用多少。很多站点的这一行来自主题或SEO插件的默认输出。
一个页面写了两个不同的摘要长度,以哪个为准?
以更严格的为准。本次实测里有两家在插件默认的不设上限之外,又加了一行160和150字符的限制,实际生效的是160和150。
和谷歌签了新闻授权协议,页面上的摘要设置还有用吗?
仍可用来对单个页面显示、不显示或限制预览,这是授权计划说明页写明的。但谷歌规范也写着,签有授权协议时,摘要长度设置不会中断协议里更具体的许可用途。协议许可范围不公开,需要以合同为准。
这个结论对中文站适用吗?
指令的作用范围对所有语言的谷歌搜索都一样,适用。不同的是法国有邻接权法和授权谈判这一层背景,中文站一般没有,所以更直接的问题是:页面上不设摘要上限的那一行,是否仍然符合你今天对AI概览的态度。
为什么这次有21家媒体没测到?
这些网站对自动化请求设了防护,直接请求和真浏览器补抓都返回拒绝访问、人机验证或连接超时。它们多是排行靠前的大型媒体,所以样本对头部大报的代表性不足,文中的比例应理解为能测到的77家的情况。
权威参考资料
本文标题:《Google-Extended挡不住AI概览:77家法国媒体,84%的摘要授权没设上限》
本文链接:https://zhangwenbao.com/google-extended-ai-overviews-snippet-permission-audit.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0
← 上一篇
AI模式里同一件商品贵21.6%?拆开算,六成配对价格一分没差下一篇 →
没有了