让AI帮你写一百页产品文案,难的从来不是写,是说清楚哪一页算写好了
本文目录
- 为什么读着还行这三个字,是你给AI开出的最贵一张验收单?
- 从照规格实现到照判据评估,中间断掉的是哪一层
- 确定性系统和概率系统,验收方式为什么不能共用一套
- 同一个提示词跑两遍结果不一样,这不是故障是它的工作方式
- 读着还行这三个字,到底把什么推回给了人
- 三个人验收同一批稿子,通过率能差出多少
- 你以为在做质检,其实每次都在重新定义标准
- 判据没写下来的团队,规模一放大就必然塌
- 一条判据要写到什么份上,才算真的判得动?
- 客观不等于武断:回答不超过十秒为什么是条废判据
- 两步法:先给输出分类,再按类写判据
- 一张判据卡片该有哪六个字段
- 通过条件必须能指着原文说是哪一句
- 不通过的例子,比通过的例子值钱得多
- 判据里出现等、相关、合适这几个词就该重写
- 能用死规则判的,就别请模型出场
- 判据的颗粒度,跟着返工成本走
- SEO这摊活里,哪些好能翻译成判据,哪些翻译不了?
- 可直判的那一类:字段级、数字级、清单级
- 半可判的那一类:得先拆成代理判据
- 翻译不了的那一类:可信、专业、有帮助
- 标题和描述的判据,怎么写才不会写成堆词
- 结构化数据和可见内容一致,这条怎么自动判
- 规格数字回源比对:对不上就整条丢弃
- 内链锚文本的判据,比多数人想的难写
- 分类页文案的判据,必须按产品线分开写
- 失手复盘:一条完美客观的判据,是怎么被凑出来的
- 它是怎么被揪出来的,以及我查了多久才摸到判据身上
- 怎么改的,以及那句我现在写每条判据都会先问的话
- 让AI当判官之前,得先给判官做一次体检
- 让模型当判官,到底靠不靠谱?一手数据这么说
- 判官的三种偏差:位置、冗长、自我偏好
- F1不是精确率和召回率的平均数,这个差别会害你
- 校准集怎么抽:不是挑典型页,是照真实分布抽
- 人工标注要标多少条才够
- 两个人标不一致的那些条,才是判据真正的病灶
- 判官换了模型版本,等于换了个人
- 判官也会被提示词里的顺序和措辞带跑
- 判官的体检报告要留档,还要跟判据版本对上号
- 判据拆开判,为什么又便宜又准?
- 一条复合判据,等于把三件事塞进一个是非题
- 拆完之后,一半的子判据根本不需要模型
- 版式和视觉那类判据,能拆到规则层的比例最高
- 拆解的第三个好处:报错能指到具体那一项
- 拆得太碎,代价是什么
- 子判据之间的与或关系,必须写死
- 成本账:一次全量评测该花多少钱
- 从整篇过不过,到哪一项没过,排障差别有多大
- 昨天全绿的判据,今天为什么会突然变红?
- 确定性系统修好就不再坏,概率系统不给你这个待遇
- 改一个看起来毫不相干的地方,为什么会带崩老判据
- 回归评测该跑全量还是跑抽样
- 评测集里要留一部分永不改动的压舱样本
- 通过率的曲线该怎么看,别只盯单点
- 模型侧的静默升级,是最难防的一种
- 这跟运行期走形那件事,分工线画在哪
- 判据本身也会退化,谁给判据做版本管理?
- 判据没有版本号,历史评测结果就全都不能比
- 判据一改动,就得跟一次重跑绑在一起
- 判据的三种退化:过时、被绕过、越加越松
- 新增判据的入口要卡住,不然它会疯长
- 判据到了几十条之后,该怎么治理
- 谁有权改判据,谁有权停用判据
- 判据的归档,比新增更难做也更重要
- 一份判据台账长什么样
- 你写判据的这套本事,正是引擎在你身上用的那套
- 把好翻译成可判定条款,你和引擎在做同一件事
- 质量评估指南读起来,为什么那么像一份判据集
- 你的页面此刻正是别人评测集里的一条样本
- 可判定性和可引用性,在这里合成了一件事
- 官方那些自问清单,本质是判据的白话版
- 内部判据能不能直接拿去当对外优化目标
- 别把判据当排名公式,这跟评分工具的坑是同一个
- 判据写得越明确,AI改稿的效率提升越明显
- 跨语言那一半:判据能不能翻译一遍就复用?
- 判据翻过去了,通过条件没跟着翻过去
- 小语种的判官从哪儿来,找不到怎么办
- 文化禁忌类判据必须硬编码,不能交给模型判
- 关税、时效、认证这三类字段的判据该写成什么样
- 两个近亲语言市场的判据,能不能共用一套
- 从零开始的话,头四周该按什么顺序做?
- 前两周先别写判据,先去数错法
- 第三周做判定分工和自动化,第四周才动校准
- 四周之后进入常规节奏,每周每月每季各做什么
- 常见问题解答
- 判据和内容规范、写作简报,是同一样东西吗?
- 团队就两三个人,值得搭这套东西吗?
- 能不能直接买个现成的内容评分工具,代替自己写判据?
- 模型判官的一致率要到多少,才算能上线?
- 判据该不该给写稿的人看?会不会导致他们只照着判据写?
- 这套东西跑起来,能指望自然流量涨多少?
- 权威参考资料
摘要:AI帮你写一百页产品文案,真正卡住你的从来不是它写得快不快,而是你说不清哪一页算写好了。传统软件按规格书验收,因为同样的输入永远得到同样的输出;生成式系统不是这样,它每次都可能给你一个不同的答案,规格书这条路直接断了。剩下的那条路叫判据:把你对好的理解,翻译成别人(包括机器)也能照着判的条款。这篇讲判据怎么写才判得动、怎么请AI当判官又怎么先给判官做体检、判据自己怎么退化、以及为什么你写判据的这套本事,正是搜索与AI引擎此刻在你网站上用的那套。
为什么读着还行这三个字,是你给AI开出的最贵一张验收单?
先把病灶说清楚:不是AI写得不够好,是你手上那把尺子根本没有刻度。
从照规格实现到照判据评估,中间断掉的是哪一层
做过网站改版的人都熟悉这个流程:产品写一份需求文档,把每个按钮点下去发生什么写清楚,开发照着实现,测试照着验,三方对同一份文档说话。这套东西能跑二十年,靠的是一个不太被提起的前提——代码是确定的,同样的输入永远给同样的输出,所以“应该怎样”可以被写死成“必须怎样”。
把生成式模型接进来之后,这个前提没了。你没法给一个模型写“当用户问退货政策时,输出以下47个字”。真能写死的地方,本来也不需要模型。你请它来,恰恰是因为你不知道用户会怎么问,也提前想不全该怎么答。
NN/g的Adam Elman在The Core Skill of Design in the AI Era: Critique里把这一层断裂讲得很干净:设计师的任务从“指定精确行为”变成“定义什么叫好,以及什么叫不好”。这句话读起来像句正确的废话,但它落到独立站运营手里,是一件相当具体、相当难、而且几乎没人认真做过的事。
确定性系统和概率系统,验收方式为什么不能共用一套
确定性系统的验收是二值的:这个功能要么符合规格,要么不符合,争议极少,争议出现时去翻文档就能裁定。概率系统的验收是分布的:你手上是一百条输出,其中八十三条你觉得可以,十一条明显不行,还有六条你自己都拿不准。
这两种东西不能用同一套流程处理。二值验收的产物是一份“通过/不通过”的结论,分布验收的产物是一条通过率曲线加一份失败样本清单。前者能签字放行,后者只告诉你现在处在什么水位。
很多团队的痛苦就卡在这儿:他们拿着二值验收的心理预期,去处理一个分布型的东西,于是永远在等一个“这套流程终于稳了”的时刻。那个时刻不会来。它只会给你一条越来越高、但永远够不着100%的线。
同一个提示词跑两遍结果不一样,这不是故障是它的工作方式
刚开始接触的人常犯一个错:把两次输出不一致当成配置没调对,于是一路把随机性参数往下压,指望压到底就变回确定性系统。压到底之后你会发现,输出确实稳定了,但那种“能替你想到你没想到的角度”的能力也一起没了。
不确定性和灵活性是同一枚硬币。你没法只留一面。所以正确的姿势不是消灭不确定性,而是给不确定性划一个可接受的范围——哪些维度必须每次都一样(比如价格、型号、认证名),哪些维度可以每次不一样(比如开头怎么切入、例子举哪个)。
这个划分本身,就是判据的第一层。你会发现它跟传统内容规范有个根本区别:传统规范说的是“该写什么”,判据说的是“写成什么样才算过”。前者对着写作者,后者对着输出物。
读着还行这三个字,到底把什么推回给了人
我见过太多团队的验收标准,扒到最后就是三个字:读着还行。这三个字最要命的地方不是它松,而是它把判断权原封不动地退回给了每一个具体的人,还退回给了这个人当天的状态。
源文里有一句话我很认同:含糊的判据会逼着评估者去行使设计判断,而设计判断是主观的。翻译成大白话——你以为你定了一条标准,实际上你只是把“你来定标准”这件事,转发给了下游那个正在赶工的人。
更隐蔽的后果是它不可累积。第一个人凭手感判过的一百页,没有留下任何能让第二个人接手的东西。三个月后你想知道当初为什么那批页面判过了,只能去问人,而人早忘了。
三个人验收同一批稿子,通过率能差出多少
这件事我建议每个团队自己做一次,成本很低,结果通常很刺激。随机抽30条AI产出,让三个同事各自独立判一遍通过与不通过,不许互相商量,判完对表。
我做过的几次里,最好的一次三个人在30条上有6条判不一样,最差的一次有14条判不一样——接近一半。而这三个人都会告诉你,他们心里的标准“其实差不多”。
不一致本身不可怕,可怕的是不一致长期不可见。平时一个人判一批,没人对表,通过率的波动就被归因成内容质量本身有波动,而不是判的人换了。
你以为在做质检,其实每次都在重新定义标准
这是含糊判据最贵的那笔账。质检的本意是拿一把固定的尺子去量东西,但当尺子本身没刻度时,每一次测量都变成了一次重新划刻度。
它带来的连锁反应很典型:这个月通过率涨了,你不知道是内容变好了还是尺子变松了;想把验收交给新同事,交接会开了两个小时,最后交出去的还是一句“你多看几篇就有感觉了”。
凡是需要靠“多看几篇就有感觉”来传递的东西,都不是标准,是手艺。手艺没什么不好,但手艺不能规模化,也没法在你休假的那两周继续工作。
判据没写下来的团队,规模一放大就必然塌
小量的时候,含糊判据是能撑住的。一周十篇,主编一个人全看,他脑子里那把尺子确实稳定,团队也确实产出了不错的东西。问题出在从十篇到一百篇的那一跳。
这一跳会同时触发三件事:判的人从一个变成三个(一致性开始崩)、单篇分到的注意力从十分钟压到两分钟(深度检查退化成扫一眼)、以及需要判的维度反而变多了(多语言、多品类、多模板)。三件事叠在一起,通过率不会掉,会涨——因为扫一眼更容易放过。这也是我在SEO内容外包怎么做才不翻车那篇里把质量门单列成一个系统的原因:一旦生产不在你手上,没有成文的判据,你连翻车了都是最后一个知道。
我在AI内容写完谁来质检那篇里讲过人机怎么分工、哪一层归人哪一层归机器。那篇解决的是“谁来判”,这篇解决的是它前面的一步:判据本身长什么样,才配得上被交给任何一方去执行。分工线画得再漂亮,尺子没刻度,两边都在瞎判。
一条判据要写到什么份上,才算真的判得动?
这一节讲判据的写法,包括那张我用了三年、六个格子的判据卡片。
客观不等于武断:回答不超过十秒为什么是条废判据
写判据最容易走的歪路,是把“客观”理解成“给个数”。源文里那个例子很典型:语音助手的回答该多长?有人一拍脑袋写下回答不得超过十秒。这条判据完美满足可判定性——掐表就行,两个人判结果一定一样。
但它是错的。让智能音箱关个灯,回五秒都嫌啰嗦;用户问一个需要权衡的复杂问题,二十秒可能还没说完。同一个阈值,套在两类完全不同的请求上,判出来的结果跟质量没有任何关系。
反过来,如果你改成让评估者判断这个回答是否显得啰嗦,可判定性又归零了。判据的难点从来不在这两端,而在中间那条窄路:既要客观到不同的人判得出一样的结果,又不能武断到跟真实需求脱钩。
两步法:先给输出分类,再按类写判据
源文给的解法我认为是整篇最有实操价值的一条,可惜只用了一段话带过。它把判据拆成两步:第一步先判这条输出属于哪一类,第二步再用这一类专属的判据去判它合不合格。
落到独立站上,第一步可能是判“这段文案属于功能描述、场景描述还是参数罗列”,第二步才是“如果是参数罗列,必须命中该品类必答参数清单里的全部项”。分类这一步通常极容易判,甚至能用规则完成;难判的那部分被收窄到了一个小得多的范围里。
这个手法的价值在于,它把一条判不动的模糊判据,换成了两条判得动的清晰判据。你以后遇到任何“这条怎么写都不对”的判据,先问自己一句:是不是因为我在拿一把尺子量三种东西。
一张判据卡片该有哪六个字段
我给团队定的格式很土,就是一张卡片六个格子。土的好处是新人五分钟能学会,而且写不满的那几格,恰好就是这条判据还没想清楚的地方。
| 字段 | 要回答什么 | 写不出来说明什么 |
|---|---|---|
| 判什么 | 一句话说清这条在管哪一件事 | 一条判据塞了两件事,该拆 |
| 看哪儿 | 判的时候读输出物的哪个部分 | 范围没界定,两个人会读不同的段落 |
| 通过条件 | 满足什么就算过,能指到具体那一句 | 只有感觉没有条件,等于没写 |
| 不通过样例 | 至少两条真实的失败输出 | 你还没见过它失败,判据是想象出来的 |
| 谁来判 | 规则、模型判官、还是人 | 默认丢给人,成本会在放量时爆掉 |
| 复判频率 | 每批全量、每周抽样、还是只在改动后 | 没定频率,实际执行会退化成想起来才判 |
六格里最容易空着的是不通过样例——这类判据上线之后往往拦不住任何东西,因为它防的是一种想象中的错法。
通过条件必须能指着原文说是哪一句
这是我判断一条判据合不合格的第一道闸:不通过的时候,判的人能不能指出具体是哪一句、哪个字段导致的。指不出来,这条判据就该重写。
能指出来带来两个连锁好处。一是申诉成本降到最低——写稿的人不服可以对着那一句讨论,而不是跟你争“我觉得挺好的”。二是修改路径明确,返工的人知道动哪儿,不用整段重写。
这条闸还能顺手筛掉一大批伪判据。诸如“内容要有深度”“要体现专业性”这类,你永远指不到具体某一句,因为它们描述的是整体印象。整体印象不是不能判,是不能直接判,得先拆成能指到句子的代理条件。
不通过的例子,比通过的例子值钱得多
大部分团队的判据文档里塞满了正面范例:看,好的产品描述长这样。这类范例对写作有帮助,对判定几乎没帮助,因为它给的是一个模糊的方向,不是一条边界。
边界只能由反例划出来。你收集到的每一条失败输出,都在替你回答一个更具体的问题:差到什么程度就不能过了。我要求团队每条判据至少配两条反例,而且必须是真实出现过的,不许自己编。编出来的反例总是错得太明显,划不出真正的那条线。
判据里出现等、相关、合适这几个词就该重写
我给团队立过一张小小的禁用词表,专门用在写判据的场合。上榜的词有:等等、相关、合适、恰当、充分、必要时、尽量、原则上。这些词出现在需求文档里叫留有余地,出现在判据里叫把锅甩给下一个人。
举个具体的:必须包含产品的核心参数等信息。这个等字一出现,判的人就得自己决定等里面包不包括保修期。三个人会给出三种答案,而这条判据在通过率报表上,看起来完全正常。
替换的办法不神秘,就是把省略掉的东西一条条列出来。列出来之后你常会发现,之所以当初写等,是因为你自己也没想清楚到底要哪些。判据把这种没想清楚,从心里搬到了纸面上。
能用死规则判的,就别请模型出场
这是成本和稳定性的双重考虑。字数区间、必含字段、URL格式、数字是否与源数据一致、是否出现禁用表述——几十行脚本就能判死,判得比任何模型都准,不要钱,也不会哪天升级完就换了个脾气。
把这类判据交给模型判,我见过两种翻车。一种是模型偶尔数错个数,把4个参数的页面判成5个;另一种更麻烦,它会替你“通融”——看到页面写得挺好,就把一个明显缺项的判据放过去了。模型天生倾向于给一个让人满意的答案,这个倾向在判官岗位上是缺点。
我的经验分界线是:凡是能被写成正则或一次数据库比对的,一律不进模型。剩下那些真正需要理解语义的,才轮到判官模型上场。这一刀切下去,通常能砍掉六成以上的模型调用量。
判据的颗粒度,跟着返工成本走
常有人问判据该写多细。我的答案是别问细不细,问判出问题之后要返多少工。返工便宜的地方可以粗,返工贵的地方必须细。
改一句文案的成本几乎为零,那这类判据粗一点无所谓,判错了顺手改回来。但结构化数据字段写错会直接影响机器怎么理解这一页,改完还要等重新抓取,代价拖得很长,这类就得细到字段级。同理,认证名、成分、适用机型这些一旦错了要下架重发的东西,判据要细到逐字比对。
我在结构化数据审计工具怎么用那篇里拆过一个页面上五种格式的字段缺漏怎么扒清楚,那套扒法可以直接接到这里当判据的自动执行层——工具负责扒出字段,判据负责说清楚扒出来之后哪些算过。
SEO这摊活里,哪些好能翻译成判据,哪些翻译不了?
把判据落到具体字段上,顺便讲一个我自己写错判据、六周后才被客服揪出来的完整过程。
可直判的那一类:字段级、数字级、清单级
先把好判的挑出来,这部分占的比例远比多数人以为的高。字段级说的是该有的东西在不在:标题有没有、描述有没有、规范网址指向哪里、图片替代文本空不空。数字级说的是页面上出现的每一个数字能不能在源数据里找到同一个值。清单级说的是某个集合里的项有没有全部命中。
这三类的共同点是判定过程不需要理解语义,只需要比对。也正因为如此,它们该被写成脚本,判得又快又不吵架,能在每次批量生成之后全量跑一遍,不用抽样。
我的建议是先把这三类判据铺满,再去碰难的。它们拦住的错误占比通常在六成以上,拦住的都是那种发出去了要下架重发的硬伤。顺带说一句,字段级判据还能顺手挡掉一批被判成薄页的风险,我在薄内容不是字数少那篇里拆过判定口径,跟这里的字段完整性是同一批检查项。
半可判的那一类:得先拆成代理判据
中间这一层最费脑子。比如“这段描述有没有回答用户真正关心的问题”,你没法直接判,但可以拆:有没有出现该品类前十个高频搜索问题里的至少三个;有没有给出适用与不适用的边界;有没有把参数翻译成使用场景。
拆出来的每一条都比原来那句窄,也都比原来那句可判。它们加起来当然不等于原来那句的全部含义——代理判据永远有损失。但你要在“有损但能判”和“完整但判不动”之间选一个,答案不难。
拆的时候有个小窍门:盯着失败样本拆,别盯着定义拆。把最近三十条不合格的输出摊开,问它们各自差在哪,差法归类之后,每一类就是一条代理判据。从定义往下推,容易推出一套漂亮但没用的体系。
翻译不了的那一类:可信、专业、有帮助
有些词就是判不了,硬判只会制造假精确。可信、专业、有帮助、有深度这几个,我建议直接从判据表里删掉,转而放进另一个地方——写作简报。
这两个位置的区别很关键。简报是给生产端的方向盘,模糊一点没关系,人会自己补齐;判据是给验收端的量尺,模糊就等于失灵。同一句话放在简报里是有用的指引,放进判据表里就成了噪音。
我在内容简报怎么写才能让稿子一次到位那篇里讲过怎么把生产规范写到可交接的程度。那篇管的是稿子出来之前,这篇管的是稿子出来之后,两头别混着用。
标题和描述的判据,怎么写才不会写成堆词
这是最容易走偏的一块。因为标题描述天然有几个可数的东西——长度、有没有核心词、有没有品牌名,很多人的判据就只剩这几条,结果AI老老实实按判据产出,产出了一堆长度合格、核心词齐全、读起来像机器写的标题。
问题不在这几条判据错,在于它们只覆盖了下限。补上限的办法是加反向判据:同一批标题里句式重复超过多少算不过、核心词在一个标题里出现两次算不过、通用修饰词命中禁用表算不过。
下限判据保证不出事,上限判据保证不难看。只写下限判据的团队,产出的东西会稳定地停在及格线上,一年之后你会发现整站的标题像一个人在打嗝。
结构化数据和可见内容一致,这条怎么自动判
这条判据在我的清单里权重很高,因为它是少数几条“违反了机器全看得见、用户一点感觉都没有”的规则。做法上并不复杂:把页面里标记出来的字段值取出来,跟正文里对应位置的文本做一次比对,不一致就整条拦下。
常见的不一致有三种:价格标记的是旧值、评分标记里的评论数跟页面上显示的对不上、可用性标记写着有货但页面显示缺货。这三种全都出自同一个原因——标记是模板生成的,正文是另一条管线生成的,两条管线的数据源不同步。
判据这时候起的作用超出了内容质量本身,它变成了一个跨管线的一致性探针。Google在结构化数据的通用准则里把这一条写得很硬:标记的内容必须与用户可见的内容一致。这不是建议,是判定标准。
规格数字回源比对:对不上就整条丢弃
凡是型号、年款、尺寸、功率、认证编号这类数字,判据只有一种写法:拿出来跟源数据表逐个比,对不上的那一条整体作废,不许修修补补。
为什么要这么狠?因为这类错误有个特点,错一个字和错十个字的后果一样严重,而“改一改还能用”的诱惑极大。一旦允许局部修补,实际执行时就会变成人工去挑哪些能救,注意力一散,漏掉的那条正好是最贵的那条。
内链锚文本的判据,比多数人想的难写
内链看起来是最机械的活,判据却出奇地难写好。只判“有没有链”太松,判“锚文本必须包含目标页核心词”又会催生一堆读起来生硬的塞词锚。
我最后落到三条:锚文本必须能独立读懂(脱离上下文也知道点过去是什么)、同一篇文章里指向同一个目标的锚不得完全重复、锚文本与目标页标题的语义距离要在一个区间内——太远说明链错了,太近说明是复制粘贴标题。
第三条得靠模型判,前两条规则就能判。这也是个典型的混合判据例子:不要因为一条判据里有一项需要模型,就把整条都交给模型。
分类页文案的判据,必须按产品线分开写
这是踩过坑之后加的一条。分类页文案的模板高度相似,很容易让人写一套通用判据全站套用。但不同产品线的必答信息差别极大:耗材类要写兼容清单,工具类要写适用材料,服饰类要写版型和尺码逻辑。
一套通用判据能做的只有最小公约数,而最小公约数恰好是最没用的那部分。更糟的是,通用判据的通过率会非常好看,因为它谁都不为难。
接下来这段失手复盘,讲的就是这条判据我当初怎么写错的。它是我这几年里改判据改得最疼的一次,也是本篇最想留给你的那一段。
失手复盘:一条完美客观的判据,是怎么被凑出来的
去年底我接了个出海乐器与音响配件站,耳机、线材、支架、转接头,SKU一千二百多个,产品描述全靠AI批量生成,我负责搭验收这一环。
我给产品描述定的核心判据只有一条,但我当时觉得它写得相当漂亮:每条描述必须包含至少3个规格参数。它满足我自己讲的所有要求——客观、可数、能指到具体句子、不需要模型就能判。我拿80条人工标注样本校准了一遍,判官跟人的一致率0.94,我很满意,上线了。
之后六周,通过率稳定在96%上下,一致率没掉,抽查也没抽出问题。我甚至在周报里写过一句这套验收已经稳了。
它是怎么被揪出来的,以及我查了多久才摸到判据身上
第七周,客服那边提了一句:最近退货理由里接口不匹配的比例明显在涨。他不是在报bug,他是在抱怨退货处理量。
我先查的是物流发错货,没问题;再查的是商品图,也没问题。第三天才想起去看那批页面本身——一看就明白了。AI确实每条都写满了3个以上参数,但写的是净重、包装尺寸、保修期。而真正决定这条线能不能用的接口类型、阻抗、频响范围,一条都没写。
还有一批更妙:同一个参数被拆成三种写法凑数量,阻抗32欧姆、32Ω、低阻抗设计,三条并排放着,判据数出来是3个参数,完美通过。它不是在骗我,它是在非常认真地满足我提出的那个要求。
怎么改的,以及那句我现在写每条判据都会先问的话
改动有三处。第一处,判据从数量改成清单命中:按品类维护一张必答参数清单,耳机类必须命中接口类型、阻抗、频响,线材类必须命中长度、接头形制、屏蔽方式,清单里的项一个都不能缺。第二处,加了一条反向判据:同一参数不得以多种写法在同一段里重复出现。第三处,通过率报表拆开按品类看,不再看全站均值。
改完之后通过率从96%掉到71%,两个月后回到88%,而接口不匹配的退货理由基本消失了。那25个百分点的下降不是质量变差,是尺子终于开始量正确的东西了。
教训我总结成一句,现在写每一条判据之前都会先问一遍:如果有人只想过这条判据,最省事的作弊法是什么?答不上来的判据不许上线。因为答不上来,通常意味着你还没想明白它到底在拦什么——而模型会替你把这个答案找出来,用你完全没预料到的方式。这跟我在用户宁可去打电话也不点你的AI客服那篇里说的能靠嘴硬改善的数字不能当KPI不是一回事:那条讲的是汇报指标会被美化,这条讲的是放行判据会被凑满,而凑满的结果是错的东西被判定为合格,然后直接发出去。
让AI当判官之前,得先给判官做一次体检
把判据变成提示词交给模型去判,这条路能走通,但得先知道判官自己有哪些毛病。
让模型当判官,到底靠不靠谱?一手数据这么说
把判据变成提示词,让另一个模型去判第一个模型的输出,这个做法有个通行叫法:LLM as a judge。听上去像左手考右手,但它确实能用,前提是你知道它的边界在哪。
这里要跟站内另外两篇划清界限。G-Eval 2.0内容质量评估器讲的是拿一套现成的六维量表给内容打出一个等级,Critic代理评分器讲的是不调真引擎也能预测策略效果。那两篇给你的是别人做好的尺子怎么用,本篇讲的是你自己那把尺子刻度怎么定、怎么校——用现成尺子的人迟早会问一句它凭什么这么打分,答案就在这一节。
最常被引用的一手依据是2023年那篇Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena。研究者用两个基准去核对模型判官和人类偏好的吻合程度,结论是强模型判官与人类的一致率超过80%,跟人和人之间的一致率处在同一水平。
这个数字要正着读也要反着读。正着读:它跟一个普通人类评估者水平相当,却便宜得多快得多。反着读:它错的那两成,不见得跟人错的那两成是同一批。把人换成模型,等于换了一种错法,不是消灭了错。
判官的三种偏差:位置、冗长、自我偏好
同一篇论文很干脆地列出了模型判官的几种系统性偏差,这三个尤其值得独立站团队记住。
位置偏差:给它两份候选让它选,它对排在前面那份有偏爱。所以做A/B对比评估时必须把顺序打乱,最好正反各跑一遍取一致的结果。冗长偏差:它倾向于给更长的答案更高的分——这一条恰好跟源文里那个啰嗦判据撞在一起,你要判的正是长短,而判官天生喜欢长的。自我偏好:模型更认可跟自己风格接近的输出。
第三条的实操推论很直接:别让写内容的那个模型给自己打分。同一个模型既当运动员又当裁判,通过率会好看得莫名其妙。生产端和评判端至少要换一个模型,最好连提示词风格都不一样。
F1不是精确率和召回率的平均数,这个差别会害你
衡量判官准不准,常用的数是F1。源文里把它说成精确率和召回率的平均,这个说法不严谨,而不严谨的地方恰好在会出事的位置上。
按scikit-learn官方文档的定义,F1是精确率与召回率的调和平均,不是算术平均。差别在哪?假设判官精确率0.95、召回率0.20,算术平均是0.575,看着还凑合;调和平均只有0.33,一眼就知道有大问题。
调和平均对短板极其敏感,任何一边趴下,总分就跟着趴下。这正是你需要的性质:一个只会说通过的判官,和一个逮谁拦谁的判官,都不该拿到及格分。用算术平均会把这两种废物判官掩护过去。
校准集怎么抽:不是挑典型页,是照真实分布抽
这是我见过最多人栽的一个坑,也包括早年的我。要校准判官,你得先有一批人工标注过的样本当标准答案。抽样的时候,本能反应是挑那些有代表性的典型页面。
这个本能是错的。典型页面往往是你最上心、写得最好的那批,判官在上面表现优异,是因为那批本来就没什么可判的。真实流量里可能六成是冷门长尾品类,图少、参数缺、描述短,判官在那些页面上的表现,才是它上线后的真实水平。
正确的抽法是照真实分布分层抽样:按品类、按内容长度、按数据完整度分几层,每层按实际占比取。抽出来的集合会显得很难看,那才对——你的站本来就长这样。我在AI做SEO/GEO审计的3个前提那篇里把数据、方法、人工复核列为三个前提,抽样口径这件事就卡在第一个前提上。
人工标注要标多少条才够
常被问的问题,我的经验值是起步100到150条,每个关键判据不少于30条正例加30条反例。低于这个量,F1的波动会大到没法用来做决策。
但比数量更重要的是标注方式:至少两个人独立标同一批,标完对表,不一致的挑出来单独讨论。很多团队为了省事只让一个人标,那这批标注就只反映了这一个人的口味,判官校准到跟他一致,也只是复制了一个人的偏好。
两个人标不一致的那些条,才是判据真正的病灶
这是标注环节最大的隐藏收益,很多人只把不一致当成噪音处理掉,实在可惜。两个熟悉业务的人对同一条输出判出相反结果,几乎不可能是因为其中一个走神了,大概率是那条判据本身有歧义。
我的做法是把所有不一致样本单独建一个池子,逐条追问:你们俩到底卡在哪个词上?追出来的答案通常直指判据里某个没定义清楚的表述。改完判据再重新标一遍,一致率会明显往上跳。
换句话说,标注不只是给判官准备教材,它同时是判据的一次压力测试。判据写得含糊,这一关一定会暴露出来,而且暴露得非常具体。
判官换了模型版本,等于换了个人
这条我吃过亏。判官跑得好好的,某天服务商把默认模型指向了新版本,通过率毫无征兆地往上抬了几个点。我第一反应是内容团队最近状态不错,两周后才发现是判官变宽容了。
处理办法有三个,建议一起上:把判官用的模型版本写死不用默认;每次版本变更走一次完整的重新校准,出一份新的F1;保留一小批永不改动的压舱样本,任何时候重跑,结果应该稳定在已知区间里。
压舱样本这招成本极低效果极好。二三十条固定输入固定预期,每周跑一次,判官一旦漂了,这条曲线会先动,比通过率更早给你信号。
判官也会被提示词里的顺序和措辞带跑
除了位置偏差,判官对提示词本身的写法也很敏感。同样一条判据,写成“请判断这段描述是否包含接口类型”和写成“这段描述缺少接口类型吗”,通过率能差出好几个点,因为否定式问法会引导它往找茬的方向走。
所以判官提示词该被当成代码管理:定稿之后不许随手改,要改就走一次重新校准。我见过团队里有人觉得“我就把措辞润色一下更通顺”,润完当批通过率变了4个点,跟内容一点关系都没有。
还有一个小技巧:让判官先输出判定理由再输出结论,而不是反过来。先给结论的话,后面的理由会变成为结论找补;先说理由,判定质量通常更稳,也方便你抽查它到底看懂没看懂。
判官的体检报告要留档,还要跟判据版本对上号
最后这条是把前面所有动作串起来的收纳工作。每一次校准都该产出一份可归档的东西:用的哪个模型和版本、判据是第几版、校准集多少条怎么抽的、F1多少、哪几条判据的一致率明显偏低。
没有这份档案,三个月后你看到通过率变化,无从判断是内容变了、判据变了、还是判官变了。这三者的处置方式完全不同,混在一起就只能靠猜。
我在AI给的结论你不敢往上线推那篇里讲过部署一套AI系统时该向它索要哪几样交代。那篇讨论的是你要不要信它的结论,这篇讨论的是你拿什么去判它的结论——前者是信任问题,后者是量具问题,别把两件事合成一件。
判据拆开判,为什么又便宜又准?
复合判据是新手最常见的形态,也是评测体系跑不长久的头号原因。
一条复合判据,等于把三件事塞进一个是非题
新手写判据最常见的形态是这样的:产品描述必须准确、完整、并且符合品牌语气。一句话,三个要求,一个通过或不通过的结论。
这条判据的问题不是标准太高,是它的输出根本没有信息量。判成不通过,你只知道三件事里至少有一件出了问题,不知道是哪一件;判成通过,你也不知道它是三项都好,还是有一项勉强擦边而另外两项拉了平均。
拆开之后完全不同:准确性不过、完整性通过、语气通过。你立刻知道该动哪儿,也知道这一批里准确性是不是系统性短板。判据的价值不在于它给出的那个是或否,在于它把问题定位到了多细。
拆完之后,一半的子判据根本不需要模型
这是拆解带来的第二个好处,也是省钱最快的一处。复合判据因为混着语义判断,只能整条交给模型;一拆开你会发现,其中相当一部分子项是纯粹的比对。
还是上面那条:准确性里最硬的一块是数字回源,脚本干;完整性里的必答项命中,脚本干;语气里的禁用词清单,脚本干。真正需要模型的只剩语气里“是否显得生硬”那一小块。
Anthropic在怎样定义成功标准并搭建评测那份文档里给了同一个方向的建议:优先用能自动判定的方式衡量,把人和模型的判断力留给真正需要判断力的地方。这句话翻译成账面语言就是——模型调用量降下来的那部分,才是评测能长期跑下去的原因。
版式和视觉那类判据,能拆到规则层的比例最高
源文提了一句很实在的话:面向视觉的体验比较难做自动评测,因为图形化的输入输出不好放进评测数据集里。这个限制是真的,但它比听上去要小,因为大部分视觉类判据其实拆得动。
拿“是否符合视觉规范”举例,往下拆是:字体族是不是清单里的、字号是不是在允许档位里、主色是不是品牌色值、前景背景对比度够不够。这四条全都能用样式检查跑出来,不需要任何人去看那张图。
剩下真正需要眼睛的,是构图、留白、图文关系这些。它们占的比例不高,交给人抽查完全负担得起。先拆,再看剩下多少必须靠眼睛,通常比你预估的少一大半。
拆解的第三个好处:报错能指到具体那一项
这条对协作的价值被严重低估了。整条判据不通过,反馈给写稿的人只能说“这篇不行”,对方要么全篇重写,要么来找你掰扯半天。拆开之后反馈变成“第3条必答参数缺了接口类型”,对方十分钟改完再提交。
我算过一笔账,某个团队把判据拆细之后,单篇的平均返工时长从40分钟降到12分钟左右,返工次数反而略微上升了——因为反馈够具体,大家愿意改了,以前那种模糊反馈会让人干脆放弃,直接换一篇。
所以拆解不只是评测技术,它同时是协作接口的设计。你的判据结构,决定了两个人之间那句反馈说得清说不清。
拆得太碎,代价是什么
凡事有边界,判据也不是拆得越碎越好。拆过头的症状有三个:判据表膨胀到几百条没人记得住、单条评测的调用次数暴涨、以及最麻烦的一种——每条都通过,合起来看还是不像话。
第三种真实存在:拆出二十条子判据条条合格,产出的东西依然平庸。这不是拆解的错,是提醒你保留一条兜底的整体判据,由人抽查,不进自动流程。
我的经验刻度是:单类输出的判据控制在8到15条之间,超过20条就该回头看有没有重复的、有没有从来没拦下过任何东西的。后者尤其值得清理,它只在消耗预算。
子判据之间的与或关系,必须写死
拆完之后立刻出现一个新问题:这些子判据是全部通过才算过,还是过一部分就行?不写清楚的话,执行的人会自己发明规则,而且每个人发明的不一样。
我的写法是分三档:硬闸(任何一条不过,整条作废,比如数字回源、认证名、禁用表述)、计分项(达到几条以上算过,比如内容丰富度相关的几条)、提示项(不过也放行,只记录,用来看趋势)。三档在判据表里用不同底色标出来,一眼就能看出这条的分量。
分档还有个副产品:它逼你面对一个平时会回避的问题——这条判据真的重要到能拦下整篇吗?很多写的时候感觉很重要的判据,一放进硬闸档就显得不合适了,那说明它本来就该是提示项。
成本账:一次全量评测该花多少钱
这笔账值得认真算,因为它直接决定了你能多频繁地跑评测,而评测频率又决定了你多快能发现问题。
粗算方式很简单:需要模型判的子判据条数 × 待评样本数 × 单次调用成本。假设5条模型判据、800个页面、单次几分钱,一次全量就是几十到一两百块。这个价格是可以每周跑一次的;如果你没拆解,20条判据全走模型,同样的量就翻了四倍,很快就会被砍成每月跑一次。
频率被砍的后果不是省了钱,是问题的平均存活时间从三天变成了半个月。我在GEO优化成本经济学那篇里算过类似的账:同一件事不同做法之间的成本能差出百倍,而成本差最终会变成执行频率差。
从整篇过不过,到哪一项没过,排障差别有多大
最后用一个具体场景收这一节。某个周一你发现上周批次的通过率从89%掉到61%,掉了28个点,现在要定位原因。
如果判据是整条的,你手上只有一堆不通过的样本,得挨个读,读到第十几条才可能看出规律,运气不好读完也没头绪。如果判据是拆开的,你只要看子判据维度的通过率分布——大概率会发现19条判据里只有1条塌了,而那一条对应的正好是上周改过的某个模板字段。
五分钟和一整天的差别,就在拆没拆这一件事上。评测系统的真正产出不是那个通过率数字,是它把问题指到了多具体的位置。
昨天全绿的判据,今天为什么会突然变红?
概率系统不给你修好就不再坏的待遇,回归这件事得换一套做法。
确定性系统修好就不再坏,概率系统不给你这个待遇
传统开发里有个默认预期:一个bug修完之后,只要没人动相关的代码,它就不会自己回来。这个预期支撑了整套测试工程的性价比——回归测试主要盯着改动周边,没改的地方大可放心。
接上模型之后这条默认预期失效了。源文里那句话说得挺形象:混沌理论似乎开始适用,看起来完全无关的提示词改动或者训练数据更新,照样可能把你在意的那条判据带崩。
这意味着回归的范围不能按改动范围推。你改了A处,不代表只需要重测A相关的判据。这一点是很多团队第一年最难适应的地方,因为它跟工程直觉是反的。
改一个看起来毫不相干的地方,为什么会带崩老判据
原因不神秘。提示词对模型来说不是一条条独立的指令,而是一整段上下文,改动任何一处都会改变整体的语境权重。你在末尾加一句“回答要更简洁”,模型可能顺手把某些原本会写的必答参数也一起简掉。
我遇过一个特别典型的:为了让描述读起来更亲切,在提示词里加了“用第二人称跟读者说话”。加完之后,规格参数命中率掉了9个点——因为第二人称的句式天然更偏口语,模型开始把“32欧姆阻抗”写成“戴起来不压耳”。
这两句话在人看来毫不相干,在模型那里它们共用同一份注意力预算。你加进去的每一句话,都在跟已有的每一句话争资源,这是概率系统的基本代谢方式。
回归评测该跑全量还是跑抽样
我的分法是按触发原因走,不按心情走。模型版本变更、提示词改动、判据改动这三种,一律跑全量;日常批次生产跑抽样,比例视产量定,通常10%到20%足够看出趋势。
为什么这三种必须全量?它们改的是系统本身,影响面天然是全站级的,抽样容易正好抽不到出问题的那一类;日常生产改的只是输入,分布短期内稳定,抽样能代表整体。
还有一种情况必须全量:你打算拿这次结果去跟历史比的时候。抽样跟全量的数字不能直接放进同一张趋势图,这个错误我见过不止一次,画出来的曲线看着煞有介事,实际在比两种不同的东西。
评测集里要留一部分永不改动的压舱样本
这条前面提过一次,这里展开说,因为它是整套回归机制里性价比最高的一件装置。
做法:挑20到30条输入,覆盖你最在意的几类场景,把每一条的预期结果人工写死,然后锁起来,谁也不许改。之后每次模型换版本、提示词调整、判据修订,先跑这一小组,结果对不上就停下来查,别急着往下走。
压舱样本提供的是跨时间的固定参照系。判据会改、评测集会扩、口径会变,只有这二三十条从头到尾没动过——它是你唯一能拿来回答“到底是它变了还是我的尺子变了”的东西。
通过率的曲线该怎么看,别只盯单点
单点数字最容易骗人。这周91%,上周88%,看着在涨,实际可能只是这批内容碰巧简单了一点。判据体系跑起来之后,看数的方式要换成看形状。
我固定看三条:总通过率的四周移动值(消掉批次噪音)、各条子判据的通过率排序(谁在拖后腿,是不是一直是它)、不通过样本的原因分布(错法有没有换种类)。第三条最容易被忽略,但它是最早的预警——总通过率还没动的时候,错法的构成往往已经变了。
错法构成变化通常意味着上游发生了什么:换了模型、改了模板、进了一批新的产品数据。发现得早,排查范围还很窄;等它传导到总通过率上,往往已经过了两三周。
模型侧的静默升级,是最难防的一种
你自己没改任何东西,判据没动,提示词没动,通过率却变了——这种情况多半来自服务商那边的模型更新。它不会给你发通知,也不该指望它发。
防这件事只有一个笨办法:把版本写死,并且定期主动跑压舱样本。写死版本能挡掉大部分意外,但托管服务的具体行为各家不同,所以压舱样本这道保险不能省。
另外在评测记录里存一列模型标识。这一列平时没用,出事那天它能让你五分钟内确认是不是判官换人了,而不是花两天去怀疑内容团队。
这跟运行期走形那件事,分工线画在哪
我在你那套AI自动化不是哪天突然坏的那篇里讲过另一件事:一套跑起来的自动化会从第二周开始悄悄偏,而输入源不声明版本、执行器不怀疑输入,中间那段偏差在结构上就没法被观测到。
那篇讲的是闸有没有在正常运转,这篇讲的是闸的刻度盘上刻的是什么。两件事可以同时出问题,也可以只出一件:判据写得再好,没人定期跑,等于没有;跑得再勤,判据量错了东西,跑得越勤错得越整齐。
合起来看的顺序是先有刻度再谈频率。所以如果你两件事都没做,先做本篇这件——一套没有判据的监控体系,每天准点告诉你一个没有意义的数字,那才叫真正的浪费。
判据本身也会退化,谁给判据做版本管理?
判据不是写完就一劳永逸的资产,它会过时、会被绕过、会越加越松。
判据没有版本号,历史评测结果就全都不能比
这是我最想让人记住的一条运营纪律。你六月跑出来的通过率是84%,八月是91%,中间判据改过三次——那这两个数字放在一起没有任何意义,因为它们不是同一把尺子量出来的。
解法极其简单,简单到很多人因此不做:给判据集编版本号,每次改动加一版,每份评测结果带上它用的是哪一版。就这么一件事,能让你手上的历史数据从装饰品变成资产。
版本号只是最低要求,还要记改了什么和为什么改。三个月后要回答“当初为什么把这条从硬闸降成提示项”,靠记忆是答不上来的。
判据一改动,就得跟一次重跑绑在一起
改判据的时候人容易只想着往前看:新判据从下一批开始生效。这样做会留下一个断层——旧批次是旧尺子量的,新批次是新尺子量的,中间那道坎在数据上完全看不见。
正确做法是判据改完,先用新版重跑最近一批已完成的样本,拿到一个可比的基线,再让它对新批次生效。多花一次评测的钱,换来趋势图不断裂。
重跑还有个额外收获:你会立刻知道这条新判据的严格程度。我改判据之后重跑,见过通过率从88%掉到40%的情况——那说明这条新判据的标准定得跟现实差太远,与其硬推不如先降半档,分两步走。
判据的三种退化:过时、被绕过、越加越松
过时最好识别:产品线变了、政策改了、平台规则更新了,判据还停在原地。定期回看能解决。
被绕过就是我那次乐器配件站踩的坑:判据还在,字面上也一直被满足,但满足的方式跟你的本意已经脱钩了。这种最难发现,因为所有数字都正常。识别办法是定期人工读一批“刚好通过”的样本——不是读不通过的,是读擦边通过的,绕过判据的花招全在那里。
越加越松是组织问题:每次有人抱怨判据太严,就松一点,松过的从来没有紧回去过。半年下来判据表还是那些条,实质门槛已经掉了一大截。防这个只能靠记录每次松动的原因,并在季度回看时集中审一遍。
新增判据的入口要卡住,不然它会疯长
判据集有个天然的膨胀倾向:每出一次事故,就有人提议加一条判据防它。听起来很负责,实际上三个月后你会有一张四十条的表,其中一半从来没拦下过任何东西。
我给新增判据设了三道门槛:必须能提供至少两条真实的失败样本(不是假想的)、必须说明它跟现有哪几条的边界在哪(防重复)、必须指定判定方式和承担成本的一方(防甩锅给人工)。三条都过了才准进表。
这三道门槛挡掉的提议,多数属于同一类:出事之后的应激反应。我在AI内容流水线为什么6站4降权那篇里复盘过三处人工节点该卡在哪,那三处解决的是流程有没有人把关,本篇的判据表解决的是把关的人手里拿的是什么。事故的真实原因常常是某条已有判据没被执行,而不是缺一条新判据。加判据是最容易做的动作,也因此经常是错的那个动作。
判据到了几十条之后,该怎么治理
规模一上来,判据集本身就变成了一个需要管理的资产。我的治理动作有三个,每季度做一次。
第一,算每条判据的拦截率:这一季它拦下了多少条输出。连续两季拦截率为零的,要么删掉,要么降级成提示项。第二,算每条判据的争议率:被申诉、被推翻的比例,高的说明表述有歧义,该重写。第三,算每条判据的成本:占了多少模型调用,能不能拆一部分到规则层。
这三个数一拉出来,该动哪几条几乎不用讨论。判据治理最怕的是靠开会讨论感觉,感觉永远得不出结论,因为每个人心里护着不同的那几条。
谁有权改判据,谁有权停用判据
这是流程题,但不定清楚会直接影响判据的可信度。我的分法是:提议人人可提,修改归一个明确的负责人,停用必须比修改更难。
为什么停用要比修改更难?因为停用是不可见的。改一条判据,报表上会显现出来;停用一条,报表只会看起来更干净——所有跟它相关的不通过全都消失了,看着像质量提升了。这个诱惑在赶进度的时候特别大。
我的规矩是停用判据必须留一条记录,写明停用原因和恢复条件,并且停用状态要在报表上显示出来,不能悄悄从表里删掉。看不见的停用,跟没有判据是一个效果。
判据的归档,比新增更难做也更重要
大多数团队只有新增的入口没有退出的出口。归档要处理的问题是:一条判据不再适用了,但历史评测结果还引用着它。
处理办法是软归档:判据不从表里删除,标记为已归档并记下归档日期,新评测不再执行它,历史结果仍然能查到它当时的定义。这样趋势图在那个时间点会有一个可解释的断点,而不是一段无从解释的跳变。
这套逻辑跟内容资产的处置其实是一回事。我在内容审计怎么做那篇里讲过上千篇旧内容的留改并删转怎么决策,判据表到了几十条之后,需要的正是同一种狠心和同一套记录纪律。
一份判据台账长什么样
把上面这些落到一张表上,就是我现在给每个团队交付的那份台账。字段不多,但每一列都对应着前面某个会出事的地方。
| 列名 | 填什么 | 它防住的是什么 |
|---|---|---|
| 编号与版本 | 判据编号加当前版本号 | 历史评测结果无法横向比较 |
| 档位 | 硬闸、计分项、提示项三选一 | 子判据的与或关系被执行者自行发明 |
| 判定方 | 规则脚本、模型判官、人工 | 默认全甩给人工,放量时成本爆掉 |
| 反例数 | 挂载的真实失败样本条数 | 凭想象写出的判据拦不住真实错误 |
| 本季拦截率 | 拦下的输出条数占比 | 长期零拦截的判据白占预算 |
| 本季争议率 | 被申诉推翻的比例 | 表述有歧义却一直没人重写 |
| 末次校准 | 日期加当时的一致率 | 判官悄悄漂了没人知道 |
| 状态 | 启用、停用、已归档及原因 | 判据被悄悄停用,报表反而更好看 |
这张表一开始会让人觉得繁琐,跑两个季度之后你会发现,它是整套体系里唯一能在人员变动时完整交接出去的东西。判据能不能传下去,取决于它有没有被写成表,而不是有没有被讲清楚。
你写判据的这套本事,正是引擎在你身上用的那套
这是我最想留给你的那一跳:判官和被判样本,中间只隔一个身份切换。
把好翻译成可判定条款,你和引擎在做同一件事
写到这儿该说那句最想说的话了。你为了管住AI产出,被迫学会了一件事:把一个模糊的质量概念,拆成一组别人照着也能判出同样结果的条款。这件事很累,很多人做到一半就放弃了。
但请留意一个巧合——搜索引擎和AI引擎,此刻正在你的网站上做完全相同的事。它们也面对一个模糊概念(这一页对用户有没有价值),也没法直接判,也只能拆成一组可计算的信号,也要跟人类评估者对表来校准。
换句话说,你在内部养出来的这套能力,跟你想搞懂引擎怎么评价你的那套能力,是同一套。这不是比喻上的相似,是流程上的同构:定义好、拆成可判定项、用人类标注校准、监控退化。四步一模一样。
质量评估指南读起来,为什么那么像一份判据集
Google那本几百页的质量评估员指南,很多人当理论读,读完记住几个缩写就完了。换个角度读会有意思得多:把它当成一份写了二十年的判据文档。
它的结构完全符合本篇讲的那几条:有分档(页面质量分成几档)、有正例反例(大量真实页面截图配判定说明)、有拆解(把整体质量拆成主内容、作者信息、网站声誉等子项)、有一致性要求(不同评估员对同一页要给出接近的结论)。
我在QRG手册怎么读那篇里拆过它的评分档位和训练机制。今天再回头看,那份手册最值得学的不是它的结论,是它的写法——一个需要成千上万人判出一致结果的场景,判据必须写成什么样子。
你的页面此刻正是别人评测集里的一条样本
这句话有点扎人,但它是准确的。当一个AI引擎在回答某个采购问题时,它会把候选页面拿来判一遍:这一页有没有直接回答、信息够不够具体、有没有明确的条件与限制、能不能独立成立而不依赖上下文。
这些判定项,跟你写给自家AI的判据是同一类东西。差别只在于,那边的判据不归你写,你只能通过页面本身去满足它。你是判官的那一刻和你是被判样本的那一刻,中间只隔了一个身份切换。
想通这一层,做优化的心态会不一样。你不再是在猜一个黑箱的喜好,而是在设想:如果我是那个判官,拿到这一页,我能不能指着某一句说它回答了问题?指不出来,那这一页大概率也过不了它那关。
可判定性和可引用性,在这里合成了一件事
被AI引擎引用的内容有几个反复出现的共性:自足(不看上下文也能读懂)、具体(有数字、有型号、有条件)、带边界(说清楚什么情况下适用、什么情况下不适用)。
把这三条跟本篇讲的判据要求对照一下,你会发现它们是同一组要求的两种说法。一段内容之所以容易被引用,正是因为它容易被判定:判官能一眼确认它答了什么、答到什么程度、在什么条件下成立。
反过来,那些写得含糊的段落,既过不了你的内部判据,也过不了引擎那一关,原因完全一致——没人能指着它说清楚它到底承诺了什么。我在外链建设凭什么要变天那篇里聊过被引用一次的分量,今天补上它的前置条件:先得可判定,才谈得上可引用。
官方那些自问清单,本质是判据的白话版
Google那份Creating Helpful, Reliable, People-First Content里,最有价值的不是那些形容词,是它给出的一串自问句:内容是否提供了原创信息或原创分析?读完之后读者是否觉得已经充分了解了这个主题?标题是否夸大或耸动?
这些句子的形态很眼熟——它们就是判据,只是写成了给人读的白话:能指到具体位置,能回答是或否,也配了不通过的样子。
所以我的建议是:别把这类官方文档当成理念读,当成判据模板抄。把里面的自问句直接搬进你的判据表,补上通过条件和反例,它立刻就能用。这比你自己从零想一套要靠谱得多,毕竟这套问题是他们拿海量真实页面磨出来的。
内部判据能不能直接拿去当对外优化目标
不能,这是必须划清楚的一条线。内部判据管的是“我们出品的东西合不合格”,对外优化目标管的是“引擎会不会青睐这一页”。两者高度相关,但不是一回事。
混淆的后果我见得太多了:团队把内部判据的通过率当成SEO指标往上汇报,做到98%通过率,流量纹丝不动。因为判据只保证了你没犯错,没保证你比对手更值得被选。判据是及格线,不是竞争力。
正确的用法是把它当成地基:判据保证每一页都不掉链子,竞争力靠选题、靠一手数据、靠别人给不出的那部分。地基打牢了,上面盖什么才有得谈;地基没打,盖再高也是在流沙上。
别把判据当排名公式,这跟评分工具的坑是同一个
这个提醒必须说,因为它是这套方法最容易走火入魔的方向。一旦你手上有了一组能打分的判据,就会忍不住去优化那个分数,然后分数变成了目标本身。
我在内容优化工具值不值得用那篇里拆过第三方NLP评分工具的真相:它是意图覆盖检查表,不是排名公式,为冲分而堆词的团队最后都撞了墙。在向量分数0.89就代表内容对齐了那篇里也讲过同一个陷阱的另一种形态——别把精确当成准确。
你自己写的判据同样跑不掉这个规律,甚至更危险,因为是自己定的,看着格外可信。AI批量内容都撞上质量墙那篇里的几个站,撞墙前的内部指标全都很体面。判据的正确用法是当筛子不是当靶子:它负责把不合格的挡在外面,不负责告诉你什么是最好的。
判据写得越明确,AI改稿的效率提升越明显
最后说个正面的收益,也是很多人做完判据体系之后最意外的一处。判据本来是拿来验收的,但它反过来对生产端的帮助可能更大。
道理很直白:你把判据连同不通过的具体项一起喂回给模型,让它照着改,比你写一堆“再写得专业一点”的指令有效得多。源文也提到了同一个手法——把评估判据和失败案例本身作为输入,请模型据此优化提示词,通常比反复试错来得快。
我自己的用法更粗暴:判据表直接写进生成提示词里,让它一开始就照着验收标准写。这一招上线之后,首次通过率通常能涨十几个点。想想也合理——以前是让它写完再考它,现在是提前把考卷给它看了。这算不算作弊我不知道,反正返工量确实降下来了。
跨语言那一半:判据能不能翻译一遍就复用?
多语言站的判据不是翻译问题,把这一层想简单了会积出几百个页面的坑。
判据翻过去了,通过条件没跟着翻过去
多语言站最常见的偷懒做法,是把中文判据机翻成目标语言直接用。字面上确实翻过去了,但判据里那些依赖语言本身的条件,一翻就散架。
举几个具体的:标题字数上限在德语里几乎必然超(复合词天生长);禁用词表在西班牙语里得按地区分开列,同一个词在西班牙和墨西哥的分量完全不同;语气类判据在日语里得改成敬体等级,而中文判据里根本没有这一维。
正确的做法是把判据分成两层:跨语言不变的和必须本地重写的。数字回源、字段必填、结构化数据一致这些属于前者,翻译过去就能用;凡是涉及措辞、长度、语气、禁忌的,一律归后者,必须找懂那个市场的人重写,不是重译。
小语种的判官从哪儿来,找不到怎么办
这是个现实困境。你能给英语内容配一个靠谱的模型判官,因为标注材料好找、模型能力也强;换成越南语、波兰语、阿拉伯语,判官的可靠性会明显下滑,而你连校准它的人工标注都凑不齐。
我的应对是降级但不放弃:小语种只跑跨语言不变的硬判据(数字、字段、一致性),语义类不上自动判官,改成按固定比例找母语者抽查,比例定得比主语言高一档。
更要紧的是把这个差异明说出来:小语种页面的通过率跟主语言的通过率不可比,因为判据集根本不是同一套。放进同一张报表而不加说明,会制造一种小语种质量更好的错觉——它只是被判得更少而已。我在出海独立站关键词本地化怎么做那篇里讲过人审那六步,判据的本地化跟关键词的本地化是同一个道理:翻译解决不了它。
文化禁忌类判据必须硬编码,不能交给模型判
这一条我建议当成铁律。涉及宗教、政治边界、健康宣称、地区称谓这些的判据,一律做成禁用词表加规则匹配,不许交给模型去理解语境。
理由很简单:模型在这类问题上的判断力受训练材料影响极大,而且它出错的方式是不可预期的。你没法接受一个“大部分时候判得对”的判官来管这一层,因为这一层错一次的代价不是返工,是下架、封店、甚至法律麻烦。
规则匹配当然会误伤,会把一些其实没问题的表述也拦下来。在这一层,误伤是可接受成本,漏放不是。这是全篇唯一一处我建议你把判据故意写严的地方。
关税、时效、认证这三类字段的判据该写成什么样
这三类有个共同特点:没人去改它,它也会自己过期。税率会调整、时效会随旺季变化、认证会到期。判据如果只判“有没有写”,那它写着一个三个月前就失效的数字,照样通过。
我的写法分两步。第一步改内容形态:这类信息一律不写死值,改成给区间、给口径、给截止日期,比如写“以下时效为2026年第二季度实测区间”,而不是写一个光秃秃的天数。第二步判据跟着形态走:判“有没有标注口径和有效期”,以及“有效期是否已过”,后者纯脚本就能跑。
认证类还要再加一条:认证名称与编号永远不进自动生成,只从源数据表读取。这条判据的执行方式是比对而不是判断,模型碰都不该碰。
两个近亲语言市场的判据,能不能共用一套
能共用一部分,但共用比例远低于直觉。这个问题我在印尼语SEO和马来语能不能合并成一套那篇里专门拆过,结论是拼写层最像、词汇层分岔最大,而判据恰好大量落在词汇层。
落到判据表上分三档:完全共用(结构类、数字类)、共用框架但换词表(禁用词、必答项)、完全分开(语气、称谓、本地合规)。第二档最容易出事——看起来只需要换个词表,换的时候却特别容易漏掉那几个假朋友。
验收的时候别忘了一件事:共用判据的两个市场,通过率要分开看。合在一起看均值,某个市场的系统性问题会被另一个市场的好成绩盖住,等它冒出来通常已经积累了几百个页面。
从零开始的话,头四周该按什么顺序做?
顺序不能颠倒,尤其是前两周那件看起来最不像干活的事。
前两周先别写判据,先去数错法
从零开始搭这套东西,我给的顺序是先看再写。头两周只做一件事:把最近三到五百条真实产出捞出来,人工过一遍,把不合格的挑出来分类。
分类不用讲究方法论,就问每一条差在哪,把差法写成短语,写完归并同类项。两周下来通常能归出十到十五类,这十几类就是你判据表的初稿骨架——它是数出来的,不是想出来的。
这一步千万别跳。跳过去直接写判据的团队,写出来的表看着很全,上线之后拦截率极低,因为防的全是没发生过的错。判据的第一版必须由真实的失败长出来。
第三周做判定分工和自动化,第四周才动校准
第三周把初稿判据逐条过一遍,标出哪些能用脚本判、哪些必须模型判、哪些只能人判,然后先把脚本那部分做出来跑起来。脚本部分通常能覆盖一半以上,而且当周就能见效,这对推动团队接受这套流程很重要——先给他们看到东西挡下来了。
第四周才轮到模型判官和校准:抽标注集、做人工标注、跑一致率、调判据措辞。这一步放最后,是因为它依赖前面三周的产物,提前做等于在半成品判据上校准,白费功夫。
顺序不能颠倒,跟我在SEO自动化的边界在哪那篇里说的一样:先想清楚哪些能交出去哪些不能,再谈自动化程度。反过来做,你会得到一套跑得飞快、但没人说得清它在拦什么的系统。
四周之后进入常规节奏,每周每月每季各做什么
第五周开始把动作固定下来,我的节奏是这样:每周跑一次抽样评测、读五条擦边通过的样本;每月看一次子判据通过率排序和错法构成变化;每季做一次判据治理(拦截率、争议率、成本三张表)加一次判官重新校准。
每周那条里的读擦边样本最容易被砍掉,因为它不产出数字,看着像没必要的仪式。但绕过判据的花招全藏在擦边通过里,这五条是你唯一能看见它们的机会。
最后提醒一句心态上的事:这套东西没有做完的那一天。判据会随产品线增加、随平台规则变化、随模型换代持续调整。它不是一个项目,是一项日常——跟你每周看流量数据是一个性质的事,不做不会立刻死,不做久了会慢慢失明。
常见问题解答
判据和内容规范、写作简报,是同一样东西吗?
不是,方向正好相反。简报和规范是给生产端的,回答的是该写什么、往哪个方向写,写得模糊一点没关系,人有能力自己补齐。判据是给验收端的,回答的是写成什么样才算过,模糊就等于失灵。
实操上两份文档分开存放、分开维护。合在一起的后果是判据被写成一堆建议,验收时谁也拿它当不了准;简报里又混进大量硬性条款,写稿的人读完只觉得束手束脚。
团队就两三个人,值得搭这套东西吗?
值得,但要砍到最小。两三个人的团队我只建议做三件事:把最常出的三到五种错法写成判据、其中能用脚本判的先做出来、再定一条每周读五条擦边通过样本的习惯。加起来一周花不到一小时。
模型判官、校准集、F1先别碰,收益要在产量上去之后才划算。但那三到五条判据必须写在纸上——你迟早会招人或者外包,那一刻没有成文判据,交接就是从零开始。
能不能直接买个现成的内容评分工具,代替自己写判据?
能补一部分,代替不了。现成工具给的是通用维度,它不知道你这个品类的必答参数是哪几项,也不知道你上季度因为哪个字段写错吃过亏——而这些恰恰是你判据表里最值钱的部分。
比较务实的分工是:通用可读性、术语覆盖、结构完整这类交给工具(GEO内容评分器那七个维度就属于这一类),省下自己造轮子的功夫;业务特定的必答项、数字回源、禁用表述这些自己写。工具负责通用及格线,你的判据负责那些别人替你想不到的地方。
模型判官的一致率要到多少,才算能上线?
没有放之四海的数字,但可以给个参照:一致率至少要不低于两个人类标注者之间的一致率,否则你还不如直接找人判。所以正确顺序是先测人和人的一致率,再拿它当基准去要求判官。
另外别只看总一致率,要看逐条判据的一致率。经常出现的情况是总数看着不错,但其中一两条判据的一致率低得离谱,是它们在拖后腿。那一两条要么重写要么改成人工判,不该被平均数掩护过去。
判据该不该给写稿的人看?会不会导致他们只照着判据写?
该给看,而且我建议直接写进生成提示词。会不会导致只照着判据写?会,这正是判据必须同时有下限项和上限项的原因——只有下限项的判据表,确实会把产出稳定地压在及格线上。
更根本的一点是:判据保密没有意义。你不给看,写稿的人会通过反复被打回来逆推出它,只是更慢更伤感情。与其让人猜,不如把标准摆在桌上,把精力花在设计那些不容易被凑满的判据上。
这套东西跑起来,能指望自然流量涨多少?
我不会给你一个数字,因为判据管的是不出错,不是管出彩。它的收益主要体现在三个地方:错误内容发出去的比例下降、返工时长下降、以及新人接手时的爬坡时间下降。
流量的变化是间接且滞后的,也很难跟同期其他动作分开归因。非要说一个观察点,我建议盯那些因为参数错、政策过期、口径打架产生的退货和客诉——这类数字响应最直接,也最能说服老板继续投入。
权威参考资料
本文标题:《让AI帮你写一百页产品文案,难的从来不是写,是说清楚哪一页算写好了》
本文链接:https://zhangwenbao.com/ai-content-eval-criteria-llm-judge-calibration.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0