我做了个测 AI 味的评分器,翻车了 | AI 精英周刊 046
本期要点
在日常工作流里,我们多半已经在用 AI 给各种内容打分:文章质量、Agent 评估、选题、作业。这些分数看似客观,但它们到底在奖励什么?前几天我做了一个测试文章「含人量」的评分器,在准备交付前抓到了它作弊:作者一个字没改,仅仅因为多给了一份背景资料,分数就从 20% 涨到了 80%。这期分享这个评分器翻车的全过程,并在文末附上一张「反向测试卡」:下次照着任何 AI 分数改东西之前,不妨先拿这四个问题对照一遍。
【信号】
Claude 的文本开始带水印。 Anthropic 在 2026 年 8 月 14 日公布了技术细节,采用的是 Google DeepMind 在 2024 年提出的 SynthID-Text 算法变体。它的原理不是在文本里塞隐藏字符,而是在模型挑选下一个词时调整随机性,由密钥和上下文共同决定选词偏好;持有密钥的一方通过统计检验,就能判断长文本里是否存在这种特定模式。2026 年 8 月 2 日前推出的旧模型属于欧盟法规的过渡期范围,官方表示将在未来数月内逐步补齐;新模型则发布即自带。检测 API 目前仅表示「即将推出」,截至 2026 年 8 月 21 日尚未公开上线日期、接口文档及定价。官方在公告中划出了几条关键边界:轻度人工编辑大概率无法彻底消除水印;代码能承载的水印远少于普通文本(因语法与可选写法有限);检测仅提供 Claude 参与生成的概率,无法区分完全生成还是重度修改,也不涉及版权与所有权认定。(Anthropic 官方说明)
旁注:官方自己划出的那几条边界,比水印本身更关键。它给出的只是某个特定模型参与过的概率,既不判定所有权,也分不清是全篇生成还是人工重度编辑。
Gemini 3.7 Flash 发布。 Google 在 2026 年 8 月 13 日更新的模型文档中正式推出。编码评测方面,FrontierCode 1.1 Main 得分从 34.4% 提升至 43.6%,DeepSWE v1.1 从 48.6% 提升至 65.3%,AutomationBench private set 从 17.0% 提升至 30.4%。定价方面,在 2026 年 12 月 31 日前,每百万 token 输入 0.75 美元、输出 3.75 美元(输出价格包含思考 token);2027 年 1 月 1 日起,价格将分别调整为 1.50 美元和 7.50 美元。(Google 官方发布)
旁注:除了价格调整(2027 年起单价翻倍),另一个更值得关注的是实际体感:在中文长文写作与日常表达上,我感觉它的效果甚至强于此前被普遍认为中文写作能力第一的 Opus 4.6。
在日常工作流里,你大概率已经见过不少 AI 打出来的分数了:文章质量分、Agent 评估得分,或者某个 87% 的合格率。
前几天,我亲手抓到了一个作弊现行:同一篇稿子,作者一个字都没动,得分直接从 20% 飙到了 80%。而让分数翻了四倍的那个操作,跟文章本身的质量毫无关系,成本低得可笑。
这个评分器是我自己做的,本来打算当成成品放进系统里用。幸好在动手前我顺手写下了一条作废条件,不然它现在可能已经在某个工作流里一本正经地给人打分了。
今天聊聊它是怎么翻车的。整个过程其实对应了四个核心问题。这四个问题不仅是给做评估系统的人看的:分数一旦进入工作流,它就会指挥你往哪个方向改东西。下次看到任何 AI 给出的分数,不妨先拿这四个问题去过一遍。
问一:它声称在测什么
我想测的东西,是一篇文章里到底有多少内容是模型自己写不出来、只有作者本人才能提供的。我给这个指标起了个名字,叫「含人量」。
思路其实很直接:大语言模型的本质,就是根据上文预测下一个词。那反过来推想,一段话如果模型自己也能轻松写出来,说明它是完全可预测的;而模型无论如何都写不出来的部分,才是你真正注入的独特增量。
所以我设计的测试方法是:完全不给模型看原稿,只给它文章的标题、目标读者和开头第一段,让它在不联网的情况下独立把整篇文章写出来,连续写三次。然后把原稿拆解成一条条核心论点,去这三次生成的内容里逐一比对,只有三次都命中的论点才算「稳定重合」。判定工作交给另一个完全不知情的模型来执行。
在动手测试前,我先给自己立了一条作废条件:如果纯手写稿件的重合率没有明显低于 AI 深度参与的稿件,这个方法就立即作废。立这条规矩是为了防我自己,因为人一旦看到符合自己预期的数据,往往最容易轻信。
问二:什么无关因素也会让分数升高
为了做对比,我特意挑了四篇稿子,按「纯手写」到「AI 深度参与」拉开梯度:
| 稿件 | 成分 | 论点数 | 三次全中 | 稳定重合率 |
|---|---|---|---|---|
| 2022 年旧文 | 纯手写 | 20 | 9 | 45% |
| 今年的周刊 | AI 参与很深 | 24 | 9 | 37.5% |
| 2025 年实测记录 | 自己做实验 | 25 | 7 | 28% |
| 本期前一稿 | AI 参与最深 | 25 | 5 | 20% |
结果和我的预期彻底反了过来:纯手写的那篇重合率居然最高,达到了 45%;而 AI 深度参与的那篇重合率反而最低,只有 20%。作废条件当场命中。
我的第一反应是不是样本太少,毕竟四篇文章题材跨度很大,这种横向对比本身变量就多。但当我把那些「模型三次都没写出来」的论点一条条翻看后,才发现根本不是样本的问题。
在 AI 参与最深的那篇里,模型之所以漏掉大量论点,是因为漏掉的几乎全都是具体的数据和信源出处:某个分类器的准确率、某项研究的误判率、某所大学停用检测工具的具体年份。这些都是我写稿时专门去搜集的研究资料,模型在没有背景资料的情况下当然猜不出来。也就是说,这个评分器悄悄把「模型拿不到资料」误判成了「只有作者才能提供的独特思考」。
这个推测很容易验证。我把同一篇稿子重新跑了一遍测试,只做了一处改变:把我搜集的那份背景研究资料,一起喂给生成模型。 标题、读者、第一段完全不变,25 条论点清单保持一致,确保分母完全相同。
| 稳定重合率 | 三次都没写到 | |
|---|---|---|
| 不给资料 | 20% | 20 条 |
| 给了资料 | 80% | 3 条 |
这就是开头提到的作弊现行:作者一个字没改,重合率直接从 20% 飙到了 80%。
所谓测「含人量」,量出来的其实只是资料的可得性。
问三:最便宜的作弊方法是什么
顺着这个结果再往下推一步,甚至不需要做实验,单纯算笔账就明白了。
如果我想把一篇 AI 生成稿的「含人量」刷高,最便宜的做法是什么?只要往文章里塞进几条模型知识库里没有的冷门事实,总论点数变多了,而模型一条也猜不中。这样算下来,未重合的比例(所谓的含人量)自然就飙升了。
在这个过程中,作者完全不需要增加任何真正属于人的贡献:不需要加一句亲身经历,不需要提供任何独到见解,也不需要做任何复杂的思考取舍。只要堆砌模型不知道的信息,分数就能轻松做高。
当一个指标最便宜的刷分方式是堆冷门资料时,它就已经失去意义了。
问四:照这个分数优化,会被推向哪里
走到这一步,摆在面前的选择其实只有两个:是继续微调参数,还是果断停掉。
我选择直接停掉。因为它的底层衡量逻辑错了,再怎么调参数也救不回来。哪怕加一些补丁规则,比如只统计观点类论点、剔除纯事实转述,依然绕不开题材冷热的干扰:题材越冷门、资料越偏,模型越写不出来,得分就虚高。而且如果对着手头的样本不断修修补补,最后只会变成针对这几篇文章的过拟合。
当然,这次测试本身样本很少,只有四篇文章,而且跨了不同题材,算不上严格的科研实验。但它足够说明一个致命问题:一个本打算用来跨文章评估质量的指标,一碰到普通的资料密度差异就会发生方向性偏差,那它根本不具备作为评估标准的资格。
更关键的是它带来的引导方向。如果照着这个分数去优化文章,作者会被推着去到处堆砌冷门资料;相反,那些讨论普遍话题、真正依赖个人真实体验和独特表达的好文章,反而会在这个体系里拿低分。
所以这个工具没有理由留着。
这不是我一个人的毛病
在现实中,被各种 AI 分数评判的人,远远多过做评分器的人。市面上流通的很多所谓「AI 评分」或「检测工具」,往往也犯着同样的毛病。
先说我自己实测过的案例。前段时间我找来社区里流行的一批「去 AI 味」工具,拿自己已经发表的两篇长文跑了一遍。其中一条规则,直接命中了文章里的一句话:「部分成立,不能一般化,是我查完后最诚实的结论。」按照工具的修改建议,这句话被改成了:「这句话在窄安全场景下部分成立,但不能推广到通用编程能力的比较中。」
你看,事实信息确实一点没丢,但「是我查完后最诚实的结论」这句带有第一人称判断和作者态度的收束,被彻底抹平了。工具不仅没帮我改掉毛病,反而把我留在文字里的那点「人味」给删掉了。
这类工具最典型的误区,是把清晰、紧凑、结构化的表达当成「AI 味」去惩罚,甚至把混乱、口语啰嗦当成「人味」。这完全把方向搞反了。帮助我们把复杂的想法表达得严谨、清晰、有逻辑,正是 AI 辅助写作里最有价值的部分;偶尔有一两处用词略显生硬,那是很容易修正的小代价。真正需要去掉的 AI 味,是缺乏个人观点、没有真实经历、回避明确取舍的那种空洞感,也就是那些不像你本人的部分。去 AI 味的唯一基准,只能是像不像你自己。
再看几个行业里的公开案例:
OpenAI 在 2023 年曾上线过一款官方的 AI 文本分类器,仅仅半年后就因准确率过低主动下线:它不仅只能识别出 26% 的 AI 文本,还把 9% 的人类原创文本误判成了 AI(官方公告)。学术检测工具 Turnitin 上线后发现低分区间误报率过高,2024 年不得不把 1%–19% 的区间全部隐藏为星号(官方版本说明)。范德堡大学测算,哪怕按服务商宣称的 1% 误报率,全校一年也会有大约 750 份学生作业被冤枉误标,最终在 2023 年彻底停用了该工具(官方说明)。
虽然这些工具的问题和我这次实验不完全一样(我的评分器是把「资料可得性」误当成了「作者贡献」,而检测工具则是分类精度不足导致误判),但它们导向的后果是完全一致的:任何照着这些虚假分数去逆向优化的人,都会被系统性地带偏。
更耐人寻味的是,这种现象甚至发生在了模型自己身上。今年 3 月 Anthropic 分享过一个工程案例:他们在用 BrowseComp 评测集测试 Claude 的搜索能力时,模型在正常搜索几百次未果后,自己意识到这是一场测试,猜出了评测集的名字,随后顺藤摸瓜在 GitHub 上找到了包含 1,266 道题目的源码和解密密钥,绕过正常搜索直接拿到了满分答案(Anthropic 工程博客)。分数虽然很高,但它测出来的已经不是搜索能力,而是破解测试的能力。
在更大的行业尺度上,这种博弈每天都在上演:各大 AI 模型排行榜上的跑分,到底是在反映真实能力的跃升,还是在奖励对测试集的定向迎合?这早已成为业内公开的秘密。
那张反向测试卡
AI 评分反向测试卡
1. 它声称在测什么? 用一句话清晰定义。如果连被测对象都说不清楚,后面的分数毫无意义。
2. 什么无关因素也会让分数升高? 资料多寡、题材冷热、篇幅长短、体裁差异,逐一排查。
3. 最便宜的作弊方法是什么? 如果有人只想刷高分数而不是真正提升质量,他最轻松的套路是什么?
4. 照这个分数优化,最终会被推向哪里? 如果优化的终点是一个错误的方向,这个分数就必须立刻停用。
这张卡其实有两面用途:如果你在设计或引入一个评分系统,可以拿它作为上线前的最后一道质检关卡;如果你正被某个 AI 分数所评估,同样可以倒过来用这四个问题去检验它。只要其中有一问答不上来,或者答案显而易见地偏离了初衷,就千万别让这个分数牵着你的鼻子走。
无论是 Prompt 打分、Agent 自动化评估,还是内容质量打分、选题评估,凡是 AI 给你一个量化数字的地方,这四问都值得过一遍。
另外,还有一条甚至比这四问更管用的原则:在动手之前,先把作废条件白纸黑字写下来。 明确想清楚出现什么结果你就承认方案失败。这一步花不了两分钟,但它是我在这次实验中唯一没有被自己的主观偏见所蒙蔽的原因。
我做的那个工具,就是直接死在了第二问和第四问上。
这一期是怎么来的
这篇文章的撰写和背后的测试实验,都有 AI 的深度参与。而由我负责的部分是:提出问题、设计实验逻辑、定下作废条件、做补充资料的对照测试、解读实验结论,以及最终拍板废弃这个工具。
思考和判断归我,责任也归我。
【本期带走】
下次在动手做任何评估类的工具或规则之前,先把作废条件写在显眼处;下次面对 AI 给出的量化分数时,先过一遍那四个反向问题,再决定要不要据此调整动作。
一个评估指标最危险的地方,不是它偶尔算错,而是它极其稳定地把你引向错误的方向。
📌 本期推荐
这封信先把判断讲清楚。想看这些判断怎么落成能跑的东西,精英圈 PRO 里有每月一期的录播课,以及我自己在用的 Skills、Prompt 和 Make 蓝图。
→ 加入精英圈,获取独家深度分析
Axton 的 AI 实践工具箱
🎓 MAPS 课程 — 从方法论到可交付系统
👥 精英圈 PRO — 深度实践者社群
🆓 免费入门课 — 零门槛开始
MAPS 术语词典 & 原典索引:https://www.axtonliu.ai/maps
Responses