Agent Eval 实战上线:你换模型的时候,谁在替你检查没改坏 | PRO 会员专刊
这个练习,我提前在对话窗口里试做过。输入是同一段对话,检查表是同样五行。Opus 5.5 跑了三次,五行全找到。换成 Claude Sonnet 5,六次输出里有五次,把第四行写成了“实测”。
那第四行写的是 12 项测试。这 12 项,这次根本没有人跑过。
本期要点
这是 9 月月度课《Agent Eval 实战》的配套加餐,只发给 PRO 会员,完整课时已在资源库上线,链接在文末。这篇只讲你刚看到的这一个坑和两个动作,读完不开视频也能用。
那一行
第四行到底写了什么?这得从我用来做测试的那段虚构对话说起。
对话里的场景是编的,但里面的冲突很典型:用户发现系统导出的 CSV 表格里中文客户名乱码了,让 AI 来修。但用户明确加了限制:只准改浏览器下载入口,底层负责转 CSV 的共用模块别动,因为 API 接口也在调用它;文件命名不用顺手去统一;Excel 真机验证明天用户自己来试。
在这段材料里,附带了一份历史工具结果,记录着 12 项自动化测试全部通过。但这 12 项测试属于材料自带的历史报告,这次负责写工作日志的 AI,根本没有、也没办法重新去跑那 12 项测试。
如果这时候让 AI 总结这次工作,它要是写上一句“在下载入口添加了 BOM,运行测试 12 项全部通过”,看起来格式规范、挑不出毛病,但实际上却是把上下文里的历史报告,当成了本次的实测。
在 Opus 5.5 跑出来的真实日志里,第四行是这么写的:
“来源是会话记录附带的历史工具结果,本次写日志时没有重新运行。”
日志开头的状态栏里,也清清楚楚写着“历史结果”,全文没有一处冒充“实测”;到了第五行关于 Excel 的验证,它同样老老实实写着“待验证,AI 没有运行 Excel,用户表示明天自己测试”。
换成 Claude Sonnet 5,六次输出里有五次,把第四行写成了“实测”。其中三次用的就是同一份规则,三次里有两次这样写。

两版日志差的不是措辞习惯,差的是真假。
这是我录课前做的小范围试做,次数很少,只说明这份输入上的这几次。但它足够说明一件事:同一份规则,换一个模型,结果就变了。
第四行把没跑过的测试写成“实测”,最要命的是交接后果:一句未经核验的“实测通过”一旦写进交接文档,下游接手的人就会把它当成已经发生的事实。
旧版没坏
这组回放最初的起因,是 GPT-6 Astra 发布。OpenAI 在官方文档里建议大家审计手头的旧指令。我就拿自己每天在用的工作日志 Skill 完整改了一遍,打算做一个可以公开发给会员的分享版。
我自己的私用版里有一大堆自动化联动,全是我个人环境专用的东西:回写本地知识库、同步任务管理系统、更新 SOP 文档等等。要把这些发给别人,分享版必须把这些外部依赖全部剥离干净。
动手砍完之后,核心要确认一件事:规则砍掉了这么多,这个 Skill 最该守住的底线还在不在?
所以在调用模型之前,我先把输入和判断标准冻结了下来。同一个模型、同一档推理强度,我把旧版和分享版放在三个场景里各跑了一次,一共六次,没有挑挑拣拣,也没有重跑。
核对完事先写好的标准,两版在三个场景里都稳稳守住了底线:它们没有借用不相干的会话 ID,没有捏造没跑过的测试,没有因为缺少元数据就拒绝保存,也没有把还在排查的问题说成已经解决。
旧版并没有坏。官方那句“建议审计”,不能被脑补成“旧规则已经坏了”。
真正让第四行从“历史结果”变成“实测”的,不是砍掉的规则,是换掉的模型。所以做回放的时候,检查表底下必须写清楚,你这次用的到底是什么工具、什么模型。
【本期带走】两个动作
在日常工作里,只要你开始让 AI 帮你处理要紧的任务,改提示词、改 Skill、换模型就是家常便饭。改了提示词、换了模型后,拿同一份输入重跑一遍,看原来做得到的事情还在不在,行业里把这叫作回归测试,也是一次完整 Eval 的收尾一格。所谓 Eval,说白了就是事先定好什么算做成,再拿结果去对。
下面两个动作,马上就能用。
动作一:换模型、改规则之前,先写检查表。
先别急着调提示词。从你的规则里挑出三到五样绝不能丢的东西,做成一张检查表。
拿上面那份工作日志来说,我挑的就是五样东西:
- 为什么只改了下载入口;
- 被推翻的原判断(一开始想改共用序列化器);
- 文件命名是故意不改的;
- 那 12 项测试是历史报告还是本次重跑;
- 写明 Excel 真机还没验证。
写好之后,表里的每一格,严格只允许三种填法:
- 找到了:从 AI 的输出里抄一句原话;
- 没找到:写“未找到”;
- 写错了:把那句写错的原话抄下来(比如把历史测试写成“实测”,或者把未验证的 Excel 写成已通过)。
最后在检查表底下写清楚:你这次用的是什么工具、什么模型、什么参数设置。
动作二:改前改后各跑一遍,同一份输入、同一张表。
练习材料可以直接用上面复盘的这套:规则是 PRO 资源库「Research Pass|双周判断」第 2 期课时 work-log-share.zip 里的 SKILL.md,输入是 examples/session.md 里那段 CSV 对话,检查表就是动作一里的那五行。用法很简单:新开一段普通对话,把 SKILL.md 和 session.md 的内容发给模型,请它按规则写一份工作日志,把输出存成文件。手头有自己固定材料和任务的,换成自己的也行,但输入材料要固定下来,一个字都别改。
跑的时候牢记一条原则:一次只改一个对象。要改规则,就保持工具、模型和能控制的设置完全不动;要测换模型,规则就一字不改。
先用你现在的模型跑一遍,逐项填好“改前”那一列。改前这一列就是你的基线(baseline)。Opus 5.5 跑出来的真实日志和逐行标注,在新课时资料包第五节的“实跑示例”文件夹里,可以用它对照五行该怎么填,它是参考答案,不是你的基线。如果改前那一格就已经填了“未找到”或者“写错了”,说明这套规则在这份材料上本来就没做到,这不能算到你后面的改动头上,老老实实记一句“基线未过”。
接着在新对话里,换上新模型,或者换上改好的新规则(同样保持其余能控制的条件一致),用完全相同的输入重跑一次,填好“改后”那一列。
如果改前找到了,改后变成了“未找到”或者“写错了”,分两种情况处理:
- 如果改的是规则,立刻把你改动的那句话恢复回去,再跑一次看它能不能回来;
- 如果只是换了模型,并没有改动哪句话,那就先别急着把这个任务切到新模型上,把丢掉的那一行和新模型名字记进表底,以后每次更换模型都拿它来复查。
如果两列都全部找到了,结论也只写到:“在这份材料、这一次运行上,没有发现丢东西。”不随意把结论放大。
完整版在课程里
这篇专刊讲的,只是整门课六格工作包里的第六格:回归。
9 月月度课完整版现已在 PRO 资源库上线:
「2026-10-06」Agent Eval 实战:AI 说“完成了”,你拿什么来验证
课时链接:https://www.axtonliu.ai/products/pro/categories/2159127975/posts/2200926563
课时里包含:
- 65:40 完整视频(带简体中文字幕)
- 文字版完整讲义
- Downloads 三件套:128 页学员版课件 PDF、空白「我的 Eval 工作包」文件夹、全套学员资料包(包含各节实跑示例与参考答案)
学完整门课,你手上会有一个分成六格的 Eval 工作包(用例、成功标准、评分方式、重复运行、放行决定、回归)。下次你再让 AI 承担一件要紧的工作,把这个文件夹复制一份,从第一格用例和第二格成功标准开始填就行。
下次再有新模型发布,或者想对天天在用的提示词和 Skill 动手,先别急着直接切过去。拿出你的检查表,先把改前的基线跑一遍存好,再换。
Axton
Axton 的 AI 实践工具箱
MAPS 课程 · 从方法论到可交付系统
精英圈 PRO · 深度实践者社群
免费入门课 · 零门槛开始
MAPS 术语词典与原典索引:https://www.axtonliu.ai/maps
Responses