我不要一个跟我一模一样的 AI | AI 精英周刊 045
周刊停了六周。从这封起恢复。
本期要点
Noren 的写作盲测量化了一件事:同一个模型 GPT-5.6 Sol,裸跑的平均盲评名次是 11.61,给一份作者档案之后升到 5.56,全场最好的两篇都出自它。但档案的目标不是让 AI 写得跟你一样,做成了也是失败。你要的是一个理解你之后比你写得更好的 AI。区别在于:句式模板只能教表层模仿,判断依据才约束得住它的取舍。本期带走一条可以今天就改的东西:把 prompt 里的禁用词表改成动作规则,判断方法是问「这条禁令禁的是词,还是姿势」。
【信号】
Claude Code 从 8 月 14 日起默认打开 auto mode。 Pro、Max、Team 计划的新会话不再逐条问你批不批准,改由一个分类器拦下不可逆、破坏性、以及伸到你环境之外的操作。官方公布的理由里有一个数字值得盯一下:1053 名付费用户的内部测试中,人工逐条审批只拦住了 13.6% 的危险命令,auto mode 拦住 89%。原因是审批疲劳,用户对 97% 的弹窗是反射性点同意的。(Anthropic 官方说明)
我的批注:这个改动我赞成,13.6% 那个数字说明逐条批准这件事早就形式化了。但它把「人在环里」的位置挪了一格。以前你守在每一步的入口,现在你得守在出口,验它交出来的东西,而不是它问你的那一下。
Sonnet 5 的入门价永久保留。 每百万 token 输入 2 美元、输出 10 美元,原定 9 月 1 日涨到 3 美元和 15 美元,现在取消了。
我的批注:批量改写、资料整理、格式转换这类活的成本模型直接变了。这类活本来也不该用最贵的模型跑,现在更没有理由了。
一个未发布的研究版 Claude 推进了黎曼 zeta 函数。 Anthropic 说它把零点满足猜想的比例下界从 41.6% 抬到 67.2%,36 小时、3100 万 token,越过了人类 46 年的累积进展。做法是把两篇已有的论文接上,不是发现新数学,中间大约 60 个 subagent 先生成了 650 个失败的想法。Anthropic 同时说明,这条技术路线不会用来证明完整的黎曼猜想。(研究说明)
我的批注:最该看的是它怎么赢的。不是想出了人类想不出的东西,是把两个已经躺在那里、分属不同子领域的结果接上了。模型的产出取决于你让它接触到什么,这件事在数学上成立,在写作上也成立。下面这篇讲的就是后者。
这三条放在一起有点意思。工具在替你把关,价格在往下走,模型开始解人类解不动的题。那么接下来限制你产出的,还剩什么?
上周我想搞清楚一件事。写中文文案,Opus 4.6、Opus 5、Sonnet 5、GPT-5.6 这几个,到底哪个更像人。
我把公开测评、社区反馈、官方说明按同一套口径捋了一遍,排了一次序。排完之后一眼就能看出来,第二行跟别的行不一样:八行里只有它后面挂着一个条件。

这是我 2026 年 8 月的工作排序,用途限定在中文文案写作,不是 benchmark。我没有找到覆盖这些全部版本、专门测简体中文文案的高质量盲测,所以它综合的是官方说明、英文写作盲测、少量中文对比和社区长期反馈。
别的行都是一个模型名字,就它后面挂了半句话。我花两天要找的那个答案,就卡在这半句话上。
那半句话值多少
Noren 做过一场写作盲测,评委不知道稿子出自哪个模型。四个模型、两种条件、每种三个样本,一共 24 篇,六位盲评按文笔、场景处理、情感与道德层次、指令贴合度打分。
第一轮直接写,GPT-5.6 Sol 的平均盲评名次是 11.61,落在 GPT-5.5 的 7.50 后面。
第二轮唯一的变化,是先给它一份写清楚的作者档案。Sol 的平均名次到了 5.56,是全场提升幅度最大的模型。这场测试里最好的那篇和第二好的那篇,都出自带档案的 Sol。
同一个模型,同一批题目,中间只隔着一份文件。
这里得说清两件事,不然这个证据会被用过头。一是它测的是虚构写作,史诗奇幻这类题材,我要的是中文文案,两者的差距比英语和中文的差距还大。二是「产出了全场最好的两篇」和「模型整体排到第一」不是一回事,它的平均名次是 5.56,不是 1。
所以它能证明的只有一件事,但这件事够了:一份档案能在同一个模型身上撬动多大的位移,被量化出来了。我那两天在比的是各家的默认值,而默认值上面还有一层,那一层归我自己管。
这里也要把话说准。模型本身当然有硬上限,推理、语言、工具能力都是它给定的,一份档案变不出来。只是大多数人在碰到那个硬上限之前,先碰到的是自己这一层。
模型不知道的是什么
裸跑的模型为什么容易平庸,Anthropic 在自己的模型说明里给了半个答案。它说 Sonnet 5 按字面理解提示,不会把一条指令悄悄推广到别处,也不会替你推断你没提的要求。关于 Opus 5,它说默认的可见回复和成稿会比早几代 Opus 更长,建议你明确要求简洁或者给一个目标长度。
这些说的是指令遵循和篇幅,不是写作水准。但顺着它往下想一层,我的判断是:模型手里没有的信息就那么几样。你的读者是谁,已经懂到哪一步。你这篇要多长,为什么是这个长度。你哪些词从来不用,哪些判断你有把握下,哪些你会明确说自己不确定。
这些都不在模型里。缺了任务和作者的上下文,它更容易回到高概率的、通用化的那种表达。写出来的稿子有个共同特征,什么都对,什么都全,读完记不住是谁写的。
回头看榜首那个 Opus 4.6,社区里说它最好用的人,看重的是改动少,交出来的稿子不必推倒重写。这仍然是在挑默认值,只不过挑到了一个离自己近一点的。挑默认值的天花板就在这儿:你往往只是在别人的平均值里,挑一个当下最不别扭的。
AI 写作要懂我而不是复制我
到这一步有个很容易走岔的地方,我自己也差点走岔。
给模型一份作者档案,听起来目标是让它写得跟你一样。真按这个标准做,做成了也是失败。
我的写作这几年一直在往上走,今年的稿子比去年好,明年还会更好。模型要是写出来跟我一模一样,我等于花了很大力气,把今天这个水平固定下来。
我要的是另一件事。它得懂我这个人,落笔像我,判断像我,该冷的地方冷,该停的地方停。同时它的写作水准要高过我,高到能把我往上拽。
你要的不是一个模仿你的 AI,是一个理解你之后比你写得更好的 AI。
这两件事在档案层面的区别很实在。前者要你交出句式模板和口头禅,后者要你交出判断依据。你为什么认为这个观点站得住,你在哪一步会停下来承认不知道,你凭什么敢这么下结论。句式模板教会的是表层模仿,判断依据才约束得住它的取舍,让它知道你在往哪个方向使劲,然后用比你更好的语言把那个方向走完。
档案里该有什么
按这个标准,我的档案里管用的是三类东西。
第一类是真实范文,而且要标清楚哪几篇是纯手写的。把 AI 协助过的稿子混进去当范本,等于让它对着自己的旧输出学,学出来的那点味道是它自己的。
第二类是红线,写成动作而不是词表。禁一个词,模型换个词接着干同一件事。我的档案里有一条禁「爹味」,它禁的不是某几个词,是居高临下这个姿势。「你有没有想过」「很多人都忽略了」「说实话大部分人」,字面完全不同,姿势一模一样。红线写在姿势上,模型换什么词都绕不过去。
第三类是认知动作。介绍新东西先画边界,引用别人的观点先检查类比准不准,讨论热点会突然把尺度拉到十年。这些是判断习惯,不是修辞。它们决定了模型能不能站到比我高的地方还不走样。
至于档案本身,我只多说一句。它一旦被复制成好几份分别喂给不同模型,又被分别手改,就会各自漂移,你会在某天读到一篇怪稿子而查不出原因。让副本从源文件生成,别手改,这件事的成本很低。
所以
回到那张榜。它没有错,Sol 上限高,Opus 4.6 顺手,Sonnet 5 便宜量大,这几句都成立。选模型这件事仍然有意义。
只是整张表说的都是同一个前提下的排序,而那个前提写在第二行的半句话里。你把自己那份东西准备好,排序才开始有意义。没准备好的时候换模型,换来换去都是在别人的平均值里挑。
榜单第一名不会替你写出你的文章。它只会更快、更完整、更漂亮地,写出所有人的文章。
【本期带走】
把你 prompt 或者规则文件里的禁用词表,挑一条改成动作规则。
判断方法一句话:这条禁令禁的是词,还是姿势? 换个词就能绕过去的,它禁的是词。
上面那条禁「爹味」的红线,两种写法长这样:

词表版模型照办,然后写出「不妨设想一下」,一个违禁词没有,姿势原封不动。动作版它绕不过去,因为禁的是位置。
今天只改一条就够。
📌 本期推荐
这封信写的是判断,不是教程。想看这些判断怎么落成能跑的东西,精英圈 PRO 里有每月一期的录播课,以及我自己在用的 Skills、Prompt 和 Make 蓝图。
→ 加入精英圈,获取独家深度分析
Axton 的 AI 实践工具箱
🎓 MAPS 课程 — 从方法论到可交付系统
👥 精英圈 PRO — 深度实践者社群
🆓 免费入门课 — 零门槛开始
MAPS 术语词典 & 原典索引:https://www.axtonliu.ai/maps
Responses