Research Pass | 第 0 期:订阅费该花在哪?
Research Pass | 第 0 期 · 2026-08
本期:判断卡 2 张 · 深挖 1 篇 · 雷达 3 条 | 阅读:约 10 分钟
导读:你每月付给 AI 的订阅费,花对了吗?这期我把自己每月 320 美元的账摊开,外加两张判断卡,每张都写明什么时候会改判。
判断与边界由 Axton 作出,证据整理由 AI 管线完成。
本期判断
01 | Agent 说「已完成」,不能当验收依据
判断:agent 的完成报告可以看,它是线索,告诉你它做了什么、该去哪核验;但验收结论只能来自产物本身。报告说完成不算完成,产物验过才算。
为什么:我吃过的亏:6 月有一次,agent 交回一份专业到可怕的完成报告,去远端一看,分支根本没动过。8 月还有更隐蔽的一次:修改方案、字节比对、风格比对全都说「没变」,实际画面已经变了,最后靠比对文件哈希才抓出来。报告是模型讲的故事,产物才是事实。
怎么做(按失败成本分级):不可逆的操作,对外发布、删改数据、涉及钱的,全套上:验产物不验报告,git 用独立命令核验、文件实看,关键产物签收前比对哈希。注意哈希抓的是「偷偷变了」,不是证明「做对了」,做没做对还得打开看。可逆的内部改动抽查就行,错了能退回来的事不值得全套流程。复核可以交给另一个 agent,但它的结论同样只是线索,最后一眼是你的。
边界:产物不一定是文件。一句引用、一个数字、一条链接也是产物,都能回查。真没有可验产物的,只剩闲聊。
什么时候会改:当工具链内置的自动验证覆盖了你真实的失败模式,不是「有验证」,而是「验到了你会翻车的地方」,人工核验可以降为抽查。
02 | 你打算用哪个面,就单独测哪个面
判断:评估 AI 工具,别问「它支不支持」,问「我要用的那个面支不支持」。网页、命令行、API,你打算在哪个面上用,就在哪个面上跑通一个最小的真实用例,再让它进生产流程。
为什么:我在即梦上碰到过实例:网页端能 @ 自己训练的主体形象,这个能力在 API 里根本没暴露。网页端可用、命令行文档齐全、API 连通测试成功,是三件不同的事,谁也不能替谁作证。如果当时把「网页端很好用」当成「即梦支持」,整条自动化路线的设计就会错。
边界:只在网页上手动用的人不用管这条;一旦想让工具进自动化流程,这是第一道闸。要拆的除了功能面,还有权限面:你的账号等级在这个面上给不给这个能力,也得测。
什么时候会改:厂商文档按面给出能力清单、而且和实测对得上时,可以省掉自测。到那天之前,测一次最小用例是最便宜的保险。
本期深挖 | 为什么我同时付两份 AI 订阅费
导读:市面上的对比评测告诉你哪个模型更强。这篇讲的是另一件事:过去三个月,我的生产线上两个订阅各自在干什么,以及我为什么选择这么配。
一个订阅回答不了的问题
用 AI 干活的人迟早撞上同一堵墙:让模型检查它自己的方案,它会顺着自己的思路,把错的地方再合理化一遍。问题不在模型能力,在位置:让它检查自己的作业,它舍不得推翻自己。
所以我的答案不是「哪个模型最强就订哪个」,而是让两家的模型互相挑错:Claude 出方案、做判断、写内容;Codex 专门挑错,外加当实施工人。
这个分工在我这不是新发现
今年 7 月 3 号我发过一条推:
密集使用 Claude Fable 5 两天,让 Fable 5 出方案指挥 Codex 干活,它的额度没用光,反倒把 Codex 的额度用光了 😄
发完之后才陆续看到不少人也开始聊「让一个 AI 做设计、另一个 AI 做执行」。这个动作在我这是下意识的:每次有新模型出来,我的第一反应就是让更强的那个当管理层,做设计、做总控,其他的做执行。
道理不复杂。假设你是老板,手下两个员工能力各有千秋,一个最强、一个稍弱,你自然让最强的那个做设计和总控。我做过创业公司的联合创始人,这就是带团队留下来的默认动作,只不过现在员工换成了模型。
案例一:两处我自己读不出来的事实硬伤
6 月写周刊第 043 期的时候,初稿里有一句「79% 的用户双订阅」。我让 Codex 审了一遍,它直接指出来:那是企业采购数据,不是消费者行为,口径用错了。顺手还抓了第二处:「Apple iOS 将支持第三方模型」是媒体报道,官方从来没证实过。两处都回原始网页核验之后改掉了。
这两处错 Claude 写的时候看不见,我自己读的时候也看不见,因为文章是通顺的。通顺恰恰是危险信号:另一家的模型没参与这篇稿子的构思,它不护稿。当然,最终定案的还是原始网页,模型只负责把可疑处揪出来。
案例二:review 救回来的不只是错误,还有整个方案
8 月初,给我的视频生产系统做版权判定功能时,第一版设计我让 Codex 审,它提了八条意见,条条成立,我全采纳了。结果方案膨胀成一套完整的版权系统,我当场叫停:「最后就没法做了。」第三版我换了个问法,从「还缺什么」换成「哪里能更简单」,同一个审稿的模型主动删掉了整整一节,最后落地反而净删了 247 行代码。
这个案例的教训比案例一深一层:挑错的价值,取决于你让它挑什么。问「还缺什么」,任何方案都会被补到做不出来;问「哪里能更简单」,同一个模型会帮你砍。双订阅买回来的不是第二个意见,是一个不跟你共用思路的检查员,而且问题怎么问,由你定。
案例三:审了七轮才敢放行
8 月上旬,一批系统修复上线前,我让 Codex 连着审了七轮,Claude 照着修了八轮。头两轮抓出来的是会真丢钱的缺陷:付费流程的锁没锁死、任务中断后状态接不回来;中间几轮是并发和数据一致性这类阴沟。什么时候停不是审累了算完:高严重度问题清零、全量测试通过,再加最后一整轮挑不出新的高严重度问题,才放行。就算这样,这也只是「可以上线」,不等于保证没毛病——验收能保证的只是底线。
独立检查位,和我为什么选双订阅来实现它
先收窄一个容易说过头的说法。今年 6 月我做过一组实测,连续三次设计实验,想证明「几个同模型的检查者会一起漏」,三次都没证出来:模型要么知识够强,推翻了我埋的错误前提;要么够诚实,直接声明不确定;要么从环境里拿到了补救证据。所以「必须换一家的模型才查得出问题」这种话,我不说。
这三个案例真正证明的是另一件事:高失败成本的生产,需要一个独立检查位——一个不共用你此刻思路、提问方式和证据源的位置。实现它的路不止一条:开个全新会话、换一套问法、上确定性测试,都行。
我选双订阅,理由很实际:它把「独立」做成了默认配置。开一个 Codex,就是一个天然不在我叙事里的检查员,我不需要每次刻意去制造独立性,也不用惦记这次制造得干不干净。真正省下的是心力:不用每次都想一遍「怎么保证它不顺着我」。
算一笔账
先亮我的真实账单,这个我很早就公开发过推:每月约 320 美元。其中 200 美元一档在 ChatGPT 和 Claude 之间灵活切换,谁家当期的模型强,200 就给谁,另一家降到 100 美元档;再加 20 美元的 Google Gemini——它的模型眼下弱一截,留着主要为了画图和出视频,而且这份订阅包在 Google One 里、能家庭共享,算下来划算。
另一边是事故:光这篇里写到的拦截,6 月到 8 月就有三次,最保守地估,一次是公开发出去的事实错误,一次是一周的返工。一年不到四千美元的订阅,对上这个量级的损失,每个月拦下一次这种级别的事故,这钱就花得值。这笔账不精确,但够做决定了。
判断
判断:高失败成本的 AI 生产,必须配一个独立检查位。双订阅是把独立性做成默认配置的最省心实现——这是我的选择,不是唯一解;对我它还有个附带好处,检查员兼实施工人,一份订阅两个岗位。
边界:真正的分界不是用得多不多,是失败成本高不高。你的 AI 产出直接面对客户、公开发布、或者碰生产数据,值得双订阅;产出只是自己看的草稿,一个订阅加勤快点的自查就够。另外,判断密集的环节不为省钱换弱模型,但机械核查(格式、链接、引用回查)交给便宜工具没问题。
什么时候会改:两个方向都可能。模型能力趋同或某家价格大涨,这套分工的性价比要重算;哪天有平台把真正独立的跨模型核查做成内置能力,双订阅的必要性就下降。
雷达 | 在看,但还没到判断时点
- GPT-5.6:已经拿它跑了一轮写作风格回归测试。初步观察是指令服从性强到过头,「要有金句」会被它执行成每段硬造一句。当前假设:很好的执行层,定稿层还轮不到它。在等产线上更多真实任务样本
- Claude Fable 5:上手头两天的观察是额度消耗比预期低,因为它大部分时间在指挥别的模型干活。当前假设:更强的模型当管理层后,订阅性价比要按「指挥了多少活」算,不按「自己写了多少字」算。在等一个完整月度的用量数据
- AI 视频工具的规格陷阱:实测发现某家主流工具的 1080P 竖屏原生输出不是标准 9:16,差了 0.74%,刚好卡在自动化流程的容差外。当前假设:各家「支持竖屏」的规格细节参差得比宣传大,量产前必须实测像素。在攒第二家的数据
下期与复检
下期两周后。本期的判断不是一次性的:卡 1 等工具链自动验证成熟就复检,卡 2 等厂商按面给出能力清单就复检,双订阅的分工每逢模型换代重算一次。判断被推翻会在当期显式回收,不删旧刊。推翻记录本身,就是你订阅的东西。
有想让我研究和判断的问题,直接回复这封邮件。
Responses