视频里我说「心里有底了」,其实没有:AI 能干的越来越多,人还剩什么 | AI 精英周刊 048
9 月 23 号下午,我在给剪视频那期写开场。那天 Opus 5.5 把我 17 分钟没剪过的口播过了七道工序,剪出来的每一条我都听完了。开场最后一句我是这样写的:「至于人到底还剩下什么活要做,看完这期你心里就有底了。」写完,我在后面加了个括号:「也许是更没底了……我其实看完确实没底了。」
视频里我把这个「没底」解释成:执行的活都被机器干了,什么算好、什么算交付,得靠你自己拿捏,验收的责任永远在人身上。那是视频里给的解释,但它没说到最让我没底的那一层。真正让我没底的是,AI 能干的活越来越多,留下能给人来做的事情,感觉已经不多了。这是一种挺大的危机感。
这一期不讲参数,也不排名。我讲这一周三件真实做出来的东西:一支剪好的短片,一张会自己作画的宣纸,一支给我的书做的宣传片。每做完一件,我原本以为得自己来的活,就又少了一样。
本期要点
这一周我用 Opus 5.5 做了三件真实作品:剪视频时,它从 17 分钟原片里找回一句原话把短片圆了回来;给一段开放提示词、花了约 23 分钟,它自己决定做出一张会作画的纯 HTML 水墨宣纸;做宣传片时,我刚给它提完具体的构图修改,紧接着就说了「我相信你的审美,就按照你的计划来」。每做完一件,原本我以为得自己来的活,就又少了一样。
剪视频:切点,和一句找回来的原话
剪视频这件事,我的预期不是被一次性掀翻的,而是分成了两步。
第一步其实发生得更早一点。在短视频里挑内容、找切点,做过视频的人都知道有多麻烦。我自己专门做过一个剪辑工具 HighlightCut,所以很清楚切点有多难调。9 月 22 号深夜,我先拿 GPT-6 Astra 测了一轮抠字。那是一段口播切片,我听完之后自己写下了一句话:「效果比我预期的要好。第一句话它切掉的完全听不出来,第二句话稍微有一点点的声音,可以听到它切了一下,但是这个效果我觉得真是不错呢。」
那一轮 Astra 也暴露了一个明显的毛病:多段拼接之后,段落之间的「语言转场不够流畅」,原话直接拼在一起,语意跳跃比较大。
到了 9 月 23 号上午,刚发布的 Opus 5.5 讨论热度很高。我想既然要做测试,不如换它重跑。还是那段 17 分钟没剪过的原始口播,中间有卡壳、重说和语气词。整个会话里人工输入只有 7 条提示词,其中一条是后面的修改请求,全程没有人工在剪辑软件里动刀。
片子一条条出来,我挨个听。
在第一条短片里,它把我的一处改口留下了:我先说了「方法」,紧接着改口说「手法」。它在后台生成的报告里写,如果这是改口,那是一处没删掉的改口;但我听完觉得,这恰恰是我一个极其自然的改口,它不算是错误,留着反而顺畅。它把这种自然的口语表达留住了,却干净地删掉了两处多余的小动作和中间卡壳重说的大半句。
到了细抠字句的版本,我特意留意了接缝处的听感。画面因为切除了多余字词确实有轻微跳切,但耳朵里完全没有出现那种短促的、没切干净的跳音。当时我在记录里写了一句:「声音没有出现这个跳动的声音,没有出现短暂的这种没切完整的跳音,这一点是比那个 GPT-6 Astra 更强的。昨天 GPT-6 Astra 切的时候它是有跳音的。」
这是同一段 17 分钟口播、同一套提示词,只换了模型后的一次真实听感。虽然算不上严谨的横评,但接缝处的平滑确实超过了昨天的表现。
真正让我意外的是第二步,它发生在一次修改里。
当时第二条短片剪出来,四个段落围绕着同一个主题,接缝也算规整,但第三段的开头第一句是:「这项能力的核心就从来没有变过。」问题在于,前半段里根本没有出现过「这项能力」具体指什么,和 Astra 那轮一样,语言出现了断裂。
复核时查出了这个跳跃,按事先定好的修改模板,给它发了一条修改提示词,写得很明确:想办法让过渡自然,可以换第三段的起句、换一段、或者调整段落顺序,但绝对不能加我没说过的话,也不能改我的意思。
既然限定了「不能加我没说过的话」,它的办法是去原片里找我说过的话。
它回到那段 17 分钟的原片里,在原片 7 分多钟的位置找回了我说的另一句话:「具体的技巧肯定会变,但是现在把意图讲清楚的能力永远不会过时」,插在第三段前面当成了新的起句,顺带切掉了紧跟在后面的「但」字。
它甚至还在报告里自己交代了一句:这句原话在母片里其实是回顾 2024 年时说的,搬到这里,原来的语境其实有所损失。
我听完那个版本,在记录里写:「它没有删句子,然后找了一个我说的话,我觉得找的很合适,基本上就把这个短视频整个就给圆回来了……这确实挺让人惊讶的。」
写下这段评价十三分钟后,我在开场文稿里打下了那个括号:「也许是更没底了……我其实看完确实没底了」。
七道工序和剪出来的短片,都在这期视频里:Claude Opus 5.5 剪视频,真的像别人说的那么神吗?

墨韵与鹈鹕:当我不指定做什么
剪视频好歹还是我拆了工序,告诉它每一步要干什么。到了 9 月 24 号上午,我连做什么都没给。
那天我给 Opus 5.5 发了一段完全开放的提示词,原话是:
「你是opus 5.5,当前世界最强模型,请发挥你的想象力,动用你所有的能力,做一件事情,让每一个看到你的结果的人,无论是AI专家还是不懂科技的文科生?小孩子,看到后都会惊叹,opus 你真是太厉害了。你会做什么事呢?」
我没有指定做一个水墨网页,更没有提流体模拟。
大概 23 分钟之后,它把作品交到了我手上。在这 23 分钟里,我没有任何一条补充指令。它自己决定做一张会自己作画的水墨宣纸,起名叫「墨韵」。事后回看它当时的版本记录,从 v1 到 v4 是它自己截图、自己看出墨被搅成了一团云、自己改代码收敛算法。
交出来的东西只有一个 HTML 文件,除了加载 Google Fonts 之外没有任何额外的库和图片音频文件。按照它自己的说法,底层是实时解流体方程,手指划过去,墨迹会在纸纤维间洇开,同时用物理建模实时合成古琴的五声音阶;点一下按钮,一只看不见的手会按照古人的笔序从远山画到点苔,最后题诗、盖上一方「克勞德印」。每次按按钮重新生成,山形和诗都不一样。

看到这个效果,我接下来做的事,就是问它怎么存到自己的目录里、怎么发布出去让大家都能实际用一下,最后把它放到了 GitHub 上开源。现在任何人都可以打开 墨韵在线页面 自己画几笔,源码在 GitHub。上面那段提示词也可以原样发给你手边的模型,看看它会做出什么。
这一次,连做什么都不用我替它想了。
但同一时期还有另一面,就是前一天晚上开始跑的「鹈鹕骑自行车」。
网上很多人拿画鹈鹕考模型,我看得审美疲劳,前一天晚上就让它用任何技术画一个最精美的鹈鹕骑车动画。它用纯数学写出了一个 38 秒的视频,夜里渲染完成。
就在墨韵正在生成的那个上午,我在鹈鹕那边发了一条消息,给它浇了一盆冷水。我的原话是:
「如果不告诉别人你没有用任何的这种 3D 建模的技术,那第一眼看上去并不会觉得很惊艳……你是不是走到了一个……只有行家才能懂的这个角度上去了……AI 专家可能会被打动,因为他们看到难度,但是小学生和文科生不会打动,因为你的画面不够精美。而且这个动物呢还不够美感,不够有美感。」
听到批评后,它下一条回复全认了,还把原因拆得很细。它在回复里写,自己「把自我设限当成了卖点」,「角色追求的是解剖准确,而不是美感」,普通观众看到的只是一只「表情僵硬、像塑料的白色大鸟」。
随后它提议用代码驱动 Blender 重做,先出一张试金石肖像。我同意安装 Blender。
还是在那个上午,不到一小时之后,我给它发了一条消息:「请在合适的时间点暂停一下你的任务吧,我正在出视频,你的渲染可能导致系统资源紧张」。
两分钟后,肖像渲染完成。还没等我挑刺,它自己先在报告里列了缺点:喙和眼周依然像塑料,羽毛像毛绒玩具一样毛躁、没有鸟羽的层次,表情还很平淡。随后它报告说,所有工作已经全部暂停。

这条线后来没有继续跑完两分钟的完整动画。你指出普通观众不会被技术难度打动,它能立刻把问题拆得很细,但下一张成片和它自己的诊断之间依然存在差距。
墨韵和鹈鹕的制作过程,我单独做了一期视频:Opus 5.5 做的动画,视频模型根本做不出来
宣传片:我说「我相信你的审美」
到了 9 月 25 号做《重构个体》的宣传片,我主动把画面方向的大部分决策交了出去。
那本书是我的心血,旁白是我自己录的,书封和内页翻页也是实物素材。第一版片子出来,用了传统的写实视频风格,我看完觉得它「非常有温度」,但「好像并没有达到炫技的效果」。我在会话里说:「这个重点不是 AI 视频的成本啊,而是你来做视频的能力……这就跟我之前可能半年前一年前我都可以做同样的一个视频出来。」
我顺口提到别人用乐高积木搭机器鸭子那类作品,它随后提出了一个全新的方案:放弃常规的写实镜头,全部用代码渲染出玩具积木的风格,用一个个方块和微缩世界来搭整部片子。
我看了测试画面,给它的回复原话是这样的:第一帧里书把 modem 挡住了,还是以前那个构图更好,书可以立在显示器边上;接着是「方向对了,积木再玩具一点,继续做整片」;最后是「你这个积木的思路也不错,我觉得挺好的。我相信你的审美,就按照你的计划来」。
这句话是在我刚提完具体的构图修改之后说的。在那个时刻,整部片子的视觉风格和场景构思,我全都交给了它。
但在同一个项目里,另一面也同样真切:让整部片子真正立起来的那些细节,全部来自于真实的个人经历。
那是我年轻时的真实记忆。1997 年,我在一台 Sun 小型机上从零配置互联网服务,手里捧着那本又厚又重、全英文的 Solaris 随机手册。读了多久已经记不清了,我向来不是从头读到尾的人,向来是「干到哪就看哪」。它一开始渲染出的画面,把手册做成了一本破旧古老的硬壳古书。我纠正它:「随机手册它应该是什么样子?就是一种说明书的那种感觉」「你这个太古老了,又古老又破烂,没有那么夸张」;而且在翻页的时候,不能对着同一页反复放大缩小,得翻到不同的页面。
还有书封上的那个方块。为什么是一块被金缮修复的方块?原话是:「用一个方块代表个体,要重构就需要先打破,再用金缮修补完整,体现的是重构之后的升级。」模型第一版在方块边缘画了三条下垂的波浪线,我说看起来像三个虫子。
这两件事在同一个项目里同时发生:我一边说了「我相信你的审美」,由着它去搭积木世界;但另一边,画面里真正让人认出这是我的书的细节,全来自于真实的生命经验。
是我自己在一件件递出去
而且这一周里,有些活并不是等它证明自己能做我才交出去的,而是我觉得没必要自己来,主动递过去的。比如审批环节卡住的时候,我的第一反应是:「只有你判断不了的让我来审批是可以的,这些不是给我增加多余的工作量吗?」很多时候不是它在抢,是我自己为了效率,把手里的活一件件递了过去。
宣传片里那些来自我自己经历的细节,确实还在我这一侧。但它们并不构成某种让人高枕无忧的安慰,我也不想把它们包装成什么「人类负责审美」的定律。
看着这一周做出来的这一批东西,真实的感觉不是释怀,而是 9 月 23 号那个括号背后、我后来才说清楚的那句话:
AI 现在能干的活越来越多,留下能给人来做的事情,感觉已经不多了。
本期推荐
文里那支积木宣传片,是给我的书《重构个体:AI 时代如何打造竞争力》做的。书里用到的提示词模板,都放在配套资源页上。
Axton 的 AI 实践工具箱
MAPS 课程 · 从方法论到可交付系统
精英圈 PRO · 深度实践者社群
免费入门课 · 零门槛开始
MAPS 术语词典与原典索引:https://www.axtonliu.ai/maps
Responses