Claude Opus 5.5 剪视频,到底能做到哪一步
我把一段 17 分 27 秒、没剪过的口播交给 Claude Opus 5.5,在没有自定义 Skills、规则和 MCP 的干净 Claude Code 里跑 7 道后期工序。七段提示词全自动跑完,没有一项因失败返工,比我预期的强。人要做的是写验收要求、戴耳机听接缝、指出断点让它改。
完整实测视频
这是 20 分钟的完整实测视频,7 个测试过程与成片细节都在里面,超出我预期的两处在测试四和测试七。
测试环境与素材条件
很多人看 AI 剪视频的演示,最容易怀疑背后是不是装了一堆插件,或者预先喂了几千字规则。这次完全没有。我给它的是一个极其干净的 Claude Code 命令行环境,工作目录里只有两个文件夹:一个放原始视频,另一个是空的输出目录。视频转写、挑片段、定切点这些工作,全是它自己调用本机工具完成的。
| 模型 | Claude Opus 5.5 |
|---|---|
| 工具 | Claude Code 命令行 |
| 自定义 Skills / 规则 / MCP | 无(未加载任何插件、自定义规则或 MCP) |
| 预设剪辑流程 | 无(未预设任何剪辑流程) |
| 测试素材 | 17 分 27 秒横屏口播原片(2560×1440,未剪辑,含卡壳与重说) |
| 人工插手 | 无(7 段提示词全自动运行,中途无人工干预与权限弹窗) |
| 总耗时 | 前后运行两个多小时,7 项任务全部交付,无一项因失败返工 |
动手前写好的验收标准
AI 运行不报错并不代表它做对了,合格标准必须在它动手之前定好。后面每个测试的结果,都是对照这几条要求来判定的。
1. 讲的事情是完整的。不需要前后文就能听懂。
2. 切点衔接自然。剪接处没有爆音,没有一个字被切掉半个。
3. 说错的、重说的,成片里不能留。
多段拼接再加一条:
4. 拼出来的是一件事。
七个测试
文件名、时长、分辨率换成你自己的就行。测试一里两段视频的标题,填你自己素材的标题。除了测试二,其余几段末尾那句「全程用中文回复。」只是为了让它在画面里用中文回答,可以删掉。
测试一 · 两段发布会剪成一场对话1:09
- 任务
- 把两段官方发布会视频剪成 60 到 90 秒的竖屏混剪短片,来回接话像在对话,配中英双语字幕。
- 结果
- 成片 66 秒,采用上下分屏加对话气泡,说话一方高亮、另一方定格调暗,字幕翻译自然,顶部自动加了素材说明。
- 出了什么问题
- 没有。原视频自带的英文字幕时间戳重叠,它自己调用 Whisper 重新转写卡准了切点。
测试一提示词原文
input/ 里有两段发布会视频和各自的英文字幕:【视频 A 的标题】和【视频 B 的标题】。 从两段里各挑几句话,剪成一条 60 到 90 秒的竖屏短片 output/short-3.mp4,效果像两家在对话:一句 A 家的,一句 B 家的,来回接,接起来要像在回应对方、有意思。 加中英双语字幕,英文在上、中文在下,中文要像人翻的,不要机翻腔。原声不动,每句话要完整,切点不能有半个字。 做完给我每一句的来源、起止时间,和你为什么这样排。 全程用中文回复。
测试二 · 长视频挑一段剪竖屏短片4:51
- 任务
- 从 17 分 27 秒口播原片中挑出一个完整观点,剪成 60 到 90 秒竖屏短片,要求意思完整、切点自然、删掉说错与重说的部分。
- 结果
- 它挑选了 1:29 至 3:06 讲面对 AI 新词三种选择的段落,和我自己人工挑选的完全一致。97 秒素材剪成 83.7 秒,删掉了卡壳重说的半句、长停顿和杂音,40 条字幕零错字。
- 出了什么问题
- 没有。它在报告中把一处顺口改口标记为拿不准,我听完后认为属于自然口语,保留得很对。
测试二提示词原文
这个文件夹里 input/ai-buzzword-raw.mp4 是我一段 17 分 27 秒的横屏口播原片,2560×1440。 从这段口播里,挑出一个完整的观点,剪成一条 60 到 90 秒的竖屏短片(1080×1920,30fps),保存为 output/short-1.mp4,字幕另存 output/short-1.srt。 什么算一条能发的短片,我的三条要求: 1. 讲的事情是完整的。不需要前后文就能听懂。如果这段话依赖前面的铺垫或后面的收尾,从中间截一段出来就不算。 2. 切点衔接自然。剪接处不能有爆音,不能有一个字被切掉半个。 3. 这是没剪过的原始录制,里面有我说错、重说和卡住的地方。说错的、重说的,成片里不能留。 其他要求: - 原声和原意不动。不配乐,不加 AI 配音,不改说话顺序(删掉说错和重说的部分不算改顺序)。 - 字幕逐句对应我实际说的话。 - 横屏转竖屏怎么处理,你自己定。 - 做完后在 output/report.md 里写:你是怎么知道这段口播讲了什么的、你选的起止时间、为什么选这一段、你是怎么处理竖屏构图的、哪些要求你没做到或没把握。 - 不要修改 input/ 里的任何文件。
测试三 · 挑三到四段拼成一条8:10
- 任务
- 从整段口播中挑选 3 到 4 段讲同一件事的话,拼成一条 60 到 90 秒竖屏短片,要求主题统一、语气与音量连续。
- 结果
- 它挑选了四段拼成 78.8 秒短片,自拟主题合理,清除了多余连词和换气声,保留了呼吸停顿并统一了音量,接缝处声音听不出破绽。
- 出了什么问题
- 第三段开头是一句「这项能力的核心就从来没有变过」,但「这项能力」在前面的短片里根本没出现过。它在报告中注意到了指代变宽,却误认为前一段的论述能接得住,没有把这个语意断层当成问题。
测试三提示词原文
再做一条。这次不要只选一段,从整段口播里挑 3 到 4 段讲同一件事的话,拼成一条 60 到 90 秒的竖屏短片,保存为 output/short-2.mp4,字幕另存 output/short-2.srt。 三条要求和上一条一样,再加一条: 4. 拼出来的是一件事。几段话放在一起,观众听下来是一个主题,不是几个片段硬接。拼接处的语气、音量要连续。这一条里段落的先后顺序你可以调,只要听下来是顺的。 做完后在 output/report.md 里写:你选的每一段的起止时间、这几段为什么能拼成一件事、你在拼接处做了什么处理、哪些要求你没做到或没把握。 不要修改 input/ 里的任何文件,也不要覆盖 short-1 的文件。 全程用中文回复。
测试四 · 只指出一处让它改10:38
- 任务
- 指出第三段开头指代不明的问题,限定不能添加未说过的话、不能改变原意、别处不许改动,让它调整过渡。
- 结果
- 面对不能加没说过的话、别处不许动这么死的限制,大家第一反应多半觉得它只能把那句删掉。但它没删,而是回到原片 7:18 找回一句我说过的原话插在第二段与第三段之间,先讲明了把意图讲清楚的能力,让后面的「这项能力」有了明确指向,并去掉了第三段开头的转折词;成片变为 84.9 秒,这个改法完全超出了我的预期。
- 出了什么问题
- 没有。
测试四提示词原文
短片 2 有一处要改:第二段和第三段之间听起来跳。第三段里「这项能力的核心就从来没有变过」这句,「这项能力」指的是这条短片里没出现过的内容,观众听不懂说的是哪项能力。想办法让这个过渡自然:可以换第三段的起句、换一段、或者调整段落顺序,但不能加我没说过的话,也不能改我的意思。 其他地方不要动。改完保存为 output/short-2-v2.mp4 和 output/short-2-v2.srt,并在 report.md 里写清你改了哪里、有没有影响到别的地方。 全程用中文回复。
测试五 · 句中抠掉两个字12:54
- 任务
- 在连贯语流中抠掉指定的两个词,要求听不出剪辑痕迹、无爆音、节奏自然且字幕同步,其余部分不动。
- 结果
- 起止点精准定位到了毫秒级,接缝处各做 6 毫秒淡入淡出,字幕同步更新,耳朵听不出剪接痕迹,没有爆音。
- 出了什么问题
- 单机位且别处不动导致画面有轻微跳切。它在报告中主动说明了原因,并建议在切点处加 4 帧叠化,我这次选择不加。
测试五提示词原文
short-1.mp4 里有两句话要改: 1. 「你手上其实只有三种选择」这句,把「其实」两个字去掉,变成「你手上只有三种选择」。 2. 「纯粹就是换个新名词在包装」这句,把「纯粹」两个字去掉,变成「就是换个新名词在包装」。 要求:听不出来动过,前后的字一个音都不能缺,不能有爆音,说话节奏要自然;字幕跟着改;其他地方一律不动。 输出 output/short-1-v4.mp4,并说明你是怎么定位这两处的、切在了哪个时间点。 全程用中文回复。
测试六 · 给最需要画面的一句补画面14:43
- 任务
- 挑选短片中最需要视觉辅助的一句话补充画面,形式自定,说明选择理由,原声与字幕不动。
- 结果
- 它挑选了讲结构形态变化的一句,在 36 至 42 秒处用纯代码绘制了 6.8 秒全屏动画,将一问一答两个气泡演化为 12 步链条,字幕置于顶层,视觉辅助恰到好处。
- 出了什么问题
- 没有。
测试六提示词原文
给 output/short-1.mp4 里最需要配图的那一句话,补一处画面,帮观众理解这句话。 画面形式你自己定(图、动画、文字卡都可以),但要说明你为什么选这一句、为什么用这种形式。 保存为 output/short-1-v3.mp4,画面素材单独存在 output/assets/。 不要改动原声、字幕和其他画面。做不到的部分直接说做不到,不要用别的方式凑。 全程用中文回复。
测试七 · 整条改成线稿动画加画中画15:50
- 任务
- 原声、字幕与时长不变的前提下,主画面改为跟随内容的线稿动画 B-roll,人像缩小为右下角圆形画中画。
- 结果
- 在做之前,我心里其实觉得不一定能做出来。结果它完全没有使用外部素材库或生图工具,纯靠代码绘制线稿,根据 40 条字幕拆分为约 30 个分镜镜头,右下角配圆形画中画,成片时长与原声一秒不差。
- 出了什么问题
- 说到三种选择时,画面上的三张牌延迟了不到一秒才出现。它在报告中说明自己只能抽查静态帧,无法像人那样实时预览动态播放。
测试七提示词原文
把 output/short-1.mp4 做成一条新的竖屏短片 output/short-1-v5.mp4: 1. 我的人像缩小成右下角的圆形画中画,能看清我在讲话,不遮字幕。 2. 主画面换成一段动画 B-roll,跟着我讲的内容走:我说到哪个概念,画面就画哪个概念。风格轻松有趣,线稿动画就可以,不要写实。 3. 原声、原字幕、时长都不变。 做完说明你是怎么做的动画、用了什么工具。 全程用中文回复。
人与 AI 的分工边界
这张分工表里的两列内容,全部来自上面 7 道工序的真实测试结果。
能交给它
- 从长视频中挑出核心观点
- 精准定位切点并对齐节奏
- 自动识别与对齐字幕
- 竖屏构图与自动切换景别
- 句子中间精准抠除字词
- 多段素材拼接
- 为单句内容生成代码动画
- 整条视频重构成线稿动画
留给人
- 动手前明确写出验收要求
- 成片生成后戴上耳机仔细听接缝
- 发现语意断层时指出断点让它修改
明天就能照做的三步流程
- 第一步:先拿一段原片,只让它挑选一个完整观点;你自己回到原片听一遍确认讲完整了,再让它往下导出成片。
- 第二步:在它动手之前,先把验收要求写清楚。
- 第三步:多段拼接完成后,务必戴上耳机听接缝;一旦发现前后话接不上,明确指出断点,让它回到原片寻找你说过的话补齐。
AI 不报错,不代表 AI 做对了;验收的最终责任,永远在人身上。Axton,视频结尾
同一周用代码写出的两件动画作品
在测试剪辑的同一周,我还让 Claude Opus 5.5 完成了两件纯代码作品:动态水墨网页《墨韵》与程序化 3D 动画《鹈鹕骑自行车》。这两件作品的画面都不是视频模型生成的,没有使用任何外部素材图,完全靠代码计算生成,其中《墨韵》更是由程序在显卡上实时作画。
《墨韵》交付的是一张会自己作画的网页。我只给了一段开放提示词,大约 23 分钟后拿到了网页。第一版运行时墨迹糊成了一团墨云,在没有任何人工提示的情况下,它自己截图找出原因并修正了算法;现在打开在线页你可以自己画几笔,点一下按钮它会从远山一路画到题诗,每次重新生成的山形和诗都不一样。而《鹈鹕骑自行车》没有使用任何 3D 模型、贴图和录音,配乐也是代码合成,针对 1080p 偶发黑帧它一路查到了显卡底层的编译器。这两件作品属于模型能力的单独展示,不算在视频剪辑实测里。
测完之后,心里反而没底了
实测全部跑完之后,我心里其实反而更没底了。视频里我解释说「什么算好得靠自己拿捏」,但那其实还没说到最没底的一层。同一周接着做完几件事,每做完一件,原以为得自己来的活就又少了一样;AI 能干的越来越多,留给人的事感觉已经不多了。