AI 自动剪辑口播视频:一条原片到抖音成片的九步流程

剪气口、剪口误、配字幕、加 B-roll、做动画、出成片,全部交给 AI,人只给素材、看样片、说过了。这篇拆开九步流程,讲哪几步会出错、怎么用 Harness 约束它,生产线代码已开源。

口播视频可以完全交给 AI 剪:剪气口、剪口误、配字幕、加 B-roll、做动画、出成片。人只做三件事:给素材、看样片、说「这条过了」。

我的抖音、YouTube、Shorts 和 TikTok 带货视频,有三周全是这条生产线剪的。Codex 剪了四十多条,Claude 也剪了几十条,中间迭代了 70 次,我自己一刀没剪。这篇是第二期训练营 Week 7 的公开整理,生产线代码已经开源:talking-head-video-factory。

它适合剪什么,不适合剪什么?

适合: 口播、IP 视频、带货口播、数字人口播。现在绝大多数视频都是口播。输入只要一条对着镜头一镜到底说完的原片,有口误、有气口、说错了重来都没关系。

不适合:

  • 纯宣传片。 没有口播主线,这套剪不了
  • 混剪铺货。 混剪很机械:预设几个标签给素材打标,再映射到几段式结构里排列组合,中间不需要智能。用现成的批量混剪工具又快又便宜

这套主打的是精剪:人力不够、又想要一条精剪片的时候。

AI 剪辑到底在剪什么?

先别把它当 AI,把它当一个剪辑师。你给他布置任务,他得先知道任务是什么、你有哪些素材。

  1. 读懂素材,编排 A-roll。 A-roll 是整条片最底下、把画面串起来的主视频,通常就是人对着镜头说话;B-roll 是叠在上面那一层,比如讲到某个工具时叠一段实操演示
  2. 删减。 口误、气口、重复、铺垫。气口在波形图上就是波峰前那段平的地方;重复靠前后对比。这些都是可配置的规则
  3. 加装饰。 字幕、关键词高亮、CTA 箭头、署名和引用出处
  4. 做动画。 逻辑解释、阶梯、图表、时间线,以前必须用 AE、PR 做的
  5. 插生成内容。 即梦、可灵、MiniMax 生成的画面,或者网上找到的证据页
  6. 出片。 横屏竖屏、30 帧 60 帧

从原片到成片的九步流程

课上用一条 1.7 GB、5 分 52 秒的原片从头走了一遍,剪成 232 秒的抖音竖屏。

步做什么说明
1读懂素材每隔零点几秒抽一帧拼成一张图给 AI 看;语音交给本地跑的 Whisper,不耗 token
2转录生成「第几秒到第几秒说了什么」的文件,那条片 1312 个词,每个词带起止时间。后面所有步骤都只在这份文件上标时间,不动原片
3找废话和重说「对吧」「哎」「然后呢」,说了两遍的、卡壳的
4剪辑图纸这条片讲什么、分几段、哪里删。那条片分了 18 段,删了 19 处
5切 A-roll先把所有切点定好,渲染时整体切一次
6精修切点结合波形找一句话真正的起止,在重音前一点点切。很多自动剪辑没做这一步
7字幕每个词已有起止时间,字幕按时间贴上去;转录后再让大模型按上下文校一遍专业名词
8动画包装见下一节
9渲染先出 540p 样片给人看,改完再渲 1080p 60 帧或 4K。导出很耗机器,不能不看效果就渲成片

动画是怎么做出来的?

两个引擎:HyperFrames 和 Remotion。原理一样:把动画写成 HTML,让网页元素动起来,再按每秒 60 次截帧,叠到画面上。

动画和字幕本质一样:第几秒到第几秒,放一个什么组件。但组件怎么入场、怎么出场,不能现场让 AI 写,写不出来。必须先把一整套组件模板做好,就像剪映里的贴纸,动效是预设好的,AI 只填内容和起止时间。

比如柱状图组件:先定义好有几根柱、每根的名字和长度。剪辑时 AI 听到口播里在比较分数,就匹配到柱状图组件,把数据和时间塞进去。工程里已经有 23 种形态:提醒卡、对比、阶梯、图表、时间线、标题、对话、排行、表盘、翻牌、地图、剪报等。

一定要有规则约束,不然每次渲染都现做一套新的,token 就炸了。

为什么自己搭的自动剪辑老出错?

做一个演示很简单,让系统长期稳定运行不简单。AI 一定会出错、一定会跑偏,要有一套规矩约束它、让它自己检查自己,这套东西叫 Harness。

九步里,读素材、转录、精修切点、字幕、渲染是流程和代码,不会出错。找废话、剪辑图纸、切 A-roll、动画匹配这四步带判断,会出错。 Harness 就围着这四步建。

一次真实事故:同一个仓库、同一个 skill,Codex 剪出一条 145 秒的片子,切了 21 场、人物换位 19 次、9 场黑板连排。技术检测全部通过,片子不合格。原因是检查只查了结构,判断没有写下来。

Harness 四件套:

  1. 判断手册:每条规则带日期和原话,AI 开工必读
  2. 参照成片:新片先说模仿哪一条,引擎一改就和基线帧比对
  3. 门禁 + 审片:编译器按数字拦,另一个 AI 按十条标准看静帧打分
  4. 挑刺回路:你看片时挑的每一句都记下来,进手册或进代码

Harness 让剪辑更少出错,不可能保证不出错。

带货视频和批量粗剪怎么改?

带货视频反而更好剪:一定有一段口播(TTS 或剪映生成的配音),再把商品素材填进去。AI 看素材时本来就会打标,把大量素材灌进去自动映射,就能批量剪。

批量粗剪对照九步砍:配音没有废话,第 3 步省掉;第 4 步图纸省不了,要知道哪段是 hook、哪段讲故事、哪段引产品、哪段转化和 CTA;第 5 步不用切;第 8 步不要动画,只配字幕。精剪一条 20 多分钟,粗剪几分钟。

课上的例子:一条 45 秒 TTS 念的保健品卖点,加 5 张商品图,流程原样跑出一条带声音的样片。

怎么开始用?

Mac / Linux:

git clone https://github.com/scotti1i/talking-head-video-factory.git
cd talking-head-video-factory
npm install
npm run doctor
cp -R skills/talkinghead-edit ~/.agents/skills/

Windows 看仓库里的 deploy/windows/README.md。

然后打开 Claude Code 或 Codex,把片子或素材文件夹丢进去,说一句「用 xiaolin 模板把这条口播剪成抖音竖屏」。它会先写剪辑图纸、出一份素材需求单,告诉你哪些素材必须你给、哪些它能去网上找。尽量一开始把素材给全。

几个经验:

  • 模板只能剪一种样子,没有泛化能力,所以特别适合批量。 想要自己的风格,找一条对标视频发给 agent,让它复刻成模板
  • 调教模板时把模型开到 high;执行剪辑时开 medium 就够,更快也更准
  • 规则是地图,不是牢笼。 规则越多,模型越笨。必须只能这么走的,写成代码让代码执行;需要判断和灵感的地方,放开它

第二期训练营 Week 7 的回放里,有这条生产线从读素材到出片的完整演示,以及怎么把它改成你自己业务的模板。

AI 自动剪辑口播视频:一条原片到抖音成片的九步流程|SCT AI 出海