同样一条 3 分钟的视频,有人 3 小时出片,有人磨 3 天。差距不在手速,在环节顺序——这一章把那条「线」拆成九个环节,逐个看清楚。
第 2 章你选了流派。但流派只回答"用什么方式生产",没回答"先做什么后做什么"。真正决定出片速度的,是环节的排列方式:慢的人不是每个环节都慢,而是顺序错了——先录了画面,回头改稿,全部重来;快的人也不是有三头六臂,而是每个环节的产出恰好是下一个环节需要的输入。
所以本章做两件事:先把一条流水线拆成九个环节,每个一句话讲清;再讲透其中最重要的一个原则——音频优先,它是快慢两条路线的分水岭。
分镜表是视频的施工图:先有图再施工,改图比改楼便宜。在分镜表里删掉一段只要两秒;等录完素材、剪到一半再删,就是半天。本章后面的演示就是让你亲手当一次「改图的人」。
九个环节里,顺序弹性最大的争议点是:先做画面还是先做声音?答案是坚定的:先定口播,再配画面。
原因是一笔改稿账。画面跟着音频走时,改一句话只需重配这一句的音频,换掉对应几秒画面,其余不动;反过来画面先做好、音频后配,改一分钟音频意味着整条时间轴重排——所有画面点位、字幕、BGM 节拍全部错位。前者改的是"一句话",后者改的是"整条片"。
TTS 普及之后,这条原则变得更强了:音频可以精确到句生成,每句多长一清二楚,时长完全可控。口播稿从"参考"升级成了"时钟"——整条流水线以它为节拍器运转。
把封面标题留到发布后随手补。它是独立工序,值得专门的一小时:第 1 章说过,封面标题决定有多少人点进来,你花三天做的内容,可能被三秒钟做的封面埋葬。正确做法是把它排进流水线,和配音、合成并列,而不是当作发布的附属动作。
九个环节之间是「串行依赖、并行准备」:合成必须等配音完成,这是串行;但配音没录完时,你完全可以先去做封面、写简介、想标题——这些是并行。出片快的人不是把单环节做到了极致,而是让等待时间为零:主线上任何一环卡住,手就切到并行任务上。
下面是一条工具分享视频的分镜表,初始七个分镜。每个色块是一个分镜,宽度按时长比例渲染,颜色按类型区分。你可以给任意分镜 ±5 秒、删掉它、或者加一个新分镜——右边三个读数会实时告诉你这条片子的"体型"是否健康。
这个演示用的是教学简化模型,不是任何平台的真实算法。但它传达的经验量级是创作者社群里反复出现的:90 秒到 4 分钟是知识类视频的甜点区——短了装不下价值,长了每分钟都得用信息密度硬撑。而钩子的账最简单:它占用的是观众耐心最薄的时段,每多 5 秒都在烧完播率。
一条流水线九个环节:选题 → 口播稿 → 分镜 → 素材 → 配音 → 合成 → 封面标题 → 发布 → 复盘。分水岭原则是音频优先:先定口播再配画面,改稿只动一句话而不是整条时间轴。环节清楚了,下一个问题自然浮现:每个环节用什么工具最顺手?第 4 章给每个环节配上具体的工具。