第 3 章 · 流程

解剖一条流水线:从选题到发布

同样一条 3 分钟的视频,有人 3 小时出片,有人磨 3 天。差距不在手速,在环节顺序——这一章把那条「线」拆成九个环节,逐个看清楚。

第 2 章你选了流派。但流派只回答"用什么方式生产",没回答"先做什么后做什么"。真正决定出片速度的,是环节的排列方式:慢的人不是每个环节都慢,而是顺序错了——先录了画面,回头改稿,全部重来;快的人也不是有三头六臂,而是每个环节的产出恰好是下一个环节需要的输入。

所以本章做两件事:先把一条流水线拆成九个环节,每个一句话讲清;再讲透其中最重要的一个原则——音频优先,它是快慢两条路线的分水岭。

九个环节,一句话一个

  1. 选题:从你刚解决的问题里找——你自己踩过的坑,就是别人会搜的题;
  2. 口播稿:先写要说的话,不是先录画面。稿子定了,视频的灵魂就定了;
  3. 分镜:给每句口播配画面——这句录屏、那句贴图、这句放大特写;
  4. 素材:按分镜去生产原料——录屏、动效、AI 生成图,缺什么补什么;
  5. 配音:真人录或 TTS 生成,把稿子变成有确定时长的音频;
  6. 合成:音画对齐、上字幕、铺 BGM——把原料组装成成片;
  7. 封面标题:独立工序,专门花时间做,不是发布前随手截一帧;
  8. 发布:分区、标签、简介、发布时间——填错分区等于白做一半;
  9. 复盘:看数据,决定下一条改哪一环——流水线是闭环,不是单程票。
💡 直觉

分镜表是视频的施工图:先有图再施工,改图比改楼便宜。在分镜表里删掉一段只要两秒;等录完素材、剪到一半再删,就是半天。本章后面的演示就是让你亲手当一次「改图的人」。

音频优先:快慢的分水岭

九个环节里,顺序弹性最大的争议点是:先做画面还是先做声音?答案是坚定的:先定口播,再配画面

原因是一笔改稿账。画面跟着音频走时,改一句话只需重配这一句的音频,换掉对应几秒画面,其余不动;反过来画面先做好、音频后配,改一分钟音频意味着整条时间轴重排——所有画面点位、字幕、BGM 节拍全部错位。前者改的是"一句话",后者改的是"整条片"。

TTS 普及之后,这条原则变得更强了:音频可以精确到句生成,每句多长一清二楚,时长完全可控。口播稿从"参考"升级成了"时钟"——整条流水线以它为节拍器运转。

⚠️ 常见陷阱

把封面标题留到发布后随手补。它是独立工序,值得专门的一小时:第 1 章说过,封面标题决定有多少人点进来,你花三天做的内容,可能被三秒钟做的封面埋葬。正确做法是把它排进流水线,和配音、合成并列,而不是当作发布的附属动作。

∑ 想深一层

九个环节之间是「串行依赖、并行准备」:合成必须等配音完成,这是串行;但配音没录完时,你完全可以先去做封面、写简介、想标题——这些是并行。出片快的人不是把单环节做到了极致,而是让等待时间为零:主线上任何一环卡住,手就切到并行任务上。

亲手排一次:分镜时间轴

下面是一条工具分享视频的分镜表,初始七个分镜。每个色块是一个分镜,宽度按时长比例渲染,颜色按类型区分。你可以给任意分镜 ±5 秒、删掉它、或者加一个新分镜——右边三个读数会实时告诉你这条片子的"体型"是否健康。

分镜时间轴

改时长、删分镜,看总时长和档位怎么变
钩子 铺垫 演示 讲解 收尾

总时长 钩子占比 完播档位

这个演示用的是教学简化模型,不是任何平台的真实算法。但它传达的经验量级是创作者社群里反复出现的:90 秒到 4 分钟是知识类视频的甜点区——短了装不下价值,长了每分钟都得用信息密度硬撑。而钩子的账最简单:它占用的是观众耐心最薄的时段,每多 5 秒都在烧完播率。

✓ 本章小结

一条流水线九个环节:选题 → 口播稿 → 分镜 → 素材 → 配音 → 合成 → 封面标题 → 发布 → 复盘。分水岭原则是音频优先:先定口播再配画面,改稿只动一句话而不是整条时间轴。环节清楚了,下一个问题自然浮现:每个环节用什么工具最顺手?第 4 章给每个环节配上具体的工具。