一条 AI 视频的完整生产线
选题文案 → 分镜脚本 → AI 生成片段 → 配音配乐 → 剪辑合成
关键认知:AI 视频工具只负责「生成片段」这一环,前后两端依然需要你主导。新手最容易翻车的就是把全流程都指望 AI。
第一步:写分镜脚本(最重要)
不要写「一个 60 秒的视频」,要拆成一条条 5-10 秒的分镜:
| # | 时长 | 画面描述 | 文案/口播 |
|---|---|---|---|
| 1 | 5s | 城市夜景延时,霓虹灯闪烁 | 「你有没有想过……」 |
| 2 | 8s | 一个年轻人对着电脑沉思 | 「每天下班后只有 3 小时属于自己」 |
分镜越具体,生成片段的可用率越高。
第二步:生成视频片段
主流工具(可灵、即梦、Vidu 等)都是「文生视频」或「图生视频」两种模式:
- 文生视频:直接输入画面描述,适合空镜、氛围镜头
- 图生视频(推荐):先用 AI 生成一张关键帧图,确认满意后让图动起来——可控性高得多
提示词同样讲究:「主体 + 动作 + 镜头运动 + 氛围」,例如:
一只柴犬戴着飞行员眼镜,坐在敞篷车副驾,风吹动耳朵,镜头缓慢推近,公路夕阳,电影感
第三步:配音与配乐
- 口播:剪映「文本朗读」或 ElevenLabs,选音色后粘贴文案即可
- 配乐:用 Suno 生成无版权 BGM,或直接用剪辑软件曲库
第四步:剪辑合成
剪映足够:导入片段 → 对齐口播节奏 → 加字幕(自动识别)→ 卡点 BGM → 导出 1080P。
新手建议
- 第一条片子控制在 30 秒内,跑通流程比质量重要
- 同一个分镜多生成 2-3 次挑最好的,AI 视频有随机性
- 片段之间加转场可以掩盖不少瑕疵