一个人做口播视频,流程通常是:写稿、背稿、录坏好几遍、再一句句加字幕、最后想配个旁白又得重新录。这篇教程用剪映(海外版 CapCut)的 AI 功能把这几步串起来,你只管写文案,剩下的它帮不少。
准备清单:剪映 / CapCut 账号(手机或电脑版都行)、写好的一段口播文案(300 字内最顺)、一个安静的录制环境。AI 功能在免费档大多可用。
第一步,打开"提词器",把文案粘进去,设置滚动速度和字号。预期结果:录制时稿子浮在画面下方跟着走,你不用背,看着念就行,眼神也不会飘。
第二步,录完导入剪辑,用"自动字幕"一键识别语音生成字幕。提示词式操作是:
识别这段口播的语音,生成中文硬字幕,自动去除语气词(比如"呃""那个"),并把每句字数控制在屏幕两行内。
为什么这么填:"去语气词"是口播观感的关键,"两行内"是避免字幕占满屏。预期结果:干净的字幕自动贴好,不用逐句手打。常见报错:识别错别字,手动改几个关键词即可,不必重录。
第三步,想加旁白又不想自己念?用"AI 配音"选一个贴近你调性的音色生成。预期结果:一段自然的旁白轨,和画面对齐。
两个省时间的延伸:一是把成片的第一帧或某句高光设为封面,平台预览时点击率差别不小,别用默认黑帧;二是如果你有一系列同主题口播,把文案存成模板,每次只换核心信息,配合同样的字幕样式和配音音色,整套视频会有"系列感",观众更容易追更。批量做的时候,先统一导出音频再做字幕识别,比边剪边识别稳得多。
效果与验收:成功的标志是——一条口播从文案到成片,你没离开剪映就搞定了,且字幕干净、节奏顺。如果自动字幕卡顿,先导出音频再识别会更稳。
进阶方向:用 Suno 这类工具给口播配一段专属 BGM,视频质感立刻不一样;需要画面素材时,可灵的片段也能当转场补进来。本站收录的 CapCut、Suno、可灵可串成你的口播流水线。