做科普频道的"套娃老师"曾经被评论区扎心:"内容不错,但声音像念课文。"他试过练习发声,试过换麦克风,最后发现最省事的方案是让 AI 替他开口——用讯飞智作生成配音后,评论区开始有人夸"声音好听",粉丝两周涨了八千。这篇教程把他的做法拆成五步。
准备清单
- 讯飞智作网页版账号(新用户有免费试听和体验额度)
- 一份口播稿(最好提前口语化改写)
- 剪映(后期对齐字幕和画面用)
分步操作
第 1 步:稿子先改成"能读"的。长句拆短,书面词换口语词,每句控制在一口气念完的长度。预期结果:自己小声读一遍不换气就卡壳的句子,就是需要拆的句子。
第 2 步:选音色。打开讯飞智作的配音工作台,按内容选类型:知识区选沉稳男声或知性女声,带货和生活区选更有活力的音色。预期结果:每个音色都有 10 秒试听,先听再选,别只看名字。
第 3 步:调语速和停顿。语速建议 0.9-1.05,知识区 0.95 最耐听;重要转折的地方手动加停顿标记。预期结果:试听时不觉得赶、不觉得飘。常见失败:整段听着像赶火车——多半是语速默认 1.0 以上还叠了长句。
第 4 步:多音字校对。把"调参""重播""说明白"这类容易读错的词,用多音字标注功能逐个修。预期结果:整段听下来没有一处违和的读音。常见失败:某处读音怎么改都怪——直接改稿子换一个同义词,比反复调标注快。
第 5 步:导出并进剪映。导出 MP3 或 WAV,拖进剪映,用"识别字幕"自动对齐。预期结果:字幕匹配度 95% 以上,个别错字手动改。到这里,一段"声音自然、字幕齐整"的口播视频就齐活了。
可直接复制的提示词
请把下面这段口播稿改写成适合 AI 配音朗读的版本:1)短句为主,每句不超过 25 字;2)去掉公文腔的连接词和一切空洞套话;3)在需要停顿的地方用逗号或句号分开;4)最后列出 5 个可能被读错的多音字及正确读音。初稿:{粘贴你的稿件}
这段可以丢给 DeepSeek 或任何对话模型用——先改稿再配音,音色再好也救不了拗口的句子,顺序不能反。
效果与验收
验收方法是找一个不知道内情的朋友试听 30 秒,问两个问题:像真人吗、听着累吗。两个都过关才算成。套娃老师的验收更严格——他让老妈听,老妈没听出来,"那一刻我知道这钱花对了",其实他用的是免费额度。
进阶方向
想更进一步有两个玩法:一是用自己的声音做克隆(需要实名授权),请假那几天也能"本人出声";二是做矩阵号的话,把音色和语速参数固定存档,几十个账号保持同一套"声纹人设",比每条现调稳得多。