Skip to content

第 9 课:配音生成

📌 学习目标:学会为不同角色生成自然配音,掌握音色选择和情感表达 ⏱️ 预计时长:20 分钟 🎯 本节节奏:TTS 工具选择 → 音色配置 → 情感控制 → 后处理


一、TTS 工具对比

工具音色自然度多角色支持中文效果价格上手难度
ElevenLabs★★★★★6 种音色★★★★$1/月起
火山引擎 TTS★★★★多种音色★★★★★免费额度
剪映文本朗读★★★有限★★★★免费极低

推荐:日常用剪映免费搞定,追求质量用 ElevenLabs 或火山引擎。


二、音色分配原则

每个角色分配一个固定音色,贯穿整部剧:

角色推荐音色理由
主角(年轻男性)稳重男声(如 ElevenLabs 的 "Adam")贴近主角性格
主角(年轻女性)明亮女声(如 "Bella")清新有活力
旁白低沉男声客观叙述感
反派/神秘人沙哑男声有压迫感
年长角色老年男声/女声区分年龄

关键原则:同一个人物从头到尾用同一个音色。


三、操作步骤(以 ElevenLabs 为例)

Step 1:注册并选择音色

  1. 访问 elevenlabs.io,注册账号
  2. 进入 Library,浏览音色列表
  3. 试听各个音色,为每个角色选定一个
  4. 将选定的音色命名为角色名(方便识别)

Step 2:输入台词生成

  1. 选择对应角色的音色
  2. 粘贴台词文本
  3. 调整语速(默认 1.0):
    • 紧张/恐惧:0.8-0.9(放慢)
    • 愤怒/兴奋:1.1-1.2(加快)
    • 平静/悲伤:0.9-1.0
  4. 点击生成,预览效果
  5. 满意后下载 MP3

Step 3:批量生成

按剧本顺序逐个生成,保存到 assets/audio/ 目录:

assets/audio/
├── 01_chenmo.mp3    # 陈默的台词
├── 02_narrator.mp3  # 旁白
├── 03_chenmo.mp3    # 陈默的下一句
└── ...

四、用标点符号控制情感

TTS 模型会根据标点符号自然调整停顿和语调:

标点效果
句号 正常停顿,语调下降
问号 上扬,表示疑问
感叹号 加重语气
省略号 ……拖长尾音,表示犹豫/恐惧/悲伤
破折号 ——明显停顿或声音拉伸
逗号 短暂停顿

实操示例:

平静版本:"我想知道这是谁"
恐惧版本:"我……我想知道……这是谁……"
愤怒版本:"告诉我你是谁!!"

五、操作技巧

技巧 1:先试一句,满意再批量

选定音色后,先用第一句台词测试:

  • 音色是否合适?
  • 语速是否需要调整?
  • 情感是否到位?

满意后再批量生成其他台词。

技巧 2:长段落拆短

TTS 对短句的处理比长句更自然。如果一段台词超过 30 字,拆成多句生成,后期拼接。

技巧 3:保留自然的呼吸声

有些 TTS 工具支持生成带呼吸声的版本,可以让配音更自然。如果工具支持,开启这个选项。

技巧 4:不满意就换音色

第一版音色不满意很正常。多试几个音色,找到最适合角色的那个。


六、配音与画面的对齐

生成完所有音频后,需要确保每个音频片段和对应的分镜画面时间对齐。

手动对齐(剪映)

  1. 打开剪映,导入所有分镜图片和配音音频
  2. 将音频拖到时间轴
  3. 根据音频时长调整图片的显示时长
  4. 检查每个镜头的配音是否和画面匹配

自动对齐(脚本)

如果音频文件名按顺序命名(如 01_xxx.mp3),可以用脚本自动对齐:

python
# 思路:按音频顺序依次排列图片,每张图片的时长等于对应音频的时长
for i, (image, audio) in enumerate(zip(images, audios)):
    duration = get_audio_duration(audio)
    add_to_timeline(image, duration)

七、常见问题

Q: 配音听起来太机械怎么办? A: 1) 在台词中加入更多标点符号引导情感;2) 尝试不同的音色;3) 适当调整语速。

Q: 不同角色的音色区分不明显? A: 选择差异更大的音色组合,比如一个偏亮、一个偏沉。

Q: 某句台词效果不好,只想重新生成这句? A: TTS 通常是按句生成的,单独重新生成那一句即可,不影响其他。


八、本章小结

要点说明
选音色每个角色固定一个音色
写台词用标点符号引导情感
调语速根据情绪调整(紧张慢、兴奋快)
先测试第一句满意再批量
对时间确保配音和画面时长匹配

下节课:第 10 课:视频合成与后期

Released under the MIT License.