本教程将全面指导您使用语音生成和配音功能,为视频创建专业的旁白和多角色对话。

1. 什么是语音生成?

**语音生成(TTS - 文本转语音)**将您的脚本文本转换为自然的语音旁白,用专业品质的音频为您的故事注入生命。

1.1 何时使用语音生成

语音生成适用于:

  • 视频旁白:为故事或视频内容添加配音
  • 多角色对话:为不同角色分配独特的声音
  • 快速迭代:更新脚本时快速重新生成音频
  • 专业品质:无需录音设备即可制作广播级旁白

2. 两种生成语音的方式

您可以在两个位置生成语音,每个位置适合不同的工作流程:

2.1 编辑器页面

快速语音生成,提供基础控制以实现快速迭代。

2.2 配音页面

高级语音编辑,可精细控制句子、停顿和音色选择。

3. 快速开始:从编辑器生成语音

编辑器为整个项目或选定镜头提供快速访问语音生成功能。

编辑器语音生成

3.1 如何在编辑器中重新生成语音

  1. 点击顶部标题栏的重新生成所有音频
  2. 从下拉菜单中选择旁白音色和角色音色
  3. 点击播放按钮预览音色样本
  4. 点击重新生成将音色应用到所有镜头

3.2 单个镜头的语音重新生成

快速 A/B 测试不同音色:

  1. 在时间轴中选择一个镜头
  2. 在右侧面板中找到音频部分
  3. 点击该镜头的重新生成音频

使用场景: 非常适合快速测试不同音色选项而不影响整个项目。

4. 配音页面:您的高级语音工作室

配音页面是进行详细语音编辑和多角色对话管理的主要工作区。

配音页面布局

4.1 页面布局概览

配音页面由两个主要区域组成:

左侧区域

  • 旁白列表:显示所有镜头的旁白文本——点击选择
  • 时间轴控制:播放控制和音频分割时间轴

右侧面板(三个标签)

  • 配音设置:调整旁白音色和参数
  • 角色音色:为不同角色分配音色
  • 口型同步:生成口型同步视频

5. 理解角色和音色分配

角色帮助您为不同角色和旁白组织音色,确保整个项目的一致性。

角色和音色分配

5.1 角色的工作原理

  • 旁白:旁白文本的默认音色
  • 角色:为说话的角色分配不同的音色
  • 角色到音色的映射:将特定音色绑定到每个角色
  • 全局应用:为角色设置音色并应用到所有匹配的镜头

5.2 为角色分配音色

  1. 点击右侧面板的角色音色标签
  2. 从角色列表中选择一个角色(旁白或角色名称)
  3. 点击选择音色按钮打开音色库
  4. 从库中选择一个音色
  5. 音色自动应用到该角色的所有镜头

专业提示: 在生成音频之前为所有角色分配音色以确保一致性。

6. 浏览和选择音色

音色库提供数百种音色供您选择,每种都具有独特的特性和风格。

音色库

6.1 音色库功能

强大的筛选:

  • 按风格:叙述、戏剧、宣传、休闲
  • 按语言:英语、中文、日语等
  • 按性别:男性、女性、中性

预览与收藏:

  • 预览音色:点击播放按钮试听样本
  • 收藏:为常用音色加星标以便快速访问

6.2 如何选择音色

  1. 在角色音色面板中,点击选择音色
  2. 在音色库弹窗中,使用筛选器缩小选项范围
  3. 点击音色卡片上的播放按钮预览
  4. 点击选择将音色分配给当前角色

选择技巧:

  • 决定前试听多个音色
  • 考虑角色的个性和年龄
  • 尽可能使用实际脚本文本测试音色

7. 多角色配音生成

一键为所有镜头生成音频,自动为每个角色应用适当的音色。

7.1 如何使用多角色配音生成

  1. 确保所有角色都已分配音色
  2. 点击时间轴上方的多角色配音生成按钮
  3. 系统为所有包含旁白文本的镜头生成音频
  4. 等待生成完成(可能需要几分钟)
  5. 完成后在时间轴上预览所有音频

生成时间: 取决于项目长度——大多数项目通常需要 2-5 分钟。

8. 上传自定义音频

有自己录制的音频?直接上传并使用时间轴工具将其分割到各个镜头。

8.1 上传工作流程

  1. 点击上传音频按钮
  2. 选择您的音频文件(支持常见格式:MP3、WAV、M4A)
  3. 音频自动添加到时间轴
  4. 使用时间轴标记将音频分割到不同镜头

使用场景:

  • 专业配音录制
  • 预先录制的旁白
  • 来自外部来源的音频

9. 时间轴控制和音频分割

时间轴是配音页面的核心功能,提供对音频播放和分割的精确控制。

9.1 时间轴功能

播放控制:

  • 播放/暂停:控制音频播放
  • 跳转按钮:快速导航到上一个或下一个镜头
  • 播放速度:调整速度(0.5x - 2x)
  • 音量控制:调整播放音量

可视化时间轴:

  • 显示所有镜头的音频段
  • 显示波形以供视觉参考
  • 指示镜头边界

9.2 音频分割功能

使用时间轴标记将完整音频文件分割到各个镜头:

  1. 将时间轴上的标记拖动到适当位置
  2. 标记自动对齐到镜头边界
  3. 调整后,点击应用分割按钮
  4. 系统按标记位置将完整音频分割到各个镜头

专业提示: 使用波形可视化来识别音频中的自然断点。

10. 调整语音参数

使用稳定性参数微调语音生成以匹配您的内容风格。

语音参数

10.1 稳定性参数

点击时间轴上方的稳定性按钮调整语音稳定性:

稳定性级别:

  • 高稳定性(1.0):更一致和稳定的表达
    • 最适合:专业旁白、新闻、教育内容
  • 中等稳定性(0.5):平衡的表达
    • 最适合:讲故事、一般视频
  • 低稳定性(0.0):更动态和富有表现力
    • 最适合:戏剧对话、情感时刻

10.2 何时调整稳定性

增加稳定性当:

  • 声音听起来太多变或不一致
  • 您需要专业、稳定的旁白
  • 录制教育或指导内容

降低稳定性当:

  • 声音听起来太机械或僵硬
  • 您想要更多情感表达
  • 创作戏剧或戏剧性内容

11. 预览和导出

生成音频后,将其与视频一起预览以确保质量和时间。

预览音频

11.1 预览工作流程

  1. 在旁白列表中点击一个镜头
  2. 使用时间轴播放控制来听取音频
  3. 观察时间轴上的音频波形和镜头分段
  4. 根据需要调整音色或重新生成

11.2 导出提示

质量检查清单:

  • 所有镜头都已生成音频(没有缺失的音频)
  • 没有音频故障或不自然的停顿
  • 音色与角色个性匹配
  • 音频级别一致

下一步:

  • 在最终导出前预览完整视频
  • 返回编辑器页面进行最终视频编辑
  • 导出带有专业音频的完整视频

12. 常见工作流程示例

以下是从头到尾的典型配音工作流程:

12.1 完整配音工作流程

  1. 准备脚本:在编辑器中为每个镜头编写旁白文本
  2. 进入配音页面:从项目导航菜单访问
  3. 分配角色音色:为旁白和角色选择合适的音色
  4. 生成音频:点击”多角色配音生成”为所有镜头生成
  5. 预览和调整:查看音频并根据需要进行调整
  6. 调整稳定性:根据需要为特定镜头微调参数
  7. 应用口型同步:为适用的镜头生成口型同步(可选)
  8. 最终检查:播放整个时间轴以验证质量
  9. 返回编辑器:返回进行最终视频编辑
  10. 导出视频:渲染带有专业音频的最终视频

13. 获得更好语音质量的提示

13.1 音色选择

  • 选择独特的音色:为不同角色选择独特的音色以避免混淆
  • 保持一致性:在整个过程中为每个角色保持相同的音色
  • 匹配个性:选择适合角色年龄、个性和角色的音色

13.2 技术质量

  • 调整稳定性:根据内容类型进行微调
  • 经常预览:在编辑过程中经常听取以尽早发现问题
  • 使用时间轴可视化:检查音频分段是否合理

13.3 工作流程效率

  • 先分配所有音色:在生成前完成音色分配
  • 批量生成:使用多角色生成以提高效率
  • 保存收藏:为常用音色加星标以便快速访问

14. 故障排除常见问题

14.1 声音不稳定或不一致

解决方案:

  • 将稳定性参数增加到 1.0
  • 如果太僵硬,尝试具有更自然变化的不同音色
  • 检查脚本是否有异常格式或字符

14.2 音频生成失败

解决方案:

  • 验证镜头是否有旁白文本
  • 确保已为所有角色分配音色
  • 尝试重新生成该特定镜头的音频
  • 检查您的互联网连接

14.3 角色听起来太相似

解决方案:

  • 为每个角色分配更独特的音色
  • 选择性别、年龄和风格差异明显的音色
  • 使用音色库筛选器查找对比鲜明的音色

14.4 口型同步效果不理想

解决方案:

  • 确保镜头是单人正脸且面部清晰
  • 验证音频质量良好
  • 尝试调整音频并重新生成口型同步
  • 检查镜头是否符合口型同步要求

15. 口型同步功能

口型同步功能可以让视频中的人物口型与音频完美匹配,创造自然真实的视频。

口型同步

15.1 什么是口型同步?

口型同步是一项 AI 技术,可以自动调整视频中的嘴部动作以精确匹配音频。这让视频看起来就像人物真的在说话一样。

15.2 最佳使用场景

口型同步在以下场景中效果最佳:

  • 单人正脸镜头:画面中只有一个人面向镜头
  • 清晰的面部特征:人物面部清晰可见,没有遮挡
  • 对话场景:访谈、独白、教学视频

15.3 限制

重要约束:

  • 最适合单人正脸镜头(多人或侧脸效果可能不佳)
  • 需要镜头同时包含视频和音频
  • 面部必须清晰可见,不能有遮挡物
  • 最适合人脸(不适合动画角色)

15.4 如何使用口型同步

  1. 在配音页面选择一个包含视频和音频的镜头
  2. 点击右侧面板的口型同步标签
  3. 点击视频对口型按钮
  4. 等待 AI 处理(通常需要几分钟)
  5. 处理完成后预览口型同步后的视频
  6. 如果满意,应用到最终视频

15.5 口型同步工作流程

典型工作流程:

  1. 先生成音频:使用配音功能为镜头生成音频
  2. 检查镜头适用性:确保镜头是单人正脸且面部清晰
  3. 应用口型同步:在口型同步面板中点击生成
  4. 预览结果:查看口型同步效果
  5. 根据需要微调:如果效果不理想,调整音频并重新生成
  6. 导出视频:满意后导出最终视频

15.6 提示和技巧

  • 先完成音频:在应用口型同步之前确保音频已生成并满意
  • 选择合适的镜头:不是所有镜头都适合——选择清晰的正脸镜头以获得最佳效果
  • 耐心等待:口型同步需要 AI 处理,可能需要几分钟
  • 多次尝试:如果第一次尝试不理想,调整音频后重新生成

16. 总结和下一步

使用这些工具,您可以从脚本到最终视频创建专业品质的旁白:

关键要点:

  • 使用编辑器进行快速语音生成
  • 使用配音页面进行高级多角色对话
  • 为角色分配音色以保持一致性
  • 调整稳定性参数以匹配内容风格
  • 使用口型同步创建逼真的对话场景

建立您的音色库:

  • 为未来项目保存喜欢的音色
  • 记录成功的音色和参数组合
  • 创建可重用的模板以获得一致的结果

准备好创作了吗? 开始尝试语音生成,发现专业旁白如何改变您的视频!