本教程将全面指导您使用语音生成和配音功能,为视频创建专业的旁白和多角色对话。
1. 什么是语音生成?
**语音生成(TTS - 文本转语音)**将您的脚本文本转换为自然的语音旁白,用专业品质的音频为您的故事注入生命。
1.1 何时使用语音生成
语音生成适用于:
- 视频旁白:为故事或视频内容添加配音
- 多角色对话:为不同角色分配独特的声音
- 快速迭代:更新脚本时快速重新生成音频
- 专业品质:无需录音设备即可制作广播级旁白
2. 两种生成语音的方式
您可以在两个位置生成语音,每个位置适合不同的工作流程:
2.1 编辑器页面
快速语音生成,提供基础控制以实现快速迭代。
2.2 配音页面
高级语音编辑,可精细控制句子、停顿和音色选择。
3. 快速开始:从编辑器生成语音
编辑器为整个项目或选定镜头提供快速访问语音生成功能。

3.1 如何在编辑器中重新生成语音
- 点击顶部标题栏的重新生成所有音频
- 从下拉菜单中选择旁白音色和角色音色
- 点击播放按钮预览音色样本
- 点击重新生成将音色应用到所有镜头
3.2 单个镜头的语音重新生成
快速 A/B 测试不同音色:
- 在时间轴中选择一个镜头
- 在右侧面板中找到音频部分
- 点击该镜头的重新生成音频
使用场景: 非常适合快速测试不同音色选项而不影响整个项目。
4. 配音页面:您的高级语音工作室
配音页面是进行详细语音编辑和多角色对话管理的主要工作区。

4.1 页面布局概览
配音页面由两个主要区域组成:
左侧区域
- 旁白列表:显示所有镜头的旁白文本——点击选择
- 时间轴控制:播放控制和音频分割时间轴
右侧面板(三个标签)
- 配音设置:调整旁白音色和参数
- 角色音色:为不同角色分配音色
- 口型同步:生成口型同步视频
5. 理解角色和音色分配
角色帮助您为不同角色和旁白组织音色,确保整个项目的一致性。

5.1 角色的工作原理
- 旁白:旁白文本的默认音色
- 角色:为说话的角色分配不同的音色
- 角色到音色的映射:将特定音色绑定到每个角色
- 全局应用:为角色设置音色并应用到所有匹配的镜头
5.2 为角色分配音色
- 点击右侧面板的角色音色标签
- 从角色列表中选择一个角色(旁白或角色名称)
- 点击选择音色按钮打开音色库
- 从库中选择一个音色
- 音色自动应用到该角色的所有镜头
专业提示: 在生成音频之前为所有角色分配音色以确保一致性。
6. 浏览和选择音色
音色库提供数百种音色供您选择,每种都具有独特的特性和风格。

6.1 音色库功能
强大的筛选:
- 按风格:叙述、戏剧、宣传、休闲
- 按语言:英语、中文、日语等
- 按性别:男性、女性、中性
预览与收藏:
- 预览音色:点击播放按钮试听样本
- 收藏:为常用音色加星标以便快速访问
6.2 如何选择音色
- 在角色音色面板中,点击选择音色
- 在音色库弹窗中,使用筛选器缩小选项范围
- 点击音色卡片上的播放按钮预览
- 点击选择将音色分配给当前角色
选择技巧:
- 决定前试听多个音色
- 考虑角色的个性和年龄
- 尽可能使用实际脚本文本测试音色
7. 多角色配音生成
一键为所有镜头生成音频,自动为每个角色应用适当的音色。
7.1 如何使用多角色配音生成
- 确保所有角色都已分配音色
- 点击时间轴上方的多角色配音生成按钮
- 系统为所有包含旁白文本的镜头生成音频
- 等待生成完成(可能需要几分钟)
- 完成后在时间轴上预览所有音频
生成时间: 取决于项目长度——大多数项目通常需要 2-5 分钟。
8. 上传自定义音频
有自己录制的音频?直接上传并使用时间轴工具将其分割到各个镜头。
8.1 上传工作流程
- 点击上传音频按钮
- 选择您的音频文件(支持常见格式:MP3、WAV、M4A)
- 音频自动添加到时间轴
- 使用时间轴标记将音频分割到不同镜头
使用场景:
- 专业配音录制
- 预先录制的旁白
- 来自外部来源的音频
9. 时间轴控制和音频分割
时间轴是配音页面的核心功能,提供对音频播放和分割的精确控制。
9.1 时间轴功能
播放控制:
- 播放/暂停:控制音频播放
- 跳转按钮:快速导航到上一个或下一个镜头
- 播放速度:调整速度(0.5x - 2x)
- 音量控制:调整播放音量
可视化时间轴:
- 显示所有镜头的音频段
- 显示波形以供视觉参考
- 指示镜头边界
9.2 音频分割功能
使用时间轴标记将完整音频文件分割到各个镜头:
- 将时间轴上的标记拖动到适当位置
- 标记自动对齐到镜头边界
- 调整后,点击应用分割按钮
- 系统按标记位置将完整音频分割到各个镜头
专业提示: 使用波形可视化来识别音频中的自然断点。
10. 调整语音参数
使用稳定性参数微调语音生成以匹配您的内容风格。

10.1 稳定性参数
点击时间轴上方的稳定性按钮调整语音稳定性:
稳定性级别:
- 高稳定性(1.0):更一致和稳定的表达
- 最适合:专业旁白、新闻、教育内容
- 中等稳定性(0.5):平衡的表达
- 最适合:讲故事、一般视频
- 低稳定性(0.0):更动态和富有表现力
- 最适合:戏剧对话、情感时刻
10.2 何时调整稳定性
增加稳定性当:
- 声音听起来太多变或不一致
- 您需要专业、稳定的旁白
- 录制教育或指导内容
降低稳定性当:
- 声音听起来太机械或僵硬
- 您想要更多情感表达
- 创作戏剧或戏剧性内容
11. 预览和导出
生成音频后,将其与视频一起预览以确保质量和时间。

11.1 预览工作流程
- 在旁白列表中点击一个镜头
- 使用时间轴播放控制来听取音频
- 观察时间轴上的音频波形和镜头分段
- 根据需要调整音色或重新生成
11.2 导出提示
质量检查清单:
- 所有镜头都已生成音频(没有缺失的音频)
- 没有音频故障或不自然的停顿
- 音色与角色个性匹配
- 音频级别一致
下一步:
- 在最终导出前预览完整视频
- 返回编辑器页面进行最终视频编辑
- 导出带有专业音频的完整视频
12. 常见工作流程示例
以下是从头到尾的典型配音工作流程:
12.1 完整配音工作流程
- 准备脚本:在编辑器中为每个镜头编写旁白文本
- 进入配音页面:从项目导航菜单访问
- 分配角色音色:为旁白和角色选择合适的音色
- 生成音频:点击”多角色配音生成”为所有镜头生成
- 预览和调整:查看音频并根据需要进行调整
- 调整稳定性:根据需要为特定镜头微调参数
- 应用口型同步:为适用的镜头生成口型同步(可选)
- 最终检查:播放整个时间轴以验证质量
- 返回编辑器:返回进行最终视频编辑
- 导出视频:渲染带有专业音频的最终视频
13. 获得更好语音质量的提示
13.1 音色选择
- 选择独特的音色:为不同角色选择独特的音色以避免混淆
- 保持一致性:在整个过程中为每个角色保持相同的音色
- 匹配个性:选择适合角色年龄、个性和角色的音色
13.2 技术质量
- 调整稳定性:根据内容类型进行微调
- 经常预览:在编辑过程中经常听取以尽早发现问题
- 使用时间轴可视化:检查音频分段是否合理
13.3 工作流程效率
- 先分配所有音色:在生成前完成音色分配
- 批量生成:使用多角色生成以提高效率
- 保存收藏:为常用音色加星标以便快速访问
14. 故障排除常见问题
14.1 声音不稳定或不一致
解决方案:
- 将稳定性参数增加到 1.0
- 如果太僵硬,尝试具有更自然变化的不同音色
- 检查脚本是否有异常格式或字符
14.2 音频生成失败
解决方案:
- 验证镜头是否有旁白文本
- 确保已为所有角色分配音色
- 尝试重新生成该特定镜头的音频
- 检查您的互联网连接
14.3 角色听起来太相似
解决方案:
- 为每个角色分配更独特的音色
- 选择性别、年龄和风格差异明显的音色
- 使用音色库筛选器查找对比鲜明的音色
14.4 口型同步效果不理想
解决方案:
- 确保镜头是单人正脸且面部清晰
- 验证音频质量良好
- 尝试调整音频并重新生成口型同步
- 检查镜头是否符合口型同步要求
15. 口型同步功能
口型同步功能可以让视频中的人物口型与音频完美匹配,创造自然真实的视频。

15.1 什么是口型同步?
口型同步是一项 AI 技术,可以自动调整视频中的嘴部动作以精确匹配音频。这让视频看起来就像人物真的在说话一样。
15.2 最佳使用场景
口型同步在以下场景中效果最佳:
- 单人正脸镜头:画面中只有一个人面向镜头
- 清晰的面部特征:人物面部清晰可见,没有遮挡
- 对话场景:访谈、独白、教学视频
15.3 限制
重要约束:
- 最适合单人正脸镜头(多人或侧脸效果可能不佳)
- 需要镜头同时包含视频和音频
- 面部必须清晰可见,不能有遮挡物
- 最适合人脸(不适合动画角色)
15.4 如何使用口型同步
- 在配音页面选择一个包含视频和音频的镜头
- 点击右侧面板的口型同步标签
- 点击视频对口型按钮
- 等待 AI 处理(通常需要几分钟)
- 处理完成后预览口型同步后的视频
- 如果满意,应用到最终视频
15.5 口型同步工作流程
典型工作流程:
- 先生成音频:使用配音功能为镜头生成音频
- 检查镜头适用性:确保镜头是单人正脸且面部清晰
- 应用口型同步:在口型同步面板中点击生成
- 预览结果:查看口型同步效果
- 根据需要微调:如果效果不理想,调整音频并重新生成
- 导出视频:满意后导出最终视频
15.6 提示和技巧
- 先完成音频:在应用口型同步之前确保音频已生成并满意
- 选择合适的镜头:不是所有镜头都适合——选择清晰的正脸镜头以获得最佳效果
- 耐心等待:口型同步需要 AI 处理,可能需要几分钟
- 多次尝试:如果第一次尝试不理想,调整音频后重新生成
16. 总结和下一步
使用这些工具,您可以从脚本到最终视频创建专业品质的旁白:
关键要点:
- 使用编辑器进行快速语音生成
- 使用配音页面进行高级多角色对话
- 为角色分配音色以保持一致性
- 调整稳定性参数以匹配内容风格
- 使用口型同步创建逼真的对话场景
建立您的音色库:
- 为未来项目保存喜欢的音色
- 记录成功的音色和参数组合
- 创建可重用的模板以获得一致的结果
准备好创作了吗? 开始尝试语音生成,发现专业旁白如何改变您的视频!