Skip to main content

语音克隆最佳实践

更好的语音克隆始于更好的源素材。源音频的微小改进就能对最终语音产生显著影响。

保持样本清晰

目标是获得以下语音:
  • 清晰
  • 干声
  • 低噪音
  • 没有强烈的音乐或人群声音
录音质量比文件格式本身更重要。

使用一致的语音

当样本素材听起来像是一种连贯的说话风格时,模型响应效果更好。 尽量保持:
  • 相似的录音环境
  • 相似的说话语调
  • 相似的能量水平
如果源音频在耳语、大喊、嘈杂片段和清晰叙述之间切换,克隆结果可能会变得不稳定。

匹配您想要的表现形式

克隆的语音往往会继承样本素材的风格。
  • 平静的样本会产生更平静的输出
  • 富有表现力的样本会产生更具表现力的输出
  • 急促的语速可能会产生急促的输出
如果您想要清晰、稳定的叙述者感觉,使用具有相同风格的源片段通常效果更好。

使用足够的音频,但不要过多

经验法则:
  • 尽可能使用至少约 1 分钟的有效语音
  • 1 到 2 分钟的清晰素材通常是一个很好的范围
  • 在大多数情况下,超过 5 分钟的音频几乎没有实际收益

保持音量平衡

尽量避免使用以下样本:
  • 声音太小
  • 削波或失真
  • 过度标准化导致听起来不自然
平衡的录音电平优于过大的音量。

选择正确的隔离模式

对于大多数项目:
  • Studio 开始
  • 仅当环境特征是体验的一部分时,才切换到 Realistic

相关页面