语音克隆最佳实践
更好的语音克隆始于更好的源素材。源音频的微小改进就能对最终语音产生显著影响。保持样本清晰
目标是获得以下语音:- 清晰
- 干声
- 低噪音
- 没有强烈的音乐或人群声音
使用一致的语音
当样本素材听起来像是一种连贯的说话风格时,模型响应效果更好。 尽量保持:- 相似的录音环境
- 相似的说话语调
- 相似的能量水平
匹配您想要的表现形式
克隆的语音往往会继承样本素材的风格。- 平静的样本会产生更平静的输出
- 富有表现力的样本会产生更具表现力的输出
- 急促的语速可能会产生急促的输出
使用足够的音频,但不要过多
经验法则:- 尽可能使用至少约 1 分钟的有效语音
- 1 到 2 分钟的清晰素材通常是一个很好的范围
- 在大多数情况下,超过 5 分钟的音频几乎没有实际收益
保持音量平衡
尽量避免使用以下样本:- 声音太小
- 削波或失真
- 过度标准化导致听起来不自然
选择正确的隔离模式
对于大多数项目:- 从
Studio开始 - 仅当环境特征是体验的一部分时,才切换到
Realistic

