音声クローニングのベストプラクティス
より良いクローニングは、より良いソース素材から始まります。ソース音声のわずかな改善が、最終的な音声に顕著な違いをもたらすことがあります。サンプルをクリーンに保つ
以下のような音声を目指してください:- クリアであること
- ドライであること(残響がない)
- 低ノイズであること
- 激しい音楽や群衆の音が含まれていないこと
一貫した音声を使用する
サンプル素材が統一された話し方であるほど、モデルはより良く反応します。 以下を維持するように努めてください:- 同様の録音環境
- 同様の話し方のトーン
- 同様のエネルギーレベル
求めるパフォーマンスに合わせる
クローンされた音声は、サンプル素材のスタイルを引き継ぐ傾向があります。- 落ち着いたサンプルは、より落ち着いた出力を生成します
- 表現力豊かなサンプルは、より表現力豊かな出力を生成します
- 早口の話し方は、早口の出力を生成する可能性があります
十分な量の音声を使用するが、多すぎないようにする
経験則として:- 可能な場合は、少なくとも1分程度の有効な音声を使用してください
- 1〜2分のクリアな素材が、通常は強力な範囲です
- ほとんどの場合、5分を超えても実用的な利点はほとんどありません
音量を一定に保つ
以下のようなサンプルは避けてください:- 音量が小さすぎる
- クリップしている、または歪んでいる
- 不自然に聞こえるほど過度にノーマライズされている
適切な分離モードを選択する
ほとんどのプロジェクトでは:Studioから開始してください- 環境の特性が体験の一部である場合にのみ、
Realisticに切り替えてください

