Skip to main content

音声クローニング

音声クローニングは元のソースから話者を再現するため、吹き替えが動画の元のアイデンティティにより近くなります。

VoiceCheapでの仕組み

音声クローニングが有効な場合、VoiceCheapはまず話者の音声を分離し、元のパフォーマンスの個性を維持しようとする翻訳音声を生成します。 品質は主に以下に依存します:
  • ソース音声の明瞭度
  • 選択した音声分離手法
  • ソースにノイズ、音楽、または重なった音声が含まれているかどうか

主要な制御

安定性

安定性は、生成された音声が生成ごとにどれだけ一定に保たれるかを制御します。
  • 値を低くすると、より幅広い感情表現が可能になります
  • 値を非常に低くすると、急いでいるように聞こえたり、一貫性がなくなったりすることがあります
  • 値を非常に高くすると、平坦または単調に聞こえることがあります

類似性

類似性は、生成された音声が元の音声プリントにどれだけ忠実に従うかを制御します。
  • 値を高くすると、元の話者に近づけることができます
  • ソース音声にノイズが多い場合、類似度を非常に高く設定すると不要なアーティファクト(ノイズ)まで取り込んでしまう可能性があります

スピーカーブースト

スピーカーブーストは、モデルを元の話者のアイデンティティに少し強く近づける機能です。
  • 通常はわずかな変化です
  • 計算量とレイテンシが増加します
  • クローン結果をソースに近づけたい場合に役立ちます

プレビューと再生成

VoiceCheapを使用すると、カスタマイズフロー内で音声の例をプレビューできます。これは、翻訳の全工程を実行する前にクローニングの品質を確認するための最良の方法です。 推奨されるワークフロー:
  1. StudioまたはRealisticを選択する
  2. 話者のサンプルをプレビューする
  3. 安定性、類似度、またはブーストを調整する
  4. 必要に応じてプレビューを再生成する
  5. プレビューの音声が適切であれば、翻訳版を開始する

クローニングを避けるべき場合

以下のような場合は、音声ライブラリまたはカスタム音声の方が適していることがあります:
  • 元の音声にノイズが多い
  • 複数の話者が頻繁に重なっている
  • ソースにクリアな音声がほとんど含まれていない
  • 多くのプロジェクトで一貫したナレーター音声を使用したい

既知のアクセントの制限(現在改善中)

一部の言語では、クローンされた出力のアクセント品質が不安定になることがあります。これは特に以下の場合によく見られます:
  • ベトナム語
  • タイ語
  • タガログ語(フィリピン語)
  • 一部のリソースが少ない、または希少な言語ペア
これらの場合、発音やアクセントがまだ完全にはネイティブに聞こえない可能性があります。アクセントの品質が重要な場合は、この動作を改善している間、当面は音声ライブラリの音声を選択することをお勧めします。 もう一つの既知の動作として、英語の話者をクローンした場合、翻訳された出力に英語のアクセントの特徴が残ることがあります。例えば、フランス語の出力がカナダ風のアクセントに近く聞こえることがあります。このリスクを減らすには、ターゲット言語の音声ライブラリから音声を選択する方が通常は適切です。現在、この問題の解決に積極的に取り組んでいます。

関連ページ