Skip to main content

テキスト読み上げ

完全な動画吹き替えワークフローを経由せずにテキストから音声を取得したい場合は、テキスト読み上げを使用してください。VoiceCheapは、Vercel AI Gatewayを通じてFish Audio S2.1 Proで音声を生成します。このツールには固定の生成モデルが1つあり、フォールバックモデルは使用しません。

パブリックプレビューおよびワークスペースツール

パブリックランディングページでは、訪問者が多言語の音声ライブラリを検索して試聴できます。音声の生成、MP3ファイルのダウンロード、履歴の表示、およびクローン音声の保存には、VoiceCheapアカウントが必要です。 認証済みツールは以下をサポートしています:
  • さまざまなアクセントを持つ41種類の厳選された多言語音声
  • 検索可能な音声名、アクセント、および話し方
  • 7つの配信プリセット:デフォルト、陽気、落ち着き、ナレーター、ドラマチック、ささやき、エネルギッシュ
  • 有料プランでの再利用可能な音声クローン
  • 統合されたプレビュー再生機能を備えた検索可能な音声ピッカー
  • ElevenLabsのUIインタラクションパターンに基づいた、文字起こし優先のオーディオプレーヤー
  • 生成された音声から測定されたタイムスタンプによる、再生と同期したハイライト表示
  • 生成履歴とMP3ダウンロード
配信プリセットは、S2.1 Proの自然言語アクションタグに変換されます。例えば、「ささやき」は各生成テキストチャンクの前に明示的な角括弧の指示を送信し、モデルが要求された配信を適用するようにします。 生成が完了するとすぐに再生可能な結果が表示されます。VoiceCheapは、保存されたMP3をバックグラウンドで分析し、話された単語の実際の開始および終了タイムスタンプを取得します。これらのタイムスタンプは履歴アイテムとともにキャッシュされるため、同時リクエストは1つの分析を共有し、既存の結果を再再生しても同じ音声が繰り返し処理されることはありません。同期が一時的に利用できない場合や、話された言語を確実に調整できない場合でも、再生とダウンロードは引き続き機能し、文字起こしは推定ハイライトを表示する代わりに静的な状態を維持します。

保存された音声クローニング

音声クローニングは、AI Gatewayの音声生成ではモデル作成が公開されていないため、Fish Audioのプロバイダー固有のモデルAPIを使用します。音声サンプルには、1人の話者による10〜120秒の明瞭な音声が含まれている必要があります。ユーザーは、音声をクローンする許可を得ていることを確認する必要があります。 選択したサンプルの合計が120秒を超える場合、ユーザーは自動トリミングを選択できます。VoiceCheapは、送信された合計が120秒の制限内に収まるように、必要に応じて選択されたすべてのファイルを短縮し、すべてのサンプルが貢献できるようにします。 音声が作成されている間、クローニングドロワーは開いたままロックされます。作成ボタンにはスピナーが表示され続け、リクエストが成功または失敗するまでフォームコントロールは無効のままになります。 AI Gatewayの音声は、現在Fish Audioのプロモーションが有効な間、$0(100万UTF-8バイトあたり)で構成されています。Gatewayの課金が再開されたら、FISH_AUDIO_TTS_PRICE_PER_MILLION_UTF8_BYTESをプロモーション後の通常料金に設定してください。現在の公開標準料金は100万UTF-8バイトあたり15ドルです。 保存された音声の制限は、吹き替えのカスタム音声の制限とは別です:
  • 無料:0個の保存された音声
  • Tester、Beginner、およびStarter:3個の保存された音声
  • CreatorおよびWorldwide:5個の保存された音声
  • Scale、Pro、Entrepreneur、およびEnterprise:10個の保存された音声

適したユースケース

  • ボイスオーバー
  • 音声スニペット
  • 発音チェック
  • ラフナレーションテスト

代わりに完全なプロジェクトを使用すべき場合

音声が以下と結びついている必要がある場合は、完全な吹き替えプロジェクトを使用してください:
  • 既存の文字起こし
  • 翻訳された動画
  • 字幕
  • リップシンク
  • Smart Publish

関連ページ