Skip to main content

Texto para fala

Use texto para fala quando quiser áudio falado a partir de texto sem passar pelo fluxo de trabalho completo de dublagem de vídeo. VoiceCheap gera o áudio com Fish Audio S2.1 Pro através do Vercel AI Gateway. Esta ferramenta possui um modelo de produção fixo e não utiliza um modelo de fallback.

Visualização pública e ferramenta de espaço de trabalho

A página inicial pública permite que os visitantes pesquisem e ouçam a biblioteca de vozes multilíngue. Gerar áudio, baixar arquivos MP3, visualizar o histórico e salvar uma voz clonada requer uma conta VoiceCheap. A ferramenta autenticada suporta:
  • 41 vozes multilíngues selecionadas com sotaques variados
  • nomes de voz, sotaques e estilos de fala pesquisáveis
  • sete predefinições de entrega: padrão, alegre, calmo, narrador, dramático, sussurro e enérgico
  • clones de voz reutilizáveis em planos pagos
  • um seletor de voz pesquisável com reprodução de prévia integrada
  • um reprodutor de áudio focado em transcrição baseado no padrão de interação da interface do ElevenLabs
  • destaque sincronizado com a reprodução, impulsionado por carimbos de data/hora medidos a partir do áudio gerado
  • histórico de geração e downloads de MP3
As predefinições de entrega são traduzidas em tags de ação de linguagem natural do S2.1 Pro. Por exemplo, Sussurro envia uma direção explícita entre colchetes antes de cada trecho de texto gerado para que o modelo aplique a entrega solicitada. O resultado reproduzível aparece assim que a geração termina. VoiceCheap então analisa o MP3 salvo em segundo plano para obter carimbos de data/hora reais de início e fim para suas palavras faladas. Esses carimbos de data/hora são armazenados em cache com o item do histórico, para que solicitações simultâneas compartilhem uma análise e a reprodução de um resultado existente não processe repetidamente o mesmo áudio. Se a sincronização estiver temporariamente indisponível ou o idioma falado não puder ser alinhado de forma confiável, a reprodução e o download continuam funcionando e a transcrição permanece estática em vez de exibir o destaque estimado.

Clonagem de voz salva

A clonagem de voz usa a API de modelo específica do provedor da Fish Audio, pois a geração de fala do AI Gateway não expõe a criação de modelos. As amostras de voz devem conter de 10 a 120 segundos de fala clara de um único falante. Os usuários devem confirmar que possuem permissão para clonar a voz. Quando as amostras selecionadas excedem 120 segundos combinados, os usuários podem optar pelo corte automático. VoiceCheap encurta cada arquivo selecionado conforme necessário para que todas as amostras contribuam enquanto o total enviado permanece dentro do limite de 120 segundos. A gaveta de clonagem permanece bloqueada enquanto uma voz está sendo criada. O botão de criar mantém um indicador de carregamento visível, e os controles do formulário permanecem desativados até que a solicitação seja bem-sucedida ou falhe. A fala do AI Gateway está configurada atualmente em $0 por milhão de bytes UTF-8 enquanto a promoção da Fish Audio estiver ativa. Defina FISH_AUDIO_TTS_PRICE_PER_MILLION_UTF8_BYTES para a taxa pós-promoção ao vivo quando o faturamento do Gateway for retomado; a taxa padrão pública é atualmente de $15 por milhão de bytes UTF-8. Os limites de voz salva são separados dos limites de vozes personalizadas de dublagem:
  • Gratuito: 0 vozes salvas
  • Tester, Beginner e Starter: 3 vozes salvas
  • Creator e Worldwide: 5 vozes salvas
  • Scale, Pro, Entrepreneur e Enterprise: 10 vozes salvas

Bons casos de uso

  • narrações
  • trechos falados
  • verificações de pronúncia
  • testes de narração bruta

Quando usar um projeto completo em vez disso

Use um projeto de dublagem completo quando o áudio precisar permanecer vinculado a:
  • uma transcrição existente
  • um vídeo traduzido
  • legendas
  • sincronização labial
  • Smart Publish

Páginas relacionadas