Skip to main content

Tekst naar spraak

Gebruik tekst naar spraak wanneer je gesproken audio uit tekst wilt zonder het volledige videonasynchronisatieproces te doorlopen. VoiceCheap genereert de audio met Fish Audio S2.1 Pro via de Vercel AI Gateway. Deze tool heeft één vast productiemodel en gebruikt geen fallback-model.

Openbare preview en werkruimtetool

De openbare landingspagina laat bezoekers zoeken in en luisteren naar de meertalige stemmenbibliotheek. Voor het genereren van audio, het downloaden van MP3-bestanden, het bekijken van de geschiedenis en het opslaan van een gekloonde stem is een VoiceCheap-account vereist. De geauthenticeerde tool ondersteunt:
  • 41 samengestelde meertalige stemmen met gevarieerde accenten
  • doorzoekbare stemnamen, accenten en spreekstijlen
  • zeven leveringspresets: standaard, vrolijk, kalm, verteller, dramatisch, fluisterend en energiek
  • herbruikbare stemklonen op betaalde abonnementen
  • een doorzoekbare stemkiezer met geïntegreerde preview-weergave
  • een audio-speler die transcript-first is, gebaseerd op het ElevenLabs UI-interactiepatroon
  • weergave-gesynchroniseerde markering aangestuurd door tijdstempels gemeten vanaf de gegenereerde audio
  • generatiegeschiedenis en MP3-downloads
Leveringspresets worden vertaald naar S2.1 Pro natuurlijke-taal actietags. Bijvoorbeeld, Fluisteren stuurt een expliciete instructie tussen vierkante haken vóór elk gegenereerd tekstblok, zodat het model de gevraagde levering toepast. Het afspeelbare resultaat verschijnt zodra de generatie is voltooid. VoiceCheap analyseert vervolgens de opgeslagen MP3 op de achtergrond om echte start- en eindtijdstempels voor de gesproken woorden te verkrijgen. Die tijdstempels worden gecachet bij het geschiedenisitem, zodat gelijktijdige verzoeken één analyse delen en het opnieuw afspelen van een bestaand resultaat niet herhaaldelijk dezelfde audio verwerkt. Als synchronisatie tijdelijk niet beschikbaar is of de gesproken taal niet betrouwbaar kan worden uitgelijnd, blijven afspelen en downloaden werken en blijft het transcript statisch in plaats van geschatte markering weer te geven.

Opgeslagen stemklonen

Stemklonen gebruikt de provider-specifieke model-API van Fish Audio omdat AI Gateway-spraakgeneratie geen modelcreatie blootstelt. Stemvoorbeelden moeten 10–120 seconden aan duidelijke spraak van één spreker bevatten. Gebruikers moeten bevestigen dat ze toestemming hebben om de stem te klonen. Wanneer de geselecteerde voorbeelden in totaal langer zijn dan 120 seconden, kunnen gebruikers kiezen voor automatisch inkorten. VoiceCheap kort elk geselecteerd bestand naar behoefte in, zodat alle voorbeelden bijdragen terwijl het ingediende totaal binnen de limiet van 120 seconden blijft. De kloon-lade blijft vergrendeld openstaan terwijl een stem wordt aangemaakt. De aanmaakknop behoudt een zichtbare spinner en formulierbesturingselementen blijven uitgeschakeld totdat het verzoek slaagt of mislukt. AI Gateway-spraak is momenteel geconfigureerd op $0 per miljoen UTF-8 bytes terwijl de Fish Audio-promotie actief is. Stel FISH_AUDIO_TTS_PRICE_PER_MILLION_UTF8_BYTES in op het live tarief na de promotie wanneer de Gateway-facturering wordt hervat; het openbare standaardtarief is momenteel $15 per miljoen UTF-8 bytes. Limieten voor opgeslagen stemmen staan los van limieten voor aangepaste stemmen bij nasynchronisatie:
  • Gratis: 0 opgeslagen stemmen
  • Tester, Beginner en Starter: 3 opgeslagen stemmen
  • Creator en Worldwide: 5 opgeslagen stemmen
  • Scale, Pro, Entrepreneur en Enterprise: 10 opgeslagen stemmen

Goede gebruiksscenario’s

  • voice-overs
  • gesproken fragmenten
  • uitspraakcontroles
  • ruwe verteltesten

Wanneer je in plaats daarvan een volledig project gebruikt

Gebruik een volledig nasynchronisatieproject wanneer de audio gekoppeld moet blijven aan:
  • een bestaand transcript
  • een vertaalde video
  • ondertitels
  • lipsynchronisatie
  • Smart Publish

Gerelateerde pagina’s