Skip to main content

Hoe lipsynchronisatie werkt

Lipsynchronisatie neemt een bronvideo en een nieuw audiospoor, en werkt vervolgens de mondbewegingen van de spreker bij zodat deze beter overeenkomen met de vertaalde spraak.

Wat verandert er en wat blijft hetzelfde

VoiceCheap richt zich op het gebied van het sprekende gezicht. In de praktijk:
  • de beweging van de mond en het onderste deel van het gezicht worden bijgewerkt
  • de doel-audio stuurt de nieuwe mondbeweging aan
  • de rest van het frame blijft zo intact mogelijk

De pijplijn op hoog niveau

1

Detecteer het gezicht

VoiceCheap identificeert het sprekende gezicht en volgt de relevante gezichtskenmerken rond de mond en het onderste deel van het gezicht.
2

Analyseer de vertaalde audio

Het systeem luistert naar de doel-audio en berekent de mondvormen die nodig zijn om bij de spraak te passen.
3

Nieuwe lipbeweging genereren

Het sprekende gebied wordt frame voor frame opnieuw gegenereerd om nauwer aan te sluiten bij de vertaalde audio.
4

Het resultaat terug in de video mengen

Het gegenereerde mondgebied wordt terug in het originele frame geplaatst, zodat het resultaat visueel coherent blijft.

Waar lipsynchronisatie in de workflow past

Lipsynchronisatie is niet de eerste kwaliteitsstap. De gebruikelijke volgorde is:
  1. zorg dat het transcript klopt
  2. kies de stemstrategie
  3. zorg ervoor dat de nagesynchroniseerde audio natuurlijk klinkt
  4. voeg lipsynchronisatie toe als het project daar baat bij heeft
Als de vertaalde stem of timing nog steeds niet goed klinkt, los dat dan eerst op. Lipsynchronisatie werkt het beste wanneer de audio al in goede staat is.

Beperkingen om rekening mee te houden

  • sterke profielaanzichten zijn moeilijker dan frontale opnames
  • zware obstructies rond de mond verminderen de kwaliteit
  • schokkerige beelden verminderen de betrouwbaarheid van gezichtstracking
  • ruisende of overlappende audio kan de natuurlijkheid van het eindresultaat verminderen

Gerelateerde pagina’s