Hoe lipsynchronisatie werkt
Lipsynchronisatie neemt een bronvideo en een nieuw audiospoor, en werkt vervolgens de mondbewegingen van de spreker bij zodat deze beter overeenkomen met de vertaalde spraak.Wat verandert er en wat blijft hetzelfde
VoiceCheap richt zich op het gebied van het sprekende gezicht. In de praktijk:- de beweging van de mond en het onderste deel van het gezicht worden bijgewerkt
- de doel-audio stuurt de nieuwe mondbeweging aan
- de rest van het frame blijft zo intact mogelijk
De pijplijn op hoog niveau
1
Detecteer het gezicht
VoiceCheap identificeert het sprekende gezicht en volgt de relevante gezichtskenmerken rond de mond en het onderste deel van het gezicht.
2
Analyseer de vertaalde audio
Het systeem luistert naar de doel-audio en berekent de mondvormen die nodig zijn om bij de spraak te passen.
3
Nieuwe lipbeweging genereren
Het sprekende gebied wordt frame voor frame opnieuw gegenereerd om nauwer aan te sluiten bij de vertaalde audio.
4
Het resultaat terug in de video mengen
Het gegenereerde mondgebied wordt terug in het originele frame geplaatst, zodat het resultaat visueel coherent blijft.
Waar lipsynchronisatie in de workflow past
Lipsynchronisatie is niet de eerste kwaliteitsstap. De gebruikelijke volgorde is:- zorg dat het transcript klopt
- kies de stemstrategie
- zorg ervoor dat de nagesynchroniseerde audio natuurlijk klinkt
- voeg lipsynchronisatie toe als het project daar baat bij heeft
Beperkingen om rekening mee te houden
- sterke profielaanzichten zijn moeilijker dan frontale opnames
- zware obstructies rond de mond verminderen de kwaliteit
- schokkerige beelden verminderen de betrouwbaarheid van gezichtstracking
- ruisende of overlappende audio kan de natuurlijkheid van het eindresultaat verminderen

