Jak działa synchronizacja ruchu ust
Synchronizacja ruchu ust pobiera wideo źródłowe i nową ścieżkę dźwiękową, a następnie aktualizuje ruchy ust mówcy, aby lepiej pasowały do przetłumaczonej mowy.Co się zmienia, a co pozostaje bez zmian
VoiceCheap koncentruje się na obszarze twarzy mówiącej osoby. W praktyce:- ruch ust i dolnej części twarzy jest aktualizowany
- docelowy dźwięk steruje nowym ruchem ust
- reszta kadru pozostaje w miarę możliwości nienaruszona
Ogólny schemat procesu
1
Wykrywanie twarzy
VoiceCheap identyfikuje twarz mówcy i śledzi odpowiednie punkty orientacyjne twarzy wokół ust i dolnej części twarzy.
2
Analiza przetłumaczonego dźwięku
System nasłuchuje docelowego dźwięku i oblicza kształty ust potrzebne do dopasowania ich do mowy.
3
Generowanie nowego ruchu ust
Obszar mówienia jest generowany ponownie klatka po klatce, aby dokładniej dopasować go do przetłumaczonego dźwięku.
4
Wkomponowanie wyniku z powrotem w wideo
Wygenerowany obszar ust jest ponownie komponowany z oryginalną klatką, dzięki czemu wynik pozostaje wizualnie spójny.
Gdzie synchronizacja ruchu ust pasuje do przepływu pracy
Synchronizacja ruchu ust nie jest pierwszym krokiem poprawy jakości. Zazwyczaj kolejność wygląda następująco:- popraw transkrypcję
- wybierz strategię głosową
- upewnij się, że dubbing brzmi naturalnie
- dodaj synchronizację ruchu ust, jeśli projekt na tym zyska
Ograniczenia, których należy się spodziewać
- widoki z profilu są trudniejsze niż ujęcia frontalne
- duże przeszkody wokół ust obniżają jakość
- drżący materiał filmowy zmniejsza niezawodność śledzenia twarzy
- zaszumiony lub nakładający się dźwięk może zmniejszyć naturalność końcowego wyniku

