Cómo funciona la sincronización labial
La sincronización labial toma un video de origen y una nueva pista de audio, luego actualiza los movimientos de la boca del orador para que coincidan mejor con el discurso traducido.Qué cambia y qué permanece igual
VoiceCheap se centra en la región de la cara que habla. En la práctica:- se actualizan el movimiento de la boca y la parte inferior de la cara
- el audio de destino impulsa el nuevo movimiento de la boca
- el resto del fotograma permanece lo más intacto posible
El proceso de alto nivel
1
Detectar la cara
VoiceCheap identifica la cara que habla y rastrea los puntos de referencia faciales relevantes alrededor de la boca y la parte inferior de la cara.
2
Analizar el audio traducido
El sistema escucha el audio de destino y calcula las formas de la boca necesarias para que coincidan con el discurso.
3
Generar nuevo movimiento labial
La región donde se habla se regenera fotograma a fotograma para ajustarse mejor al audio traducido.
4
Integrar el resultado en el vídeo
La región de la boca generada se compone de nuevo en el fotograma original para que el resultado sea visualmente coherente.
Dónde encaja la sincronización labial en el flujo de trabajo
La sincronización labial no es el primer paso de calidad. El orden habitual es:- corregir la transcripción
- elegir la estrategia de voz
- asegurarse de que el audio del doblaje suene natural
- añadir sincronización labial si el proyecto se beneficia de ello
Limitaciones a tener en cuenta
- las vistas de perfil marcadas son más difíciles que los planos frontales
- las obstrucciones importantes alrededor de la boca reducen la calidad
- las imágenes inestables reducen la fiabilidad del seguimiento facial
- el audio con ruido o superpuesto puede reducir la naturalidad del resultado final

