Comment fonctionne la synchronisation labiale
La synchronisation labiale prend une vidéo source et une nouvelle piste audio, puis met à jour les mouvements de la bouche du locuteur afin qu’ils correspondent mieux à la parole traduite.Ce qui change et ce qui reste identique
VoiceCheap se concentre sur la région du visage qui parle. En pratique :- le mouvement de la bouche et du bas du visage est mis à jour
- l’audio cible pilote le nouveau mouvement de la bouche
- le reste de l’image reste aussi intact que possible
Le pipeline de haut niveau
1
Détecter le visage
VoiceCheap identifie le visage qui parle et suit les points de repère faciaux pertinents autour de la bouche et du bas du visage.
2
Analyser l'audio traduit
Le système écoute l’audio cible et calcule les formes de bouche nécessaires pour correspondre à la parole.
3
Générer un nouveau mouvement labial
La zone de parole est régénérée image par image pour correspondre plus étroitement à l’audio traduit.
4
Intégrer le résultat dans la vidéo
La zone buccale générée est recomposée dans l’image originale afin que le résultat reste visuellement cohérent.
Où la synchronisation labiale s’inscrit dans le flux de travail
La synchronisation labiale n’est pas la première étape de qualité. L’ordre habituel est :- obtenir une transcription correcte
- choisir la stratégie de voix
- s’assurer que l’audio doublé semble naturel
- ajouter la synchronisation labiale si le projet en bénéficie
Limitations à prévoir
- les vues de profil marquées sont plus difficiles que les plans de face
- les obstructions importantes autour de la bouche réduisent la qualité
- les séquences instables réduisent la fiabilité du suivi du visage
- un audio bruyant ou superposé peut réduire le naturel du résultat final

