Skip to main content

립싱크 작동 방식

립싱크는 소스 영상과 새로운 오디오 트랙을 가져와 번역된 음성에 더 잘 맞도록 화자의 입 모양을 업데이트합니다.

변경되는 것과 유지되는 것

VoiceCheap는 말하는 얼굴 영역에 집중합니다. 실제로는 다음과 같습니다:
  • 입과 하관의 움직임이 업데이트됩니다
  • 대상 오디오가 새로운 입 모양 움직임을 유도합니다
  • 프레임의 나머지 부분은 가능한 한 그대로 유지됩니다

상위 수준 파이프라인

1

얼굴 감지

VoiceCheap는 말하는 얼굴을 식별하고 입과 하관 주변의 관련 얼굴 랜드마크를 추적합니다.
2

번역된 오디오 분석

시스템은 대상 오디오를 듣고 음성에 맞추는 데 필요한 입 모양을 계산합니다.
3

새로운 립싱크 움직임 생성

말하는 영역을 프레임별로 다시 생성하여 번역된 오디오와 더 밀접하게 일치시킵니다.
4

결과를 비디오에 다시 합성

생성된 입 영역을 원래 프레임에 다시 합성하여 결과물이 시각적으로 일관성을 유지하도록 합니다.

워크플로우에서 립싱크가 차지하는 위치

립싱크는 품질 향상을 위한 첫 번째 단계가 아닙니다. 일반적인 순서는 다음과 같습니다:
  1. 정확한 대본 확보
  2. 음성 전략 선택
  3. 더빙된 오디오가 자연스럽게 들리는지 확인
  4. 프로젝트에 도움이 되는 경우 립싱크 추가
번역된 음성이나 타이밍이 여전히 어색하다면 먼저 수정하세요. 립싱크는 오디오가 이미 잘 갖춰져 있을 때 가장 효과적입니다.

예상되는 제한 사항

  • 측면 프로필 뷰는 정면 샷보다 어렵습니다
  • 입 주변의 심한 장애물은 품질을 저하시킵니다
  • 흔들리는 영상은 얼굴 추적의 신뢰성을 떨어뜨립니다
  • 잡음이 많거나 겹치는 오디오는 최종 결과물의 자연스러움을 감소시킬 수 있습니다

관련 페이지