Skip to main content

음성 복제

음성 복제는 원본 소스의 화자를 재현하여 더빙이 영상의 원래 정체성에 더 가깝게 유지되도록 합니다.

VoiceCheap에서의 작동 방식

음성 복제가 활성화되면 VoiceCheap은 먼저 화자의 음성을 분리한 다음, 원본 연기의 특성을 보존하려는 번역된 음성을 생성합니다. 품질은 다음 요소에 크게 좌우됩니다:
  • 소스 음성의 깨끗함
  • 선택된 음성 분리 방식
  • 소스에 소음, 음악 또는 겹치는 음성이 포함되어 있는지 여부

주요 제어 기능

안정성

안정성은 생성된 음성이 생성 과정에서 얼마나 일정하게 유지되는지를 제어합니다.
  • 낮은 값은 더 넓은 감정 범위를 허용합니다
  • 매우 낮은 값은 서두르거나 일관성이 없어 보일 수 있습니다
  • 매우 높은 값은 평평하거나 단조롭게 들릴 수 있습니다

유사성

유사성은 생성된 음성이 원본 음성 지문을 얼마나 밀접하게 따르는지를 제어합니다.
  • 값이 높을수록 원본 화자와 더 유사하게 유지될 수 있습니다
  • 원본 오디오에 노이즈가 있는 경우, 유사도를 너무 높게 설정하면 원치 않는 아티팩트가 포함될 수 있습니다

화자 부스트

화자 부스트는 모델이 원본 화자의 정체성을 더 강하게 반영하도록 합니다.
  • 보통 미묘한 차이를 보입니다
  • 컴퓨팅 자원과 지연 시간이 증가합니다
  • 복제된 결과물이 원본과 더 가깝게 유지되기를 원할 때 유용할 수 있습니다

미리보기 및 재생성

VoiceCheap을 사용하면 맞춤 설정 흐름 내에서 음성 예시를 미리 들어볼 수 있습니다. 이는 전체 더빙 작업을 시작하기 전에 음성 복제 품질을 검증하는 가장 좋은 방법입니다. 권장 워크플로우:
  1. Studio 또는 Realistic 선택
  2. 화자 샘플 미리듣기
  3. 안정성, 유사도 또는 부스트 조정
  4. 필요한 경우 미리보기 재생성
  5. 미리보기 소리가 적절하면 번역된 버전 실행

음성 복제를 피해야 하는 경우

다음과 같은 경우에는 음성 라이브러리나 맞춤 음성이 더 나을 수 있습니다:
  • 원본 오디오에 노이즈가 많은 경우
  • 여러 화자의 목소리가 자주 겹치는 경우
  • 원본에 깨끗한 음성 데이터가 거의 없는 경우
  • 여러 프로젝트에 걸쳐 일관된 내레이터 음성을 원하는 경우

알려진 억양 제한 사항 (현재 개선 중)

일부 언어의 경우, 복제된 출력물의 억양 품질이 불안정할 수 있습니다. 이는 다음 언어에서 더 흔하게 나타납니다:
  • 베트남어
  • 태국어
  • 타갈로그어(필리핀어)
  • 일부 저자원 또는 희귀 언어 쌍
이러한 경우 발음과 억양이 아직 완전히 원어민처럼 들리지 않을 수 있습니다. 억양 품질이 중요하다면, 해당 동작을 개선하는 동안에는 음성 라이브러리의 음성을 사용하는 것을 권장합니다. 또 다른 알려진 동작: 영어 화자를 복제하면 번역된 출력물에 여전히 영어 억양 특성이 남아 있을 수 있습니다. 예를 들어, 프랑스어 출력물이 때때로 캐나다식 억양에 더 가깝게 들릴 수 있습니다. 이러한 위험을 줄이려면 대상 언어의 음성 라이브러리 음성을 선택하는 것이 보통 더 좋습니다. 저희는 이 문제를 적극적으로 개선하고 있습니다.

관련 페이지