Skip to main content
Iniciar traducción

Iniciar traducción

Cree un nuevo proyecto de traducción subiendo un archivo de video o audio. El proceso de traducción se ejecuta de forma asíncrona en segundo plano. Utilice el endpoint de estado para realizar un seguimiento del progreso y recuperar los resultados. Utilice Obtener detalles del proyecto cuando necesite el historial de versiones traducidas o el historial de sincronización labial.

Límite de concurrencia

Puede ejecutar hasta 10 traducciones al mismo tiempo por cuenta. Si ya hay 10 traducciones en curso, las nuevas solicitudes devuelven CONCURRENT_TRANSLATION_LIMIT_REACHED (HTTP 429).

Solicitud

Este endpoint acepta multipart/form-data con una subida de archivo.

Encabezados

string
requerido
Tu clave de API VoiceCheap. Obtén una en app.voicecheap.ai/page-api.

Parámetros del cuerpo

file
requerido
El archivo de video o audio a traducir.Formatos de video admitidos: video/mp4, video/quicktime, video/x-matroska, video/webm, video/mpegFormatos de audio admitidos: audio/mpeg, audio/wav, audio/mp4, audio/x-m4a, audio/flac, audio/ogg, audio/aac, audio/webmTamaño máximo de archivo por plan: Beginner 5 GB, Starter 10 GB, Creator 20 GB, Pro 30 GB, Scale 40 GB y Enterprise 60 GB.
string
requerido
El idioma al que traducir el contenido. Debe estar en minúsculas.Valores permitidos (más de 70): afrikaans, albanian, amharic, arabic, armenian, assamese, azerbaijani, basque, belarusian, bengali, bosnian, bulgarian, catalan, croatian, czech, danish, dutch, english, british english, estonian, finnish, french, french canadian, galician, german, greek, gujarati, hebrew, hindi, hungarian, icelandic, indonesian, irish, italian, japanese, kannada, kazakh, khmer, korean, lao, latvian, lithuanian, macedonian, malay, malayalam, mandarin, marathi, mongolian, nepali, norwegian, persian, polish, portuguese, brazilian portuguese, punjabi, romanian, russian, serbian, slovak, slovenian, spanish, swahili, swedish, tagalog, tamil, telugu, thai, turkish, ukrainian, urdu, vietnamese, welsh, yoruba, zulu
string
El idioma de origen del contenido utilizando códigos de idioma ISO (p. ej., en, es, fr, de, ja, zh).
Altamente recomendado: Déjalo vacío para la detección automática.Solo proporciona este parámetro si estás 100% seguro de que el código de idioma es correcto y tiene un formato ISO válido. Los códigos de idioma incorrectos provocarán fallos en la transcripción. Nuestra detección automática admite más de 80 idiomas y es altamente precisa.
Predeterminado: auto-detect
string
Un nombre personalizado para el proyecto. Útil para identificar proyectos en tu panel de control.Predeterminado: Se utilizará el ID del proyecto si no se proporciona.
string
Un endpoint https que recibe los eventos de webhook para este proyecto, anulando el endpoint configurado en tu cuenta.Predeterminado: El endpoint de webhook de la cuenta, cuando hay uno configurado.
string
auto-detect o un número entero de 1 a 32. Un número conocido de hablantes puede mejorar la diarización.Predeterminado: auto-detect
string
Una matriz de cadenas JSON de nombres, marcas, acrónimos o términos especializados específicos de la solicitud. Estos términos se combinan con el glosario guardado de la cuenta o del equipo.
boolean
Elimina las muletillas comunes de la transcripción original antes de la traducción.Predeterminado: true
string
Una transcripción SRT existente en el idioma de origen. originalLanguage debe ser explícito cuando se proporciona este campo.
boolean
Si se debe conservar el audio de fondo en la salida.Cuando está habilitado, mantiene la música de fondo, el ambiente, las risas, los aplausos y los sonidos de la multitud mientras elimina solo la voz original (separación de pistas). Desactívalo si tu fuente no tiene audio de fondo.Predeterminado: true
boolean
Mantén al hablante original en un volumen bajo debajo de la voz traducida.Predeterminado: false
number
Volumen de la voz original de 1 a 70 cuando keepOriginalVoice está habilitado.Predeterminado: 30
string
Modo de aislamiento de voz cuando keepBackgroundMusic está habilitado. Controla la calidad y las características de la separación de voz.
Nuestro procesamiento de voz predeterminado, diseñado para una calidad de audio profesional:
  • Elimina ecos y reverberaciones
  • Limpia imperfecciones técnicas
  • Produce una voz clara y nítida
Recomendado para: La mayoría de los proyectos donde la calidad del audio es primordial. Ideal para tutoriales, contenido educativo, videos de marketing y cualquier contenido que requiera una claridad de voz óptima.
Conserva las características naturales del entorno de grabación:
  • Mantiene un sonido más cercano a la grabación original
  • Preserva las características ambientales
Recomendado para: Contenido donde la autenticidad del entorno es importante, como vlogs al aire libre, documentales o contenido donde el ambiente sonoro sea una parte integral de la experiencia.
Esta opción puede crear artefactos o efectos inesperados en algunos casos debido a la preservación de elementos de fondo.
Valores permitidos: studio, realisticPredeterminado: studio
boolean
Si se deben generar subtítulos para el video traducido.Cuando está habilitado, añade subtítulos limpios en blanco y negro al estilo Netflix. Usa subtitlesSource para elegir el texto original (idioma de origen) o traducido (idioma de destino). Los subtítulos se sincronizan automáticamente para una legibilidad óptima.Nota: Los subtítulos incrustados requieren FFmpeg con el filtro subtitles (libass). Si no está disponible, la API recurre a incrustar una pista de subtítulos en lugar de un estilo quemado permanentemente.Predeterminado: false
string
Elija la fuente del texto de los subtítulos cuando subtitles esté habilitado.Valores permitidos: translated, originalPredeterminado: translatedNota: Si se selecciona original pero la transcripción original no está disponible, los subtítulos recurrirán a translated.
string
Activa el procesamiento de sincronización labial una vez completada la traducción.
  • standard = Lip Sync
  • pro = Lip Sync Pro
  • studio = Lip Sync Studio
Los modos premium aplican sus requisitos normales de plan, duración y créditos.Predeterminado: omita el campo para omitir la sincronización labial.
boolean
Habilite la detección de hablante activo para la ejecución de sincronización labial solicitada.Predeterminado: false
boolean
Selector de sincronización labial heredado conservado para compatibilidad con versiones anteriores.
  • false = Sincronización labial estándar (4 minutos de créditos por 1 minuto de video)
  • true = Lip Sync Pro (9 minutos de créditos por 1 minuto de video)
Lip Sync Pro está disponible a partir del plan Creator.
Duración máxima: 30 minutos por video.Latencia: El procesamiento de sincronización labial suele añadir 2x-4x la duración del video original.
Los correos electrónicos de finalización y error de sincronización labial no se envían para las solicitudes activadas por API. Utilice el endpoint de estado para realizar un seguimiento del progreso.
Predeterminado: no habilitado (omita el campo para omitir la sincronización labial)Form-data: Envíe valores booleanos como cadenas true o false (p. ej., -F "lipsyncPro=false").
No combine lipsyncPro con un lipSyncMode conflictivo.
string
Estrategia de voz: cloning o custom.Predeterminado: cloning
string
Requerido cuando voiceMode es custom. La voz debe pertenecer al propietario efectivo del proyecto. Se rechazarán los ID de voz arbitrarios o sin propietario.
object
Ajuste los parámetros de clonación de voz para un control avanzado sobre la voz generada. Pase como una cadena JSON al usar form-data. Todos los valores deben estar entre 0 y 1 (con un incremento de 0.01).
Estos ajustes solo se aplican cuando voiceMode es cloning.
Valores predeterminados (equilibrados):
Recomendado para evitar la reproducción de acentos:
string
Una matriz JSON de rangos de tiempo de origen que deben permanecer en el idioma original.
Los saltos de tiempo requieren entrada de video y keepBackgroundMusic=true. No se pueden combinar con keepOriginalVoice y no pueden superponerse a los segmentos de transcripción.

Respuesta

boolean
requerido
Siempre true para solicitudes exitosas
string
requerido
Un mensaje legible por humanos que describe el resultado
string
requerido
El identificador único para el proyecto de doblaje creado. Utilice este ID para comprobar el estado.
number
requerido
Estimación aproximada del procesamiento en minutos. La estimación actual es de cinco minutos de procesamiento por cada minuto iniciado de medio de origen.

Ejemplos

Las reglas de glosario guardadas y las instrucciones de doblaje personalizadas de la cuenta o equipo efectivo se aplican automáticamente.

Ejemplo de respuesta

Errores