> ## Documentation Index
> Fetch the complete documentation index at: https://api-docs.voicecheap.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 模型、速度与限制

> 按典型速度、质量配置、分辨率适配和当前时长限制比较 VoiceCheap 口型同步层级。

# 模型、速度与限制

每个口型同步层级在速度、质量和项目规模之间都有不同的权衡。

## 模型差异概览

| 层级              | 主要优势        | 最显著的改进                       | 最佳适用场景             |
| --------------- | ----------- | ---------------------------- | ------------------ |
| Lip Sync        | 速度与质量的最佳平衡  | 适用于大多数普通谈话类视频的自然口型同步         | 通用工作流程             |
| Lip Sync Pro    | 高级面部细节      | 更好的胡须细节、牙齿、嘴部区域保真度以及对更大脸部的处理 | 专业级特写和高质量导出        |
| Lip Sync Studio | 最强的整体场景理解能力 | 更好的连贯性、遮挡处理、角度鲁棒性和高分辨率输出     | 高难度镜头、高端作品以及最高质量目标 |

## 各模型的擅长领域

### Lip Sync

`Lip Sync` 是许多项目最实用的默认选择。

当您需要以下内容时，它是最佳选择：

* 快速交付
* 普通谈话类视频的良好质量
* 强大的质量与成本平衡

对于简单的视频，这通常已经足够。

### Lip Sync Pro

`Lip Sync Pro` 比标准口型同步更注重面部细节。

其主要优势包括：

* 更强的胡须渲染
* 更好的牙齿生成
* 更清晰的嘴部区域细节
* 更好地处理画面中较大的脸部区域

这就是为什么 Pro 版本通常更适合以下场景：

* 更紧凑的特写镜头
* 高端创作者内容
* 优质营销视频
* 对面部细节要求高于处理速度的项目

其代价是处理速度比标准 `Lip Sync` 更慢且成本更高。

### Lip Sync Studio

当拍摄本身难度较大或输出标准特别高时，`Lip Sync Studio` 是最强大的模型。

它最大的区别在于：

* 它能对整个镜头建立更全面的理解，而不是依赖较小的独立片段
* 它能原生处理遮挡问题，而无需依赖额外设置
* 它在侧面视角、肩部以上构图和非正面口型位置的表现要强得多
* 它能更好地保留说话者的语调、情感和表演细节
* 它是为更高质量的输出而构建的，包括更强的 4K 定位能力

这就是为什么 `Lip Sync Studio` 在以下方面优于 `Lip Sync Pro`：

* 高难度摄像机角度
* 面部有部分遮挡的镜头
* 在较长的不间断镜头中一致性至关重要的场景
* 对视觉伪影容忍度较低的优质短视频作品

## 为什么有些视频处理时间更长

两个时长相同的视频，其处理过程可能大不相同。

常见原因：

* 一个视频包含许多场景切换，而另一个大多是一个稳定的镜头
* 一个视频屏幕上有多个面孔
* 一个视频有更多的侧面视角或极端角度
* 一个视频在嘴部或面部有更多的部分遮挡
* 一个视频中说话者清晰可见且正在积极说话的帧数较少
* 一个视频的分辨率更高
* 处理时的队列负载不同

对于 `Lip Sync` 和 `Lip Sync Pro`，包含许多场景变化或许多没有清晰说话面孔帧的视频，其高效处理难度会大大增加。这可能会增加运行时间，并使长篇内容在处理困难时更容易失败。

`Lip Sync Studio` 在处理这些高难度镜头时通常更具韧性，但它仍然是最慢的层级，因为模型在每个镜头上执行的工作量更大。

## 为什么有些片段会失败或效果不佳

当源素材包含以下内容时，质量可能会下降：

* 静止或几乎静止且看起来不像在说话的面孔
* 许多快速剪辑
* 画面中过小的面孔
* 低层级下的强侧面镜头
* 严重的遮挡
* 非人类或非类人面孔

原则上：

* `Lip Sync` 适用于大多数标准视频
* `Lip Sync Pro` 可改善优质面部细节
* 当素材难度大、价值高或视觉要求高时，`Lip Sync Studio` 是最佳选择

## 典型性能

这些时间仅为估算值，而非保证。实际运行时间取决于队列负载、视频时长、分辨率和源素材的复杂程度。

| 层级              | 约 30 秒视频的典型时间 | 约 2 分钟视频的典型时间  | 备注                |
| --------------- | ------------- | -------------- | ----------------- |
| Lip Sync        | 约 1 到 3 分钟    | 约 4 到 8 分钟     | 大多数项目的最佳平衡点       |
| Lip Sync Pro    | 约 2 到 5 分钟    | 约 6 到 12 分钟    | 速度较慢，面部细节更强       |
| Lip Sync Studio | 约 10 到 15 分钟  | 可接近 45 到 55 分钟 | 最高质量层级，最适合优质短视频作品 |

## 当前时长限制

| 层级              | 当前最大视频时长 |
| --------------- | -------- |
| Lip Sync        | 30 分钟    |
| Lip Sync Pro    | 30 分钟    |
| Lip Sync Studio | 30 分钟    |

<Note>
  口型同步限制可能会随时间变化。如果您正在规划大型制作工作流，请在开始长任务之前在应用中确认当前限制。
  长任务。
</Note>

## 影响速度的因素

* 视频时长
* 分辨率
* 当前队列深度
* 面部角度复杂度
* 场景切换次数
* 可见人脸数量
* 说话人脸被遮挡的频率
* 说话者在整个镜头中是否清晰可见
* 音频清晰度

根据经验，1080p 通常是速度与质量之间的最佳平衡点。4K 可以使用，但会增加处理时间。

## 当前计费影响

以下是除翻译视频时长外，当前额外计费的分钟数：

* Lip Sync: `+4`
* Lip Sync Pro: `+9`
* Lip Sync Studio: `+14`

## 套餐可用性

* Beginner：不可用
* Starter: `Lip Sync`
* Creator：`Lip Sync` 和 `Lip Sync Pro`
* Pro：`Lip Sync` 和 `Lip Sync Pro`
* Scale：`Lip Sync`、`Lip Sync Pro` 和 `Lip Sync Studio`

## 相关页面

* [口型同步概述](/docs/zh/lip-sync/overview)
* [最佳实践](/docs/zh/lip-sync/best-practices)
