Skip to main content

文本转语音

当您想要从文本获取口述音频,且无需经过完整视频配音工作流时,请使用文本转语音。VoiceCheap 通过 Vercel AI Gateway 使用 Fish Audio S2.1 Pro 生成音频。此工具具有一个固定的生产模型,且不使用回退模型。

公开预览和工作区工具

公开落地页允许访客搜索并收听多语言语音库。生成音频、下载 MP3 文件、查看历史记录以及保存克隆语音需要 VoiceCheap 账户。 已认证工具支持:
  • 41 种精选的多语言语音,带有不同口音
  • 可搜索的语音名称、口音和说话风格
  • 七种交付预设:默认、欢快、冷静、旁白、戏剧性、耳语和充满活力
  • 付费计划中可重复使用的语音克隆
  • 带有集成预览播放功能的可搜索语音选择器
  • 基于 ElevenLabs UI 交互模式的转录优先音频播放器
  • 由从生成音频中测量的时间戳驱动的播放同步高亮显示
  • 生成历史记录和 MP3 下载
交付预设被翻译为 S2.1 Pro 自然语言动作标签。例如,耳语(Whisper)会在每个生成的文本块前发送明确的方括号指令,以便模型应用所请求的交付方式。 生成完成后,可播放的结果即会出现。VoiceCheap 随后会在后台分析保存的 MP3,以获取其口述单词的真实开始和结束时间戳。这些时间戳会与历史记录项一起缓存,因此并发请求共享一次分析,重播现有结果不会重复处理相同的音频。如果同步暂时不可用或无法可靠地对齐口述语言,播放和下载功能仍可继续工作,转录内容将保持静态,而不是显示估计的高亮显示。

保存的语音克隆

语音克隆使用 Fish Audio 的特定提供商模型 API,因为 AI Gateway 语音生成不公开模型创建功能。语音样本必须包含来自同一说话者的 10–120 秒清晰语音。用户必须确认他们拥有克隆该语音的权限。 当所选样本总时长超过 120 秒时,用户可以选择自动修剪。VoiceCheap 会根据需要缩短每个选定文件,以便所有样本都能参与,同时提交的总时长保持在 120 秒限制内。 在创建语音时,克隆抽屉保持锁定打开状态。创建按钮会保持可见的加载转圈,表单控件在请求成功或失败前保持禁用状态。 在 Fish Audio 促销活动期间,AI Gateway 语音目前配置为每百万 UTF-8 字节 $0。当 Gateway 计费恢复时,请将 FISH_AUDIO_TTS_PRICE_PER_MILLION_UTF8_BYTES 设置为促销后的实时费率;目前的公开标准费率为每百万 UTF-8 字节 15 美元。 保存的语音限制与配音自定义语音限制是分开的:
  • 免费版:0 个保存的语音
  • Tester、Beginner 和 Starter:3 个保存的语音
  • Creator 和 Worldwide:5 个保存的语音
  • Scale、Pro、Entrepreneur 和 Enterprise:10 个保存的语音

良好的使用场景

  • 旁白
  • 口述片段
  • 发音检查
  • 粗略旁白测试

何时改用完整项目

当音频需要与以下内容保持关联时,请使用完整配音项目:
  • 现有转录
  • 翻译后的视频
  • 字幕
  • 口型同步
  • Smart Publish

相关页面