跳转到主要内容
ToolPotion

Chatterbox Turbo

Chatterbox Turbo 是 Resemble AI 开发的开源文本转语音模型,具有超快的性能,参数量为 3.5 亿,延迟为 75 毫秒。它支持从 5 秒的音频中进行声音克隆,并提供用于表现性输出的副语言标签。

查看模型
分享

描述

Chatterbox Turbo 是由 Resemble AI 开发的开源文本转语音 (TTS) 模型,旨在实现速度和表现力。它拥有 3.5 亿个参数,延迟仅为 75 毫秒,使其在 GPU 上的速度可达实时的六倍。

该模型支持零样本声音克隆,允许用户仅使用五秒的参考音频复制任何声音,无需额外的训练或微调。

Chatterbox Turbo 的独特之处在于其包含副语言提示,这使得模型能够在克隆的声音中执行自然的声音反应,例如叹息、喘息和咳嗽。此功能增强了生成音频的表现力,使其适用于语音助手、互动媒体和实时代理循环等应用。

该模型在设计时考虑了生产就绪性,提供简单的安装过程和全面的文档。它在 MIT 许可证下提供,确保开发者的灵活性。Chatterbox Turbo 还包括 PerTh 水印技术,这是一种心理声学技术,可以将数据嵌入音频输出中,确保真实性和可追溯性,而不影响音频质量。

Chatterbox Turbo 的性能已与 ElevenLabs Turbo v2.5 和 Cartesia Sonic 3 等专有模型进行了测试,在零样本场景中表现出优越的结果。该模型可通过 GitHub 和 Hugging Face 访问,为开发者提供快速集成所需的工具和资源。

Chatterbox Turbo亮点

  • 开源 TTS 模型

  • 3.5 亿参数

  • 75 毫秒延迟

  • 零样本声音克隆

  • 副语言提示

  • PerTh 水印

  • MIT 许可证

  • 流媒体就绪推理

Chatterbox Turbo入门

  1. 安装:使用 pip 进行安装

  2. 配置:使用参考脚本进行设置

  3. 使用:克隆声音并生成语音

  4. 优化:调整情感和副语言标签

Chatterbox Turbo的使用案例

  • 语音助手
  • 互动媒体
  • 声音克隆
  • 情感控制
  • 安全音频

Chatterbox Turbo的常见问题

From Resemble AI

a model in Resemble AI.

Chatterbox Turbo 评价

加载中...

与 Chatterbox Turbo 类似的热门AI工具

AI 应用

Chatterbox AI 提供实时语音克隆和文本转语音生成,延迟低于200毫秒。基于开源模型,提供情感控制和便捷的在线访问,非常适合 AI 代理、游戏和专业语音生成。

文字转语音媒体与娱乐

Sonic 是 Cartesia 的实时文本转语音 API,能够生成 44 种语言的富有表现力的声音,并带有笑声。专为 AI 代理和互动应用设计,提供低延迟和高质量的语音合成。

精选文字转语音

AI 模型

Bark是Suno开发的基于变换器的文本到音频模型,能够生成真实的多语言语音和其他音频形式。它支持通过预训练模型检查点进行推理的研究。

AI 模型与大语言模型

GPT-SoVITS 是一个语音克隆模型,使用户能够仅使用一分钟的语音数据创建高质量的文本转语音 (TTS) 输出。它利用少量学习技术进行有效的语音合成。

精选AI 语音生成器

Whisper Large V3 Turbo 是一款先进的自动语音识别和翻译模型,经过优化以提高速度,并减少了解码层。它支持多种语言,并提供强大的转录能力。

AI 模型与大语言模型

AI GitHub 仓库

VoiceStar 是一个强大的、可控时长的文本转语音 (TTS) 系统,能够推断语音模式。它旨在为各种应用提供高质量、可定制的语音输出。

AI 模型与大语言模型教育与在线学习

AI 平台

Inworld AI 提供排名第一的实时语音 AI,具有低于 200 毫秒的延迟,支持先进的文本转语音和语音转文本。它提供语音克隆、跨语言能力和 LLM 路由,显著降低了开发者的成本。大规模构建引人入胜、逼真的人工智能交互,适用于各种应用。

精选AI 游戏开发工具媒体与娱乐

Speechify 的 AI Voice Generator 可在几秒钟内从文本生成逼真的语音。它提供 60 多种语言的 1,000 多种 AI 语音,并可自定义音高、语调和语速。基本使用无需注册,可轻松为视频、播客和脚本生成配音。

精选文字转语音