描述
Chatterbox Turbo 是由 Resemble AI 开发的开源文本转语音 (TTS) 模型,旨在实现速度和表现力。它拥有 3.5 亿个参数,延迟仅为 75 毫秒,使其在 GPU 上的速度可达实时的六倍。
该模型支持零样本声音克隆,允许用户仅使用五秒的参考音频复制任何声音,无需额外的训练或微调。
Chatterbox Turbo 的独特之处在于其包含副语言提示,这使得模型能够在克隆的声音中执行自然的声音反应,例如叹息、喘息和咳嗽。此功能增强了生成音频的表现力,使其适用于语音助手、互动媒体和实时代理循环等应用。
该模型在设计时考虑了生产就绪性,提供简单的安装过程和全面的文档。它在 MIT 许可证下提供,确保开发者的灵活性。Chatterbox Turbo 还包括 PerTh 水印技术,这是一种心理声学技术,可以将数据嵌入音频输出中,确保真实性和可追溯性,而不影响音频质量。
Chatterbox Turbo 的性能已与 ElevenLabs Turbo v2.5 和 Cartesia Sonic 3 等专有模型进行了测试,在零样本场景中表现出优越的结果。该模型可通过 GitHub 和 Hugging Face 访问,为开发者提供快速集成所需的工具和资源。
Chatterbox Turbo亮点
开源 TTS 模型
3.5 亿参数
75 毫秒延迟
零样本声音克隆
副语言提示
PerTh 水印
MIT 许可证
流媒体就绪推理
Chatterbox Turbo入门
安装:使用 pip 进行安装
配置:使用参考脚本进行设置
使用:克隆声音并生成语音
优化:调整情感和副语言标签
Chatterbox Turbo的使用案例
- 语音助手
- 互动媒体
- 声音克隆
- 情感控制
- 安全音频








