描述
Meta AI 的研究人员开发了 Voicebox,这是一款突破性的生成式语音 AI 模型,它能够泛化到其未专门训练的任务,并达到最先进的性能。与需要针对特定任务进行训练数据的传统语音 AI 模型不同,Voicebox 使用新颖的 Flow Matching 方法(这是对扩散模型的一项改进)从原始音频和相应的转录文本中进行学习。
Voicebox 在创建高质量音频片段方面表现出色,能够以六种语言合成语音:英语、法语、西班牙语、德语、波兰语和葡萄牙语。其多功能性还体现在执行高级语音编辑任务,如降噪、内容编辑和风格转换。一项关键创新是它能够修改音频样本的任何部分,而不仅仅是结尾部分,这使其比自回归模型更具灵活性。
在性能基准测试中,Voicebox 显著优于现有模型。在零样本文本到语音任务上,其清晰度和音频相似性均优于 VALL-E,同时速度快 20 倍。在跨语言风格迁移方面,与 YourTTS 相比,Voicebox 降低了词错误率并提高了音频相似性。这些进步在英语和多语言基准测试的词错误率和音频风格相似性指标上均创下了新的最先进记录。
Voicebox 的能力支持多种令人兴奋的用例。它可以执行上下文文本到语音合成,通过匹配简短音频样本的风格来生成新语音。跨语言风格迁移能够实现跨越语言障碍的自然交流。此外,其语音降噪和编辑功能可以无缝修复损坏的音频片段或替换说错的词语,从而简化音频后期制作。该模型还可以生成代表真实语音模式的多样化语音样本,可用于训练更鲁棒的语音助手模型。
认识到潜在的滥用风险,Meta AI 目前不会公开发布 Voicebox 模型或代码。取而代之的是,他们正在分享音频样本和一份详细的研究论文,概述了其方法和结果。这包括有关一个高效分类器的信息,该分类器旨在区分真实音频和 Voicebox 生成的音频,以减轻潜在风险并促进负责任的 AI 开发。
Voicebox亮点
生成式语音 AI 模型
跨语音任务泛化
最先进的性能
支持六种语言的语音合成
执行降噪
支持内容编辑
支持风格转换
生成多样化的语音样本
采用 Flow Matching 模型
可修改音频样本的任何部分
在零样本 TTS 上优于 VALL-E
在跨语言风格迁移上优于 YourTTS
在基准测试上取得新的最先进结果
在超过 50,000 小时的语音数据上进行训练
Voicebox入门
访问模型:通过研究出版物和共享样本获取 Voicebox 模型访问权限。
理解方法:研究详细介绍 Flow Matching 方法和训练数据的研究论文。
评估性能:分析提供的音频样本和基准测试结果,以了解清晰度和相似性。
探索功能:查看上下文 TTS、跨语言迁移和音频编辑等用例。
评估负责任 AI:了解用于区分生成音频和真实音频的已开发分类器。
Voicebox的使用案例
- 语音合成
- 音频编辑
- 风格迁移
- 跨语言交流
- 合成数据生成
- 辅助工具
- 虚拟助手





