描述
Make-An-Audio 代表了文本到音频生成领域的重大进步,它利用提示增强的扩散模型来克服诸如高质量数据集有限以及长音频序列建模复杂性等挑战。该系统引入了一种新颖的伪提示增强技术,采用了“蒸馏-再编程”方法。这种方法通过整合弱监督数据(包括无语言音频)来有效缓解数据稀缺问题。
此外,Make-An-Audio 使用频谱图自编码器来预测自监督音频表示,而不是原始波形。这种架构选择,结合强大的对比语言-音频预训练(CLAP)表示,使模型能够在客观和主观评估中都达到最先进的性能。该系统通过无分类器引导展示了卓越的可控性,允许用户微调生成的音频输出。
除了基本的文本到音频之外,Make-An-Audio 还展示了 X 到音频任务的强大泛化能力,体现了“不落下任何模态”的原则。这使得能够根据用户定义的模态输入生成高清、高保真音频。该系统支持个性化文本到音频生成,能够将独特对象注入新场景并跨不同风格进行转换。例如,可以从初始的“雷声”声音生成“婴儿哭声”,从而产生逼真且忠实的音频。它还支持音频修复和图像到音频生成,扩展了其创意潜力。
Make-An-Audio亮点
用于文本到音频生成的提示增强扩散模型
使用蒸馏-再编程方法的伪提示增强
用于音频表示预测的频谱图自编码器
对比语言-音频预训练(CLAP)表示
用于可控性的无分类器引导
X 到音频任务的泛化(例如,图像到音频、视频到音频)
具有对象注入和风格转换的个性化文本到音频生成
音频修复功能
生成高清、高保真音频
解决音频生成中的数据稀缺问题
Make-An-Audio入门
访问模型:获取 Make-An-Audio 模型的访问权限。
通过 API 集成:通过 API 连接到模型以进行程序化使用。
提供文本提示:输入所需的音频生成文本描述。
指定模态输入(可选):对于 X 到音频任务,提供相关的图像或视频输入。
配置引导:利用无分类器引导来微调音频特性。
生成音频:启动音频生成过程。
优化输出:调整参数以进行个性化音频或修复任务。
Make-An-Audio的使用案例
- 文本到语音合成
- 音效生成
- 音频修复
- 图像到音频
- 视频到音频
- 个性化音频内容
- 音乐生成
- AI 研究


