描述
AudioGen 是一个创新的自回归生成模型,专为文本到音频生成而设计。它解决了根据描述性文本输入生成音频样本的复杂任务。该模型通过在学习到的离散音频表示中生成音频来运行,使其能够产生高保真音景。
AudioGen 的开发解决了文本到音频生成中固有的几个重大挑战。由于音频传播的性质,区分不同的声源(尤其是在多个声源同时存在时)非常困难。现实世界的录音条件(包括背景噪声和混响)进一步加剧了这种复杂性。另一个限制是文本标注的稀缺性,这限制了训练数据的可扩展性。此外,对高保真音频进行建模需要以高采样率进行编码,从而产生计算量巨大的极长序列。
为了克服这些障碍,AudioGen 采用了多项先进技术。涉及混合不同音频样本的增强策略鼓励模型在内部学习声源分离。为了应对文本-音频数据的稀缺性,我们精心策划了十个具有不同音频类型和文本标注的多元数据集。为了提高推理速度,我们探索了多流建模,允许使用更短的序列,同时保持可比的比特率和感知质量。采用无分类器引导来增强模型对所提供文本提示的遵循程度。与现有基线的比较评估表明,AudioGen 在客观和主观指标上都优于它们。
除了初始生成外,AudioGen 还探索了其进行条件和无条件音频续的能力。此功能允许根据文本引导或自由生成来扩展现有的音频片段。通过各种样本比较展示了模型的架构和性能,包括不同的模型大小以及混合和无分类器引导的影响。对多流建模的探索进一步凸显了其在管理序列长度和质量方面的灵活性。
AudioGen亮点
根据文本标题生成音频样本
在学习到的离散音频表示上运行
包含用于声源分离的增强技术
利用精心策划的数据集解决文本-音频数据稀缺问题
采用多流建模以实现更快的推理
应用无分类器引导以确保文本遵循性
在客观和主观指标上优于基线
支持音频续(条件和无条件)
探索不同的模型大小(例如,AudioGen-large,AudioGen-base)
展示混合和引导尺度的影响
处理现实世界音频的复杂性,如背景噪声
AudioGen入门
访问模型:获取 AudioGen 模型访问权限。
身份验证:如果需要,请验证您的访问权限。
设置环境:准备您的开发环境以进行集成。
通过 API 集成:使用提供的 API 端点发送文本提示。
生成音频:接收基于文本输入的生成的音频样本。
优化参数:调整引导尺度和模型配置以获得所需的输出。
AudioGen的使用案例
- 音效生成
- 音频内容创作
- 音频原型设计
- 辅助工具
- 交互式音频体验
- 音乐和声音设计
- 音频续写



