描述
HiFi-GAN 代表了语音合成技术的一项重大进步,它利用生成对抗网络(GAN)以卓越的效率和保真度生成原始音频波形。与以往常常难以媲美自回归和流模型的质量的基于 GAN 的方法不同,HiFi-GAN 通过专注于建模语音音频固有的周期性模式这一关键方面,引入了一种新颖的方法。这种对周期性的关注是提升整体样本质量的关键,从而合成出与人类语音高度相似的语音。
HiFi-GAN 的有效性通过主观人类评估得到证明,其获得了较高的平均意见得分(MOS),表明其与人类语音的相似度。该模型能够在 22.05 kHz 下生成高保真音频,在单个 V100 GPU 上运行速度高达实时速度的 167.9 倍。这种速度和质量的结合使其在各种应用中都非常实用。
此外,HiFi-GAN 展现出强大的通用性,在对未见过说话人的梅尔频谱图反演和端到端语音合成任务中均表现出色。这种适应性使其无需进行大量重新训练即可应用于更广泛的数据集和场景。该研究还提出了一种轻量级的 HiFi-GAN 版本,该版本在 CPU 上实现了令人印象深刻的性能,生成样本的速度比实时快 13.4 倍,同时保持了与自回归模型相当的质量。这个优化版本使高质量语音合成更加普及,即使在性能较低的硬件上也能轻松使用。
该项目提供了不同配置和数据集的音频样本,包括单说话人(LJ Speech)、未见过说话人(VCTK)以及端到端合成。还包括了消融研究,深入探讨了多周期判别器(MPD)、多尺度判别器(MSD)和多分辨率特征(MRF)损失等不同组件的影响。该实现是公开可用的,鼓励在高效高保真语音合成领域进行进一步的研究和开发。
HiFi-GAN 语音合成亮点
生成对抗网络(GAN)架构
高效语音合成
高保真音频生成
建模音频中的周期性模式
支持单说话人合成
支持未见过说话人合成
支持端到端语音合成
快速推理速度(V100 GPU 上最高可达实时速度的 167.9 倍)
适用于 CPU 推理的轻量级版本(最高可达实时速度的 13.4 倍)
生成 22.05 kHz 高保真音频
质量媲美自回归模型
提供消融研究
HiFi-GAN 语音合成入门
访问模型:从 GitHub 下载或克隆 HiFi-GAN 存储库。
设置环境:按照存储库中的说明安装必要的 Python 库和依赖项。
通过 API 集成:利用提供的代码将 HiFi-GAN 集成到您的语音合成流程中。
准备音频数据:根据模型要求格式化您的输入梅尔频谱图或原始音频。
运行推理:执行模型以生成合成语音波形。
评估结果:评估生成音频样本的质量和速度。
HiFi-GAN 语音合成的使用案例
- 语音合成
- 语音助手
- 有声读物旁白
- 内容创作
- 辅助工具
- 研究与开发


