Descripción
FastSpeech 2 representa un avance significativo en la tecnología no autorregresiva de texto a voz (TTS), basándose en la base de su predecesor, FastSpeech. Mientras que FastSpeech ofrecía una síntesis más rápida en comparación con los modelos autorregresivos, dependía de un pipeline de destilación complejo y que consumía mucho tiempo entre profesor y estudiante. Este proceso, junto con la precisión de la predicción de duración y la posible pérdida de información durante la simplificación de datos, limitaba la calidad de voz alcanzable.
FastSpeech 2 aborda estas limitaciones al adoptar un enfoque de entrenamiento más directo. En lugar de depender de la salida destilada de un modelo profesor, entrena directamente con datos objetivo de verdad fundamental. Crucialmente, introduce información de variación adicional como entradas condicionales, incluyendo tono, energía y predicciones de duración más precisas. Estas características extraídas se utilizan durante el entrenamiento y se predicen durante la inferencia, lo que permite al modelo capturar mejor los matices del habla humana y resolver el problema inherente de mapeo uno a muchos en TTS, donde un solo texto puede corresponder a múltiples variaciones de voz.
Una innovación adicional se observa en FastSpeech 2s, que es pionero en la generación directa de formas de onda de voz a partir de texto de manera paralela. Esta capacidad de inferencia totalmente de extremo a extremo aumenta significativamente la velocidad de síntesis. Los resultados experimentales demuestran que FastSpeech 2 logra un aumento de tres veces en la velocidad de entrenamiento en comparación con FastSpeech, y FastSpeech 2s ofrece una inferencia aún más rápida. En términos de calidad de voz, tanto FastSpeech 2 como 2s superan a FastSpeech, y FastSpeech 2 incluso supera la calidad de los modelos autorregresivos tradicionales.
La arquitectura del modelo permite la integración directa de características acústicas, lo que resulta en un habla más expresiva y natural. Esto lo hace adecuado para una amplia gama de aplicaciones que requieren síntesis de voz rápida y de alta calidad. La capacidad de controlar y predecir variaciones en el tono y la energía abre posibilidades para salidas de voz más dinámicas y personalizadas, yendo más allá de la generación de voz estática.
Aspectos destacados de FastSpeech 2
Síntesis de texto a voz de extremo a extremo
Arquitectura de modelo no autorregresivo
Entrenamiento directo con objetivos de verdad fundamental
Incorpora tono y energía como entradas condicionales
Predice duración, tono y energía para inferencia
Logra una aceleración de entrenamiento 3x sobre FastSpeech
FastSpeech 2s ofrece generación de formas de onda paralela totalmente de extremo a extremo
Supera a FastSpeech en calidad de voz
Puede superar a los modelos autorregresivos en calidad de voz
Utiliza Parallel WaveGAN (PWG) como vocoder para muestras de audio
Reduce el ruido de fondo mediante sustracción espectral
Primeros pasos con FastSpeech 2
Acceder al Modelo: Obtener los pesos y el código del modelo FastSpeech 2.
Configurar Entorno: Configurar el framework de aprendizaje profundo y las dependencias necesarias.
Preparar Datos: Recopilar y preprocesar datos de texto y audio correspondientes.
Entrenar Modelo: Entrenar FastSpeech 2 utilizando objetivos de verdad fundamental y características acústicas extraídas.
Integrar vía API: Implementar el modelo entrenado para inferencia en su aplicación.
Optimizar Inferencia: Utilizar FastSpeech 2s para una generación de voz más rápida y totalmente de extremo a extremo.
Casos de uso de FastSpeech 2
- Síntesis de Voz de Alta Calidad
- Entrenamiento TTS Más Rápido
- Desarrollo de Asistentes de Voz
- Creación de Contenido
- Herramientas de Accesibilidad
- Generación de Voz en Tiempo Real



