Description
FastSpeech 2 représente une avancée significative dans la technologie de synthèse vocale (TTS) non autorégressive, s'appuyant sur les fondations de son prédécesseur, FastSpeech. Alors que FastSpeech offrait une synthèse plus rapide par rapport aux modèles autorégressifs, il reposait sur un pipeline de distillation complexe et chronophage entre modèle enseignant et élève. Ce processus, ainsi que la précision de la prédiction de durée et la perte d'informations potentielle lors de la simplification des données, limitaient la qualité vocale réalisable.
FastSpeech 2 aborde ces limitations en adoptant une approche d'entraînement plus directe. Au lieu de s'appuyer sur la sortie distillée d'un modèle enseignant, il s'entraîne directement avec les données cibles de référence. De manière cruciale, il introduit des informations de variation supplémentaires en tant qu'entrées conditionnelles, notamment la hauteur, l'énergie et des prédictions de durée plus précises. Ces caractéristiques extraites sont utilisées pendant l'entraînement et prédites pendant l'inférence, permettant au modèle de mieux capturer les nuances de la parole humaine et de résoudre le problème inhérent de mappage un-à-plusieurs en TTS, où un texte unique peut correspondre à plusieurs variations vocales.
Une innovation supplémentaire est observée dans FastSpeech 2s, qui est le premier à générer directement des formes d'onde vocales à partir de texte de manière parallèle. Cette capacité d'inférence entièrement de bout en bout augmente considérablement la vitesse de synthèse. Les résultats expérimentaux démontrent que FastSpeech 2 atteint une augmentation de trois fois de la vitesse d'entraînement par rapport à FastSpeech, FastSpeech 2s offrant une inférence encore plus rapide. En termes de qualité vocale, FastSpeech 2 et 2s surpassent FastSpeech, FastSpeech 2 dépassant même la qualité des modèles autorégressifs traditionnels.
L'architecture du modèle permet l'intégration directe de caractéristiques acoustiques, conduisant à une parole plus expressive et naturelle. Cela le rend adapté à un large éventail d'applications nécessitant une synthèse vocale rapide et de haute qualité. La capacité de contrôler et de prédire les variations de hauteur et d'énergie ouvre des possibilités pour des sorties vocales plus dynamiques et personnalisées, allant au-delà de la génération vocale statique.
Points forts de FastSpeech 2
Synthèse vocale de bout en bout
Architecture de modèle non autorégressive
Entraînement direct avec des cibles de référence
Intègre la hauteur et l'énergie comme entrées conditionnelles
Prédit la durée, la hauteur et l'énergie pour l'inférence
Atteint une accélération de l'entraînement de 3x par rapport à FastSpeech
FastSpeech 2s offre une génération de formes d'onde parallèle entièrement de bout en bout
Surpasse FastSpeech en qualité vocale
Peut surpasser les modèles autorégressifs en qualité vocale
Utilise Parallel WaveGAN (PWG) comme vocodeur pour les échantillons audio
Réduit le bruit de fond à l'aide de la soustraction spectrale
Premiers pas avec FastSpeech 2
Accéder au modèle : Obtenir les poids et le code du modèle FastSpeech 2.
Configurer l'environnement : Configurer le framework d'apprentissage profond et les dépendances nécessaires.
Préparer les données : Collecter et prétraiter les données textuelles et audio correspondantes.
Entraîner le modèle : Entraîner FastSpeech 2 en utilisant des cibles de référence et des caractéristiques acoustiques extraites.
Intégrer via API : Implémenter le modèle entraîné pour l'inférence dans votre application.
Optimiser l'inférence : Utiliser FastSpeech 2s pour une génération vocale plus rapide et entièrement de bout en bout.
Cas d'utilisation de FastSpeech 2
- Synthèse vocale de haute qualité
- Entraînement TTS plus rapide
- Développement d'assistants vocaux
- Création de contenu
- Outils d'accessibilité
- Génération vocale en temps réel



