Description
AudioLM représente un nouveau framework pour la génération d'audio de haute qualité avec une cohérence remarquable à long terme. À son cœur, AudioLM transforme la tâche complexe de génération audio en un problème de modélisation du langage. Il y parvient en mappant l'audio d'entrée à une séquence de jetons discrets, traitant ainsi efficacement l'audio comme une forme de langage.
Le modèle utilise un schéma de tokenisation hybride pour équilibrer la qualité de reconstruction avec la cohérence structurelle à long terme. Il utilise les activations discrétisées d'un modèle de langage masqué pré-entraîné sur l'audio pour capturer les dépendances à long terme, tout en employant des codes discrets d'un codec audio neuronal pour une synthèse haute fidélité. Cette double approche permet à AudioLM d'apprendre à partir de grands corpus d'ondes audio brutes.
Lorsqu'il est entraîné sur des données vocales, AudioLM peut générer des continuations de parole syntaxiquement et sémantiquement plausibles. De manière cruciale, il maintient l'identité du locuteur, la prosodie, l'accent et les conditions d'enregistrement de l'invite initiale, même pour des locuteurs non rencontrés pendant l'entraînement. Cette capacité s'étend au-delà de la parole, comme en témoigne sa capacité à générer des continuations de musique de piano cohérentes sans s'appuyer sur des représentations musicales symboliques.
L'architecture d'AudioLM permet divers modes de génération. La continuation de la parole implique de fournir une courte invite audio et de recevoir une extension naturelle et cohérente. La génération acoustique se concentre sur l'échantillonnage de jetons acoustiques pour produire divers échantillons audio avec un contenu sémantique identique mais des identités de locuteurs et des conditions d'enregistrement variables. La génération inconditionnelle produit des séquences audio entièrement nouvelles sans aucune invite, démontrant l'étendue générative du modèle. Le framework souligne également l'importance des jetons sémantiques pour la cohérence linguistique, démontrant que les jetons acoustiques seuls conduisent à un contenu moins cohérent.
La polyvalence du modèle est encore démontrée par son application à la génération musicale, en particulier les continuations de piano. En s'entraînant sur de l'audio de piano brut, AudioLM apprend à produire des séquences musicalement cohérentes, surpassant les modèles entraînés uniquement sur des jetons acoustiques. Cela indique une compréhension robuste de la structure et du contenu audio, applicable dans différents domaines.
Points forts de AudioLM
Génération audio de haute qualité
Cohérence audio à long terme
Approche de modélisation du langage pour l'audio
Schéma de tokenisation hybride
Génération de continuation de parole
Préservation de l'identité du locuteur
Maintien de la prosodie et de l'accent
Génération de continuation musicale (par exemple, piano)
Génération audio inconditionnelle
Génération acoustique avec conditions variables
Apprend à partir d'ondes audio brutes
Génère des continuations syntaxiquement et sémantiquement plausibles
Premiers pas avec AudioLM
Accéder au modèle : Obtenir l'accès au modèle AudioLM ou à son implémentation.
Authentification : Si nécessaire, authentifiez vos identifiants d'accès.
Configurer l'environnement : Préparez votre environnement de développement avec les bibliothèques et dépendances nécessaires.
Intégrer via API : Utilisez les points d'accès API fournis pour envoyer des invites audio et recevoir l'audio généré.
Configurer les paramètres : Ajustez les paramètres du modèle pour les caractéristiques audio et les modes de génération souhaités.
Optimiser la sortie : Affinez les paramètres de génération pour atteindre des objectifs spécifiques de qualité et de cohérence.
Cas d'utilisation de AudioLM
- Synthèse vocale
- Composition musicale
- Création de contenu audio
- Conception sonore
- Clonage vocal
- Prototypage d'IA audio


