Zum Hauptinhalt springen
ToolPotion

Jukebox | OpenAI

Jukebox ist ein neuronales Netz, das Musik, einschließlich rudimentärer Gesangspartien, als Roh-Audio generiert. Es kann Musik in verschiedenen Genres und Künstlerstilen produzieren und bietet einen neuartigen Ansatz zur KI-gesteuerten Musikkomposition. Die Modellgewichte und der Code werden zusammen mit einem Werkzeug zur Erkundung generierter Samples veröffentlicht.

URL besuchen

Beschreibung

Jukebox, entwickelt von OpenAI, ist ein hochentwickeltes neuronales Netz, das für die KI-gestützte Musikgenerierung konzipiert ist. Es erzeugt Musik direkt als Roh-Audio, wobei es rudimentäre Gesangspartien einbeziehen und eine Vielzahl von Genres und Künstlerstilen nachahmen kann. Dies stellt einen bedeutenden Fortschritt bei generativen Modellen dar, der über die symbolische Musikgenerierung hinausgeht, um die Nuancen von Roh-Audio zu erfassen.

Im Kern verwendet Jukebox ein hierarchisches VQ-VAE (Vector Quantized Variational Autoencoder)-Modell, um Roh-Audio in einen diskreten, niedrigdimensionalen Raum zu komprimieren. Diese Kompression ist entscheidend für die Handhabung der extrem langen Sequenzen, die für Audiodaten typisch sind, und ermöglicht es dem Modell, semantische Strukturen auf hoher Ebene zu lernen. Die VQ-VAE-Architektur ist von VQ-VAE-2 inspiriert, mit Modifikationen zur Bewältigung von Codebook-Kollaps und zur Verbesserung der Rekonstruktionsqualität, einschließlich der Hinzufügung eines spektralen Verlusts. Das Modell verwendet drei Kompressionsstufen, die 44kHz Roh-Audio um das 8-fache, 32-fache und 128-fache herunterskalieren und dabei wesentliche musikalische Informationen wie Tonhöhe, Klangfarbe und Lautstärke beibehalten.

Nach der Audiokompression werden Transformer-Modelle als Prior-Modelle trainiert, um die Verteilung dieser komprimierten Audiocodes zu lernen. Diese Priors generieren Musik im diskreten Raum, wobei ein Top-Level-Prior die Langzeitstruktur erfasst und Low-Level-Priors lokale musikalische Details hinzufügen. Die Modelle werden autoregressiv mit einer vereinfachten Variante von Sparse Transformers trainiert, wobei jedes Modell 72 Schichten von faktorisiertem Self-Attention aufweist. Dieser hierarchische Ansatz ermöglicht es Jukebox, kohärente Musikstücke mit beeindruckender Audioqualität zu generieren.

Jukebox kann mit verschiedenen Eingaben konditioniert werden, darunter Genre, Künstler und Liedtexte. Durch die Bereitstellung dieser als Eingabe können Benutzer den Generierungsprozess steuern, um Musik in einem gewünschten Stil zu erzeugen. Das Modell wurde auf einem großen Datensatz von 1,2 Millionen Songs trainiert, gepaart mit Liedtexten und Metadaten von LyricWiki. Insbesondere die Konditionierung auf Liedtexte erforderte ausgeklügelte Abgleichtechniken, um lyrische Inhalte mit entsprechenden Audiosegmenten abzugleichen und die Fähigkeit des Modells zur Generierung von Gesang zu verbessern.

Trotz seiner Fähigkeiten hat Jukebox Einschränkungen. Generierte Songs können vertraute größere musikalische Strukturen wie wiederholte Refrains vermissen lassen, und der Downsampling/Upsampling-Prozess kann wahrnehmbare Störungen einführen. Der Sampling-Prozess ist ebenfalls langsam und dauert etwa 9 Stunden, um eine Minute Audio zu rendern, was ihn für interaktive Anwendungen ungeeignet macht. Zukünftige Arbeiten zielen darauf ab, die Musikalität zu verbessern, Rauschen zu reduzieren und die Sampling-Geschwindigkeit zu erhöhen, möglicherweise durch Destillation in einen parallelen Sampler. OpenAI plant auch, den Umfang des Modells zu erweitern, um Songs aus anderen Sprachen und Regionen einzubeziehen und die Mensch-Modell-Kollaboration bei der Musikkomposition zu fördern.

Jukebox im Überblick

  • Generiert Musik als Roh-Audio

  • Enthält rudimentäre Gesangsfähigkeiten

  • Unterstützt Konditionierung auf Genre, Künstler und Liedtexte

  • Ahmt eine Vielzahl von Musikgenres nach

  • Ahmt verschiedene Künstlerstile nach

  • Verwendet ein hierarchisches VQ-VAE zur Audiokompression

  • Setzt Transformer-Modelle zur Code-Generierung ein

  • Trainiert auf einem großen Datensatz von 1,2 Millionen Songs

  • Modellgewichte und Code sind öffentlich veröffentlicht

  • Enthält ein Werkzeug zur Erkundung generierter Samples

  • Gibt Musik in mehreren Kompressionsstufen aus

  • Lernt langfristige musikalische Struktur

Erste Schritte mit Jukebox

  1. Modellgewichte und Code abrufen: Laden Sie das veröffentlichte Jukebox-Modell und den zugehörigen Code aus dem bereitgestellten GitHub-Repository herunter.

  2. Eingabedaten vorbereiten: Sammeln Sie gewünschte Genre-, Künstler- und Textinformationen für die Musikgenerierung.

  3. Generierungsparameter konfigurieren: Legen Sie Parameter für die gewünschte Audioqualität, Länge und Konditionierungseingaben fest.

  4. Generierungsprozess ausführen: Führen Sie das Jukebox-Modell aus, um Roh-Audio-Musiksamples zu generieren.

  5. Generierte Samples erkunden: Nutzen Sie das bereitgestellte Werkzeug, um die Ausgabe anzuhören und zu analysieren.

  6. In Projekte integrieren: Passen Sie den veröffentlichten Code für benutzerdefinierte Musikgenerierungsanwendungen an.

Jukebox's Anwendungsfälle

  • KI-Musikgenerierung
  • Nachahmung von Musikstilen
  • Rudimentäre Gesangssynthese
  • Kreative Musikerforschung
  • Soundtrack-Komposition
  • Musikforschung

FAQ von Jukebox

Jukebox Bewertungen

Wird geladen...

Beliebte KI-Tools wie Jukebox

KI-GitHub-Repos

Audiocraft ist eine PyTorch-Bibliothek für Deep Learning zur Audioerzeugung und -verarbeitung. Sie bietet hochmoderne Modelle wie MusicGen für steuerbare Musikgenerierung und…

KI-Musikgeneratoren

KI-Modelle

AudioGen ist ein autoregressives generatives KI-Modell, das Audio-Samples basierend auf beschreibenden Text-Captions erstellt. Es adressiert Herausforderungen bei der…

KI-Musikgeneratoren

Lyria 3.5 ist ein fortschrittliches Musikgenerierungsmodell von Google DeepMind, das Benutzern hilft, Songs mühelos zu komponieren. Es bietet technische Kontrolle und die…

EmpfohlenKI-Musikgeneratoren

KI-Modelle

MusicLM ist ein KI-Modell, das hochauflösende Musik aus Textbeschreibungen generiert. Es kann Musik mit einer Abtastrate von bis zu 24 kHz erzeugen, die über mehrere Minuten…

KI-Musikgeneratoren

KI-Modelle

AudioLDM ist ein Framework zur Generierung von Audio aus Text, das latente Diffusionsmodelle nutzt. Es übersetzt verschiedene Modalitäten in eine einheitliche 'Sprache des Audios'…

KI-Musikgeneratoren

Google Flow Music ist eine generative KI-Plattform zum Erstellen, Remixen und Teilen von Songs in Studioqualität. Sie ermöglicht es Benutzern, KI-Musikvideos zu steuern, neue…

EmpfohlenKI-Musikgeneratoren

SongAIs KI-Musikgenerator erstellt originelle Musik mit männlichen oder weiblichen Stimmen, MP3-Audio und MP4-Videos. Generieren Sie Musik aus Audiodateien oder Ihrer eigenen…

KI-Musikgeneratoren

AI Music Generator ist eine Text-zu-Musik-Plattform, die in weniger als einer Minute studioqualitative Songs in über 50 Stilen erstellt, mit Bearbeitungswerkzeugen, Stem-Trennung…

KI-MusikgeneratorenMedien und Unterhaltung