Перейти к основному содержимому
ToolPotion

Jukebox | OpenAI

Jukebox — это нейронная сеть, которая генерирует музыку, включая зачатки пения, в виде необработанного аудиосигнала. Она способна создавать музыку в различных жанрах и стилях исполнителей, предлагая новый подход к созданию музыки с помощью ИИ. Веса модели и код выпущены вместе с инструментом для исследования сгенерированных образцов.

Посетить URL

Описание

Jukebox, разработанный OpenAI, представляет собой сложную нейронную сеть, предназначенную для генерации музыки с помощью ИИ. Она создает музыку непосредственно в виде необработанного аудиосигнала, способна включать зачатки пения и имитировать различные жанры и стили исполнителей. Это значительный прорыв в области генеративных моделей, выходящий за рамки символической генерации музыки и улавливающий нюансы необработанного аудио.

В основе Jukebox лежит иерархическая модель VQ-VAE (Vector Quantized Variational Autoencoder) для сжатия необработанного аудио в дискретное пространство с меньшей размерностью. Это сжатие имеет решающее значение для обработки чрезвычайно длинных последовательностей, присущих аудиоданным, позволяя модели изучать высокоуровневые семантические структуры. Архитектура VQ-VAE вдохновлена VQ-VAE-2 с модификациями для решения проблемы коллапса кодовой книги и улучшения качества реконструкции, включая добавление спектральной потери. Модель использует три уровня сжатия, понижая частоту дискретизации 44 кГц необработанного аудио в 8, 32 и 128 раз, сохраняя важную музыкальную информацию, такую как высота тона, тембр и громкость.

После сжатия аудио трансформерные модели обучаются как априорные модели для изучения распределения этих сжатых аудиокодов. Эти априорные модели генерируют музыку в дискретном пространстве, причем априорная модель верхнего уровня улавливает долгосрочную структуру, а априорные модели нижнего уровня добавляют локальные музыкальные детали. Модели обучаются авторегрессионно с использованием упрощенного варианта Sparse Transformers, причем каждая модель имеет 72 слоя факторизованного самовнимания. Такой иерархический подход позволяет Jukebox генерировать связные музыкальные произведения с впечатляющим качеством звука.

Jukebox может быть обусловлен различными входными данными, включая жанр, исполнителя и текст песни. Предоставляя их в качестве входных данных, пользователи могут управлять процессом генерации для создания музыки в желаемом стиле. Модель была обучена на большом наборе данных из 1,2 миллиона песен с сопоставленными текстами и метаданными из LyricWiki. Обусловленность на текстах песен, в частности, потребовала сложных методов выравнивания для сопоставления лирического содержания с соответствующими аудиосегментами, что повысило способность модели генерировать пение.

Несмотря на свои возможности, Jukebox имеет ограничения. Сгенерированные песни могут не иметь привычных крупных музыкальных структур, таких как повторяющиеся припевы, а процесс понижения/повышения дискретизации может вносить заметный шум. Процесс сэмплирования также медленный, занимая около 9 часов для рендеринга одной минуты аудио, что делает его непригодным для интерактивных приложений. Будущие работы направлены на улучшение музыкальности, снижение шума и увеличение скорости сэмплирования, возможно, путем дистилляции в параллельный сэмплер. OpenAI также планирует расширить сферу применения модели, включив песни из других языков и регионов, способствуя сотрудничеству человека и модели в создании музыки.

Главное о Jukebox

  • Генерирует музыку в виде необработанного аудиосигнала

  • Включает возможности зачаточного пения

  • Поддерживает обусловленность на жанре, исполнителе и тексте песни

  • Имитирует различные музыкальные жанры

  • Имитирует стили различных исполнителей

  • Использует иерархический VQ-VAE для сжатия аудио

  • Применяет трансформерные модели для генерации кодов

  • Обучен на большом наборе данных из 1,2 миллиона песен

  • Веса модели и код общедоступны

  • Включает инструмент для исследования сгенерированных образцов

  • Выводит музыку на нескольких уровнях сжатия

  • Изучает долгосрочную музыкальную структуру

Начало работы с Jukebox

  1. Доступ к весам модели и коду: Загрузите выпущенную модель Jukebox и связанный с ней код из предоставленного репозитория GitHub.

  2. Подготовка входных данных: Соберите информацию о желаемом жанре, исполнителе и тексте для генерации музыки.

  3. Настройка параметров генерации: Установите параметры для желаемого качества звука, длительности и входных данных для обусловленности.

  4. Запуск процесса генерации: Выполните модель Jukebox для генерации образцов музыки в виде необработанного аудиосигнала.

  5. Исследование сгенерированных образцов: Используйте предоставленный инструмент для прослушивания и анализа выходных данных.

  6. Интеграция в проекты: Адаптируйте выпущенный код для пользовательских приложений генерации музыки.

Варианты использования Jukebox

  • Генерация музыки с помощью ИИ
  • Имитация музыкального стиля
  • Синтез зачаточного пения
  • Творческое исследование музыки
  • Составление саундтреков
  • Исследование музыки

Часто задаваемые вопросы Jukebox

Отзывы о Jukebox

Загрузка...

Популярные ИИ-инструменты, похожие на Jukebox

AI-репозитории на GitHub

Audiocraft — это библиотека PyTorch для глубокого обучения в области генерации и обработки аудио. Она предлагает передовые модели, такие как MusicGen для управляемой генерации…

ИИ-генераторы музыки

AI-модели

AudioGen — это авторегрессионная генеративная ИИ-модель, которая создает аудиофрагменты на основе описательных текстовых подписей. Она решает проблемы генерации аудио, такие как…

ИИ-генераторы музыки

Lyria 3.5 — это продвинутая модель генерации музыки от Google DeepMind, которая помогает пользователям легко сочинять песни. Она предлагает технический контроль и возможность…

РекомендованоИИ-генераторы музыки

AI-модели

MusicLM — это ИИ-модель, генерирующая музыку высокого качества по текстовым описаниям. Она способна создавать музыку с частотой дискретизации до 24 кГц, сохраняя согласованность в…

ИИ-генераторы музыки

AI-модели

AudioLDM — это фреймворк для генерации аудио по текстовому описанию, использующий латентные диффузионные модели. Он переводит различные модальности в унифицированный «язык аудио»…

ИИ-генераторы музыки

AI-приложения

Google Flow Music — это платформа генеративного ИИ для создания, ремикширования и обмена песнями студийного качества. Она позволяет пользователям управлять музыкальными видео,…

РекомендованоИИ-генераторы музыки

AI-генератор музыки от SongAI создает оригинальную музыку с мужским или женским вокалом, в форматах MP3 и MP4. Генерируйте музыку из аудиофайлов или собственного голоса.…

ИИ-генераторы музыки

AI Music Generator — это платформа для создания музыки из текста, которая генерирует песни студийного качества менее чем за минуту в более чем 50 стилях, с инструментами…

ИИ-генераторы музыкиМедиа и развлечения