Описание
AudioLM представляет собой новый фреймворк для генерации высококачественного звука с замечательной долгосрочной согласованностью. По своей сути AudioLM преобразует сложную задачу генерации звука в проблему языкового моделирования. Это достигается путем отображения входного звука в последовательность дискретных токенов, фактически рассматривая звук как форму языка.
Модель использует гибридную схему токенизации для балансировки качества реконструкции с долгосрочной структурной согласованностью. Она использует дискретизированные активации маскированной языковой модели, предварительно обученной на аудио, для захвата долгосрочных зависимостей, одновременно используя дискретные коды из нейронного аудиокодека для высококачественного синтеза. Этот двойной подход позволяет AudioLM обучаться на больших корпусах необработанных аудиосигналов.
При обучении на речевых данных AudioLM может генерировать синтаксически и семантически правдоподобные продолжения речи. Важно отметить, что она сохраняет идентичность диктора, просодию, акцент и условия записи исходного запроса, даже для дикторов, не встречавшихся во время обучения. Эта возможность выходит за рамки речи, что демонстрируется ее способностью генерировать связные продолжения фортепианной музыки без опоры на символические музыкальные представления.
Архитектура AudioLM допускает различные режимы генерации. Продолжение речи включает предоставление короткого аудиозапроса и получение естественного, связного продолжения. Акустическая генерация фокусируется на выборке акустических токенов для создания разнообразных аудиообразцов с идентичным семантическим содержанием, но различными идентичностями дикторов и условиями записи. Безусловная генерация создает совершенно новые аудиопоследовательности без какого-либо запроса, демонстрируя широту генеративных возможностей модели. Фреймворк также подчеркивает важность семантических токенов для лингвистической согласованности, демонстрируя, что одни только акустические токены приводят к менее согласованному контенту.
Универсальность модели дополнительно подтверждается ее применением в генерации музыки, в частности, продолжений фортепианной музыки. Обучаясь на необработанном аудио фортепиано, AudioLM учится создавать музыкально связные последовательности, превосходя модели, обученные только на акустических токенах. Это указывает на надежное понимание аудиоструктуры и контента, применимое в различных областях.
Главное о AudioLM
Высококачественная генерация аудио
Долгосрочная согласованность аудио
Подход к аудио как к языковому моделированию
Гибридная схема токенизации
Генерация продолжений речи
Сохранение идентичности диктора
Поддержание просодии и акцента
Генерация продолжений музыки (например, фортепиано)
Безусловная генерация аудио
Акустическая генерация с различными условиями
Обучение на необработанных аудиосигналах
Генерация синтаксически и семантически правдоподобных продолжений
Начало работы с AudioLM
Доступ к модели: Получите доступ к модели AudioLM или ее реализации.
Аутентификация: При необходимости аутентифицируйте свои учетные данные доступа.
Настройка среды: Подготовьте среду разработки с необходимыми библиотеками и зависимостями.
Интеграция через API: Используйте предоставленные конечные точки API для отправки аудиозапросов и получения сгенерированного аудио.
Настройка параметров: Настройте параметры модели для желаемых характеристик аудио и режимов генерации.
Оптимизация вывода: Настройте параметры генерации для достижения конкретных целей качества и согласованности.
Варианты использования AudioLM
- Синтез речи
- Музыкальная композиция
- Создание аудиоконтента
- Звуковой дизайн
- Клонирование голоса
- Прототипирование аудио ИИ


