Описание
Make-An-Audio представляет собой значительный прорыв в области генерации аудио из текста, используя диффузионные модели с улучшенными промптами для преодоления таких проблем, как ограниченность высококачественных наборов данных и сложность моделирования длинных аудиопоследовательностей. Система вводит новую технику псевдоулучшения промптов, основанную на подходе «дистилляция с последующим перепрограммированием». Этот метод эффективно устраняет нехватку данных, используя слабо контролируемые данные, включая аудио без языка.
Кроме того, Make-An-Audio использует спектральный автоэнкодер для предсказания самообучаемых представлений аудио, а не необработанных волновых форм. Этот архитектурный выбор в сочетании с надежными представлениями контрастного языково-аудио предварительного обучения (CLAP) позволяет модели достигать передовых результатов как в объективных, так и в субъективных оценках. Система демонстрирует замечательную управляемость посредством бесконтрольной (classifier-free) наводки, позволяя пользователям точно настраивать сгенерированные аудиовыходы.
Помимо базовой генерации аудио из текста, Make-An-Audio демонстрирует впечатляющие возможности обобщения для задач X-to-Audio, воплощая принцип «ни одной модальности не оставлено позади». Это открывает возможность генерации высококачественного аудио на основе входных данных, определяемых пользователем. Система поддерживает персонализированную генерацию аудио из текста, позволяя вставлять уникальные объекты в новые сцены и трансформировать аудио в различных стилях. Примеры включают генерацию «плача ребенка» из начального звука «грома», что приводит к реалистичному и точному аудио. Она также поддерживает аудио-inpainting и генерацию аудио из изображений, расширяя свой творческий потенциал.
Главное о Make-An-Audio
Диффузионная модель с улучшенными промптами для генерации аудио из текста
Псевдоулучшение промптов с использованием подхода «дистилляция с последующим перепрограммированием»
Спектральный автоэнкодер для предсказания представлений аудио
Представления контрастного языково-аудио предварительного обучения (CLAP)
Бесконтрольная наводка (Classifier-free guidance) для управляемости
Обобщение для задач X-to-Audio (например, изображение-в-аудио, видео-в-аудио)
Персонализированная генерация аудио из текста с вставкой объектов и трансформацией стиля
Возможности аудио-inpainting
Генерирует высококачественное аудио
Решает проблему нехватки данных при генерации аудио
Начало работы с Make-An-Audio
Доступ к модели: Получите доступ к модели Make-An-Audio.
Интеграция через API: Подключитесь к API модели для программного использования.
Предоставьте текстовый промпт: Введите желаемые текстовые описания для генерации аудио.
Укажите входные данные модальности (необязательно): Для задач X-to-Audio предоставьте соответствующее изображение или видео.
Настройте наводку: Используйте бесконтрольную наводку для точной настройки характеристик аудио.
Сгенерируйте аудио: Запустите процесс генерации аудио.
Уточните вывод: Настройте параметры для персонализированного аудио или задач inpainting.
Варианты использования Make-An-Audio
- Синтез речи из текста
- Генерация звуковых эффектов
- Аудио-inpainting
- Изображение-в-аудио
- Видео-в-аудио
- Персонализированный аудиоконтент
- Генерация музыки
- Исследования в области ИИ


