Описание
DreamTalk — это официальная реализация фреймворка для генерации выразительных видео говорящих голов, управляемых аудио и основанных на диффузионных моделях. Этот инструмент предназначен для создания высококачественных видео говорящих голов, которые точно отражают разнообразные стили речи и эмоции. Его основная возможность заключается в надежной работе с широким спектром входных данных, включая стандартную речь, песни, многоязычное аудио и даже зашумленные аудиосигналы. Кроме того, DreamTalk демонстрирует устойчивость при обработке портретов вне домена, что делает его универсальным решением для различных приложений.
Фреймворк использует диффузионные вероятностные модели для достижения выразительной и реалистичной генерации видео. Пользователи могут установить проект с помощью conda и pip, следуя определенным требованиям к версиям PyTorch, torchvision, torchaudio и других зависимостей. Процесс установки включает создание выделенной среды conda, а затем установку необходимых пакетов из файла требований.
Для пользователей, заинтересованных в получении предварительно обученных контрольных точек, доступ к публичному скачиванию был прекращен из-за соображений социального воздействия. Заинтересованные стороны должны запрашивать контрольные точки по электронной почте, явно давая согласие на их использование исключительно в академических исследовательских целях. После получения контрольные точки должны быть помещены в указанную папку 'checkpoints'.
Инференс с помощью DreamTalk включает запуск скрипта Python с несколькими ключевыми параметрами. К ним относятся пути к входному аудиофайлу (поддерживаются различные форматы, такие как wav, mp3, m4a и mp4), эталонный клип стиля, последовательность поз головы и входное изображение портрета. Дополнительные параметры, такие как 'cfg_scale', контролируют интенсивность стилей речи, а 'max_gen_len' устанавливает максимальную продолжительность генерации видео. Выходное видео сохраняется в папке 'output_video', а промежуточные результаты — во временной папке.
DreamTalk также предлагает специальные решения для улучшения разрешения видео. Предлагаются два метода: CodeFormer для разрешения до 1024x1024, хотя он медленнее и может иметь проблемы с временной несогласованностью, и Temporal Super-Resolution Model от MetaPortrait для разрешения 512x512 с более высокой производительностью и временной согласованностью, хотя он может снизить интенсивность лицевых эмоций. Проект признает и опирается на предыдущие работы в этой области, цитируя соответствующие исследования и предоставляя запись для цитирования для академического использования.
Основные функции DreamTalk
Генерация говорящих голов на основе аудио с использованием диффузионных моделей
Высококачественный видеовыход с разнообразными стилями речи
Надежная работа с различными аудиовходами (речь, песни, зашумленное аудио)
Обработка портретов вне домена
Поддержка нескольких языков
Предоставление кода официальной реализации
Включение скрипта инференса для генерации видео
Предложение специальных решений для улучшения разрешения (CodeFormer, MetaPortrait)
Настраиваемые параметры для интенсивности стиля и продолжительности генерации
Поддержка инференса на CPU
Начало работы с DreamTalk
Клонировать: Клонируйте репозиторий DreamTalk с GitHub.
Установить зависимости: Создайте среду conda и установите необходимые пакеты с помощью предоставленного requirements.txt.
Скачать контрольные точки: Запросите контрольные точки по электронной почте для академических исследований и поместите их в папку 'checkpoints'.
Подготовить входные данные: Соберите входное аудио, эталонные клипы стиля, последовательности поз головы и изображения портретов.
Настроить инференс: Укажите пути к входным данным и параметры, такие как cfg_scale и max_gen_len, в скрипте инференса.
Выполнить инференс: Запустите скрипт инференса (например, python inference_for_demo_video.py) для генерации видео говорящих голов.
Улучшить разрешение (необязательно): Примените CodeFormer или MetaPortrait для улучшения разрешения видео.
Использовать для исследований: Применяйте сгенерированные видео в академических исследовательских целях.
Варианты использования DreamTalk
- Генерация выразительных говорящих голов
- Аудиовизуальный синтез
- Исследования в области AI-анимации
- Кросс-языковые говорящие головы
- Перенос стиля для лиц
- Обработка зашумленного аудио






