Descripción
DreamTalk es una implementación oficial de un framework de generación de cabezas parlantes expresivas impulsado por audio y basado en difusión. Esta herramienta está diseñada para producir videos de alta calidad de cabezas parlantes que reflejen con precisión diversos estilos de habla y emociones. Su capacidad principal radica en su rendimiento robusto en una amplia gama de entradas, incluyendo habla estándar, canciones, audio multilingüe e incluso señales de audio ruidosas. Además, DreamTalk demuestra resiliencia al procesar retratos fuera de dominio, lo que lo convierte en una solución versátil para diversas aplicaciones.
El framework aprovecha los modelos probabilísticos de difusión para lograr su generación de video expresiva y realista. Los usuarios pueden instalar el proyecto usando conda y pip, siguiendo requisitos de versión específicos para PyTorch, torchvision, torchaudio y otras dependencias. El proceso de instalación implica crear un entorno conda dedicado y luego instalar los paquetes necesarios desde un archivo de requisitos.
Para los usuarios interesados en obtener los checkpoints pre-entrenados, el acceso de descarga pública ha cesado debido a consideraciones de impacto social. Las partes interesadas deben solicitar los checkpoints por correo electrónico, consintiendo explícitamente su uso únicamente para fines de investigación académica. Una vez obtenidos, los checkpoints deben colocarse en la carpeta designada 'checkpoints'.
La inferencia con DreamTalk implica ejecutar un script de Python con varios parámetros clave. Estos incluyen las rutas al archivo de audio de entrada (que admite varios formatos como wav, mp3, m4a y mp4), un clip de estilo de referencia, una secuencia de pose de cabeza y la imagen del retrato de entrada. Parámetros adicionales como 'cfg_scale' controlan la intensidad de los estilos de habla, mientras que 'max_gen_len' establece la duración máxima de generación de video. El video de salida se guarda en la carpeta 'output_video', con resultados intermedios en una carpeta temporal.
DreamTalk también ofrece soluciones ad-hoc para mejorar la resolución del video. Se sugieren dos métodos: CodeFormer para resoluciones de hasta 1024x1024, aunque es más lento y puede tener problemas de inconsistencia temporal, y el Modelo de Super-Resolución Temporal de MetaPortrait para resoluciones de 512x512 con un rendimiento más rápido y coherencia temporal, aunque puede reducir la intensidad de la emoción facial. El proyecto reconoce y se basa en trabajos anteriores en el campo, citando investigaciones relevantes y proporcionando una entrada de citación para uso académico.
Características principales de DreamTalk
Generación de cabezas parlantes impulsada por audio basada en difusión
Salida de video de alta calidad con diversos estilos de habla
Rendimiento robusto con varias entradas de audio (voz, canciones, audio ruidoso)
Maneja retratos fuera de dominio
Soporta múltiples idiomas
Proporciona código de implementación oficial
Incluye script de inferencia para generación de video
Ofrece soluciones ad-hoc para mejora de resolución (CodeFormer, MetaPortrait)
Parámetros ajustables para intensidad de estilo y duración de generación
Soporta inferencia en CPU
Primeros pasos con DreamTalk
Clonar: Clone el repositorio DreamTalk desde GitHub.
Instalar dependencias: Cree un entorno conda e instale los paquetes requeridos usando el archivo requirements.txt proporcionado.
Descargar Checkpoints: Solicite los checkpoints por correo electrónico para investigación académica y colóquelos en la carpeta 'checkpoints'.
Preparar Entradas: Reúna el audio de entrada, clips de estilo de referencia, secuencias de pose de cabeza e imágenes de retrato.
Configurar Inferencia: Especifique las rutas de entrada y parámetros como cfg_scale y max_gen_len en el script de inferencia.
Ejecutar Inferencia: Ejecute el script de inferencia (por ejemplo, python inference_for_demo_video.py) para generar videos de cabezas parlantes.
Mejorar Resolución (Opcional): Aplique CodeFormer o MetaPortrait para mejorar la resolución del video.
Utilizar para Investigación: Emplee los videos generados para fines de investigación académica.
Casos de uso de DreamTalk
- Generación Expresiva de Cabezas Parlantes
- Síntesis Audiovisual
- Investigación en Animación con IA
- Cabezas Parlantes Translingües
- Transferencia de Estilo para Rostros
- Manejo de Audio Ruidoso






