Descrição
DreamTalk é uma implementação oficial de um framework de geração de cabeças falantes expressivas, impulsionado por áudio e baseado em difusão. Esta ferramenta foi projetada para produzir vídeos de cabeças falantes de alta qualidade que refletem com precisão diversos estilos de fala e emoções. Sua capacidade principal reside em seu desempenho robusto em uma ampla gama de entradas, incluindo fala padrão, músicas, áudio multilíngue e até mesmo sinais de áudio ruidosos. Além disso, o DreamTalk demonstra resiliência ao processar retratos fora de domínio, tornando-o uma solução versátil para várias aplicações.
O framework utiliza modelos probabilísticos de difusão para alcançar sua geração de vídeo expressiva e realista. Os usuários podem instalar o projeto usando conda e pip, seguindo requisitos de versão específicos para PyTorch, torchvision, torchaudio e outras dependências. O processo de instalação envolve a criação de um ambiente conda dedicado e, em seguida, a instalação dos pacotes necessários a partir de um arquivo de requisitos.
Para usuários interessados em obter os checkpoints pré-treinados, o acesso para download público foi encerrado devido a considerações de impacto social. Partes interessadas devem solicitar os checkpoints por e-mail, consentindo explicitamente com seu uso exclusivamente para fins de pesquisa acadêmica. Uma vez obtidos, os checkpoints devem ser colocados na pasta designada 'checkpoints'.
A inferência com DreamTalk envolve a execução de um script Python com vários parâmetros chave. Estes incluem caminhos para o arquivo de áudio de entrada (suportando vários formatos como wav, mp3, m4a e mp4), um clipe de estilo de referência, uma sequência de pose de cabeça e a imagem de retrato de entrada. Parâmetros adicionais como 'cfg_scale' controlam a intensidade dos estilos de fala, enquanto 'max_gen_len' define a duração máxima da geração de vídeo. O vídeo de saída é salvo na pasta 'output_video', com resultados intermediários em uma pasta temporária.
DreamTalk também oferece soluções ad-hoc para melhorar a resolução do vídeo. Dois métodos são sugeridos: CodeFormer para resolução de até 1024x1024, embora seja mais lento e possa ter problemas de inconsistência temporal, e o Modelo de Super-Resolução Temporal do MetaPortrait para resolução de 512x512 com desempenho mais rápido e coerência temporal, embora possa reduzir a intensidade da emoção facial. O projeto reconhece e se baseia em trabalhos anteriores na área, citando pesquisas relevantes e fornecendo uma entrada de citação para uso acadêmico.
Recursos principais de DreamTalk
Geração de cabeças falantes expressivas impulsionada por áudio e baseada em difusão
Saída de vídeo de alta qualidade com diversos estilos de fala
Desempenho robusto com várias entradas de áudio (fala, músicas, áudio ruidoso)
Lida com retratos fora de domínio
Suporta múltiplos idiomas
Fornece código de implementação oficial
Inclui script de inferência para geração de vídeo
Oferece soluções ad-hoc para aprimoramento de resolução (CodeFormer, MetaPortrait)
Parâmetros ajustáveis para intensidade de estilo e duração da geração
Suporta inferência em CPU
Primeiros passos com DreamTalk
Clonar: Clone o repositório DreamTalk do GitHub.
Instalar dependências: Crie um ambiente conda e instale os pacotes necessários usando o requirements.txt fornecido.
Baixar Checkpoints: Solicite os checkpoints por e-mail para pesquisa acadêmica e coloque-os na pasta 'checkpoints'.
Preparar Entradas: Reúna áudio de entrada, clipes de estilo de referência, sequências de pose de cabeça e imagens de retrato.
Configurar Inferência: Especifique os caminhos de entrada e parâmetros como cfg_scale e max_gen_len no script de inferência.
Executar Inferência: Execute o script de inferência (por exemplo, python inference_for_demo_video.py) para gerar vídeos de cabeças falantes.
Melhorar Resolução (Opcional): Aplique CodeFormer ou MetaPortrait para resolução de vídeo aprimorada.
Utilizar para Pesquisa: Empregue os vídeos gerados para fins de pesquisa acadêmica.
Casos de uso de DreamTalk
- Geração Expressiva de Cabeças Falantes
- Síntese Audiovisual
- Pesquisa em Animação por IA
- Cabeças Falantes Cross-linguais
- Transferência de Estilo para Rostos
- Lidando com Áudio Ruidoso






