Pular para o conteúdo principal
ToolPotion

TokenFlow

TokenFlow é uma implementação PyTorch para edição de vídeo consistente usando modelos de difusão pré-treinados de texto para imagem. Permite a edição de vídeo orientada por texto sem treinamento adicional, preservando o layout espacial e a dinâmica ao impor consistência em recursos de difusão através de correspondências inter-quadros. Alcança resultados de ponta em vídeos do mundo real.

Visitar URL

Descrição

TokenFlow apresenta um framework inovador para edição de vídeo consistente, aproveitando modelos de difusão pré-treinados de texto para imagem sem a necessidade de treinamento ou ajuste fino adicional. Os rápidos avanços em IA generativa se estenderam à geração de vídeo, mas os modelos de vídeo de ponta atuais muitas vezes ficam aquém dos modelos de imagem em qualidade visual e controle do usuário. Este trabalho introduz um método que aproveita o poder dos modelos de difusão de texto para imagem para edição de vídeo orientada por texto.

Dada uma vídeo fonte e um prompt de texto alvo, TokenFlow gera um vídeo de alta qualidade que se alinha com o texto alvo, preservando meticulosamente o layout espacial e a dinâmica do vídeo de entrada original. A inovação central reside na observação de que a consistência no vídeo editado pode ser alcançada impondo consistência no espaço de recursos de difusão. Isso é realizado propagando explicitamente recursos de difusão com base em correspondências inter-quadros prontamente disponíveis dentro do modelo. Consequentemente, o framework opera sem a necessidade de qualquer treinamento ou ajuste fino e é compatível com qualquer técnica de edição de texto para imagem pronta para uso.

A implementação é fornecida em PyTorch e é o repositório oficial do artigo "TokenFlow: Consistent Diffusion Features for Consistent Video Editing", apresentado na ICLR 2024. O projeto demonstra resultados de edição de ponta em uma variedade de vídeos do mundo real. Os usuários podem explorar resultados de amostra, detalhes do projeto e a pesquisa subjacente através dos links fornecidos. O framework é projetado para edições que preservam a estrutura e se baseia em técnicas de edição de imagem existentes, como Plug-and-Play, ControlNet e SDEdit. Recomenda-se que os usuários garantam a compatibilidade com sua técnica de edição base escolhida, pois o decodificador LDM pode introduzir um leve tremor dependendo do conteúdo do vídeo original.

Recursos principais de TokenFlow

  • Implementação oficial em PyTorch do TokenFlow

  • Permite edição de vídeo consistente usando modelos de difusão pré-treinados

  • Não requer treinamento ou ajuste fino adicional

  • Preserva o layout espacial e a dinâmica dos vídeos de entrada

  • Alcança edição de vídeo orientada por texto

  • Impõe consistência no espaço de recursos de difusão

  • Utiliza correspondências inter-quadros para propagação de recursos

  • Compatível com métodos de edição de texto para imagem prontos para uso

  • Demonstra resultados de edição de ponta

  • Suporta edições que preservam a estrutura

  • Funciona com técnicas Plug-and-Play, ControlNet e SDEdit

Primeiros passos com TokenFlow

  1. Clonar: Clone o repositório TokenFlow do GitHub.

  2. Instalar dependências: Crie um ambiente conda e instale os pacotes necessários usando `pip install -r requirements.txt`.

  3. Pré-processar: Prepare seu vídeo executando `python preprocess.py` com o caminho dos dados e o prompt de inversão especificados.

  4. Configurar: Crie um arquivo de configuração YAML para o método de edição escolhido (por exemplo, `configs/config_pnp.yaml`).

  5. Executar: Execute o script de edição, como `python run_tokenflow_pnp.py`, usando sua configuração.

Casos de uso de TokenFlow

  • Modificação de vídeo orientada por texto
  • Edição de vídeo com preservação de estrutura
  • Criação de conteúdo de vídeo com IA
  • Melhoria da qualidade de vídeo
  • Pesquisa e desenvolvimento em IA de vídeo

Perguntas frequentes de TokenFlow

Avaliações de TokenFlow

Carregando...

Ferramentas de IA populares como TokenFlow

Modelos de IA

Lumiere é um modelo de difusão espaço-temporal do Google Research para gerar vídeos realistas, diversos e coerentes. Ele sintetiza durações completas de vídeo em uma única…

Geradores de vídeo com IA

Apps de IA

VideoAI é um gerador de vídeo por IA que transforma textos e imagens em vídeos utilizando modelos líderes como Kling, Wan, Seedance e Veo. Também oferece ferramentas de imagem e…

Geradores de vídeo com IAMídia e entretenimento

Modelos de IA

Imagen Video é um sistema de geração de vídeo condicional por texto desenvolvido pelo Google Research. Ele utiliza uma cascata de modelos de difusão de vídeo para criar vídeos de…

Geradores de vídeo com IA

Stable Video Diffusion Online transforma imagens e texto em vídeos curtos usando um modelo avançado de IA. Esta ferramenta de prévia de pesquisa expande as possibilidades de…

Geradores de vídeo com IA

O CapCut AI Video Editor oferece edição de vídeo online inteligente com ferramentas avançadas de IA para criar conteúdo em alta. Ele apresenta design de IA, um estúdio de vídeo,…

DestaqueEditores de vídeo com IA

Modelos de IA

VideoPoet é um modelo de linguagem grande da Google Research capaz de geração de vídeo zero-shot. Ele transforma modelos de linguagem autorregressivos em geradores de vídeo de…

Geradores de vídeo com IA

Repositórios de IA no GitHub

Kandinsky 2 é um modelo multilíngue de difusão latente de texto para imagem. Ele oferece recursos avançados de geração de imagens, incluindo texto para imagem, imagem para imagem…

Modelos de IA e LLMs

Repositórios de IA no GitHub

StoryDiffusion é uma ferramenta de IA para gerar imagens e vídeos consistentes em sequências longas. Utiliza auto-atenção consistente para consistência de personagens na geração…

Geradores de imagens com IA