Aller au contenu principal
ToolPotion

TokenFlow

TokenFlow est une implémentation PyTorch pour le montage vidéo cohérent à l'aide de modèles de diffusion texte-image pré-entraînés. Il permet le montage vidéo piloté par le texte sans entraînement supplémentaire, en préservant la disposition spatiale et la dynamique grâce à l'application de la cohérence dans les caractéristiques de diffusion via des correspondances inter-images. Atteint des résultats de pointe sur des vidéos du monde réel.

Visiter l'URL

Description

TokenFlow présente un cadre innovant pour le montage vidéo cohérent, exploitant des modèles de diffusion texte-image pré-entraînés sans nécessiter d'entraînement ou de réglage fin supplémentaire. Les progrès rapides de l'IA générative se sont étendus à la génération vidéo, mais les modèles vidéo de pointe actuels sont souvent inférieurs aux modèles d'image en termes de qualité visuelle et de contrôle utilisateur. Ce travail introduit une méthode qui exploite la puissance des modèles de diffusion texte-image pour le montage vidéo piloté par le texte.

Étant donné une vidéo source et une invite textuelle cible, TokenFlow génère une vidéo de haute qualité qui correspond au texte cible tout en préservant méticuleusement la disposition spatiale et la dynamique de la vidéo d'entrée d'origine. L'innovation principale réside dans l'observation que la cohérence de la vidéo éditée peut être obtenue en appliquant la cohérence dans l'espace des caractéristiques de diffusion. Ceci est réalisé en propageant explicitement les caractéristiques de diffusion sur la base de correspondances inter-images facilement disponibles au sein du modèle. Par conséquent, le cadre fonctionne sans avoir besoin d'aucun entraînement ou réglage fin et est compatible avec toute technique d'édition texte-image prête à l'emploi.

L'implémentation est fournie en PyTorch et est le dépôt officiel de l'article "TokenFlow: Consistent Diffusion Features for Consistent Video Editing", présenté à l'ICLR 2024. Le projet démontre des résultats d'édition de pointe sur une variété de vidéos du monde réel. Les utilisateurs peuvent explorer des exemples de résultats, des détails du projet et la recherche sous-jacente via les liens fournis. Le cadre est conçu pour des modifications préservant la structure et s'appuie sur des techniques d'édition d'images existantes telles que Plug-and-Play, ControlNet et SDEdit. Il est conseillé aux utilisateurs de s'assurer de la compatibilité avec leur technique d'édition de base choisie, car le décodeur LDM pourrait introduire un léger tremblement en fonction du contenu vidéo d'origine.

Fonctionnalités principales de TokenFlow

  • Implémentation PyTorch officielle de TokenFlow

  • Permet le montage vidéo cohérent à l'aide de modèles de diffusion pré-entraînés

  • Aucun entraînement ou réglage fin supplémentaire requis

  • Préserve la disposition spatiale et la dynamique des vidéos d'entrée

  • Permet le montage vidéo piloté par le texte

  • Applique la cohérence dans l'espace des caractéristiques de diffusion

  • Utilise des correspondances inter-images pour la propagation des caractéristiques

  • Compatible avec les méthodes d'édition texte-image prêtes à l'emploi

  • Démontre des résultats d'édition de pointe

  • Prend en charge les modifications préservant la structure

  • Fonctionne avec les techniques Plug-and-Play, ControlNet et SDEdit

Premiers pas avec TokenFlow

  1. Cloner : Clonez le dépôt TokenFlow depuis GitHub.

  2. Installer les dépendances : Créez un environnement conda et installez les paquets requis en utilisant `pip install -r requirements.txt`.

  3. Prétraiter : Préparez votre vidéo en exécutant `python preprocess.py` avec le chemin des données et l'invite d'inversion spécifiés.

  4. Configurer : Créez un fichier de configuration YAML pour votre méthode d'édition choisie (par exemple, `configs/config_pnp.yaml`).

  5. Exécuter : Lancez le script d'édition, tel que `python run_tokenflow_pnp.py`, en utilisant votre configuration.

Cas d'utilisation de TokenFlow

  • Modification vidéo pilotée par le texte
  • Montage vidéo préservant la structure
  • Création de contenu vidéo assistée par IA
  • Amélioration de la qualité vidéo
  • Recherche et développement en IA vidéo

FAQ de TokenFlow

Avis sur TokenFlow

Chargement...

Outils IA populaires comme TokenFlow

Modèles IA

Lumiere est un modèle de diffusion espace-temps de Google Research pour la génération de vidéos réalistes, diverses et cohérentes. Il synthétise des durées vidéo complètes en une…

Générateurs de vidéos IA

Applications IA

VideoAI est un générateur de vidéos AI qui transforme des textes et des images en vidéos en utilisant des modèles de pointe tels que Kling, Wan, Seedance et Veo. Il propose…

Générateurs de vidéos IAMédias et divertissement

Modèles IA

Imagen Video est un système de génération vidéo conditionné par du texte, développé par Google Research. Il exploite une cascade de modèles de diffusion vidéo pour créer des…

Générateurs de vidéos IA

Stable Video Diffusion Online transforme des images et du texte en courtes vidéos à l'aide d'un modèle d'IA avancé. Cet outil en avant-première de recherche élargit les…

Générateurs de vidéos IA

Applications IA

CapCut AI Video Editor propose un montage vidéo intelligent en ligne avec des outils IA avancés pour créer du contenu tendance. Il intègre la conception IA, un studio vidéo, des…

En vedetteÉditeurs vidéo IA

Modèles IA

VideoPoet est un grand modèle linguistique de Google Research capable de génération vidéo en mode zero-shot. Il transforme les modèles de langage autorégressifs en générateurs…

Générateurs de vidéos IA

Dépôts GitHub d'IA

Kandinsky 2 est un modèle de diffusion latente multilingue de texte à image. Il offre des capacités avancées de génération d'images, notamment le texte-à-image, l'image-à-image et…

Modèles d'IA et LLM

Dépôts GitHub d'IA

StoryDiffusion est un outil d'IA pour générer des images et des vidéos cohérentes sur de longues séquences. Il utilise une auto-attention cohérente pour la constance des…

Générateurs d'images IA