Descripción
TokenFlow presenta un marco innovador para la edición de video consistente, aprovechando modelos de difusión pre-entrenados de texto a imagen sin requerir ningún entrenamiento o ajuste adicional. Los rápidos avances en IA generativa se han extendido a la generación de video, sin embargo, los modelos de video de vanguardia actuales a menudo se quedan cortos en comparación con los modelos de imagen en calidad visual y control del usuario. Este trabajo introduce un método que aprovecha el poder de los modelos de difusión de texto a imagen para la edición de video controlada por texto.
Dada una video fuente y un prompt de texto objetivo, TokenFlow genera un video de alta calidad que se alinea con el texto objetivo, preservando meticulosamente el diseño espacial y la dinámica del video de entrada original. La innovación central radica en la observación de que la consistencia en el video editado se puede lograr forzando la consistencia dentro del espacio de características de difusión. Esto se logra propagando explícitamente las características de difusión basándose en correspondencias inter-fotogramas fácilmente disponibles dentro del modelo. En consecuencia, el marco opera sin la necesidad de entrenamiento o ajuste y es compatible con cualquier técnica de edición de texto a imagen lista para usar.
La implementación se proporciona en PyTorch y es el repositorio oficial del artículo "TokenFlow: Consistent Diffusion Features for Consistent Video Editing", presentado en ICLR 2024. El proyecto demuestra resultados de edición de vanguardia en una variedad de videos del mundo real. Los usuarios pueden explorar resultados de muestra, detalles del proyecto y la investigación subyacente a través de los enlaces proporcionados. El marco está diseñado para ediciones que preservan la estructura y se basa en técnicas de edición de imágenes existentes como Plug-and-Play, ControlNet y SDEdit. Se aconseja a los usuarios que aseguren la compatibilidad con su técnica de edición base elegida, ya que el decodificador LDM podría introducir un ligero temblor dependiendo del contenido del video original.
Características principales de TokenFlow
Implementación oficial en PyTorch de TokenFlow
Permite la edición de video consistente utilizando modelos de difusión pre-entrenados
No se requiere entrenamiento o ajuste adicional
Preserva el diseño espacial y la dinámica de los videos de entrada
Logra la edición de video controlada por texto
Fuerza la consistencia en el espacio de características de difusión
Utiliza correspondencias inter-fotogramas para la propagación de características
Compatible con métodos de edición de texto a imagen listos para usar
Demuestra resultados de edición de vanguardia
Soporta ediciones que preservan la estructura
Funciona con las técnicas Plug-and-Play, ControlNet y SDEdit
Primeros pasos con TokenFlow
Clonar: Clone el repositorio de TokenFlow desde GitHub.
Instalar dependencias: Cree un entorno conda e instale los paquetes requeridos usando `pip install -r requirements.txt`.
Preprocesar: Prepare su video ejecutando `python preprocess.py` con la ruta de datos y el prompt de inversión especificados.
Configurar: Cree un archivo de configuración YAML para su método de edición elegido (por ejemplo, `configs/config_pnp.yaml`).
Ejecutar: Ejecute el script de edición, como `python run_tokenflow_pnp.py`, utilizando su configuración.
Casos de uso de TokenFlow
- Modificación de video controlada por texto
- Edición de video que preserva la estructura
- Creación de contenido de video impulsada por IA
- Mejora de la calidad del video
- Investigación y desarrollo en IA de video





