描述
TokenFlow 提出了一种创新的框架,用于进行一致的视频编辑,该框架利用预训练的文本到图像扩散模型,而无需任何额外的训练或微调。生成式 AI 的快速发展已扩展到视频生成领域,但当前最先进的视频模型在视觉质量和用户控制方面通常不如图像模型。这项工作引入了一种方法,该方法利用文本到图像扩散模型的力量来进行文本驱动的视频编辑。
给定源视频和目标文本提示,TokenFlow 会生成一个高质量的视频,该视频与目标文本对齐,同时精心保留原始输入视频的空间布局和动态。核心创新在于观察到,通过在扩散特征空间内强制执行一致性,可以实现编辑视频的一致性。这是通过根据模型中易于获得的帧间对应关系显式传播扩散特征来实现的。因此,该框架无需任何训练或微调即可运行,并且与任何现成的文本到图像编辑技术兼容。
该实现以 PyTorch 提供,是 ICLR 2024 上发表的“TokenFlow: Consistent Diffusion Features for Consistent Video Editing”论文的官方存储库。该项目在各种真实世界视频中展示了最先进的编辑结果。用户可以通过提供的链接探索示例结果、项目详情和底层研究。该框架专为结构保持编辑而设计,并建立在即插即用、ControlNet 和 SDEdit 等现有图像编辑技术之上。建议用户确保与他们选择的基础编辑技术的兼容性,因为 LDM 解码器可能会根据原始视频内容引入轻微的抖动。
TokenFlow的核心功能
TokenFlow 的官方 PyTorch 实现
使用预训练的扩散模型实现一致的视频编辑
无需进一步训练或微调
保留输入视频的空间布局和动态
实现文本驱动的视频编辑
强制执行扩散特征空间的一致性
利用帧间对应关系进行特征传播
兼容现成的文本到图像编辑方法
展示了最先进的编辑结果
支持结构保持编辑
可与即插即用、ControlNet 和 SDEdit 技术配合使用
TokenFlow入门
克隆:从 GitHub 克隆 TokenFlow 存储库。
安装依赖项:创建一个 conda 环境并使用 `pip install -r requirements.txt` 安装所需的包。
预处理:通过运行 `python preprocess.py` 并指定数据路径和反演提示来准备您的视频。
配置:为您选择的编辑方法创建一个 YAML 配置文件(例如 `configs/config_pnp.yaml`)。
执行:使用您的配置运行编辑脚本,例如 `python run_tokenflow_pnp.py`。
TokenFlow的使用案例
- 文本驱动的视频修改
- 结构保持视频编辑
- AI 驱动的视频内容创作
- 增强视频质量
- 视频 AI 的研究与开发





