描述
VideoPoet 代表了 AI 驱动视频合成的重大进步,它作为一个大型语言模型,专为零样本视频生成而设计。其核心创新在于一种简单的建模方法,能够将任何自回归语言模型转化为复杂的视频生成器。这种方法允许根据文本提示创建高质量视频,并展现出生成各种大型、有趣且高保真运动的卓越能力。
在技术基础方面,VideoPoet 使用了预训练的 MAGVIT V2 视频分词器和 SoundStream 音频分词器。这些组件将可变长度的图像、视频和音频片段转换为统一词汇表中的离散代码。这些代码与文本语言模型兼容,便于与其他模态(如文本)进行无缝集成。然后,自回归语言模型跨视频、图像、音频和文本模态进行学习,以预测序列中的下一个视频或音频标记。训练框架包含多种多模态生成学习目标,包括文本到视频、文本到图像、图像到视频、视频帧续写、视频修复和外绘、视频风格化以及视频到音频。这些任务可以组合以实现额外的零样本能力,例如文本到音频生成。
VideoPoet 的能力超越了简单的生成。它能够根据文本提示输出高运动、可变长度的视频,并且无需文本指导即可为输入视频生成匹配的音频。该模型支持生成方形或纵向视频,适合短视频内容。此外,它在可控视频编辑方面表现出色,允许主体遵循不同的运动或风格,以及交互式编辑,用户可以从生成的候选对象中选择以优化运动类型。图像到视频生成也是一项关键功能,可以将任何输入图像转换为由文本提示引导的视频。零样本风格化允许视频根据文本提示采用各种艺术风格,并且可以通过提示工程指定可控的相机运动,实现诸如缩放、滑轨变焦和 FPV 航拍镜头等效果。
该模型在视频生成方面展现了最先进的水平,尤其是在生成多样化和高保真运动方面。它可以通过迭代地根据一秒的输入剪辑预测一秒的输出,来生成更长的视频,并显示出强大的对象身份保持能力。这使得 VideoPoet 成为视觉叙事、内容创作和探索新颖媒体合成形式的强大工具。该研究强调了其在轻松创建动态视觉叙事和应用风格化效果方面的潜力。
VideoPoet亮点
从文本提示进行零样本视频生成
无需文本指导的视频到音频生成
支持文本到视频、文本到图像和图像到视频生成
支持视频帧续写、修复和外绘
实现视频风格化和可控相机运动
能够生成可变长度的视频
在长片段中保持强大的对象身份
支持用于短视频内容的方形和纵向视频方向
通过候选对象选择进行交互式视频编辑
组合生成学习目标以实现多模态任务
利用 MAGVIT V2 和 SoundStream 分词器
输出高运动和高保真视频内容
VideoPoet入门
访问模型:通过其研究界面或 API 使用 VideoPoet 模型。
输入提示:提供所需视频内容的详细文本描述。
指定参数:定义视频方向(方形/纵向)和所需长度。
生成视频:启动生成过程以创建视频序列。
生成音频:可选地,为创建的视频生成匹配的音频。
编辑视频:应用风格化、相机运动或交互式编辑进行优化。
集成:将生成的视频片段整合到叙事或内容项目中。
VideoPoet的使用案例
- 内容创作
- 叙事
- 视频编辑
- 原型设计
- 艺术探索
- 视听同步
- 短视频
- 概念可视化





