跳转到主要内容
ToolPotion

VideoPoet

VideoPoet 是 Google Research 开发的一款大型语言模型,能够进行零样本视频生成。它将自回归语言模型转化为高质量的视频生成器,支持文本到视频、视频到音频以及各种编辑任务,并具有出色的时间一致性和运动保真度。

访问URL

描述

VideoPoet 代表了 AI 驱动视频合成的重大进步,它作为一个大型语言模型,专为零样本视频生成而设计。其核心创新在于一种简单的建模方法,能够将任何自回归语言模型转化为复杂的视频生成器。这种方法允许根据文本提示创建高质量视频,并展现出生成各种大型、有趣且高保真运动的卓越能力。

在技术基础方面,VideoPoet 使用了预训练的 MAGVIT V2 视频分词器和 SoundStream 音频分词器。这些组件将可变长度的图像、视频和音频片段转换为统一词汇表中的离散代码。这些代码与文本语言模型兼容,便于与其他模态(如文本)进行无缝集成。然后,自回归语言模型跨视频、图像、音频和文本模态进行学习,以预测序列中的下一个视频或音频标记。训练框架包含多种多模态生成学习目标,包括文本到视频、文本到图像、图像到视频、视频帧续写、视频修复和外绘、视频风格化以及视频到音频。这些任务可以组合以实现额外的零样本能力,例如文本到音频生成。

VideoPoet 的能力超越了简单的生成。它能够根据文本提示输出高运动、可变长度的视频,并且无需文本指导即可为输入视频生成匹配的音频。该模型支持生成方形或纵向视频,适合短视频内容。此外,它在可控视频编辑方面表现出色,允许主体遵循不同的运动或风格,以及交互式编辑,用户可以从生成的候选对象中选择以优化运动类型。图像到视频生成也是一项关键功能,可以将任何输入图像转换为由文本提示引导的视频。零样本风格化允许视频根据文本提示采用各种艺术风格,并且可以通过提示工程指定可控的相机运动,实现诸如缩放、滑轨变焦和 FPV 航拍镜头等效果。

该模型在视频生成方面展现了最先进的水平,尤其是在生成多样化和高保真运动方面。它可以通过迭代地根据一秒的输入剪辑预测一秒的输出,来生成更长的视频,并显示出强大的对象身份保持能力。这使得 VideoPoet 成为视觉叙事、内容创作和探索新颖媒体合成形式的强大工具。该研究强调了其在轻松创建动态视觉叙事和应用风格化效果方面的潜力。

VideoPoet亮点

  • 从文本提示进行零样本视频生成

  • 无需文本指导的视频到音频生成

  • 支持文本到视频、文本到图像和图像到视频生成

  • 支持视频帧续写、修复和外绘

  • 实现视频风格化和可控相机运动

  • 能够生成可变长度的视频

  • 在长片段中保持强大的对象身份

  • 支持用于短视频内容的方形和纵向视频方向

  • 通过候选对象选择进行交互式视频编辑

  • 组合生成学习目标以实现多模态任务

  • 利用 MAGVIT V2 和 SoundStream 分词器

  • 输出高运动和高保真视频内容

VideoPoet入门

  1. 访问模型:通过其研究界面或 API 使用 VideoPoet 模型。

  2. 输入提示:提供所需视频内容的详细文本描述。

  3. 指定参数:定义视频方向(方形/纵向)和所需长度。

  4. 生成视频:启动生成过程以创建视频序列。

  5. 生成音频:可选地,为创建的视频生成匹配的音频。

  6. 编辑视频:应用风格化、相机运动或交互式编辑进行优化。

  7. 集成:将生成的视频片段整合到叙事或内容项目中。

VideoPoet的使用案例

  • 内容创作
  • 叙事
  • 视频编辑
  • 原型设计
  • 艺术探索
  • 视听同步
  • 短视频
  • 概念可视化

VideoPoet的常见问题

VideoPoet 评价

加载中...

与 VideoPoet 类似的热门AI工具

AI 模型

Lumiere 是 Google Research 开发的时空扩散模型,用于生成逼真、多样且连贯的视频。它能在单次运行中合成整个视频时长,从而实现高级的文本到视频、图像到视频、视频修复以及风格化生成任务,并具有出色的时间一致性。

AI 视频生成器

AI 模型

Make-A-Video 是一个先进的 AI 系统,可根据文本提示生成视频。它利用文本到图像的进展和无标签的视频数据来理解世界的视觉外观和运动,使用户能够根据简单的文本描述创建独特的视频。该系统提供创意控制,并致力于负责任的 AI 开发。

AI 视频生成器

AI 模型

Imagen Video 是 Google Research 开发的一种文本条件视频生成系统。它利用级联视频扩散模型,根据文本提示生成高清视频,为各种创意应用提供高保真度、可控性和世界知识。

AI 视频生成器

AI 应用

一个全方位的AI视频生成平台,能够从文本、图像或参考片段创建专业的MP4视频,使用多个领先模型如Veo 3、Sora 2、Kling和Seedance,生成时间约为一分钟。

AI 视频生成器营销与创意机构

Seedance 2.0 是一个多模态 AI 视频生成器,可以根据文本、图像、视频和音频输入创建视频,具备摄像机和动作复制、视频扩展以及自动生成音效的功能。

AI 视频生成器媒体与娱乐

Flux 3 是一个 AI 视频生成器,可以从文本、图像或参考片段创建视频。它具有原生音频、自然运动和多语言对话,允许用户无缝预览和下载他们的创作。

AI 视频生成器

AI 应用

VideoAI 是一个 AI 视频生成器,利用领先的模型如 Kling、Wan、Seedance 和 Veo 将文本和图像转换为视频。它还为创作者提供图像工具和 AI 音乐生成。

AI 视频生成器媒体与娱乐

AI 应用

ClipDance 是一个 AI 视频创作平台,可以将文本和图像转化为具有本地同步音频的电影级 1080p 视频,基于 Seedance 2.0 和其他领先模型。免费开始。

AI 视频生成器媒体与娱乐