跳转到主要内容
ToolPotion

daVinci-MagiHuman

daVinci-MagiHuman 是一个开源 AI 模型,可以将单张肖像照片和脚本或音频转换为同步口型的对话视频,生成对齐的音频和视频,且只需一次处理即可完成。可以在线免费试用或自托管。

访问URL
daVinci-MagiHuman screenshot

描述

daVinci-MagiHuman 是一个拥有 150 亿参数的开源 AI 模型,可以从单张照片生成同步口型的对话视频。您只需上传一张肖像,添加脚本或音频,即可获得自然的对话片段,其中音频和视频是一起生成的,而不是从不同的管道拼接而成。该模型由 Sand.ai 和 GAIR Lab(上海交通大学)开发,并在 Apache 2.0 许可下发布,因此权重可以被检查、在本地运行,并在许可范围内进行商业使用。

该模型使用单流 Transformer,联合去噪视频和音频标记,利用参考图像潜在空间,从面部照片加上文本或音频生成统一的音频视频输出。在单个 NVIDIA H100 GPU 上,它可以在大约两秒的墙钟时间内生成一个短的 256p 片段,已发布的评估报告显示其单词错误率较低,并且在与 Ovi 1.1 和 LTX 2.3 等基准的比较中获得了较高的人类偏好。

用户可以通过免费的在线演示进行尝试,从 Hugging Face 下载检查点,或克隆 GitHub 仓库进行自托管,并使用自定义设置和高达 1080p 的分辨率进行推理。根据发布的训练数据,它支持多种语言的口型同步。

托管服务提供免费层,包括初始和每日签到积分(15 天临时存储),以及 Basic、Pro 和 Max 积分计划,增加 HD 生成、优先处理、永久资产存储和商业使用权。

daVinci-MagiHuman的核心功能

  • 单张照片生成同步口型的对话视频

  • 统一的音频和视频在一次模型处理过程中生成

  • 150 亿参数的单流 Transformer 架构

  • 在 Apache 2.0 许可下开源

  • 快速推理(在 H100 上约 2 秒生成约 2 秒的 256p 片段)

  • 根据训练数据支持多语言口型同步

  • 通过 Hugging Face 和 GitHub 自托管,或使用托管的在线演示

  • 输出分辨率高达 1080p

如何使用 daVinci-MagiHuman?

  1. 上传肖像:添加一张清晰的正面肖像照片。

  2. 添加脚本或音频:输入文本或上传音频文件以驱动语音。

  3. 选择分辨率:选择输出分辨率,如 256p、720p 或 1080p。

  4. 生成:运行模型以创建同步口型的片段。

  5. 下载:保存完成的对话视频,或从 Hugging Face 或 GitHub 自托管。

daVinci-MagiHuman的使用案例

  • 对话头像视频
  • 自托管生成
  • 多语言配音
  • 研究与基准测试
  • 内容创作

daVinci-MagiHuman的常见问题

daVinci-MagiHuman 评价

加载中...

与 daVinci-MagiHuman 类似的热门AI工具

AI 应用

一家专注于视频生成的人工智能公司,推出了Magi系列模型,包括MAGI-2 Preview,这是一个统一的音视频模型,能够生成同步的对话、歌唱和电影镜头运动,并为开发者提供API平台。

AI 视频生成器媒体与娱乐

AI 应用

Digen AI 是一款免费的 AI 视频生成器,可以将图像转换为具有真实口型同步、多语言支持和智能运动的专业视频。它旨在帮助没有技术技能的创作者制作视频。

AI 视频生成器媒体与娱乐

AI 应用

Gaga AI 是 Sand.ai 提供的在线 AI 视频生成器和头像创建工具,可以将单张图像和音频转换为具有精确口型同步、自然表情、声音克隆和文本转语音的电影级对话视频。

AI 视频生成器

AI 应用

Seedance 2.0 是一个统一的多模态 AI 视频生成器,可以将文本、图像、音频或视频参考转化为具有本地同步口型、物理准确运动和录音室质量音效的 1080p 电影片段,所有这些都在一个流程中完成。

AI 视频生成器媒体与娱乐

AI 应用

ClipDance 是一个 AI 视频创作平台,可以将文本和图像转化为具有本地同步音频的电影级 1080p 视频,基于 Seedance 2.0 和其他领先模型。免费开始。

AI 视频生成器媒体与娱乐

AI 应用

LumeFlow AI 是一个一体化的 AI 视频和图像平台,能够使用 20 多种模型将文本、图像或视频转换为高质量的剪辑,支持同步口型、特效和图像生成。无需编辑技能。

AI 视频生成器营销与创意机构

AI 应用

Monet AI 是一个一体化的视觉创作平台,将 20 多个领先的视频、图像和音频模型统一在一个账户中,让创作者无需切换平台即可生成和比较 AI 内容。

AI 视频生成器营销与创意机构

AI 应用

LipsyncX 是一个 AI 唇动视频生成器,可以将照片、视频、脚本和声音转化为会说话的照片、配音片段、唱歌视频和多语言头像视频,支持 50 多种语言,并采用按需付费定价模式。

AI 视频生成器媒体与娱乐