描述
daVinci-MagiHuman 是一个拥有 150 亿参数的开源 AI 模型,可以从单张照片生成同步口型的对话视频。您只需上传一张肖像,添加脚本或音频,即可获得自然的对话片段,其中音频和视频是一起生成的,而不是从不同的管道拼接而成。该模型由 Sand.ai 和 GAIR Lab(上海交通大学)开发,并在 Apache 2.0 许可下发布,因此权重可以被检查、在本地运行,并在许可范围内进行商业使用。
该模型使用单流 Transformer,联合去噪视频和音频标记,利用参考图像潜在空间,从面部照片加上文本或音频生成统一的音频视频输出。在单个 NVIDIA H100 GPU 上,它可以在大约两秒的墙钟时间内生成一个短的 256p 片段,已发布的评估报告显示其单词错误率较低,并且在与 Ovi 1.1 和 LTX 2.3 等基准的比较中获得了较高的人类偏好。
用户可以通过免费的在线演示进行尝试,从 Hugging Face 下载检查点,或克隆 GitHub 仓库进行自托管,并使用自定义设置和高达 1080p 的分辨率进行推理。根据发布的训练数据,它支持多种语言的口型同步。
托管服务提供免费层,包括初始和每日签到积分(15 天临时存储),以及 Basic、Pro 和 Max 积分计划,增加 HD 生成、优先处理、永久资产存储和商业使用权。
daVinci-MagiHuman的核心功能
单张照片生成同步口型的对话视频
统一的音频和视频在一次模型处理过程中生成
150 亿参数的单流 Transformer 架构
在 Apache 2.0 许可下开源
快速推理(在 H100 上约 2 秒生成约 2 秒的 256p 片段)
根据训练数据支持多语言口型同步
通过 Hugging Face 和 GitHub 自托管,或使用托管的在线演示
输出分辨率高达 1080p
如何使用 daVinci-MagiHuman?
上传肖像:添加一张清晰的正面肖像照片。
添加脚本或音频:输入文本或上传音频文件以驱动语音。
选择分辨率:选择输出分辨率,如 256p、720p 或 1080p。
生成:运行模型以创建同步口型的片段。
下载:保存完成的对话视频,或从 Hugging Face 或 GitHub 自托管。
daVinci-MagiHuman的使用案例
- 对话头像视频
- 自托管生成
- 多语言配音
- 研究与基准测试
- 内容创作






