描述
DreamTalk 是一个基于扩散模型的音频驱动的富有表现力的说话人脸生成框架的官方实现。该工具旨在生成高质量的说话人脸视频,准确反映各种口语风格和情感。其核心能力在于其在各种输入下的稳健性能,包括标准语音、歌曲、多语言音频,甚至嘈杂的音频信号。此外,DreamTalk 在处理域外肖像时也表现出韧性,使其成为各种应用的通用解决方案。
该框架利用扩散概率模型来实现富有表现力和逼真的视频生成。用户可以使用 conda 和 pip 安装该项目,遵循 PyTorch、torchvision、torchaudio 和其他依赖项的特定版本要求。安装过程包括创建一个专用的 conda 环境,然后从 requirements 文件安装必要的包。
对于有兴趣获取预训练检查点的用户,由于社会影响的考虑,已停止公开下载。有兴趣的各方必须通过电子邮件请求检查点,明确同意仅将其用于学术研究目的。获得后,检查点应放置在指定的“checkpoints”文件夹中。
使用 DreamTalk 进行推理涉及运行一个带有几个关键参数的 Python 脚本。这些参数包括输入音频文件(支持 wav、mp3、m4a 和 mp4 等各种格式)、参考风格剪辑、头部姿势序列和输入肖像图像的路径。其他参数,如“cfg_scale”,控制口语风格的强度,而“max_gen_len”设置最大视频生成时长。输出视频保存在“output_video”文件夹中,中间结果保存在临时文件夹中。
DreamTalk 还提供用于提高视频分辨率的临时解决方案。建议两种方法:CodeFormer 可实现高达 1024x1024 的分辨率,但速度较慢,可能存在时间不一致问题;MetaPortrait 的 Temporal Super-Resolution Model 可实现 512x512 的分辨率,性能更快且时间连贯,但可能会降低面部表情强度。该项目承认并借鉴了该领域的先前工作,引用了相关研究并为学术用途提供了引用条目。
DreamTalk的核心功能
基于扩散模型的音频驱动说话人脸生成
高质量视频输出,具有多样的口语风格
对各种音频输入(语音、歌曲、嘈杂音频)表现稳健
处理域外肖像
支持多种语言
提供官方实现代码
包含用于视频生成的推理脚本
提供用于分辨率增强的临时解决方案(CodeFormer、MetaPortrait)
可调节的风格强度和生成长度参数
支持 CPU 推理
DreamTalk入门
克隆:从 GitHub 克隆 DreamTalk 存储库。
安装依赖项:创建一个 conda 环境,并使用提供的 requirements.txt 安装所需的包。
下载检查点:通过电子邮件请求用于学术研究的检查点,并将其放置在“checkpoints”文件夹中。
准备输入:收集输入音频、参考风格剪辑、头部姿势序列和肖像图像。
配置推理:在推理脚本中指定输入路径和参数,如 cfg_scale 和 max_gen_len。
执行推理:运行推理脚本(例如,python inference_for_demo_video.py)以生成说话人脸视频。
提高分辨率(可选):应用 CodeFormer 或 MetaPortrait 以增强视频分辨率。
用于研究:将生成的视频用于学术研究目的。
DreamTalk的使用案例
- 富有表现力的说话人脸生成
- 视听合成
- AI 动画研究
- 跨语言说话人脸
- 面部风格迁移
- 处理嘈杂音频






