説明
DreamTalkは、拡散ベースの音声駆動型表情豊かなトーキングヘッド生成フレームワークの公式実装です。このツールは、多様な話方スタイルや感情を正確に反映する、高品質なトーキングヘッド動画を生成するように設計されています。その中核的な能力は、標準的なスピーチ、歌、多言語音声、さらにはノイズの多い音声信号を含む、幅広い入力に対する堅牢なパフォーマンスにあります。さらに、DreamTalkはドメイン外のポートレートを処理する際にも耐性を示し、さまざまなアプリケーションに対応できる汎用性の高いソリューションとなっています。
このフレームワークは、拡散確率モデルを活用して、表情豊かでリアルな動画生成を実現しています。ユーザーは、PyTorch、torchvision、torchaudio、その他の依存関係の特定のバージョン要件に従って、condaとpipを使用してプロジェクトをインストールできます。インストールプロセスには、専用のconda環境を作成し、要件ファイルから必要なパッケージをインストールすることが含まれます。
事前学習済みチェックポイントの取得に関心のあるユーザー向けに、社会的影響への配慮から公開ダウンロードアクセスは停止されています。関心のある関係者は、メールでチェックポイントをリクエストし、学術研究目的のみに使用することに明示的に同意する必要があります。取得したチェックポイントは、指定された「checkpoints」フォルダに配置する必要があります。
DreamTalkを使用した推論には、いくつかの主要なパラメータを持つPythonスクリプトを実行することが含まれます。これらには、入力音声ファイル(wav、mp3、m4a、mp4などのさまざまな形式をサポート)、参照スタイルクリップ、ヘッドポーズシーケンス、および入力ポートレート画像のパスが含まれます。「cfg_scale」のような追加パラメータは、話方スタイルの強度を制御し、「max_gen_len」は最大動画生成時間を設定します。出力動画は「output_video」フォルダに保存され、中間結果は一時フォルダに保存されます。
DreamTalkは、動画解像度を向上させるためのアドホックソリューションも提供しています。2つの方法が提案されています。CodeFormerは最大1024x1024解像度に対応しますが、遅く、時間的な不整合の問題が発生する可能性があります。一方、MetaPortraitのTemporal Super-Resolution Modelは、512x512解像度でより高速なパフォーマンスと時間的な一貫性を実現しますが、顔の感情の強度が低下する可能性があります。このプロジェクトは、この分野の先行研究を認識し、それらを基盤としており、関連研究を引用し、学術利用のための引用エントリを提供しています。
DreamTalkの主要機能
拡散ベースの音声駆動型トーキングヘッド生成
多様な話方スタイルでの高品質な動画出力
さまざまな音声入力(スピーチ、歌、ノイズの多い音声)での堅牢なパフォーマンス
ドメイン外のポートレートに対応
複数言語をサポート
公式実装コードを提供
動画生成用の推論スクリプトを含む
解像度向上用のアドホックソリューション(CodeFormer、MetaPortrait)を提供
スタイル強度と生成長さを調整可能なパラメータ
CPU推論をサポート
DreamTalkをはじめる
クローン: DreamTalkリポジトリをGitHubからクローンします。
依存関係のインストール: conda環境を作成し、提供されたrequirements.txtを使用して必要なパッケージをインストールします。
チェックポイントのダウンロード: 学術研究用にメールでチェックポイントをリクエストし、「checkpoints」フォルダに配置します。
入力の準備: 入力音声、参照スタイルクリップ、ヘッドポーズシーケンス、ポートレート画像を用意します。
推論の設定: 推論スクリプトで、入力パスとcfg_scaleやmax_gen_lenなどのパラメータを指定します。
推論の実行: 推論スクリプト(例: python inference_for_demo_video.py)を実行して、トーキングヘッド動画を生成します。
解像度の向上(オプション): CodeFormerまたはMetaPortraitを使用して、動画解像度を向上させます。
研究への活用: 生成された動画を学術研究目的で使用します。
DreamTalkの使用例
- 表情豊かなトーキングヘッド生成
- 音声・映像合成
- AIアニメーションの研究
- クロスリンガル・トーキングヘッド
- 顔のスタイル転送
- ノイズの多い音声の処理






