説明
Make-An-Audioは、テキストから音声への生成における重要な進歩を表しており、プロンプト拡張拡散モデルを活用して、高品質なデータセットの制限や長い音声シーケンスのモデリングの複雑さといった課題を克服します。このシステムは、蒸留・再プログラム化アプローチを利用した新しい疑似プロンプト拡張技術を導入しています。この手法は、弱教師ありデータや言語フリーの音声を取り込むことで、データの希少性を効果的に緩和します。
さらに、Make-An-Audioはスペクトログラムオートエンコーダーを使用して、生の波形ではなく自己教師あり音声表現を予測します。このアーキテクチャ上の選択は、堅牢な対照言語音声事前学習(CLAP)表現と組み合わせることで、モデルが客観的および主観的な評価の両方で最先端のパフォーマンスを達成することを可能にします。このシステムは、分類器フリーガイダンスによる顕著な制御性を示し、ユーザーが生成された音声出力を微調整できるようにします。
基本的なテキストから音声への変換を超えて、Make-An-Audioは「どのモダリティも置き去りにしない」という原則を体現し、Xから音声へのタスクに対する印象的な汎化能力を示しています。これにより、ユーザー定義のモダリティ入力に基づいた高解像度で忠実度の高い音声を生成する能力が解放されます。このシステムは、パーソナライズされたテキストから音声への生成をサポートし、ユニークなオブジェクトを新しいシーンに注入したり、異なるスタイル間で変換したりすることを可能にします。例としては、初期の「雷」の音から「赤ちゃんの泣き声」を生成し、リアルで忠実な音声を作成することが挙げられます。また、音声インペインティングや画像から音声への生成もサポートし、その創造的な可能性を広げています。
Make-An-Audioのハイライト
テキストから音声への生成のためのプロンプト拡張拡散モデル
蒸留・再プログラム化アプローチを使用した疑似プロンプト拡張
音声表現予測のためのスペクトログラムオートエンコーダー
対照言語音声事前学習(CLAP)表現
制御性のための分類器フリーガイダンス
Xから音声へのタスク(例:画像から音声、動画から音声)への汎化
オブジェクト注入とスタイル変換によるパーソナライズされたテキストから音声への生成
音声インペインティング機能
高解像度で忠実度の高い音声を生成
音声生成におけるデータ希少性への対応
Make-An-Audioをはじめる
モデルへのアクセス: Make-An-Audioモデルへのアクセスを取得します。
API経由での統合: プログラムによる使用のためにモデルのAPIに接続します。
テキストプロンプトの提供: 音声生成のための希望するテキスト説明を入力します。
モダリティ入力の指定(オプション): Xから音声へのタスクの場合、関連する画像または動画入力を提供します。
ガイダンスの設定: 音声特性の微調整のために分類器フリーガイダンスを利用します。
音声の生成: 音声生成プロセスを開始します。
出力の調整: パーソナライズされた音声またはインペインティングタスクのためにパラメータを調整します。
Make-An-Audioの使用例
- テキストから音声への合成
- 効果音生成
- 音声インペインティング
- 画像から音声への変換
- 動画から音声への変換
- パーソナライズされたオーディオコンテンツ
- 音楽生成
- AI研究


