説明
AudioLMは、驚異的な長期一貫性を持つ高品質オーディオ生成のための新しいフレームワークです。AudioLMは、オーディオ生成という複雑なタスクを言語モデリング問題に変換します。これは、入力オーディオを離散トークンのシーケンスにマッピングすることで実現され、実質的にオーディオを言語の一形態として扱います。
このモデルは、再構築品質と長期的な構造的一貫性のバランスを取るために、ハイブリッドトークン化スキームを利用しています。オーディオで事前学習されたマスク言語モデルの離散化されたアクティベーションを使用して長期依存関係を捉え、ニューラルオーディオコーデックからの離散コードを使用して高忠実度合成を行います。この二重アプローチにより、AudioLMは大規模な生のオーディオ波形コーパスから学習することができます。
音声データでトレーニングされた場合、AudioLMは構文的および意味的に妥当な音声継続を生成できます。特に重要なのは、トレーニング中に遭遇しなかったスピーカーに対しても、初期プロンプトのスピーカーの同一性、イントネーション、アクセント、録音条件を維持することです。この機能は音声を超えて拡張され、記号音楽表現に依存せずに一貫性のあるピアノ音楽の継続を生成する能力によって実証されています。
AudioLMのアーキテクチャは、さまざまな生成モードを可能にします。音声継続では、短いオーディオプロンプトを提供し、自然で一貫性のある拡張を受け取ります。音響生成は、音響トークンをサンプリングして、同じ意味内容を持ちながらスピーカーの同一性や録音条件が異なる多様なオーディオサンプルを生成することに焦点を当てています。無条件生成は、プロンプトなしで完全に新しいオーディオシーケンスを生成し、モデルの生成能力の広さを示します。このフレームワークは、言語的一貫性における意味トークンの重要性も強調しており、音響トークンのみでは一貫性の低いコンテンツにつながることを示しています。
このモデルの汎用性は、音楽生成、特にピアノの継続生成への応用によってさらに証明されています。生のピアノオーディオでトレーニングすることにより、AudioLMは音楽的に一貫性のあるシーケンスを生成することを学習し、音響トークンのみでトレーニングされたモデルを上回ります。これは、オーディオ構造とコンテンツに対する堅牢な理解を示しており、さまざまなドメインに適用可能です。
AudioLMのハイライト
高品質オーディオ生成
長期オーディオ一貫性
オーディオへの言語モデリングアプローチ
ハイブリッドトークン化スキーム
音声継続生成
スピーカー同一性保持
イントネーションとアクセント維持
音楽継続生成(例:ピアノ)
無条件オーディオ生成
異なる条件での音響生成
生のオーディオ波形から学習
構文的および意味的に妥当な継続を生成
AudioLMをはじめる
モデルへのアクセス: AudioLMモデルまたはその実装へのアクセスを取得します。
認証: 必要に応じて、アクセス資格情報を認証します。
環境設定: 必要なライブラリと依存関係で開発環境を準備します。
API経由での統合: 提供されたAPIエンドポイントを使用して、オーディオプロンプトを送信し、生成されたオーディオを受信します。
パラメータ設定: 希望するオーディオ特性と生成モードに合わせてモデルパラメータを調整します。
出力の最適化: 特定の品質と一貫性の目標を達成するために、生成設定を微調整します。
AudioLMの使用例
- 音声合成
- 音楽作曲
- オーディオコンテンツ作成
- サウンドデザイン
- ボイスクローニング
- オーディオAIのプロトタイピング


