説明
Lyraは、最も制約の厳しいネットワーク条件下でも高品質な音声通信を提供するために設計された、画期的な音声圧縮コーデックです。Googleによって開発されたLyraは、極めて低いビットレートで音声の明瞭度と自然さを維持するという長年の課題に取り組みます。これは、従来はロボットのような、あるいは劣化された音声をもたらすことが多かった課題です。
Lyraの核心的な革新は、従来のコーデック技術と高度な機械学習を組み合わせたハイブリッドアプローチにあります。このコーデックは、特徴と呼ばれる音声の識別可能な属性を40ミリ秒ごとに抽出します。これらの特徴は、ログメルスペクトログラムとして表され、伝送のために圧縮されます。受信側では、DeepMindのWaveNetのようなモデルに着想を得た生成モデルが、これらの圧縮された特徴を使用して音声信号を再構築します。この方法により、Lyraは、最先端の波形コーデックと同等のオーディオ品質を提供しながら、パラメトリックコーデックの特徴である低ビットレートを実現できます。
オーディオサンプルごとにオーディオを圧縮し、より高いビットレートを必要とする従来の波形コーデックとは異なり、Lyraの生成アプローチはより効率的です。生成モデルにおける主な懸念は計算複雑性ですが、Lyraはコスト効率の高い再帰型生成モデル、WaveRNNのバリエーションを採用することでこれを軽減します。このモデルはより低いレートで動作しますが、異なる周波数範囲にわたって複数の信号を並列に生成し、それらを単一の出力信号に結合します。この最適化により、Lyraはクラウドサーバーだけでなく、リアルタイムでミドルレンジのモバイルデバイスでも機能し、処理遅延は90msとなり、業界標準に準拠しています。
Lyraは、ターゲットビットレート3kbpsで動作するように設計されており、このレベルでは既存のコーデックを大幅に上回ります。リスニングテストによると、Lyraは8kbpsのOpusと比較して良好な結果を示しており、60%以上の帯域幅削減を表しています。これにより、Lyraは、高ビットレートコーデックには帯域幅が不足している環境や、既存の低ビットレートオプションが十分な品質を提供できない環境に理想的なソリューションとなります。このコーデックは、70以上の言語にわたる数千時間もの音声データでトレーニングされており、グローバルなユーザーベースに対して堅牢性と公平性を保証します。Googleは、Duoなどの製品にLyraを積極的に展開しており、低帯域幅接続でのオーディオ通話品質と信頼性を向上させています。さらに、パフォーマンスの最適化と非音声オーディオユースケースへの拡張に向けた研究も継続的に行われています。
Lyra Speech Codecのハイライト
非常に低いビットレートでの高品質音声圧縮
音声再構築のための機械学習と生成モデルを活用
ターゲットビットレート3kbpsで動作
8kbpsのOpusと比較して60%以上の帯域幅削減を実現
ミドルレンジモバイルデバイスでのリアルタイムパフォーマンス
90msの処理遅延
70以上の言語にわたる数千時間もの音声データでトレーニング済み
従来のコーデック技術とMLを組み合わせたハイブリッドアプローチ
生成モデリングにコスト効率の高いWaveRNNバリエーションを使用
低速および輻輳したネットワークでの音声通信を可能にする
音声信号の効率的なデータ伝送とストレージ向けに設計
Lyra Speech Codecをはじめる
モデルへのアクセス: Lyraをアプリケーションまたはサービスに統合します。
環境設定: 必要な計算リソースが利用可能であることを確認します。
API経由での統合: 音声信号のエンコードおよびデコードのためにLyra APIを利用します。
最適化: 特定のネットワーク条件と希望する品質レベルに合わせてパラメータを微調整します。
Lyra Speech Codecの使用例
- 低帯域幅通信
- モバイル音声通話
- 新興市場
- リアルタイムコラボレーション
- VoIPアプリケーション
- ビデオ会議




