Zum Hauptinhalt springen
ToolPotion

Lyra Speech Codec

Lyra ist ein neuartiger Sprachcodec mit sehr niedriger Bitrate, der von Google entwickelt wurde. Er nutzt maschinelles Lernen, um Sprachsignale zu komprimieren und ermöglicht so eine qualitativ hochwertige Audiokommunikation selbst in den langsamsten Netzwerken. Lyra erreicht dies durch den Einsatz generativer Modelle zur Rekonstruktion von Sprache aus extrahierten Merkmalen, was im Vergleich zu herkömmlichen Codecs eine deutliche Bandbreitenreduzierung bietet.

URL besuchen

Beschreibung

Lyra ist ein bahnbrechender Sprachkompressionscodec, der entwickelt wurde, um eine qualitativ hochwertige Sprachkommunikation selbst unter den eingeschränktesten Netzwerkbedingungen zu ermöglichen. Lyra wurde von Google entwickelt und löst die langjährige Herausforderung, Sprachverständlichkeit und Natürlichkeit bei extrem niedrigen Bitraten aufrechtzuerhalten, eine Leistung, die historisch zu roboterhafter oder beeinträchtigter Sprache führte.

Die Kerninnovation von Lyra liegt in seinem hybriden Ansatz, der traditionelle Codec-Techniken mit fortschrittlichem maschinellem Lernen kombiniert. Der Codec extrahiert alle 40 Millisekunden charakteristische Sprachmerkmale, sogenannte Features. Diese Features, die als log-mel-Spektrogramme dargestellt werden, werden dann für die Übertragung komprimiert. Am Empfänger rekonstruiert ein generatives Modell, inspiriert von Modellen wie DeepMinds WaveNet, das Sprachsignal anhand dieser komprimierten Features. Diese Methode ermöglicht es Lyra, die für parametrische Codecs charakteristischen niedrigen Bitraten zu erreichen und gleichzeitig eine Audioqualität zu liefern, die mit modernsten Wellenform-Codecs vergleichbar ist.

Im Gegensatz zu herkömmlichen Wellenform-Codecs, die Audio Sample für Sample komprimieren und höhere Bitraten erfordern, ist Lyras generativer Ansatz effizienter. Ein Hauptanliegen bei generativen Modellen ist die Rechenkomplexität, aber Lyra mildert dies durch den Einsatz eines kostengünstigen rekurrenten generativen Modells, einer Variante von WaveRNN. Dieses Modell arbeitet mit einer niedrigeren Rate, generiert aber mehrere Signale parallel über verschiedene Frequenzbereiche, die dann zu einem einzigen Ausgabesignal kombiniert werden. Diese Optimierung ermöglicht es Lyra, nicht nur auf Cloud-Servern, sondern auch in Echtzeit auf mittelklasse Mobilgeräten mit einer Verarbeitungs­latenz von 90 ms zu funktionieren, was den Industriestandards entspricht.

Lyra ist darauf ausgelegt, mit einer Ziel­bitrate von 3 kbps zu arbeiten und übertrifft bestehende Codecs auf diesem Niveau deutlich. Hörtests zeigen, dass Lyra im Vergleich zu Opus bei 8 kbps gut abschneidet, was einer Bandbreitenreduzierung von über 60 % entspricht. Dies macht Lyra zu einer idealen Lösung für Umgebungen, in denen die Bandbreite für Codecs mit höherer Bitrate nicht ausreicht oder in denen bestehende Optionen mit niedriger Bitrate keine ausreichende Qualität liefern. Der Codec wurde auf Tausenden von Stunden an Sprachdaten in über 70 Sprachen trainiert, um Robustheit und Fairness für eine globale Nutzerbasis zu gewährleisten. Google rollt Lyra aktiv in seine Produkte wie Duo aus, um die Audio­anruf­qualität und -zuverlässigkeit bei Verbindungen mit geringer Bandbreite zu verbessern, und forscht kontinuierlich an weiterer Leistungs­optimierung und Erweiterung auf Anwendungsfälle für Nicht-Sprach­audio.

Lyra Speech Codec im Überblick

  • Hochwertige Sprachkompression bei sehr niedrigen Bitraten

  • Nutzt maschinelles Lernen und generative Modelle zur Sprachrekonstruktion

  • Betrieb bei einer Ziel­bitrate von 3 kbps

  • Erreicht eine Bandbreitenreduzierung von über 60 % im Vergleich zu Opus bei 8 kbps

  • Echtzeit­leistung auf mittelklasse Mobilgeräten

  • Verarbeitungs­latenz von 90 ms

  • Trainiert auf Tausenden von Stunden an Sprachdaten in über 70 Sprachen

  • Hybrider Ansatz, der traditionelle Codec-Techniken mit ML kombiniert

  • Verwendet eine kostengünstige WaveRNN-Variante für die generative Modellierung

  • Ermöglicht Sprachkommunikation in langsamen und überlasteten Netzwerken

  • Entwickelt für effiziente Datenübertragung und Speicherung von Sprachsignalen

Erste Schritte mit Lyra Speech Codec

  1. Modell zugreifen: Integrieren Sie Lyra in Ihre Anwendung oder Ihren Dienst.

  2. Umgebung einrichten: Stellen Sie sicher, dass die erforderlichen Rechenressourcen verfügbar sind.

  3. Integration über API: Nutzen Sie die Lyra API zum Kodieren und Dekodieren von Sprachsignalen.

  4. Optimieren: Feinabstimmen Sie Parameter für spezifische Netzwerkbedingungen und gewünschte Qualitätsstufen.

Lyra Speech Codec's Anwendungsfälle

  • Kommunikation mit geringer Bandbreite
  • Mobile Sprachanrufe
  • Schwellenländer
  • Echtzeit­zusammenarbeit
  • VoIP-Anwendungen
  • Videokonferenzen

FAQ von Lyra Speech Codec

Lyra Speech Codec Bewertungen

Wird geladen...

Beliebte KI-Tools wie Lyra Speech Codec

KI-Modelle

AudioLM ist ein KI-Modell, das hochwertige Audiodaten mit langfristiger Konsistenz generiert. Es behandelt die Audiogenerierung als Sprachmodellierungsaufgabe und bildet Audio auf…

KI-Modelle & LLMs

KI-Modelle

SoundStorm ist ein KI-Modell für effiziente, nicht-autoregressive Audioerzeugung. Es erzeugt qualitativ hochwertiges Audio, das um zwei Größenordnungen schneller ist als bisherige…

KI-Modelle & LLMs

KI-Modelle

Wav2vec 2.0 ist ein Algorithmus für selbstüberwachtes Lernen zur automatischen Spracherkennung. Er lernt aus Rohaudio und benötigt nur minimale transkribierte Daten, um eine hohe…

KI-Modelle & LLMs

Funnel-Transformer ist ein KI-Modell, das Hidden States komprimiert, um die Rechenkosten zu senken. Es ermöglicht tiefere oder breitere Modelle bei gleichen FLOPs und kann…

KI-Modelle & LLMs

KI-Modelle

Voicebox ist ein generatives KI-Modell für Sprache, das über mehrere Aufgaben hinweg mit Spitzenleistung generalisiert. Es kann Sprache synthetisieren, Rauschen entfernen, Inhalte…

KI-Stimmengeneratoren

KI-Modelle

ESPnet ist ein Open-Source-Toolkit für die End-to-End-Sprachverarbeitung. Es bietet umfassende Rezepte und Tools für Aufgaben wie automatische Spracherkennung (ASR),…

Machine-Learning-Plattformen

KI-Modelle

FastSpeech 2 ist ein End-to-End-Text-to-Speech-Modell, das die Sprachqualität und Trainingsgeschwindigkeit verbessert. Es integriert direkt Informationen zur Sprachvariation wie…

KI-Modelle & LLMs

KI-Modelle

Dieses Repository bietet eine PyTorch-Implementierung von MADE (Masked Autoencoder Density Estimation). Es ermöglicht die Umwandlung von Autoencodern in autoregressive…

KI-Modelle & LLMs