Descripción
Lyra es un códec de compresión de voz revolucionario diseñado para ofrecer comunicación de voz de alta calidad incluso en las condiciones de red más restrictivas. Desarrollado por Google, Lyra aborda el desafío de larga data de mantener la inteligibilidad y naturalidad del audio a tasas de bits extremadamente bajas, una hazaña que históricamente ha resultado en voz robótica o degradada.
La innovación central de Lyra reside en su enfoque híbrido, que combina técnicas de códec tradicionales con aprendizaje automático avanzado. El códec extrae atributos distintivos del habla, conocidos como características, cada 40 milisegundos. Estas características, representadas como espectrogramas mel logarítmicos, se comprimen para su transmisión. En el extremo receptor, un modelo generativo, inspirado en modelos como WaveNet de DeepMind, reconstruye la señal de voz utilizando estas características comprimidas. Este método permite a Lyra lograr las bajas tasas de bits características de los códecs paramétricos, al tiempo que ofrece una calidad de audio comparable a la de los códecs de forma de onda de última generación.
A diferencia de los códecs de forma de onda tradicionales que comprimen el audio muestra a muestra, requiriendo tasas de bits más altas, el enfoque generativo de Lyra es más eficiente. Una preocupación clave con los modelos generativos es la complejidad computacional, pero Lyra la mitiga empleando un modelo generativo recurrente rentable, una variación de WaveRNN. Este modelo opera a una tasa más baja pero genera múltiples señales en paralelo en diferentes rangos de frecuencia, que luego se combinan en una única señal de salida. Esta optimización permite que Lyra funcione no solo en servidores en la nube, sino también en tiempo real en dispositivos móviles de gama media, con una latencia de procesamiento de 90 ms, alineándose con los estándares de la industria.
Lyra está diseñado para operar a una tasa de bits objetivo de 3 kbps, superando significativamente a los códecs existentes en este nivel. Las pruebas de escucha indican que Lyra se compara favorablemente con Opus a 8 kbps, lo que representa una reducción del ancho de banda de más del 60%. Esto convierte a Lyra en una solución ideal para entornos donde el ancho de banda es insuficiente para códecs de mayor tasa de bits o donde las opciones de baja tasa de bits existentes no proporcionan una calidad adecuada. El códec ha sido entrenado con miles de horas de datos de voz en más de 70 idiomas, asegurando robustez y equidad para una base de usuarios global. Google está implementando activamente Lyra en sus productos, como Duo, para mejorar la calidad y confiabilidad de las llamadas de voz en conexiones de bajo ancho de banda, con investigación en curso para una mayor optimización del rendimiento y expansión a casos de uso de audio no de voz.
Aspectos destacados de Lyra Speech Codec
Compresión de voz de alta calidad a tasas de bits muy bajas
Aprovecha el aprendizaje automático y los modelos generativos para la reconstrucción de voz
Opera a una tasa de bits objetivo de 3 kbps
Logra una reducción del ancho de banda de más del 60% en comparación con Opus a 8 kbps
Rendimiento en tiempo real en dispositivos móviles de gama media
Latencia de procesamiento de 90 ms
Entrenado con miles de horas de datos de voz en más de 70 idiomas
Enfoque híbrido que combina técnicas de códec tradicionales con ML
Utiliza una variación rentable de WaveRNN para modelado generativo
Permite la comunicación de voz en redes lentas y congestionadas
Diseñado para la transmisión y almacenamiento eficientes de datos de señales de voz
Primeros pasos con Lyra Speech Codec
Acceder al modelo: Integre Lyra en su aplicación o servicio.
Configurar el entorno: Asegúrese de que los recursos computacionales necesarios estén disponibles.
Integrar a través de API: Utilice la API de Lyra para codificar y decodificar señales de voz.
Optimizar: Ajuste los parámetros para condiciones de red específicas y niveles de calidad deseados.
Casos de uso de Lyra Speech Codec
- Comunicación de bajo ancho de banda
- Llamadas de voz móviles
- Mercados emergentes
- Colaboración en tiempo real
- Aplicaciones VoIP
- Videoconferencias




