Descrição
Lyra é um codec de compressão de voz inovador projetado para oferecer comunicação de voz de alta qualidade mesmo nas condições de rede mais restritas. Desenvolvido pelo Google, Lyra aborda o desafio de longa data de manter a inteligibilidade e a naturalidade do áudio em taxas de bits extremamente baixas, um feito que historicamente resultou em voz robótica ou degradada.
A inovação central do Lyra reside em sua abordagem híbrida, combinando técnicas de codec tradicionais com aprendizado de máquina avançado. O codec extrai atributos distintos de voz, conhecidos como características, a cada 40 milissegundos. Essas características, representadas como espectrogramas mel logarítmicos, são então comprimidas para transmissão. No lado receptor, um modelo generativo, inspirado em modelos como o WaveNet do DeepMind, reconstrói o sinal de voz usando essas características comprimidas. Este método permite que Lyra atinja as baixas taxas de bits características de codecs paramétricos, ao mesmo tempo que oferece qualidade de áudio comparável a codecs de forma de onda de ponta.
Ao contrário dos codecs de forma de onda tradicionais que comprimem áudio amostra por amostra, exigindo taxas de bits mais altas, a abordagem generativa do Lyra é mais eficiente. Uma preocupação chave com modelos generativos é a complexidade computacional, mas Lyra a mitiga empregando um modelo generativo recorrente de baixo custo, uma variação do WaveRNN. Este modelo opera em uma taxa mais baixa, mas gera múltiplos sinais em paralelo em diferentes faixas de frequência, que são então combinados em um único sinal de saída. Essa otimização permite que Lyra funcione não apenas em servidores em nuvem, mas também em tempo real em dispositivos móveis de médio porte, com uma latência de processamento de 90ms, alinhando-se com os padrões da indústria.
Lyra é projetado para operar em uma taxa de bits alvo de 3kbps, superando significativamente os codecs existentes nesse nível. Testes de audição indicam que Lyra é comparado favoravelmente ao Opus a 8kbps, representando uma redução de largura de banda de mais de 60%. Isso torna Lyra uma solução ideal para ambientes onde a largura de banda é insuficiente para codecs de taxa de bits mais alta ou onde as opções de taxa de bits baixa existentes não fornecem qualidade adequada. O codec foi treinado em milhares de horas de dados de voz em mais de 70 idiomas, garantindo robustez e justiça para uma base de usuários global. O Google está implementando ativamente Lyra em seus produtos, como o Duo, para aprimorar a qualidade e a confiabilidade das chamadas de voz em conexões de baixa largura de banda, com pesquisas contínuas para otimização de desempenho e expansão para casos de uso de áudio não vocal.
Destaques de Lyra Speech Codec
Compressão de voz de alta qualidade em taxas de bits muito baixas
Utiliza aprendizado de máquina e modelos generativos para reconstrução de voz
Opera em uma taxa de bits alvo de 3kbps
Alcança redução de largura de banda de mais de 60% em comparação com Opus a 8kbps
Desempenho em tempo real em dispositivos móveis de médio porte
Latência de processamento de 90ms
Treinado em milhares de horas de dados de voz em mais de 70 idiomas
Abordagem híbrida combinando técnicas de codec tradicionais com ML
Usa uma variação WaveRNN de baixo custo para modelagem generativa
Permite comunicação de voz em redes lentas e congestionadas
Projetado para transmissão e armazenamento eficientes de sinais de voz
Primeiros passos com Lyra Speech Codec
Acessar modelo: Integre Lyra em sua aplicação ou serviço.
Configurar ambiente: Garanta que os recursos computacionais necessários estejam disponíveis.
Integrar via API: Utilize a API Lyra para codificar e decodificar sinais de voz.
Otimizar: Ajuste os parâmetros para condições de rede específicas e níveis de qualidade desejados.
Casos de uso de Lyra Speech Codec
- Comunicação de baixa largura de banda
- Chamadas de voz móveis
- Mercados emergentes
- Colaboração em tempo real
- Aplicações VoIP
- Videoconferência




