Описание
Lyra — это новаторский кодек для сжатия речи, разработанный для обеспечения высококачественной голосовой связи даже в самых ограниченных сетевых условиях. Разработанный Google, Lyra решает давнюю проблему поддержания разборчивости и естественности речи при чрезвычайно низких битрейтах, что исторически приводило к роботизированной или искаженной речи.
Основная инновация Lyra заключается в его гибридном подходе, сочетающем традиционные методы кодирования с передовым машинным обучением. Кодек извлекает отличительные речевые атрибуты, известные как признаки, каждые 40 миллисекунд. Эти признаки, представленные в виде лог-мел-спектрограмм, затем сжимаются для передачи. На принимающей стороне генеративная модель, вдохновленная такими моделями, как WaveNet от DeepMind, восстанавливает речевой сигнал, используя эти сжатые признаки. Этот метод позволяет Lyra достигать низких битрейтов, характерных для параметрических кодеков, при этом обеспечивая качество звука, сравнимое с передовыми волновыми кодеками.
В отличие от традиционных волновых кодеков, которые сжимают аудио по выборке, требуя более высоких битрейтов, генеративный подход Lyra более эффективен. Ключевой проблемой генеративных моделей является вычислительная сложность, но Lyra смягчает ее, используя экономичную рекуррентную генеративную модель, вариант WaveRNN. Эта модель работает с более низкой частотой, но параллельно генерирует несколько сигналов в различных частотных диапазонах, которые затем объединяются в один выходной сигнал. Эта оптимизация позволяет Lyra работать не только на облачных серверах, но и в режиме реального времени на мобильных устройствах среднего класса с задержкой обработки 90 мс, что соответствует отраслевым стандартам.
Lyra разработан для работы с целевым битрейтом 3 кбит/с, что значительно превосходит существующие кодеки на этом уровне. Прослушивание показывает, что Lyra выгодно отличается от Opus при 8 кбит/с, представляя собой снижение пропускной способности более чем на 60%. Это делает Lyra идеальным решением для сред, где пропускная способность недостаточна для кодеков с более высоким битрейтом или где существующие варианты с низким битрейтом не обеспечивают достаточного качества. Кодек был обучен на тысячах часов речевых данных более чем на 70 языках, что обеспечивает надежность и справедливость для глобальной пользовательской базы. Google активно внедряет Lyra в свои продукты, такие как Duo, для повышения качества и надежности аудиозвонков при низкоскоростных соединениях, при этом проводятся исследования по дальнейшей оптимизации производительности и расширению применения на неречевые аудиосценарии.
Главное о Lyra Speech Codec
Высококачественное сжатие речи при очень низких битрейтах
Использует машинное обучение и генеративные модели для восстановления речи
Работает с целевым битрейтом 3 кбит/с
Обеспечивает снижение пропускной способности более чем на 60% по сравнению с Opus при 8 кбит/с
Производительность в реальном времени на мобильных устройствах среднего класса
Задержка обработки 90 мс
Обучен на тысячах часов речевых данных более чем на 70 языках
Гибридный подход, сочетающий традиционные методы кодирования с машинным обучением
Использует экономичный вариант WaveRNN для генеративного моделирования
Обеспечивает голосовую связь в медленных и перегруженных сетях
Разработан для эффективной передачи данных и хранения голосовых сигналов
Начало работы с Lyra Speech Codec
Доступ к модели: Интегрируйте Lyra в ваше приложение или сервис.
Настройка среды: Убедитесь, что доступны необходимые вычислительные ресурсы.
Интеграция через API: Используйте API Lyra для кодирования и декодирования речевых сигналов.
Оптимизация: Настройте параметры для конкретных сетевых условий и желаемых уровней качества.
Варианты использования Lyra Speech Codec
- Связь с низкой пропускной способностью
- Мобильные голосовые вызовы
- Развивающиеся рынки
- Совместная работа в реальном времени
- VoIP-приложения
- Видеоконференции




