Перейти к основному содержимому
ToolPotion

Lyra Speech Codec

Lyra — это новая разработка Google, представляющая собой кодек для речи с очень низким битрейтом. Он использует машинное обучение для сжатия голосовых сигналов, обеспечивая высокое качество аудиосвязи даже в самых медленных сетях. Lyra достигает этого за счет использования генеративных моделей для восстановления речи из извлеченных признаков, что обеспечивает значительное снижение пропускной способности по сравнению с традиционными кодеками.

Посетить URL

Описание

Lyra — это новаторский кодек для сжатия речи, разработанный для обеспечения высококачественной голосовой связи даже в самых ограниченных сетевых условиях. Разработанный Google, Lyra решает давнюю проблему поддержания разборчивости и естественности речи при чрезвычайно низких битрейтах, что исторически приводило к роботизированной или искаженной речи.

Основная инновация Lyra заключается в его гибридном подходе, сочетающем традиционные методы кодирования с передовым машинным обучением. Кодек извлекает отличительные речевые атрибуты, известные как признаки, каждые 40 миллисекунд. Эти признаки, представленные в виде лог-мел-спектрограмм, затем сжимаются для передачи. На принимающей стороне генеративная модель, вдохновленная такими моделями, как WaveNet от DeepMind, восстанавливает речевой сигнал, используя эти сжатые признаки. Этот метод позволяет Lyra достигать низких битрейтов, характерных для параметрических кодеков, при этом обеспечивая качество звука, сравнимое с передовыми волновыми кодеками.

В отличие от традиционных волновых кодеков, которые сжимают аудио по выборке, требуя более высоких битрейтов, генеративный подход Lyra более эффективен. Ключевой проблемой генеративных моделей является вычислительная сложность, но Lyra смягчает ее, используя экономичную рекуррентную генеративную модель, вариант WaveRNN. Эта модель работает с более низкой частотой, но параллельно генерирует несколько сигналов в различных частотных диапазонах, которые затем объединяются в один выходной сигнал. Эта оптимизация позволяет Lyra работать не только на облачных серверах, но и в режиме реального времени на мобильных устройствах среднего класса с задержкой обработки 90 мс, что соответствует отраслевым стандартам.

Lyra разработан для работы с целевым битрейтом 3 кбит/с, что значительно превосходит существующие кодеки на этом уровне. Прослушивание показывает, что Lyra выгодно отличается от Opus при 8 кбит/с, представляя собой снижение пропускной способности более чем на 60%. Это делает Lyra идеальным решением для сред, где пропускная способность недостаточна для кодеков с более высоким битрейтом или где существующие варианты с низким битрейтом не обеспечивают достаточного качества. Кодек был обучен на тысячах часов речевых данных более чем на 70 языках, что обеспечивает надежность и справедливость для глобальной пользовательской базы. Google активно внедряет Lyra в свои продукты, такие как Duo, для повышения качества и надежности аудиозвонков при низкоскоростных соединениях, при этом проводятся исследования по дальнейшей оптимизации производительности и расширению применения на неречевые аудиосценарии.

Главное о Lyra Speech Codec

  • Высококачественное сжатие речи при очень низких битрейтах

  • Использует машинное обучение и генеративные модели для восстановления речи

  • Работает с целевым битрейтом 3 кбит/с

  • Обеспечивает снижение пропускной способности более чем на 60% по сравнению с Opus при 8 кбит/с

  • Производительность в реальном времени на мобильных устройствах среднего класса

  • Задержка обработки 90 мс

  • Обучен на тысячах часов речевых данных более чем на 70 языках

  • Гибридный подход, сочетающий традиционные методы кодирования с машинным обучением

  • Использует экономичный вариант WaveRNN для генеративного моделирования

  • Обеспечивает голосовую связь в медленных и перегруженных сетях

  • Разработан для эффективной передачи данных и хранения голосовых сигналов

Начало работы с Lyra Speech Codec

  1. Доступ к модели: Интегрируйте Lyra в ваше приложение или сервис.

  2. Настройка среды: Убедитесь, что доступны необходимые вычислительные ресурсы.

  3. Интеграция через API: Используйте API Lyra для кодирования и декодирования речевых сигналов.

  4. Оптимизация: Настройте параметры для конкретных сетевых условий и желаемых уровней качества.

Варианты использования Lyra Speech Codec

  • Связь с низкой пропускной способностью
  • Мобильные голосовые вызовы
  • Развивающиеся рынки
  • Совместная работа в реальном времени
  • VoIP-приложения
  • Видеоконференции

Часто задаваемые вопросы Lyra Speech Codec

Отзывы о Lyra Speech Codec

Загрузка...

Популярные ИИ-инструменты, похожие на Lyra Speech Codec

AI-модели

AudioLM — это ИИ-модель, которая генерирует высококачественный звук с долгосрочной согласованностью. Она рассматривает генерацию звука как задачу языкового моделирования,…

ИИ-модели и LLM

AI-модели

SoundStorm — это ИИ-модель для эффективной неавторегрессивной генерации аудио. Она производит высококачественное аудио в два раза быстрее предыдущих методов, сохраняя…

ИИ-модели и LLM

AI-модели

Wav2vec 2.0 — это алгоритм самообучения для автоматического распознавания речи. Он обучается на необработанных аудиоданных, требуя минимального количества транскрибированных…

ИИ-модели и LLM

AI-модели

Funnel-Transformer — это ИИ-модель, которая сжимает скрытые состояния для снижения вычислительных затрат. Она позволяет создавать более глубокие или широкие модели при том же…

ИИ-модели и LLM

AI-модели

Voicebox — это генеративная модель ИИ для речи, которая обобщает данные для множества задач с производительностью на уровне передовых решений. Она может синтезировать речь,…

ИИ-генераторы голоса

AI-модели

ESPnet — это открытый набор инструментов для комплексной обработки речи. Он предоставляет исчерпывающие рецепты и инструменты для таких задач, как автоматическое распознавание…

Платформы машинного обучения

AI-модели

FastSpeech 2 — это сквозная модель преобразования текста в речь, которая улучшает качество голоса и скорость обучения. Она напрямую включает информацию о вариативности речи, такую…

ИИ-модели и LLM

AI-модели

Этот репозиторий предоставляет реализацию MADE (Masked Autoencoder Density Estimation) на PyTorch. Он позволяет превращать автокодировщики в авторегрессионные модели плотности…

ИИ-модели и LLM