Описание
OpenAI Whisper — это сложная предобученная модель, предназначенная для автоматического распознавания речи (ASR) и перевода речи. Разработанная компанией OpenAI, Whisper основана на архитектуре трансформера с кодировщиком и декодировщиком, также известной как модель последовательность-в-последовательность. Она была обучена на обширном наборе данных, содержащем 680 000 часов размеченных речевых данных с использованием крупномасштабного слабого контроля. Это обучение позволяет Whisper эффективно обобщать на различных наборах данных и в различных областях без необходимости дообучения.
Модели Whisper доступны в пяти конфигурациях, каждая из которых отличается размером и возможностями. Более мелкие модели обучены как на данных только на английском, так и на многоязычных данных, в то время как самые большие модели являются исключительно многоязычными. Эти модели доступны на платформе Hugging Face Hub, что обеспечивает гибкость для различных задач ASR и перевода. Whisper может транскрибировать аудиофайлы и переводить речь с одного языка на другой, что делает её универсальным инструментом для разработчиков и исследователей.
Модель использует контекстные токены для определения задачи и языка для транскрипции или перевода. Эти токены направляют модель в предсказании выходного языка и задачи, позволяя контролировать или автоматически делать предсказания. Возможности Whisper распространяются на транскрипцию длинных форм с помощью алгоритма разбиения, что позволяет ей обрабатывать аудиофайлы произвольной длины.
Хотя Whisper демонстрирует высокую производительность в ASR и переводе, у неё есть ограничения. Точность модели может варьироваться в зависимости от языков, особенно тех, для которых имеется меньше обучающих данных. Кроме того, она может генерировать галлюцинации, когда выходной текст включает в себя информацию, отсутствующую в аудиовходе. Несмотря на эти проблемы, устойчивость Whisper к акцентам, фоновому шуму и техническому языку делает её ценным инструментом для повышения доступности и разработки решений ASR.
Главное о Модель OpenAI Whisper
Предобучена на 680 тыс. часов данных
Поддерживает автоматическое распознавание речи
Обеспечивает перевод речи
Модель на основе трансформера с кодировщиком и декодировщиком
Доступна в пяти размерах моделей
Обрабатывает многоязычные и задачи только на английском
Контекстные токены для управления задачами и языком
Транскрипция длинных форм с помощью разбиения
Начало работы с Модель OpenAI Whisper
Доступ к странице: посетите страницу модели Hugging Face
Загрузите модель: скачайте модель Whisper с Hub
Настройте окружение: настройте WhisperProcessor
Интеграция: используйте контекстные токены для задач
Дообучение: улучшите производительность с помощью размеченных данных
Варианты использования Модель OpenAI Whisper
- Распознавание речи
- Перевод речи
- Многоязычное ASR
- Инструменты доступности
- Исследования и разработки












