Description
Whisper as a Service (WAAS) est un projet open-source qui offre une solution robuste pour la transcription audio en exploitant le modèle Whisper d'OpenAI. Il fournit à la fois une interface utilisateur graphique (GUI) pour le téléchargement direct de fichiers et une API pour l'intégration programmatique, ce qui le rend polyvalent pour divers cas d'utilisation.
La fonctionnalité principale de WAAS tourne autour de son système de mise en file d'attente, qui permet le traitement asynchrone des tâches de transcription. Les utilisateurs peuvent télécharger des fichiers audio ou vidéo via la GUI, et une fois terminé, recevoir des liens de téléchargement pour le texte transcrit dans divers formats comme SRT, TXT ou JSON par e-mail. La GUI comprend également un éditeur dans le navigateur pour affiner les transcriptions, améliorant ainsi la précision.
Pour les développeurs, l'API WAAS offre des points d'accès pour soumettre de nouvelles tâches de transcription, détecter la langue audio et récupérer le statut et les résultats des tâches. L'API prend en charge les rappels par e-mail ou les notifications webhook, permettant aux applications d'être informées lorsque la transcription est prête. Cette nature asynchrone est cruciale pour gérer efficacement de grands volumes de données audio.
WAAS est conçu pour être facilement déployable à l'aide de Docker Compose, avec des options d'accélération GPU pour un traitement plus rapide. Le projet est compatible avec Python 3.8-3.10 et respecte les exigences d'OpenAI Whisper. Des directives de contribution et des instructions d'installation sont fournies, encourageant l'implication et la personnalisation de la communauté.
L'architecture du projet comprend une file d'attente Redis et un worker API, garantissant que les tâches de transcription sont gérées efficacement. Des fonctionnalités de sécurité, telles que la vérification de la signature des webhooks, sont également implémentées pour assurer l'intégrité des données. WAAS est un outil précieux pour quiconque a besoin d'intégrer des capacités avancées de reconnaissance vocale dans ses flux de travail ou ses applications.
Fonctionnalités principales de Whisper as a Service
GUI pour le téléchargement et la transcription de fichiers audio
API pour la soumission programmatique de tâches de transcription
Traitement asynchrone des tâches avec mise en file d'attente
Notifications par e-mail avec liens de téléchargement
Éditeur dans le navigateur pour la correction des transcriptions
Prise en charge de plusieurs formats de sortie (SRT, TXT, JSON)
Intégration de Webhook pour les notifications en temps réel
Détection de langue pour les fichiers audio
Accélération GPU optionnelle pour un traitement plus rapide
Docker Compose pour un déploiement facile
Vérification de la signature des Webhooks pour la sécurité
Premiers pas avec Whisper as a Service
Cloner : Clonez le dépôt WAAS depuis GitHub.
Installer : Configurez un environnement virtuel Python et installez les dépendances à l'aide de pip.
Configurer : Créez un fichier .envrc avec les clés API et les paramètres d'e-mail nécessaires.
Exécuter : Lancez l'application à l'aide de Docker Compose pour une configuration complète.
Intégrer : Utilisez les points d'accès API fournis pour soumettre des tâches de transcription.
Recevoir : Configurez des rappels par e-mail ou des webhooks pour les notifications d'achèvement des tâches.
Cas d'utilisation de Whisper as a Service
- Transcription Automatisée
- Compte-rendu de Réunion
- Production de Podcasts
- Sous-titrage Vidéo
- Outils pour Développeurs
- Apprentissage des Langues
- Fonctionnalités d'Accessibilité





