Descripción
Whisper as a Service (WAAS) es un proyecto de código abierto que ofrece una solución robusta para la transcripción de audio aprovechando el modelo Whisper de OpenAI. Proporciona tanto una interfaz gráfica de usuario (GUI) para cargas de archivos directas como una API para la integración programática, lo que la hace versátil para diversos casos de uso.
La funcionalidad principal de WAAS gira en torno a su sistema de colas, que permite el procesamiento asíncrono de trabajos de transcripción. Los usuarios pueden cargar archivos de audio o video a través de la GUI y, al finalizar, recibir enlaces de descarga para el texto transcrito en varios formatos como SRT, TXT o JSON por correo electrónico. La GUI también incluye un editor en el navegador para ajustar las transcripciones, mejorando la precisión.
Para los desarrolladores, la API de WAAS ofrece endpoints para enviar nuevos trabajos de transcripción, detectar el idioma del audio y recuperar el estado y los resultados del trabajo. La API soporta callbacks por correo electrónico o notificaciones webhook, permitiendo que las aplicaciones sean notificadas cuando una transcripción esté lista. Esta naturaleza asíncrona es crucial para manejar grandes volúmenes de datos de audio de manera eficiente.
WAAS está diseñado para ser fácilmente desplegable usando Docker Compose, con opciones para aceleración por GPU para un procesamiento más rápido. El proyecto es compatible con Python 3.8-3.10 y cumple con los requisitos de OpenAI Whisper. Se proporcionan directrices de contribución e instrucciones de instalación, fomentando la participación y personalización de la comunidad.
La arquitectura del proyecto incluye una cola Redis y un worker de API, asegurando que las tareas de transcripción se gestionen de manera efectiva. También se implementan funciones de seguridad, como la verificación de firmas de webhook, para garantizar la integridad de los datos. WAAS es una herramienta valiosa para cualquiera que necesite integrar capacidades avanzadas de voz a texto en sus flujos de trabajo o aplicaciones.
Características principales de Whisper as a Service
GUI para carga y transcripción de archivos de audio
API para envío programático de trabajos de transcripción
Procesamiento asíncrono de trabajos con colas
Notificaciones por correo electrónico con enlaces de descarga
Editor en el navegador para corrección de transcripciones
Soporte para múltiples formatos de salida (SRT, TXT, JSON)
Integración de Webhook para notificaciones en tiempo real
Detección de idioma para archivos de audio
Aceleración opcional por GPU para procesamiento más rápido
Docker Compose para fácil despliegue
Verificación de firma de Webhook para seguridad
Primeros pasos con Whisper as a Service
Clonar: Clona el repositorio de WAAS desde GitHub.
Instalar: Configura un entorno virtual de Python e instala las dependencias usando pip.
Configurar: Crea un archivo .envrc con las claves API necesarias y la configuración de correo electrónico.
Ejecutar: Ejecuta la aplicación usando Docker Compose para una configuración completa.
Integrar: Utiliza los endpoints de la API proporcionados para enviar trabajos de transcripción.
Recibir: Configura callbacks por correo electrónico o webhooks para notificaciones de finalización de trabajos.
Casos de uso de Whisper as a Service
- Transcripción Automatizada
- Actas de Reuniones
- Producción de Podcasts
- Subtitulado de Videos
- Herramientas para Desarrolladores
- Aprendizaje de Idiomas
- Funciones de Accesibilidad





