Descrição
Whisper como Serviço (WAAS) é um projeto de código aberto que oferece uma solução robusta para transcrição de áudio, aproveitando o modelo Whisper da OpenAI. Ele fornece tanto uma interface gráfica do usuário (GUI) para upload direto de arquivos quanto uma API para integração programática, tornando-o versátil para diversos casos de uso.
A funcionalidade principal do WAAS gira em torno de seu sistema de filas, que permite o processamento assíncrono de trabalhos de transcrição. Os usuários podem fazer upload de arquivos de áudio ou vídeo através da GUI e, após a conclusão, receber links de download para o texto transcrito em vários formatos como SRT, TXT ou JSON por e-mail. A GUI também inclui um editor no navegador para ajuste fino de transcrições, aprimorando a precisão.
Para desenvolvedores, a API do WAAS oferece endpoints para submeter novos trabalhos de transcrição, detectar o idioma do áudio e recuperar o status e os resultados do trabalho. A API suporta callbacks por e-mail ou notificações webhook, permitindo que as aplicações sejam notificadas quando uma transcrição estiver pronta. Essa natureza assíncrona é crucial para lidar com grandes volumes de dados de áudio de forma eficiente.
O WAAS foi projetado para ser facilmente implantável usando Docker Compose, com opções para aceleração de GPU para processamento mais rápido. O projeto é compatível com Python 3.8-3.10 e adere aos requisitos do OpenAI Whisper. Diretrizes de contribuição e instruções de instalação são fornecidas, incentivando o envolvimento e a personalização da comunidade.
A arquitetura do projeto inclui uma fila Redis e um worker de API, garantindo que as tarefas de transcrição sejam gerenciadas de forma eficaz. Recursos de segurança, como verificação de assinatura de webhook, também são implementados para garantir a integridade dos dados. O WAAS é uma ferramenta valiosa para quem precisa integrar capacidades avançadas de fala para texto em seus fluxos de trabalho ou aplicações.
Recursos principais de Whisper como Serviço
GUI para upload de arquivos de áudio e transcrição
API para submissão programática de trabalhos de transcrição
Processamento assíncrono de trabalhos com filas
Notificações por e-mail com links de download
Editor no navegador para correção de transcrições
Suporte a múltiplos formatos de saída (SRT, TXT, JSON)
Integração com Webhook para notificações em tempo real
Detecção de idioma para arquivos de áudio
Aceleração opcional de GPU para processamento mais rápido
Docker Compose para implantação fácil
Verificação de assinatura de webhook para segurança
Primeiros passos com Whisper como Serviço
Clonar: Clone o repositório WAAS do GitHub.
Instalar: Configure um ambiente virtual Python e instale as dependências usando pip.
Configurar: Crie um arquivo .envrc com as chaves de API e configurações de e-mail necessárias.
Executar: Execute a aplicação usando Docker Compose para uma configuração completa.
Integrar: Use os endpoints da API fornecidos para submeter trabalhos de transcrição.
Receber: Configure callbacks por e-mail ou webhooks para notificações de conclusão do trabalho.
Casos de uso de Whisper como Serviço
- Transcrição Automatizada
- Atas de Reunião
- Produção de Podcast
- Legendas de Vídeo
- Ferramentas para Desenvolvedores
- Aprendizado de Idiomas
- Recursos de Acessibilidade





