Deskripsi
Whisper adalah model pengenalan ucapan sumber terbuka yang kuat yang dikembangkan oleh OpenAI, dibangun di atas pengawasan lemah berskala besar. Model ini berfungsi sebagai model multitasking serbaguna yang mampu melakukan pengenalan ucapan multibahasa, terjemahan ucapan, dan identifikasi bahasa. Pendekatan terpadu ini memungkinkan satu model sequence-to-sequence Transformer untuk menangani tugas-tugas yang secara tradisional memerlukan beberapa tahapan yang berbeda.
Model ini dilatih pada kumpulan data audio yang luas dan beragam, memungkinkannya untuk memproses berbagai pola ucapan dan bahasa secara efektif. Arsitekturnya secara bersamaan merepresentasikan berbagai tugas pemrosesan ucapan sebagai urutan token, yang diprediksi oleh decoder. Desain ini menyederhanakan pipeline pemrosesan ucapan secara signifikan.
Whisper menawarkan berbagai ukuran model, termasuk varian khusus bahasa Inggris, yang memberikan keseimbangan antara kecepatan dan akurasi. Model-model ini cocok untuk persyaratan perangkat keras dan kinerja yang berbeda. Proyek ini menyediakan instruksi yang jelas untuk penyiapan dan penggunaan, termasuk instalasi paket Python dan dependensi sistem yang diperlukan seperti ffmpeg. Antarmuka baris perintah dan API Python tersedia untuk integrasi yang mudah ke dalam berbagai alur kerja.
Bagi pengembang dan peneliti, Whisper menawarkan fleksibilitas dalam cara penggunaannya. Baik mentranskripsi file audio secara langsung melalui baris perintah atau mengintegrasikan kemampuannya ke dalam aplikasi Python, model ini dirancang untuk aksesibilitas. Proyek ini juga mendorong kontribusi komunitas dan berbagi contoh melalui diskusi GitHub-nya.
Kemampuan utama meliputi transkripsi akurat di berbagai bahasa, terjemahan ucapan ke dalam bahasa Inggris, dan identifikasi bahasa yang diucapkan. Ketersediaan berbagai ukuran model, dari 'tiny' hingga 'large', memungkinkan pengguna untuk memilih yang paling sesuai dengan kebutuhan spesifik mereka, menyeimbangkan sumber daya komputasi dengan akurasi yang diinginkan. Model 'turbo' menawarkan kecepatan transkripsi yang dioptimalkan dan lebih cepat dengan kompromi akurasi minimal.
Proyek ini dirilis di bawah Lisensi MIT, membuatnya tersedia secara gratis untuk penggunaan penelitian dan komersial. Repositori GitHub berfungsi sebagai pusat utama untuk kode, dokumentasi, dan interaksi komunitas, mendorong transparansi dan pengembangan kolaboratif.
Fitur Inti OpenAI Whisper
Pengenalan ucapan multibahasa
Terjemahan ucapan ke dalam bahasa Inggris
Identifikasi bahasa
Arsitektur sequence-to-sequence Transformer
Berbagai ukuran model (tiny, base, small, medium, large, turbo)
Varian model khusus bahasa Inggris
Antarmuka baris perintah
API Python untuk integrasi
Sumber terbuka di bawah Lisensi MIT
Dilatih pada data audio yang beragam dan berskala besar
Memulai dengan OpenAI Whisper
Clone: Kloning repositori Whisper dari GitHub.
Instal Dependensi: Instal dependensi Python menggunakan pip, termasuk tiktoken OpenAI dan ffmpeg.
Konfigurasi: Pastikan Rust terinstal jika wheel yang sudah dibuat untuk tiktoken tidak tersedia.
Eksekusi: Gunakan antarmuka baris perintah atau API Python untuk mentranskripsi, menerjemahkan, atau mendeteksi bahasa dalam file audio.
Kasus Penggunaan OpenAI Whisper
- Transkripsi Audio
- Terjemahan Ucapan
- Identifikasi Bahasa
- Deteksi Aktivitas Suara
- Analisis Konten
- Alat Aksesibilitas
- Integrasi Pengembang







