Deskripsi
OpenAI Whisper adalah model pra-latih yang canggih yang dirancang untuk pengenalan suara otomatis (ASR) dan terjemahan suara. Dikembangkan oleh OpenAI, Whisper didasarkan pada arsitektur encoder-decoder Transformer, yang juga dikenal sebagai model sequence-to-sequence. Model ini dilatih pada dataset besar yang terdiri dari 680.000 jam data suara berlabel menggunakan pengawasan lemah skala besar. Pelatihan ini memungkinkan Whisper untuk menggeneralisasi secara efektif di berbagai dataset dan domain tanpa memerlukan fine-tuning.
Model Whisper tersedia dalam lima konfigurasi, masing-masing bervariasi dalam ukuran dan kemampuan. Model yang lebih kecil dilatih pada data yang hanya berbahasa Inggris dan data multibahasa, sementara model terbesar hanya multibahasa. Model-model ini dapat diakses di Hugging Face Hub, memberikan fleksibilitas untuk berbagai tugas ASR dan terjemahan. Whisper dapat mentranskripsi sampel audio dan menerjemahkan suara dari satu bahasa ke bahasa lain, menjadikannya alat yang serbaguna bagi pengembang dan peneliti.
Model ini menggunakan token konteks untuk menentukan tugas dan bahasa untuk transkripsi atau terjemahan. Token-token ini membimbing model dalam memprediksi bahasa keluaran dan tugas, memungkinkan prediksi yang terkontrol atau otomatis. Kemampuan Whisper meluas ke transkripsi bentuk panjang melalui algoritma chunking, memungkinkannya untuk menangani sampel audio dengan panjang sembarang.
Meskipun Whisper menunjukkan kinerja yang kuat dalam ASR dan terjemahan, model ini memiliki keterbatasan. Akurasi model dapat bervariasi di berbagai bahasa, terutama yang memiliki data pelatihan yang lebih sedikit. Selain itu, model ini dapat menghasilkan halusinasi, di mana keluaran mencakup teks yang tidak ada dalam input audio. Meskipun tantangan ini ada, ketahanan Whisper terhadap aksen, kebisingan latar belakang, dan bahasa teknis menjadikannya alat yang berharga untuk meningkatkan aksesibilitas dan mengembangkan solusi ASR.
Sorotan Model OpenAI Whisper
Pra-latih pada 680k jam data
Mendukung pengenalan suara otomatis
Memungkinkan terjemahan suara
Model encoder-decoder berbasis Transformer
Tersedia dalam lima ukuran model
Menangani tugas multibahasa dan hanya bahasa Inggris
Token konteks untuk kontrol tugas dan bahasa
Transkripsi bentuk panjang dengan chunking
Memulai dengan Model OpenAI Whisper
Akses halaman: Kunjungi halaman model Hugging Face
Muat model: Unduh model Whisper dari Hub
Konfigurasi lingkungan: Siapkan WhisperProcessor
Integrasi: Gunakan token konteks untuk tugas
Fine-tune: Tingkatkan kinerja dengan data berlabel
Kasus Penggunaan Model OpenAI Whisper
- Pengenalan Suara
- Terjemahan Suara
- ASR Multibahasa
- Alat Aksesibilitas
- Penelitian dan Pengembangan












