Deskripsi
GLM-OCR adalah model OCR multimodal yang canggih yang dikembangkan untuk pemahaman dokumen yang kompleks. Dibangun di atas arsitektur encoder-decoder GLM-V, model ini memperkenalkan teknik inovatif seperti kerugian Multi-Token Prediction (MTP) dan pembelajaran penguatan penuh yang stabil. Kemajuan ini secara signifikan meningkatkan efisiensi pelatihan, akurasi pengenalan, dan kemampuan generalisasi.
Model ini mengintegrasikan encoder visual CogViT, yang telah dilatih sebelumnya pada data gambar-teks yang luas, dan konektor lintas-modal yang ringan dengan pengurangan token yang efisien. Ini juga dilengkapi dengan dekoder bahasa GLM-0.5B. Bersama-sama, komponen ini membentuk jalur dua tahap analisis tata letak dan pengenalan paralel berdasarkan PP-DocLayout-V3, memastikan kinerja OCR yang kuat dan berkualitas tinggi di berbagai tata letak dokumen.
GLM-OCR mencapai hasil terbaik di kelasnya, mencetak 94.62 di OmniDocBench V1.5 dan menduduki peringkat #1 secara keseluruhan. Model ini unggul dalam tolok ukur pemahaman dokumen utama, termasuk pengenalan rumus, pengenalan tabel, dan ekstraksi informasi. Model ini dioptimalkan untuk skenario dunia nyata, mempertahankan kinerja yang kuat pada tabel kompleks, dokumen yang padat kode, segel, dan tata letak menantang lainnya.
Dengan hanya 0.9B parameter, GLM-OCR mendukung penerapan melalui vLLM, SGLang, dan Ollama, mengurangi latensi inferensi dan biaya komputasi. Ini menjadikannya ideal untuk layanan dengan banyak koneksi dan penerapan di tepi. Model ini sepenuhnya open-source, dilengkapi dengan SDK yang komprehensif dan rantai alat inferensi, menawarkan instalasi yang sederhana, pemanggilan satu baris, dan integrasi yang mulus ke dalam jalur produksi yang ada.
SDK resmi disarankan untuk tugas pemrosesan dokumen, mengintegrasikan PP-DocLayoutV3 untuk analisis tata letak dan generasi output terstruktur. Ini mengurangi beban rekayasa yang diperlukan untuk membangun sistem kecerdasan dokumen end-to-end. Model GLM-OCR dirilis di bawah Lisensi MIT, dengan jalur OCR lengkap yang mengintegrasikan PP-DocLayoutV3, dilisensikan di bawah Lisensi Apache 2.0.
Sorotan GLM-OCR
Model OCR multimodal
Arsitektur encoder-decoder GLM-V
Kerugian Multi-Token Prediction
Pembelajaran penguatan yang stabil
Encoder visual CogViT
Dekoder bahasa GLM-0.5B
Jalur dua tahap
Kinerja terbaik di kelasnya
Memulai dengan GLM-OCR
Akses halaman: Kunjungi halaman GLM-OCR di Hugging Face
Muat model: Unduh model GLM-OCR
Konfigurasi lingkungan: Siapkan lingkungan yang diperlukan untuk model
Integrasi: Gunakan SDK untuk integrasi yang mulus
Kasus Penggunaan GLM-OCR
- Pemrosesan Dokumen
- Ekstraksi Informasi
- Pengenalan Tabel
- Pengenalan Rumus
- Analisis Tata Letak








