Beschreibung
GLM-OCR ist ein anspruchsvolles multimodales OCR-Modell, das für das Verständnis komplexer Dokumente entwickelt wurde. Basierend auf der GLM-V Encoder-Decoder-Architektur führt es innovative Techniken wie Multi-Token-Vorhersage (MTP) Verlust und stabiles Vollaufgaben-Verstärkungslernen ein. Diese Fortschritte verbessern erheblich die Trainingseffizienz, die Erkennungsgenauigkeit und die Generalisierungsfähigkeiten.
Das Modell integriert den CogViT visuellen Encoder, der auf umfangreichen Bild-Text-Daten vortrainiert wurde, und einen leichten cross-modalen Connector mit effizientem Token-Downsampling. Es verfügt auch über einen GLM-0.5B Sprachdecoder. Zusammen bilden diese Komponenten eine zweistufige Pipeline zur Layout-Analyse und parallelen Erkennung basierend auf PP-DocLayout-V3, die eine robuste und qualitativ hochwertige OCR-Leistung über verschiedene Dokumentenlayouts gewährleistet.
GLM-OCR erzielt erstklassige Ergebnisse mit einem Score von 94,62 auf OmniDocBench V1.5 und belegt den ersten Platz insgesamt. Es glänzt in wichtigen Benchmarks zum Verständnis von Dokumenten, einschließlich der Formel- und Tabellen-Erkennung sowie der Informationsbeschaffung. Das Modell ist für reale Szenarien optimiert und bietet eine robuste Leistung bei komplexen Tabellen, codeintensiven Dokumenten, Siegeln und anderen herausfordernden Layouts.
Mit nur 0,9B Parametern unterstützt GLM-OCR die Bereitstellung über vLLM, SGLang und Ollama, wodurch die Inferenzlatenz und die Rechenkosten gesenkt werden. Dies macht es ideal für Dienste mit hoher Parallelität und Edge-Bereitstellungen. Das Modell ist vollständig Open Source und mit einem umfassenden SDK und einer Inferenz-Toolchain ausgestattet, die eine einfache Installation, einen Einzeiler-Aufruf und eine reibungslose Integration in bestehende Produktionspipelines ermöglicht.
Das offizielle SDK wird für Dokumentenverarbeitungsaufgaben empfohlen und integriert PP-DocLayoutV3 für die Layout-Analyse und die Generierung strukturierter Ausgaben. Dies reduziert den Ingenieuroverhead, der erforderlich ist, um End-to-End-Dokumentenintelligenzsysteme zu erstellen. Das GLM-OCR-Modell wird unter der MIT-Lizenz veröffentlicht, wobei die vollständige OCR-Pipeline, die PP-DocLayoutV3 integriert, unter der Apache-Lizenz 2.0 lizenziert ist.
GLM-OCR im Überblick
Multimodales OCR-Modell
GLM-V Encoder-Decoder-Architektur
Multi-Token-Vorhersageverlust
Stabiles Verstärkungslernen
CogViT visueller Encoder
GLM-0.5B Sprachdecoder
Zweistufige Pipeline
Erstklassige Leistung
Erste Schritte mit GLM-OCR
Zugangsseite: Besuchen Sie die GLM-OCR-Seite auf Hugging Face
Modell laden: Laden Sie das GLM-OCR-Modell herunter
Umgebung konfigurieren: Richten Sie die erforderliche Umgebung für das Modell ein
Integrieren: Verwenden Sie das SDK für eine nahtlose Integration
GLM-OCR's Anwendungsfälle
- Dokumentenverarbeitung
- Informationsbeschaffung
- Tabellenerkennung
- Formelerkennung
- Layout-Analyse








