Description
GLM-OCR est un modèle OCR multimodal sophistiqué développé pour la compréhension de documents complexes. Basé sur l'architecture encodeur-décodeur GLM-V, il introduit des techniques innovantes telles que la perte de prédiction multi-token (MTP) et un apprentissage par renforcement stable. Ces avancées améliorent considérablement l'efficacité de l'entraînement, la précision de la reconnaissance et les capacités de généralisation.
Le modèle intègre l'encodeur visuel CogViT, pré-entraîné sur d'importantes données image-texte, et un connecteur cross-modal léger avec un sous-échantillonnage efficace des tokens. Il dispose également d'un décodeur de langue GLM-0.5B. Ensemble, ces composants forment un pipeline en deux étapes d'analyse de mise en page et de reconnaissance parallèle basé sur PP-DocLayout-V3, garantissant des performances OCR robustes et de haute qualité sur divers formats de documents.
GLM-OCR atteint des résultats à la pointe de la technologie, avec un score de 94,62 sur OmniDocBench V1.5 et se classe #1 au total. Il excelle dans les principaux benchmarks de compréhension de documents, y compris la reconnaissance de formules, la reconnaissance de tableaux et l'extraction d'informations. Le modèle est optimisé pour des scénarios du monde réel, maintenant des performances robustes sur des tableaux complexes, des documents riches en code, des sceaux et d'autres mises en page difficiles.
Avec seulement 0,9 milliard de paramètres, GLM-OCR prend en charge le déploiement via vLLM, SGLang et Ollama, réduisant la latence d'inférence et les coûts de calcul. Cela le rend idéal pour des services à haute concurrence et des déploiements en périphérie. Le modèle est entièrement open-source, équipé d'un SDK complet et d'une chaîne d'outils d'inférence, offrant une installation simple, une invocation en une ligne et une intégration fluide dans les pipelines de production existants.
Le SDK officiel est recommandé pour les tâches de parsing de documents, intégrant PP-DocLayoutV3 pour l'analyse de mise en page et la génération de sorties structurées. Cela réduit la charge d'ingénierie nécessaire pour construire des systèmes d'intelligence documentaire de bout en bout. Le modèle GLM-OCR est publié sous la licence MIT, avec le pipeline OCR complet intégrant PP-DocLayoutV3, sous licence Apache 2.0.
Points forts de GLM-OCR
Modèle OCR multimodal
Architecture encodeur-décodeur GLM-V
Perte de prédiction multi-token
Apprentissage par renforcement stable
Encodeur visuel CogViT
Décodeur de langue GLM-0.5B
Pipeline en deux étapes
Performances à la pointe de la technologie
Premiers pas avec GLM-OCR
Accéder à la page : Visitez la page GLM-OCR sur Hugging Face
Charger le modèle : Téléchargez le modèle GLM-OCR
Configurer l'environnement : Configurez l'environnement requis pour le modèle
Intégrer : Utilisez le SDK pour une intégration sans faille
Cas d'utilisation de GLM-OCR
- Parsing de Documents
- Extraction d'Informations
- Reconnaissance de Tableaux
- Reconnaissance de Formules
- Analyse de Mise en Page








