Descrição
GLM-OCR é um sofisticado modelo de OCR multimodal desenvolvido para compreensão complexa de documentos. Baseado na arquitetura de codificador-decodificador GLM-V, ele introduz técnicas inovadoras, como perda de Previsão de Múltiplos Tokens (MTP) e aprendizado por reforço estável. Esses avanços melhoram significativamente a eficiência de treinamento, a precisão de reconhecimento e as capacidades de generalização.
O modelo integra o codificador visual CogViT, pré-treinado em um extenso conjunto de dados de imagem-texto, e um conector cross-modal leve com downsampling eficiente de tokens. Ele também apresenta um decodificador de linguagem GLM-0.5B. Juntos, esses componentes formam um pipeline de duas etapas de análise de layout e reconhecimento paralelo baseado no PP-DocLayout-V3, garantindo desempenho robusto e de alta qualidade em OCR em diversos layouts de documentos.
GLM-OCR alcança resultados de ponta, marcando 94,62 no OmniDocBench V1.5 e ocupando a posição #1 geral. Ele se destaca em principais benchmarks de compreensão de documentos, incluindo reconhecimento de fórmulas, reconhecimento de tabelas e extração de informações. O modelo é otimizado para cenários do mundo real, mantendo desempenho robusto em tabelas complexas, documentos com muito código, selos e outros layouts desafiadores.
Com apenas 0,9B de parâmetros, o GLM-OCR suporta implantação via vLLM, SGLang e Ollama, reduzindo a latência de inferência e os custos computacionais. Isso o torna ideal para serviços de alta concorrência e implantações em edge. O modelo é totalmente open-source, equipado com um SDK abrangente e uma cadeia de ferramentas de inferência, oferecendo instalação simples, invocação em uma linha e integração suave em pipelines de produção existentes.
O SDK oficial é recomendado para tarefas de análise de documentos, integrando PP-DocLayoutV3 para análise de layout e geração de saída estruturada. Isso reduz a sobrecarga de engenharia necessária para construir sistemas de inteligência de documentos de ponta a ponta. O modelo GLM-OCR é lançado sob a Licença MIT, com o pipeline completo de OCR integrando PP-DocLayoutV3, licenciado sob a Licença Apache 2.0.
Destaques de GLM-OCR
Modelo de OCR multimodal
Arquitetura de codificador-decodificador GLM-V
Perda de Previsão de Múltiplos Tokens
Aprendizado por reforço estável
Codificador visual CogViT
Decodificador de linguagem GLM-0.5B
Pipeline de duas etapas
Desempenho de ponta
Primeiros passos com GLM-OCR
Acessar página: Visite a página do GLM-OCR no Hugging Face
Carregar modelo: Baixe o modelo GLM-OCR
Configurar ambiente: Configure o ambiente necessário para o modelo
Integrar: Use o SDK para integração sem costura
Casos de uso de GLM-OCR
- Análise de Documentos
- Extração de Informações
- Reconhecimento de Tabelas
- Reconhecimento de Fórmulas
- Análise de Layout








