跳转到主要内容
ToolPotion

GLM-OCR

GLM-OCR 是一个多模态 OCR 模型,旨在实现复杂文档理解。它通过多标记预测损失和稳定的强化学习提高训练效率和识别准确性。该模型针对现实场景进行了优化,在各种文档布局中提供强大的性能。

查看模型
分享

描述

GLM-OCR 是一个复杂文档理解的先进多模态 OCR 模型。基于 GLM-V 编码器-解码器架构,它引入了多标记预测 (MTP) 损失和稳定的全任务强化学习等创新技术。这些进展显著提高了训练效率、识别准确性和泛化能力。

该模型集成了在大量图像-文本数据上预训练的 CogViT 视觉编码器,以及一个轻量级的跨模态连接器,具有高效的标记下采样。它还配备了 GLM-0.5B 语言解码器。这些组件共同形成了基于 PP-DocLayout-V3 的布局分析和并行识别的两阶段管道,确保在各种文档布局中提供强大且高质量的 OCR 性能。

GLM-OCR 在 OmniDocBench V1.5 上取得了 94.62 的顶尖成绩,整体排名第 1。它在主要的文档理解基准测试中表现出色,包括公式识别、表格识别和信息提取。该模型针对现实场景进行了优化,在复杂表格、代码密集型文档、印章和其他具有挑战性的布局上保持强大的性能。

GLM-OCR 仅有 0.9B 参数,支持通过 vLLM、SGLang 和 Ollama 部署,减少推理延迟和计算成本。这使其非常适合高并发服务和边缘部署。该模型完全开源,配备了全面的 SDK 和推理工具链,提供简单的安装、一行调用和顺利集成到现有生产管道中。

官方 SDK 推荐用于文档解析任务,集成 PP-DocLayoutV3 进行布局分析和结构化输出生成。这减少了构建端到端文档智能系统所需的工程开销。GLM-OCR 模型在 MIT 许可证下发布,完整的 OCR 管道集成 PP-DocLayoutV3,采用 Apache 许可证 2.0。

GLM-OCR亮点

  • 多模态 OCR 模型

  • GLM-V 编码器-解码器架构

  • 多标记预测损失

  • 稳定的强化学习

  • CogViT 视觉编码器

  • GLM-0.5B 语言解码器

  • 两阶段管道

  • 顶尖性能

GLM-OCR入门

  1. 访问页面:访问 Hugging Face 上的 GLM-OCR 页面

  2. 加载模型:下载 GLM-OCR 模型

  3. 配置环境:为模型设置所需环境

  4. 集成:使用 SDK 进行无缝集成

GLM-OCR的使用案例

  • 文档解析
  • 信息提取
  • 表格识别
  • 公式识别
  • 布局分析

GLM-OCR的常见问题

From Zhipu AI

a model in GLM-4.5 by Zhipu AI.

GLM-OCR 评价

加载中...

与 GLM-OCR 类似的热门AI工具

AI 模型

LayoutLM 是一个用于视觉丰富文档理解和信息提取的多模态预训练模型。它结合了文本、布局和图像信息,在表单和收据理解等任务上取得了最先进的成果。该模型有多种尺寸和版本,包括多语言支持。

AI 模型与大语言模型

AI 模型

TrOCR 是一个为光学字符识别 (OCR) 任务设计的编码器-解码器模型。它利用基于 Transformer 的架构处理图像并生成文本,适用于识别图像中的手写文本。

AI 模型与大语言模型

GOT-OCR2.0 是一个先进的 OCR 模型,旨在实现高效的文本识别。它利用统一的端到端方法来提高准确性和性能,使其非常适合于文本提取和处理的各种应用。

AI 模型与大语言模型

AI 模型

RolmOCR是Reducto AI开发的开源OCR工具,相比其前身olmOCR,提供更快的处理速度和更低的内存使用。它旨在高效处理各种文档类型,而无需使用元数据输入。

AI 模型与大语言模型

Florence-2 是微软开发的先进视觉基础模型,旨在处理各种视觉和视觉语言任务。它采用基于提示的方法来处理诸如图像描述和物体检测等任务,利用庞大的数据集进行多任务学习。

AI 模型与大语言模型

Llama-3.2-11B-Vision-Instruct 是一个多模态 AI 模型,旨在进行视觉识别、图像推理和图像描述。由 Meta 开发,它整合了文本和图像输入,以提供先进的图像理解能力。

AI 模型与大语言模型

AI 模型

LLaVA 是一个大型多模态模型,它将视觉编码器与语言模型相结合,用于通用的视觉和语言理解。它在多模态聊天能力方面表现出色,模仿 GPT-4,并通过视觉指令调优在 Science QA 等基准测试中取得了最先进的准确率。

AI 模型与大语言模型

Llama-4-Scout-17B-16E-Instruct 是 Meta 设计的多模态 AI 模型。它利用专家混合架构提供先进的文本和图像理解能力,支持多语言输出和针对多种应用的微调。

AI 模型与大语言模型