描述
GLM-OCR 是一个复杂文档理解的先进多模态 OCR 模型。基于 GLM-V 编码器-解码器架构,它引入了多标记预测 (MTP) 损失和稳定的全任务强化学习等创新技术。这些进展显著提高了训练效率、识别准确性和泛化能力。
该模型集成了在大量图像-文本数据上预训练的 CogViT 视觉编码器,以及一个轻量级的跨模态连接器,具有高效的标记下采样。它还配备了 GLM-0.5B 语言解码器。这些组件共同形成了基于 PP-DocLayout-V3 的布局分析和并行识别的两阶段管道,确保在各种文档布局中提供强大且高质量的 OCR 性能。
GLM-OCR 在 OmniDocBench V1.5 上取得了 94.62 的顶尖成绩,整体排名第 1。它在主要的文档理解基准测试中表现出色,包括公式识别、表格识别和信息提取。该模型针对现实场景进行了优化,在复杂表格、代码密集型文档、印章和其他具有挑战性的布局上保持强大的性能。
GLM-OCR 仅有 0.9B 参数,支持通过 vLLM、SGLang 和 Ollama 部署,减少推理延迟和计算成本。这使其非常适合高并发服务和边缘部署。该模型完全开源,配备了全面的 SDK 和推理工具链,提供简单的安装、一行调用和顺利集成到现有生产管道中。
官方 SDK 推荐用于文档解析任务,集成 PP-DocLayoutV3 进行布局分析和结构化输出生成。这减少了构建端到端文档智能系统所需的工程开销。GLM-OCR 模型在 MIT 许可证下发布,完整的 OCR 管道集成 PP-DocLayoutV3,采用 Apache 许可证 2.0。
GLM-OCR亮点
多模态 OCR 模型
GLM-V 编码器-解码器架构
多标记预测损失
稳定的强化学习
CogViT 视觉编码器
GLM-0.5B 语言解码器
两阶段管道
顶尖性能
GLM-OCR入门
访问页面:访问 Hugging Face 上的 GLM-OCR 页面
加载模型:下载 GLM-OCR 模型
配置环境:为模型设置所需环境
集成:使用 SDK 进行无缝集成
GLM-OCR的使用案例
- 文档解析
- 信息提取
- 表格识别
- 公式识别
- 布局分析








