描述
DeepSeek OCR 是一个基于两阶段变换器的文档 AI,它将页面图像压缩为紧凑的视觉令牌,然后使用高容量的专家混合语言模型进行解码。第一阶段将窗口化的 SAM 视觉变换器与密集的 CLIP-Large 编码器和 16 倍卷积压缩器相结合,而第二阶段则使用 DeepSeek-3B-MoE 解码器(每个令牌约 570M 活跃参数)以最小的损失重建文本、HTML 和图形注释。
其核心创新是上下文光学压缩:通过将 1024x1024 的页面减少到少至 256 个令牌,DeepSeek OCR 实现了对传统 OCR 流水线难以处理的长文档的摄取,同时保持全球语义并大幅降低计算量。模式选择器的范围从 Tiny(64 个令牌)到 Gundam(多视口平铺),让用户可以根据发票、蓝图和大幅面扫描的需求调整速度与保真度之间的平衡。
经过对 3000 万个真实 PDF 页面以及合成图表、公式和图示的训练,它保留了布局结构、表格、化学 SMILES 字符串和几何任务,并支持超过 100 种语言,包括拉丁文、CJK、斯拉夫文和科学脚本。结构化输出可以以 HTML 表格、Markdown、JSON、SMILES 和标题的形式发出,以便直接摄取到分析流水线中。
MIT 许可的权重(约 6.7 GB 的 safetensors 检查点)可以在本地 GPU 上本地运行,避免跨境数据暴露,或通过 DeepSeek 的 OpenAI 兼容 API 进行调用,采用基于令牌的定价。单个 NVIDIA A100 每天可以处理大约 200,000 页。
DeepSeek OCR的核心功能
两阶段变换器 OCR,具有上下文光学压缩
结合窗口化 SAM 和 CLIP-Large 的 DeepEncoder,具有 16 倍压缩
DeepSeek-3B 混合专家解码器(约 570M 活跃参数)
从 Tiny(64 个令牌)到 Gundam 多视口平铺的模式选择器
支持包括 CJK、斯拉夫文和科学脚本在内的 100 多种语言
以 HTML 表格、Markdown、JSON、SMILES 和标题的形式输出结构化结果
MIT 许可的权重,适用于本地 GPU 部署
与 OpenAI 兼容的托管 API,采用基于令牌的定价
如何使用 DeepSeek OCR?
本地部署:克隆 GitHub 仓库,下载约 6.7 GB 的 safetensors 检查点,并在兼容的 GPU 上配置 PyTorch 2.6+ 和 FlashAttention。
或调用 API:使用 DeepSeek 的 OpenAI 兼容端点提交图像,并接收结构化文本,采用基于令牌的计费。
选择模式:选择 Tiny、Base、Large 或 Gundam,以平衡文档类型的速度与保真度。
集成输出:将结果转换为 JSON,将 SMILES 字符串链接到化学信息学流水线,或将布局感知的 HTML 输入到自动化和 RAG 工作流中。
DeepSeek OCR的使用案例
- 扫描的书籍和报告
- 技术图示和公式
- 多语言数据集创建
- 文档转换应用
- 大规模本地 OCR




