跳转到主要内容
ToolPotion

DeepSeek OCR

DeepSeek OCR 是一个开源的两阶段变换器 OCR 系统,利用上下文光学压缩技术,提供对 100 多种语言的表格、图表、公式和图示的近无损文档理解。

访问URL
DeepSeek OCR screenshot

描述

DeepSeek OCR 是一个基于两阶段变换器的文档 AI,它将页面图像压缩为紧凑的视觉令牌,然后使用高容量的专家混合语言模型进行解码。第一阶段将窗口化的 SAM 视觉变换器与密集的 CLIP-Large 编码器和 16 倍卷积压缩器相结合,而第二阶段则使用 DeepSeek-3B-MoE 解码器(每个令牌约 570M 活跃参数)以最小的损失重建文本、HTML 和图形注释。

其核心创新是上下文光学压缩:通过将 1024x1024 的页面减少到少至 256 个令牌,DeepSeek OCR 实现了对传统 OCR 流水线难以处理的长文档的摄取,同时保持全球语义并大幅降低计算量。模式选择器的范围从 Tiny(64 个令牌)到 Gundam(多视口平铺),让用户可以根据发票、蓝图和大幅面扫描的需求调整速度与保真度之间的平衡。

经过对 3000 万个真实 PDF 页面以及合成图表、公式和图示的训练,它保留了布局结构、表格、化学 SMILES 字符串和几何任务,并支持超过 100 种语言,包括拉丁文、CJK、斯拉夫文和科学脚本。结构化输出可以以 HTML 表格、Markdown、JSON、SMILES 和标题的形式发出,以便直接摄取到分析流水线中。

MIT 许可的权重(约 6.7 GB 的 safetensors 检查点)可以在本地 GPU 上本地运行,避免跨境数据暴露,或通过 DeepSeek 的 OpenAI 兼容 API 进行调用,采用基于令牌的定价。单个 NVIDIA A100 每天可以处理大约 200,000 页。

DeepSeek OCR的核心功能

  • 两阶段变换器 OCR,具有上下文光学压缩

  • 结合窗口化 SAM 和 CLIP-Large 的 DeepEncoder,具有 16 倍压缩

  • DeepSeek-3B 混合专家解码器(约 570M 活跃参数)

  • 从 Tiny(64 个令牌)到 Gundam 多视口平铺的模式选择器

  • 支持包括 CJK、斯拉夫文和科学脚本在内的 100 多种语言

  • 以 HTML 表格、Markdown、JSON、SMILES 和标题的形式输出结构化结果

  • MIT 许可的权重,适用于本地 GPU 部署

  • 与 OpenAI 兼容的托管 API,采用基于令牌的定价

如何使用 DeepSeek OCR?

  1. 本地部署:克隆 GitHub 仓库,下载约 6.7 GB 的 safetensors 检查点,并在兼容的 GPU 上配置 PyTorch 2.6+ 和 FlashAttention。

  2. 或调用 API:使用 DeepSeek 的 OpenAI 兼容端点提交图像,并接收结构化文本,采用基于令牌的计费。

  3. 选择模式:选择 Tiny、Base、Large 或 Gundam,以平衡文档类型的速度与保真度。

  4. 集成输出:将结果转换为 JSON,将 SMILES 字符串链接到化学信息学流水线,或将布局感知的 HTML 输入到自动化和 RAG 工作流中。

DeepSeek OCR的使用案例

  • 扫描的书籍和报告
  • 技术图示和公式
  • 多语言数据集创建
  • 文档转换应用
  • 大规模本地 OCR

DeepSeek OCR的常见问题

DeepSeek OCR 评价

加载中...

与 DeepSeek OCR 类似的热门AI工具

AI 应用

aOCR 是一个文档解析和数据提取 API,专为技术团队设计,将 PDF、图像、电子表格和幻灯片转换为结构化、可分析的数据,OCR 准确率高达 99.2%。

AI 文档与 PDF 工具

AI 应用

HandOCR 是一款基于 AI 的在线 OCR 工具,可以在几秒钟内将图像和 PDF 转换为可编辑文本,支持多语言和批量处理,无需登录即可享受每日免费配额。

AI 文档与 PDF 工具

AI 应用

一个免费的 AI ChatPDF 工具,允许您上传 PDF、文档和 PPT,以便使用多种 AI 模型进行总结、分析、提问和翻译,支持多种语言。

AI 文档与 PDF 工具

Mistral AI 提供先进的文档 AI 和 OCR 解决方案,使组织能够高效地提取、理解和分析文档。凭借多语言支持和灵活的工作流程,它适用于各种文档类型,提高生产力和合规性。

AI 文档与 PDF 工具医疗健康与生命科学

AI 应用

Doc2X 是一款 AI 文档解析工具,能够准确识别 PDF 和图像中的公式和表格,并将其转换为 Word、LaTeX、HTML 和 Markdown,同时提供多语言和双语 PDF 翻译,适用于学术和商业用途。

AI 文档与 PDF 工具

Lekt AI 为企业提供可扩展的 API 解决方案,专注于高级数据处理。其平台集成了文档智能、数据转换和内容创建功能。该平台专为企业级性能而设计,可确保为不断发展的组织提供可靠高效的关键任务数据操作。

AI 文档与 PDF 工具

AI 应用

Doculator 是一个免费的、由 AI 驱动的在线翻译平台。它提供文档、图像和视频翻译服务,支持超过 100 种语言。主要优势包括保留原始格式、高准确性和高效处理各种文件类型,使全球沟通无缝衔接。

AI翻译工具

AI 应用

getTxt.AI 提供 AI 驱动的文本提取服务,支持 PDF、图像、音频和视频。它可将文件转换为文本或 Markdown,支持超过 50 种语言的翻译,并提供摘要功能。非常适合需要统一 API 来处理各种数据源的开发者,简化 AI 应用的后端。

AI 文档与 PDF 工具