説明
DeepSeek OCRは、ページ画像をコンパクトなビジョントークンに圧縮し、高容量のMixture-of-Experts言語モデルでデコードする二段階のトランスフォーマーベースの文書AIです。第一段階では、ウィンドウ化されたSAMビジョントランスフォーマーと密なCLIP-Largeエンコーダー、16倍の畳み込み圧縮器を統合し、第二段階では、DeepSeek-3B-MoEデコーダー(トークンあたり約570Mのアクティブパラメータ)を使用して、最小限の損失でテキスト、HTML、および図の注釈を再構築します。
その核心的な革新は文脈光圧縮です:1024x1024のページを256トークンまで削減することで、DeepSeek OCRは従来のOCRパイプラインでは処理できない長文書の取り込みを可能にし、グローバルな意味を保持しつつ計算量を削減します。モードセレクターはTiny(64トークン)からGundam(マルチビューポートタイル)まであり、ユーザーは請求書、設計図、大判スキャンの速度と忠実度のバランスを調整できます。
3000万の実際のPDFページと合成されたチャート、数式、図でトレーニングされており、レイアウト構造、表、化学のSMILES文字列、幾何学的タスクを保持し、ラテン文字、CJK、キリル文字、科学的スクリプトを含む100以上の言語をサポートしています。構造化された出力は、HTMLテーブル、Markdown、JSON、SMILES、および分析パイプラインへの直接取り込みのためのキャプションとして出力できます。
MITライセンスの重み(約6.7 GBのsafetensorsチェックポイント)は、ローカルGPU上でオンプレミスで実行でき、国境を越えたデータ露出を回避するか、トークンベースの価格設定でDeepSeekのOpenAI互換APIを介して呼び出すことができます。単一のNVIDIA A100は、1日あたり約200,000ページを処理できます。
DeepSeek OCRの主要機能
文脈光圧縮を伴う二段階トランスフォーマーOCR
ウィンドウ化されたSAMとCLIP-Largeを16倍圧縮で組み合わせたDeepEncoder
DeepSeek-3B Mixture-of-Expertsデコーダー(約570Mのアクティブパラメータ)
Tiny(64トークン)からGundamマルチビューポートタイルまでのモードセレクター
CJK、キリル文字、科学的スクリプトを含む100以上の言語をサポート
HTMLテーブル、Markdown、JSON、SMILES、キャプションとしての構造化出力
オンプレミスのローカルGPU展開用のMITライセンスの重み
トークンベースの価格設定によるOpenAI互換のホスティングAPI
DeepSeek OCRの使い方は?
ローカルに展開する:GitHubリポジトリをクローンし、約6.7 GBのsafetensorsチェックポイントをダウンロードし、互換性のあるGPUでPyTorch 2.6+をFlashAttentionで設定します。
またはAPIを呼び出す:DeepSeekのOpenAI互換エンドポイントを使用して画像を送信し、トークンベースの請求で構造化されたテキストを受け取ります。
モードを選択する:Tiny、Base、Large、またはGundamを選択して、文書タイプに対する速度と忠実度のバランスを調整します。
出力を統合する:結果をJSONに変換し、SMILES文字列をケモインフォマティクスパイプラインにリンクさせるか、レイアウトを考慮したHTMLを自動化およびRAGワークフローに供給します。
DeepSeek OCRの使用例
- スキャンした書籍とレポート
- 技術図面と数式
- 多言語データセットの作成
- 文書変換アプリ
- 大規模なオンプレミスOCR




