説明
GLM-OCRは、複雑な文書理解のために開発された高度なマルチモーダルOCRモデルです。GLM-Vエンコーダーデコーダーアーキテクチャに基づいて構築されており、Multi-Token Prediction (MTP)損失や安定したフルタスク強化学習などの革新的な技術を導入しています。これらの進歩により、トレーニング効率、認識精度、一般化能力が大幅に向上します。
このモデルは、広範な画像-テキストデータで事前トレーニングされたCogViTビジュアルエンコーダーと、効率的なトークンダウンサンプリングを備えた軽量のクロスモーダルコネクタを統合しています。また、GLM-0.5B言語デコーダーも搭載しています。これらのコンポーネントは、PP-DocLayout-V3に基づくレイアウト分析と並列認識の二段階パイプラインを形成し、さまざまな文書レイアウトにわたって堅牢で高品質なOCRパフォーマンスを確保します。
GLM-OCRは、OmniDocBench V1.5で94.62のスコアを達成し、全体で1位にランクインするなど、最先端の結果を達成しています。数式認識、表認識、情報抽出などの主要な文書理解ベンチマークで優れた性能を発揮します。このモデルは、複雑な表、コードが多い文書、印章、その他の難しいレイアウトに対しても堅牢なパフォーマンスを維持し、実世界のシナリオに最適化されています。
わずか0.9Bのパラメータで、GLM-OCRはvLLM、SGLang、Ollamaを介したデプロイメントをサポートし、推論のレイテンシと計算コストを削減します。これにより、高い同時接続サービスやエッジデプロイメントに最適です。このモデルは完全にオープンソースであり、包括的なSDKと推論ツールチェーンを備えており、簡単なインストール、一行の呼び出し、既存のプロダクションパイプラインへのスムーズな統合を提供します。
公式SDKは文書解析タスクに推奨されており、レイアウト分析と構造化出力生成のためにPP-DocLayoutV3を統合しています。これにより、エンドツーエンドの文書インテリジェンスシステムを構築するために必要なエンジニアリングオーバーヘッドが削減されます。GLM-OCRモデルはMITライセンスの下でリリースされており、PP-DocLayoutV3を統合した完全なOCRパイプラインはApache License 2.0の下でライセンスされています。
GLM-OCRのハイライト
マルチモーダルOCRモデル
GLM-Vエンコーダーデコーダーアーキテクチャ
Multi-Token Prediction損失
安定した強化学習
CogViTビジュアルエンコーダー
GLM-0.5B言語デコーダー
二段階パイプライン
最先端のパフォーマンス
GLM-OCRをはじめる
ページにアクセス: Hugging FaceのGLM-OCRページを訪問
モデルをロード: GLM-OCRモデルをダウンロード
環境を設定: モデルに必要な環境を設定
統合: SDKを使用してシームレスに統合
GLM-OCRの使用例
- 文書解析
- 情報抽出
- 表認識
- 数式認識
- レイアウト分析








