メインコンテンツへスキップ
ToolPotion

GLM-OCR

GLM-OCRは、複雑な文書理解のために設計されたマルチモーダルOCRモデルです。Multi-Token Prediction損失と安定した強化学習を使用して、トレーニング効率と認識精度を向上させます。このモデルは、さまざまな文書レイアウトにわたって堅牢なパフォーマンスを提供し、実世界のシナリオに最適化されています。

モデルを見る
共有

説明

GLM-OCRは、複雑な文書理解のために開発された高度なマルチモーダルOCRモデルです。GLM-Vエンコーダーデコーダーアーキテクチャに基づいて構築されており、Multi-Token Prediction (MTP)損失や安定したフルタスク強化学習などの革新的な技術を導入しています。これらの進歩により、トレーニング効率、認識精度、一般化能力が大幅に向上します。

このモデルは、広範な画像-テキストデータで事前トレーニングされたCogViTビジュアルエンコーダーと、効率的なトークンダウンサンプリングを備えた軽量のクロスモーダルコネクタを統合しています。また、GLM-0.5B言語デコーダーも搭載しています。これらのコンポーネントは、PP-DocLayout-V3に基づくレイアウト分析と並列認識の二段階パイプラインを形成し、さまざまな文書レイアウトにわたって堅牢で高品質なOCRパフォーマンスを確保します。

GLM-OCRは、OmniDocBench V1.5で94.62のスコアを達成し、全体で1位にランクインするなど、最先端の結果を達成しています。数式認識、表認識、情報抽出などの主要な文書理解ベンチマークで優れた性能を発揮します。このモデルは、複雑な表、コードが多い文書、印章、その他の難しいレイアウトに対しても堅牢なパフォーマンスを維持し、実世界のシナリオに最適化されています。

わずか0.9Bのパラメータで、GLM-OCRはvLLM、SGLang、Ollamaを介したデプロイメントをサポートし、推論のレイテンシと計算コストを削減します。これにより、高い同時接続サービスやエッジデプロイメントに最適です。このモデルは完全にオープンソースであり、包括的なSDKと推論ツールチェーンを備えており、簡単なインストール、一行の呼び出し、既存のプロダクションパイプラインへのスムーズな統合を提供します。

公式SDKは文書解析タスクに推奨されており、レイアウト分析と構造化出力生成のためにPP-DocLayoutV3を統合しています。これにより、エンドツーエンドの文書インテリジェンスシステムを構築するために必要なエンジニアリングオーバーヘッドが削減されます。GLM-OCRモデルはMITライセンスの下でリリースされており、PP-DocLayoutV3を統合した完全なOCRパイプラインはApache License 2.0の下でライセンスされています。

GLM-OCRのハイライト

  • マルチモーダルOCRモデル

  • GLM-Vエンコーダーデコーダーアーキテクチャ

  • Multi-Token Prediction損失

  • 安定した強化学習

  • CogViTビジュアルエンコーダー

  • GLM-0.5B言語デコーダー

  • 二段階パイプライン

  • 最先端のパフォーマンス

GLM-OCRをはじめる

  1. ページにアクセス: Hugging FaceのGLM-OCRページを訪問

  2. モデルをロード: GLM-OCRモデルをダウンロード

  3. 環境を設定: モデルに必要な環境を設定

  4. 統合: SDKを使用してシームレスに統合

GLM-OCRの使用例

  • 文書解析
  • 情報抽出
  • 表認識
  • 数式認識
  • レイアウト分析

GLM-OCRのFAQ

From Zhipu AI

a model in GLM-4.5 by Zhipu AI.

GLM-OCR のレビュー

読み込み中...

GLM-OCR に似た人気のAIツール

AI モデル

LayoutLMは、視覚的にリッチなドキュメントの理解と情報抽出のためのマルチモーダル事前学習モデルです。テキスト、レイアウト、画像情報を組み合わせて、フォームやレシートの理解などのタスクで最先端の結果を達成します。このモデルは、多言語サポートを含む、さまざまなサイズとバージョンで利用可能です。

AIモデルとLLM

AI モデル

TrOCRは光学文字認識(OCR)タスクのために設計されたエンコーダ-デコーダモデルです。画像を処理してテキストを生成するためにTransformerベースのアーキテクチャを利用しており、画像内の手書きテキストを認識するのに適しています。

AIモデルとLLM

GOT-OCR2.0は、効率的なテキスト認識のために設計された高度なOCRモデルです。統一されたエンドツーエンドアプローチを活用して精度とパフォーマンスを向上させ、テキスト抽出や処理のさまざまなアプリケーションに最適です。

AIモデルとLLM

AI モデル

RolmOCRはReducto AIによって開発されたオープンソースのOCRツールで、前のolmOCRと比較して処理速度が速く、メモリ使用量が少なくなっています。メタデータ入力を使用せずに、さまざまな文書タイプを効率的に処理するように設計されています。

AIモデルとLLM

Florence-2は、Microsoftによって開発された高度なビジョン基盤モデルで、さまざまなビジョンおよびビジョン-言語タスクを処理するように設計されています。キャプショニングや物体検出などのタスクに対してプロンプトベースのアプローチを使用し、多様なデータセットを活用してマルチタスク学習を行います。

AIモデルとLLM

Llama-3.2-11B-Vision-Instructは、視覚認識、画像推論、キャプショニングのために設計されたマルチモーダルAIモデルです。Metaによって開発され、テキストと画像の入力を統合して高度な画像理解能力を提供します。

AIモデルとLLM

AI モデル

LLaVAは、汎用的な視覚と言語の理解のために、ビジョンエンコーダーと言語モデルを組み合わせた大規模マルチモーダルモデルです。マルチモーダルチャット機能に優れ、GPT-4を模倣し、視覚的指示チューニングを通じてScience QAのようなベンチマークで最先端の精度を達成しています。

AIモデルとLLM

Llama-4-Scout-17B-16E-Instructは、Metaによって設計されたマルチモーダルAIモデルです。専門家の混合アーキテクチャを活用して、先進的なテキストおよび画像理解機能を提供し、多言語出力と多様なアプリケーション向けのファインチューニングをサポートします。

AIモデルとLLM