説明
OCR - 画像リーダーは、Chrome向けの強力な光学文字認識(OCR)拡張機能で、画像をキャプチャして編集可能なテキストに変換するように設計されています。インストールすると、ブラウザにツールバーボタンが追加されます。アクティブ化されると、ユーザーはOCR処理のためにアクティブウィンドウ内の特定の領域を選択できます。
この拡張機能は、Tesseract OCRエンジンを「tesseract.js」ライブラリ経由で統合しており、100以上の言語をサポートしています。主な機能には、自動的なテキストの向き検出とスクリプト認識が含まれており、多様なテキストソースでの精度と使いやすさを向上させます。ライブラリはオンデマンドでロードされ、使用後に削除されるため、長期的なリソース消費はありません。
2つのOCRエンジンが利用可能です。Tesseractはフォーマットを保持せずにプレーンテキストを抽出します。一方、IBM Granite-Doclingは、見出し、リスト、スタイル(太字、イタリック)、表、数式を解釈できます。OCRプロセスは本質的に遅いため、拡張機能は検出中にプログレスバーを表示します。重要な点として、すべてのOCR処理はオフラインで行われ、サーバーサイドとのやり取りはありません。ただし、言語トレーニングデータの初期ダウンロードは除く。
このツールは多用途で、ユーザーは画像、PDFドキュメント、PowerPointスライド、さらにはコンテンツ選択が制限されている可能性のあるウェブページからテキストを抽出できます。精度を向上させるために、拡張機能には画像を反転させてOCRを再試行する機能が含まれており、これはダークテーマのインターフェースで特に役立ちます。初期抽出の信頼性が低い場合は、ユーザーは手動で画像を修正して再アップロードすることもできます。
バージョン0.2.4では、ブラウザレベルのページズームとOSレベルの画面ズームのサポートが導入され、ベータ版の画像言語検出も追加されました。この拡張機能はbrian.girkoによって提供されており、243人のユーザーから5つ星中4.1の評価を獲得しており、OCR機能に対する全体的に肯定的な評価を示しています。
OCRの主要機能
画像からテキストへの変換のための光学文字認識(OCR)
内部OCRエンジン(tesseract.js経由のTesseract)
100以上の言語をサポート
自動テキスト向きおよびスクリプト検出
オフラインOCR処理
Tesseract(プレーンテキスト)とIBM Granite-Docling(フォーマット済みテキスト)エンジンの選択
精度向上のための画像反転および再試行オプション
画像、PDF、Powerpointスライドからのテキスト抽出機能
コンテンツ選択が制限されているウェブページからのテキスト抽出
JSライブラリのオンデマンドロードおよびアンロード
検出モジュールのプログレスバー
ブラウザおよびOSレベルのズームサポート
ベータ版画像言語検出
OCRの使い方は?
ChromeウェブストアからOCR - 画像リーダー拡張機能をインストールします。
拡張機能のツールバーボタンをクリックしてアクティブ化します。
画像またはドキュメントが含まれる画面上の目的の領域を選択します。
拡張機能が領域をキャプチャし、OCR処理を実行します。
抽出されたテキストの精度を確認します。
必要に応じて、画像を修正して再度OCRを試行するために再アップロードします。
OCRの使用例
- 画像からテキストを抽出する
- ドキュメントをデジタル化する
- PDFコンテンツを処理する
- ウェブページテキストをキャプチャする
- プレゼンテーションスライドを分析する
- アクセシビリティを向上させる
- データ入力自動化







