描述
OCR - 图片阅读器是一款强大的 Chrome 光学字符识别 (OCR) 扩展程序,旨在捕获和将图像转换为可编辑文本。安装后,它会在您的浏览器中添加一个工具栏按钮。激活后,用户可以选择活动窗口内的特定区域进行 OCR 处理。
该扩展程序利用 Tesseract OCR 引擎,通过 "tesseract.js" 库集成,该库支持 100 多种语言。主要功能包括自动文本方向检测和脚本识别,从而提高了跨不同文本源的准确性和可用性。该库是按需加载并在使用后移除的,确保没有长期资源消耗。
提供两种 OCR 引擎:Tesseract,它提取纯文本而不保留格式;以及 IBM Granite-Docling,能够解释标题、列表、样式(粗体、斜体)、表格和数学方程式。由于 OCR 过程固有的缓慢,该扩展程序在检测过程中会显示一个进度条。重要的是,所有 OCR 处理均在本地离线进行,没有服务器端交互,除了初始下载语言训练数据。
此工具用途广泛,允许用户从图像、PDF 文档、PowerPoint 幻灯片甚至内容选择可能受限的网页中提取文本。为了提高准确性,该扩展程序包含一个反转图像并重试 OCR 的功能,这对于深色主题界面尤其有用。如果初始提取置信度较低,用户还可以手动修改图像并重新上传以进行另一次尝试。
0.2.4 版本引入了对浏览器级别页面缩放和操作系统级别屏幕缩放的支持,以及 beta 级别的图像语言检测。该扩展程序由 brian.girko 提供,获得了 243 位用户 4.1/5 的评分,表明其 OCR 功能普遍受到好评。
OCR的核心功能
光学字符识别 (OCR),用于图像到文本转换
内部 OCR 引擎 (Tesseract via tesseract.js)
支持 100 多种语言
自动文本方向和脚本检测
离线 OCR 处理
Tesseract (纯文本) 和 IBM Granite-Docling (格式化文本) 引擎之间的选择
用于提高准确性的图像反转和重试选项
能够从图像、PDF 和 PowerPoint 幻灯片中提取文本
从内容选择受限的网页中提取文本
按需加载和卸载 JS 库
检测模块的进度条
支持浏览器和操作系统级别的缩放
Beta 图像语言检测
如何使用 OCR?
从 Chrome 网上应用店安装 OCR - 图片阅读器扩展程序。
点击扩展程序的工具栏按钮以激活它。
选择屏幕上包含图像或文档的所需区域。
扩展程序将捕获该区域并执行 OCR 处理。
检查提取的文本是否准确。
如有必要,修改图像并重新上传以进行另一次 OCR 尝试。
OCR的使用案例
- 从图像中提取文本
- 数字化文档
- 处理 PDF 内容
- 捕获网页文本
- 分析演示文稿幻灯片
- 提高可访问性
- 数据录入自动化







