설명
OCR - 이미지 리더는 Chrome용 강력한 광학 문자 인식(OCR) 확장 프로그램으로, 이미지를 캡처하여 편집 가능한 텍스트로 변환하도록 설계되었습니다. 설치 시 브라우저에 도구 모음 버튼이 추가됩니다. 활성화되면 사용자는 OCR 처리를 위해 활성 창 내의 특정 영역을 선택할 수 있습니다.
이 확장 프로그램은 "tesseract.js" 라이브러리를 통해 통합된 Tesseract OCR 엔진을 사용하며, 100개 이상의 언어를 지원합니다. 주요 기능에는 자동 텍스트 방향 감지 및 스크립트 인식이 포함되어 다양한 텍스트 소스에 대한 정확성과 사용성을 향상시킵니다. 라이브러리는 필요에 따라 로드되고 사용 후 제거되어 장기적인 리소스 소비를 방지합니다.
두 가지 OCR 엔진을 사용할 수 있습니다. 서식을 유지하지 않고 일반 텍스트를 추출하는 Tesseract와 제목, 목록, 스타일(굵게, 기울임꼴), 표 및 수학 방정식을 해석할 수 있는 IBM Granite-Docling입니다. OCR 프로세스의 본질적인 느린 속도로 인해 이 확장 프로그램은 감지 중에 진행률 표시줄을 제공합니다. 중요하게도, 언어 학습 데이터의 초기 다운로드를 제외하고는 모든 OCR 처리가 오프라인으로 수행되며 서버 측 상호 작용은 없습니다.
이 도구는 다용도로 사용할 수 있으며, 사용자는 이미지, PDF 문서, PowerPoint 슬라이드 또는 콘텐츠 선택이 제한될 수 있는 웹 페이지에서도 텍스트를 추출할 수 있습니다. 정확도 향상을 위해 이 확장 프로그램에는 이미지를 반전하고 OCR을 다시 시도하는 기능이 포함되어 있으며, 이는 특히 어두운 테마 인터페이스에 유용합니다. 초기 추출 신뢰도가 낮은 경우 사용자는 이미지를 수동으로 수정하고 다시 업로드하여 다시 시도할 수 있습니다.
버전 0.2.4에서는 브라우저 수준 페이지 확대/축소 및 OS 수준 화면 확대/축소 지원과 함께 베타 수준의 이미지 언어 감지가 도입되었습니다. 이 확장 프로그램은 brian.girko에서 제공하며 243명의 사용자로부터 5점 만점에 4.1점을 획득하여 OCR 기능에 대해 전반적으로 긍정적인 평가를 받고 있음을 나타냅니다.
OCR의 핵심 기능
이미지-텍스트 변환을 위한 광학 문자 인식(OCR)
내부 OCR 엔진(tesseract.js를 통한 Tesseract)
100개 이상의 언어 지원
자동 텍스트 방향 및 스크립트 감지
오프라인 OCR 처리
Tesseract(일반 텍스트) 및 IBM Granite-Docling(서식 있는 텍스트) 엔진 선택
정확도 향상을 위한 이미지 반전 및 다시 시도 옵션
이미지, PDF 및 PowerPoint 슬라이드에서 텍스트 추출 기능
콘텐츠 선택이 제한된 웹 페이지에서 텍스트 추출
JS 라이브러리의 온디맨드 로딩 및 언로딩
감지 모듈용 진행률 표시줄
브라우저 및 OS 수준 확대/축소 지원
베타 이미지 언어 감지
OCR 사용 방법은?
Chrome 웹 스토어에서 OCR - 이미지 리더 확장 프로그램을 설치합니다.
확장 프로그램의 도구 모음 버튼을 클릭하여 활성화합니다.
이미지 또는 문서가 포함된 화면의 원하는 영역을 선택합니다.
확장 프로그램이 해당 영역을 캡처하고 OCR 처리를 수행합니다.
추출된 텍스트의 정확성을 검토합니다.
필요한 경우 이미지를 수정하고 다시 업로드하여 OCR을 다시 시도합니다.
OCR의 사용 사례
- 이미지에서 텍스트 추출
- 문서 디지털화
- PDF 콘텐츠 처리
- 웹 페이지 텍스트 캡처
- 프레젠테이션 슬라이드 분석
- 접근성 향상
- 데이터 입력 자동화







