설명
GLM-OCR는 복잡한 문서 이해를 위해 개발된 정교한 다중 모드 OCR 모델입니다. GLM-V 인코더-디코더 아키텍처를 기반으로 하여 Multi-Token Prediction (MTP) 손실 및 안정적인 전체 작업 강화 학습과 같은 혁신적인 기술을 도입합니다. 이러한 발전은 훈련 효율성, 인식 정확성 및 일반화 능력을 크게 향상시킵니다.
이 모델은 방대한 이미지-텍스트 데이터로 사전 훈련된 CogViT 시각 인코더와 효율적인 토큰 다운샘플링을 갖춘 경량 크로스 모달 커넥터를 통합합니다. 또한 GLM-0.5B 언어 디코더를 특징으로 합니다. 이러한 구성 요소는 PP-DocLayout-V3를 기반으로 한 레이아웃 분석 및 병렬 인식의 두 단계 파이프라인을 형성하여 다양한 문서 레이아웃에서 강력하고 고품질의 OCR 성능을 보장합니다.
GLM-OCR은 OmniDocBench V1.5에서 94.62의 점수를 기록하며 전체 1위를 차지하는 최첨단 결과를 달성합니다. 수식 인식, 표 인식 및 정보 추출을 포함한 주요 문서 이해 벤치마크에서 뛰어난 성능을 발휘합니다. 이 모델은 복잡한 표, 코드가 많은 문서, 인장 및 기타 도전적인 레이아웃에서 강력한 성능을 유지하며 실제 시나리오에 최적화되어 있습니다.
단 0.9B 매개변수로 GLM-OCR은 vLLM, SGLang 및 Ollama를 통해 배포를 지원하여 추론 지연 및 컴퓨팅 비용을 줄입니다. 이는 고동시성 서비스 및 엣지 배포에 이상적입니다. 이 모델은 완전히 오픈 소스이며, 포괄적인 SDK 및 추론 툴체인을 갖추고 있어 간단한 설치, 한 줄 호출 및 기존 생산 파이프라인에 원활하게 통합할 수 있습니다.
문서 파싱 작업에는 공식 SDK를 사용하는 것이 권장되며, PP-DocLayoutV3를 통합하여 레이아웃 분석 및 구조화된 출력 생성을 지원합니다. 이는 엔드 투 엔드 문서 인텔리전스 시스템을 구축하는 데 필요한 엔지니어링 오버헤드를 줄입니다. GLM-OCR 모델은 MIT 라이센스 하에 출시되었으며, PP-DocLayoutV3를 통합한 전체 OCR 파이프라인은 Apache License 2.0 하에 라이센스가 부여됩니다.
GLM-OCR 하이라이트
다중 모드 OCR 모델
GLM-V 인코더-디코더 아키텍처
Multi-Token Prediction 손실
안정적인 강화 학습
CogViT 시각 인코더
GLM-0.5B 언어 디코더
두 단계 파이프라인
최첨단 성능
GLM-OCR 시작하기
페이지 접근: Hugging Face의 GLM-OCR 페이지 방문
모델 로드: GLM-OCR 모델 다운로드
환경 구성: 모델에 필요한 환경 설정
통합: SDK를 사용하여 원활한 통합
GLM-OCR의 사용 사례
- 문서 파싱
- 정보 추출
- 표 인식
- 수식 인식
- 레이아웃 분석








