Описание
GLM-OCR — это сложная мультимодальная модель OCR, разработанная для понимания сложных документов. Основанная на архитектуре кодировщика-декодера GLM-V, она вводит инновационные методы, такие как потери Multi-Token Prediction (MTP) и стабильное обучение с подкреплением для всей задачи. Эти достижения значительно повышают эффективность обучения, точность распознавания и способности к обобщению.
Модель интегрирует визуальный кодировщик CogViT, предварительно обученный на обширных данных изображений и текста, и легкий кросс-модальный соединитель с эффективным понижением дискретизации токенов. Она также включает языковой декодер GLM-0.5B. Вместе эти компоненты образуют двухступенчатый конвейер анализа макета и параллельного распознавания на основе PP-DocLayout-V3, обеспечивая надежную и высококачественную производительность OCR в различных макетах документов.
GLM-OCR достигает передовых результатов, набирая 94.62 на OmniDocBench V1.5 и занимая 1-е место в общем зачете. Она превосходит в основных бенчмарках понимания документов, включая распознавание формул, распознавание таблиц и извлечение информации. Модель оптимизирована для реальных сценариев, поддерживая надежную производительность на сложных таблицах, документах с большим количеством кода, печатях и других сложных макетах.
С всего лишь 0.9B параметрами, GLM-OCR поддерживает развертывание через vLLM, SGLang и Ollama, снижая задержку вывода и вычислительные затраты. Это делает ее идеальной для услуг с высокой конкуренцией и развертывания на краю. Модель полностью открыта, оснащена комплексным SDK и инструментами вывода, предлагая простую установку, однострочный вызов и плавную интеграцию в существующие производственные конвейеры.
Официальный SDK рекомендуется для задач парсинга документов, интегрируя PP-DocLayoutV3 для анализа макета и генерации структурированного вывода. Это снижает инженерные затраты, необходимые для создания систем интеллектуального анализа документов от начала до конца. Модель GLM-OCR выпущена под лицензией MIT, полный конвейер OCR интегрирует PP-DocLayoutV3, лицензированный под лицензией Apache 2.0.
Главное о GLM-OCR
Мультимодальная модель OCR
Архитектура кодировщика-декодера GLM-V
Потери Multi-Token Prediction
Стабильное обучение с подкреплением
Визуальный кодировщик CogViT
Языковой декодер GLM-0.5B
Двухступенчатый конвейер
Передовая производительность
Начало работы с GLM-OCR
Доступ к странице: Посетите страницу GLM-OCR на Hugging Face
Загрузка модели: Скачайте модель GLM-OCR
Настройка окружения: Настройте необходимое окружение для модели
Интеграция: Используйте SDK для бесшовной интеграции
Варианты использования GLM-OCR
- Парсинг документов
- Извлечение информации
- Распознавание таблиц
- Распознавание формул
- Анализ макета








