الوصف
RolmOCR هي أداة OCR متقدمة تم تطويرها بواسطة Reducto AI، مصممة لتعزيز قدرات تحليل الوثائق باستخدام نموذج اللغة البصرية Qwen2-VL-7B. تم إصدارها بموجب ترخيص Apache 2.0، وتعمل RolmOCR كبديل مباشر للأداة السابقة olmOCR، حيث تقدم سرعة محسنة واستخدام ذاكرة مخفض. هذه الأداة فعالة بشكل خاص في معالجة الوثائق المعقدة مثل ملفات PDF، دون الاعتماد على مدخلات البيانات الوصفية، مما يساعد في تقليل طول الطلب واستخدام VRAM مع الحفاظ على الدقة.
تضمن تطوير RolmOCR تغييرات كبيرة، بما في ذلك استخدام نموذج أساسي أحدث، Qwen2.5-VL-7B، وتدوير 15% من بيانات التدريب لتحسين المتانة ضد الوثائق المائلة. على الرغم من هذه التحسينات، تشترك RolmOCR في بعض القيود الشائعة لحلول OCR المعتمدة على VLM، مثل الهلوسة المحتملة أو حذف المحتوى. بالإضافة إلى ذلك، لا تدعم حدود تخطيط المربعات، على عكس واجهة برمجة التطبيقات Reducto Parsing.
تعتبر RolmOCR مناسبة للمستخدمين الذين يبحثون عن حل فعال ومفتوح المصدر لمهام OCR الخاصة بالوثائق. يمكن استضافتها مع vLLM والوصول إليها عبر خادم متوافق مع OpenAI، مما يجعلها متعددة الاستخدامات لمجموعة متنوعة من التطبيقات. على الرغم من عدم تقييم النسخ الكمية، فإن الطبيعة المفتوحة المصدر للأداة تسمح بمزيد من الاستكشاف والتطوير من قبل المجتمع.
أبرز ملامح RolmOCR
أداة OCR مفتوحة المصدر
تستخدم نموذج Qwen2-VL-7B
معالجة أسرع
استخدام ذاكرة مخفض
لا مدخلات بيانات وصفية
ترخيص Apache 2.0
متينة ضد الوثائق المائلة
متوافقة مع خادم OpenAI
البدء مع RolmOCR
الوصول إلى الصفحة: زيارة صفحة نموذج Hugging Face
تحميل النموذج: تهيئة RolmOCR في بيئتك
تهيئة البيئة: إعداد استضافة vLLM
التكامل: الاتصال عبر خادم متوافق مع OpenAI
التعديل الدقيق: ضبط إعدادات النموذج لمهام محددة
حالات استخدام RolmOCR
- تحليل الوثائق
- تحسين الذاكرة
- تطوير مفتوح المصدر
- التعامل مع الوثائق المائلة
- التكامل مع OpenAI








