تخطَّ إلى المحتوى الرئيسي
ToolPotion

RolmOCR

RolmOCR من Reducto AI هو أداة OCR مفتوحة المصدر تقدم معالجة أسرع واستخدام ذاكرة أقل مقارنة بسابقتها، olmOCR. تم تصميمها للتعامل بكفاءة مع أنواع مختلفة من الوثائق دون استخدام مدخلات البيانات الوصفية.

عرض النموذج
مشاركة

الوصف

RolmOCR هي أداة OCR متقدمة تم تطويرها بواسطة Reducto AI، مصممة لتعزيز قدرات تحليل الوثائق باستخدام نموذج اللغة البصرية Qwen2-VL-7B. تم إصدارها بموجب ترخيص Apache 2.0، وتعمل RolmOCR كبديل مباشر للأداة السابقة olmOCR، حيث تقدم سرعة محسنة واستخدام ذاكرة مخفض. هذه الأداة فعالة بشكل خاص في معالجة الوثائق المعقدة مثل ملفات PDF، دون الاعتماد على مدخلات البيانات الوصفية، مما يساعد في تقليل طول الطلب واستخدام VRAM مع الحفاظ على الدقة.

تضمن تطوير RolmOCR تغييرات كبيرة، بما في ذلك استخدام نموذج أساسي أحدث، Qwen2.5-VL-7B، وتدوير 15% من بيانات التدريب لتحسين المتانة ضد الوثائق المائلة. على الرغم من هذه التحسينات، تشترك RolmOCR في بعض القيود الشائعة لحلول OCR المعتمدة على VLM، مثل الهلوسة المحتملة أو حذف المحتوى. بالإضافة إلى ذلك، لا تدعم حدود تخطيط المربعات، على عكس واجهة برمجة التطبيقات Reducto Parsing.

تعتبر RolmOCR مناسبة للمستخدمين الذين يبحثون عن حل فعال ومفتوح المصدر لمهام OCR الخاصة بالوثائق. يمكن استضافتها مع vLLM والوصول إليها عبر خادم متوافق مع OpenAI، مما يجعلها متعددة الاستخدامات لمجموعة متنوعة من التطبيقات. على الرغم من عدم تقييم النسخ الكمية، فإن الطبيعة المفتوحة المصدر للأداة تسمح بمزيد من الاستكشاف والتطوير من قبل المجتمع.

أبرز ملامح RolmOCR

  • أداة OCR مفتوحة المصدر

  • تستخدم نموذج Qwen2-VL-7B

  • معالجة أسرع

  • استخدام ذاكرة مخفض

  • لا مدخلات بيانات وصفية

  • ترخيص Apache 2.0

  • متينة ضد الوثائق المائلة

  • متوافقة مع خادم OpenAI

البدء مع RolmOCR

  1. الوصول إلى الصفحة: زيارة صفحة نموذج Hugging Face

  2. تحميل النموذج: تهيئة RolmOCR في بيئتك

  3. تهيئة البيئة: إعداد استضافة vLLM

  4. التكامل: الاتصال عبر خادم متوافق مع OpenAI

  5. التعديل الدقيق: ضبط إعدادات النموذج لمهام محددة

حالات استخدام RolmOCR

  • تحليل الوثائق
  • تحسين الذاكرة
  • تطوير مفتوح المصدر
  • التعامل مع الوثائق المائلة
  • التكامل مع OpenAI

الأسئلة الشائعة من RolmOCR

تقييمات RolmOCR

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل RolmOCR

نماذج الذكاء الاصطناعي

نموذج GOT-OCR2.0 هو نموذج متقدم للتعرف على النصوص مصمم لتحقيق كفاءة عالية في التعرف على النصوص. يعتمد على نهج موحد شامل لتحسين الدقة والأداء، مما يجعله مثالياً لمجموعة متنوعة من…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

نموذج TrOCR هو نموذج ترميز-فك ترميز مصمم لمهام التعرف على الأحرف البصرية (OCR). يستخدم بنية قائمة على المحولات لمعالجة الصور وتوليد النص، مما يجعله مناسبًا للتعرف على النصوص…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

GLM-OCR هو نموذج OCR متعدد الوسائط مصمم لفهم الوثائق المعقدة. يعزز كفاءة التدريب ودقة التعرف باستخدام خسارة التنبؤ متعدد الرموز والتعلم المعزز المستقر. النموذج مُحسّن للسيناريوهات…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

LayoutLM هو نموذج تدريب مسبق متعدد الوسائط لفهم المستندات الغنية بصريًا واستخراج المعلومات. يجمع بين معلومات النص والتخطيط والصورة لتحقيق نتائج متطورة في مهام مثل فهم النماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Unlimited-OCR هو نموذج متقدم للتعرف الضوئي على الأحرف مصمم لتعزيز تحليل النصوص على المدى الطويل. يستفيد من تقنيات الذكاء الاصطناعي مفتوحة المصدر لتوفير استخراج نصوص فعال ودقيق من…

مميزةكشط الويب واستخراج البيانات

تطبيقات الذكاء الاصطناعي

Dots.OCR هي أداة مدعومة بالذكاء الاصطناعي مصممة للتعرف على الأحرف البصرية. تتيح للمستخدمين رفع المستندات ومعالجتها واستخراج النص بكفاءة. تدعم الأداة التعرف على المهام الفردية…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

OLOCR هي أداة مجانية عبر الإنترنت للتعرف الضوئي على الحروف بالذكاء الاصطناعي تستخرج النصوص من الصور وملفات PDF. توفر دقة عالية مع تصحيح اختياري بالذكاء الاصطناعي لنتائج أنظف. لا…

أدوات المستندات وملفات PDF بالذكاء الاصطناعي

مستودعات GitHub للذكاء الاصطناعي

PaddleOCR هو مجموعة أدوات OCR قوية وخفيفة الوزن مصممة لتحويل مستندات PDF والصور إلى بيانات منظمة لتطبيقات الذكاء الاصطناعي. يدعم أكثر من 100 لغة ويجسر الفجوة بين الصور وملفات PDF…

أدوات الرؤية الحاسوبية