تخطَّ إلى المحتوى الرئيسي
ToolPotion

GLM-OCR

GLM-OCR هو نموذج OCR متعدد الوسائط مصمم لفهم الوثائق المعقدة. يعزز كفاءة التدريب ودقة التعرف باستخدام خسارة التنبؤ متعدد الرموز والتعلم المعزز المستقر. النموذج مُحسّن للسيناريوهات الواقعية، مما يوفر أداءً قويًا عبر تخطيطات الوثائق المتنوعة.

عرض النموذج
مشاركة

الوصف

GLM-OCR هو نموذج OCR متعدد الوسائط متطور تم تطويره لفهم الوثائق المعقدة. يعتمد على بنية GLM-V للترميز وفك الترميز، ويقدم تقنيات مبتكرة مثل خسارة التنبؤ متعدد الرموز (MTP) والتعلم المعزز المستقر. تعزز هذه التطورات بشكل كبير كفاءة التدريب ودقة التعرف وقدرات التعميم.

يتكامل النموذج مع مشفر الصور CogViT، المدرب مسبقًا على بيانات الصور والنصوص الواسعة، وموصل خفيف الوزن عبر الوسائط مع تقليل فعال للرموز. كما يتميز بفك ترميز اللغة GLM-0.5B. تشكل هذه المكونات معًا خط أنابيب من مرحلتين لتحليل التخطيط والتعرف المتوازي بناءً على PP-DocLayout-V3، مما يضمن أداءً قويًا وعالي الجودة في OCR عبر تخطيطات الوثائق المختلفة.

يحقق GLM-OCR نتائج رائدة، حيث سجل 94.62 على OmniDocBench V1.5 واحتل المرتبة الأولى بشكل عام. يتفوق في المعايير الرئيسية لفهم الوثائق، بما في ذلك التعرف على الصيغ، والتعرف على الجداول، واستخراج المعلومات. النموذج مُحسّن للسيناريوهات الواقعية، حيث يحافظ على أداء قوي في الجداول المعقدة، والوثائق التي تحتوي على أكواد، والأختام، وغيرها من التخطيطات التحدي.

مع وجود 0.9 مليار معلمة فقط، يدعم GLM-OCR النشر عبر vLLM وSGLang وOllama، مما يقلل من زمن الاستدلال وتكاليف الحوسبة. مما يجعله مثاليًا للخدمات ذات التزامن العالي والنشر على الحافة. النموذج مفتوح المصدر بالكامل، مزود بمجموعة أدوات تطوير البرمجيات الشاملة وأدوات الاستدلال، مما يوفر تثبيتًا بسيطًا، واستدعاءً من سطر واحد، وتكاملًا سلسًا في خطوط الإنتاج الحالية.

توصى مجموعة أدوات تطوير البرمجيات الرسمية لمهام تحليل الوثائق، حيث تتكامل مع PP-DocLayoutV3 لتحليل التخطيط وتوليد المخرجات المنظمة. يقلل هذا من العبء الهندسي المطلوب لبناء أنظمة ذكاء وثائق شاملة. تم إصدار نموذج GLM-OCR بموجب ترخيص MIT، مع خط أنابيب OCR الكامل الذي يتكامل مع PP-DocLayoutV3، المرخص بموجب ترخيص Apache 2.0.

أبرز ملامح GLM-OCR

  • نموذج OCR متعدد الوسائط

  • بنية GLM-V للترميز وفك الترميز

  • خسارة التنبؤ متعدد الرموز

  • التعلم المعزز المستقر

  • مشفر الصور CogViT

  • فك ترميز اللغة GLM-0.5B

  • خط أنابيب من مرحلتين

  • أداء رائد

البدء مع GLM-OCR

  1. الوصول إلى الصفحة: زيارة صفحة GLM-OCR على Hugging Face

  2. تحميل النموذج: تنزيل نموذج GLM-OCR

  3. تكوين البيئة: إعداد البيئة المطلوبة للنموذج

  4. التكامل: استخدام مجموعة أدوات تطوير البرمجيات للتكامل السلس

حالات استخدام GLM-OCR

  • تحليل الوثائق
  • استخراج المعلومات
  • التعرف على الجداول
  • التعرف على الصيغ
  • تحليل التخطيط

الأسئلة الشائعة من GLM-OCR

From Zhipu AI

a model in GLM-4.5 من Zhipu AI.

تقييمات GLM-OCR

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل GLM-OCR

نماذج الذكاء الاصطناعي

LayoutLM هو نموذج تدريب مسبق متعدد الوسائط لفهم المستندات الغنية بصريًا واستخراج المعلومات. يجمع بين معلومات النص والتخطيط والصورة لتحقيق نتائج متطورة في مهام مثل فهم النماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

نموذج TrOCR هو نموذج ترميز-فك ترميز مصمم لمهام التعرف على الأحرف البصرية (OCR). يستخدم بنية قائمة على المحولات لمعالجة الصور وتوليد النص، مما يجعله مناسبًا للتعرف على النصوص…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

نموذج GOT-OCR2.0 هو نموذج متقدم للتعرف على النصوص مصمم لتحقيق كفاءة عالية في التعرف على النصوص. يعتمد على نهج موحد شامل لتحسين الدقة والأداء، مما يجعله مثالياً لمجموعة متنوعة من…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

RolmOCR من Reducto AI هو أداة OCR مفتوحة المصدر تقدم معالجة أسرع واستخدام ذاكرة أقل مقارنة بسابقتها، olmOCR. تم تصميمها للتعامل بكفاءة مع أنواع مختلفة من الوثائق دون استخدام…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

فلورنس-2 هو نموذج متقدم للرؤية من مايكروسوفت، مصمم للتعامل مع مجموعة متنوعة من مهام الرؤية والرؤية-اللغة. يستخدم نهجًا قائمًا على المطالبات لمهام مثل التسمية واكتشاف الكائنات،…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Llama-3.2-11B-Vision-Instruct هو نموذج ذكاء اصطناعي متعدد الوسائط مصمم للتعرف البصري، واستنتاج الصور، والتعليق. تم تطويره بواسطة ميتا، ويجمع بين مدخلات النص والصورة لتقديم قدرات…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

LLaVA هو نموذج متعدد الوسائط كبير يجمع بين مشفر الرؤية ونموذج لغوي للفهم البصري واللغوي للأغراض العامة. يتفوق في قدرات الدردشة متعددة الوسائط، محاكياً GPT-4، ويحقق دقة متطورة في…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Llama-4-Scout-17B-16E-Instruct هو نموذج ذكاء اصطناعي متعدد الوسائط مصمم بواسطة ميتا. يستفيد من بنية مزيج من الخبراء لتوفير قدرات متقدمة في فهم النصوص والصور، ويدعم المخرجات متعددة…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة