الوصف
نموذج TrOCR هو نموذج قائم على المحولات مصمم خصيصًا لمهام التعرف على الأحرف البصرية (OCR). تم تطويره بواسطة مايكروسوفت وموجود على منصة Hugging Face، وقد تم ضبطه بدقة على مجموعة بيانات IAM. يستخدم نموذج ترميز-فك ترميز، حيث يتم تهيئة مشفر الصورة من أوزان BEiT، ويتم تهيئة مفكك النص من أوزان RoBERTa. يقوم النموذج بمعالجة الصور عن طريق تقسيمها إلى قطع ثابتة الحجم، والتي يتم تضمينها خطيًا وإدخالها في مشفر المحولات. يقوم مفكك النص بتوليد الرموز بشكل تلقائي، مما يسمح بالتعرف الدقيق على النص.
يعتبر نموذج TrOCR فعالًا بشكل خاص في التعرف على النصوص المكتوبة بخط اليد في الصور ذات السطر النصي الواحد، مما يجعله أداة قيمة للتطبيقات التي تتطلب التعرف على النصوص المكتوبة بخط اليد. يمكن للمستخدمين استكشاف مركز النموذج للحصول على إصدارات مضبوطة بدقة مصممة لمهام محددة. على الرغم من قوة النموذج، من المهم ملاحظة أنه قد يكون له قيود عند التعامل مع تخطيطات الصور المعقدة أو الخطوط غير القياسية.
تجعل مرونة النموذج وطبيعته مفتوحة المصدر متاحة لمجموعة واسعة من المستخدمين، من الباحثين إلى المطورين الذين يعملون على مشاريع التعرف على الأحرف البصرية. من خلال الاستفادة من النماذج المدربة مسبقًا، يقدم نموذج TrOCR حلاً قويًا لتحويل صور النصوص المكتوبة بخط اليد إلى نصوص رقمية، مما يسهل مهام مثل رقمنة الوثائق واستخراج البيانات.
أبرز ملامح نموذج TrOCR
بنية قائمة على المحولات
نموذج ترميز-فك ترميز
تم ضبطه بدقة على مجموعة بيانات IAM
مشفر صورة قائم على المحولات
مفكك نص قائم على المحولات
مهيأ من BEiT وRoBERTa
يعالج قطع الصور الثابتة الحجم
توليد الرموز بشكل تلقائي
البدء مع نموذج TrOCR
الوصول إلى الصفحة: زيارة صفحة نموذج Hugging Face
تحميل النموذج: تنزيل نموذج TrOCR
تهيئة البيئة: إعداد PyTorch لاستخدام النموذج
التكامل: تنفيذ TrOCR في خط أنابيب OCR الخاص بك
حالات استخدام نموذج TrOCR
- التعرف على النصوص المكتوبة بخط اليد
- رقمنة الوثائق
- استخراج البيانات
- بحث OCR
- تحويل النص









