تخطَّ إلى المحتوى الرئيسي
ToolPotion

OmniParser: وكيل واجهة المستخدم الرسومية القائم على الرؤية

OmniParser هي طريقة لتحليل لقطات شاشة واجهة المستخدم إلى عناصر منظمة. إنه يعزز قدرة نماذج لغة الرؤية مثل GPT-4V على توليد إجراءات على الواجهات. يحدد OmniParser الأيقونات التفاعلية ويفهم دلالات العناصر، مما يحسن الأداء في المعايير. إنه مصمم كمكون إضافي لنماذج لغة الرؤية المختلفة.

عرض النموذج
مشاركة

الوصف

OmniParser هي طريقة شاملة مصممة لتحليل لقطات شاشة واجهة المستخدم إلى عناصر منظمة، خاصة لوكلاء الذكاء الاصطناعي. إنه يعالج قيود نماذج لغة الرؤية الحالية، مثل GPT-4V، في التفاعل بدقة مع واجهات المستخدم عبر التطبيقات وأنظمة التشغيل المختلفة. تدور الوظيفة الأساسية لـ OmniParser حول جانبين رئيسيين: تحديد الأيقونات التفاعلية بشكل موثوق داخل واجهة المستخدم وفهم دلالات العناصر المختلفة في لقطة الشاشة لربط الإجراءات بدقة بمناطق الشاشة.

لتحقيق ذلك، يستخدم OmniParser نهجًا ذا شقين. أولاً، يستخدم نموذج الكشف لتحليل المناطق التفاعلية على الشاشة. يتم ضبط هذا النموذج بدقة باستخدام مجموعة بيانات منسقة من اكتشافات الأيقونات التفاعلية المشتقة من أشجار DOM لصفحات الويب الشائعة. ثانيًا، يستخرج نموذج التسمية التوضيحية الدلالات الوظيفية للعناصر المكتشفة. يتم تدريب هذا النموذج على مجموعة بيانات وصف الأيقونات. يتيح الجمع بين هذين النموذجين لـ OmniParser توفير معلومات منظمة حول واجهة المستخدم، بما في ذلك مربعات الإحاطة للأيقونات التفاعلية وأوصاف وظائفها.

يعمل OmniParser على تحسين أداء نماذج لغة الرؤية بشكل كبير في المعايير مثل ScreenSpot و Mind2Web و AITW. لقد ثبت أنه يتفوق على خطوط الأساس الخاصة بـ GPT-4V، حتى عند استخدام مدخلات لقطات الشاشة فقط. علاوة على ذلك، تم تصميم OmniParser كمكون إضافي، مما يجعله متوافقًا مع نماذج لغة الرؤية الأخرى مثل Phi-3.5-V و Llama-3.2-V. تتيح إمكانية المكون الإضافي هذه سهولة التكامل وتعزيز النماذج الحالية.

تكمن قيمة OmniParser في قدرته على تعزيز قدرات وكلاء الذكاء الاصطناعي الذين يعملون على واجهات المستخدم. من خلال توفير تقنية تحليل شاشة قوية، يمكّن OmniParser هؤلاء الوكلاء من التفاعل بشكل أكثر فعالية مع التطبيقات وأنظمة التشغيل المختلفة. يؤدي هذا إلى تحسين الأداء في المعايير ويفتح إمكانيات جديدة للأتمتة والتفاعل مع الواجهات الرقمية. يشمل الجمهور المستهدف الباحثين والمطورين الذين يعملون على وكلاء الذكاء الاصطناعي ونماذج لغة الرؤية وأتمتة واجهة المستخدم.

أبرز ملامح OmniParser: وكيل واجهة المستخدم الرسومية القائم على الرؤية

  • تحليل لقطات شاشة واجهة المستخدم إلى عناصر منظمة

  • تحديد الأيقونات التفاعلية

  • فهم دلالات عناصر واجهة المستخدم

  • يحسن أداء GPT-4V

  • يتفوق على خطوط الأساس الخاصة بـ GPT-4V في المعايير

  • جاهز كمكون إضافي لنماذج لغة الرؤية الأخرى

  • يستخدم نموذج اكتشاف المنطقة التفاعلية

  • يوظف وصف وظيفة الأيقونة

  • يدعم Phi-3.5-V و Llama-3.2-V

  • يستخدم مجموعة بيانات منسقة للتدريب

  • ينشئ مربعات إحاطة ومعرفات رقمية

  • يستخرج أوصاف النص والأيقونات

البدء مع OmniParser: وكيل واجهة المستخدم الرسومية القائم على الرؤية

  1. فهم المشكلة: التعرف على قيود نماذج لغة الرؤية الحالية في تفاعل واجهة المستخدم.

  2. استخدام المدخلات: تقديم مهمة مستخدم ولقطة شاشة لواجهة المستخدم كمدخلات.

  3. معالجة المدخلات: يقوم OmniParser بتحليل لقطة الشاشة.

  4. تلقي المخرجات: الحصول على لقطة شاشة محللة مع مربعات إحاطة ودلالات محلية.

  5. التكامل مع النماذج: استخدم OmniParser كمكون إضافي لنماذج لغة الرؤية مثل GPT-4V أو Phi-3.5-V أو Llama-3.2-V.

  6. تقييم الأداء: تقييم الأداء المحسن في معايير مثل ScreenSpot و Mind2Web و AITW.

  7. التحسين والتحسين: اضبط النموذج بدقة لتطبيقات أو أنواع واجهة مستخدم معينة.

حالات استخدام OmniParser: وكيل واجهة المستخدم الرسومية القائم على الرؤية

  • أتمتة واجهة المستخدم
  • تطوير وكيل الذكاء الاصطناعي
  • تحسين نموذج لغة الرؤية
  • تحليل لقطات الشاشة
  • تحسين المعايير
  • التفاعل عبر الأنظمة الأساسية
  • اكتشاف الأيقونات

الأسئلة الشائعة من OmniParser: وكيل واجهة المستخدم الرسومية القائم على الرؤية

From Microsoft

تقييمات OmniParser: وكيل واجهة المستخدم الرسومية القائم على الرؤية

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل OmniParser: وكيل واجهة المستخدم الرسومية القائم على الرؤية

نماذج الذكاء الاصطناعي

نموذج Command A+ هو نموذج مزيج من الخبراء يحتوي على 25 مليار معلمة نشطة و218 مليار معلمة إجمالية، مصمم للتفكير المعقد، والرؤية، والمهام متعددة اللغات عبر 48 لغة، مما يوفر حلولاً…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

مستودعات GitHub للذكاء الاصطناعي

LLaVA هو نموذج ضبط التعليمات المرئية يجمع بين قدرات اللغة والرؤية الكبيرة. يهدف إلى تحقيق أداء بمستوى GPT-4V، مما يتيح الفهم والتفاعل متعدد الوسائط. يوفر المشروع التعليمات…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نموذج GPT Image 2 هو نموذج متقدم لتوليد الصور من OpenAI، مصمم لإنشاء وتحرير الصور بسرعة وجودة عالية. يدعم أحجام صور متنوعة ومدخلات عالية الدقة، مما يجعله مناسبًا لتطبيقات متنوعة…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

فلورنس-2 هو نموذج متقدم للرؤية من مايكروسوفت، مصمم للتعامل مع مجموعة متنوعة من مهام الرؤية والرؤية-اللغة. يستخدم نهجًا قائمًا على المطالبات لمهام مثل التسمية واكتشاف الكائنات،…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

مستودعات GitHub للذكاء الاصطناعي

كود مفتوح المصدر لـ MiniGPT-4 و MiniGPT-v2، نماذج لغوية كبيرة متقدمة تعزز فهم الرؤية واللغة. تتيح هذه النماذج التعلم متعدد المهام لمهام الرؤية واللغة، وتقدم قدرات لفهم الصور…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

يتيح SAM 3 للمستخدمين استخدام النصوص والمحفزات البصرية لتحديد الأجسام بدقة، وتقسيمها، وتتبعها في الصور أو الفيديوهات. سيكون متاحًا قريبًا في تطبيقات Instagram Edits وVibes على…

مميزةأدوات الرؤية الحاسوبية

نماذج الذكاء الاصطناعي

MMAction2 هي مكتبة أساسية لمهام التعرف على الإجراءات وفهم الفيديو. توفر مجموعة أدوات شاملة لتطوير ونشر نماذج تحليل الفيديو المتطورة، مبنية على PyTorch ومتكاملة مع نظام OpenMMLab…

أدوات الرؤية الحاسوبية

نماذج اللغة الكبيرة

الخطوة 3.7 فلاش هو نموذج متعدد الوسائط عالي الأداء مصمم لعمليات الوكيل الحقيقية. يتفوق في الفهم البصري، والتنفيذ المستقر، والتوافق العميق مع أطر الوكيل الرئيسية.

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة