الوصف
OmniParser هي طريقة شاملة مصممة لتحليل لقطات شاشة واجهة المستخدم إلى عناصر منظمة، خاصة لوكلاء الذكاء الاصطناعي. إنه يعالج قيود نماذج لغة الرؤية الحالية، مثل GPT-4V، في التفاعل بدقة مع واجهات المستخدم عبر التطبيقات وأنظمة التشغيل المختلفة. تدور الوظيفة الأساسية لـ OmniParser حول جانبين رئيسيين: تحديد الأيقونات التفاعلية بشكل موثوق داخل واجهة المستخدم وفهم دلالات العناصر المختلفة في لقطة الشاشة لربط الإجراءات بدقة بمناطق الشاشة.
لتحقيق ذلك، يستخدم OmniParser نهجًا ذا شقين. أولاً، يستخدم نموذج الكشف لتحليل المناطق التفاعلية على الشاشة. يتم ضبط هذا النموذج بدقة باستخدام مجموعة بيانات منسقة من اكتشافات الأيقونات التفاعلية المشتقة من أشجار DOM لصفحات الويب الشائعة. ثانيًا، يستخرج نموذج التسمية التوضيحية الدلالات الوظيفية للعناصر المكتشفة. يتم تدريب هذا النموذج على مجموعة بيانات وصف الأيقونات. يتيح الجمع بين هذين النموذجين لـ OmniParser توفير معلومات منظمة حول واجهة المستخدم، بما في ذلك مربعات الإحاطة للأيقونات التفاعلية وأوصاف وظائفها.
يعمل OmniParser على تحسين أداء نماذج لغة الرؤية بشكل كبير في المعايير مثل ScreenSpot و Mind2Web و AITW. لقد ثبت أنه يتفوق على خطوط الأساس الخاصة بـ GPT-4V، حتى عند استخدام مدخلات لقطات الشاشة فقط. علاوة على ذلك، تم تصميم OmniParser كمكون إضافي، مما يجعله متوافقًا مع نماذج لغة الرؤية الأخرى مثل Phi-3.5-V و Llama-3.2-V. تتيح إمكانية المكون الإضافي هذه سهولة التكامل وتعزيز النماذج الحالية.
تكمن قيمة OmniParser في قدرته على تعزيز قدرات وكلاء الذكاء الاصطناعي الذين يعملون على واجهات المستخدم. من خلال توفير تقنية تحليل شاشة قوية، يمكّن OmniParser هؤلاء الوكلاء من التفاعل بشكل أكثر فعالية مع التطبيقات وأنظمة التشغيل المختلفة. يؤدي هذا إلى تحسين الأداء في المعايير ويفتح إمكانيات جديدة للأتمتة والتفاعل مع الواجهات الرقمية. يشمل الجمهور المستهدف الباحثين والمطورين الذين يعملون على وكلاء الذكاء الاصطناعي ونماذج لغة الرؤية وأتمتة واجهة المستخدم.
الميزات الأساسية لـ OmniParser: وكيل واجهة المستخدم الرسومية القائم على الرؤية
تحليل لقطات شاشة واجهة المستخدم إلى عناصر منظمة
تحديد الأيقونات التفاعلية
فهم دلالات عناصر واجهة المستخدم
يحسن أداء GPT-4V
يتفوق على خطوط الأساس الخاصة بـ GPT-4V في المعايير
جاهز كمكون إضافي لنماذج لغة الرؤية الأخرى
يستخدم نموذج اكتشاف المنطقة التفاعلية
يوظف وصف وظيفة الأيقونة
يدعم Phi-3.5-V و Llama-3.2-V
يستخدم مجموعة بيانات منسقة للتدريب
ينشئ مربعات إحاطة ومعرفات رقمية
يستخرج أوصاف النص والأيقونات
كيفية استخدام OmniParser: وكيل واجهة المستخدم الرسومية القائم على الرؤية؟
فهم المشكلة: التعرف على قيود نماذج لغة الرؤية الحالية في تفاعل واجهة المستخدم.
استخدام المدخلات: تقديم مهمة مستخدم ولقطة شاشة لواجهة المستخدم كمدخلات.
معالجة المدخلات: يقوم OmniParser بتحليل لقطة الشاشة.
تلقي المخرجات: الحصول على لقطة شاشة محللة مع مربعات إحاطة ودلالات محلية.
التكامل مع النماذج: استخدم OmniParser كمكون إضافي لنماذج لغة الرؤية مثل GPT-4V أو Phi-3.5-V أو Llama-3.2-V.
تقييم الأداء: تقييم الأداء المحسن في معايير مثل ScreenSpot و Mind2Web و AITW.
التحسين والتحسين: اضبط النموذج بدقة لتطبيقات أو أنواع واجهة مستخدم معينة.
حالات استخدام OmniParser: وكيل واجهة المستخدم الرسومية القائم على الرؤية
- أتمتة واجهة المستخدم
- تطوير وكيل الذكاء الاصطناعي
- تحسين نموذج لغة الرؤية
- تحليل لقطات الشاشة
- تحسين المعايير
- التفاعل عبر الأنظمة الأساسية
- اكتشاف الأيقونات







