Description
OmniParser est une méthode complète conçue pour analyser les captures d'écran d'interface utilisateur en éléments structurés, spécifiquement pour les agents d'IA. Il répond aux limites des modèles de langage visuels existants, tels que GPT-4V, en interagissant avec précision avec les interfaces utilisateur sur différentes applications et systèmes d'exploitation. La fonctionnalité principale d'OmniParser s'articule autour de deux aspects clés : identifier de manière fiable les icônes interactives au sein d'une interface utilisateur et comprendre la sémantique des différents éléments d'une capture d'écran afin d'associer avec précision les actions aux zones de l'écran.
Pour ce faire, OmniParser utilise une approche en deux volets. Tout d'abord, il utilise un modèle de détection pour analyser les zones interactives à l'écran. Ce modèle est affiné à l'aide d'un ensemble de données organisé de détections d'icônes interactives dérivées des arborescences DOM des pages Web populaires. Deuxièmement, un modèle de légende extrait la sémantique fonctionnelle des éléments détectés. Ce modèle est entraîné sur un ensemble de données de description d'icônes. La combinaison de ces deux modèles permet à OmniParser de fournir des informations structurées sur l'interface utilisateur, notamment les boîtes englobantes des icônes interactives et les descriptions de leurs fonctionnalités.
OmniParser améliore considérablement les performances des modèles de langage visuels sur des benchmarks tels que ScreenSpot, Mind2Web et AITW. Il a été démontré qu'il surpasse les bases de référence de GPT-4V, même en utilisant uniquement des entrées de capture d'écran. De plus, OmniParser est conçu comme un plugin, ce qui le rend compatible avec d'autres modèles de langage visuels tels que Phi-3.5-V et Llama-3.2-V. Cette capacité de plugin permet une intégration et une amélioration faciles des modèles existants.
La proposition de valeur d'OmniParser réside dans sa capacité à améliorer les capacités des agents d'IA opérant sur les interfaces utilisateur. En fournissant une technique robuste d'analyse d'écran, OmniParser permet à ces agents d'interagir plus efficacement avec diverses applications et systèmes d'exploitation. Cela conduit à une amélioration des performances sur les benchmarks et ouvre de nouvelles possibilités d'automatisation et d'interaction avec les interfaces numériques. Le public cible comprend les chercheurs et les développeurs travaillant sur les agents d'IA, les modèles de langage visuels et l'automatisation de l'interface utilisateur.
Fonctionnalités principales de OmniParser: Agent GUI basé sur la vision
Analyse les captures d'écran de l'interface utilisateur en éléments structurés
Identifie les icônes interactives
Comprend la sémantique des éléments de l'interface utilisateur
Améliore les performances de GPT-4V
Surpasse les bases de référence de GPT-4V sur les benchmarks
Prêt pour le plugin pour d'autres modèles de langage visuels
Utilise un modèle de détection de zone interactive
Emploie la description des fonctionnalités des icônes
Prend en charge Phi-3.5-V et Llama-3.2-V
Utilise un ensemble de données organisé pour l'entraînement
Génère des boîtes englobantes et des identifiants numériques
Extrait des descriptions de texte et d'icônes
Comment utiliser OmniParser: Agent GUI basé sur la vision ?
Comprendre le problème : reconnaître les limites des modèles de langage visuels existants dans l'interaction avec l'interface utilisateur.
Utiliser l'entrée : fournir une tâche utilisateur et une capture d'écran de l'interface utilisateur en entrée.
Traiter l'entrée : OmniParser analyse la capture d'écran.
Recevoir la sortie : obtenir une capture d'écran analysée avec des boîtes englobantes et une sémantique locale.
Intégrer avec les modèles : utiliser OmniParser comme un plugin pour les modèles de langage visuels comme GPT-4V, Phi-3.5-V ou Llama-3.2-V.
Évaluer les performances : évaluer l'amélioration des performances sur des benchmarks tels que ScreenSpot, Mind2Web et AITW.
Affiner et optimiser : affiner le modèle pour des applications ou des types d'interface utilisateur spécifiques.
Cas d'utilisation de OmniParser: Agent GUI basé sur la vision
- Automatisation de l'interface utilisateur
- Développement d'agents d'IA
- Amélioration des modèles de langage visuels
- Analyse de captures d'écran
- Amélioration des benchmarks
- Interaction multiplateforme
- Détection d'icônes







