Descripción
OmniParser es un método integral diseñado para analizar capturas de pantalla de interfaces de usuario en elementos estructurados, específicamente para agentes de IA. Aborda las limitaciones de los modelos de lenguaje de visión existentes, como GPT-4V, para interactuar con precisión con las interfaces de usuario en diferentes aplicaciones y sistemas operativos. La funcionalidad principal de OmniParser gira en torno a dos aspectos clave: identificar de forma fiable los iconos interactivos dentro de una interfaz de usuario y comprender la semántica de varios elementos en una captura de pantalla para asociar con precisión las acciones con las regiones de la pantalla.
Para lograr esto, OmniParser emplea un enfoque doble. Primero, utiliza un modelo de detección para analizar las regiones interactivas en la pantalla. Este modelo se ajusta con un conjunto de datos curado de detecciones de iconos interactivos derivadas de los árboles DOM de páginas web populares. Segundo, un modelo de subtítulos extrae la semántica funcional de los elementos detectados. Este modelo se entrena con un conjunto de datos de descripción de iconos. La combinación de estos dos modelos permite a OmniParser proporcionar información estructurada sobre la interfaz de usuario, incluidos los cuadros delimitadores de los iconos interactivos y las descripciones de su funcionalidad.
OmniParser mejora significativamente el rendimiento de los modelos de lenguaje de visión en puntos de referencia como ScreenSpot, Mind2Web y AITW. Se ha demostrado que supera a las líneas de base de GPT-4V, incluso cuando se utilizan solo entradas de captura de pantalla. Además, OmniParser está diseñado como un plugin, lo que lo hace compatible con otros modelos de lenguaje de visión como Phi-3.5-V y Llama-3.2-V. Esta capacidad de plugin permite una fácil integración y mejora de los modelos existentes.
La propuesta de valor de OmniParser radica en su capacidad para mejorar las capacidades de los agentes de IA que operan en las interfaces de usuario. Al proporcionar una técnica robusta de análisis de pantalla, OmniParser permite a estos agentes interactuar de manera más efectiva con varias aplicaciones y sistemas operativos. Esto conduce a un mejor rendimiento en los puntos de referencia y abre nuevas posibilidades para la automatización y la interacción con las interfaces digitales. El público objetivo incluye investigadores y desarrolladores que trabajan en agentes de IA, modelos de lenguaje de visión y automatización de la interfaz de usuario.
Características principales de OmniParser: Agente de GUI basado en visión
Analiza capturas de pantalla de la interfaz de usuario en elementos estructurados
Identifica iconos interactivos
Comprende la semántica de los elementos de la interfaz de usuario
Mejora el rendimiento de GPT-4V
Supera las líneas de base de GPT-4V en los puntos de referencia
Listo para plugin para otros modelos de lenguaje de visión
Utiliza un modelo de detección de regiones interactivas
Emplea la descripción de la funcionalidad de los iconos
Soporta Phi-3.5-V y Llama-3.2-V
Utiliza un conjunto de datos curado para el entrenamiento
Genera cuadros delimitadores e ID numéricos
Extrae descripciones de texto e iconos
¿Cómo usar OmniParser: Agente de GUI basado en visión?
Comprender el problema: Reconocer las limitaciones de los modelos de lenguaje de visión existentes en la interacción con la interfaz de usuario.
Usar la entrada: Proporcionar una tarea del usuario y una captura de pantalla de la interfaz de usuario como entrada.
Procesar la entrada: OmniParser analiza la captura de pantalla.
Recibir la salida: Obtener una captura de pantalla analizada con cuadros delimitadores y semántica local.
Integrar con modelos: Usar OmniParser como un plugin para modelos de lenguaje de visión como GPT-4V, Phi-3.5-V o Llama-3.2-V.
Evaluar el rendimiento: Evaluar el rendimiento mejorado en puntos de referencia como ScreenSpot, Mind2Web y AITW.
Refinar y optimizar: Ajustar el modelo para aplicaciones específicas o tipos de interfaz de usuario.
Casos de uso de OmniParser: Agente de GUI basado en visión
- Automatización de la interfaz de usuario
- Desarrollo de agentes de IA
- Mejora del modelo de lenguaje de visión
- Análisis de capturas de pantalla
- Mejora de los puntos de referencia
- Interacción multiplataforma
- Detección de iconos







