Описание
Windows Agent Arena (WAA) — это новая, открытая фреймворк, разработанная для решения задач оценки и разработки ИИ-агентов, способных к рассуждению, планированию и действиям в реальной операционной системе Windows. Традиционные бенчмарки часто фокусируются на ограниченных модальностях или доменах и требуют много времени, занимая дни для полной оценки из-за последовательного характера задач. WAA предлагает воспроизводимую и реалистичную среду ОС Windows, где ИИ-агенты могут взаимодействовать с широким спектром приложений, инструментов и веб-браузеров, имитируя пользовательский опыт человека.
Фреймворк поддерживает развертывание агентов в масштабе, используя облачную инфраструктуру Azure ML для параллельного выполнения. Это позволяет проводить бенчмаркинг сотен задач за минуты, а не дни. WAA включает более 154 разнообразных задач, охватывающих распространенные рабочие нагрузки Windows, такие как редактирование документов (LibreOffice Calc/Writer), просмотр интернета (Microsoft Edge, Google Chrome), системные задачи (Проводник, Параметры), кодирование (Visual Studio Code), воспроизведение медиа (VLC Player) и утилиты (Блокнот, Часы, Paint). Оценка задач детерминирована, с пользовательскими скриптами, генерирующими награды в конце каждого эпизода.
В основе WAA лежит Docker-контейнер, содержащий виртуальную машину Windows 11. Сервер Python Flask выступает в качестве посредника, выполняя команды внутри ВМ и возвращая наблюдения. Для масштабируемой облачной параллелизации используются задачи Azure Machine Learning, равномерно распределяющие задачи между вычислительными экземплярами и агрегирующие результаты. Эта инфраструктура поддерживает гибкое локальное выполнение во время прототипирования и надежный облачный бенчмаркинг.
Для демонстрации возможностей WAA был представлен агент Navi. Navi использует цепочку рассуждений (chain-of-thought prompting) для анализа состояния компьютера, предыдущих действий и принятия решения о следующем шаге. Его входные данные включают заголовок активного окна, заголовки всех открытых окон/вкладок и представление экрана, обработанное различными методами, такими как парсинг дерева UIA, парсинг дерева DOM, OCR, обнаружение иконок/изображений и OmniParser. Первоначальные результаты показывают, что, хотя текущие модели достигают более низкой производительности, чем люди, качество представления экрана значительно влияет на успех агента, при этом парсинг дерева UIA и распознавание подписей иконок OmniParser демонстрируют повышение производительности.
WAA является ценным ресурсом для исследователей и разработчиков, стремящихся продвинуть область ИИ-агентов, особенно тех, которые работают в сложных настольных средах. Он облегчает тщательное тестирование, сравнительный анализ архитектур агентов и получение инсайтов для будущей разработки агентов.
Основные функции Windows Agent Arena
Масштабируемая среда ОС Windows для ИИ-агентов
Реалистичное взаимодействие с рабочим столом и разнообразными приложениями
Поддержка мультимодальных ИИ-агентов
Бенчмаркинг рабочих процессов агентов
Параллельное выполнение через Azure ML
154 разнообразные задачи для Windows
Детерминированная оценка задач
Цепочка рассуждений (chain-of-thought prompting) для агентов
Множество методов представления экрана (UIA, DOM, OCR, обнаружение иконок, OmniParser)
Открытая фреймворк
Воспроизводимая исследовательская среда
Как использовать Windows Agent Arena?
Настройте Docker-контейнер с ВМ Windows 11
Настройте планирование задач и развертывание агентов
Определите входные данные агента и методы парсинга экрана
Запустите оценки бенчмаркинга локально или на Azure ML
Проанализируйте метрики производительности и логи агентов
Варианты использования Windows Agent Arena
- Бенчмаркинг ИИ-агентов
- Исследование автоматизации рабочего стола
- Разработка мультимодальных агентов
- Воспроизводимые исследования в области ИИ
- Исследования взаимодействия человека и ИИ






