설명
Windows Agent Arena(WAA)는 실제 Windows 운영 체제 내에서 추론, 계획 및 행동이 가능한 AI 에이전트를 평가하고 개발하는 데 따르는 어려움을 해결하기 위해 설계된 새롭고 오픈 소스인 프레임워크입니다. 기존의 벤치마크는 종종 제한된 모달리티 또는 도메인에 초점을 맞추며, 작업의 순차적인 특성으로 인해 전체 평가에 며칠이 소요되는 등 시간이 많이 걸립니다. WAA는 AI 에이전트가 광범위한 애플리케이션, 도구 및 웹 브라우저와 상호 작용할 수 있는 재현 가능하고 현실적인 Windows OS 환경을 제공하여 인간 사용자 경험을 반영합니다.
이 프레임워크는 병렬 실행을 위해 Azure ML 클라우드 인프라를 활용하여 에이전트의 대규모 배포를 지원합니다. 이를 통해 며칠이 아닌 몇 분 안에 수백 개의 작업을 벤치마킹할 수 있습니다. WAA는 문서 편집(LibreOffice Calc/Writer), 인터넷 브라우징(Microsoft Edge, Google Chrome), 시스템 작업(파일 탐색기, 설정), 코딩(Visual Studio Code), 미디어 재생(VLC Player) 및 유틸리티 기능(메모장, 시계, 그림판)과 같은 일반적인 Windows 워크로드를 포괄하는 154개 이상의 다양한 작업을 포함합니다. 작업 평가는 결정론적이며, 각 에피소드 끝에서 사용자 지정 스크립트가 보상을 생성합니다.
핵심적으로 WAA는 Windows 11 VM을 호스팅하는 Docker 컨테이너를 사용합니다. Python Flask 서버가 중개자 역할을 하여 VM 내에서 명령을 실행하고 관찰 결과를 반환합니다. 확장 가능한 클라우드 병렬 처리를 위해 Azure Machine Learning 작업을 사용하여 작업을 컴퓨팅 인스턴스 간에 균등하게 분배하고 결과를 집계합니다. 이 인프라는 프로토타이핑 중 유연한 로컬 실행과 강력한 클라우드 기반 벤치마킹을 지원합니다.
WAA의 기능을 시연하기 위해 Navi 에이전트가 도입되었습니다. Navi는 연쇄적 사고 프롬프팅을 사용하여 컴퓨터의 상태, 이전 작업에 대해 추론하고 다음 단계를 결정합니다. 입력에는 포그라운드 창 제목, 열려 있는 모든 창/탭의 제목, UIA 트리 파싱, DOM 트리 파싱, OCR, 아이콘/이미지 감지 및 OmniParser와 같은 다양한 방법을 통해 처리된 화면 표현이 포함됩니다. 초기 결과에 따르면 현재 모델이 인간보다 낮은 성능을 달성하지만, 화면 표현의 품질이 에이전트 성공에 크게 영향을 미치며, UIA 트리 파싱과 OmniParser의 아이콘 캡셔닝이 성능 향상을 보여줍니다.
WAA는 특히 복잡한 데스크톱 환경에서 작동하는 AI 에이전트 분야를 발전시키고자 하는 연구원 및 개발자에게 귀중한 리소스입니다. 엄격한 테스트, 에이전트 아키텍처의 비교 분석 및 향후 에이전트 개발을 위한 통찰력 생성을 촉진합니다.
Windows Agent Arena의 핵심 기능
AI 에이전트를 위한 확장 가능한 Windows OS 환경
다양한 애플리케이션을 통한 현실적인 데스크톱 상호 작용
멀티모달 AI 에이전트 지원
에이전트 워크플로 벤치마킹
Azure ML을 통한 병렬 실행
154개의 다양한 Windows 작업
결정론적 작업 평가
에이전트를 위한 연쇄적 사고 프롬프팅
다중 화면 표현 방법(UIA, DOM, OCR, 아이콘 감지, OmniParser)
오픈 소스 프레임워크
재현 가능한 연구 환경
Windows Agent Arena 사용 방법은?
Windows 11 VM이 포함된 Docker 컨테이너 설정
작업 스케줄링 및 에이전트 배포 구성
에이전트 입력 및 화면 파싱 방법 정의
로컬 또는 Azure ML에서 벤치마크 평가 실행
에이전트 성능 지표 및 로그 분석
Windows Agent Arena의 사용 사례
- AI 에이전트 벤치마킹
- 데스크톱 자동화 연구
- 멀티모달 에이전트 개발
- 재현 가능한 AI 연구
- 인간-AI 상호 작용 연구






