설명
강화 학습(RL) 에이전트는 종종 작업별 학습 및 샘플 효율성 측면에서 어려움을 겪습니다. Plan2Explore는 새로운 자체 지도 강화 학습 접근 방식을 도입하여 이러한 한계를 해결합니다. 이 에이전트는 탐색에 뛰어나고 사전 지식 없이 새롭고 보지 못한 작업에 빠르게 적응하도록 설계되었습니다.
탐색 단계 동안 Plan2Explore는 이전 방법과 달리 새로움을 발견하기 위해 계획을 선제적으로 사용하여 차별화됩니다. 에이전트는 관찰에 도달한 후 사후적으로 관찰의 새로움을 평가하는 대신 전략적으로 예상되는 미래의 새로움을 찾습니다. 이러한 계획 주도 탐색은 보다 효율적인 데이터 수집과 환경에 대한 풍부한 이해를 가능하게 합니다.
탐색 단계 이후 Plan2Explore는 놀라운 적응성을 보여줍니다. 제로 또는 몇 번의 작업별 상호 작용만으로도 서기, 걷기, 달리기와 같은 다양한 다운스트림 작업에 대해 빠르게 미세 조정할 수 있습니다. 이 기능은 광범위한 작업별 학습 데이터 및 상호 작용의 필요성을 크게 줄여 매우 다재다능합니다.
이 에이전트는 고차원 이미지 입력을 포함하는 복잡한 제어 작업에서 엄격하게 평가되었습니다. 이러한 평가에서 Plan2Explore는 훈련 감독이나 작업별 보상이 없는 상태에서도 기존의 자체 지도 탐색 방법보다 뛰어난 성능을 달성했습니다. 그 성능은 보상에 접근할 수 있는 오라클 에이전트의 성능에 근접하여 효과를 강조했습니다.
Plan2Explore의 아키텍처를 통해 작업별 보상과 독립적으로 자체 지도 탐색을 통해 전역 세계 모델을 먼저 학습할 수 있습니다. 이 기본 모델이 설정되면 에이전트는 다양한 작업에 대해 다양한 보상 함수에 적응할 수 있으며, 이는 탐색 및 활용 학습의 강력한 분리를 보여줍니다.
이 프로젝트는 GitHub에서 사용할 수 있는 Tensorflow로 Plan2Explore의 오픈 소스 구현을 제공하여 자체 지도 강화 학습 분야의 추가 연구 및 개발을 장려합니다. 이 릴리스는 연구원 및 실무자가 Plan2Explore 프레임워크를 실험하고 구축하는 데 쉽게 접근할 수 있도록 합니다.
Plan2Explore 하이라이트
자체 지도 강화 학습 에이전트
효율적인 탐색을 위한 계획 활용
예상되는 미래의 새로움 추구
새로운 작업에 대한 제로샷 또는 퓨샷 적응 가능
탐색 중 전역 세계 모델 학습
고차원 이미지 입력 처리
이전 자체 지도 탐색 방법보다 뛰어난 성능
보상 접근 가능한 오라클 성능에 근접
Tensorflow에서 사용 가능한 오픈 소스 구현
Plan2Explore 시작하기
모델 액세스: Plan2Explore 에이전트 구현을 얻습니다.
환경 설정: 실행에 필요한 소프트웨어 및 하드웨어를 구성합니다.
탐색: 자체 지도 방식으로 에이전트를 실행하여 세계 모델을 학습합니다.
작업에 적응: 특정 다운스트림 작업을 위해 에이전트를 미세 조정하기 위해 보상 함수를 제공합니다.
API를 통한 통합: 사용자 지정 RL 환경에 통합하기 위해 제공된 코드를 활용합니다.
최적화: 대상 작업에서 성능 향상을 위해 매개변수를 실험합니다.
Plan2Explore의 사용 사례
- 로봇 제어
- 게임 AI
- 자율 시스템
- 강화 학습 연구
- 시뮬레이션 환경








