설명
Octo는 로봇 조작을 위한 오픈 소스, 광범위하게 적용 가능한 범용 정책 개발에 대한 지속적인 이니셔티브를 나타냅니다. Octo의 핵심은 포괄적인 Open X-Embodiment 데이터셋에서 추출한 800,000개의 로봇 에피소드에 대해 세심하게 사전 학습된 트랜스포머 기반 확산 정책입니다. 이 광범위한 사전 학습은 Octo에 다양한 로봇 작업을 이해하고 실행할 수 있는 강력한 기반을 제공합니다.
Octo의 설계 철학은 유연성과 확장성 모두를 강조합니다. 일반적으로 사용되는 다양한 로봇, 센서 구성 및 행동 공간을 수용하도록 설계되었습니다. 이 일반적이고 확장 가능한 아키텍처를 통해 대규모 데이터셋으로 학습할 수 있으며, 이는 매우 적응력이 뛰어난 모델로 이어집니다. Octo는 자연어 지침 및 목표 이미지를 포함한 작업 지정을 위한 여러 입력 모달리티를 지원합니다. 또한 관측 기록을 처리하고 확산 디코딩을 통해 다중 모달 행동 분포를 생성할 수 있습니다.
Octo의 핵심 강점은 효율적인 미세 조정을 지원한다는 점입니다. 이 기능을 통해 정책을 새로운 로봇 설정에 신속하게 적용할 수 있으며, 여기에는 다른 행동 공간이나 다양한 카메라 및 고유 센서 조합이 포함됩니다. 이러한 설계 선택은 Octo를 다재다능하고 광범위하게 적용 가능한 범용 로봇 정책으로 만들어 수많은 다운스트림 로봇 공학 애플리케이션 및 연구 프로젝트에 적합합니다.
Octo는 Open X-Embodiment 데이터셋의 25개 데이터셋의 다양한 혼합으로 학습되며, 이는 광범위한 로봇 구현체, 장면 및 작업을 포함합니다. 로봇 유형, 센서(예: 손목 카메라 유무) 및 레이블(예: 언어 지침 유무) 측면에서 이러한 데이터셋의 이질성은 Octo의 강력한 일반화 기능에 기여합니다.
Octo에 대한 평가는 네 기관의 아홉 가지 실제 로봇 설정에서 수행되었습니다. 이러한 평가는 다양한 객체 상호 작용, 긴 작업 지평 및 정밀 조작 작업을 다룹니다. Octo는 사전 학습 데이터의 환경에서 강력한 즉시 사용 가능한 성능을 보여주며, 소규모 대상 도메인 데이터셋으로 새로운 작업 및 환경에 대한 효율적인 미세 조정에서 뛰어납니다. 또한 힘-토크 입력과 같은 새로운 관측 및 조인트 위치 제어와 같은 새로운 행동 공간에 대한 놀라운 적응성을 보여주므로 고급 로봇 공학 연구 및 개발을 위한 강력한 도구입니다.
Octo 로봇 정책 하이라이트
트랜스포머 기반 확산 정책 아키텍처
Open X-Embodiment 데이터셋의 800,000개 로봇 에피소드로 사전 학습됨
작업 지정을 위한 자연어 지침 지원
작업 지정을 위한 목표 이미지 조건 지원
관측 기록 수용
확산 디코딩을 통한 다중 모달 행동 분포 생성
새로운 관측 및 행동 공간에 대한 효율적인 미세 조정을 위해 설계됨
두 가지 버전으로 제공: Octo-Small (2,700만 매개변수) 및 Octo-Base (9,300만 매개변수)
4개 기관의 9개 실제 로봇 설정에서 평가됨
제로샷 언어 조건에서 RT-1-X보다 뛰어난 성능
RT-2-X와 유사한 성능
WidowX 작업에서 목표 이미지 조건으로 더 높은 성능 달성
처음부터 학습하거나 VC-1 가중치로 학습하는 것에 비해 뛰어난 미세 조정 성능 달성
Octo 로봇 정책 시작하기
모델 액세스: 제공된 리포지토리에서 Octo 모델 가중치와 코드를 가져옵니다.
환경 설정: 로봇 시뮬레이션 또는 하드웨어 환경을 구성합니다.
정책 통합: Octo 모델을 로드하고 관측 및 행동 공간을 정의합니다.
작업 지정: 자연어 또는 목표 이미지를 통해 작업 지침을 제공합니다.
로봇 제어: 정책을 실행하여 로봇 행동을 제어합니다.
모델 미세 조정: 대상 시연을 사용하여 새로운 작업 또는 환경에 Octo를 적용합니다.
Octo 로봇 정책의 사용 사례
- 범용 로봇 조작
- 작업별 미세 조정
- 다중 모달 작업 지침
- 로봇 공학 연구 플랫폼
- 센서 구성 적응
- 행동 공간 유연성








