説明
Octoは、ロボット操作のためのオープンソースで広く適用可能な汎用ポリシーを開発する継続的な取り組みを表しています。Octoの中核はTransformerベースの拡散ポリシーであり、包括的なOpen X-Embodimentデータセットから取得した80万件のロボットエピソードで綿密に事前学習されています。この広範な事前学習により、Octoは多様なロボットタスクの理解と実行のための堅牢な基盤を備えています。
Octoの設計思想は、柔軟性とスケーラビリティの両方を重視しています。一般的に使用される様々なロボット、センサー構成、およびアクションスペースに対応できるように設計されています。この汎用的でスケーラブルなアーキテクチャにより、大規模データセットでのトレーニングが可能になり、非常に適応性の高いモデルが生まれます。Octoは、自然言語指示や目標画像を含む、タスク指定のための複数の入力モダリティをサポートしています。また、観測履歴を処理し、拡散デコーディングを通じてマルチモーダルアクション分布を生成することも可能です。
Octoの主な強みは、効率的なファインチューニングをサポートしている点にあります。この機能により、ポリシーは新しいロボットセットアップ、特に異なるアクションスペースやカメラと固有センサーの様々な組み合わせを持つものに迅速に適応させることができます。この設計選択により、Octoは汎用性が高く、広く適用可能な汎用ロボットポリシーとなり、数多くの下流のロボティクスアプリケーションや研究プロジェクトに適しています。
Octoは、Open X-Embodiment Datasetの25の多様なデータセットの混合でトレーニングされており、ロボットの具現化、シーン、タスクの幅広い配列を網羅しています。ロボットの種類、センサー(例:リストカメラの有無)、ラベル(例:言語指示の有無)の点でこれらのデータセットの異質性は、Octoの堅牢な汎化能力に貢献しています。
Octoの評価は、4つの異なる機関の9つの実世界のロボットセットアップで実施されました。これらの評価は、多様なオブジェクトインタラクション、長いタスクホライゾン、および精密な操作タスクをカバーしています。Octoは、事前学習データからの環境において、箱から出してすぐに強力なパフォーマンスを示し、少量のターゲットドメインデータセットを用いた新しいタスクや環境への効率的なファインチューニングで優れています。また、フォーストルク入力などの新しい観測や、ジョイント位置制御などの新しいアクションスペースへの驚くべき適応性を示しており、高度なロボティクス研究開発のための強力なツールとなっています。
Octo Robot Policyのハイライト
Transformerベースの拡散ポリシーアーキテクチャ
Open X-Embodimentデータセットからの80万件のロボットエピソードで事前学習済み
タスク指定のための自然言語指示をサポート
タスク指定のための目標画像条件付けをサポート
観測履歴に対応
拡散デコーディングによるマルチモーダルアクション分布の生成
新しい観測およびアクションスペースへの効率的なファインチューニングのために設計
2つのバージョンで利用可能: Octo-Small (27Mパラメータ) および Octo-Base (93Mパラメータ)
4機関にわたる9つの実ロボットセットアップで評価済み
ゼロショット言語条件付けでRT-1-Xを上回るパフォーマンス
RT-2-Xと同等のパフォーマンス
WidowXタスクでの目標画像条件付けでより高いパフォーマンスを達成
スクラッチからのトレーニングまたはVC-1ウェイトでのトレーニングと比較して優れたファインチューニングパフォーマンスを実証
Octo Robot Policyをはじめる
モデルへのアクセス: 提供されているリポジトリからOctoモデルのウェイトとコードを取得します。
環境設定: ロボットシミュレーションまたはハードウェア環境を構成します。
ポリシーの統合: Octoモデルをロードし、観測およびアクションスペースを定義します。
タスク指定: 自然言語または目標画像を通じてタスク指示を提供します。
ロボット制御: ポリシーを実行してロボットアクションを制御します。
モデルのファインチューニング: ターゲットデモンストレーションを使用して、新しいタスクまたは環境にOctoを適応させます。
Octo Robot Policyの使用例
- 汎用ロボット操作
- タスク固有のファインチューニング
- マルチモーダルタスク指示
- ロボティクス研究プラットフォーム
- センサー構成の適応
- アクションスペースの柔軟性








