Description
Octo représente une initiative continue visant à développer des politiques généralistes open-source largement applicables pour la manipulation robotique. Le cœur d'Octo est une politique de diffusion basée sur des transformeurs, méticuleusement pré-entraînée sur 800 000 épisodes robotiques provenant de l'ensemble de données complet Open X-Embodiment. Ce pré-entraînement extensif équipe Octo d'une base solide pour comprendre et exécuter une gamme variée de tâches robotiques.
La philosophie de conception derrière Octo met l'accent sur la flexibilité et la scalabilité. Elle est conçue pour accueillir une variété de robots couramment utilisés, de configurations de capteurs et d'espaces d'action. Cette architecture générique et évolutive permet un entraînement sur des ensembles de données massifs, conduisant à un modèle hautement adaptable. Octo prend en charge plusieurs modalités d'entrée pour la spécification des tâches, y compris les instructions en langage naturel et les images cibles. Il peut également traiter des historiques d'observation et générer des distributions d'actions multimodales via le décodage de diffusion.
Une force clé d'Octo réside dans son support pour un réglage fin efficace. Cette capacité permet d'adapter rapidement la politique à de nouvelles configurations de robots, y compris celles avec des espaces d'action différents ou des combinaisons variées de caméras et de capteurs proprioceptifs. Ce choix de conception fait d'Octo une politique robotique généraliste polyvalente et largement applicable, adaptée à de nombreuses applications robotiques en aval et projets de recherche.
Octo est entraîné sur un mélange diversifié de 25 ensembles de données de l'ensemble de données Open X-Embodiment, couvrant un large éventail d'incarnations de robots, de scènes et de tâches. L'hétérogénéité de ces ensembles de données, en termes de types de robots, de capteurs (par exemple, avec ou sans caméras de poignet) et d'étiquettes (par exemple, avec ou sans instructions linguistiques), contribue aux capacités de généralisation robustes d'Octo.
Les évaluations d'Octo ont été menées sur neuf configurations de robots du monde réel dans quatre institutions différentes. Ces évaluations couvrent diverses interactions avec des objets, de longs horizons de tâches et des tâches de manipulation précises. Octo démontre de solides performances prêtes à l'emploi dans des environnements issus de ses données de pré-entraînement et excelle dans le réglage fin efficace pour de nouvelles tâches et environnements avec de petits ensembles de données cibles. Il montre également une adaptabilité remarquable aux nouvelles observations, telles que les entrées force-couple, et aux nouveaux espaces d'action, comme le contrôle de la position des articulations, ce qui en fait un outil puissant pour la recherche et le développement avancés en robotique.
Points forts de Octo Robot Policy
Architecture de politique de diffusion basée sur des transformeurs
Pré-entraîné sur 800 000 épisodes robotiques de l'ensemble de données Open X-Embodiment
Prend en charge les instructions en langage naturel pour la spécification des tâches
Prend en charge le conditionnement par image cible pour la spécification des tâches
Gère les historiques d'observation
Génère des distributions d'actions multimodales via le décodage de diffusion
Conçu pour un réglage fin efficace sur de nouveaux espaces d'observation et d'action
Disponible en deux versions : Octo-Small (27M de paramètres) et Octo-Base (93M de paramètres)
Évalué sur 9 configurations de robots réels dans 4 institutions
Surpasse RT-1-X en conditionnement linguistique zero-shot
Performances comparables à RT-2-X
Atteint des performances plus élevées avec le conditionnement par image cible sur les tâches WidowX
Démontre des performances de réglage fin supérieures par rapport à l'entraînement à partir de zéro ou avec des poids VC-1
Premiers pas avec Octo Robot Policy
Accéder au modèle : Obtenez les poids et le code du modèle Octo à partir des dépôts fournis.
Configurer l'environnement : Configurez votre environnement de simulation ou matériel robotique.
Intégrer la politique : Chargez le modèle Octo et définissez vos espaces d'observation et d'action.
Spécification de la tâche : Fournissez les instructions de la tâche via le langage naturel ou des images cibles.
Contrôle du robot : Exécutez la politique pour contrôler les actions du robot.
Régler le modèle : Adaptez Octo à de nouvelles tâches ou environnements à l'aide de démonstrations cibles.
Cas d'utilisation de Octo Robot Policy
- Manipulation Robotique Générale
- Réglage Fin Spécifique à la Tâche
- Instruction de Tâche Multimodale
- Plateforme de Recherche en Robotique
- Adaptation de la Configuration des Capteurs
- Flexibilité de l'Espace d'Action








