الوصف
يمثل Octo مبادرة مستمرة لتطوير سياسات عامة مفتوحة المصدر وقابلة للتطبيق على نطاق واسع لمعالجة الروبوتات. يكمن جوهر Octo في سياسة انتشارية قائمة على المحولات، تم تدريبها مسبقًا بدقة على 800,000 حلقة روبوتية مأخوذة من مجموعة بيانات Open X-Embodiment الشاملة. هذا التدريب المسبق المكثف يزود Octo بأساس قوي لفهم وتنفيذ مجموعة متنوعة من مهام الروبوتات.
تؤكد فلسفة التصميم وراء Octo على المرونة وقابلية التوسع. تم تصميمه لاستيعاب مجموعة متنوعة من الروبوتات الشائعة الاستخدام، وتكوينات المستشعرات، ومساحات الإجراءات. تسمح هذه البنية العامة والقابلة للتوسع بالتدريب على مجموعات بيانات ضخمة، مما يؤدي إلى نموذج قابل للتكيف بدرجة عالية. يدعم Octo وسائط إدخال متعددة لتحديد المهام، بما في ذلك التعليمات باللغة الطبيعية وصور الأهداف. يمكنه أيضًا معالجة سجلات الملاحظات وإنشاء توزيعات إجراءات متعددة الوسائط من خلال فك تشفير الانتشار.
تكمن قوة Octo الرئيسية في دعمه للضبط الدقيق الفعال. تسمح هذه القدرة بتكييف السياسة بسرعة مع إعدادات الروبوتات الجديدة، بما في ذلك تلك التي تحتوي على مساحات إجراءات مختلفة أو مجموعات متنوعة من الكاميرات ومستشعرات الحركة الذاتية. هذا الاختيار التصميمي يجعل Octo سياسة روبوتية عامة متعددة الاستخدامات وقابلة للتطبيق على نطاق واسع، ومناسبة للعديد من تطبيقات الروبوتات النهائية ومشاريع البحث.
تم تدريب Octo على مزيج متنوع من 25 مجموعة بيانات من مجموعة بيانات Open X-Embodiment، والتي تشمل مجموعة واسعة من تجسيدات الروبوتات والمشاهد والمهام. يساهم عدم تجانس مجموعات البيانات هذه، من حيث أنواع الروبوتات والمستشعرات (مثل، مع أو بدون كاميرات معصم) والتسميات (مثل، مع أو بدون تعليمات لغوية)، في قدرات التعميم القوية لـ Octo.
تم إجراء تقييمات لـ Octo عبر تسعة إعدادات روبوتية واقعية في أربع مؤسسات مختلفة. تغطي هذه التقييمات تفاعلات متنوعة مع الكائنات، وآفاق مهام طويلة، ومهام معالجة دقيقة. يُظهر Octo أداءً قويًا خارج الصندوق في البيئات من بيانات التدريب المسبق الخاصة به ويتفوق في الضبط الدقيق الفعال للمهام والبيئات الجديدة باستخدام مجموعات بيانات المجال المستهدف الصغيرة. كما أنه يُظهر قدرة ملحوظة على التكيف مع الملاحظات الجديدة، مثل مدخلات القوة وعزم الدوران، ومساحات الإجراءات الجديدة، مثل التحكم في موضع المفصل، مما يجعله أداة قوية لأبحاث وتطوير الروبوتات المتقدمة.
أبرز ملامح Octo Robot Policy
بنية سياسة انتشارية قائمة على المحولات
مدرب مسبقًا على 800,000 حلقة روبوتية من مجموعة بيانات Open X-Embodiment
يدعم التعليمات باللغة الطبيعية لتحديد المهام
يدعم تكييف صور الأهداف لتحديد المهام
يستوعب سجلات الملاحظات
ينشئ توزيعات إجراءات متعددة الوسائط عبر فك تشفير الانتشار
مصمم للضبط الدقيق الفعال لمساحات الملاحظة والإجراءات الجديدة
متوفر في نسختين: Octo-Small (27 مليون معلمة) و Octo-Base (93 مليون معلمة)
تم تقييمه على 9 إعدادات روبوتية حقيقية عبر 4 مؤسسات
يتفوق على RT-1-X في التكييف اللغوي بدون عينات
أداء مماثل لـ RT-2-X
يحقق أداءً أعلى مع تكييف صور الأهداف في مهام WidowX
يُظهر أداء ضبط دقيق متفوق مقارنة بالتدريب من الصفر أو باستخدام أوزان VC-1
البدء مع Octo Robot Policy
الوصول إلى النموذج: احصل على أوزان النموذج ورموز Octo من المستودعات المقدمة.
إعداد البيئة: قم بتكوين بيئة محاكاة الروبوتات أو الأجهزة الخاصة بك.
دمج السياسة: قم بتحميل نموذج Octo وحدد مساحات الملاحظة والإجراءات الخاصة بك.
تحديد المهمة: قدم تعليمات المهمة عبر اللغة الطبيعية أو صور الأهداف.
التحكم في الروبوت: قم بتنفيذ السياسة للتحكم في إجراءات الروبوت.
ضبط النموذج بدقة: قم بتكييف Octo للمهام أو البيئات الجديدة باستخدام عروض توضيحية مستهدفة.
حالات استخدام Octo Robot Policy
- معالجة الروبوتات العامة
- الضبط الدقيق لمهام محددة
- تعليمات المهام متعددة الوسائط
- منصة أبحاث الروبوتات
- تكييف تكوين المستشعرات
- مرونة مساحة الإجراءات








