الوصف
غالباً ما تواجه وكلاء التعلم المعزز (RL) تحديات في التعلم الخاص بالمهام وكفاءة العينات. يعالج Plan2Explore هذه القيود من خلال تقديم نهج جديد للتعلم المعزز ذاتي الإشراف. تم تصميم هذا الوكيل ليتفوق في الاستكشاف وللتكيف بسرعة مع المهام الجديدة وغير المرئية دون معرفة مسبقة.
خلال مرحلة الاستكشاف، يميز Plan2Explore نفسه عن الطرق السابقة من خلال استخدام التخطيط بشكل استباقي لاكتشاف حالات جديدة. بدلاً من تقييم حداثة الملاحظات بشكل رجعي بعد الوصول إليها، يسعى الوكيل بشكل استراتيجي إلى الحداثة المستقبلية المتوقعة. يتيح هذا الاستكشاف المدفوع بالتخطيط جمع بيانات أكثر كفاءة وفهمًا أعمق للبيئة.
بعد مرحلة الاستكشاف، يُظهر Plan2Explore قدرة تكيف ملحوظة. يمكن ضبطه بدقة بسرعة لمهام لاحقة متعددة، مثل الوقوف أو المشي أو الجري، باستخدام تفاعلات قليلة أو معدومة خاصة بالمهام. تقلل هذه القدرة بشكل كبير من الحاجة إلى بيانات تدريب وتفاعل مكثفة خاصة بالمهام، مما يجعله متعدد الاستخدامات للغاية.
تم تقييم الوكيل بدقة على مهام تحكم معقدة تتضمن مدخلات صور عالية الأبعاد. في هذه التقييمات، حقق Plan2Explore أداءً فائقًا مقارنة بطرق الاستكشاف ذاتية الإشراف الحالية، حتى عند العمل بدون أي إشراف تدريبي أو مكافآت خاصة بالمهام. اقترب أداؤه بشكل وثيق من أداء وكيل أوراكل الذي كان لديه وصول إلى المكافآت، مما يسلط الضوء على فعاليته.
تسمح بنية Plan2Explore بتعلم نموذج عالمي شامل من خلال الاستكشاف ذاتي الإشراف، بشكل مستقل عن أي مكافآت خاصة بالمهام. بمجرد إنشاء هذا النموذج الأساسي، يمكن للوكيل بعد ذلك التكيف مع دوال مكافأة مختلفة لمهام مختلفة، مما يعرض فصلًا قويًا بين تعلم الاستكشاف والاستغلال.
يوفر المشروع تطبيقًا مفتوح المصدر لـ Plan2Explore في Tensorflow، متاحًا على GitHub، مما يشجع على المزيد من البحث والتطوير في مجال التعلم المعزز ذاتي الإشراف. يسهل هذا الإصدار الوصول السهل للباحثين والممارسين للتجربة والبناء على إطار عمل Plan2Explore.
أبرز ملامح Plan2Explore
وكيل تعلم معزز ذاتي الإشراف
يستفيد من التخطيط للاستكشاف الفعال
يسعى إلى الحداثة المستقبلية المتوقعة
يتيح التكيف الصفري أو القليل من اللقطات مع المهام الجديدة
يتعلم نموذج عالمي شامل أثناء الاستكشاف
يتعامل مع مدخلات الصور عالية الأبعاد
يتفوق على طرق الاستكشاف ذاتية الإشراف السابقة
يقترب من أداء الأوراكل مع الوصول إلى المكافآت
تطبيق مفتوح المصدر متاح في Tensorflow
البدء مع Plan2Explore
الوصول إلى النموذج: الحصول على تطبيق وكيل Plan2Explore.
إعداد البيئة: تكوين البرامج والأجهزة اللازمة للتنفيذ.
الاستكشاف: تشغيل الوكيل بطريقة ذاتية الإشراف لتعلم نموذج عالمي.
التكيف مع المهام: توفير دوال المكافأة لضبط الوكيل للمهام اللاحقة المحددة.
التكامل عبر API: استخدام الكود المقدم للتكامل في بيئات RL مخصصة.
التحسين: التجربة مع المعلمات لتحسين الأداء في المهام المستهدفة.
حالات استخدام Plan2Explore
- التحكم في الروبوتات
- ذكاء اصطناعي الألعاب
- الأنظمة المستقلة
- أبحاث التعلم المعزز
- بيئات المحاكاة








