الوصف
يستضيف مستودع GitHub هذا، "handful-of-trials"، كود التجارب الخاص بالورقة البحثية "التعلم المعزز العميق في عدد قليل من التجارب باستخدام نماذج الديناميكيات الاحتمالية". يركز المشروع على التعلم المعزز المستند إلى النماذج (RL) ويعالج التحدي الشائع حيث غالبًا ما تكون خوارزميات التعلم المستند إلى النماذج، على الرغم من كفاءتها في استخدام العينات، أقل أداءً من الخوارزميات الخالية من النماذج في الأداء النهائي، خاصة عند استخدام مقربات دالة عالية السعة مثل الشبكات العميقة.
الابتكار الأساسي المقدم هو خوارزمية "المجموعات الاحتمالية مع أخذ عينات المسار" (PETS). تسد PETS فجوة الأداء من خلال استخدام نماذج ديناميكيات واعية بالشكوك. إنها تدمج نماذج ديناميكيات الشبكات العميقة التي تكون واعية بشكوكها الخاصة مع تقنيات نشر الشكوك المتطورة المستندة إلى العينات. يسمح هذا النهج للنموذج بالتعلم بفعالية من بيانات محدودة، وهو عامل حاسم في العديد من تطبيقات التعلم المعزز في العالم الحقيقي حيث تكون جمع البيانات مكلفًا أو مستهلكًا للوقت.
يوفر المستودع الكود اللازم لإعادة إنتاج التجارب الموضحة في الورقة البحثية. يتضمن نصوصًا برمجية لتشغيل التجارب على مهام معيارية مختلفة، مثل cartpole، reacher، pusher، و halfcheetah. يمكن للمستخدمين تكوين التجارب عن طريق تحديد أسماء البيئات، ومعلمات المتحكم (مثل نوع النموذج، طريقة النشر، المحسن)، وتجاوزات المعلمات. يتضمن الكود أيضًا أدوات مساعدة لتصور المسارات وتحليل النتائج، مع تسجيل بيانات التجارب بتنسيق منظم.
لتسهيل الاستخدام، يقدم المستودع ملف Dockerfile لإنشاء بيئة مكتفية ذاتيًا، بما في ذلك التبعيات الضرورية مثل MuJoCo. تتوفر أيضًا صورة Docker مبنية مسبقًا. تمت كتابة المشروع بشكل أساسي بلغة Python، مع تخصيص جزء كبير من الكود لتطبيق خوارزمية PETS ومكوناتها المرتبطة بها، مثل المجموعات الاحتمالية وطرق أخذ عينات المسار. تهدف الأبحاث إلى إظهار أن التعلم المعزز المستند إلى النماذج يمكن أن يحقق أداءً نهائيًا رائدًا مع الحاجة إلى عينات أقل بكثير من الطرق الرائدة الخالية من النماذج.
أبرز ملامح Handful of Trials RL Code
تطبيق خوارزمية PETS للتعلم المعزز العميق.
يستخدم نماذج ديناميكيات الشبكات العميقة الواعية بالشكوك.
يستخدم نشر الشكوك المستند إلى العينات للتعلم الفعال.
كود لإعادة إنتاج التجارب على مهام التعلم المعزز المعيارية.
يتضمن نصوصًا برمجية لتشغيل التجارب وتكوينها.
يوفر أدوات تصور للمسارات.
يقدم ملف Dockerfile وصورة مبنية مسبقًا لإعداد البيئة.
يدعم تكوينات مختلفة للمتحكم بما في ذلك نوع النموذج، النشر، وطرق التحسين.
البدء مع Handful of Trials RL Code
استنساخ المستودع: احصل على الكود من مستودع GitHub.
إعداد البيئة: قم بتثبيت التبعيات باستخدام `requirements.txt` أو استخدم ملف Dockerfile/الصورة المقدمة.
تكوين التجارب: حدد البيئة، ومعلمات المتحكم، والتجاوزات حسب الحاجة.
تشغيل التجارب: قم بتنفيذ التجارب باستخدام `python scripts/mbexp.py` مع المعلمات المطلوبة.
تحليل النتائج: افحص البيانات المسجلة في `logs.mat` للملاحظات، والإجراءات، والمكافآت، والعوائد.
تصور المسارات: استخدم `python scripts/render.py` لتصور أداء النموذج المدرب.
حالات استخدام Handful of Trials RL Code
- التعلم المعزز الفعال من حيث العينات
- أبحاث التعلم المعزز المستند إلى النماذج
- التحكم في الروبوتات
- مهام التعلم المعزز المعيارية
- قياس عدم اليقين في التعلم المعزز
- التعلم العميق لنمذجة الديناميكيات








