تخطَّ إلى المحتوى الرئيسي
ToolPotion

Handful of Trials RL Code

يحتوي هذا المستودع على كود التجارب لـ "التعلم المعزز العميق في عدد قليل من التجارب باستخدام نماذج الديناميكيات الاحتمالية". يقوم بتطبيق خوارزمية PETS، التي تجمع بين نماذج ديناميكيات الشبكات العميقة الواعية بالشكوك مع نشر الشكوك المستند إلى العينات للتعلم الفعال للعينات في مهام التعلم المعزز.

زيارة الرابط

الوصف

يستضيف مستودع GitHub هذا، "handful-of-trials"، كود التجارب الخاص بالورقة البحثية "التعلم المعزز العميق في عدد قليل من التجارب باستخدام نماذج الديناميكيات الاحتمالية". يركز المشروع على التعلم المعزز المستند إلى النماذج (RL) ويعالج التحدي الشائع حيث غالبًا ما تكون خوارزميات التعلم المستند إلى النماذج، على الرغم من كفاءتها في استخدام العينات، أقل أداءً من الخوارزميات الخالية من النماذج في الأداء النهائي، خاصة عند استخدام مقربات دالة عالية السعة مثل الشبكات العميقة.

الابتكار الأساسي المقدم هو خوارزمية "المجموعات الاحتمالية مع أخذ عينات المسار" (PETS). تسد PETS فجوة الأداء من خلال استخدام نماذج ديناميكيات واعية بالشكوك. إنها تدمج نماذج ديناميكيات الشبكات العميقة التي تكون واعية بشكوكها الخاصة مع تقنيات نشر الشكوك المتطورة المستندة إلى العينات. يسمح هذا النهج للنموذج بالتعلم بفعالية من بيانات محدودة، وهو عامل حاسم في العديد من تطبيقات التعلم المعزز في العالم الحقيقي حيث تكون جمع البيانات مكلفًا أو مستهلكًا للوقت.

يوفر المستودع الكود اللازم لإعادة إنتاج التجارب الموضحة في الورقة البحثية. يتضمن نصوصًا برمجية لتشغيل التجارب على مهام معيارية مختلفة، مثل cartpole، reacher، pusher، و halfcheetah. يمكن للمستخدمين تكوين التجارب عن طريق تحديد أسماء البيئات، ومعلمات المتحكم (مثل نوع النموذج، طريقة النشر، المحسن)، وتجاوزات المعلمات. يتضمن الكود أيضًا أدوات مساعدة لتصور المسارات وتحليل النتائج، مع تسجيل بيانات التجارب بتنسيق منظم.

لتسهيل الاستخدام، يقدم المستودع ملف Dockerfile لإنشاء بيئة مكتفية ذاتيًا، بما في ذلك التبعيات الضرورية مثل MuJoCo. تتوفر أيضًا صورة Docker مبنية مسبقًا. تمت كتابة المشروع بشكل أساسي بلغة Python، مع تخصيص جزء كبير من الكود لتطبيق خوارزمية PETS ومكوناتها المرتبطة بها، مثل المجموعات الاحتمالية وطرق أخذ عينات المسار. تهدف الأبحاث إلى إظهار أن التعلم المعزز المستند إلى النماذج يمكن أن يحقق أداءً نهائيًا رائدًا مع الحاجة إلى عينات أقل بكثير من الطرق الرائدة الخالية من النماذج.

أبرز ملامح Handful of Trials RL Code

  • تطبيق خوارزمية PETS للتعلم المعزز العميق.

  • يستخدم نماذج ديناميكيات الشبكات العميقة الواعية بالشكوك.

  • يستخدم نشر الشكوك المستند إلى العينات للتعلم الفعال.

  • كود لإعادة إنتاج التجارب على مهام التعلم المعزز المعيارية.

  • يتضمن نصوصًا برمجية لتشغيل التجارب وتكوينها.

  • يوفر أدوات تصور للمسارات.

  • يقدم ملف Dockerfile وصورة مبنية مسبقًا لإعداد البيئة.

  • يدعم تكوينات مختلفة للمتحكم بما في ذلك نوع النموذج، النشر، وطرق التحسين.

البدء مع Handful of Trials RL Code

  1. استنساخ المستودع: احصل على الكود من مستودع GitHub.

  2. إعداد البيئة: قم بتثبيت التبعيات باستخدام `requirements.txt` أو استخدم ملف Dockerfile/الصورة المقدمة.

  3. تكوين التجارب: حدد البيئة، ومعلمات المتحكم، والتجاوزات حسب الحاجة.

  4. تشغيل التجارب: قم بتنفيذ التجارب باستخدام `python scripts/mbexp.py` مع المعلمات المطلوبة.

  5. تحليل النتائج: افحص البيانات المسجلة في `logs.mat` للملاحظات، والإجراءات، والمكافآت، والعوائد.

  6. تصور المسارات: استخدم `python scripts/render.py` لتصور أداء النموذج المدرب.

حالات استخدام Handful of Trials RL Code

  • التعلم المعزز الفعال من حيث العينات
  • أبحاث التعلم المعزز المستند إلى النماذج
  • التحكم في الروبوتات
  • مهام التعلم المعزز المعيارية
  • قياس عدم اليقين في التعلم المعزز
  • التعلم العميق لنمذجة الديناميكيات

الأسئلة الشائعة من Handful of Trials RL Code

تقييمات Handful of Trials RL Code

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل Handful of Trials RL Code

نماذج الذكاء الاصطناعي

يوفر هذا المستودع الكود الخاص بتجارب التعلم المعزز المفصلة في ورقة "التعلم التكيفي النموذجي (Model-Agnostic Meta-Learning) للتكيف السريع للشبكات العميقة". يمكّن الباحثين والمطورين…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

يحتوي مستودع GitHub هذا على الكود الخاص بورقة البحث "متى تثق بنموذجك: تحسين السياسة المستند إلى النموذج". يوفر تطبيقات لخوارزميات تحسين السياسة المستندة إلى النموذج، مما يمكّن…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

PlaNet هو خوارزمية تعلم معزز قائمة على النموذج تخطط من البكسلات عن طريق تعلم ديناميكيات كامنة. تتنبأ بكفاءة بالمكافآت المستقبلية في مساحة كامنة متعلمة، وتتنافس مع الأساليب الخالية…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

يعيد Decision Transformer صياغة التعلم المعزز كمشكلة نمذجة تسلسلية، مستفيدًا من معماريات Transformer مثل GPT-x و BERT. يقوم بتوليد إجراءات مثلى من خلال التكييف على العوائد…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

نماذج العالم (World Models) هو مشروع بحثي يستكشف نماذج الشبكات العصبية التوليدية لبيئات التعلم المعزز. يمكّن الوكلاء من التعلم داخل 'أحلام' محاكاة تم إنشاؤها بواسطة نماذج عالمهم…

أدوات ذكاء اصطناعي أخرى

نماذج الذكاء الاصطناعي

يوفر مستودع GitHub هذا التنفيذ الرسمي لخوارزمية Twin Delayed Deep Deterministic Policy Gradients (TD3) باستخدام PyTorch. وهو مصمم لمهام التحكم المستمر ضمن بيئات OpenAI Gym، ويقدم…

أدوات ذكاء اصطناعي أخرى

نماذج الذكاء الاصطناعي

تُعد طرق تدرج السياسة فئة من خوارزميات التعلم المعزز التي تتعلم دالة السياسة مباشرة. على عكس الطرق القائمة على القيمة، فإنها تُحسّن معلمات السياسة لزيادة المكافآت المتوقعة، مما…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Q-learning هو خوارزمية تعلم معزز خالية من النماذج تدرب الوكيل على تعيين قيم للإجراءات بناءً على الحالات الحالية. إنها تحسن اتخاذ القرار عن طريق زيادة المكافآت المستقبلية المتوقعة،…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة