تخطَّ إلى المحتوى الرئيسي
ToolPotion

طريقة تدرج السياسة (Policy Gradient Method)

تُعد طرق تدرج السياسة فئة من خوارزميات التعلم المعزز التي تتعلم دالة السياسة مباشرة. على عكس الطرق القائمة على القيمة، فإنها تُحسّن معلمات السياسة لزيادة المكافآت المتوقعة، مما يوفر نهجًا مباشرًا لاختيار الإجراءات في البيئات المعقدة.

زيارة الرابط

الوصف

تمثل طرق تدرج السياسة فئة فرعية مهمة ضمن التعلم المعزز، مع التركيز بشكل خاص على تحسين السياسة. على عكس الأساليب التقليدية القائمة على القيمة التي تتعلم أولاً دالة قيمة لاستنتاج الإجراءات المثلى، فإن طرق تحسين السياسة تُعامل دالة السياسة وتتعلمها مباشرة. هذه السياسة، والمشار إليها بـ π(θ)، هي دالة للمعلمات θ، ودورها الأساسي هو اختيار الإجراءات بناءً على الحالة الحالية للبيئة دون الاعتماد على دالة قيمة وسيطة.

الهدف الأساسي لطرق تدرج السياسة هو اكتشاف المجموعة المثلى من المعلمات θ التي تزيد من المكافأة الدورية المتوقعة، J(θ). يتم التعبير عن ذلك رياضيًا على النحو التالي: J(θ) = E[∑ γ^t R_t]، حيث γ هو عامل الخصم، و R_t هي المكافأة عند الخطوة الزمنية t، ويتم أخذ التوقع على المسارات التي تولدها السياسة π_θ. يُعد تدرج السياسة، ∇_θ J(θ)، مفتاح عملية التحسين هذه. تستخدم خوارزميات تدرج السياسة المختلفة تقنيات متنوعة لتقدير هذا التدرج بشكل عشوائي، مما يتيح زيادة J(θ) بشكل تكراري من خلال صعود التدرج.

تستخدم خوارزمية REINFORCE، وهي طريقة أساسية لتدرج السياسة، هوية دالة الدرجة لتقدير تدرج السياسة. يمكن تحسينها من خلال دمج "خدعة السببية"، التي تزن الإجراءات بالمكافآت المستقبلية. تشمل التحسينات الإضافية تقنيات تقليل التباين لتحقيق استقرار التعلم. تقوم REINFORCE مع خط أساس بطرح خط أساس يعتمد على الحالة من العائد، مما يقلل التباين بشكل كبير. يؤدي هذا إلى طرق الممثل-الناقد (actor-critic)، حيث يساعد الناقد (مُقدّر دالة القيمة) الممثل (دالة السياسة) على التعلم بكفاءة أكبر.

تبني الطرق الأكثر تقدمًا مثل تدرج السياسة الطبيعي (Natural Policy Gradient)، وتحسين سياسة منطقة الثقة (TRPO)، وتحسين سياسة التقريب (PPO) على هذه الأسس. يقدم تدرج السياسة الطبيعي تحديثًا خاليًا من الإحداثيات باستخدام مصفوفة معلومات فيشر. تفرض TRPO قيد منطقة الثقة لضمان تحديثات سياسة مستقرة، بينما تستخدم PPO نسب احتمالات مقطوعة لتحقيق استقرار مماثل مع تقريب بسيط من الدرجة الأولى. تهدف هذه الطرق إلى توفير تحسين سياسة أكثر قوة وكفاءة في مهام التعلم المعزز المعقدة.

أبرز ملامح طريقة تدرج السياسة (Policy Gradient Method)

  • تتعلم دالة السياسة π(θ) مباشرة.

  • تُحسّن معلمات السياسة θ لزيادة المكافأة الدورية المتوقعة J(θ).

  • تستخدم تدرج السياسة ∇_θ J(θ) للتحسين.

  • تستخدم تقديرًا عشوائيًا لتدرج السياسة.

  • تزيد المكافأة بشكل تكراري عبر صعود التدرج.

  • أساس لخوارزميات مثل REINFORCE.

  • تدعم تقنيات تقليل التباين للتعلم المستقر.

  • تشكل أساسًا لطرق الممثل-الناقد.

  • تتضمن متغيرات متقدمة مثل تدرج السياسة الطبيعي، TRPO، و PPO.

  • تُعامل السياسات لمساحات الإجراءات المنفصلة والمستمرة.

البدء مع طريقة تدرج السياسة (Policy Gradient Method)

  1. تحديد السياسة: قم بمعالجة دالة سياسة π(θ) التي تربط الحالات باحتمالات الإجراءات.

  2. توليد المسارات: قم بتشغيل حلقات في البيئة باستخدام السياسة الحالية π(θ).

  3. تقدير التدرج: احسب تقديرًا عشوائيًا لتدرج السياسة ∇_θ J(θ) باستخدام المسارات التي تم أخذ عينات منها.

  4. تحديث المعلمات: اضبط معلمات السياسة θ عبر صعود التدرج لزيادة المكافآت المتوقعة.

  5. التكرار: كرر العملية، مع تحسين السياسة عبر تحديثات متعددة.

حالات استخدام طريقة تدرج السياسة (Policy Gradient Method)

  • التحكم في الروبوتات
  • لعب الألعاب
  • القيادة الذاتية
  • إدارة الموارد
  • التوصيات الشخصية
  • التداول المالي
  • توليد اللغة الطبيعية

الأسئلة الشائعة من طريقة تدرج السياسة (Policy Gradient Method)

تقييمات طريقة تدرج السياسة (Policy Gradient Method)

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل طريقة تدرج السياسة (Policy Gradient Method)

نماذج الذكاء الاصطناعي

Q-learning هو خوارزمية تعلم معزز خالية من النماذج تدرب الوكيل على تعيين قيم للإجراءات بناءً على الحالات الحالية. إنها تحسن اتخاذ القرار عن طريق زيادة المكافآت المستقبلية المتوقعة،…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

SARSA هو خوارزمية تعلم معزز لتعلم سياسات عملية اتخاذ القرار ماركوف. تقوم بتحديث قيم Q بناءً على الحالة الحالية للوكيل، والإجراء المتخذ، والمكافأة المستلمة، والحالة التالية،…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

هذه هي الطبعة الثانية من الكتاب الدراسي الأساسي "التعلم المعزز: مقدمة" بقلم ريتشارد س. سوتون وأندرو ج. بارتو. يقدم نظرة شاملة على مفاهيم وخوارزميات وتطبيقات التعلم المعزز، وهو…

نماذج الذكاء الاصطناعي

يعيد Decision Transformer صياغة التعلم المعزز كمشكلة نمذجة تسلسلية، مستفيدًا من معماريات Transformer مثل GPT-x و BERT. يقوم بتوليد إجراءات مثلى من خلال التكييف على العوائد…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

PlaNet هو خوارزمية تعلم معزز قائمة على النموذج تخطط من البكسلات عن طريق تعلم ديناميكيات كامنة. تتنبأ بكفاءة بالمكافآت المستقبلية في مساحة كامنة متعلمة، وتتنافس مع الأساليب الخالية…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

يحتوي مستودع GitHub هذا على الكود الخاص بورقة البحث "متى تثق بنموذجك: تحسين السياسة المستند إلى النموذج". يوفر تطبيقات لخوارزميات تحسين السياسة المستندة إلى النموذج، مما يمكّن…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

كتب الذكاء الاصطناعي

تعلم التعزيز: مقدمة هو دليل شامل لتعلم التعزيز، من تأليف ريتشارد س. ساتون وأندرو ج. بارتو. تقدم هذه الطبعة الثانية تغطية موسعة للخوارزميات والمفاهيم الرئيسية، مما يجعلها ضرورية…

مميزةمساعدو البحث بالذكاء الاصطناعيالتعليم والتعلّم الإلكتروني

نماذج الذكاء الاصطناعي

يحتوي هذا المستودع على كود التجارب لـ "التعلم المعزز العميق في عدد قليل من التجارب باستخدام نماذج الديناميكيات الاحتمالية". يقوم بتطبيق خوارزمية PETS، التي تجمع بين نماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة