تخطّي إلى المحتوى
Kudos AI

التعلّم المعزّز

حسن التصرّف حين تكون النتائج غير مؤكدة: معادلة بلمان وكيفية حلّها، ثم ما الذي يتغيّر حين تكون البيئة مجهولة ويتعيّن على الوكيل أن يتعلّم من التجربة وحدها.

متقدّم440 XP~2 h90% للتقدّم

سجّل الدخول لخوض الاختبارات وكسب XP وفتح المراحل عند بلوغك إتقان 90%.

  1. عمليات القرار الماركوفية ومعادلة بلمان

    30 دقيقة · 130 XP

    المكوّنات الخمسة لعملية القرار الماركوفية، ولماذا تتفوّق السياسة على الخطة في ظل عدم اليقين، وشرط الاتساق الذي يجب أن تحقّقه كل منفعة.

    افتح الدرس →

    سجّل الدخول لخوض الاختبار المكوّن من 3 أسئلة.

  2. التكرار على القيمة وعلى السياسة

    35 دقيقة · 150 XP

    تحويل معادلة بلمان إلى إسناد والمسح تكرارًا حتى الاستقرار، ثم حلقة التقييم والتحسين التي تصل إلى السياسة أولًا في الغالب.

    افتح الدرس →

    سجّل الدخول لخوض الاختبار المكوّن من 3 أسئلة.

  3. التعلّم بالقيمة Q والاستكشاف

    35 دقيقة · 160 XP

    تعلّم حسن التصرّف دون نموذج للبيئة: التحديث بفرق التوقيت، وانتقال القيمة رجوعًا خطوةً خطوة، ولماذا يعلق الوكيل الجشع تمامًا.

    افتح الدرس →

    سجّل الدخول لخوض الاختبار المكوّن من 3 أسئلة.

أكمل جميع الوحدات → لتكسب شارة التعلّم المعزّز