تخطّي إلى المحتوى
Kudos AI

عملية القرار الماركوفية

نموذج صوري لاتخاذ القرار المتتابع تكون نتائجه عشوائية جزئيًا، ويُعرَّف بحالات وأفعال واحتمالات انتقال ودالة مكافأة.

خطّة من ثلاث خطوات تُنفَّذ مرّة، فتنزلق الحركة الأولى ويبقى ما تلاها موجّهًا إلى حالة لم يعد العميل فيها.

فهم عملية القرار الماركوفية

كثير من المسائل يتطلب سلسلة قرارات تتكشّف عواقبها عبر الزمن وليست تامة القابلية للتنبؤ. وعملية القرار الماركوفية هي الصياغة الصورية القياسية لذلك. فهي تحدّد المواقف التي قد يكون فيها العميل، والأفعال المتاحة، واحتمال الانتقال من موقف إلى آخر بفعل معيّن، والمكافأة الفورية المتلقاة.

وخاصية ماركوف هي الافتراض المبسِّط الذي يجعل الإطار قابلًا للمعالجة: فتوزيع الحالة التالية يتوقف على الحالة الراهنة والفعل المختار وحدهما، لا على كيفية وصول العميل إليها. وهذا أقل تقييدًا مما يبدو أول الأمر، لأن كل ما يهمّ حقًا من التاريخ يمكن طيّه داخل تعريف الحالة، على حساب فضاء حالات أكبر.

والمطلوب سياسة، أي تطبيق من الحالات إلى الأفعال. وقيمة سياسة عند حالة هي مجموع المكافآت المتوقع من اتباعها منذ تلك النقطة. ولأن القرار الجيد الآن يتوقف على قيمة الحالات التي يفضي إليها، وتلك القيم تتوقف على القرارات اللاحقة، فالمسألة عوديّة بطبعها؛ ومعادلة بلمان تعبّر عن هذا الاتساق الذاتي بالضبط، وهي أساس الخوارزميات التي تحلّ هذه العمليات.

وتُخصَم المكافآت المستقبلية بمعامل بين الصفر والواحد يُطبَّق عند كل خطوة. ويخدم هذا غرضين: إبقاء المجموع منتهيًا على أفق غير محدود، وتشفير تفضيل حقيقي للمكافآت الأقرب. فالخصم القريب من الصفر ينتج سلوكًا قصير النظر، والقريب من الواحد ينتج سلوكًا بعيد النظر على حساب تعلّم أبطأ وأقل استقرارًا.

كيفية الحساب

V(s) = max_a Σ_{s′} P(s′ | s, a) [ R(s, a, s′) + γ V(s′) ]

حيث

s, s′
الحالة الراهنة والحالة التالية
a
فعل متاح في الحالة s
P(s′ | s, a)
احتمال بلوغ s′ بأخذ a في s
R(s, a, s′)
المكافأة الفورية لذلك الانتقال
γ
معامل الخصم، بين 0 و1
V(s)
قيمة s تحت سياسة مثلى

مثال على عملية القرار الماركوفية

تأمّل روبوتًا على شبكة تكون فيها كل خلية حالةً وتكون الأفعال هي التحركات الأربعة. والحركة غير موثوقة: فالاتجاه المقصود ينجح في معظم الأحيان وينزلق جانبًا أحيانًا. وبلوغ خلية الهدف يعطي مكافأة موجبة كبيرة، والوقوع في خطر مكافأة سالبة كبيرة، وكل خطوة عادية مكافأة سالبة صغيرة تثبيطًا للتلكّؤ.

والسياسة المثلى ليست ببساطة أقصر مسار. فلأن الحركة قد تنزلق، فالطريق الذي يمرّ ملاصقًا لخطر يحمل مخاطرة حقيقية بالوقوع فيه، وقد تفضّل السياسة طريقًا أطول يحفظ مسافةً. وتشفّر دالة القيمة هذا بإسناد قيمة أدنى للحالات المجاورة للأخطار.

والكلفة الصغيرة لكل خطوة أهم مما تبدو. فبدونها لا تخسر السياسةُ التي تتجوّل بلا نهاية دون بلوغ الخطر شيئًا، فلا حافز للعميل على الإنهاء. وتصميم المكافآت من هذا النوع هو ما يسكن فيه فعليًا معظم الصعوبة العملية في تطبيق التعلّم المعزَّز.

الأسئلة الشائعة

ماذا تفترض خاصية ماركوف بالضبط؟

أن الحالة الراهنة ملخّص كافٍ للماضي للتنبؤ بالمستقبل. فبمعلومية الحالة الحاضرة والفعل، لا يضيف التاريخ السابق معلومة عمّا سيحدث تاليًا. وإن أضاف، فتعريف الحالة ناقص وينبغي توسيعه.

لماذا يُستعمل معامل خصم؟

لإبقاء مجموع المكافآت منتهيًا على أفق غير محدود، وللتعبير عن أفضلية المكافآت الأقرب. وهو يحسّن كذلك الاستقرار العددي للخوارزميات التي تحسب القيم.

ما علاقة عملية القرار الماركوفية بالتعلّم المعزَّز؟

العملية هي صياغة المسألة؛ والتعلّم المعزَّز مجموعة الطرق التي تحلّها حين تكون احتمالات الانتقال والمكافآت مجهولة ويجب تعلّمها من التجربة. أما إذا كانت معلومة فتُحلّ العملية مباشرةً بطرق التخطيط مثل التكرار على القيم.

الخلاصة

تعبّر عملية القرار الماركوفية عن اتخاذ القرار المتتابع تحت عدم اليقين بحالات وأفعال وانتقالات ومكافآت، وحلّها سياسة. وهي المسألة الصورية التي وُجدت خوارزميات التعلّم المعزَّز لحلّها.