تخطّي إلى المحتوى
Kudos AI
Read in English
التعلّم المعزّز

التعلّم المعزّز وتعلّم Q

تعلّم حسن التصرّف بلا نموذج للعالم: تحديثات الفروق الزمنية، وقاعدة تعلّم Q، والاستكشاف في مقابل الاستثمار، وتشغيل يستعيد الأمثلية المخطَّطة من التجربة وحدها.

قراءة 8 دقيقةKudos AI

المتطلبات المسبقة: عمليات القرار الماركوفية

خمس رحلات تُحدَّث يدويًا، وB مضطرّة إلى التعلّم قبل أن تستطيع A ذلك - ثم إخفاق الجشع مرسومًا حلقةً مغلقة كما هو فعلًا.

حلّت عمليات القرار الماركوفية مسألة التخطيط: بمعلومية P(s′∣s,a)P(s' \mid s, a) وR(s)R(s)، يعيد تكرار القيمة سياسةً مثلى. لكن الوكيل المُلقى في بيئة غير مألوفة لا يملك أياً منهما. فهو لا يعرف ماذا تفعل أفعاله، ولا أين المكافآت. وعليه أن يكتشف ذلك بالتصرّف.

تلك هي مسألة التعلّم المعزّز، وهي أقرب بكثير إلى الوضع الذي يوجد فيه أي وكيل حقيقي.

أ. التعلّم من الفرق بين تقديرين متعاقبين

لنفترض أن الوكيل يتبع سياسةً π\pi في عالم 4×34 \times 3 عند Russell وNorvig، حيث تكلّف كل خطوة R=−0.04R = -0.04 ولا تُخصم المكافآت (γ=1\gamma = 1)، ويعتقد حالياً Uπ(1,3)=0.84U^{\pi}(1,3) = 0.84 وUπ(2,3)=0.92U^{\pi}(2,3) = 0.92. ثم يرصد انتقالاً من (1,3)(1,3) إلى (2,3)(2,3). فلو وقع ذلك الانتقال في كل مرة، لوجب أن تحقّق المنفعتان علاقة بلمان لـπ\pi، أي Uπ(1,3)=−0.04+0.92=0.88U^{\pi}(1,3) = -0.04 + 0.92 = 0.88 - وهما لا تحقّقانها تماماً. فالتقدير عند (1,3)(1,3) يبدو منخفضاً قليلاً. (ومع γ=0.9\gamma = 0.9 المستعملة لاحقاً في هذه المقالة يصير الهدف 0.7880.788، ويبدو التقدير نفسه مرتفعاً.)

والعلاج دفعُه نحو الاتّساق. فعند رصد انتقال s→s′s \to s':

Uπ(s)←Uπ(s)+α(R(s)+γ Uπ(s′)−Uπ(s)),U^{\pi}(s) \leftarrow U^{\pi}(s) + \alpha\big(R(s) + \gamma\, U^{\pi}(s') - U^{\pi}(s)\big),

حيث α\alpha معدّل التعلّم. وهذا تحديث الفرق الزمني (TD)، سُمّي كذلك لأنه مدفوع بالفرق بين تقديري المنفعة في خطوتين زمنيتين متعاقبتين.

والكمية بين القوسين هي خطأ TD: أي ما رصدناه للتوّ، R(s)+γU(s′)R(s) + \gamma U(s')، ناقص ما كنا نعتقده، U(s)U(s). والخطأ الصفري يعني أن تقديراتنا متّسقة محلياً فلا شيء يتغيّر. وكل طرق TD تعمل هكذا - بتعديل التقديرات نحو التوازن الذي يصحّ حين تكون صحيحة.

لماذا هذا لافت. لا يذكر التحديث أي احتمالات إطلاقاً. فالوكيل لا يقدّر P(s′∣s,a)P(s' \mid s, a) أبداً. ومع ذلك، لأن الانتقالات تُعايَن من النموذج الحقيقي، تقود الانتقالاتُ المتكرّرة التحديثَ بتناسب مع تكرارها، ويحدث المتوسّط ضمنياً. فالنموذج لا يُتعلَّم قط، بل يُطاع فحسب.

ب. من المنافع إلى قيم الأفعال

يتعلّم TD كما كُتب Uπ(s)U^{\pi}(s) - أي مدى جودة الحالة. وهذا غير قابل للتنفيذ مباشرةً: فلكي يختار الوكيل عليه معرفة جودة كل فعل متاح، وتحويل UU إلى اختيار يستلزم معرفة إلى أين تؤدّي الأفعال، وهو بالضبط النموذج الذي لا نملكه.

فلنتعلّم قيم الأفعال بدلاً من ذلك. عرّف Q(s,a)Q(s, a) بأنها المنفعة المتوقّعة لاتّخاذ الفعل aa في الحالة ss. وترتبط الاثنتان بـ

U(s)=max⁡aQ(s,a),U(s) = \max_{a} Q(s, a),

ويستطيع الوكيل الذي يملك QQ أن يتصرّف بلا أي نموذج البتّة: انظر في صف الحالة الحالية وخذ أكبر مدخلة.

ج. تحديث تعلّم Q

Q(s,a)←Q(s,a)+α(R(s)+γmax⁡a′Q(s′,a′)−Q(s,a))Q(s, a) \leftarrow Q(s, a) + \alpha\Big(R(s) + \gamma \max_{a'} Q(s', a') - Q(s, a)\Big)

ويُطبَّق كلما اتُّخذ الفعل aa في ss وأدّى إلى s′s'. وهو فكرة TD مع استبدال أفضل قيمة فعل متاحة عند الحالة التالية بمنفعة الحالة.

وmax⁡a′\max_{a'} هي التفصيلة الحاسمة. فالوكيل يرجّع قيمة أفضل فعل عند s′s'، بغضّ النظر عمّا يفعله تالياً فعلاً. وهذا يجعل تعلّم Q خارج السياسة: فهو يتعلّم عن السياسة المثلى بينما يتصرّف وفق سياسة أخرى أكثر استكشافاً.

أما قريبه SARSA - اختصاراً لحالة، فعل، مكافأة، حالة، فعل - فيستخدم بدل ذلك الفعل a′a' المتَّخذ فعلاً:

Q(s,a)←Q(s,a)+α(R(s)+γ Q(s′,a′)−Q(s,a)).Q(s, a) \leftarrow Q(s, a) + \alpha\big(R(s) + \gamma\, Q(s', a') - Q(s, a)\big).

وهذا يجعل SARSA داخل السياسة: فهو يتعلّم قيمة السياسة المتَّبعة، بما فيها الاستكشاف. وللوكيل الجشِع بحتاً يتطابق الاثنان. أما حين يجري استكشاف فيختلفان، والفرق مهم: إذ يستطيع تعلّم Q تعلّم سلوك جيد حتى وهو مقاد بسياسة استكشاف عشوائية أو معادية، بينما يكون SARSA أواقع حين تكون السياسة خارج سيطرة الوكيل جزئياً - مثلاً حين يتشارك وكلاء آخرون البيئة.

د. الآلية، خطوةً خطوة

خذ عالم المقالة السابقة: حالتان غير نهائيتين s1,s2s_1, s_2 بـR(s)=−0.04R(s) = -0.04، ونهائيتان GOAL بـ(+1)(+1) وPIT بـ(−1)(-1)، وγ=0.9\gamma = 0.9. وتبدأ كل قيم QQ من الصفر. ولنستخدم α=0.5\alpha = 0.5.

لنفترض أن الوكيل يسلك s1→s2→s_1 \to s_2 \to GOAL، مرتين.

التحديث 1، (s1,Right)→s2(s_1, \text{Right}) \to s_2. وكل Q(s2,⋅)Q(s_2, \cdot) ما زالت 00:

Q(s1,Right)←0+0.5(−0.04+0.9×0−0)=−0.02.Q(s_1, \text{Right}) \leftarrow 0 + 0.5\big(-0.04 + 0.9 \times 0 - 0\big) = -0.02 .

التحديث 2، (s2,Right)→(s_2, \text{Right}) \to GOAL، وقيمتها +1+1:

Q(s2,Right)←0+0.5(−0.04+0.9×1−0)=0.5×0.86=0.43.Q(s_2, \text{Right}) \leftarrow 0 + 0.5\big(-0.04 + 0.9 \times 1 - 0\big) = 0.5 \times 0.86 = 0.43 .

التحديث 3، (s1,Right)→s2(s_1, \text{Right}) \to s_2 مرة أخرى - لكن لـs2s_2 الآن قيمة:

Q(s1,Right)←−0.02+0.5(−0.04+0.9×0.43−(−0.02))=0.1635.Q(s_1, \text{Right}) \leftarrow -0.02 + 0.5\big(-0.04 + 0.9 \times 0.43 - (-0.02)\big) = 0.1635 .

التحديث 4، (s2,Right)→(s_2, \text{Right}) \to GOAL: 0.43+0.5(0.86−0.43)=0.6450.43 + 0.5(0.86 - 0.43) = 0.645.

التحديثالزوجقبلبعد
1(s1,Right)(s_1, \text{Right})0.0000−0.0200
2(s2,Right)(s_2, \text{Right})0.00000.4300
3(s1,Right)(s_1, \text{Right})−0.02000.1635
4(s2,Right)(s_2, \text{Right})0.43000.6450

لاحظ كيف تنتشر القيمة إلى الوراء: فلا يصل شيء مفيد إلى s1s_1 قبل أن تتعلّم s2s_2 شيئاً أولاً.

هذه المتتالية بعينها تتقارب إلى الرقم الخطأ، وهذا هو المقصود. فكلتا الحلقتين أعلاه انتُقيتا يدوياً لبلوغ GOAL. وتكرارهما وحدهما يدفع Q(s2,Right)Q(s_2, \text{Right}) نحو −0.04+0.9(1)=0.86-0.04 + 0.9(1) = 0.86 - وهي قيمة Right الذي ينجح دائماً. لكن Right لا يبلغ GOAL إلا 80٪ من الوقت؛ وفي الـ20٪ الباقية يسقط في PIT. والقيمة الصحيحة −0.04+0.9 (0.8×1+0.2×(−1))=0.5-0.04 + 0.9\,(0.8 \times 1 + 0.2 \times (-1)) = 0.5. ولا يبلغها تعلّم Q إلا لأن التجربة الحقيقية تعاين النتيجتين بالنسبة الصحيحة. فالعيّنة المتحيّزة تعطي إجابة متحيّزة.

هـ. الاستكشاف في مقابل الاستثمار

الوكيل الذي يأخذ دائماً أفضل فعل حالي قد لا يكتشف أفضل منه أبداً. والوكيل الذي يتصرّف دائماً عشوائياً يتعلّم عن كل شيء ولا يستثمر شيئاً. وهذه هي مقايضة الاستكشاف والاستثمار.

وأبسط جواب عملي هو الجشِع-ε\varepsilon: تصرّف جشِعاً باحتمال 1−ε1 - \varepsilon، وعشوائياً باحتمال ε\varepsilon. وما دام ε\varepsilon يتناقص مع الزمن، يستكشف الوكيل بما يكفي مبكراً ليجد الأفعال الجيدة ويستثمر بما يكفي لاحقاً ليراكم المكافأة. وتستخدم المخطّطات الأدقّ دالةَ استكشاف تضخّم قيمة أزواج الحالة-الفعل التي جُرّبت نادراً، وهو ما يقتضي حفظ عدّادات الزيارات.

يطبّق الشكل أدناه التحديث نفسه في عالم مختلف قليلًا، فأرقامه ليست أرقام الجدول: حالتان A وB، وحالة نهائية قيمتها +1+1 تُبلغ بالذهاب يمينًا من B، وحركة يمين تفشل في 20% من المرات فتعيد العميل إلى A بدل أن تُسقطه في حفرة. ويبدأ بخمس رحلات مرسومة سلفًا تنجح كلها، بالترتيب B، B، A، B، A. تنقّل بينها وراقب الترتيب لا الأرقام. فـA يبقى عند الصفر تمامًا في الرحلتين الأوليين، لأن أيًّا منهما لا تبدأ من A، ثم يجد تحديثه الأول B وقد بلغ 0.420.42. ثم حاكِ البيئة التي يواجهها العميل فعلًا. فنظامٌ من الرحلات الناجحة دائمًا يتقارب إلى 0.8600 عند B، وهي قيمة عالمٍ ينجح فيه الذهاب يمينًا دائمًا. ولا يعلّم خلافَ ذلك إلا الانزلاق.

تفاعلي: القيمة تصل خطوةً إلى الوراء في كل مرة

رحلات الدرس الخمس، ثم البيئة التي يواجهها العميل فعلًا.

جدول Q

من A0.0000من B0.0000
التكرار على القيمةلو لم تنزلق أي رحلة
Q(A, يمين)
0.0000
Q(B, يمين)
0.0000
الرحلات المنفَّذة
0
آخر خطأ TD
-

تبدأ كل قيم Q من الصفر، بما فيها قيمة الحالة النهائية: فالعميل لم يزرها ولا يعلم أنها تدفع. ولهذا يُنزِل أول رحلة من B القيمةَ إلى -0.02 بدل أن يرفعها: فكل ما تعلّمه حتى الآن أن العيش يكلّف 0.04.

و. هل يستعيد فعلاً الأمثلية المخطَّطة؟

حسبت المقالة السابقة الإجابة الدقيقة بالتخطيط مع معرفة كاملة بالنموذج: U(s1)=0.3902U(s_1) = 0.3902 وU(s2)=0.5000U(s_2) = 0.5000. ولا يرى متعلّم Q ذلك النموذج قط. شغّله 200,000 حلقة بـε=0.2\varepsilon = 0.2 ومعدّل تعلّم متناقص:

Python

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

يطبع:

الزوجQQ المُتعلَّمة
(s1,Right)(s_1, \text{Right})0.3847
(s1,Stay)(s_1, \text{Stay})0.3082
(s2,Left)(s_2, \text{Left})0.3253
(s2,Right)(s_2, \text{Right})0.4926

وأخذ U(s)=max⁡aQ(s,a)U(s) = \max_a Q(s,a) يعطي 0.38470.3847 و0.49260.4926، مقابل 0.39020.3902 و0.50000.5000 المخطَّطتين - والسياسة الجشِعة المقروءة من هذه القيم هي Right في الحالتين، وهي بالضبط السياسة التي أنتجها تكرار القيمة. فقد استعاد الوكيل السلوك الأمثل دون أن يُخبَر قط بما تفعله أفعاله.

والفجوة الصغيرة المتبقّية خطأ معاينة أمين لا خلل: فالتقديرات متوسطات على عدد منتهٍ من الانتقالات المعايَنة، وتضيق ببطء كلما تناقص معدّل التعلّم. وهذه هي المقايضة المعيارية - إذ يطلب منك تعلّم Q أقل بكثير مما يطلبه تكرار القيمة، ويدفع الثمن كفاءةً في العيّنات.

ز. الحدود

كل ما هنا يفترض جدول QQ بمدخلة لكل زوج حالة-فعل. وهذا حسن لأربع مدخلات وميؤوس منه للشطرنج أو لأي بيئة ذات حالة متصلة. فالمسائل الحقيقية تحتاج التعميم: تقريب QQ بدالة مُبارَمة بدل تعدادها، وهنا يلتقي التعلّم المعزّز ببقية تعلّم الآلة.

والحدّ الثاني أن وكلاء تعلّم Q لا يستطيعون النظر إلى الأمام. فلأنهم لا يعرفون إلى أين تؤدّي الأفعال، لا يستطيعون تخطيط متتالية كما يفعل وكيل قائم على نموذج - بل يستطيعون فقط مقارنة قيم الأفعال التي تعلّموها. فالتحرّر من النموذج يُشترى بثمن بُعد النظر.

الخلاصات الأساسية

  • يُسقط التعلّم المعزّز افتراض عملية القرار الماركوفية بأن النموذج معلوم؛ ويتعلّم الوكيل من التجربة بدلاً من ذلك.
  • تحديث TD يدفع التقديرات نحو الاتّساق المحلي، بلا أي احتمالات - إذ توفّر المعاينة المتوسّط ضمنياً.
  • Q(s,a)Q(s,a) تجعل اختيار الفعل خالياً من النموذج، مع U(s)=max⁡aQ(s,a)U(s) = \max_a Q(s,a).
  • قاعدة تعلّم Q ترجّع max⁡a′Q(s′,a′)\max_{a'} Q(s', a')، فتجعله خارج السياسة؛ بينما يرجّع SARSA الفعل المتَّخذ فعلاً فيكون داخل السياسة.
  • تنتشر القيمة إلى الوراء من المكافآت، بتحديث واحد لكل خطوة.
  • العيّنة المتحيّزة من الانتقالات تعطي QQ متحيّزة؛ والصحّة تعتمد على تجربة النتائج بنسبها الحقيقية.
  • بلغ متعلّمنا 0.38470.3847 و0.49260.4926 مقابل 0.39020.3902 و0.50000.5000 المخطَّطتين، فاستعاد السياسة المثلى بلا نموذج.
  • وQQ الجدولية لا تتوسّع؛ والتعميم هو الجسر إلى بقية تعلّم الآلة.

ما التالي

مسألة الاستكشاف، وخطأ المعاينة أعلاه، وسؤال إسناد الفضل، كلها ذات نكهة معلوماتية. وتجعل الإنتروبيا والمعلومات فكرةَ «كم بقي من اللايقين» دقيقة.

المراجع والقراءات الإضافية

  • Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· مكتبة مراجع Kudos AI

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 7 دقيقةالتعلّم المعزّز

عمليات القرار الماركوفية

كيف تخطّط حين لا تفعل الأفعال ما تقصده بموثوقية: الحالات، ونموذج الانتقال، والمكافآت والخصم، ومعادلة بلمان، وتكرار القيمة محلولاً عددياً حتى نقطته الثابتة.

التعلّم المعزّزالاحتمالاتالذكاء الاصطناعي
قراءة 3 دقيقةأسس الاحتمالات

أيّ توزيع خاطئ تريد؟

هدفٌ ثنائي المنوال، وغاوسيّة واحدة، واتّجاهان للتباعد نفسه. تصغير KL(P||Q) يمدّ الغاوسيّة على المنوالين بلا كتلة تُذكر حيث يقيم الهدف فعلًا؛ وتصغير KL(Q||P) يضعها على منوال واحد عند 0.6931 نات، وهي ln 2 حتى أربعة أرقام عشرية لا مصادفة. وكل مواءمة يحكم عليها المعيار الآخر بالكارثة: 2.0976 مقابل 15.2799.

تعلّم الآلةالرياضيات
قراءة 4 دقيقةالاستدلال الاحتمالي

الأسبوع الذي لم يكن ممكنًا

خذ أرجح حالة في كل يوم واكتبها بالترتيب، فيخرج لك تقرير يعطيه النموذج احتمالًا يساوي الصفر تمامًا: في مثال لمراقبة آلة على أربعة أيام يكون الجواب يومًا بيوم سليمة، سليمة، معطّلة، معطّلة، والانتقال من سليمة إلى معطّلة انتقال لا يقع. ما السؤالان فعلًا، ولماذا يجيب التنعيم وفيتربي عن سؤالين مختلفين، وماذا يعني احتمال بعدي قدره 0.411 لأفضل مسار لمن عليه أن يتصرّف.

الذكاء الاصطناعيالاحتمالات
← العودة إلى كل المقالات