تخطّي إلى المحتوى
Kudos AI
Read in English
التعلّم المعزّز

الوسيط الذي لا يختاره أحد

مكافأة البقاء في عالَم الشبكة تُكتب مرّةً ولا تُناقَش، والسياسة المثلى دالّة درجيّة فيها: ثمانية عتبات بين -3 و0، كلٌّ منها يقلب مربّعًا واحدًا بالضبط. والقيمة المألوفة -0.04 تبعد 0.0048 عن العتبة التي تقرّر هل يسلك الوكيل الطريق القصير بمحاذاة الحفرة، وفوق -0.0221، حين تكاد الخطوات تكون مجانيّة، يصير الفعل الأمثل في أحد الأركان أن يدفع الجدار عمدًا.

قراءة 4 دقيقةKudos AI

المتطلبات المسبقة: عمليات القرار الماركوفية

كَنْسات بلمان تُحسب حيًّا على عالَم صغير، والمنافع تستقرّ مربّعًا بعد مربّع، وأسهم السياسة تنقلب مع تغيّر قيمة البقاء في المكان.

عالَم الشبكة المعياري أربعة مربّعات في ثلاثة، بجدار في (2,2)، وهدف قيمته +1 في (4,3)، وحفرة قيمتها -1 في (4,2). وكل فعل ينقل الوكيل كما أُريد باحتمال 0.8، وجانبًا باحتمال 0.1 إلى كل جهة؛ وارتطامه بجدار يبقيه مكانه. ومعامل الخصم يساوي واحدًا.

وفي مكان ما من المواصفة، في جملة لا يتوقّف عندها أحد عادةً، توجد مكافأة البقاء: كل مربّع غير نهائي يدفع RR لكل خطوة، وعادةً −0.04-0.04. وُضعت لتجعل التلكّؤ مكلفًا. ولا تُقدَّم بوصفها اختيارًا في النمذجة، لأنّها لا تبدو كذلك.

وهي أثقل أرقام المسألة أثرًا.

أ. ثماني عتبات

حُلّ العالَم لكل RR بين −3-3 و00، فلا تنزلق السياسة المثلى. بل تثبت، ثم تتغيّر في مربّع واحد، ثم تثبت من جديد. وبتنصيف كل تغيّر حتى ستّ منازل عشريّة:

مكافأة البقاءالمربّعقبلبعد
-1.649707(3,2)يمينأعلى
-1.564259(3,1)يمينأعلى
-0.731138(1,1)يمينأعلى
-0.452624(4,1)أعلىيسار
-0.084989(2,1)يمينيسار
-0.044833(3,1)أعلىيسار
-0.027357(3,2)أعلىيسار
-0.022145(4,1)يسارأسفل

تسع سياسات مثلى متمايزة على ذلك المجال، يفصل بينها ثمانية أرقام، وكل رقم أعلاه حُسب مرّتين: بالتكرار على السياسات، حيث كل تقييم حلٌّ خطّي مضبوط، وبالتكرار على القيم حتى تسامح قدره 10−1410^{-14}. وتتّفق الطريقتان على كل سياسة وعلى كل منفعة في حدود 9×10−149 \times 10^{-14}.

تفاعلي: السياسة دالةً درجيةً في مكافأة البقاء

عالم 4x3، باحتمال 0.8 للاتجاه المقصود و0.1 لكل جانب، بلا خصم.

(1,1)0.705(1,2)0.762(1,3)0.812(2,1)0.655(2,3)0.868(3,1)0.611(3,2)0.660(3,3)0.918(4,1)0.388(4,2)-1(4,3)+1-30-0.04-1-0.2
منفعة المربع (1,1)
0.705308
مجال السياسة
7 من 9
مربعات تخالف الكتاب
0
تكرار القيم مقابل الحل الدقيق
5.4e-15

عند R = -0.04 تكون السياسة المثلى هي التي تصح لكل مكافأة عيش بين -0.044833 و-0.027357، وتساوي U(1,1) القيمة 0.705308. في (3,1) يتجه الوكيل يسارًا، الطريق الطويل، أبعد ما يمكن عن الحفرة.

ب. القيمة المألوفة على بعد 0.0048 من حافّة

انظر إلى السطر الغليظ. عند R=−0.04R = -0.04 يتّجه الوكيل الواقف في (3,1)، أي قُطريًّا أسفل الحفرة وإلى يسارها، إلى اليسار: الطريق الطويل، على امتداد الأسفل ثم صعودًا على الجانب البعيد، دون أن يطأ قطّ مربّعًا مجاورًا للحفرة. وهذه هي السياسة المطبوعة في كل كتاب، والتي يتعلّم منها حدس الجميع هذا العالَم.

وعند R=−0.05R = -0.05 يتّجه إلى أعلى بدل ذلك: إلى (3,2)، المربّع الواقع مباشرةً يسار الحفرة، سالكًا الطريق القصير وقابلًا باحتمال حقيقي أن تدفعه الريح جانبًا إلى الـ−1-1.

والانقلاب عند R=−0.044833R = -0.044833. والإعداد المألوف يعلوه بـ0.0048330.004833. ومكافأة بقاء قدرها −0.04-0.04 وأخرى قدرها −0.05-0.05 اختيار واحد في نظر أيّ حكم بشري، وهما تنتجان حكايتين مختلفتين عمّا يفعله وكيل عاقل في هذا العالَم.

أمّا المنافع فتتحرّك بسلاسة خلال ذلك كلّه: U(1,1)U(1,1) يساوي 0.7053080.705308 عند R=−0.04R = -0.04، و−1.600186-1.600186 عند R=−0.4R = -0.4، و−10.815340-10.815340 عند R=−2R = -2. فالسياسة، أي الشيء الذي تنشره فعلًا، هي الدالّة الدرجيّة.

ج. سياستان تبدوان خللًا

فوق -0.022145 يدفع الوكيل الجدار عمدًا. فلكل مكافأة بقاء بين −0.022145-0.022145 و00، وهي أرخص الخطوات في المجال كلّه، يكون الفعل الأمثل في (4,1)، الركن الأيمن الأسفل، هو أسفل. ولا شيء تحته؛ فالحركة ترتطم بالأرض ويبقى الوكيل مكانه باحتمال 0.8، وينزلق جانبًا باحتمال 0.1 إلى كل جهة، وإحداهما ترتطم بجدار أيضًا.

وليس هذا خللًا. فالمربّع الذي يعلو (4,1) مباشرةً هو الحفرة. وحين لا يكلّف الوقت شيئًا يُذكر، يكون أرخص ما يُفعل في ذلك الركن ألّا يُفعل شيء، وأفضل فعل يحقّق هذا اللاشيء هو الدفع نحو الأرض. فكل حركة مقصودة تخاطر بالانحراف صعودًا إلى الـ−1-1.

وعند الطرف الآخر يغوص الوكيل في الحفرة. فمن أجل R<−1.649707R < -1.649707 يكون الفعل الأمثل في (3,2) هو الذهاب يمينًا، أي مباشرةً إلى النهاية −1-1. فما إن تتجاوز كلفة الخطوة الإضافيّة 1.649707 حتى يفوز أسرع المخارج، والحفرة أقربها. و U(1,1)=−10.815340U(1,1) = -10.815340 عند R=−2R = -2: الوكيل ليس مرتبكًا، بل هو في عالَم يكلّف فيه الوجود كثيرًا.

والسلوكان كلاهما تعظيم سليم. وكلاهما سيُبلَّغ عنه بوصفه خللًا من لم ينظر في مكافأة البقاء، ولا يُصلَح أيٌّ منهما بتغيير الخوارزميّة.

د. ما العمل

الخلاصات العمليّة قصيرة ومحدّدة.

  • امسح الوسيط الذي لم تحسب أنّك تختاره. تسع سياسات على مجال واحد ليست اكتشافًا غريبًا؛ بل هي شكل أيّ أرغماكس ثابت بالقطع. والمسح رخيص: كل حلٍّ هنا نظام خطّي 11×1111 \times 11.
  • أبلغ عن المجال لا عن النقطة. «السياسة المثلى من أجل −0.0448<R<−0.0274-0.0448 < R < -0.0274» دعوى تصمد أمام من يقرّب مكافأة البقاء. أمّا «السياسة المثلى من أجل R=−0.04R = -0.04» فدعوى عن رقم واحد، وهي الأضعف وإن بدت أدقّ.
  • المكافأة المضبوطة وسيط مُلائَم. فتعديل كلفة الخطوة حتى يفعل الوكيل الصواب ملاءمةٌ، والقيمة الناتجة ترث كل تحفّظ يلحق بأيّ وسيط مُلائَم. وبخاصّة لا ينبغي أن تُعرض بعد ذلك بوصفها جزءًا من البيئة.
  • افحص طرفَي المجال الذي تعتقده. إن كان اعتقادك أنّ «الوقت مكلف قليلًا، نحو بضعة بالمئة لكل خطوة» فاحلل عند طرفَي «بضعة بالمئة». وهنا يحتوي ذلك المجال على ثلاث عتبات.

والصيغة الأعمق للفكرة أنّ دالّة المكافأة ليست وصفًا للعالَم. إنّها المواصفة الكاملة للغاية التي وُجد الوكيل من أجلها، وجزءٌ منها يُكتب مرّةً في ملف إعدادات ولا يُراجَع ولا يُغيَّر يعمل أكثر من كل ما يتجادل فيه الناس.

المراجع والقراءات الإضافية

  • Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· مكتبة مراجع Kudos AI

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 7 دقيقةالتعلّم المعزّز

عمليات القرار الماركوفية

كيف تخطّط حين لا تفعل الأفعال ما تقصده بموثوقية: الحالات، ونموذج الانتقال، والمكافآت والخصم، ومعادلة بلمان، وتكرار القيمة محلولاً عددياً حتى نقطته الثابتة.

التعلّم المعزّزالاحتمالاتالذكاء الاصطناعي
قراءة 4 دقيقةالاستدلال الاحتمالي

الأسبوع الذي لم يكن ممكنًا

خذ أرجح حالة في كل يوم واكتبها بالترتيب، فيخرج لك تقرير يعطيه النموذج احتمالًا يساوي الصفر تمامًا: في مثال لمراقبة آلة على أربعة أيام يكون الجواب يومًا بيوم سليمة، سليمة، معطّلة، معطّلة، والانتقال من سليمة إلى معطّلة انتقال لا يقع. ما السؤالان فعلًا، ولماذا يجيب التنعيم وفيتربي عن سؤالين مختلفين، وماذا يعني احتمال بعدي قدره 0.411 لأفضل مسار لمن عليه أن يتصرّف.

الذكاء الاصطناعيالاحتمالات
قراءة 4 دقيقةالبحث والألعاب

الإصلاح الذي غيّر نسبة النجاح أكثر بكثير ممّا غيّر الكلفة

السماح بالنقلات الجانبيّة يرفع تسلّق التلال في مسألة الملكات الثماني من 14.75% من التشغيلات المحلولة إلى 94.55%، وهو ما يُقرأ تحسّنًا بستّة أضعاف وليس كذلك: فمع إعادات البدء العشوائيّة تنتقل الكلفة المتوقّعة للحلّ من 21.9 خطوة إلى 23.1، وإذا عُدّت بالنقلات المقيَّمة انخفضت بنسبة 16%، من 1,547 إلى 1,298. والتلدين المحاكى يحلّ 98.8% بكلفة 1,622 تقييمًا. فالذي تغيّر هو الإحصاء في معظمه لا العمل.

الذكاء الاصطناعي
← العودة إلى كل المقالات