تخطّي إلى المحتوى
Kudos AI
Read in English
القرارات المتسلسلة والتعلّم المعزّز

القرارات في ظلّ اللايقين: المنفعة والمعلومة

لماذا قد يكون رفض رهانٍ قيمتُه المالية المتوقّعة موجبةٌ أمرًا عقلانيًا، وما الذي يقيسه تقوّس دالّة المنفعة، وكيف تسعّر مشاهدةً قبل شرائها - بما في ذلك الحالة الشائعة التي يكون فيها السعر الأمين صفرًا.

قراءة 6 دقيقةKudos AI

المتطلبات المسبقة: الشبكات البايزية والاستدلال الاحتمالي

خيار في برنامج مسابقات يُوزن مرّتين، مرّة بالدولارات ومرّة بالمنفعة، والحسابان يبلغان جوابين متعاكسين على رمية العملة نفسها.

يُنتج الاستدلال اعتقادات. والاعتقادات لا تخبرك بما تفعل. فالفعل يحتاج شيئًا لا تستطيع الاعتقادات تقديمه - التفضيلات - ونظرية القرار هي الحساب الذي يجمع الاثنين معًا.

أ. المنفعة المتوقّعة

دالّة المنفعة U(s)U(s) تعطي عددًا واحدًا لمدى استحسان الحالة. ولمّا كان الفعل في عالم غير يقيني لا يثبّت نتيجته، فاكتب Result(a)\mathrm{Result}(a) للمتغيّر العشوائي للنتائج الممكنة. والمنفعة المتوقّعة لفعلٍ ما، بمعلومية الشاهد e\mathbf{e}، هي

EU(a∣e)=∑s′P(Result(a)=s′∣a,e) U(s′),EU(a \mid \mathbf{e}) = \sum_{s'} P\big(\mathrm{Result}(a) = s' \mid a, \mathbf{e}\big)\, U(s') ,

ومبدأ المنفعة المتوقّعة العظمى هو ببساطة argmax⁡aEU(a∣e)\operatorname{argmax}_a EU(a \mid \mathbf{e}).

وليس ذلك «عظّم أفضل الحالات»، فتلك تهمل المخاطرة، ولا «ابلغ هدفًا»، إذ جودة النتيجة هنا متّصلة لا نجاحًا أو رسوبًا.

ب. المال ليس منفعة

لقد فزت في برنامج مسابقات. خذ $1,000,000، أو اقذف قطعة نقد عادلة: لا شيء في مقابل $2,500,000. والقيمة المالية المتوقّعة للمقامرة $1,250,000، وهي تفوق المليون المضمون. ومع ذلك يرفض أكثر الناس.

قوِّم وضعك الحالي بـ5، والمليون المضمون بـ8، وأفضل النتائج بـ9. فيكون

EU(Accept)=12(5)+12(9)=7<8=EU(Decline),EU(\text{Accept}) = \tfrac{1}{2}(5) + \tfrac{1}{2}(9) = 7 < 8 = EU(\text{Decline}) ,

ومن ثمّ فالرفض هو ما يقضي به المبدأ. والتوسيط واحد بعينه في الحسابين؛ ولا يختلف إلا المقياس، والمنفعة هي المقياس الذي يرمّز التفضيل.

والخلاف على شكل منحنى، لا على الحذر. فمنفعة الملياردير خطّية تقريبًا على بضعة ملايين، فتعطي EU(Accept)=1.25>1.0EU(\text{Accept}) = 1.25 > 1.0، ويقول المبدأ نفسه خذ المقامرة. عميلان، والاحتمالات نفسها، وخياران عقلانيان متضادّان.

Python

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

الحجّة تدور على شكل منحنى، فهذا هو المنحنى. النتائج الثلاث نقاطٌ عليه، والمزلاج يثنيه، والاحتمالات لا تتحرّك أبدًا. والخط المتقطّع هو التقدير الذي تحتاجه القمّة ليصحّ القبول: 11 عند التقديرات أعلاه. وهذا يستحقّ قراءتين، فهو يقول إن المليون والنصف الثاني ينبغي أن يضيف ما لا يقلّ عمّا أضافه المليون الأول، وذاك نقيض الغلّة المتناقصة التي تقوم عليها الحجّة كلّها.

تفاعلي: القطعة النقدية، والمنحنى الذي يحسم

الاحتمالات لا تتغيّر أبدًا. وإنما يتغيّر شكل المنفعة.

01.0M2.5M
المنفعة المتوقّعة، القبول
7.00
المنفعة المتوقّعة، الرفض
8.00
تقدير القمّة الذي يعادل
11.00
ما يوصي به MEU
ارفض
القيمة المالية المتوقّعة
$1,250,000

يساوي الرهان $1,250,000 بالمال مقابل مليون مضمون، فالمال يقول اقبل. وبالمنفعة يساوي 7.00 مقابل 8.00، فيقول المبدأ ارفض. ولا شيء هنا نقدٌ للمتوسّط: فهو محسوب بالطريقة نفسها في الحالتين، وإنما يختلف المقياس الذي يُمتوسَّط. ولكي يصحّ القبول لا بدّ أن تُقدَّر القمّة بـ11.00، أي أن يضيف المليون والنصف الثاني ما لا يقلّ عمّا أضافه المليون الأول.

ج. التقوّس هو النفور من المخاطرة

وجد غرايسون منفعة المال قريبة من اللوغاريتم، وهي فكرة ترجع إلى برنولي في 1738. وكانت الملاءمة لأحد المفحوصين U=−263.31+22.09log⁡(n+150,000)U = -263.31 + 22.09\log(n + 150{,}000). وتدرّج فيها بزيادات متساوية قدرها $100,000 تتقلّص المنفعة المضافة: 11.2811.28، ثم 7.437.43، ثم 5.555.55، ثم 4.434.43.

وتقلّص المكاسب هو التقعّر، وللمنحنى المقعّر يكون U(L)<U(SEMV(L))U(L) < U(S_{EMV(L)}) لكل يانصيب LL: فمواجهة المقامرة تساوي أقلّ من أن تُسلَّم قيمتها المتوقّعة. وذلك هو النفور من المخاطرة، وهو قابل للقياس. وعلى المنحنى نفسه، لقطعة نقد عادلة بين $0 و$800,000 منفعة متوقّعة 20.3520.35 في مقابل 28.6728.67 للمبلغ اليقيني $400,000. والمبلغ المضمون الذي يقدّره مساويًا للمقامرة - مكافئ اليقين - نحو $227,000، فتكون علاوة المخاطرة نحو $173,000.

وليس المنحنى مقعّرًا في كل موضع. فمن غرق في الدَّين بمقدار $10 ملايين قد يقبل عقلانيًا قطعة نقد بين ربحٍ إضافي قدره $10 ملايين وخسارةٍ قدرها $20 مليونًا، إذ لا تكاد النتائج تختلف عن موضعه الذي هو فيه. وذلك يعطي شكل حرف S: سعيًا إلى المخاطرة عند اليأس، ونفورًا منها على الثروات الموجبة.

وليس للمنافع مقياس مطلق، فثبّت واحدًا بتثبيت أفضل نتيجة وأسوئها عند 1 و0، ثم استخلص أي جائزة بعرضها في مقابل يانصيب معياري وضبط الاحتمال حتى يستوي الأمران عند العميل. وذلك الاحتمال هو المنفعة.

وحيث تكون أسوأ النتائج هي الموت، يأبى الناس تسعيره، وتجري المفاضلة على كل حال. والميكرومورت احتمال موت مقداره واحد في المليون. وقيادة 230 ميلًا تكلّف واحدًا، فعمر سيارة يبلغ 92,000 ميل يكلّف 400؛ ويدفع الناس نحو $10,000 في سيارة تنصّف تلك المخاطرة، فتوفّر 200، وذلك يستلزم $50 لكل ميكرومورت - وهو يطابق ما تورده الدراسات مباشرة. والمدى مقصور على المخاطر الصغيرة؛ فما من أحد يقبل $50 مليونًا ليموت في الحال.

ويورد رسل ونورفيغ خبر وكالة رفضت دراسةً عن الأسبستوس لأنها افترضت قيمة بالدولار لحياة طفل، ثم امتنعت عن الإزالة - فأضمرت بذلك قيمةً أدنى من التي أبت التصريح بها.

د. تسعير مشاهدة

شبكة القرار توسّع الشبكة البايزية بعقد قرار مستطيلة لخيارات العميل وعقدة منفعة معيّنة الشكل تعطي النتيجة درجتها. وتقييمها حلقة: اضبط الشاهد، ثم أجرِ لكل فعل استدلالًا عاديًا على آباء عقدة المنفعة، وتوسّط، وخذ الأفضل. وآلة الاستدلال لا تتغيّر.

وتلك البنية تتيح لك أن تسأل كم تساوي المشاهدة قبل شرائها. وقيمة المعلومة التامّة هي المنفعة المتوقّعة لقرارٍ يُتّخذ بعد المشاهدة، متوسّطةً على ما قد تقوله، مطروحًا منها المنفعة المتوقّعة لقرارٍ يُتّخذ الآن:

VPIe(Ej)=(∑kP(Ej=ejk∣e) EU(αejk∣e,Ej=ejk))−EU(α∣e).VPI_{\mathbf{e}}(E_j) = \left(\sum_k P(E_j = e_{jk} \mid \mathbf{e})\, EU\big(\alpha_{e_{jk}} \mid \mathbf{e}, E_j = e_{jk}\big)\right) - EU(\alpha \mid \mathbf{e}) .

تستطيع شركة نفط أن تشتري واحدة من nn كتلة لا يميّز بينها شيء؛ وواحدة منها بالضبط تحوي نفطًا قيمته CC وثمن كلٍّ منها C/nC/n، فيكون الربح المتوقّع صفرًا في الحالين. ومسحٌ قاطع للكتلة 3 يغيّر ذلك. فباحتمال 1/n1/n يجد نفطًا فتربح الشركة (n−1)C/n(n-1)C/n؛ وإلا تحسّنت الفرصة بين سائر الكتل من 1/n1/n إلى 1/(n−1)1/(n-1)، وذلك يساوي C/(n(n−1))C/(n(n-1)). ومعًا:

1n⋅(n−1)Cn+n−1n⋅Cn(n−1)=Cn.\frac{1}{n}\cdot\frac{(n-1)C}{n} + \frac{n-1}{n}\cdot\frac{C}{n(n-1)} = \frac{C}{n} .

فمسح كتلة واحدة يساوي ثمن كتلة بالضبط، مهما كان nn.

Python

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

هـ. الحالة التي يكون فيها السعر صفرًا

وللاستدلال نفسه لازمٌ أحدّ. طريقان: طريق سريع منفعته المتوقّعة 10، ودربٌ ترابي يساوي 4 قد ينقله تقرير قمر صناعي إلى أي موضع في [3,6][3, 6]. والتقرير لا يساوي شيئًا. فمهما قال، لا يتجاوز الدرب 6، وتبقى تسلك الطريق السريع، وتبقى المنفعة المتوقّعة بعده 10، فيكون VPI=0VPI = 0.

وقرّب بين الطريقين بدل ذلك - 10 في مقابل شيء في [8,13][8, 13] - فعلى القراءات 8,10,12,138, 10, 12, 13 تأخذ في كل مرة الأفضل من 10 ومن القراءة:

10+10+12+134=11.25.\frac{10 + 10 + 12 + 13}{4} = 11.25 .

والآن تنبّه إلى الشقّ الآخر من الفرق. فالقرار الآن لا يعني أخذ الطريق السريع، بل يعني أخذ الفعل الأعلى منفعةً متوقّعة، والمسلك الترابيّ يساوي أصلًا 14(8+10+12+13)=10.75\tfrac{1}{4}(8 + 10 + 12 + 13) = 10.75. فالأساس إذًا هو 10.7510.75 لا 1010:

VPI=11.25−10.75=0.50.VPI = 11.25 - 10.75 = 0.50 .

وتلك القيمة كلّها تأتي من قراءة واحدة. فبلا تقرير تسلك المسلك الترابيّ؛ أمّا القراءة 88 فتردّك إلى الطريق السريع، وذلك يساوي 14(10−8)=0.50\tfrac{1}{4}(10 - 8) = 0.50 بالضبط. وعند 1010 يتعادل الطريقان، فلا يكسب التحوّل شيئًا، وأمّا 1212 و1313 فخبر سارّ لا قيمة له، لأنّك كنت سالكًا ذلك الطريق على أيّ حال.

أين يضعك هذا

المعلومة تساوي شيئًا حين تستطيع أن تغيّر ما تفعل، وحينئذ فقط. فالقياس الذي لا يقدر على تبديل الخيار لا يساوي شيئًا مهما كان دقيقًا أو باهظًا، والقيمة تبلغ ذروتها حين تتقارب الأفعال المرشّحة وتتّسع المشاهدة اتّساعًا يكفي لإعادة ترتيبها. وذلك تحقّقٌ رخيص قبل أن تطلب دراسة، وهو الحساب نفسه الذي يفسّر لماذا يرفض العاقل رهانًا مؤاتيًا. ومسار التدريب اتّخاذ القرار في ظلّ عدم اليقين يعالج كلًّا من هذه يدويًا وبالشيفرة.

المراجع والقراءات الإضافية

  • Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· مكتبة مراجع Kudos AI

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 4 دقيقةالاستدلال الاحتمالي

الأسبوع الذي لم يكن ممكنًا

خذ أرجح حالة في كل يوم واكتبها بالترتيب، فيخرج لك تقرير يعطيه النموذج احتمالًا يساوي الصفر تمامًا: في مثال لمراقبة آلة على أربعة أيام يكون الجواب يومًا بيوم سليمة، سليمة، معطّلة، معطّلة، والانتقال من سليمة إلى معطّلة انتقال لا يقع. ما السؤالان فعلًا، ولماذا يجيب التنعيم وفيتربي عن سؤالين مختلفين، وماذا يعني احتمال بعدي قدره 0.411 لأفضل مسار لمن عليه أن يتصرّف.

الذكاء الاصطناعيالاحتمالات
قراءة 3 دقيقةالاستدلال الاحتمالي

مئة ألف عيّنة، أربعمئة منها حقيقيّة

على شبكة السطو مع اتّصال الجارين معًا، تُبقي المعاينة بالرفض 183 سحبًا من 100,000، وتُبقي المعاينة بالترجيح بالأرجحيّة كلَّ السحوب بحجم عيّنة فعّال قدره 396. والتقديران يبتعدان نحو 10% عن احتمال بعدي قدره 0.284172، والسبب يُحسب بالضبط: 252 عيّنة تحمل 76% من الوزن و99.975% من مربّع الوزن.

الذكاء الاصطناعيالاحتمالات
قراءة 9 دقيقةالاستدلال الاحتمالي

تعلّم الأعداد في نموذج احتمالي

من أين تأتي أعداد الشبكة البايزية أو التوزيع الغاوسي فعلًا: وصفة الإمكان الأعظم ذات الخطوات الثلاث مطبَّقة على معالم منفصلة ثم متصلة، وتوزيع بيتا القبلي الذي يصلح ما تفعله بحدث لم يُشاهد قط، وبايز الساذج والتكرار الصفري الواحد الذي يدمّره، وخوارزمية EM للحالة التي يتعذّر فيها العدّ أصلًا - وكل رقم محسوب لا مُدّعى.

الاحتمالاتالإحصاءالذكاء الاصطناعي
← العودة إلى كل المقالات