المبرهنة التي لا تقول شيئًا عن مسألتك
بالمتوسّط على الدوالّ الـ256 من ثلاث بتّات إلى واحدة، يسجّل متعلّمُ أقرب جار ومتعلّمٌ بُني ليخطئ عمدًا 0.500000 بالضبط خارج بيانات التدريب. تلك هي مبرهنة انعدام الغداء المجّاني، وهي صحيحة بالضبط، وما إن يُقصَر المتوسّط على الدوالّ الستّ التي تعتمد على بتّ واحد حتى يفترق الاثنان إلى 0.333333 و0.666667.
المتطلبات المسبقة: لماذا ينجح التعلّم من البيانات أصلاً
ثلاثة مداخل ثنائيّة، أي ثماني نقاط ممكنة، ودالّةٌ تُسنِد وسمًا لكلٍّ منها. وعدد هذه الدوالّ ، وهي كلّها.
أرِ متعلّمًا أربعًا من النقاط الثماني بأوسامها الحقيقيّة، وقيّمه على الأربع الباقية. افعل ذلك لكلٍّ من الدوالّ الـ256 وخُذ المتوسّط:
| المتعلّم | متوسّط الخطأ خارج التدريب |
|---|---|
| توقّع 0 دائمًا | 0.500000 |
| توقّع 1 دائمًا | 0.500000 |
| أقرب جار بمسافة هامنغ | 0.500000 |
| نقيض أقرب جار | 0.500000 |
والسطر الأخير متعلّمٌ بُني ليخطئ: يجد أقرب نقطة تدريب ويتوقّع عكس وسمها. وبمتوسّط على كل الدوالّ يكون جيّدًا تمامًا كأقرب جار، وهو جيّد تمامًا كتجاهل البيانات رأسًا.
هذه هي مبرهنة انعدام الغداء المجّاني، والجدول ليس تقريبًا. فكل خانة تعدادٌ مضبوط لـ256 دالّة.
أ. لماذا لا يمكن أن تخرج على غير ذلك
لأيّ أربع نقاط محجوزة تنتظم الدوالّ الـ256 أزواجًا. فلكل دالّة أخرى تطابقها على نقاط التدريب الأربع وتخالفها على نقاط الاختبار الأربع. والمتعلّم يرى بيانات التدريب نفسها في الحالتين، فيتوقّع الشيء نفسه، فيكون مجموع أخطائه على الزوج أربعةً من أربع. وبالمتوسّط على الزوج: النصف بالضبط.
ولا يدخل في هذه الحجّة شيء من صفات المتعلّم. فهي تصدق على شبكة عميقة، وعلى جدول بحث، وعلى مولّد أعداد عشوائيّة.
ب. ولماذا لا تنطبق
المبرهنة تأخذ متوسّطًا على توزيع منتظم على كل الدوالّ. وهذا هو الفرض الذي يقوم بالعمل، وليس فرضًا هيّنًا: فتحته تكون أوسام النقاط التي لم ترَها مستقلّةً عن أوسام التي رأيتها. وعالَمٌ يُسحب هكذا لا يحوي بنيةً قابلة للتعلّم بالبناء، والمبرهنة تقول ذلك.
اقصُر المتوسّط نفسه على الدوالّ الستّ التي تعتمد على بتّ واحد - أو ، وهي أبسط بنية ممكنة - فتعطي المتعلّمات الأربعة نفسها:
| المتعلّم | الخطأ على الستّ |
|---|---|
| توقّع 0 دائمًا | 0.500000 |
| توقّع 1 دائمًا | 0.500000 |
| أقرب جار | 0.333333 |
| نقيض أقرب جار | 0.666667 |
فيظهر الترتيب فورًا، وهو الترتيب الذي يتوقّعه أيّ أحد: التنبّؤ بالتشابه ينفع حين تحمل المدخلات المتشابهة أوسامًا متشابهة، وصار النقيض سيّئًا بمقدار ما المتعلّم جيّد بالضبط.
وهذان الرقمان يخصّان التقسيم المعتمد في المقال كلّه، حيث يُرى المتعلّم النقاط الأربع التي بتّها الأوّل 0؛ أمّا بالمتوسّط على الطرق الـ70 لاختيار نقاط التدريب الأربع فتعطي الدوالّ الستّ 0.342857 لأقرب جار و0.657143 لنقيضه، بالترتيب نفسه.
وستٌّ من 256 هي 2.3% من فضاء الدوالّ. وكل مسألة واقعيّة تعيش في جزء لا يقلّ عن ذلك خصوصيّةً، وغالبًا أكثر بكثير.
تفاعلي: لا غداء مجانيًا، الدوال الـ256 كلها
ثلاث بتات، أربع نقاط معروضة وأربع محجوبة، وكل الدوال معدودة.
- الدوال المحسوب متوسطها
- 256 من 256
- أقرب جار، متوسط الخطأ
- 0.500000
- نقيض أقرب جار، متوسط الخطأ
- 0.500000
- الحصة من فضاء الدوال
- 100%
الدالة 255، بالأوسام 11111111 هي آخر الـ256، وعلى مجموعها ينال كل متعلم 0.500000 تمامًا خارج بيانات التدريب، ومنهم المتعلم المصمَّم ليخطئ. فلكل دالة شريكة تتفق معها على النقاط الأربع المعروضة وتعكس الأربع المحجوبة كلها؛ ولا يستطيع أي متعلم التمييز بينهما، فمجموع خطئه على الزوج أربعة من أربعة دائمًا.
ج. فيمَ تنفع المبرهنة فعلًا
ليست حجّةً على أنّ الطرائق كلّها سواء. بل هي برهانٌ على أنّه لا طريقة أفضل على الإطلاق، وهذا له لازم دقيق ونافع: أن نجاح متعلّمٍ على صنف من المسائل يُشترى بمطابقته لذلك الصنف، ويُدفع ثمنه إخفاقًا على مُتمّمه.
وهذا هو المضمون الحقيقي، ويحسن ذكره بالصورة التي يأخذها عمليًّا:
- لكل متعلّم تحيّز استقرائي، حتى الذي لا يعلن عن واحد. فأقرب الجيران يفترض أنّ المدخلات المتقاربة تتشارك الأوسام؛ والنماذج الخطّيّة تفترض آثارًا تجميعيّة؛ والشبكات الالتفافيّة تفترض أنّ الانسحاب يهمّ وأنّ الموضعيّة تنفع. ولا شيء من ذلك محايد، ولا يمكن أن يكون.
- نتيجة أيّ معيار قياس قولٌ عن صنف من المسائل. فـ«الطريقة س تتفوّق على الطريقة ص» دعوى عن التوزيع الذي سُحب منه المعيار، لا عن التعلّم عمومًا.
- السؤال النافع ليس أبدًا أيّ خوارزميّة أفضل. بل أيّ الفروض تحقّقها مسألتك فعلًا، وأيّ طريقة مبنيّة عليها.
د. وفيمَ لا تنفع
كثيرًا ما تُستدعى المبرهنة لإنهاء نقاشات لا تحسمها: أنّ اختيار النموذج عبث، أو أنّ معرفة المجال لا تُرمَّز نافعةً، أو أنّ مقارنة الطرائق بلا معنى. والثلاثة يدحضها الجدول الثاني. فتحت بنية رقيقة كـ«الوسم يعتمد على واحد من ثلاث بتّات» يكون متعلّمٌ ضعفَ آخر جودةً، ويلزم 256 تقييمًا مضبوطًا لإظهار ذلك.
المراجع والقراءات الإضافية
- Ian Goodfellow, Yoshua Bengio, Aaron Courville, Deep Learning, MIT Press (Adaptive Computation and Machine Learning), 2016المصدر ↗
تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.