تخطّي إلى المحتوى
Kudos AI
Read in English
Statistical Learning Theory

لماذا ينجح التعلّم من البيانات أصلاً

الفجوة بين الخطأ الذي تقيسه والخطأ الذي ستتحمّله، ولماذا يجعل انتقاء الأفضل من ألف فرضية متطابقة الأمر يبدو أفضل من الصدفة بـ0.1149، وكيف تُعدّ السعة لفئات النماذج اللانهائية، والنظرية التي تُساوي بين كلّ المتعلّمين - مع الافتراض الذي يصدّقها.

قراءة 6 دقيقةKudos AI

المتطلبات المسبقة: The Bias-Variance Trade-off

فرضية تهبط قرب خطئها الحقيقي بينما ينجرف أوفر الكثيرين حظّاً تحتها، ومجموعة نقاط تأخذ كلّ العنونات حتى يتبيّن نمط غير قابل للتحقّق، وكلّ متعلّم يتقارب إلى النصف بالضبط عند التوسّط على الأهداف.

النموذج المُلاءَم على بيانات يورد درجةً على تلك البيانات. والكلّ يعلم ألّا يثق بها. وأقلّ من ذلك من يستطيع أن يقول بدقّة ما الخطأ فيها، وبكم، وما الذي ينبغي أن يصحّ كي تكون جديرة بالثقة.

ولتلك الأسئلة أجوبة دقيقة، وهي أطرف من التحذير. وهذا المقال يشتغل على ثلاثة منها، محسوباً كلّ رقم لا منقولاً.

الرقم الذي تراه تقرير عن بحث

ثبّت قاعدةً قبل أن تنظر في البيانات. سيكون خطؤها على عيّنتك قريباً من خطئها على العالم، لأنّ النقاط سحوب مستقلّة والمتوسّطات تتركّز. هذه إحصاء عاديّ، ولا شيء معطوب بعد.

والمتعلّمون لا يعملون هكذا. إنّهم ينظرون في البيانات ثمّ يختارون. وذلك الاختيار دالّة في العيّنة، وهو يهدم الضمانة.

وإليك حجم الضرر، مقيساً على بيانات بُنيت كي لا يكون فيها شيء يُتعلَّم. كلّ فرضية مرشّحة ضجيج محض خطؤها الحقيقي 0.5 بالضبط. اسحب 200 نقطة، وقيّمها كلّها، واحتفظ بالأفضل:

المرشّحونكم تبدو الأفضل تحت الحقيقة
10.00020.0002
100.05490.0549
1000.08870.0887
10000.11490.1149

مع مرشّح واحد لا شيء يُختار وتكون الدرجة أمينةً في حدود 0.00020.0002. ومع ألف، يقع الخطأ المورَد 0.11490.1149 تحت الحقيقة - نموذج يبدو أفضل من الصدفة بوضوح وهو الصدفة بعينها.

ولا واحدة من تلك الألف أفضل من أخرى. فهي متطابقة في الحقيقة. والذي يختلف هو الحظّ على هذه العيّنة، وأخذ الأفضل هو أخذ الأوفر حظّاً.

وهذه هي الآليّة وراء النتيجة التي لا تتكرّر، والسمة المنتقاة على البيانات التي تُقوَّم عليها بعدُ، و«جرّبنا عدّة معماريات فنجحت هذه». فدرجة التدريب لا تقدّر الأداء المقبل؛ إنّها تقرير عن بحث.

دفع ثمن البحث، باللوغاريتمات

الإصلاح أن تكفّ عن سؤال الفائز وتسأل المرشّحين جميعاً دفعةً واحدة. فإن صحّت ضمانة في آنٍ واحد لهم كلّهم، غطّت الذي انتقته البيانات، أيّاً كان الانتقاء.

وهذا حدّ الاتّحاد، وهو مع متباينة هوفدينغ يعطي مطلباً في العيّنات:

n  ≥  ln⁡∣H∣+ln⁡(2/δ)2ε2n \;\ge\; \frac{\ln|H| + \ln(2/\delta)}{2\varepsilon^2}

اقرأها قائمة أسعار: ε\varepsilon هو التسامح المقبول، وδ\delta معدّل ما تسمح به من إخفاق الضمانة، و∣H∣|H| ما يكلّفه بحثك. عند ε=0.1\varepsilon = 0.1 وδ=0.05\delta = 0.05:

الفرضياتالعيّنات
2220
10300
1000530
1048576878

نصف مليون ضعف من الفرضيات يكلّف 658 عيّنة إضافية. لا 658 ضعفاً - بل 658 زيادة.

وذلك اللوغاريتم هو سبب إمكان تعلّم الآلة. فلو نما المطلب مع حجم الفئة بدل عدد خاناتها لما كانت أيّ فئة نماذج نافعة في المتناول.

الجدولان كلاهما في الشكل أدناه، وليس فيهما محاكاة. فأفضل m فرضية متطابقة هو أصغر m سحبة ذات حدّين، فالمجاملة مجموع منتهٍ لا متوسّط مئتي تجربة. وهذا يصحّح مدخلًا واحدًا: فعند مرشّح واحد تكون الفجوة المتوقّعة صفرًا تمامًا، و0.0002 أعلاه هي ضجيج المحاكاة نفسها. وانتقل إلى اللوحة الثانية وادفع حجم الصنف إلى المليار لترى الميزانية تأبى أن تتبعه.

تفاعلي: ماذا يكلّف البحث، وماذا يشتري اللوغاريتم

حساب مضبوط: أفضل m مرشّح هو أصغر m سحبة ذات حدّين.

0.200
المجاملة
0.0000
الخطأ المُعلَن للأفضل
0.5000

مرشّح واحد، ولا خيار، فالمجاملة المتوقّعة 0 بالضبط. وجدول الدرس يذكر هنا 0.0002، وهي ضجيج محاكاته ذات المئتي تجربة لا انحياز في الإجراء. وهذا الشكل يحسب التوقّع بدل تقديره.

السعة، حين يُخفق العدّ

الحجّة تعدّ الفرضيات، وأكثر الفئات النافعة تضمّ عدداً لانهائياً منها: كلّ العتبات على مستقيم، وكلّ فوق-المستويات في فضاء. ومع ذلك تعمّم تلك الفئات جيّداً تماماً، فعدّ الأعضاء يقيس الشيء الخطأ إذن.

والعلاج أن تنظر إلى البيانات بدلاً من ذلك. فالفرضيتان اللتان تُسندان العناوين نفسها إلى نقاطك لا تتمايزان عليها مهما فعلتا في غيرها. والمقدار المهمّ إذن هو كم عنونة متمايزة تستطيع الفئة إنتاجها - وهو عدد يبقى منتهياً وإن لم تكن الفئة كذلك.

تُشظّى مجموعة نقاط متى كانت كلّ عنونة ممكنة لها قابلة للتحقّق. والبُعد VC هو حجم أكبر مجموعة مشظّاة.

والمجالات على مستقيم تجعل ذلك ملموساً. نقطتان: يستطيع المجال أخذ كلتيهما، أو إحداهما، أو لا شيء - العنونات الأربع، مشظّاة. ثلاث نقاط: تبلغ الفئة 7 من 8، والغائبة هي

(1,0,1)(1, 0, 1)

لأنّ المجال الذي يضمّ النقطتين الخارجيّتين يجب أن يضمّ الوسطى. وسبع من ثماني إخفاق

  • فالتشظية كلّ شيء أو لا شيء - فيكون البُعد VC 2 بالضبط، يحدّه نمط واحد غير قابل للتحقّق.

والمستطيلات الموازية للمحاور تشظّي أربع نقاط في معيّن وتخفق عند خمس، بحجّة تستحقّ الحفظ: من بين خمس نقاط، أربع على الأكثر يمكن أن تكون أطرافاً (يساراً ويميناً وأعلى وأسفل)، والنقطة الباقية محاصَرة بها. وأيّ مستطيل يضمّ الأطراف الأربعة يضمّها هي أيضاً.

لماذا ينفع هذا

لِمّة ساور تحوّل البُعد المنتهي إلى عدّ كثير حدود. فالفئة ذات البُعد VC = dd تحقّق على nn نقطة ما لا يزيد عن ∑i≤d(ni)\sum_{i \le d} \binom{n}{i} عنونة. عند البُعد 2:

nnالقابلة للتحقّقدون قيد
378
10561024
202111048576

ولم يحتج حدّ الاتّحاد قطّ إلى الفرضيات، بل إلى سلوكياتها المتمايزة. ضع كثير الحدود مكان ∣H∣|H|، وخذ اللوغاريتم، فيصير الثمن نحو dlog⁡nd \log n - بطيئاً بما يكفي كي تنضبط الضمانة مع تراكم البيانات. وتكفّ السعة عن كونها عدّاً للفرضيات وتصير عدّاً للسلوكيات.

النظرية التي تُساوي بين الجميع

إذن فالسعة تُقاس وتُدفَع. فأيّ الخوارزميات أفضل؟

خذ مجالاً من خمس نقاط، فيكون عدد الدوالّ الهدف الممكنة 25=322^5 = 32. يرى المتعلّم ثلاثة عناوين ويتنبّأ بالباقيَين. توسّط درجته على الأهداف الاثنين والثلاثين. أربع استراتيجيات مختلفة عن عمد - «تنبّأ دائماً بـ1»، واتّباع الأكثرية المرئية، وتجاهل البيانات والتناوب، أو عكس الأكثرية - تحصل كلٌّ منها على

12\frac{1}{2}

النصف بالضبط، محسوباً بكسور دقيقة على الأهداف الاثنين والثلاثين. حتى الاستراتيجية المصمّمة لتكون سيّئة.

والآليّة لا علاقة لها بالمتعلّمين. ثبّت عناوين التدريب وخذ أيّ نقطة غير مرئية: تأتي الأهداف المتّسقة أزواجاً، متطابقةً إلّا عند تلك النقطة، حيث يقول أحدهما 0 والآخر 1. فأيّ تنبّؤ صائب لواحد وخاطئ لتوأمه. والمتعلّم لا يدخل الحجّة أبداً.

والخطوة التي تعيد التعلّم

اسمح الآن بالأهداف الستّة التي تنتقل من 0 إلى 1 مرّةً واحدة على الأكثر، أي دوالّ العتبة 00000 و00001 و00011 و00111 و01111 و11111 - واستعمل متعلّماً مبنيّاً لتلك الهيئة. تصير الإصابة 3/43/4.

ولم يُتعلَّم شيء عن العالم بين الحسابين، ولم تصل بيانات جديدة. الذي تغيّر هو أيّ العوالم عُدّت ممكنة.

وهذا هو التحيّز الاستقرائي، ومنه يأتي التعميم.

ما يُحمَّل النظرية قوله

تُنقل هكذا: «لا خوارزمية أفضل من أخرى»، وهو ما يُسقط الافتراض الذي يقوم بالعمل كلّه.

فالمساواة تصحّ عند التوسّط بانتظام على كلّ الأهداف الممكنة. وتساءل ماذا يضمّ ذلك التوزيع: من كلّ الدوالّ على مجالٍ ما، الأغلبية الساحقة بلا بنية - ضجيج غير قابل للضغط، لا شيء يُستخرج. ولا تتفوّق طريقة على الصدفة عليها، وهي تحكم المتوسّط.

والمسائل الحقيقية تسكن ركناً متناهي الصغر عالي البنية من ذلك الفضاء. والمتوسّط المنتظم على كلّ الدوالّ ليس نموذجاً لأيّ مسألة حقيقية.

فالنظرية إذن ليست دعوةً إلى اليأس ولا رخصةً لعدّ الطرائق كلّها سواء. إنّها تقول شيئاً أحدّ: لا تحصل على تعميم من لا شيء. فالأداء يأتي من افتراضات، وهي قد تكون خاطئة، والطريقة التي تبدو ناجحة في كلّ مكان لم تلتقِ بالمسألة التي تخطئ فيها.

وهذا يجعل اختيار فئة النماذج دعوى جوهرية عن العالم - تستحقّ أن تُتّخذ عمداً وأن تُعلن صراحةً.

مسار النظرية الإحصائية للتعلّم يشتغل على الحجج الثلاث بالتفصيل، وكلّ حساب فيه قابل للتشغيل والتعديل داخل المتصفّح.

المراجع والقراءات الإضافية

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 3 دقيقةStatistical Learning Theory

وسيط واحد، وسعة لا نهائيّة

مصنّف بوسيط حقيقي واحد يحقّق جميع الوسوم الـ1,048,576 لعشرين نقطة في كل مرّة، ثم يتنبّأ بالنقطة الحادية والعشرين بدقّة 0.5038 على عشرين ألف تجربة. فعدّ الوسائط لا يحدّ سعة صنف النماذج من أعلى ولا من أسفل، ولهذا وجب قياس السعة بطريق آخر.

تعلّم الآلةالرياضيات
قراءة 3 دقيقةStatistical Learning Theory

المبرهنة التي لا تقول شيئًا عن مسألتك

بالمتوسّط على الدوالّ الـ256 من ثلاث بتّات إلى واحدة، يسجّل متعلّمُ أقرب جار ومتعلّمٌ بُني ليخطئ عمدًا 0.500000 بالضبط خارج بيانات التدريب. تلك هي مبرهنة انعدام الغداء المجّاني، وهي صحيحة بالضبط، وما إن يُقصَر المتوسّط على الدوالّ الستّ التي تعتمد على بتّ واحد حتى يفترق الاثنان إلى 0.333333 و0.666667.

تعلّم الآلةالرياضيات
قراءة 6 دقيقةأسس التعلّم الإحصائي

مقايضة التحيّز والتباين

التفكيك الدقيق لخطأ الاختبار المتوقّع إلى مربّع التحيّز والتباين والضجيج غير القابل للتقليص، مبرهَناً عددياً بمحاكاة من 2000 تكرار تُقاس فيها الحدود الثلاثة كلٌّ على حدة ويُتحقّق من أن مجموعها يطابق.

الإحصاءتعلّم الآلةالرياضيات
← العودة إلى كل المقالات