مقايضة التحيّز والتباين
التفكيك الدقيق لخطأ الاختبار المتوقّع إلى مربّع التحيّز والتباين والضجيج غير القابل للتقليص، مبرهَناً عددياً بمحاكاة من 2000 تكرار تُقاس فيها الحدود الثلاثة كلٌّ على حدة ويُتحقّق من أن مجموعها يطابق.
المتطلبات المسبقة: ما هو التعلّم الإحصائي؟
أظهرت مقالة ما هو التعلّم الإحصائي؟ كثيرَ حدود من الدرجة 15 يلائم عيّنة تدريبه أفضل من أي منافس بينما يخطئ خطأً كارثياً في الدالة الكامنة. كان ذلك عرضاً توضيحياً. وتقدّم هذه المقالة السرد الدقيق: ينقسم خطأ الاختبار المتوقّع إلى ثلاثة أجزاء بالضبط، اثنان منها نتحكّم فيهما وواحد لا، والاثنان اللذان نتحكّم فيهما يتحرّكان في اتجاهين متعاكسين.
أ. التفكيك
خذ نقطة اختبار ، وليكن نموذجاً مُلائَماً على عيّنة تدريب عشوائية. يتفكّك الخطأ التربيعي المتوقّع عند ، مأخوذاً كمتوسط على كل عيّنات التدريب التي كان يمكن سحبها، إلى
حيث التحيّز هو .
هذه مساواة، لا تقريب ولا قاعدة استرشادية. ويعني كل حدّ شيئاً ملموساً:
- التحيّز هو الخطأ الناتج عن تقريب مسألة واقعية معقّدة بنموذج أبسط. فالمستقيم المُلائَم على منحنى متحيّز في كل مكان، ولا تزيل ذلك أي كمية إضافية من البيانات.
- التباين هو مقدار ما سيتغيّر به لو أُعيدت ملاءمته على عيّنة تدريب أخرى بالحجم نفسه. فالطريقة التي تتأرجح بعنف من عيّنة إلى أخرى عالية التباين، وأي ملاءمة مفردة منها غير موثوقة.
- الخطأ غير القابل للتقليص هو ، أرضية المقالة السابقة.
ولأن مربّع التحيّز والتباين كليهما غير سالبين، فمجموعهما غير سالب، ومن ثم لا يمكن لخطأ الاختبار المتوقّع أن يهبط أبداً دون . الأرضية حقيقية.
ب. لماذا يتصارع الحدّان
النمط العام: كلما ازدادت الطريقة مرونة، هبط التحيّز وارتفع التباين.
فمزيد من المرونة يعني أن النموذج يستطيع الانحناء نحو الحقيقي، فيقلّ خطؤه المنهجي - التحيّز إلى أسفل. لكنه يعني أيضاً أن النموذج يستطيع الانحناء نحو الضجيج الخاص بـهذه العيّنة، فتنتج عيّنة أخرى ملاءمة مختلفة بوضوح - التباين إلى أعلى.
وخطأ الاختبار هو المجموع. في البداية تشتري المرونة خفضاً كبيراً في التحيّز مقابل ارتفاع صغير في التباين، فيهبط الخطأ الكلي. وبعد نقطة ما تنعكس الصفقة ويتسلّق الخطأ الكلي. ويقع النموذج الأفضل حيث يتعادل معدّلا التغيّر.
يرسم الشكل منحنيات تخطيطية بوحدات اعتباطية، لا محاكاة أدناه؛ وأرضية الضجيج فيه عند 0.16، لا عند 0.09 المستعملة هناك.
تفاعلي: المفاضلة بين التحيز والتباين
خطأ التدريب مقابل خطأ الاختبار مع تزايد تعقيد النموذج.
- النظام
- مطابقة جيدة
- خطأ التدريب
- 0.25
- خطأ الاختبار
- 0.55
قرب النقطة المثلى: خطأ الاختبار قريب من أدنى قيمة له.
ينخفض خطأ التدريب دائماً كلما ازداد النموذج مرونة، لذا فهو دليل مضلِّل. أما خطأ الاختبار فهو bias² + variance + irreducible noise: يبلغ أدناه حيث تتوازن القوتان، ثم يرتفع عندما يبدأ النموذج بمطابقة الضجيج. أضف بيانات (ارفع حجم العينة) فيتقلّص حد التباين، دافعاً النقطة المثلى نحو تعقيد أعلى وخافضاً منحنى الاختبار بأكمله.
ج. قياس الحدود الثلاثة
يُعرض التفكيك عادةً بوصفه نظرية لأنك في الممارسة لا تستطيع حسابه - فأنت لا تعرف ولا تملك سوى عيّنة تدريب واحدة. أما في محاكاة فنحن نتحكّم بالاثنين، ومن ثم نستطيع قياس كل حدّ على حدة والتحقّق من أن مجموعها يطابق فعلاً.
الإعداد: ، وضجيج أي ، وعيّنات تدريب من 30 نقطة، ونقطة اختبار واحدة . نعيد الملاءمة 2000 مرة على عيّنات جديدة ونراقب ما تفعله التنبّؤات عند .
يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.
يطبع تشغيله:
true f(x0) = 0.8090, Var(eps) = 0.0900
degree 1: bias^2 0.2684 variance 0.0130 + noise 0.0900 = 0.3713
degree 3: bias^2 0.0059 variance 0.0105 + noise 0.0900 = 0.1064
degree 9: bias^2 0.0000 variance 0.0295 + noise 0.0900 = 0.1195
د. قراءة الجدول
كل دعوى في القسم ب ظاهرة هنا رقماً.
ينهار التحيّز مع ازدياد المرونة. مربّع تحيّز الدرجة 1 هو - فالمستقيم لا يستطيع ببساطة المرور قرب عند ، وكان متوسط تنبّؤه عبر 2000 ملاءمة مقابل قيمة حقيقية . وعند الدرجة 3 يصبح مربّع التحيّز ، وعند الدرجة 9 يُقرَّب إلى الصفر: فالنموذج المرن، في المتوسط، مصيب تماماً.
ينمو التباين مع ازدياد المرونة. إذ يزيد على الضعف من عند الدرجة 1 إلى عند الدرجة 9. فملاءمة الدرجة 9 مصيبة في المتوسط، لكن أي ملاءمة مفردة منها منحرفة بوضوح، في اتجاه يتوقّف على أي 30 نقطة صادفت رؤيتها.
المجموع أصغر ما يكون في الوسط. يسير الخطأ الكلي . تفوز الدرجة 3 - لا لأنها الأفضل في أي من الحدّين منفرداً (فتحيّز الدرجة 9 أقل) بل لأنها أفضل مساومة.
الأرضية صامدة. لا تهبط أي تهيئة دون . وأفضل مجموع، ، لا يعلو الضجيج غير القابل للتقليص إلا بـ، وتلك الفجوة المتبقّية هي الخطأ القابل للتقليص الذي ما زال متاحاً.
تنبيه بشأن صفّ الدرجة 9. طباعة مربّع التحيّز بقيمة لا تعني أن النموذج غير متحيّز في كل مكان - بل عند هذه بعينها فقط، وبأربع منازل عشرية فقط بعد المتوسط على 2000 ملاءمة. فالتحيّز دالة في ؛ وعند نقطة قريبة من حدّ الفترة سيُظهر النموذج نفسه تحيّزاً كبيراً، للسبب ذاته الذي جعل كثير الحدود من الدرجة 15 ينفجر في المقالة السابقة.
هـ. هل يصمد التفكيك فعلاً؟
ينبغي أن يساوي مجموع الحدود الثلاثة خطأَ الاختبار المتوقّع، وهو ما يمكننا قياسه مباشرة بتوليد مشاهدات مشوّشة جديدة عند ومتوسّط مربّعات أخطاء التنبّؤ. وبفعل ذلك إلى جانب التفكيك نحصل على:
| الدرجة | مربّع التحيّز + التباين + الضجيج | متوسط مربّع خطأ الاختبار المقيس |
|---|---|---|
| 1 | 0.3713 | 0.3764 |
| 3 | 0.1064 | 0.1072 |
| 9 | 0.1195 | 0.1171 |
يتوافق العمودان في حدود أجزاء من الألف - والفارق المتبقّي هو خطأ مونتي كارلو الناتج عن استخدام 2000 محاكاة بدل عدد لا نهائي. المطابقة دقيقة؛ وتقديرنا لها جيّد جداً فحسب.
و. ماذا يعني هذا عملياً
لا تستطيع حساب التحيّز والتباين على بيانات حقيقية، لأنك تملك عيّنة واحدة ولا سبيل لك إلى . لكن ما تستطيعه هو التعرّف على بصمتيهما:
| العَرَض | السبب المرجّح | الاستجابة |
|---|---|---|
| خطأ تدريب مرتفع، وخطأ اختبار مماثل | تحيّز مرتفع (نقص ملاءمة) | نموذج أكثر مرونة، سمات أفضل |
| خطأ تدريب منخفض جداً، وخطأ اختبار أعلى بكثير | تباين مرتفع (فرط ملاءمة) | التنظيم، التبسيط، مزيد من البيانات |
| الخطآن قريبان من أرضية الضجيج | قرب المثالية | توقّف |
لاحظ عدم التماثل في العلاجين: زيادة البيانات تخفض التباين ولا تفعل شيئاً للتحيّز. فمضاعفة العيّنة لن تساعد مستقيماً على ملاءمة موجة جيبية. وإذا كان نموذجك متحيّزاً فأنت بحاجة إلى نموذج مختلف، لا إلى بيانات أكبر.
الخلاصات الأساسية
- يتفكّك خطأ الاختبار المتوقّع بدقة إلى مربّع التحيّز والتباين والضجيج غير القابل للتقليص.
- يهبط التحيّز ويرتفع التباين مع المرونة؛ والمجموع على شكل حرف U، والنموذج الأفضل هو المساومة لا الطرف.
- في المحاكاة تكون الحدود قابلة للقياس: فازت الدرجة 3 بمجموع مقابل (متحيّز) و (عالي التباين).
- لا يمكن لخطأ الاختبار أبداً أن يهبط دون .
- مزيد من البيانات يعالج التباين لا التحيّز. فشخّص أيّهما لديك قبل اختيار العلاج.
ما التالي
يتطلّب جدول التشخيص أعلاه تقديراً أميناً لخطأ الاختبار، وخطأ التدريب ليس كذلك قطعاً. والحصول على ذلك التقدير من البيانات التي بحوزتك بالفعل - دون مجموعة اختبار منفصلة قد لا تقدر على تحمّلها - هو مهمة التحقّق المتقاطع وإعادة المعاينة.
المراجع والقراءات الإضافية
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗
تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.