تخطّي إلى المحتوى
Kudos AI
Read in English
أسس التعلّم الإحصائي

مقايضة التحيّز والتباين

التفكيك الدقيق لخطأ الاختبار المتوقّع إلى مربّع التحيّز والتباين والضجيج غير القابل للتقليص، مبرهَناً عددياً بمحاكاة من 2000 تكرار تُقاس فيها الحدود الثلاثة كلٌّ على حدة ويُتحقّق من أن مجموعها يطابق.

قراءة 6 دقيقةKudos AI

المتطلبات المسبقة: ما هو التعلّم الإحصائي؟

التحيّز المربّع يهبط والتباين يرتفع مرسومَين على حدة ثم مجموعَين في حرف U المألوف - ومجموعات تدريب «اترك واحدًا» تظهر متداخلة تداخلًا شبه تامّ.

أظهرت مقالة ما هو التعلّم الإحصائي؟ كثيرَ حدود من الدرجة 15 يلائم عيّنة تدريبه أفضل من أي منافس بينما يخطئ خطأً كارثياً في الدالة الكامنة. كان ذلك عرضاً توضيحياً. وتقدّم هذه المقالة السرد الدقيق: ينقسم خطأ الاختبار المتوقّع إلى ثلاثة أجزاء بالضبط، اثنان منها نتحكّم فيهما وواحد لا، والاثنان اللذان نتحكّم فيهما يتحرّكان في اتجاهين متعاكسين.

أ. التفكيك

خذ نقطة اختبار x0x_0، وليكن f^\hat f نموذجاً مُلائَماً على عيّنة تدريب عشوائية. يتفكّك الخطأ التربيعي المتوقّع عند x0x_0، مأخوذاً كمتوسط على كل عيّنات التدريب التي كان يمكن سحبها، إلى

E[(y0−f^(x0))2]=[Bias⁡(f^(x0))]2⏟wrong on average+Var⁡(f^(x0))⏟unstable+Var⁡(ε)⏟irreducible,\mathbb{E}\big[(y_0 - \hat f(x_0))^2\big] = \underbrace{\big[\operatorname{Bias}(\hat f(x_0))\big]^2}_{\text{wrong on average}} + \underbrace{\operatorname{Var}(\hat f(x_0))}_{\text{unstable}} + \underbrace{\operatorname{Var}(\varepsilon)}_{\text{irreducible}} ,

حيث التحيّز هو Bias⁡(f^(x0))=E[f^(x0)]−f(x0)\operatorname{Bias}(\hat f(x_0)) = \mathbb{E}[\hat f(x_0)] - f(x_0).

هذه مساواة، لا تقريب ولا قاعدة استرشادية. ويعني كل حدّ شيئاً ملموساً:

  • التحيّز هو الخطأ الناتج عن تقريب مسألة واقعية معقّدة بنموذج أبسط. فالمستقيم المُلائَم على منحنى متحيّز في كل مكان، ولا تزيل ذلك أي كمية إضافية من البيانات.
  • التباين هو مقدار ما سيتغيّر به f^\hat f لو أُعيدت ملاءمته على عيّنة تدريب أخرى بالحجم نفسه. فالطريقة التي تتأرجح بعنف من عيّنة إلى أخرى عالية التباين، وأي ملاءمة مفردة منها غير موثوقة.
  • الخطأ غير القابل للتقليص هو Var⁡(ε)\operatorname{Var}(\varepsilon)، أرضية المقالة السابقة.

ولأن مربّع التحيّز والتباين كليهما غير سالبين، فمجموعهما غير سالب، ومن ثم لا يمكن لخطأ الاختبار المتوقّع أن يهبط أبداً دون Var⁡(ε)\operatorname{Var}(\varepsilon). الأرضية حقيقية.

ب. لماذا يتصارع الحدّان

النمط العام: كلما ازدادت الطريقة مرونة، هبط التحيّز وارتفع التباين.

فمزيد من المرونة يعني أن النموذج يستطيع الانحناء نحو ff الحقيقي، فيقلّ خطؤه المنهجي - التحيّز إلى أسفل. لكنه يعني أيضاً أن النموذج يستطيع الانحناء نحو الضجيج الخاص بـهذه العيّنة، فتنتج عيّنة أخرى ملاءمة مختلفة بوضوح - التباين إلى أعلى.

وخطأ الاختبار هو المجموع. في البداية تشتري المرونة خفضاً كبيراً في التحيّز مقابل ارتفاع صغير في التباين، فيهبط الخطأ الكلي. وبعد نقطة ما تنعكس الصفقة ويتسلّق الخطأ الكلي. ويقع النموذج الأفضل حيث يتعادل معدّلا التغيّر.

يرسم الشكل منحنيات تخطيطية بوحدات اعتباطية، لا محاكاة sin⁡(2πx)\sin(2\pi x) أدناه؛ وأرضية الضجيج فيه عند 0.16، لا عند 0.09 المستعملة هناك.

تفاعلي: المفاضلة بين التحيز والتباين

خطأ التدريب مقابل خطأ الاختبار مع تزايد تعقيد النموذج.

0.00.51.0الضجيج غير القابل للاختزال→ تعقيد النموذج
خطأ الاختبارخطأ التدريبالتعقيد الأمثل
النظام
مطابقة جيدة
خطأ التدريب
0.25
خطأ الاختبار
0.55

قرب النقطة المثلى: خطأ الاختبار قريب من أدنى قيمة له.

ينخفض خطأ التدريب دائماً كلما ازداد النموذج مرونة، لذا فهو دليل مضلِّل. أما خطأ الاختبار فهو bias² + variance + irreducible noise: يبلغ أدناه حيث تتوازن القوتان، ثم يرتفع عندما يبدأ النموذج بمطابقة الضجيج. أضف بيانات (ارفع حجم العينة) فيتقلّص حد التباين، دافعاً النقطة المثلى نحو تعقيد أعلى وخافضاً منحنى الاختبار بأكمله.

ج. قياس الحدود الثلاثة

يُعرض التفكيك عادةً بوصفه نظرية لأنك في الممارسة لا تستطيع حسابه - فأنت لا تعرف ff ولا تملك سوى عيّنة تدريب واحدة. أما في محاكاة فنحن نتحكّم بالاثنين، ومن ثم نستطيع قياس كل حدّ على حدة والتحقّق من أن مجموعها يطابق فعلاً.

الإعداد: f(x)=sin⁡(2πx)f(x) = \sin(2\pi x)، وضجيج ε∼N(0,0.32)\varepsilon \sim N(0, 0.3^2) أي Var⁡(ε)=0.09\operatorname{Var}(\varepsilon) = 0.09، وعيّنات تدريب من 30 نقطة، ونقطة اختبار واحدة x0=0.35x_0 = 0.35. نعيد الملاءمة 2000 مرة على عيّنات جديدة ونراقب ما تفعله التنبّؤات عند x0x_0.

Python

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

يطبع تشغيله:

true f(x0) = 0.8090,  Var(eps) = 0.0900

degree 1:  bias^2 0.2684   variance 0.0130   + noise 0.0900   = 0.3713
degree 3:  bias^2 0.0059   variance 0.0105   + noise 0.0900   = 0.1064
degree 9:  bias^2 0.0000   variance 0.0295   + noise 0.0900   = 0.1195

د. قراءة الجدول

كل دعوى في القسم ب ظاهرة هنا رقماً.

ينهار التحيّز مع ازدياد المرونة. مربّع تحيّز الدرجة 1 هو 0.26840.2684 - فالمستقيم لا يستطيع ببساطة المرور قرب sin⁡(2πx)\sin(2\pi x) عند x0=0.35x_0 = 0.35، وكان متوسط تنبّؤه عبر 2000 ملاءمة 0.2910.291 مقابل قيمة حقيقية 0.8090.809. وعند الدرجة 3 يصبح مربّع التحيّز 0.00590.0059، وعند الدرجة 9 يُقرَّب إلى الصفر: فالنموذج المرن، في المتوسط، مصيب تماماً.

ينمو التباين مع ازدياد المرونة. إذ يزيد على الضعف من 0.01300.0130 عند الدرجة 1 إلى 0.02950.0295 عند الدرجة 9. فملاءمة الدرجة 9 مصيبة في المتوسط، لكن أي ملاءمة مفردة منها منحرفة بوضوح، في اتجاه يتوقّف على أي 30 نقطة صادفت رؤيتها.

المجموع أصغر ما يكون في الوسط. يسير الخطأ الكلي 0.3713→0.1064→0.11950.3713 \to 0.1064 \to 0.1195. تفوز الدرجة 3 - لا لأنها الأفضل في أي من الحدّين منفرداً (فتحيّز الدرجة 9 أقل) بل لأنها أفضل مساومة.

الأرضية صامدة. لا تهبط أي تهيئة دون 0.090.09. وأفضل مجموع، 0.10640.1064، لا يعلو الضجيج غير القابل للتقليص إلا بـ0.01640.0164، وتلك الفجوة المتبقّية هي الخطأ القابل للتقليص الذي ما زال متاحاً.

تنبيه بشأن صفّ الدرجة 9. طباعة مربّع التحيّز بقيمة 0.00000.0000 لا تعني أن النموذج غير متحيّز في كل مكان - بل عند هذه x0x_0 بعينها فقط، وبأربع منازل عشرية فقط بعد المتوسط على 2000 ملاءمة. فالتحيّز دالة في xx؛ وعند نقطة قريبة من حدّ الفترة سيُظهر النموذج نفسه تحيّزاً كبيراً، للسبب ذاته الذي جعل كثير الحدود من الدرجة 15 ينفجر في المقالة السابقة.

هـ. هل يصمد التفكيك فعلاً؟

ينبغي أن يساوي مجموع الحدود الثلاثة خطأَ الاختبار المتوقّع، وهو ما يمكننا قياسه مباشرة بتوليد مشاهدات مشوّشة جديدة عند x0x_0 ومتوسّط مربّعات أخطاء التنبّؤ. وبفعل ذلك إلى جانب التفكيك نحصل على:

الدرجةمربّع التحيّز + التباين + الضجيجمتوسط مربّع خطأ الاختبار المقيس
10.37130.3764
30.10640.1072
90.11950.1171

يتوافق العمودان في حدود أجزاء من الألف - والفارق المتبقّي هو خطأ مونتي كارلو الناتج عن استخدام 2000 محاكاة بدل عدد لا نهائي. المطابقة دقيقة؛ وتقديرنا لها جيّد جداً فحسب.

و. ماذا يعني هذا عملياً

لا تستطيع حساب التحيّز والتباين على بيانات حقيقية، لأنك تملك عيّنة واحدة ولا سبيل لك إلى ff. لكن ما تستطيعه هو التعرّف على بصمتيهما:

العَرَضالسبب المرجّحالاستجابة
خطأ تدريب مرتفع، وخطأ اختبار مماثلتحيّز مرتفع (نقص ملاءمة)نموذج أكثر مرونة، سمات أفضل
خطأ تدريب منخفض جداً، وخطأ اختبار أعلى بكثيرتباين مرتفع (فرط ملاءمة)التنظيم، التبسيط، مزيد من البيانات
الخطآن قريبان من أرضية الضجيجقرب المثاليةتوقّف

لاحظ عدم التماثل في العلاجين: زيادة البيانات تخفض التباين ولا تفعل شيئاً للتحيّز. فمضاعفة العيّنة لن تساعد مستقيماً على ملاءمة موجة جيبية. وإذا كان نموذجك متحيّزاً فأنت بحاجة إلى نموذج مختلف، لا إلى بيانات أكبر.

الخلاصات الأساسية

  • يتفكّك خطأ الاختبار المتوقّع بدقة إلى مربّع التحيّز والتباين والضجيج غير القابل للتقليص.
  • يهبط التحيّز ويرتفع التباين مع المرونة؛ والمجموع على شكل حرف U، والنموذج الأفضل هو المساومة لا الطرف.
  • في المحاكاة تكون الحدود قابلة للقياس: فازت الدرجة 3 بمجموع 0.10640.1064 مقابل 0.37130.3713 (متحيّز) و0.11950.1195 (عالي التباين).
  • لا يمكن لخطأ الاختبار أبداً أن يهبط دون Var⁡(ε)\operatorname{Var}(\varepsilon).
  • مزيد من البيانات يعالج التباين لا التحيّز. فشخّص أيّهما لديك قبل اختيار العلاج.

ما التالي

يتطلّب جدول التشخيص أعلاه تقديراً أميناً لخطأ الاختبار، وخطأ التدريب ليس كذلك قطعاً. والحصول على ذلك التقدير من البيانات التي بحوزتك بالفعل - دون مجموعة اختبار منفصلة قد لا تقدر على تحمّلها - هو مهمة التحقّق المتقاطع وإعادة المعاينة.

المراجع والقراءات الإضافية

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 3 دقيقةStatistical Learning Theory

وسيط واحد، وسعة لا نهائيّة

مصنّف بوسيط حقيقي واحد يحقّق جميع الوسوم الـ1,048,576 لعشرين نقطة في كل مرّة، ثم يتنبّأ بالنقطة الحادية والعشرين بدقّة 0.5038 على عشرين ألف تجربة. فعدّ الوسائط لا يحدّ سعة صنف النماذج من أعلى ولا من أسفل، ولهذا وجب قياس السعة بطريق آخر.

تعلّم الآلةالرياضيات
قراءة 6 دقيقةأسس التعلّم الإحصائي

التحقّق المتقاطع وإعادة المعاينة

لماذا يكون خطأ التدريب تقديراً متحيّزاً لخطأ الاختبار، وكيف تعالج ذلك مجموعة التحقّق وطريقة ترك واحد وطريقة الطيّات k، مع حساب LOOCV على خمس مشاهدات مشاهدةً مشاهدة.

الإحصاءتعلّم الآلة
قراءة 6 دقيقةالتعلّم الموجَّه

الانحدار الخطي من المبادئ الأولى

اشتقاق معاملات المربّعات الصغرى باشتقاق مجموع مربّعات البواقي، ثم تنفيذ ملاءمة كاملة على خمس مشاهدات يدوياً: المعاملات والقيم المُلائَمة والبواقي وRSS ومعامل التحديد، وكلٌّ منها متحقَّق منه عددياً.

الإحصاءتعلّم الآلةالرياضيات
← العودة إلى كل المقالات