تخطّي إلى المحتوى
Kudos AI
Read in English
التعلّم الموجَّه

الانحدار الخطي من المبادئ الأولى

اشتقاق معاملات المربّعات الصغرى باشتقاق مجموع مربّعات البواقي، ثم تنفيذ ملاءمة كاملة على خمس مشاهدات يدوياً: المعاملات والقيم المُلائَمة والبواقي وRSS ومعامل التحديد، وكلٌّ منها متحقَّق منه عددياً.

قراءة 6 دقيقةKudos AI

المتطلبات المسبقة: ما هو التعلّم الإحصائي؟

مربّعات البواقي مرسومة حرفيًا وهي تتقلّص مع ميلان المستقيم إلى موضعه، ثم جمع البواقي الخمسة على الشاشة ليكون الناتج صفرًا تمامًا.

الانحدار الخطي قديم وبسيط، ولا يزال أول ما ينبغي تجربته. وهو أيضاً أوضح موضع لرؤية النمط الذي تتّبعه كل طريقة موجَّهة أخرى: اكتب مقياساً لمدى سوء ملاءمة النموذج، ثم اختر البارامترات التي تصغّره. وهنا يمكن إجراء ذلك التصغير بدقة، في صورة مغلقة، بتفاضل تملكه بالفعل.

أ. النموذج

مع متنبّئ واحد، نفترض

Y≈β0+β1X,Y \approx \beta_0 + \beta_1 X ,

حيث β0\beta_0 هو المقطع وβ1\beta_1 هو الميل. وهما معاً معاملات النموذج. ويعطي تقديرهما من البيانات β^0\hat\beta_0 وβ^1\hat\beta_1، والتنبّؤات

y^i=β^0+β^1xi.\hat y_i = \hat\beta_0 + \hat\beta_1 x_i .

والباقي رقم ii هو ei=yi−y^ie_i = y_i - \hat y_i، أي الفجوة بين ما رصدناه وما تنبّأنا به.

ب. ما معنى «أفضل ملاءمة»

نحتاج إلى رقم واحد يقيس مدى سوء ملاءمة مستقيم مرشّح. والاختيار المعياري هو مجموع مربّعات البواقي:

RSS=∑i=1nei2=∑i=1n(yi−β0−β1xi)2.\mathrm{RSS} = \sum_{i=1}^{n} e_i^2 = \sum_{i=1}^{n}\big(y_i - \beta_0 - \beta_1 x_i\big)^2 .

يفعل التربيع شيئين: يجعل الانحرافات الموجبة والسالبة متساوية في الوزن، ويعاقب انحرافاً كبيراً واحداً أشدّ من عدة انحرافات صغيرة. وهو أيضاً قابل للاشتقاق في كل مكان، وهذا ما يتيح الحلّ المغلق أدناه.

تختار المربّعات الصغرى β^0,β^1\hat\beta_0, \hat\beta_1 اللذين يصغّران RSS.

ج. اشتقاق المعاملات

RSS دالة ملساء في متغيّرين، فيقع صغراها حيث تنعدم المشتقّتان الجزئيتان معاً.

بالنسبة إلى المقطع:

∂ RSS∂β0=∑i=1n2(yi−β0−β1xi)(−1)=0  ⟹  ∑i=1n(yi−β0−β1xi)=0.\frac{\partial\,\mathrm{RSS}}{\partial \beta_0} = \sum_{i=1}^n 2\big(y_i - \beta_0 - \beta_1 x_i\big)(-1) = 0 \;\Longrightarrow\; \sum_{i=1}^n \big(y_i - \beta_0 - \beta_1 x_i\big) = 0 .

وبالقسمة على nn نحصل على yˉ−β0−β1xˉ=0\bar y - \beta_0 - \beta_1 \bar x = 0، ومن ثم

β^0=yˉ−β^1xˉ.\hat\beta_0 = \bar y - \hat\beta_1 \bar x .

وينتج عن ذلك أمران فوراً: مجموع البواقي صفر، والمستقيم المُلائَم يمرّ دائماً بالنقطة (xˉ,yˉ)(\bar x, \bar y).

بالنسبة إلى الميل:

∂ RSS∂β1=∑i=1n2(yi−β0−β1xi)(−xi)=0.\frac{\partial\,\mathrm{RSS}}{\partial \beta_1} = \sum_{i=1}^n 2\big(y_i - \beta_0 - \beta_1 x_i\big)(-x_i) = 0 .

وبالتعويض بـ β0=yˉ−β1xˉ\beta_0 = \bar y - \beta_1\bar x وإعادة الترتيب ينتج

β^1=∑i=1n(xi−xˉ)(yi−yˉ)∑i=1n(xi−xˉ)2.\hat\beta_1 = \frac{\sum_{i=1}^n (x_i - \bar x)(y_i - \bar y)}{\sum_{i=1}^n (x_i - \bar x)^2} .

البسط هو التغاير العيّني لـ xx وyy (حتى ثابت)، والمقام هو التباين العيّني لـ xx. فالميل إذاً هو مقدار تحرّك xx وyy معاً، مقيساً بمقدار تحرّك xx وحده - وهو بالضبط ما ينبغي أن يكون عليه الميل.

د. ملاءمة كاملة محلولة

خمس مشاهدات:

iixix_iyiy_i
112
224
335
444
555

الخطوة 1 - المتوسطات.

xˉ=1+2+3+4+55=3,yˉ=2+4+5+4+55=4.\bar x = \frac{1+2+3+4+5}{5} = 3, \qquad \bar y = \frac{2+4+5+4+5}{5} = 4 .

الخطوة 2 - جداءات الانحرافات.

xi−xˉx_i - \bar xyi−yˉy_i - \bar yالجداء(xi−xˉ)2(x_i - \bar x)^2
−2-2−2-24444
−1-1000011
00110000
11000011
22112244
المجموع6\mathbf{6}10\mathbf{10}

الخطوة 3 - المعاملات.

β^1=610=0.6=35,β^0=4−0.6×3=4−1.8=2.2=115.\hat\beta_1 = \frac{6}{10} = 0.6 = \tfrac{3}{5}, \qquad \hat\beta_0 = 4 - 0.6 \times 3 = 4 - 1.8 = 2.2 = \tfrac{11}{5} .

والمستقيم المُلائَم هو

y^=2.2+0.6 x.\hat y = 2.2 + 0.6\,x .

الخطوة 4 - القيم المُلائَمة والبواقي.

xix_iy^i=2.2+0.6xi\hat y_i = 2.2 + 0.6x_iyiy_ieie_iei2e_i^2
12.82−0.8-0.80.64
23.440.60.60.36
34.051.01.01.00
44.64−0.6-0.60.36
55.25−0.2-0.20.04
0.02.40

مجموع البواقي صفر تماماً، كما وعد الاشتقاق، ويمرّ المستقيم بالنقطة (3,4)=(xˉ,yˉ)(3, 4) = (\bar x, \bar y) - تحقّق من الصف 3.

RSS=2.40.\mathrm{RSS} = 2.40 .

هـ. ما جودة الملاءمة؟

RSS وحدها غير قابلة للتفسير: فهي تتوقّف على الوحدات وحجم العيّنة. قارنها بدلاً من ذلك بـمجموع المربّعات الكلي، أي خطأ أفضل تنبّؤ ثابت ممكن yˉ\bar y:

TSS=∑(yi−yˉ)2=4+0+1+0+1=6.\mathrm{TSS} = \sum (y_i - \bar y)^2 = 4 + 0 + 1 + 0 + 1 = 6 .

ومن ثم

R2=1−RSSTSS=1−2.46=0.6.R^2 = 1 - \frac{\mathrm{RSS}}{\mathrm{TSS}} = 1 - \frac{2.4}{6} = 0.6 .

يفسّر المتنبّئ 60٪ من تغيّر yy، ولا يفسّر الـ40٪ الباقية. ويقع R2R^2 في [0,1][0,1] لنموذج مُلائَم بمقطع، وهو عديم الوحدة، وهذا ما يجعله قابلاً للمقارنة عبر المسائل.

لا يتناقص R2R^2 أبداً عند إضافة متنبّئ، ولو كان عمود ضجيج خالص، لأن الحرية الإضافية لا يمكنها إلا أن تخفض RSS. ومن ثم لا يصلح للمفاضلة بين نماذج بأحجام مختلفة - وذلك ما يخدمه التحقّق المتقاطع.

تفاعلي: المربعات التي تصغّرها طريقة المربعات الصغرى

مجموع مربعات البواقي هو المساحة الكلية للمربعات.

012345670123456(x̄, ȳ)هذا المستقيمالمتوسط4.056
مجموع مربعات البواقي RSS
4.05
المجموع الكلي للمربعات TSS
6
معامل التحديد R²
0.325
مجموع البواقي
-0.5

تغطي المربعات RSS = 4.05، فيكون R² مساويًا 0.325. أمِل المستقيم وارفعه لتصغير المساحة الكلية، وراقب العمود المكدّس ينخفض نحو حده الأدنى 2.40، أو انتقل إليه مباشرة.

و. التحقّق من كل رقم

Python

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

يطبع تشغيله الجدول تماماً - ميل 0.60.6، ومقطع 2.22.2، وبواقٍ مجموعها 00 (بدقة الآلة)، وRSS=2.4\mathrm{RSS} = 2.4، وTSS=6.0\mathrm{TSS} = 6.0، وR2=0.6R^2 = 0.6 - إضافةً إلى sklearn: 2.2 0.6 0.6، وهو تأكيد مستقل.

ز. ما الذي يفترضه النموذج

تعيد المربّعات الصغرى دائماً إجابةً ما. أما كونها ذات معنى فيتوقّف على فرضيات يجدر ذكرها صراحةً:

  • الخطية. العلاقة مستقيمة فعلاً. فإن انحنت، كانت الملاءمة متحيّزة مهما جمعت من بيانات - وهو نمط الإخفاق في مقايضة التحيّز والتباين.
  • استقلال الأخطاء. البواقي المترابطة (السلاسل الزمنية، البيانات العنقودية) تُبقي المعاملات قابلة للاستخدام لكنها تجعل الأخطاء المعيارية أصغر بكثير مما ينبغي.
  • ثبات تباين الخطأ. إن نما التشتّت مع xx، أفرطت الملاءمة في ترجيح المنطقة المشوّشة.
  • النقاط المؤثّرة. مع n=5n = 5، تحرّك قيمة شاذّة واحدة المستقيمَ تحريكاً ملموساً - كما أظهرت الطيّة 1 في LOOCV، إذ نقل حذف (1,2)(1,2) التنبّؤ هناك من 2.82.8 إلى 4.04.0، أي إزاحة بمقدار 1.21.2.

ورسم البواقي مقابل القيم المُلائَمة يفحص الفرضيتين الوسطيين أسرع من أي اختبار صوري.

الخلاصات الأساسية

  • تصغّر المربّعات الصغرى RSS، وتصفير المشتقّتين الجزئيتين يعطي معاملات في صورة مغلقة - بلا حاجة إلى تكرار.
  • β^1\hat\beta_1 هو تغاير xx وyy مقسوماً على تباين xx؛ وβ^0\hat\beta_0 يفرض مرور المستقيم بالنقطة (xˉ,yˉ)(\bar x, \bar y).
  • يضمن الاشتقاق أن مجموع البواقي صفر.
  • ملاءمتنا المحلولة: y^=2.2+0.6x\hat y = 2.2 + 0.6x، وRSS=2.4\mathrm{RSS} = 2.4، وTSS=6\mathrm{TSS} = 6، وR2=0.6R^2 = 0.6.
  • لا يتناقص R2R^2 أبداً عند إضافة متنبّئات، فلا يصلح لمقارنة نماذج بأحجام مختلفة.

ما التالي

الخطأ التربيعي هدف خاطئ حين تكون الاستجابة فئةً لا عدداً - فالمستقيم المُلائَم سيتنبّأ عن طيب خاطر باحتمال قدره 1.41.4. وتكييف النموذج الخطي للتصنيف هو موضوع الانحدار اللوجستي والتصنيف.

المراجع والقراءات الإضافية

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 6 دقيقةأسس التعلّم الإحصائي

ما هو التعلّم الإحصائي؟

الإطار الكامن وراء كل نموذج تنبّؤي: تقدير دالة مجهولة f من البيانات، والفصل بين الخطأ القابل للتقليص وغير القابل له، ولماذا يشدّ التنبّؤ والاستدلال في اتجاهين متعاكسين.

الإحصاءتعلّم الآلةالرياضيات
قراءة 6 دقيقةأسس التعلّم الإحصائي

مقايضة التحيّز والتباين

التفكيك الدقيق لخطأ الاختبار المتوقّع إلى مربّع التحيّز والتباين والضجيج غير القابل للتقليص، مبرهَناً عددياً بمحاكاة من 2000 تكرار تُقاس فيها الحدود الثلاثة كلٌّ على حدة ويُتحقّق من أن مجموعها يطابق.

الإحصاءتعلّم الآلةالرياضيات
قراءة 7 دقيقةالتعلّم الموجَّه

الانحدار اللوجستي والتصنيف

لماذا لا يستطيع المستقيم نمذجة احتمال، وكيف تعالج الدالة اللوجستية ذلك، وما معنى المعاملات بلغة لوغاريتم الأرجحية، مع خطوة صعود تدرّجي وملاءمة متقاربة محسوبتين ومتحقَّق منهما عددياً.

الإحصاءتعلّم الآلةالتحسين
← العودة إلى كل المقالات