تخطّي إلى المحتوى
Kudos AI

المربّعات الصغرى من المشتقّة

تصغير مجموع مربعات البواقي بصيغة مغلقة، ومعنى صيغة الميل، ولماذا لا يصلح معامل التحديد لمقارنة نماذج بأحجام مختلفة.

متوسّطالوحدة 130 دقيقة · 120 XP
مربّعات البواقي مرسومة حرفيًا وهي تتقلّص مع ميلان المستقيم إلى موضعه، ثم جمع البواقي الخمسة على الشاشة ليكون الناتج صفرًا تمامًا.

يُعرَض الانحدار الخطي عادةً صيغةً تُطبَّق. لكن فهمه أفضل بوصفه جواباً لسؤال في التفاضل: أي مستقيم يجعل مربّعات الأخطاء أصغر ما يمكن؟ فما إن تطرحه هكذا، حتى تتساقط المعاملات من مشتقّتين ولا يبقى شيء للحفظ.

الهدف

لائم y^i=β0+β1xi\hat y_i = \beta_0 + \beta_1 x_i وقِس سوء الملاءمة بـمجموع مربّعات البواقي:

RSS(β0,β1)=∑i=1n(yi−β0−β1xi)2.\mathrm{RSS}(\beta_0, \beta_1) = \sum_{i=1}^{n}\big(y_i - \beta_0 - \beta_1 x_i\big)^2 .

ويؤدّي التربيع مهمّتين: يمنع تلاشي الأخطاء الموجبة والسالبة معاً، ويجعل RSS دالةً ملساء محدّبة، فيجد تصفير المشتقّات الصغرى الشاملة لا مجرّد نقطة سكون.

الاشتقاق

بالنسبة إلى المقطع:

∂RSS∂β0=−2∑i=1n(yi−β0−β1xi)=0⟹∑i=1nei=0,\frac{\partial \mathrm{RSS}}{\partial \beta_0} = -2\sum_{i=1}^{n}\big(y_i - \beta_0 - \beta_1 x_i\big) = 0 \quad\Longrightarrow\quad \sum_{i=1}^{n} e_i = 0 ,

بكتابة eie_i للباقي. فشرط المقطع يضمن أن مجموع البواقي صفر تماماً - أو بالتكافؤ أن المستقيم المُلائَم يمرّ بنقطة المتوسطات (xˉ,yˉ)(\bar x, \bar y). وليس ذلك مصادفةً ولا اصطلاحاً؛ بل هو ما تقوله تلك المشتقّة الواحدة.

وبالنسبة إلى الميل، وبالتعويض بـβ0=yˉ−β1xˉ\beta_0 = \bar y - \beta_1 \bar x:

β^1=∑i(xi−xˉ)(yi−yˉ)∑i(xi−xˉ)2,β^0=yˉ−β^1xˉ.\hat\beta_1 = \frac{\sum_i (x_i - \bar x)(y_i - \bar y)}{\sum_i (x_i - \bar x)^2}, \qquad \hat\beta_0 = \bar y - \hat\beta_1 \bar x .

مثال محلول

خمس نقاط: x=(1,2,3,4,5)x = (1,2,3,4,5)، وy=(2.1,3.9,6.2,7.8,10.1)y = (2.1, 3.9, 6.2, 7.8, 10.1).

xˉ=3.0\bar x = 3.0، وyˉ=6.02\bar y = 6.02. ومن ثم

Sxy=∑(xi−xˉ)(yi−yˉ)=19.90,Sxx=∑(xi−xˉ)2=10.00,S_{xy} = \sum (x_i - \bar x)(y_i - \bar y) = 19.90 , \qquad S_{xx} = \sum (x_i - \bar x)^2 = 10.00 ,

فيكون

β^1=19.9010.00=1.9900,β^0=6.02−1.99×3=0.0500.\hat\beta_1 = \frac{19.90}{10.00} = 1.9900 , \qquad \hat\beta_0 = 6.02 - 1.99 \times 3 = 0.0500 .

والبواقي هي (0.06, −0.13, 0.18, −0.21, 0.10)(0.06,\, -0.13,\, 0.18,\, -0.21,\, 0.10) - ومجموعها 00 تماماً، كما وعدت مشتقّة المقطع. تحقّق بنفسك؛ فذلك المجموع أسرع طريقة لالتقاط زلّة حسابية.

Python

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

معامل التحديد، وفخّه

R2=1−RSSTSS,TSS=∑i(yi−yˉ)2.R^2 = 1 - \frac{\mathrm{RSS}}{\mathrm{TSS}}, \qquad \mathrm{TSS} = \sum_i (y_i - \bar y)^2 .

هنا TSS=39.7080\mathrm{TSS} = 39.7080 وRSS=0.1070\mathrm{RSS} = 0.1070، فيكون R2=0.9973R^2 = 0.9973 - أي أن المستقيم يفسّر 99.73٪ من تغيّر yy.

لماذا لا يستطيع R2R^2 ترتيب نماذج بأحجام مختلفة. إضافة أي متنبّئ، ولو كان ضجيجاً خالصاً، تمنح المربّعات الصغرى حريةً أكبر تماماً لخفض RSS. ومن ثم لا يمكن لـRSS أن تزيد أبداً عند إضافة متنبّئ، ولا يمكن لـR2R^2 أن ينقص أبداً. والمقياس الذي يكافئ دائماً على زيادة المتنبّئات لا يصلح للبتّ في جدارة متنبّئ. فالمقارنات تحتاج شيئاً يعاقب على الحجم - معامل تحديد معدَّلاً، أو معيار معلومات، أو تقديراً محجوزاً من التحقّق المتقاطع.

شاهد المربّعات. يستخدم الشكل أدناه خمس نقاط أخرى، (1,2),(2,4),(3,5),(4,4),(5,5)(1,2), (2,4), (3,5), (4,4), (5,5)، أكثر تشتّتاً بكثير من نقاط المثال المحلول. يُرسم فيه كل باقٍ مع مربّعه، فيكون RSS هو مساحتها الكلية، مقابل TSS الذي يتركه المتوسط الثابت. حرّك المقطع والميل، أو اضغط انتقل إلى مستقيم المربعات الصغرى: فتصل إلى y^=2.2+0.6x\hat y = 2.2 + 0.6x، حيث RSS=2.4\mathrm{RSS} = 2.4 وTSS=6\mathrm{TSS} = 6 وR2=0.6R^2 = 0.6، ومجموع البواقي صفر تماماً مرة أخرى.

تفاعلي: المربعات التي تصغّرها طريقة المربعات الصغرى

مجموع مربعات البواقي هو المساحة الكلية للمربعات.

012345670123456(x̄, ȳ)هذا المستقيمالمتوسط4.056
مجموع مربعات البواقي RSS
4.05
المجموع الكلي للمربعات TSS
6
معامل التحديد R²
0.325
مجموع البواقي
-0.5

تغطي المربعات RSS = 4.05، فيكون R² مساويًا 0.325. أمِل المستقيم وارفعه لتصغير المساحة الكلية، وراقب العمود المكدّس ينخفض نحو حده الأدنى 2.40، أو انتقل إليه مباشرة.

شاهده يتحرّك. المربّعات الصغرى فرد من عائلة أوسع: حرّك البارامتر وراقب لوغاريتم الإمكان يبلغ ذروته عند موضع المقدّر بالضبط.

تفاعلي: تسلّق دالة الإمكان

عينة ثابتة من أربعين عدداً مرصوداً للأحداث.

لوغاريتم دالة الإمكانMLE 1.550.511.522.533.5لامبدا0123456
المرصودبواسون المُلائَمة (λ)
λ المختار
0.80
لوغاريتم دالة الإمكان
-72.9
MLE (متوسط العينة)
1.55

يسأل الإمكان الأعظم: أي قيمة لـ λ تجعل البيانات المرصودة أكثر احتمالاً؟ حرّك λ فيرتفع لوغاريتم دالة الإمكان نحو ذروة وحيدة، تماماً عند متوسط العينة (1.55)، وعندها تنطبق الأعمدة المُلائَمة على الترددات المرصودة. كل نموذج GLM في هذا الموقع هو التسلّق نفسه، لكن بأبعاد أكثر.

جرّبه مباشرةً. لائم نموذجاً خطياً معمّماً بتكرار خطوة المعادلة السوية نفسها حتى التقارب:

A Poisson GLM by hand (IRLS, numpy)

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

قبل الاختبار

كن قادراً على قول ما يضمنه ∂RSS/∂β0=0\partial \mathrm{RSS}/\partial \beta_0 = 0، ولماذا R2R^2 أداة خاطئة لاختيار النماذج. والاشتقاق الكامل في الانحدار الخطي من المبادئ الأولى.

المراجع والقراءات الإضافية

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

افتح المسار كاملًا

هذا الدرس الأول مجاني. سجّل لتخوض اختبار الإتقان وتكسب نقاط الخبرة وتفتح جميع الوحدات، مع مزيد من الأمثلة التفاعلية القابلة للتشغيل.