تخطّي إلى المحتوى
Kudos AI
Read in English
التعلّم الموجَّه

التنظيم: ريدج ولاسو

إضافة عقوبة على حجم المعاملات لمبادلة قليل من التحيّز بخفض كبير في التباين، ولماذا تصفّر عقوبة L1 معاملات بعينها تماماً بينما تكتفي L2 بتقليصها، مع ملاءمة الاثنتين عددياً.

قراءة 6 دقيقةKudos AI

المتطلبات المسبقة: الانحدار الخطي من المبادئ الأولى, مقايضة التحيّز والتباين

انحدار الحرف يقترب من الصفر مقاربًا دون بلوغه بينما يعبره لاسو ويثبت عنده، ثم الحقيقة نفسها مرسومة: قرص بلا زوايا في مقابل معيّن له زوايا.

للمربّعات الصغرى هدف واحد: تصغير RSS قدر الإمكان على بيانات التدريب. وقد أظهرت مقايضة التحيّز والتباين لماذا لا يعني ذلك أن تكون مصيباً، وأظهر الانحدار اللوجستي معاملات تنطلق إلى ±∞\pm\infty حين لا يكبحها شيء.

يضيف التنظيم حدّاً ثانياً إلى دالة الهدف يجعل المعاملات الكبيرة مكلفة. والنتيجة أسوأ عمداً على بيانات التدريب، وأفضل كثيراً في الغالب على بيانات جديدة.

أ. انحدار ريدج

يصغّر ريدج RSS مضافاً إليها عقوبة تتناسب مع مجموع مربّعات المعاملات:

∑i=1n(yi−β0−∑j=1pβjxij)2+λ∑j=1pβj2  =  RSS+λ∑j=1pβj2.\sum_{i=1}^{n}\Big(y_i - \beta_0 - \sum_{j=1}^{p}\beta_j x_{ij}\Big)^2 + \lambda\sum_{j=1}^{p}\beta_j^2 \;=\; \mathrm{RSS} + \lambda\sum_{j=1}^{p}\beta_j^2 .

ويتحكّم بارامتر الضبط λ≥0\lambda \ge 0 في المبادلة. فعند λ=0\lambda = 0 تختفي العقوبة ونستعيد المربّعات الصغرى. وحين λ→∞\lambda \to \infty تهيمن العقوبة وتُدفَع كل المعاملات نحو الصفر.

وثمّة تفصيلان مهمّان. المقطع β0\beta_0 لا يُعاقَب - فهو يحدّد المستوى العام فحسب، وتقليصه بلا معنى. ولأن العقوبة تعمل على مقادير المعاملات، يجب توحيد مقاييس المتنبّئات أولاً: وإلا لغيّر قياس متغيّر بالغرامات بدل الكيلوغرامات مقدارَ معاقبته، وهو خطأ بيّن.

ب. لاسو

يستبدل لاسو بالعقوبة التربيعية عقوبةً بالقيمة المطلقة:

RSS+λ∑j=1p∣βj∣.\mathrm{RSS} + \lambda\sum_{j=1}^{p}\big|\beta_j\big| .

يستخدم ريدج عقوبة ℓ2\ell_2، ويستخدم لاسو عقوبة ℓ1\ell_1. ولهذا التغيير المفرد نتيجة لا تتناسب مع حجمه: فعقوبة ℓ1\ell_1 تُجبر بعض المعاملات على أن تساوي الصفر تماماً متى صار λ\lambda كبيراً بما يكفي. أما ريدج فيقلّص المعاملات نحو الصفر لكنه، إلا في النهاية الحدّية، لا يبلغه أبداً.

والنموذج الذي يحوي أصفاراً تامّة يتجاهل تلك المتنبّئات كلياً، ومن ثم يؤدي لاسو اختيار المتغيّرات وينتج نماذج متناثرة - وهي عادةً أسهل تفسيراً بكثير من ملاءمة ريدج التي تُبقي المتنبّئات الـpp جميعاً بمعاملات صغيرة.

ج. مراقبتهما وهما يتقلّصان

باستخدام مجموعة المشاهدات الخمس من الانحدار الخطي من المبادئ الأولى (x=1..5x = 1..5، y=2,4,5,4,5y = 2,4,5,4,5)، التي كانت ملاءمتها بالمربّعات الصغرى y^=2.2+0.6x\hat y = 2.2 + 0.6x:

λ\lambdaميل ريدجمقطع ريدجميل لاسومقطع لاسو
00.60002.20000.60002.2000
0.10.59412.21780.59502.2150
10.54552.36360.55002.3500
50.40002.80000.35002.9500
100.30003.10000.10003.7000
120.27273.18180.00004.0000
200.20003.40000.00004.0000

تجذب الطريقتان الميل إلى أسفل كلما كبر λ\lambda، ويرتفع المقطع تعويضاً - فهو غير معاقَب، ومن ثم يمتصّ المستوى.

والفارق في كيفية اقترابهما من الصفر هو بيت القصيد. ريدج يقسم: ميله 6/(10+λ)6/(10 + \lambda)، فعند λ=20\lambda = 20 يساوي 0.20.2، أي ثلث قيمته الأصلية، لكنه حيّ. أما لاسو فيطرح: ميله (6−λ/2)/10(6 - \lambda/2)/10، فيبلغ 0.00.0 تماماً عند λ=12\lambda = 12 ويلبث عنده. ومن ثم يصبح النموذج مجرّد y^=4.0=yˉ\hat y = 4.0 = \bar y - أي أن المتنبّئ أُطفئ تماماً.

هذه الأرقام تلائم xx الخام لا xx موحَّد المقياس. ومع متنبّئ واحد لا يغيّر ذلك إلا قيمةَ λ\lambda التي تُنتج كل صف، لا شكلَ أيٍّ من المسارين.

Python

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

يطبع تشغيله كل صف من الجدول، بما في ذلك lambda=12 ridge 0.2727 3.1818 lasso 0.0000 4.0000. وانتبه إلى المقياس: فـLasso في scikit-learn يقسم RSS على 2n2n، ومن ثم فإن alpha فيه تساوي λ/(2n)\lambda/(2n). ولو مُرِّرت λ\lambda كما هي لَلُوئم كل صف من صفوف لاسو بعقوبة أكبر بعشر مرات من صف ريدج المجاور له.

تحفّظ على هذا العرض. مع متنبّئ واحد وخمس مشاهدات لا يوجد ما يُختار - فالتناثر لا يصير مثيراً للاهتمام إلا حين تكون بعض المتنبّئات غير ذات صلة فعلاً ويستطيع لاسو إطفاءها مع إبقاء البقية. يعرض الجدول الآلية بأمانة، لا السياق الذي تؤتي فيه ثمارها.

تفاعلي: ما الذي تفعله العقوبتان بمعامل

ثمانية متنبئات، ثلاثة منها صفر حقيقةً.

ريدج (L2)
0λ →
لاسو (L1)
0λ →
لاسو: مُطفأة
3 من 8
منها ضجيج حقيقي
3 / 3
ريدج: مُطفأة
0 من 8

عند هذه العقوبة صيّر لاسو 3 من 8 معاملات صفرًا تمامًا، ومنها 3 من الثلاثة التي هي ضجيج حقيقةً. أما ريدج فلم يصيّر أيًّا منها صفرًا، ولن يفعل عند أي عقوبة: فمساراته تقترب من المحور اقترابًا مقاربًا. وهذا الفرق هو اختيار المتغيّرات بتمامه. ولاحظ أيضًا ترتيب الإطفاء عند لاسو: الأضعف أولًا، وهو السلوك النافع وهو كذلك السلوك الخطر حين يترابط متنبئان فيُبقي أحدهما اعتباطًا.

د. لماذا تتصرّف العقوبتان تصرّفاً مختلفاً

السرد الهندسي هو الأوضح. يمكن كتابة المسألتين هكذا: صغّر RSS تحت ميزانية على حجم المعاملات -

∑jβj2≤s(ridge),∑j∣βj∣≤s(lasso).\sum_j \beta_j^2 \le s \quad\text{(ridge)}, \qquad \sum_j |\beta_j| \le s \quad\text{(lasso)} .

في بُعدين تكون ميزانية ريدج دائرة وميزانية لاسو معيّناً رؤوسه على المحاور. ويقع الحل حيث تلمس كنتورات RSS الإهليلجية منطقةَ الميزانية لأول مرة.

الدائرة بلا رؤوس، فلا تكاد نقطة التماس تقع على محور بالضبط - ويبقى المعاملان غير صفريين. أما رؤوس المعيّن فتقع على المحاور، والكنتورات المتمدّدة تصيب رأساً بسهولة. والرأس يعني أن أحد المعاملين صفر تماماً. وفي الأبعاد الأعلى يزداد عدد رؤوس المعيّن وحوافّه وأوجهه، وإصابة أحدها تصفّر عدة معاملات دفعةً واحدة.

هـ. لماذا يخفض هذا الخطأ

التنظيم هو مقايضة التحيّز والتباين مطبَّقةً عن عمد. فتقليص المعاملات بعيداً عن قيم المربّعات الصغرى يُدخل تحيّزاً: إذ لم يعد المقدّر متمركزاً على الحقيقة. لكنه يجعل الملاءمة أيضاً أقل حساسية بكثير لأي عيّنة بعينها سحبتها، وهو ما يخفض التباين.

وحين يهبط التباين أسرع مما يرتفع مربّع التحيّز، يهبط الخطأ الكلي المتوقّع. وهذا أرجح ما يكون حين تكون المربّعات الصغرى غير مستقرة: متنبّئات كثيرة قياساً بالمشاهدات، أو متنبّئات شديدة الارتباط. وفي الحالة القصوى p>np > n لا يوجد للمربّعات الصغرى حلّ وحيد أصلاً. أما ريدج فيبقى له حلّ واحد بالضبط، ويبقى للاسو حلول لكنها ليست بالضرورة وحيدة (فعمودان متطابقان يمكنهما اقتسام وزنهما بطرق كثيرة بالكلفة نفسها).

ينمو التحيّز نمواً مطّرداً مع λ\lambda ويهبط التباين هبوطاً مطّرداً، ومن ثم توجد قيمة مثلى داخلية - ولا يمكن إيجادها من خطأ التدريب، الذي يفضّل λ=0\lambda = 0 دائماً. بل تُختار بـالتحقّق المتقاطع على شبكة من قيم λ\lambda.

و. الاختيار بينهما

ريدج (ℓ2\ell_2)لاسو (ℓ1\ell_1)
المعاملاتمقلَّصة، وكلها مُبقاةبعضها صفر تماماً
اختيار المتغيّراتلانعم
قابلية التفسيركل المتنبّئات ppمجموعة جزئية متناثرة
الأفضل حينمتنبّئات كثيرة تهمّ قليلاًمتنبّئات قليلة تهمّ كثيراً
المتنبّئات المترابطةيوزّع الوزن بينهايميل إلى انتقاء واحد اعتباطاً

لا يتفوّق أحدهما مطلقاً. إنها مسألة تجريبية خاصة بالمسألة، تُحسَم بالتحقّق المتقاطع لكليهما. والصف الأخير مطبّ عملي: فمع مجموعة من المتنبّئات المترابطة قد يكون اختيار لاسو الاعتباطي غير مستقر عبر إعادات المعاينة، ولهذا وُجدت الشبكة المرنة (elastic net) التي تجمع العقوبتين.

الخلاصات الأساسية

  • يضيف التنظيم إلى RSS عقوبة على حجم المعاملات، يضبطها λ\lambda، مبادلاً ملاءمة التدريب بالاستقرار.
  • ريدج (ℓ2\ell_2) يقلّص المعاملات نحو الصفر؛ ولاسو (ℓ1\ell_1) يصفّر بعضها تماماً، فيؤدي اختياراً للمتغيّرات.
  • يجب توحيد مقاييس المتنبّئات، ولا يُعاقَب المقطع أبداً.
  • الفرق هندسي: الميزانية الدائرية بلا رؤوس، والمعيّن له رؤوس على المحاور.
  • يعمل عبر مبادلة قليل من التحيّز بخفض كبير في التباين؛ ويجب اختيار λ\lambda بالتحقّق المتقاطع، لا بخطأ التدريب أبداً.

ما التالي

كان كل نموذج حتى الآن صيغة عامة واحدة. وثمّة استراتيجية مختلفة: تقطيع فضاء المتنبّئات إلى مناطق والتنبّؤ بثابت في كل منها - وهو ما يعالج التفاعلات واللاخطية دون أن يحدّدها أحد سلفاً. وذلك هو أشجار القرار والتجميعات.

المراجع والقراءات الإضافية

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 6 دقيقةالتعلّم الموجَّه

الانحدار الخطي من المبادئ الأولى

اشتقاق معاملات المربّعات الصغرى باشتقاق مجموع مربّعات البواقي، ثم تنفيذ ملاءمة كاملة على خمس مشاهدات يدوياً: المعاملات والقيم المُلائَمة والبواقي وRSS ومعامل التحديد، وكلٌّ منها متحقَّق منه عددياً.

الإحصاءتعلّم الآلةالرياضيات
قراءة 7 دقيقةالتعلّم الموجَّه

الانحدار اللوجستي والتصنيف

لماذا لا يستطيع المستقيم نمذجة احتمال، وكيف تعالج الدالة اللوجستية ذلك، وما معنى المعاملات بلغة لوغاريتم الأرجحية، مع خطوة صعود تدرّجي وملاءمة متقاربة محسوبتين ومتحقَّق منهما عددياً.

الإحصاءتعلّم الآلةالتحسين
قراءة 5 دقيقةالتعلّم غير المُشرَف عليه

الاتّجاه الذي يتغيّر حين تغيّر وحدة القياس

اثنا عشر شخصًا، وقياسان لكلٍّ منهم، وثلاث مكوّنات رئيسة أولى مختلفة: بالمليمترات يكون الجواب الطول وحده تقريبًا، وبالأمتار الوزن وحده تقريبًا، وبالسنتيمترات مزيجًا متوازنًا - مع بقاء الارتباط عند 0.9500 في الحالات الثلاث. وما يقوله ذلك عمّا تعظّمه المكوّنات الرئيسة، ولماذا قد تكون نسبة تباين مفسَّر تبلغ 99.999% قولًا عن الأمتار لا عن الأشخاص، وما الذي تختاره المعيرة فعلًا.

تعلّم الآلةالإحصاء
← العودة إلى كل المقالات