تخطّي إلى المحتوى
Kudos AI
Read in English
التعلّم الموجَّه

الانحدار اللوجستي والتصنيف

لماذا لا يستطيع المستقيم نمذجة احتمال، وكيف تعالج الدالة اللوجستية ذلك، وما معنى المعاملات بلغة لوغاريتم الأرجحية، مع خطوة صعود تدرّجي وملاءمة متقاربة محسوبتين ومتحقَّق منهما عددياً.

قراءة 7 دقيقةKudos AI

المتطلبات المسبقة: الانحدار الخطي من المبادئ الأولى, مبرهنة بايز وتحديث الاعتقاد

مستقيم يتجاوز الواحد ويهبط دون الصفر، ثم الجزء الخطي نفسه مطويًّا داخل المنحنى اللوجستي، والحدّ الفاصل يُقرأ مباشرة من المعاملات.

لائم مقال الانحدار الخطي من المبادئ الأولى استجابةً عددية. لكن كثيراً من المسائل تطرح سؤالاً فئوياً بدل ذلك: هل ينتمي هذا إلى الفئة أ أم إلى الفئة ب؟ وما نريده عادةً ليس التسمية بل احتمال التسمية، والاحتمالات مقيَّدة على نحو لا تُقيَّد به المستقيمات.

أ. لماذا لا نلائم مستقيماً وحسب؟

رمّز الفئتين بـ00 و11 وشغّل المربّعات الصغرى. المستقيم المُلائَم هو β^0+β^1X\hat\beta_0 + \hat\beta_1 X، وهو معرّف لكل XX حقيقي، ومن ثم يتجاوز 11 في النهاية ويهبط تحت 00 في النهاية. وبوصفه تقديراً لـ P(Y=1∣X)P(Y = 1 \mid X) فهذا ليس غير دقيق فحسب، بل مستحيل - إنه ينتهك بديهيتي الاحتمالات من الصفر.

نحتاج إلى نموذج يكون خرجه محصوراً في (0,1)(0, 1) بحكم بنائه.

ب. الدالة اللوجستية

يُنمذج الانحدار اللوجستي الاحتمال مباشرة:

p(X)=P(Y=1∣X)=eβ0+β1X1+eβ0+β1X.p(X) = P(Y = 1 \mid X) = \frac{e^{\beta_0 + \beta_1 X}}{1 + e^{\beta_0 + \beta_1 X}} .

وبكتابة z=β0+β1Xz = \beta_0 + \beta_1 X، تصبح هذه هي الدالة اللوجستية (أو السيغمويد)

σ(z)=11+e−z,\sigma(z) = \frac{1}{1 + e^{-z}} ,

والصورتان متطابقتان جبرياً (اقسم بسط الأولى ومقامها على eze^{z}). وسلوكها هو بالضبط ما نحتاجه: حين z→+∞z \to +\infty يكون σ→1\sigma \to 1؛ وحين z→−∞z \to -\infty يكون σ→0\sigma \to 0؛ وσ(0)=0.5\sigma(0) = 0.5. فالخرج يقترب من الطرفين دون بلوغهما أبداً.

بعض القيم، مع z=−4+xz = -4 + x:

xxzzσ(z)\sigma(z)
2−2-20.1192
4000.5000
6220.8808

ج. الأرجحية ولوغاريتمها: ما معنى المعاملات

إعادة ترتيب النموذج تعطي الأرجحية:

p(X)1−p(X)=eβ0+β1X,\frac{p(X)}{1 - p(X)} = e^{\beta_0 + \beta_1 X} ,

وأخذ اللوغاريتم يعطي لوغاريتم الأرجحية أو اللوجيت:

log⁡ ⁣(p(X)1−p(X))=β0+β1X.\log\!\left(\frac{p(X)}{1 - p(X)}\right) = \beta_0 + \beta_1 X .

بهذا المعنى يكون الانحدار اللوجستي نموذجاً خطياً - خطياً في لوغاريتم الأرجحية، لا في الاحتمال. فالأرجحية تمتد من 00 إلى ∞\infty، ولوغاريتمها يغطي المستقيم الحقيقي كله، وهو بالضبط المدى الذي تحتاجه دالة خطية.

ppالأرجحية p/(1−p)p/(1-p)لوغاريتم الأرجحية
0.200.25−1.3863-1.3863
0.501.000.00000.0000
0.753.001.09861.0986
0.909.002.19722.1972

إذاً β1\beta_1 هو التغيّر في لوغاريتم الأرجحية لكل زيادة بمقدار وحدة في XX، وeβ1e^{\beta_1} هو التغيّر الضربي في الأرجحية.

أشيع سوء قراءة. β1\beta_1 ليس التغيّر في الاحتمال لكل وحدة من XX. فلأن المنحنى اللوجستي على شكل حرف S، تحرّك الخطوة الواحدة نفسُها الاحتمالَ كثيراً قرب p=0.5p = 0.5 ولا تكاد تحرّكه في الذيلين. ولوغاريتم الأرجحية وحده هو ما يتغيّر بمقدار ثابت.

د. الملاءمة بالإمكان الأعظم

المربّعات الصغرى ليست المعيار الطبيعي هنا. بل نختار المعاملات التي تجعل التسميات المرصودة أكثر احتمالاً. وتسهم كل مشاهدة بـ p(xi)p(x_i) إن كان yi=1y_i = 1 وبـ 1−p(xi)1 - p(x_i) إن كان yi=0y_i = 0، وهو ما يتركّب في دالة الإمكان

ℓ(β0,β1)=∏i: yi=1p(xi)∏i: yi=0(1−p(xi)).\ell(\beta_0, \beta_1) = \prod_{i:\,y_i=1} p(x_i) \prod_{i:\,y_i=0}\big(1 - p(x_i)\big) .

ويحوّل أخذ اللوغاريتم الجداءَ إلى مجموع - وهو أفضل سلوكاً عددياً بكثير - فينتج لوغاريتم الإمكان

log⁡ℓ=∑i=1n[yilog⁡p(xi)+(1−yi)log⁡(1−p(xi))].\log \ell = \sum_{i=1}^{n}\Big[y_i \log p(x_i) + (1-y_i)\log\big(1 - p(x_i)\big)\Big] .

وخلافاً للمربّعات الصغرى، ليس لهذا حلّ في صورة مغلقة؛ بل يُعظَّم عددياً. وتدرّجه أنيق إلى حدّ لافت:

∂log⁡ℓ∂β0=∑i(yi−pi),∂log⁡ℓ∂β1=∑i(yi−pi) xi.\frac{\partial \log\ell}{\partial \beta_0} = \sum_i (y_i - p_i), \qquad \frac{\partial \log\ell}{\partial \beta_1} = \sum_i (y_i - p_i)\,x_i .

تدفع كل مشاهدة المعاملات بمقدار يتناسب مع خطأ التنبّؤ الحالي - وهو نمط يعود للظهور في الانتشار العكسي والنزول التدرّجي.

هـ. خطوة تدرّج واحدة، يدوياً

ستّ مشاهدات، غير قابلة للفصل التام عن قصد (والسبب في القسم ز):

xix_i123456
yiy_i010111

لنبدأ من β0=β1=0\beta_0 = \beta_1 = 0. عندئذ zi=0z_i = 0 وpi=σ(0)=0.5p_i = \sigma(0) = 0.5 لكل مشاهدة، ومن ثم

log⁡ℓ=6log⁡(0.5)=−4.158883.\log\ell = 6\log(0.5) = -4.158883 .

مركّبتا التدرّج:

∑i(yi−pi)=(0−0.5)+(1−0.5)+(0−0.5)+(1−0.5)+(1−0.5)+(1−0.5)=1.0,\sum_i (y_i - p_i) = (0-0.5)+(1-0.5)+(0-0.5)+(1-0.5)+(1-0.5)+(1-0.5) = 1.0 , ∑i(yi−pi)xi=−0.5+1.0−1.5+2.0+2.5+3.0=6.5.\sum_i (y_i - p_i)x_i = -0.5 + 1.0 - 1.5 + 2.0 + 2.5 + 3.0 = 6.5 .

وبأخذ خطوة بحجم η=0.05\eta = 0.05 صعوداً (فنحن نُعظّم):

β0←0+0.05(1.0)=0.05,β1←0+0.05(6.5)=0.325.\beta_0 \leftarrow 0 + 0.05(1.0) = 0.05, \qquad \beta_1 \leftarrow 0 + 0.05(6.5) = 0.325 .

الاحتمالات الجديدة هي [0.5927,0.6682,0.7359,0.7941,0.8422,0.8808][0.5927, 0.6682, 0.7359, 0.7941, 0.8422, 0.8808]، وارتفع لوغاريتم الإمكان إلى −3.162034-3.162034. خطوة واحدة حسّنت الملاءمة.

حجم الخطوة ليس بارامتراً حراً. فمع η=0.5\eta = 0.5 تهبط الخطوة نفسها عند β=(0.5,3.25)\beta = (0.5, 3.25) وينخفض لوغاريتم الإمكان إلى −14.024-14.024 - أسوأ بكثير من نقطة البداية. تجاوز القمة سهل؛ وكون الخطوة صاعدة محلياً لا يعني أن أي حجم خطوة في ذلك الاتجاه يمثّل تحسّناً.

والتكرار حتى التقارب يعطي

β^0=−2.7700,β^1=1.1447,\hat\beta_0 = -2.7700, \qquad \hat\beta_1 = 1.1447,

بلوغاريتم إمكان قدره −2.440125-2.440125.

تفسير النتيجة. كل وحدة إضافية من xx تضرب الأرجحية في e1.14466=3.1414e^{1.14466} = 3.1414 - أي تقريباً ثلاثة أمثال. وحدّ القرار، حيث p=0.5p = 0.5، هو حيث z=0z = 0:

x=−β^0β^1=2.77001.14466=2.4199.x = -\frac{\hat\beta_0}{\hat\beta_1} = \frac{2.7700}{1.14466} = 2.4199 .

فدون x≈2.42x \approx 2.42 نتنبّأ بالفئة 0، وفوقه بالفئة 1.

تفاعلي: خطّي في اللوغاريتم الأرجحي، منحنٍ في الاحتمال

الخطوة المعلَّمة وحدةٌ واحدة من x، مرسومةً على الاثنين.

00.5
مضاعِف الأرجحية
3.141x
الحدّ (p = 0.5)
2.4199
الخطوة تضيف، لوغاريتميًا
1.1447
الخطوة تضيف، احتماليًا
0.2642

تضيف الخطوة 1.1447 إلى لوغاريتم الأرجحية - المقدار نفسه أينما أُخذت، لأن ذلك الخط مستقيم - وتضرب الأرجحية في 3.141 في كل مكان كذلك. لكنها تحرّك الاحتمال بمقدار 0.2642، وهذا قريب من أقصاه، لأنك قرب الحدّ حيث المنحنى أشدّ انحدارًا. انزلق إلى أحد الذيلين وراقب الخطوة نفسها تكاد لا تساوي شيئًا.

Python

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

كل رقم أعلاه يُعاد إنتاجه بتشغيل هذا الكود.

و. من الاحتمال إلى القرار

يُخرج النموذج احتمالاً؛ أما القرار فيحتاج إلى عتبة. والعتبة الافتراضية 0.50.5 صحيحة فقط حين يتساوى ثمن نوعَي الخطأ. فحين تكون السلبية الكاذبة أغلى بكثير من الإيجابية الكاذبة، تكون العتبة الصائبة أدنى - وهذا قرار يتعلّق بالعواقب، لا سؤال إحصائي تستطيع البيانات الإجابة عنه.

ودرس معدّل الأساس من مبرهنة بايز ينطبق هنا بتمامه: فمع فئة إيجابية نادرة، قد يكون النموذج عالي الدقة ومع ذلك مخطئاً في معظم المرات التي يتنبّأ فيها بـ«إيجابي».

ز. حين تنفجر الملاءمة

إذا كانت الفئتان قابلتين للفصل التام - أي توجد عتبة تفصلهما بلا تداخل - أمكن دائماً زيادة الإمكان بتكبير β1\beta_1، ما يدفع الاحتمالات المُلائَمة نحو 00 و11 تماماً. فلا توجد قيمة عظمى، ولا وجود لمقدّر الإمكان الأعظم.

وليس هذا افتراضياً. فباستبدال بياناتنا بالبيانات المفصولة بنظافة x=(1,2,3,4)x = (1,2,3,4) وy=(0,0,1,1)y = (0,0,1,1)، يعيد حلّالٌ غير منظَّم β^1≈18.2\hat\beta_1 \approx 18.2 مع β^0≈−45.8\hat\beta_0 \approx -45.8 - أرقام هي أثر لموضع توقّف المحسِّن، لا تقديرات. وقد ينبّهك البرنامج وقد لا ينبّهك. والعلاج المعياري هو فرض عقوبة على حجم المعاملات، وهو بالضبط موضوع المقالة التالية.

الخلاصات الأساسية

  • النموذج الخطي لاحتمال يُنتج قيماً خارج [0,1][0,1]؛ والدالة اللوجستية تحصر الخرج في (0,1)(0,1) بحكم البناء.
  • الانحدار اللوجستي خطي في لوغاريتم الأرجحية: فـβ1\beta_1 هو تغيّر لوغاريتم الأرجحية لكل وحدة من XX، وeβ1e^{\beta_1} مضاعِف الأرجحية - لا تغيّر في الاحتمال.
  • تعظّم الملاءمة لوغاريتم الإمكان، وهو بلا صورة مغلقة ويُحلّ عددياً؛ وتدرّجه ∑(yi−pi)\sum(y_i - p_i) و∑(yi−pi)xi\sum(y_i - p_i)x_i.
  • تقاربت ملاءمتنا إلى β^0=−2.7700\hat\beta_0 = -2.7700 وβ^1=1.1447\hat\beta_1 = 1.1447: أرجحية ×3.14\times 3.14 لكل وحدة، وحدّ عند x=2.4199x = 2.4199.
  • حجم الخطوة مهم - فـη=0.05\eta = 0.05 حسّنت الملاءمة، وη=0.5\eta = 0.5 أساءت إليها كثيراً.
  • تحت الفصل التام لا وجود لمقدّر الإمكان الأعظم وتتباعد المعاملات.

ما التالي

نمطا الإخفاق اللذان رأيناهما للتوّ - معاملات تنفلت تحت الفصل، ونماذج مرنة تطارد الضجيج - يعالجهما مبدأ واحد: أضف عقوبة تجعل المعاملات الكبيرة مكلفة. وذلك هو التنظيم: ريدج ولاسو.

المراجع والقراءات الإضافية

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 8 دقيقةالتعلّم الموجَّه

مقارنة المصنّفات، وما تخفيه الدقة

مصنّف بايز الذي لا يُهزم وأرضية الخطأ التي يخلّفها، وأقرب k جار محاكاةً غير معلمية وk مفتاحًا للمرونة، والتحليل التمييزي ولماذا يفرض التغاير المشترك خطًا مستقيمًا، ومصفوفة الالتباس والعتبات ومنحنى ROC التي يخفيها رقم دقة واحد - وكل عدد محسوب على بيانات محاكاة يُعرف فيها الأمثل.

تعلّم الآلةالإحصاء
قراءة 6 دقيقةآلات متّجهات الدعم

آلات متّجهات الدعم: الهوامش والنوى

لماذا تكون أوسع شريحة بين فئتين حدًّا جيّدًا، ولماذا يكون الإصرار على حدّ تامّ مهزومًا بذاته، وكيف تسترجع ميزانيةٌ للانتهاكات الثباتَ، وكيف تثني نواةٌ الحدَّ بالعمل في فضاء لا تضطرّ إلى بنائه قطّ.

تعلّم الآلةالتحسين
قراءة 6 دقيقةالتعلّم الموجَّه

الانحدار الخطي من المبادئ الأولى

اشتقاق معاملات المربّعات الصغرى باشتقاق مجموع مربّعات البواقي، ثم تنفيذ ملاءمة كاملة على خمس مشاهدات يدوياً: المعاملات والقيم المُلائَمة والبواقي وRSS ومعامل التحديد، وكلٌّ منها متحقَّق منه عددياً.

الإحصاءتعلّم الآلةالرياضيات
← العودة إلى كل المقالات