المكوّنات الرئيسة والتباين
اتّجاه التباين الأقصى، والقيد الذي يجعل السؤال محكم الطرح، ونسبة التباين المفسَّر، ولماذا ليس تعيير المقياس اختياريًا.
ستّ نقاط، لكلّ واحدة قياسان. وبنهاية هذا الدرس سيحلّ عددٌ واحد محلّ القياسين معًا ويحتفظ بـ98.83٪ من كلّ ما كان يتغيّر.
وهذه هي فكرة المركّبات الرئيسة كلّها: فأكثر البيانات ذات الأعمدة الكثيرة ليست في حقيقتها بهذا الاتّساع. فالأعمدة تتحرّك معًا، وحركتها تقع قريبًا من شكلٍ أدنى بُعدًا. وإيجاد ذلك الشكل يتيح حمل كلّ المعلومات تقريبًا بأعداد أقلّ بكثير.
والمعضلة أن ليس ثمّة ما تتحقّق به من جوابك. فكل ما في المسار المُشرَف عليه كان له استجابة تُتنبَّأ، فيمكن للنموذج أن يصيب أو يخطئ. وهنا لا استجابة البتّة - ليس إلّا البيانات - و«ما البنية التي تحويها» سؤال أعسر بحقّ حتّى في طرحه. فأوّل العمل إذن أن نقول بالضبط ما الذي يجعل الجواب جوابًا جيّدًا.
وتحليل المكوّنات الرئيسة يجعل السؤال دقيقًا على وجه واحد: أوجِد عددًا صغيرًا من الاتّجاهات تتباين البيانات على امتدادها أقصى ما تتباين، واستعملها مكان المتغيّرات الأصليّة.
المكوّنة الرئيسة الأولى
المكوّنة الرئيسة الأولى هي التركيبة الخطّية المُعيَّرة
صاحبة أكبر تباين. والقيد ليس زينةً. فلولاه لأمكنك مضاعفة كل ، فيتربّع التباين أربع مرّات، ثم تعيد الكرّة بلا نهاية: فلا يكون للتعظيم حلّ البتّة. وتثبيت الطول عند الواحد يجعل المسألة في الاتّجاه لا في المقدار.
والمتّجه هو متّجه التحميلات. يصف اتّجاهًا في فضاء الخصائص، وهو ملك لمجموعة البيانات بأسرها. وإسقاط المشاهدات عليه يعطي الدرجات ، واحدةً لكل مشاهدة.
التحميلات والدرجات تجيبان عن سؤالين مختلفين. فالتحميل يقول كم تُسهم المتغيّرة في مكوّنة؛ والدرجة تقول أين تقع المشاهدة على امتدادها. والخلط بينهما أشيع سبل إساءة قراءة مخرجات التحليل.
ويضيف جيمس وزملاؤه توصيفًا ثانيًا مكافئًا يستحقّ الحفظ: اتّجاه المكوّنة الأولى هو أيضًا المستقيم الأقرب إلى المشاهدات الـ كلّها، بمعنى مربّعات المسافات العموديّة. فتعظيم تباين الإسقاطات وتصغير المسافة إلى المستقيم مسألة واحدة.
مثال محلول
ستّ مشاهدات على متغيّرتين:
وبتمركيز الأعمدة تكون مصفوفة التغاير العيّنيّة
وقيمها الذاتيّة و، ومتّجهها الذاتي الأول - أي متّجه التحميلات الأول - هو
والتحميلان موجبان والثاني أكبر، فالمكوّنة في جوهرها «المتغيّرتان معًا، مرجَّحتين نحو الثانية». والدرجات هي
وتباينها العيّني - أي تمامًا. وليست تلك مصادفة: فالقيمة الذاتيّة هي التباين الذي تلتقطه مكوّنتها.
يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.
تفاعلي: ما الذي يبقيه الإسقاط وما الذي يفقده
ست نقاط، ومستقيم واحد، وكل الزوايا متاحة.
- التباين المحفوظ
- 2.0000
- المسافة المربّعة المفقودة
- 6.1667
- مجموعهما
- 8.1667
يُحفظ 2.0000 من التباين. وانظر خاصةً إلى المقياس الثالث: فالأوّلان يتحركان في اتجاهين متعاكسين ومجموعهما لا يتغيّر أبدًا مهما كانت الزاوية. فتعظيم التباين المحفوظ وتصغير المسافة العمودية إلى المستقيم ليسا معيارين تصادف اتفاقهما، بل معيار واحد مكتوب بطريقتين. ولا زاوية تتفوّق على المركّبة الرئيسة؛ حاول أن تجد واحدة.
نسبة التباين المفسَّر
كل مكوّنة تلتقط حصّةً من التباين الكلّي، ونسبة التباين المفسَّر تُبلّغ عنها:
وهنا و. فاتّجاه واحد يحمل 98.83٪ من التباين في بيانات ذات متغيّرتين، فاستبدال درجة واحدة بالمتغيّرتين لا يكاد يفقد شيئًا.
ومخطّط الركام يرتّب نسبة التباين المفسَّر لكل مكوّنة، والنصيحة المعتادة أن تبحث عن مِرفق. ويجدر أن نصدق في وصف ما هو: حكم بالعين لا اختبار. فلا توجد طريقة موضوعيّة متّفق عليها على نطاق واسع لتقرير كم مكوّنة تكفي، وفي السياق غير المُشرَف عليه لا خطأ محجوزًا يُحتكم إليه كذلك - وهذه بعينها مشقّة انعدام .
لماذا ليس توحيد القياس اختياريًا
التحليل يعظّم التباين، وللتباين وحدات. فقِس طولًا بالمليمترات بدل الأمتار يكبر تباينه بمقدار ، فتهيمن تلك المتغيّرة على المكوّنة الأولى لا لسبب إلا اختيار المسطرة.
والعلاج تعيير كل متغيّرة إلى انحراف معياري واحد قبل حساب المكوّنات - وهو ما يعادل إجراء التحليل على مصفوفة الارتباط بدل مصفوفة التغاير. ويصف جيمس وزملاؤه ذلك بالممارسة المعتادة، ويستحقّ الاستثناء التسمية: فحين تكون المتغيّرات بالوحدات نفسها أصلًا وتكون تبايناتها المختلفة ذات دلالة حقيقيّة، يكون التعيير إهدارًا لمعلومة حقيقيّة.
قبل الاختبار
كن قادرًا على بيان ما تعظّمه المكوّنة الأولى ولماذا يلزم قيد المعيار، وتمييز التحميل من الدرجة، وحساب نسبة التباين المفسَّر من القيم الذاتيّة، وبيان ما يفسد إن أُهمل توحيد القياس. ومدخل الموسوعة تحليل المكوّنات الرئيسة يغطّي المادّة نفسها مرجعًا.
المراجع والقراءات الإضافية
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗
تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.
افتح المسار كاملًا
هذا الدرس الأول مجاني. سجّل لتخوض اختبار الإتقان وتكسب نقاط الخبرة وتفتح جميع الوحدات، مع مزيد من الأمثلة التفاعلية القابلة للتشغيل.