فهم التحليل المصفوفي
يبدأ نظام التوصية من جدول فيه المستخدمون على جانب والعناصر على الآخر ولا شيء تقريباً في الوسط: ففي المحاكاة المستعملة في هذا المسار كلّه، 17.7٪ من الخانات ممتلئة. ويفترض التحليل المصفوفي أنّ ذلك الجدول قريب من جداء مصفوفتين أصغر بكثير، فيوصَف كلّ مستخدم وكلّ عنصر بحفنة أعداد ويكون التنبّؤ جداءهما القياسيّ. والعوامل ليست مسمّاة مسبقاً؛ إنّها الاتّجاهات التي يتبيّن أنّها تفسّر التقييمات.
وأوّل ما يستحقّ الاستيعاب هو مقدار ما يأتي قبل العوامل. فالتنبّؤ بالمتوسّط العامّ لكلّ شيء يعطي خطأً جذرياً 0.9368. وإضافة إزاحة واحدة لكلّ مستخدم ولكلّ عنصر - تلتقط من يقيّم بسخاء وأيّ العناصر يحبّه أكثر الناس - تعطي 0.6761. وثمانية عوامل كامنة فوق ذلك تعطي 0.5393. فالإزاحتان تحملان نحو ثلثي التحسّن الكلّي، وهما رخيصتان ومتينتان على الصفوف المتفرّقة وسهلتا الشرح.
ويحتاج الجزءان إلى تنظيم، وللسبب نفسه. فالأعداد تتفاوت بمراتب من حيث القدر، فالعنصر ذو التقييمات الثلاثة كان سينال إزاحة ملائَمة على ثلاثة أعداد ويُوثَق به كما يُوثَق بإزاحة على ثلاثمئة. وجرّ كلّ معامل نحو الصفر بقدر قلّة البيانات التي تسنده يمنع حفنة تقييمات متحمّسة من ترقية عنصر مغمور، وهذا يجعل ثابتة التقليص معاملاً فائقاً حقيقياً.
والخطأ غير موزّع بالتساوي بين المستخدمين. فالنموذج الملائَم نفسه يسجّل 0.5210 للمستخدمين بأكثر من ثلاثين تقييماً، و0.6018 بين عشرة وثلاثين، و0.6693 دون العشرة، أي أسوأ بنحو 1.28 مرّة عند الأقلّ تقييماً. ولأنّ المقيِّمين الكثيفين يقدّمون معظم صفوف التقييم، يحدّد الرقم المعلن من يعرفهم النظام أصلاً، بينما يعيش المستخدم الجديد أسوأ نسخة منه. وأيّ تقييم يستحقّ الثقة يُفكَّك بمقدار تاريخ كلّ مستخدم.
كيفية الحساب
r̂(u,i) = μ + b_u + b_i + p_u · q_i; minimise Σ (r − r̂)² + λ(‖p_u‖² + ‖q_i‖² + b_u² + b_i²)
حيث
- μ
- متوسّط التقييم العامّ
- b_u, b_i
- إزاحتا المستخدم والعنصر، تُلائَمان قبل أيّ تفاعل
- p_u, q_i
- المتّجهان الكامنان، وعادةً من 8 إلى 200 عدد لكلٍّ
- λ
- التقليص الذي يحمي المعاملات المقدَّرة من تقييمات قليلة
مثال على التحليل المصفوفي
على كتالوغ محاكًى 800 في 300 مرصود بنسبة 17.7٪: خطأ جذري 0.9368 للمتوسّط العامّ، و0.6761 بعد إزاحتي المستخدم والعنصر، و0.5393 بعد ثمانية عوامل كامنة.
وبحسب نشاط المستخدم يسجّل النموذج نفسه 0.6693 دون عشرة تقييمات، و0.6018 بين عشرة وثلاثين، و0.5210 فوق الثلاثين: أي غرامة بداية باردة قدرها 1.28 مرّة.
وبترتيب كلّ عنصر غير مقيَّم وأخذ أوّل عشرة لكلّ مستخدم، لا يظهر إلّا 91 عنصراً من 300، مع أنّ النموذج لا يحوي أيّ حدّ صريح للشيوع.
الأسئلة الشائعة
كم عاملاً ينبغي أن أستعمل؟
ما يكفي حتّى يتوقّف خطأ التحقّق عن التحسّن، ولا أكثر. فزيادة العوامل تلائم تقييمات التدريب أفضل دائماً وتبدأ بحفظ الصفوف المتفرّقة، ولهذا يجب اختيار ثابتة التقليص وعدد العوامل معاً لا واحداً تلو آخر.
أيمكن تفسير العوامل المتعلَّمة؟
قد يوافق اتّجاه أحياناً شيئاً معروفاً، لكن لا ضمان لذلك: فالتحليل غير محدَّد إلّا إلى دوران، فأيّ تفسير تضعه على محور بعينه حكاية عن أساس واحد اعتباطيّ من بين كثير.
أالخطأ الجذري هو الشيء الصحيح للتحسين؟
إنّه الشيء السهل للتحسين، وهو يقيس المهمّة الخطأ. فالمستخدمون يرون قائمة مرتَّبة لا رقماً متنبّأً به، فقد يحسّن نموذج خطأه على تقييمات ما كان أحد ليراها بينما يترك رأس كلّ قائمة كما هو. ومقاييس الترتيب والاختبارات المتّصلة تقيس ما يُقدَّم فعلاً.
الخلاصة
التحليل المصفوفي طريقة مضغوطة لملء جدول لا يستطيع أحد ملأه يدوياً، ومعظم دقّته تصل قبل الجزء المثير: فإزاحتان تحملان ثلثي التحسّن. وأنماط إخفاقه تتركّز بالضبط حيث يحتاجه المنتج أكثر، عند المستخدمين الذين أخبروه أقلّ، فقيّمه بالشرائح لا بمتوسّط واحد.