فهم تباعد كولباك-لايبلر
افترض أنّ مصدراً يبثّ وفق p وأنّك بنيت أقصر ترميز ممكن لتوزيع آخر q. عندئذ يكلّف كلّ رمز log2(1/q) بتّة بدل log2(1/p)، ويكون متوسّط الفاتورة هو العشوائية المتقاطعة. وتباعد كولباك-لايبلر هو الجزء من تلك الفاتورة الذي لم يكن عليك دفعه: الفارق بين ما تنفقه وعشوائية المصدر.
والتفكيك دقيق، وهو كلّ سبب كون العشوائية المتقاطعة دالّة الخسارة المعيارية. فلمصدر باحتمالات 0.6 و0.25 و0.1 و0.05 تبلغ العشوائية 1.4905 بتّة. وترميزه بأسلوب مبنيّ للتوزيع المنتظم يكلّف 2.0000 بتّة لكلّ رمز بالضبط، والزيادة 0.5095. الرقم الأوّل يثبّته العالم، والثاني هو الجزء الوحيد الذي يستطيع نموذج تحسينه، فالتدريب على العشوائية المتقاطعة تدريب على التباعد عن الحقيقة.
وليس مسافة، وعدم التناظر ليس تفصيلاً تقنياً. فلمصدر يبثّ رمزاً واحداً 98٪ من الوقت يبلغ التباعد من ذلك المصدر إلى التوزيع المنتظم 1.4235 بتّة، بينما يبلغ في الجهة الأخرى 2.8540، أي أكثر قليلاً من الضعف. فـKL(p||q) تهيمن عليها النتائج التي يُنتجها p ويعدّها q بعيدة الاحتمال، فتعاقب النموذج على إهماله ما يقع؛ والجهة العكسية تعاقب النموذج على توزيع كتلة حيث لا يقع شيء. والجهة التي تصغّرها الطريقة تحدّد أتتحفّظ أم تلتزم.
وتنمو غرامة الخطأ الواثق بلا حدّ. فإعطاء الحقيقة احتمال 0.5 يكلّف بتّة واحدة، و0.1 يكلّف 3.32، و0.01 يكلّف 6.64، و0.001 يكلّف 9.97. وهذا بالضبط سبب حساسية العشوائية المتقاطعة للمعايرة بما لا تكون الدقّة كذلك، وسبب قدرة حفنة أمثلة خاطئة بثقة على الهيمنة على التدرّج.
كيفية الحساب
KL(p||q) = Σ p(x) log2( p(x) / q(x) ) and H(p,q) = H(p) + KL(p||q)
حيث
- p
- التوزيع الذي يولّد البيانات فعلاً
- q
- النموذج: التوزيع الذي تستعمل ترميزه
- H(p,q)
- العشوائية المتقاطعة، متوسّط كلفة ترميز p بـq
- KL(p||q) ≥ 0
- صفر بالضبط حين يتطابق p وq في كلّ موضع
مثال على تباعد كولباك-لايبلر
مصدر (0.6، 0.25، 0.1، 0.05) في مقابل نموذج منتظم: عشوائية 1.4905 بتّة، وعشوائية متقاطعة 2.0000 بتّة، وتباعد 0.5095 بتّة لكلّ رمز.
مصدر 98٪ منه رمز واحد: KL(المصدر||المنتظم) = 1.4235 بتّة، وKL(المنتظم||المصدر) = 2.8540 بتّة. التوزيعان نفسهما، والكلفة ضعف في جهة واحدة.
الخسارة لكلّ مثال حين يعطي النموذج التسمية الصحيحة 0.5 و0.1 و0.01 و0.001: 1.00 و3.32 و6.64 و9.97 بتّة.
الأسئلة الشائعة
لماذا لا نستعمل مقياساً متناظراً بدلاً منه؟
توجد بدائل متناظرة، وهي نافعة حين تريد فعلاً مقارنة توزيعين بوصفهما كائنين. لكنّ الصيغة غير المتناظرة هي التي تجيب عن سؤال «كم يكلّفني هذا النموذج»، وهو السؤال الذي يجب أن تجيب عنه دالّة الخسارة.
ماذا يحدث إن أسند النموذج صفراً إلى شيء يقع؟
يكون التباعد لا نهائياً، وليس هذا حادثاً عددياً: إذ لا كلمة لذلك الرمز في الترميز. وعملياً هذا سبب تمليس الاحتمالات أو قصّها، وسبب وجوب أن يكون الصفر في نموذج ادّعاءً متعمَّداً لا أثراً لعيّنة صغيرة.
أتصغير العشوائية المتقاطعة هو الإمكان الأعظم نفسه؟
نعم، إلى ثابت وتغيير وحدات. فمتوسّط سالب لوغاريتم الإمكان للبيانات تحت النموذج هو العشوائية المتقاطعة التجريبية، فالإجراءان يختاران النموذج نفسه ولا يختلفان إلّا في طريقة عرض الرقم.
الخلاصة
التباعد ثمن الخطأ في التوزيع، مقيساً بالبتّات ومستحقّاً عن كلّ مشاهدة. وهو يقسم العشوائية المتقاطعة إلى جزء لا تستطيع تغييره وجزء هو نموذجك بالكامل، وهذا ما يجعله الكمّية الطبيعية للتصغير، ما دمت تتذكّر أيّ جهة تصغّر.