الإنتروبيا والمعلومات
قياس اللايقين بالبتّات: إنتروبيا شانون ولماذا اللوغاريتم بالأساس 2، ومكسب المعلومات محلولاً على قسمة، وكيف ترتبط الإنتروبيا المتقاطعة وتباعد كولباك-لايبلر بالإنتروبيا وبدوال الخسارة التي تدرّب المصنِّفات.
المتطلبات المسبقة: الاحتمالات من الصفر: لغة اللايقين
يبدو سؤال «ما مقدار لايقيني؟» سؤالاً عن شعور. وليس كذلك. فله جواب عددي دقيق مقيس بالبتّات، ويتبيّن أن ذلك الجواب هو الكمية التي تحدّد كيف تنقسم شجرة القرار وعلى أي خسارة يُدرَّب المصنِّف. وكلاهما ينبع من تعريف واحد.
أ. قياس المفاجأة بالبتّات
لنبدأ بالحدس. العملة التي نعلم أنها تسقط على «صورة» دائماً لا تحمل لايقيناً: فرصدها لا يخبرك بشيء لم تكن تعرفه. والعملة المتوازنة أقصى ما تكون لايقيناً بين خيارين. أما العملة التي تسقط على صورة 99٪ من الوقت فأقرب كثيراً إلى الحالة الأولى منها إلى الثانية - خمّن «صورة» فلن تخطئ إلا 1٪ من الوقت.
نريد مقياساً يساوي للعملة اليقينية، ويبلغ أقصاه للمتوازنة، ويصغر لعملة الـ99٪. وباتّباع راسل ونورفيغ، تكون إنتروبيا متغيّر عشوائي يأخذ القيم بالاحتمالات هي
والصورة الأولى أدلّ. فالكمية هي مفاجأة النتيجة : كبيرة حين تكون النتيجة غير مرجّحة، وصفر حين تكون يقينية. والإنتروبيا ببساطة المفاجأة المتوقَّعة - كل مفاجأة مرجّحة بمدى تكرارها الفعلي.
لماذا الأساس 2. الوحدة هي البت، والأساس 2 يجعل ذلك حرفياً: فالإنتروبيا هي متوسط عدد أسئلة نعم/لا اللازمة لتحديد النتيجة. ورمية عملة متوازنة تحتاج سؤالاً واحداً، فينبغي أن تقيس بت بالضبط. وهي كذلك:
وللنرد الرباعي المتوازن أربع نتائج متساوية الترجيح، وهو ما يحتاج سؤالين: بت. وتتصرّف العملة المغشوشة كما اقتضى الحدس:
وللمتغيّر البولياني يريحنا أن نكتب لإنتروبيا شيء صادق باحتمال :
| 0.50 | 1.0000 |
| 0.75 | 0.8113 |
| 0.90 | 0.4690 |
| 0.99 | 0.0808 |
| 1.00 | 0.0000 |
متناظرة حول ، وأقصى ما تكون هناك، وصفر عند اليقين - وهو الشكل الذي طلبناه بالضبط. (واصطلاحاً ، وهو أيضاً نهايتها.)
يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.
الإنتروبيا والمعلومات
كل القيم بالبِتّات (الأساس 2).
- H(p) الإنتروبيا
- 1.0000 bits
- H(p, q) الإنتروبيا التقاطعية
- 1.7370 bits
- KL(p ‖ q) التباعد
- 0.7370 bits
H(p, q) = H(p) + KL(p ‖ q) → 1.7370 = 1.0000 + 0.7370
الحد الأقصى لـ 2 نتائج: 1.0000 بِت
p - التوزيع الحقيقي
q - التوزيع المُفترَض
إعدادات جاهزة
تبلغ الإنتروبيا ذروتها حين تتساوى احتمالات جميع النتائج، وتهبط إلى الصفر متى صارت نتيجة واحدة مؤكدة. والإنتروبيا التقاطعية هي ما يُدرَّب النموذج على تصغيره؛ وهي تنقسم تمامًا إلى إنتروبيا البيانات - التي لا يستطيع أي نموذج إزالتها - زائد تباعد KL، وهو الجزء الناتج عن اعتقاد التوزيع الخاطئ.
ب. مكسب المعلومات: كم يخبرك السؤال
تصير الإنتروبيا نافعة لحظة أن تسأل ماذا يشتري لك الاختبار. لنفترض أن مجموعة تدريب فيها مثالاً موجباً و مثالاً سالباً. فإنتروبيتها .
والآن اختبر سمةً لها قيمة، فتقسم المجموعة إلى مجموعات جزئية ، حيث تحوي عدد موجباً و سالباً. والنزول في الفرع يترك بتّاً باقية للحسم، ويسلك مثال عشوائي ذلك الفرع باحتمال . ومن ثم تكون الإنتروبيا المتوقّعة المتبقّية بعد الاختبار
ومكسب المعلومات هو الانخفاض المتوقّع في الإنتروبيا:
مثال محلول. اثنا عشر مثالاً، ستة موجبة وستة سالبة، فالإنتروبيا الابتدائية بت بالضبط. وتقسمها سمةٌ إلى فرع من 5 (4 موجبة، 1 سالب) وفرع من 7 (2 موجبة، 5 سالبة).
إنتروبيتا الفرعين: و.
والأوزان: و.
فهذه السمة تحسم نحو خُمس بت من البت الواحد من اللايقين الذي بدأنا به - تحسّن حقيقي لكنه متواضع.
المكسب القريب من الصفر يشي بسمة غير ذات صلة. فإن قسم اختبارٌ البيانات إلى مجموعات جزئية تبدو نِسَب فئاتها كلها كنِسَب الأم، فهو لم يخبرك بشيء، ويعيد الحساب أعلاه صفراً تقريباً. وهذا يجعل مكسب المعلومات إشارة صالحة للتشذيب كما هو صالح للقسمة.
يطبّق الشكل أدناه الحساب نفسه على قسمة أخرى: بيانات المطعم عند Russell وNorvig، وهي أيضًا اثنا عشر مثالًا ستة منها موجبة وستة سالبة، مع صفتين من صفاتها. فالصفة Patrons تكسب بتّ، والصفة Type تكسب بالضبط، وهي الصفة غير ذات الصلة التي ذكرتها الملاحظة أعلاه. وكل فرع مرسوم شريطًا وكل رقم محسوب من جديد لا منقولًا. وأداة التحكّم الثالثة تنقل أمثلة داخل فرع Patrons الوحيد الذي ما زال مختلطًا، وهو الموضع الوحيد الذي يمكن أن يتغيّر فيه المكسب دون تغيير السؤال، وتُظهر ما لا تُظهره قسمة واحدة محسوبة باليد: فالإنتروبيا المتوقّعة الباقية أكبر ما تكون حين يتوازن ذلك الفرع، بينما لا يكون المكسب أصغر ما يكون هناك، لأن نقل مثال يغيّر أيضًا الإنتروبيا التي بدأ منها القسم.
تفاعلي: كم يساوي السؤال، بالبتّات
الأمثلة الاثنا عشر نفسها. ولا يتغيّر إلا السؤال.
- الإنتروبيا قبل
- 1.0000
- الإنتروبيا المتوقّعة بعد
- 0.4591
- مكسب المعلومات
- 0.5409
- الفروع
- 3 of 12
ستة موجبة وستة سالبة، فتبدأ المجموعة عند 1.0000 بتّ من الريبة. ويقسمها الزبائن ثلاثة أقسام، فيخرج قسمان محسومَين أصلًا، ولا يبقى مختلطًا إلا الممتلئ عند B(1/3) = 0.9183. وبعد الترجيح بتكرار كل فرع يبقى 0.4591، فتساوي المسألة 0.5409 بتّ.
ج. مطبّ اصطلاحي يستحق التسمية
تعرض مقالة أشجار القرار والتجميعات معيار القسمة
وتسمّيه إنتروبيا متقاطعة، اتّباعاً لاصطلاح التعلّم الإحصائي. وقراءةً على ضوء هذه المقالة، تلك هي صيغة الإنتروبيا - توزيع واحد يُقيَّم مقابل نفسه.
أما نظرية المعلومات فتحجز الإنتروبيا المتقاطعة لكمية تشمل توزيعين. والاسمان معياريان كلٌّ في أدبياته، ولا خطأ في أيّهما، لكنهما ليسا الشيء نفسه، ويسبّب التصادم التباساً حقيقياً. فحين تصادف «الإنتروبيا المتقاطعة» معياراً لقسمة الأشجار، اقرأها إنتروبيا عقدة؛ والقسم التالي عن الشيء الآخر.
د. الإنتروبيا المتقاطعة وتباعد كولباك-لايبلر
لنفترض أن الحقيقة لكنك تتصرّف باعتقاد . تقيس الإنتروبيا المتقاطعة متوسط المفاجأة التي تتكبّدها فعلاً:
فالأوزان هي الاحتمالات الحقيقية ؛ والمفاجآت محسوبة من اعتقادك . فإن كان انهارت إلى . وإلا فهي أكبر تماماً - أي أنك مفاجأ منهجياً أكثر مما يلزم.
وللفائض اسمه. فـتباعد KL بين و هو
وترتبط الكميات الثلاث بـ
وبعبارة أخرى: مفاجأتك الكلية هي اللايقين غير القابل للتقليص في العالم، زائد عقوبة كونك مخطئاً بشأنه. ولأن مثبَّت بالواقع، فتصغير الإنتروبيا المتقاطعة على نموذجك هو بالضبط تصغير تباعد KL عن الحقيقة.
تحقّق عددياً. لتكن الحقيقة عملة متوازنة، ، بينما تعتقد أنت :
و، كما ادُّعي.
يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.
KL ليست مسافة. فهي ليست متناظرة - إذ عموماً - ولا تحقّق متباينة المثلث. وتسميتها «تباعداً» لا مسافة تسمية مقصودة. ولاحظ أيضاً أنها تنفجر إذا كان حيث : فإسناد احتمال صفري لشيء ثم وقوعه مفاجأة لا نهائية.
في ما يلي، المصدر ثابت والنموذج بين يديك. راقب أيّ القراءتين يأبى أن يتزحزح: فالإنتروبيا خاصّية للمصدر، ولا يمسّها أي ضبط للمؤشّرات. وكل ما يعلو تلك الأرضية هو التباعد، وهو وحده ما يستطيع التدريب أن يقلّصه. أما اللوحة الثانية فتفصّل الكلفة رمزًا رمزًا، وعندها يكفّ الحساب عن كونه متوسّطًا ليصير تشخيصًا: فالبتّات قلّما تُهدر حيث تتوقّع.
تفاعلي: البتات التي يكلّفها نموذج خاطئ
المصدر ثابت. حرّك النموذج ولاحظ أن الأرضية لا تتزحزح.
أين تذهب البتات: p(x) log2(1/q(x))
- H(p)
- 1.4905 بت
- H(p, q)
- 2.0000 بت
- KL(p || q)
- 0.5095 بت
- KL(q || p)
- 0.5952 بت
أنت تدفع 0.5095 بت لكل رمز زيادة على ما يتطلبه المصدر، أي 6.4٪ من بايت يُهدر مع كل رمز بلا انقطاع. ومعظم ذلك آتٍ من A: إذ يمنحه النموذج كلمة ترميز طولها 2.00 بت بينما يواصل المصدر إنتاجه، فيهدر وحده 0.758 بت من المتوسط. ولاحظ أن هذا ليس الرمز الأسوأ تقديرًا عند النموذج، بل الرمز الخاطئ والشائع معًا.
هـ. لماذا تُدرَّب المصنِّفات على الإنتروبيا المتقاطعة
هنا تستحق النظرية مكانها. يُخرج المصنِّف توزيعاً احتمالياً على التسميات؛ والحقيقة الأرضية أيضاً توزيع - عادةً بكل الكتلة على تسمية واحدة. وتدريب النموذج يعني جعل توزيعه يطابق التوزيع الحقيقي، والإنتروبيا المتقاطعة هي بالضبط الكمية التي تقيس الفجوة. ويقولها شولّيه مباشرة: الإنتروبيا المتقاطعة كمية من نظرية المعلومات تقيس المسافة بين التوزيعات الاحتمالية، وهنا بين توزيع الحقيقة الأرضية وتنبّؤات النموذج، وهي عادةً الاختيار الصحيح حين يُخرج النموذج احتمالات.
ومع حقيقة أحادية على الفئة ، تتلاشى كل الحدود إلا واحداً وتصير خسارة ذلك المثال مجرّد
أي المفاجأة المسنَدة إلى الإجابة الصحيحة. فالثقة مع الصواب لا تكاد تكلّف شيئاً؛ والثقة مع الخطأ تكلّف كثيراً. وذلك اللاتماثل - الذي يوفّره اللوغاريتم لا إضافة لاحقة - هو ما يجعل الإنتروبيا المتقاطعة إشارة تدريب أفضل من الدقة، التي تكون مسطّحة في كل مكان تقريباً ولا تعطي النزول التدرّجي ما ينزل عليه.
وهذا هو الاستدلال نفسه الذي يبرّر هدف خسارة اللوغاريتم في الانحدار اللوجستي والتصنيف: فالخسارة ليست دالة مريحة اعتباطية، بل هي المفاجأة المتوقّعة لاعتقادات النموذج تحت التوزيع الحقيقي.
والإنتروبيا نفسها تقيس أيضًا ما تستطيع قناة ذات ضجيج أن تحمله، وهنا يذهب الشكل أدناه خطوة أبعد من هذه المقالة. إنه قناة ثنائية تقلب كل بتّ باحتمال ، وسعتها بتّ لكل استعمال. اضبط احتمال القلب على 0.1 لتقرأ 0.5310، وعلى 0.5 لتقرأ صفرًا تمامًا، ثم تجاوزه وانظر السعة تعود صاعدة، لأن قناة تكذب دائمًا يمكن عكسها. أما اللوحة الثانية فمثال مستقلّ: بتّان متوازنان وهدف هو «أو» الحصري لهما، حيث يحمل كل مدخل وحده 0 بتّ بالضبط عن الهدف ويحمل الزوج بتًّا واحدًا. ومزلاج المعالجة يمرّر المخرج عبر قناة ثانية على التوالي: قلبها المركّب ، وهو لا يكون أقرب إلى اليقين من أبدًا، فلا يمكن للمعلومة أن ترتفع.
تفاعلي: ماذا تحمل القناة، وماذا لا تستعيده أبدًا
حساب مضبوط من التوزيع المشترك. ولا معاينة في أي موضع.
- بتّات لكل استعمال
- 0.5310
- بعد المعالجة
- 0.3199
- ما ضاع بالمعالجة
- 0.2111
- القلب المركّب
- 0.1800
قناة تقلب باحتمال 0.10 تصيب 90% من الوقت، ولا تحمل مع ذلك إلا 0.5310 بتّ لكل استعمال؛ فالإصابة والمعلومة ليستا عملةً واحدة. والآن أمرِر الخرج عبر قناة ثانية عند 0.10: يصير القلب المركّب 0.1800 ويبقى 0.3199 بتّ. لقد هبط، وسيهبط دائمًا: تلك متباينة معالجة البيانات.
الخلاصات الأساسية
- الإنتروبيا هي المفاجأة المتوقّعة، مقيسةً بـالبتّات؛ والأساس 2 يجعلها متوسط عدد أسئلة نعم/لا.
- العملة المتوازنة بت بالضبط، والنرد الرباعي المتوازن بت، وعملة الـ99٪ نحو بت، والنتيجة اليقينية .
- مكسب المعلومات هو انخفاض الإنتروبيا المتوقّع من اختبار؛ وقسمتنا نقلت بت إلى ، بمكسب 0.1957 بت.
- يسمّي التعلّم الإحصائي معيار الشجرة «إنتروبيا متقاطعة»؛ وتسمّيه نظرية المعلومات إنتروبيا. الصيغة نفسها، والاسمان مختلفان، والالتباس حقيقي.
- الإنتروبيا المتقاطعة تقيّم اعتقاداً مقابل حقيقة ، وتتفكّك إلى - لايقين غير قابل للتقليص زائد عقوبة الخطأ.
- تباعد KL غير متناظر وغير محدود؛ وهو ليس مسافة.
- تصغير الإنتروبيا المتقاطعة هو تصغير KL عن الحقيقة، ولهذا كانت خسارة التصنيف المعيارية.
ما التالي
تقيس الإنتروبيا اللايقين داخل نموذج احتمالي. وثمّة تقليد آخر يمثّل المعرفة بعبارات صادقة أو كاذبة ببساطة، ويستدلّ على ما يلزم عنها - المنطق وتمثيل المعرفة.
المراجع والقراءات الإضافية
- Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· مكتبة مراجع Kudos AI
- François Chollet, Deep Learning with Python, Manning (2nd edition, MEAP), 2020· مكتبة مراجع Kudos AI
تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.