تخطّي إلى المحتوى
Kudos AI
Read in English
أسس الاحتمالات

الإنتروبيا والمعلومات

قياس اللايقين بالبتّات: إنتروبيا شانون ولماذا اللوغاريتم بالأساس 2، ومكسب المعلومات محلولاً على قسمة، وكيف ترتبط الإنتروبيا المتقاطعة وتباعد كولباك-لايبلر بالإنتروبيا وبدوال الخسارة التي تدرّب المصنِّفات.

قراءة 8 دقيقةKudos AI

المتطلبات المسبقة: الاحتمالات من الصفر: لغة اللايقين

يُسحب التوزيع من المنتظم إلى المائل بينما يتابعه مؤشّر الإنتروبيا: عملة متوازنة عند 1 بت، وعملة 99/1 عند 0.0808، ونرد رباعي متوازن عند 2، والـ0.1957 بت التي تشتريها لك القسمة.

يبدو سؤال «ما مقدار لايقيني؟» سؤالاً عن شعور. وليس كذلك. فله جواب عددي دقيق مقيس بالبتّات، ويتبيّن أن ذلك الجواب هو الكمية التي تحدّد كيف تنقسم شجرة القرار وعلى أي خسارة يُدرَّب المصنِّف. وكلاهما ينبع من تعريف واحد.

أ. قياس المفاجأة بالبتّات

لنبدأ بالحدس. العملة التي نعلم أنها تسقط على «صورة» دائماً لا تحمل لايقيناً: فرصدها لا يخبرك بشيء لم تكن تعرفه. والعملة المتوازنة أقصى ما تكون لايقيناً بين خيارين. أما العملة التي تسقط على صورة 99٪ من الوقت فأقرب كثيراً إلى الحالة الأولى منها إلى الثانية - خمّن «صورة» فلن تخطئ إلا 1٪ من الوقت.

نريد مقياساً يساوي 00 للعملة اليقينية، ويبلغ أقصاه للمتوازنة، ويصغر لعملة الـ99٪. وباتّباع راسل ونورفيغ، تكون إنتروبيا متغيّر عشوائي VV يأخذ القيم vkv_k بالاحتمالات P(vk)P(v_k) هي

H(V)=∑kP(vk)log⁡21P(vk)=−∑kP(vk)log⁡2P(vk).H(V) = \sum_{k} P(v_k) \log_2 \frac{1}{P(v_k)} = -\sum_{k} P(v_k) \log_2 P(v_k) .

والصورة الأولى أدلّ. فالكمية log⁡21P(vk)\log_2 \frac{1}{P(v_k)} هي مفاجأة النتيجة kk: كبيرة حين تكون النتيجة غير مرجّحة، وصفر حين تكون يقينية. والإنتروبيا ببساطة المفاجأة المتوقَّعة - كل مفاجأة مرجّحة بمدى تكرارها الفعلي.

لماذا الأساس 2. الوحدة هي البت، والأساس 2 يجعل ذلك حرفياً: فالإنتروبيا هي متوسط عدد أسئلة نعم/لا اللازمة لتحديد النتيجة. ورمية عملة متوازنة تحتاج سؤالاً واحداً، فينبغي أن تقيس 11 بت بالضبط. وهي كذلك:

H(Fair)=−(0.5log⁡20.5+0.5log⁡20.5)=1.H(\text{Fair}) = -\big(0.5 \log_2 0.5 + 0.5 \log_2 0.5\big) = 1 .

وللنرد الرباعي المتوازن أربع نتائج متساوية الترجيح، وهو ما يحتاج سؤالين: H=2H = 2 بت. وتتصرّف العملة المغشوشة كما اقتضى الحدس:

H(Loaded)=−(0.99log⁡20.99+0.01log⁡20.01)≈0.08 bits.H(\text{Loaded}) = -\big(0.99 \log_2 0.99 + 0.01 \log_2 0.01\big) \approx 0.08 \text{ bits}.

وللمتغيّر البولياني يريحنا أن نكتب B(q)B(q) لإنتروبيا شيء صادق باحتمال qq:

B(q)=−(qlog⁡2q+(1−q)log⁡2(1−q)).B(q) = -\big(q \log_2 q + (1-q) \log_2 (1-q)\big).
qqB(q)B(q)
0.501.0000
0.750.8113
0.900.4690
0.990.0808
1.000.0000

متناظرة حول q=0.5q = 0.5، وأقصى ما تكون هناك، وصفر عند اليقين - وهو الشكل الذي طلبناه بالضبط. (واصطلاحاً 0log⁡0=00 \log 0 = 0، وهو أيضاً نهايتها.)

Python

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

الإنتروبيا والمعلومات

كل القيم بالبِتّات (الأساس 2).

H(p) الإنتروبيا
1.0000 bits
H(p, q) الإنتروبيا التقاطعية
1.7370 bits
KL(p ‖ q) التباعد
0.7370 bits

H(p, q) = H(p) + KL(p ‖ q) → 1.7370 = 1.0000 + 0.7370

الحد الأقصى لـ 2 نتائج: 1.0000 بِت

p - التوزيع الحقيقي

A50.0%
B50.0%

q - التوزيع المُفترَض

A90.0%
B10.0%

إعدادات جاهزة

تبلغ الإنتروبيا ذروتها حين تتساوى احتمالات جميع النتائج، وتهبط إلى الصفر متى صارت نتيجة واحدة مؤكدة. والإنتروبيا التقاطعية هي ما يُدرَّب النموذج على تصغيره؛ وهي تنقسم تمامًا إلى إنتروبيا البيانات - التي لا يستطيع أي نموذج إزالتها - زائد تباعد KL، وهو الجزء الناتج عن اعتقاد التوزيع الخاطئ.

ب. مكسب المعلومات: كم يخبرك السؤال

تصير الإنتروبيا نافعة لحظة أن تسأل ماذا يشتري لك الاختبار. لنفترض أن مجموعة تدريب فيها pp مثالاً موجباً وnn مثالاً سالباً. فإنتروبيتها B ⁣(pp+n)B\!\left(\frac{p}{p+n}\right).

والآن اختبر سمةً AA لها dd قيمة، فتقسم المجموعة إلى مجموعات جزئية E1,…,EdE_1, \dots, E_d، حيث تحوي EkE_k عدد pkp_k موجباً وnkn_k سالباً. والنزول في الفرع kk يترك B ⁣(pkpk+nk)B\!\left(\frac{p_k}{p_k+n_k}\right) بتّاً باقية للحسم، ويسلك مثال عشوائي ذلك الفرع باحتمال pk+nkp+n\frac{p_k+n_k}{p+n}. ومن ثم تكون الإنتروبيا المتوقّعة المتبقّية بعد الاختبار

Remainder(A)=∑k=1dpk+nkp+n B ⁣(pkpk+nk),\text{Remainder}(A) = \sum_{k=1}^{d} \frac{p_k + n_k}{p + n}\, B\!\left(\frac{p_k}{p_k + n_k}\right),

ومكسب المعلومات هو الانخفاض المتوقّع في الإنتروبيا:

Gain(A)=B ⁣(pp+n)−Remainder(A).\text{Gain}(A) = B\!\left(\frac{p}{p+n}\right) - \text{Remainder}(A).

مثال محلول. اثنا عشر مثالاً، ستة موجبة وستة سالبة، فالإنتروبيا الابتدائية B(0.5)=1B(0.5) = 1 بت بالضبط. وتقسمها سمةٌ إلى فرع من 5 (4 موجبة، 1 سالب) وفرع من 7 (2 موجبة، 5 سالبة).

إنتروبيتا الفرعين: B(4/5)=B(0.8)=0.7219B(4/5) = B(0.8) = 0.7219 وB(2/7)=B(0.2857)=0.8631B(2/7) = B(0.2857) = 0.8631.

والأوزان: 5/12=0.41675/12 = 0.4167 و7/12=0.58337/12 = 0.5833.

Remainder=0.4167×0.7219+0.5833×0.8631=0.8043,\text{Remainder} = 0.4167 \times 0.7219 + 0.5833 \times 0.8631 = 0.8043 , Gain=1.0000−0.8043=0.1957 bits.\text{Gain} = 1.0000 - 0.8043 = 0.1957 \text{ bits}.

فهذه السمة تحسم نحو خُمس بت من البت الواحد من اللايقين الذي بدأنا به - تحسّن حقيقي لكنه متواضع.

المكسب القريب من الصفر يشي بسمة غير ذات صلة. فإن قسم اختبارٌ البيانات إلى مجموعات جزئية تبدو نِسَب فئاتها كلها كنِسَب الأم، فهو لم يخبرك بشيء، ويعيد الحساب أعلاه صفراً تقريباً. وهذا يجعل مكسب المعلومات إشارة صالحة للتشذيب كما هو صالح للقسمة.

يطبّق الشكل أدناه الحساب نفسه على قسمة أخرى: بيانات المطعم عند Russell وNorvig، وهي أيضًا اثنا عشر مثالًا ستة منها موجبة وستة سالبة، مع صفتين من صفاتها. فالصفة Patrons تكسب 0.54090.5409 بتّ، والصفة Type تكسب 00 بالضبط، وهي الصفة غير ذات الصلة التي ذكرتها الملاحظة أعلاه. وكل فرع مرسوم شريطًا وكل رقم محسوب من جديد لا منقولًا. وأداة التحكّم الثالثة تنقل أمثلة داخل فرع Patrons الوحيد الذي ما زال مختلطًا، وهو الموضع الوحيد الذي يمكن أن يتغيّر فيه المكسب دون تغيير السؤال، وتُظهر ما لا تُظهره قسمة واحدة محسوبة باليد: فالإنتروبيا المتوقّعة الباقية أكبر ما تكون حين يتوازن ذلك الفرع، بينما لا يكون المكسب أصغر ما يكون هناك، لأن نقل مثال يغيّر أيضًا الإنتروبيا التي بدأ منها القسم.

تفاعلي: كم يساوي السؤال، بالبتّات

الأمثلة الاثنا عشر نفسها. ولا يتغيّر إلا السؤال.

NoneSomeFull
الإنتروبيا قبل
1.0000
الإنتروبيا المتوقّعة بعد
0.4591
مكسب المعلومات
0.5409
الفروع
3 of 12

ستة موجبة وستة سالبة، فتبدأ المجموعة عند 1.0000 بتّ من الريبة. ويقسمها الزبائن ثلاثة أقسام، فيخرج قسمان محسومَين أصلًا، ولا يبقى مختلطًا إلا الممتلئ عند B(1/3) = 0.9183. وبعد الترجيح بتكرار كل فرع يبقى 0.4591، فتساوي المسألة 0.5409 بتّ.

ج. مطبّ اصطلاحي يستحق التسمية

تعرض مقالة أشجار القرار والتجميعات معيار القسمة

D=−∑k=1Kp^mklog⁡p^mkD = -\sum_{k=1}^{K} \hat p_{mk} \log \hat p_{mk}

وتسمّيه إنتروبيا متقاطعة، اتّباعاً لاصطلاح التعلّم الإحصائي. وقراءةً على ضوء هذه المقالة، تلك هي صيغة الإنتروبيا - توزيع واحد يُقيَّم مقابل نفسه.

أما نظرية المعلومات فتحجز الإنتروبيا المتقاطعة لكمية تشمل توزيعين. والاسمان معياريان كلٌّ في أدبياته، ولا خطأ في أيّهما، لكنهما ليسا الشيء نفسه، ويسبّب التصادم التباساً حقيقياً. فحين تصادف «الإنتروبيا المتقاطعة» معياراً لقسمة الأشجار، اقرأها إنتروبيا عقدة؛ والقسم التالي عن الشيء الآخر.

د. الإنتروبيا المتقاطعة وتباعد كولباك-لايبلر

لنفترض أن الحقيقة pp لكنك تتصرّف باعتقاد qq. تقيس الإنتروبيا المتقاطعة متوسط المفاجأة التي تتكبّدها فعلاً:

H(p,q)=−∑ip(xi)log⁡2q(xi).H(p, q) = -\sum_{i} p(x_i) \log_2 q(x_i) .

فالأوزان هي الاحتمالات الحقيقية pp؛ والمفاجآت محسوبة من اعتقادك qq. فإن كان q=pq = p انهارت إلى H(p)H(p). وإلا فهي أكبر تماماً - أي أنك مفاجأ منهجياً أكثر مما يلزم.

وللفائض اسمه. فـتباعد KL بين PP وQQ هو

KL(P,Q)=∑iP(xi)log⁡2P(xi)Q(xi),\text{KL}(P, Q) = \sum_{i} P(x_i) \log_2 \frac{P(x_i)}{Q(x_i)} ,

وترتبط الكميات الثلاث بـ

H(p,q)=H(p)+KL(p ∥ q).H(p, q) = H(p) + \text{KL}(p \,\|\, q).

وبعبارة أخرى: مفاجأتك الكلية هي اللايقين غير القابل للتقليص في العالم، زائد عقوبة كونك مخطئاً بشأنه. ولأن H(p)H(p) مثبَّت بالواقع، فتصغير الإنتروبيا المتقاطعة على نموذجك هو بالضبط تصغير تباعد KL عن الحقيقة.

تحقّق عددياً. لتكن الحقيقة عملة متوازنة، p=(0.5,0.5)p = (0.5, 0.5)، بينما تعتقد أنت q=(0.9,0.1)q = (0.9, 0.1):

H(p)=1.0000,H(p,q)=1.7370,KL(p ∥ q)=0.7370.H(p) = 1.0000, \qquad H(p, q) = 1.7370, \qquad \text{KL}(p \,\|\, q) = 0.7370 .

و1.0000+0.7370=1.73701.0000 + 0.7370 = 1.7370، كما ادُّعي.

Python

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

KL ليست مسافة. فهي ليست متناظرة - إذ KL(P,Q)≠KL(Q,P)\text{KL}(P, Q) \neq \text{KL}(Q, P) عموماً - ولا تحقّق متباينة المثلث. وتسميتها «تباعداً» لا مسافة تسمية مقصودة. ولاحظ أيضاً أنها تنفجر إذا كان q(x)=0q(x) = 0 حيث p(x)>0p(x) > 0: فإسناد احتمال صفري لشيء ثم وقوعه مفاجأة لا نهائية.

في ما يلي، المصدر ثابت والنموذج بين يديك. راقب أيّ القراءتين يأبى أن يتزحزح: فالإنتروبيا خاصّية للمصدر، ولا يمسّها أي ضبط للمؤشّرات. وكل ما يعلو تلك الأرضية هو التباعد، وهو وحده ما يستطيع التدريب أن يقلّصه. أما اللوحة الثانية فتفصّل الكلفة رمزًا رمزًا، وعندها يكفّ الحساب عن كونه متوسّطًا ليصير تشخيصًا: فالبتّات قلّما تُهدر حيث تتوقّع.

تفاعلي: البتات التي يكلّفها نموذج خاطئ

المصدر ثابت. حرّك النموذج ولاحظ أن الأرضية لا تتزحزح.

0.000.300.60ABCD
المصدر pالنموذج q

أين تذهب البتات: p(x) log2(1/q(x))

0.000.601.20ABCD
غير قابل للاختزالمهدور
H(p)
1.4905 بت
H(p, q)
2.0000 بت
KL(p || q)
0.5095 بت
KL(q || p)
0.5952 بت

أنت تدفع 0.5095 بت لكل رمز زيادة على ما يتطلبه المصدر، أي 6.4٪ من بايت يُهدر مع كل رمز بلا انقطاع. ومعظم ذلك آتٍ من A: إذ يمنحه النموذج كلمة ترميز طولها 2.00 بت بينما يواصل المصدر إنتاجه، فيهدر وحده 0.758 بت من المتوسط. ولاحظ أن هذا ليس الرمز الأسوأ تقديرًا عند النموذج، بل الرمز الخاطئ والشائع معًا.

هـ. لماذا تُدرَّب المصنِّفات على الإنتروبيا المتقاطعة

هنا تستحق النظرية مكانها. يُخرج المصنِّف توزيعاً احتمالياً على التسميات؛ والحقيقة الأرضية أيضاً توزيع - عادةً بكل الكتلة على تسمية واحدة. وتدريب النموذج يعني جعل توزيعه يطابق التوزيع الحقيقي، والإنتروبيا المتقاطعة هي بالضبط الكمية التي تقيس الفجوة. ويقولها شولّيه مباشرة: الإنتروبيا المتقاطعة كمية من نظرية المعلومات تقيس المسافة بين التوزيعات الاحتمالية، وهنا بين توزيع الحقيقة الأرضية وتنبّؤات النموذج، وهي عادةً الاختيار الصحيح حين يُخرج النموذج احتمالات.

ومع حقيقة أحادية على الفئة cc، تتلاشى كل الحدود إلا واحداً وتصير خسارة ذلك المثال مجرّد

−log⁡q(c),-\log q(c),

أي المفاجأة المسنَدة إلى الإجابة الصحيحة. فالثقة مع الصواب لا تكاد تكلّف شيئاً؛ والثقة مع الخطأ تكلّف كثيراً. وذلك اللاتماثل - الذي يوفّره اللوغاريتم لا إضافة لاحقة - هو ما يجعل الإنتروبيا المتقاطعة إشارة تدريب أفضل من الدقة، التي تكون مسطّحة في كل مكان تقريباً ولا تعطي النزول التدرّجي ما ينزل عليه.

وهذا هو الاستدلال نفسه الذي يبرّر هدف خسارة اللوغاريتم في الانحدار اللوجستي والتصنيف: فالخسارة ليست دالة مريحة اعتباطية، بل هي المفاجأة المتوقّعة لاعتقادات النموذج تحت التوزيع الحقيقي.

والإنتروبيا نفسها تقيس أيضًا ما تستطيع قناة ذات ضجيج أن تحمله، وهنا يذهب الشكل أدناه خطوة أبعد من هذه المقالة. إنه قناة ثنائية تقلب كل بتّ باحتمال ff، وسعتها 1−B(f)1 - B(f) بتّ لكل استعمال. اضبط احتمال القلب على 0.1 لتقرأ 0.5310، وعلى 0.5 لتقرأ صفرًا تمامًا، ثم تجاوزه وانظر السعة تعود صاعدة، لأن قناة تكذب دائمًا يمكن عكسها. أما اللوحة الثانية فمثال مستقلّ: بتّان متوازنان وهدف هو «أو» الحصري لهما، حيث يحمل كل مدخل وحده 0 بتّ بالضبط عن الهدف ويحمل الزوج بتًّا واحدًا. ومزلاج المعالجة يمرّر المخرج عبر قناة ثانية على التوالي: قلبها المركّب f(1−g)+g(1−f)f(1-g) + g(1-f)، وهو لا يكون أقرب إلى اليقين من ff أبدًا، فلا يمكن للمعلومة أن ترتفع.

تفاعلي: ماذا تحمل القناة، وماذا لا تستعيده أبدًا

حساب مضبوط من التوزيع المشترك. ولا معاينة في أي موضع.

1 bit0.5
بتّات لكل استعمال
0.5310
بعد المعالجة
0.3199
ما ضاع بالمعالجة
0.2111
القلب المركّب
0.1800

قناة تقلب باحتمال 0.10 تصيب 90% من الوقت، ولا تحمل مع ذلك إلا 0.5310 بتّ لكل استعمال؛ فالإصابة والمعلومة ليستا عملةً واحدة. والآن أمرِر الخرج عبر قناة ثانية عند 0.10: يصير القلب المركّب 0.1800 ويبقى 0.3199 بتّ. لقد هبط، وسيهبط دائمًا: تلك متباينة معالجة البيانات.

الخلاصات الأساسية

  • الإنتروبيا H(V)=−∑kP(vk)log⁡2P(vk)H(V) = -\sum_k P(v_k)\log_2 P(v_k) هي المفاجأة المتوقّعة، مقيسةً بـالبتّات؛ والأساس 2 يجعلها متوسط عدد أسئلة نعم/لا.
  • العملة المتوازنة 11 بت بالضبط، والنرد الرباعي المتوازن 22 بت، وعملة الـ99٪ نحو 0.080.08 بت، والنتيجة اليقينية 00.
  • مكسب المعلومات هو انخفاض الإنتروبيا المتوقّع من اختبار؛ وقسمتنا نقلت 11 بت إلى 0.80430.8043، بمكسب 0.1957 بت.
  • يسمّي التعلّم الإحصائي معيار الشجرة −∑p^log⁡p^-\sum \hat p \log \hat p «إنتروبيا متقاطعة»؛ وتسمّيه نظرية المعلومات إنتروبيا. الصيغة نفسها، والاسمان مختلفان، والالتباس حقيقي.
  • الإنتروبيا المتقاطعة H(p,q)=−∑plog⁡qH(p,q) = -\sum p \log q تقيّم اعتقاداً qq مقابل حقيقة pp، وتتفكّك إلى H(p)+KL(p∥q)H(p) + \text{KL}(p \| q) - لايقين غير قابل للتقليص زائد عقوبة الخطأ.
  • تباعد KL غير متناظر وغير محدود؛ وهو ليس مسافة.
  • تصغير الإنتروبيا المتقاطعة هو تصغير KL عن الحقيقة، ولهذا كانت خسارة التصنيف المعيارية.

ما التالي

تقيس الإنتروبيا اللايقين داخل نموذج احتمالي. وثمّة تقليد آخر يمثّل المعرفة بعبارات صادقة أو كاذبة ببساطة، ويستدلّ على ما يلزم عنها - المنطق وتمثيل المعرفة.

المراجع والقراءات الإضافية

  • Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· مكتبة مراجع Kudos AI
  • François Chollet, Deep Learning with Python, Manning (2nd edition, MEAP), 2020· مكتبة مراجع Kudos AI

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 3 دقيقةأسس الاحتمالات

أيّ توزيع خاطئ تريد؟

هدفٌ ثنائي المنوال، وغاوسيّة واحدة، واتّجاهان للتباعد نفسه. تصغير KL(P||Q) يمدّ الغاوسيّة على المنوالين بلا كتلة تُذكر حيث يقيم الهدف فعلًا؛ وتصغير KL(Q||P) يضعها على منوال واحد عند 0.6931 نات، وهي ln 2 حتى أربعة أرقام عشرية لا مصادفة. وكل مواءمة يحكم عليها المعيار الآخر بالكارثة: 2.0976 مقابل 15.2799.

تعلّم الآلةالرياضيات
قراءة 5 دقيقةInformation Theory

الحدّ الذي يُبلَغ فعلاً

العشوائية المعلوماتية ليست ملخّصاً لتوزيع بل أرضية يبلغها أفضل ترميز إلى آخر منزلة عشرية، والزيادة المدفوعة ثمناً للتوزيع الخاطئ هي بالضبط الخسارة التي يصغّرها كلّ مصنّف أصلاً، والمعلومة المتبادلة تضع سقفاً صلباً على كلّ ما يلي المستشعر. ثلاث نتائج، كلّ واحدة أحدّ من المعتاد.

الرياضياتتعلّم الآلة
قراءة 2 دقيقةأسس الاحتمالات

السمتان اللتان تبدوان ضجيجًا

متغيّرٌ يحدّد آخر بارتباط قدره 0.0000000000 بالضبط، وزوجُ سماتٍ كل معلومة متبادلة ثنائيّة بينهما وبين الهدف تساوي صفرًا بالضبط بينما يحدّدانه معًا تمامًا. والغربلة أحاديّة المتغيّر تطرح الاثنتين، والحالة الثانية هي المهمّة: فالسمات التي تحذفها تُحذف لأنّها مهمّة.

تعلّم الآلةالرياضيات
← العودة إلى كل المقالات