تخطّي إلى المحتوى
Kudos AI
Read in English
Statistical Inference

ما تستطيع العيّنة أن تقوله لك وما لا تستطيع

المقدّرات بوصفها متغيّرات عشوائية لها توزيعاتها الخاصّة، والحالة التي يكون فيها المقدّر غير المتحيّز هو الأسوأ، وما يعد به مجال الثقة فعلاً والمجال المعتاد الذي يسلّم 87% حيث يعلن 95%، وما تكون القيمة p احتمالاً له - وكلّ رقم محسوب بدقّة أو بمحاكاة ببذرة معلنة.

قراءة 8 دقيقةKudos AI

المتطلبات المسبقة: Probability and Statistical Foundations

توزيع معاينة يتراكم تقديراً بعد تقدير، ومجالات ثقة تتكدّس بينما تُخطئ نسبة ثابتة منها القيمة الحقيقية، وقيمة p تنبثق بوصفها مساحة ذيل تحت توزيع الفرضية الصفرية.

كلّ ما ستقرأه تقريباً من مادّة كمّية يقوم على حركة واحدة: قاس أحدهم أشياء قليلة ثمّ قال شيئاً عن الأشياء الكثيرة التي لم يقِسها. تجربة على 200 مريض تصير دعوى عن علاج. واستطلاع لألف ناخب يصير رقماً في نشرة الأخبار.

تلك الحركة هي الاستدلال، وليست سحراً. لها قواعد، ولها كلفة، وفيها ثلاثة مواضع تُصاغ عندها الخلاصة عادةً أقوى ممّا يسمح به الحساب. وهذا المقال يمرّ على تلك الثلاثة، وكلّ رقم فيه حُسب قبل أن يُكتب - بدقّة حيث يوجد جواب دقيق، وبمحاكاة ببذرة معلنة حيث لا يوجد.

التقدير نفسه شيء عشوائي

لنبدأ بالفكرة التي تجعل الباقي ممكناً. حين تحسب متوسّطاً من عيّنة، فذلك المتوسّط ليس حقيقة عن العالم؛ إنّه حقيقة عن عيّنتك. اسحب عيّنة أخرى تحصل على رقم آخر. فللتقدير إذن توزيع خاصّ به، وفهم الاستدلال يعني التفكير في ذلك التوزيع لا في الرقم الواحد الذي وقع لك.

ويصفه أمران. التحيّز هو ما إذا كان المقدّر متمركزاً على الحقيقة - أي هل يقع، متوسَّطاً على كلّ العيّنات التي كان يمكن أن تسحبها، على الجواب الصحيح. والتباين هو كم يتأرجح من عيّنة إلى أخرى.

والمثال الكلاسيكي هو صيغة التباين. فإن قِست تشتّت بياناتك حول متوسّط العيّنة وقسمت على nn، حصلت على جواب أصغر ممّا ينبغي بصورة منهجية - بالعامل الدقيق (n−1)/n(n-1)/n، أي تسعة أعشار عند n=10n = 10. والسبب يستحقّ وقفة: متوسّط العيّنة هو، بحكم البناء، النقطة الأقرب إلى بياناتك. فقياس التشتّت منه يقلّل من التشتّت حول المتوسّط الحقيقي، وهو في موضع آخر. والقسمة على n−1n-1 تعيد بالضبط ما أُنفق في تحديد المركز.

ومحاكاة 400,000 عيّنة من الحجم 10 من مجتمع طبيعي تباينه 4 تؤكّد ذلك: صيغة 1/n1/n تتوسّط 3.6009553.600955 مقابل تنبّؤ 3.63.6، وصيغة 1/(n−1)1/(n-1) تتوسّط 4.0010624.001062.

حيث يتبيّن أنّ «غير المتحيّز» أسوأ

هنا الجزء الذي يُتخطّى عادةً، وهو النصف الأنفع.

الإصابة في المتوسّط ليست هي القرب. والمقياس الطبيعي لـ«القرب» هو الخطأ التربيعي المتوسّط، وهو ينحلّ بالضبط إلى مربّع التحيّز زائد التباين. وعلى العيّنات الـ400,000 نفسها:

  • المقدّر المتحيّز 1/n1/n خطؤه التربيعي المتوسّط 3.0456653.045665
  • والمقدّر غير المتحيّز 1/(n−1)1/(n-1) خطؤه 3.5634933.563493

فالمقدّر غير المتحيّز هو الأسوأ، وليس بفارق يسير. وليست هذه آثار محاكاة - فالقيمتان الدقيقتان لمجتمع طبيعي هما σ4(2n−1)/n2=3.04\sigma^4(2n-1)/n^2 = 3.04 و2σ4/(n−1)=3.5555562\sigma^4/(n-1) = 3.555556، والمحاكاة تقع على بُعد أقلّ من ربع بالمئة من كلٍّ منهما. فالقسمة على العدد الأكبر تقلّص كلّ تقدير قليلاً نحو الصفر، والتباين الذي يشتريه ذلك يفوق التحيّز الذي يكلّفه.

هذه هي مبادلة التحيّز والتباين في أنقى صورها، وهي سبب كون الطرق التي تُدخل تحيّزاً عن عمد - انحدار الحرف، والتقليص، وكلّ التنظيم تقريباً - تحسينات لا تنازلات.

ونتيجة أخرى لهذا التوزيع: عرضه ينكمش كـ1/n1/\sqrt{n}. فمع انحراف معياري للمجتمع قدره 2 يكون الخطأ المعياري للمتوسّط 0.40.4 عند n=25n = 25 و0.20.2 عند n=100n = 100. أي إنّ تنصيف ريبتك يكلّف أربعة أضعاف البيانات. وهذه الحقيقة وحدها تحكم ميزانية كلّ دراسة صُمّمت يوماً.

لهذه الأرقام الأربعة جميعًا صيغ مغلقة، فالشكل أدناه يحسبها بدل محاكاتها: 3.6 و4 للوصفتين وسطيًا، و3.04 و3.5556 لخطأيهما التربيعيين. وسحبُ حجم العيّنة يحسم ما يقوله هذا القسم عند حجم واحد فقط: فمع بيانات طبيعية تكون الوصفة المتحيّزة أقرب عند كل n، لأن (2n-1)(n-1) أصغر من 2n تربيعًا مهما كان n، ويتلاشى تفوّقها كلّما كبرت العيّنة.

تفاعلي: الوصفة الخاطئة والأقرب مع ذلك

صيغ مغلقة في كل شيء. والدرس يحاكيها، وهي لا تحتاج محاكاة.

320
القسمة على n، وسطيًا
3.6000
القسمة على n - 1
4.0000
خطؤها التربيعي
3.0400
وخطأ الأخرى
3.5556
(n - 1)/n = 0.900

القسمة على n تستعيد وسطيًا 3.6000 من تباين حقيقي قدره 4، أي 10 - 1 على 10 بالضبط. والقسمة على n - 1 تعيد درجة الحرية فتقع على 4 تمامًا. ومع ذلك فالوصفة المتحيّزة أقربُ: خطؤها التربيعي 3.0400 مقابل 3.5556، موزّعًا على تحيّز -0.4000 وتشتّت 2.8800. وحرّك n فلن ينقلب الترتيب عند أي حجم.

ما يعد به مجال الثقة فعلاً

الرقم المفرد يخفي دقّته، فنورد مدىً بدلاً منه. ووعد مجال الثقة بنسبة 95% دقيق، وليس هو الوعد الذي يردّده أكثر الناس.

الوعد يخصّ الإجراء: ابنِ مجالات هكذا، عيّنةً بعد عيّنة، فتحتوي 95% منها القيمة الحقيقية. وليس قولاً عن المجال الذي على شاشتك. فما إن تُجمع البيانات وتثبت الأرقام حتى يصير مجالك محتوياً للحقيقة أو غير محتوٍ لها - ولا يبقى شيء غير مؤكّد. والقول «هناك احتمال 95% أن تكون القيمة الحقيقية هنا» يعامل مجهولاً ثابتاً كأنّه عشوائي.

يبدو التمييز تنطّعاً حتى ترى ما يحدث حين يكون الإجراء خاطئاً قليلاً.

طريقتان تُخفق بهما الوصفة المعتادة

استعمال الكمّ الخطأ. حين لا تعرف تشتّت المجتمع وتضطرّ إلى تقديره من العيّنة الصغيرة نفسها، يكون هناك مصدرا ريبة، ولا يغطّي 1.9599641.959964 المألوف من التوزيع الطبيعي إلّا أحدهما. فعند n=10n = 10 يغطّي المجال المبنيّ به الحقيقةَ 0.9183510.918351 من الوقت لا 0.950.95. وهذا الرقم دقيق لا مُحاكى مع مجتمع طبيعي؛ أمّا مع البيانات الشديدة الالتواء فكلا الكمّين تقريب. وتوزيع ستيودنت موجود تحديداً لتصحيح ذلك، وكمّه عند 9 درجات حرّية هو 2.2621572.262157 - أوسع بوضوح. وعند 29 درجة حرّية يكون قد هبط إلى 2.0452302.045230.

تحجيم العرض من الزلّة نفسها. المجال المعتاد لنسبة أسوأ، وهو يُخفق على نحو مفيد. ولمّا كان للتوزيع ذي الحدّين عدد منتهٍ من الحالات، أمكن حساب تغطيته بدقّة بتعدادها كلّها. عند n=50n = 50:

pp الحقيقيةالمجال المعتادمجال ويلسون
0.050.9198670.962224
0.100.8789170.970308
0.200.9375310.950701
0.500.9350910.935091

فعند p=0.1p = 0.1 تكون الـ95% المعلنة في الحقيقة 87.9%. والآليّة أنّ العيّنة سيّئة الحظّ نفسها تزيح المركز وتخطئ في تحجيم العرض، فيتعاضد الخطآن بدل أن يتقاصّا.

وعند p=0.01p = 0.01 ينهار تماماً، فيغطّي 0.3948480.394848. والسبب صارخ: 0.6050060.605006 من عيّنات الخمسين لا تتضمّن أيّ نجاح، وحين يكون التقدير صفراً يكون الخطأ المعياري المقدَّر صفراً كذلك، فيؤول المجال إلى النقطة 00 - التي تُخطئ.

الجزء الذي ينبغي أن ينهي قواعد الإبهام

قد ترجو أن تكون قاعدة «افحص np>5np > 5» حاميةً من هذا. وليست كذلك، لأنّ التغطية لا تتحسّن بسلاسة مع تراكم البيانات. وعند p=0.2p = 0.2 كذلك، يغطّي المجال المعتاد:

  • 0.9512140.951214 عند n=23n = 23
  • 0.8728620.872862 عند n=24n = 24

فمشاهدة واحدة إضافية تكلّف نحو ثماني نقاط من التغطية. وهنا npnp يساوي 4.6 ثمّ 4.8، فكانت القاعدة ستنبّه على الحجمين كليهما، لكنّها تُجيز n=32n = 32 (np=6.4np = 6.4)، حيث تهبط التغطية مع ذلك ست نقاط عن n=31n = 31، من 0.9498350.949835 إلى 0.8901910.890191. وتهبط التغطية من حجم إلى الذي يليه في 29 من الخطوات الـ180 بين 20 و200: أغلب هذه الهبوطات بين نقطة وثلاث نقاط، وثلاثة منها تتجاوز خمس نقاط. فللتوزيع ذي الحدّين بـn+1n+1 حالة مجموعة مجالات قابلة للتحقّق مختلفة تماماً حين يتغيّر nn، فتقفز التغطية حين تعبر حالات كاملة الحدَّ. ولا عتبة على nn تجعل المجال المعتاد آمناً، وهذه هي الحجّة الأمينة لاستعمال مجال أفضل.

الشكل أدناه يُجري هذا التعداد لكل أحجام العيّنات من 20 إلى 200 دفعةً واحدة. ولا شيء فيه محاكاة: فكل نقطة مجموع منتهٍ على النتائج n + 1. ابدأ عند n = 23 حيث يغطّي المجال الشائع 0.951 ويبدو سليمًا، ثم تقدّم خطوةً إلى 24 وانظر ثماني نقاط تتبخّر. ثم انتقل إلى p = 0.01 لترى الإخفاق في أوضح صوره، وإلى مجال ويلسون لترى ماذا يفيد أخذُ العرض من p لا من التقدير.

تفاعلي: التغطية التي يمنحها فعلًا مجال 95%

مضبوطة بالتعداد. فللتوزيع ذي الحدّين n + 1 نتيجة لا غير.

95%80%n = 20200
التغطية عند n
95.1%
النقص
0.0%
أحجام تتراجع
29
عيّنات بلا نجاح واحد
0.6%
القيمة الحقيقية p

عند n = 23 يمنح المجال الذي يعلن 95% تغطيةً قدرها 95.1%. وتأمّل الشكل: التغطية لا تزحف نحو الخط بل تعبره 29 مرة في هذا المدى وحده، وكل سنّ قيمةٌ إضافية يمكن للتقدير بلوغها. انقل n من 23 إلى 24 لترى ثماني نقاط تختفي بمشاهدة واحدة زائدة.

ما تكون القيمة p احتمالاً له

الفكرة الثالثة أكثرها إساءةً في القراءة، وسوء القراءة ناتج عن نسيان كيفيّة حسابها.

يبدأ اختبار الفرضيات بافتراض ما أنت في شكّ منه. لنفترض أنّه لا أثر هناك. ثمّ نسأل: لو كان ذلك صحيحاً، فكم مرّة تبدو بيانات لا تقلّ تطرّفاً عن بياناتي؟ ذلك الاحتمال هو القيمة p.

وكلّ شيء يتبع كون الافتراض قد وُضع أوّلاً. فالقيمة p لا يمكن أن تكون احتمال صحّة الفرضية الصفرية، لأنّ الحساب ثبّتها صحيحةً سلفاً. ومقدار مشروط بافتراض لا يكون كذلك احتمالاً عنه.

وتحت فرضية صفرية صحيحة تكون القيمة p منتظمة على [0,1][0,1]: كلّ القيم محتملة بالقدر نفسه. ومحاكاة 50,000 اختبار على عيّنات من 25 تحت فرضية صفرية صحيحة تعطي مسافة كولموغوروف-سميرنوف قدرها 0.0042990.004299 عن التوزيع المنتظم، مع وقوع 0.04990.0499 من القيم تحت 0.050.05. فقيمة 0.030.03 ليست أندر من 0.530.53؛ وإنّما تقع في منطقة أُعلن أنّها مثيرة للاهتمام.

القوّة هي التي تحدّد قيمة النتيجة الصفرية

المقدار الرفيق هو القوّة: احتمال إيجاد أثر موجود فعلاً. وهي مثبَّتة بالتصميم، قبل وجود أيّ بيانات، وهي دائماً قوّة في مواجهة حجم أثر محدّد. ولاختبار t ثنائي الطرف لعيّنة واحدة (أو لأزواج مترابطة) على nn مشاهدة، يبحث عن نصف انحراف معياري، محسوباً من توزيع ستيودنت اللامركزي:

nnالقوّة
100.293176
250.669708
500.933898
1000.998610

وبلوغ الـ80% المتعارف عليها يحتاج n=34n = 34. فدراسة من 25 تُبلغ عن «عدم وجود أثر دالّ» كانت ستفوّت أثراً حقيقياً بهذا الحجم ثلث الوقت. وبحثاً عن خُمس انحراف معياري تبلغ قوّة التصميم نفسه 0.1605040.160504 - أي إنّه يفوّته خمس مرّات من ستّ. فغياب الدليل ليس دليل غياب إلّا بمقدار القوّة.

لماذا قد تكون أكثر النتائج الدالّة خاطئة

فلنجمع الاثنين، دون أن يسيء أيّ اختبار التصرّف في أيّ موضع.

أجرِ 20 اختباراً مستقلاً على فرضيات كلّها صفرية. احتمال خروج واحد على الأقلّ دالّاً عند 0.050.05 هو 1−0.9520=0.6415141 - 0.95^{20} = 0.641514. ولم ينكسر شيء: كلّ اختبار يخطئ 5% من الوقت تماماً كما أُعلن، وعشرون فرصة تجعل ذلك مرجّحاً.

والأسوأ: لنفترض أنّ فرضية من كلّ عشر فقط صحيحة، بقوّة 0.80.8 وَα=0.05\alpha = 0.05. لكلّ 100 فرضية مختبَرة تجد الاختبارات 8 آثار حقيقية وتثير 4.5 إنذارات كاذبة من الـ90 الصفرية. ومن ثمّ

false discovery rate=0.9×0.050.1×0.8+0.9×0.05=0.36\text{false discovery rate} = \frac{0.9 \times 0.05}{0.1 \times 0.8 + 0.9 \times 0.05} = 0.36

أي إنّ أكثر من ثلث النتائج الدالّة خاطئ، بينما يعمل كلّ اختبار على حدة تماماً وفق مواصفته. والذي أحدث الضرر هو المعدّل القاعدي - كم من الفرضيات كان صحيحاً أصلاً. وعتبة بونفيروني 0.05/20=0.00250.05/20 = 0.0025 تعيد خطأ العائلة إلى 0.0488300.048830، وتدفع ثمن ذلك قوّةً في كلّ اختبار.

يعرض الشكل أدناه مئة فرضية على هيئة مربّعات، ويُجري عليها جميعًا التصميم الذي تختاره. والقوة ليست مؤشّرًا تحرّكه: بل تُحسب من حجم العيّنة ومن الأثر المطلوب عبر توزيع ستيودنت اللامركزي، فالمنحنى بجوار الشبكة هو الجدول أعلاه وقد سُدّت فجواته. قلّل معدّل الأساس تجد المربّعات الكهرمانية - وهي فرضيات عدمية عُدّت دالّة - تتفوّق على الخضراء، دون أن يُساء تطبيق شيء في أي موضع. ثم شدّد العتبة وراقب ثمن الحماية يُدفع من القوة.

تفاعلي: مئة فرضية، وكل اختبار يعمل بلا خلل

لا شيء هنا أُسيء تطبيقه. ومع ذلك، عُدّ المربّعات الكهرمانية.

مربّع واحد لكل فرضية مُختبَرة

صحيحة، ووُجدتصحيحة، وفاتتعدمية، وعُدّت دالّةعدمية، ولم تُعدّ
القوة
80.8%
معدّل الاكتشافات الزائفة
35.8%
دالّ وصحيح
64.2%
آثار حقيقية فائتة
1.9

القوة تجاه هذا الأثر، بحسب حجم العيّنة

0.00.50.81.0n = 34
مستوى الدلالة

من بين 12.6 نتيجة تَعدّها هذه الدفعة دالّة، هناك 4.5 زائفة، أي 35.8% منها. ولم يخطئ أي اختبار: فقد رُفضت كل فرضية عدمية بمعدّلها المعلَن تمامًا، ووُجد كل أثر حقيقي بالقوة التي اشتراها التصميم بالضبط. والجاني هو معدّل الأساس، وهو مقدار لا يظهر في أي من الاختبارات. ورفع القوة يساعد، لكن عبر البسط وحده: فهو لا يمسّ الإنذارات الكاذبة، التي يحدّدها مستوى الدلالة وعدد الفرضيات العدمية لا غير.

الخيط الجامع

تشترك الأفكار الثلاث في شكل واحد. فالتقدير والمجال والقيمة p كلّ منها جواب عن سؤال ضيّق محكم الصياغة، وكلّ منها يُقرأ عادةً على أنّه جواب عن سؤال أوسع يعني الناس أكثر.

التقدير يقول أين تشير البيانات، لا كم يبعد. والمجال يصف سلوك إجراء على المدى الطويل، لا حظّ مجالك في الإصابة. والقيمة p تقول كم ستكون البيانات مفاجئة لو لم يكن هناك شيء يجري، لا كم ينبغي أن تصدّق أنّ هناك شيئاً.

وقراءة كلّ منها على ما هو لا تكلّف شيئاً، وهي الفرق بين أن تستعمل الإحصاء وأن يستعملك.

مسار الاستدلال الإحصائي يشتغل على الثلاثة بالتفصيل، مع حسابات قابلة للتشغيل والتعديل داخل المتصفّح.

المراجع والقراءات الإضافية

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 3 دقيقةStatistical Inference

مجالُ الـ95% الذي يغطّي 81% من الوقت

لمجال الثقة المدرسي لنسبةٍ ما تغطيةٌ مضبوطة تُحسب بجمعٍ على العيّنات الممكنة وعددها n+1، وعند n = 30 وp = 0.10 تساوي 0.8085 لا 0.95. والتغطية لا تتحسّن باطّراد مع n، وفي سياق الأحداث النادرة قد تهبط إلى 0.0392. وبديلان من سطر واحد يصلحان ذلك.

الإحصاء
قراءة 3 دقيقةالاستدلال الاحتمالي

مئة ألف عيّنة، أربعمئة منها حقيقيّة

على شبكة السطو مع اتّصال الجارين معًا، تُبقي المعاينة بالرفض 183 سحبًا من 100,000، وتُبقي المعاينة بالترجيح بالأرجحيّة كلَّ السحوب بحجم عيّنة فعّال قدره 396. والتقديران يبتعدان نحو 10% عن احتمال بعدي قدره 0.284172، والسبب يُحسب بالضبط: 252 عيّنة تحمل 76% من الوزن و99.975% من مربّع الوزن.

الذكاء الاصطناعيالاحتمالات
قراءة 6 دقيقةExperimentation

التجربة التي كانت ستفوز على أيّ حال

تجربة بـ2000 مستخدم لكلّ ذراع تعرض آثاراً أكبر 2.4 مرّة ممّا ينبغي. وتجربة A/A تُراجَع عشر مرّات تخرج معنويةً 19٪ من الوقت. وعشرون متريكاً صفرياً مستقلّاً تنتج فائزاً 64٪ من الوقت، واثنتا عشرة شريحة صفرية 46٪. أربعة أرقام، وسبب واحد، والقرارات التي يجب اتّخاذها قبل وصول البيانات.

الإحصاءتعلّم الآلة
← العودة إلى كل المقالات