وسيط واحد، وسعة لا نهائيّة
مصنّف بوسيط حقيقي واحد يحقّق جميع الوسوم الـ1,048,576 لعشرين نقطة في كل مرّة، ثم يتنبّأ بالنقطة الحادية والعشرين بدقّة 0.5038 على عشرين ألف تجربة. فعدّ الوسائط لا يحدّ سعة صنف النماذج من أعلى ولا من أسفل، ولهذا وجب قياس السعة بطريق آخر.
المتطلبات المسبقة: لماذا ينجح التعلّم من البيانات أصلاً
إليك مصنّفًا. يأخذ عددًا حقيقيًّا ، وله وسيط حقيقي واحد ، ويتنبّأ بـ
وسيط واحد. أقلّ ممّا لمستقيم يمرّ بالمبدأ في بعدين، وهو عادةً الطرف الرخيص من المقياس.
ضع عشرين نقطة عند من أجل ، وأعطه أيّ وسم شئت لتلك النقاط. عددها . وقيمة واحدة لـ تحقّق كلًّا منها، وقد فُحص ذلك استقصاءً.
أ. كيف يفعل ذلك
الحيلة أنّ لا يُستعمل مقبضًا يُدار، بل يُستعمل شريطًا يُسجَّل عليه.
خُذ الوسوم ، كلٌّ منها ، وضَع
عندئذٍ يقتطع النشر الثنائي لـ ابتداءً من الخانة ، وتقرأ إشارةُ الجيب البتَّ المكتوب هناك. فكل وسم يحتلّ خانته الثنائيّة، ولا يتصادم شيء، لأنّ النقاط اختيرت متباعدةً بأوكتاف.
والعدد الحقيقي يسع بتّاتٍ لا تُحصى. فليس ثمّة يتوقّف عنده هذا، ومن ثَمّ يفتّت الصنف مجموعاتٍ من كل حجم منتهٍ، وبُعده بالمعنى الفابنيكي-تشيرفونينكيسي لا نهائي.
ب. وهو لا يتعلّم شيئًا
وائم العشرين نقطة بوسوم عشوائيّة، ثم اسأله عن نقطة حادية وعشرين عند ، موسومة عشوائيًّا هي الأخرى. على 20,000 تجربة: دقّة تدريب 100% في كل مرّة، ودقّة خارج العيّنة 0.5038.
وهذا بالضبط ما يعنيه «البُعد اللانهائي» عمليًّا. فالوسوم العشرون تثبّت أوّل عشرين بتًّا من ولا تقول شيئًا البتّة عن البتّ الحادي والعشرين، فيكون التنبّؤ على نقطة جديدة رميةَ عملة. للنموذج ذاكرة تامّة وتعميم معدوم، والحدود المستقلّة عن التوزيع تمتنع عن قول أيّ شيء عنه، وهي محقّة.
وإلى هنا فالأمر طرفة. والجدير بالحفظ هو أثرها في عدّ الوسائط.
ج. عدد الوسائط ليس حدًّا أعلى
القراءة الطبيعيّة لـ«وسيط واحد» هي «لا يسع هذا الصنف أن يعبّر عن كثير». ويقول المصنّف الجيبي إنّ تلك القراءة خاطئة ببساطة. فالسعة تتعلّق بعدد الوسوم المتمايزة التي يستطيع صنفٌ إنتاجها على عيّنة منتهية، وعدد الوسائط لا يقيّدها إلّا حين تُستعمل الوسائط كما نتوقّع: على نحو متّصل، وموضعي، واتّجاه تغيّر واحد لكلٍّ منها.
والفواصل الخطّيّة في بُعدها ، فيصمد الحدس هناك ويسوء تعميمه فيما وراء ذلك. فعددٌ حقيقي واحد قد يحمل مجموعة تدريب بأكملها.
وللمقارنة، يعرض الشكل صنفًا بوسيطين سعته محدودة فعلًا: فمع فترة واحدة على ثلاث نقاط يبلغ 7 من الوسوم الثمانية، ولا يستطيع إنتاج (1, 0, 1).
تفاعلي: ابحث عن التسمية التي لا تستطيع إنتاجها
انقر نقطةً لتقلب تسميتها.
- هذه التسمية
- قابلة
- التسميات القابلة للتحقيق
- 7 / 8
- بُعد VC
- 2
قابلة، والفترة المرسومة حول الآحاد هي الفرضية المحقِّقة لها. واصل: 1 من التسميات الثماني لا يمكن إنتاجها البتة. حاول أن تجد واحدة قبل أن تضغط الزر.
د. وليس حدًّا أدنى أيضًا
والاتّجاه العكسي يفشل كذلك، وهو الذي يهمّ عمليًّا.
أضف شرط هامش إلى الفواصل الخطّيّة: أن تصنّف تصنيفًا صحيحًا مع بقاء كل النقاط على بعد على الأقلّ من الحدّ، والبيانات داخل كرة نصف قطرها . عندئذٍ تُحدّ سعة ذلك الصنف المقيَّد بـ أيًّا كان البعد. ادفع إلى اللانهاية، وهو ما تفعله النواة، فلا يتزحزح ذلك الحدّ: إذ أزال القيدُ كلَّ الدوالّ التي كان بوسع الوسائط أن تعبّر عنها تقريبًا، وما بقي يحكمه مقياس لا عدد.
والشبكات الحديثة هي الظاهرة نفسها على نطاق أوسع. فوسائطها أكثر من أمثلة تدريبها، فيضع العدُّ سعتها فوق ، ويصير كل حدٍّ كلاسيكي مبنيّ عليه فارغًا. ومع ذلك تعمّم. فالوسائط ليست حرّةً في أخذ قيم عشوائيّة: بل يبلغها مُحسِّن بعينه، من تهيئة بعينها، تحت اضمحلال الأوزان والإيقاف المبكر وتوسيع البيانات، ومجموعةُ الدوالّ التي يمكن بلوغها فعلًا بهذا الطريق أصغر بكثير ممّا يسع المعماريّة أن تعبّر عنه.
هـ. ماذا نقيس بدلًا من ذلك
إن كان العدّ لا يحدّ السعة في أيّ من الاتّجاهين، فالخيارات الأمينة تجريبيّة.
- حاول مواءمة وسوم عشوائيّة. فإن بلغ نموذجٌ خطأ تدريب صفرًا على المدخلات نفسها بعد خلط الوسوم، فسعته الفعليّة على تلك العيّنة على الأقلّ، وعلى أيّ تفسير لأدائه الحقيقي أن يأتي من غير حجم صنف الفرضيّات.
- قِس الهامش، وقِس المعيار. ففي الأصناف التي يوجد لها حدّ، يكون المقدار الوارد فيه مقياسًا لا عددًا: للفواصل، ومعايير الأوزان للشبكات. وهذه أشياء يمكن حسابها بعد التدريب.
- احجز عيّنة، واحجزها حقًّا. فتقدير التحقّق قياس مباشر لما تحاول الحدود حدَّه، وهو يبقى مقياس السعة الوحيد المتاح دائمًا.
- ارتب في أيّ دعوى عن السعة تُقال قبل التدريب. فالمصنّف الجيبي يبعد سطرًا واحدًا من الشيفرة عن أن يبدو أبسط نموذج في الدنيا.
السعة خاصّيّةٌ لما تستطيع الإجراءات بلوغه فعلًا، لا لعدد الأعداد التي تخزّنها.
المراجع والقراءات الإضافية
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗
- Ian Goodfellow, Yoshua Bengio, Aaron Courville, Deep Learning, MIT Press (Adaptive Computation and Machine Learning), 2016المصدر ↗
تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.