الخطوة، وحافة الاستقرار
ما الذي تصغّره خطوة التدرّج، ولماذا يكون تدرّج الدفعة الصغيرة هو التدرّج الكامل زائد ضجيج لا تدرّجًا آخر، وحجم الخطوة الذي فوقه يتوقف الانحدار عن الانحدار.
كل نموذج في هذا الموقع يُلاءم بالطريقة نفسها. الانحدار الخطي، والانحدار اللوجستي، والشبكة العصبية، والمحوّل: كلٌّ منها يكتب رقمًا يقول كم هو مخطئ الآن، ويسأل في أي اتجاه ينزل هذا الرقم، ثم يتحرّك. النموذج يتغيّر؛ أما الحلقة فلا.
والذي يتغيّر، والذي يحسم أتأخذ الحلقة أربعين خطوة أم تنفجر في ثلاث، هو الهندسة المحيطة بها. وهذا الدرس عن أصغر جزء من تلك الهندسة: خطوة واحدة.
ما الذي تصغّره الحلقة
يصغّر التدريبُ الخطر التجريبي - أي متوسط الخسارة على البيانات المتاحة:
وأمثلة هذا المسار كلها تستعمل مسألة مربعات صغرى بـ نقطة ووسيطين، لأن كل شيء فيها يُحسب بالضبط ويُقارن بما تدّعيه النظرية. خسارتها ، ومصغّرها ، والخسارة عنده . ومعرفة الجواب سلفًا هي المقصد: فهي تحيل كل دعوى أدناه قياسًا.
تدرّج الدفعة الصغيرة هو التدرّج الكامل زائد ضجيج
حساب يعني لمس الأمثلة كلها. أما الدفعة الصغيرة ذات الحجم فتلمس منها وتأخذ متوسطها:
ولأن عيّنة منتظمة، فإن بالضبط. ويستحق هذا عنايةً في الصياغة، لأن الاعتقاد البديل - أن الدفعة الصغيرة تشير إلى وجهة مختلفة منهجيًا - يقود إلى استنتاجات خاطئة عن حجم الدفعة.
عند نقطة الأصل يساوي التدرّج الكامل (−3.416495, 0.179597). ومتوسط 20٬000 دفعة صغيرة مستقلة عند النقطة نفسها يعطي:
| حجم الدفعة | خطأ المتوسط | الحجم المعتاد للضجيج |
|---|---|---|
| 8 | 0.032 | 1.4382 |
| 32 | 0.012 | 0.7052 |
| 128 | 0.002 | 0.3027 |
العمود الأول يتقلّص نحو الصفر لأنه بقيّة مونت كارلو في المتوسط لا تحيّز. أما العمود الثاني فهو الحكاية الحقيقية: ستة عشر ضعف الدفعة يشتري ضعف الدقة، قريبًا من الذي يتنبأ به متوسط سحبات مستقلة. والزيادة البالغة 19٪ فوق 4 ليست ضجيجًا: فهذه الدفعات تُسحب بغير إرجاع من نقطة فحسب، وعامل المجتمع المنتهي يقلّص دفعةً من 128 أكثر بكثير من دفعةٍ من 8. وذلك يتنبأ بـ، أما السحب بإرجاع، وهو المستقلّ حقًا، فيعطي 3.89 بدلًا من ذلك. وهذا التبادل هو سبب استعمال التدريبات دفعاتٍ صغيرة وخطواتٍ كثيرة بدل العكس. فالحساب يشتري الدقة بالجذر، ويشتري الخطوات خطيًا.
العامل (1 − ηλ)
وأما الخطوة نفسها: قرب الصغرى تشبه الخسارة وعاءً تربيعيًا، وشكل ذلك الوعاء هو الهسّيان . اكتب الخطأ ؛ فخطوة تدرّج بمعدّل تعطي
حلّل على متجهات الذاتية. فكل مركّبة تُضرب ببساطة في ، حيث انحناء ذلك الاتجاه، والاتجاهات لا تتفاعل البتة. فالخطوة الواحدة ليست حركةً واحدة؛ بل هي من الانكماشات المستقلة بعددِ اتجاهات الانحناء، كلٌّ بمعدّله.
ولا تنكمش المركّبة إلا حين ، أي بالضبط . وكل اتجاه يجب أن ينكمش، فالقيد الحاكم هو أشدّها:
الجرف، مقيسًا
في هذه المسألة ، فالعتبة . تنفيذان من نقطة البدء نفسها، مئتا خطوة لكلٍّ منهما:
| حجم الخطوة | كمضاعف لـ2/L | الخسارة بعد 200 خطوة |
|---|---|---|
| 1.124600 | 0.99 | 0.236592 |
| 1.147319 | 1.01 | 23585.65 |
تغيّرٌ بنسبة اثنين في المئة في الخطوة يفصل تنفيذًا متقاربًا عن آخر يبعد خمس مراتب عشرية. وليس هذا تدهورًا لطيفًا بمنطقة رمادية في الوسط؛ بل هو تغيّر إشارة في ، وما إن يهبط ذلك العامل دون حتى يتضخّم أشدّ الاتجاهات انحناءً بعامل ثابت في كل خطوة إلى الأبد.
وصورة هذا العملية مألوفة لكل من رأى منحنى خسارة يصير NaN خلال بضع عشرات من
الخطوات بعد تغيير في معدّل التعلّم بدا بريئًا. لم يكن شيء غير مستقر ثم صار غير
مستقر؛ بل عبَر التنفيذ عتبةً كانت قائمة منذ البداية.
تفاعلي: الخطوة، وحافة الاستقرار
η = 0.6816، والجرف عند 2/L = 1.1360.
- الانكماش في الخطوة
- 0.949667
- خطوات لست منازل
- > 260
- الجرف عند 2/L
- 1.1360
ست منازل بعيدة المنال في 260 خطوة عند هذا الضبط. وعدد الشرط 23.8410 - استطالة معتدلة، في مسألة ذات وسيطين - وهو وحده يحدّد المعدّل. ارفع β فيلغى التعرّج عَرض الوادي بينما يتراكم الزحف في اتجاهه، وتهبط التبعية من κ إلى √κ.
المستقر غير الأسرع
معرفة لا تعني وضع . فالاستقرار والسرعة مسألتان منفصلتان، ولهما جوابان مختلفان.
ينكمش الخطأ بمقدار في الخطوة، حيث أكثر الاتجاهات استواءً. ورفع يسرّع الاتجاه المستوي ويبطئ الحادّ، فأفضل خطوة حيث تلتقي الكلفتان:
هنا ، فيكون - وهو دون عتبة التباعد بوضوح. وكل حجم خطوة بين و هو أبطأ وأقرب إلى الجرف.
وتلك الصيغة تستحق التحقق لا الثقة. فتشغيل الـ200 خطوة نفسها عند كل من 2000 حجم خطوة وأخذ ما ينتهي أقرب إلى يعطي أمثلًا تجريبيًا قدره 1.088582 مقابل 1.090230 المشتقّ - توافق في حدود . وهذه الفجوة الصغيرة ليست من الشبكة: ففي 200 خطوة فقط تقع أفضل خطوة دون الأمثل المقارب بقليل، وتقترب منه كلّما طال التنفيذ. فبين الاشتقاق والبحث على شبكة ثلاثة أسطر، والشبكة تلتقط أخطاء الإشارة التي يخفيها الجبر.
ما لم يفسّره هذا بعد
حقيقتان تتجاوران بضيق. أفضل خطوة في هذه المسألة نحو 1.09، و يساوي 0.074 - فالاتجاه الأكثر استواءً لا يتحرك إلا بمقدار من خطئه الباقي في الخطوة، حتى عند المعدّل الأمثل. وهذه النسبة، لا حجم الخطوة، هي ما يجعل التدريب بطيئًا، ولها اسم وعلاج.
الاسم هو عدد الشرط، والعلاج هو الدرس التالي.
المراجع والقراءات الإضافية
- Ian Goodfellow, Yoshua Bengio, Aaron Courville, Deep Learning, MIT Press (Adaptive Computation and Machine Learning), 2016المصدر ↗
- Stephen Boyd, Lieven Vandenberghe, Convex Optimization, Cambridge University Press, 2004المصدر ↗
تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.
افتح المسار كاملًا
هذا الدرس الأول مجاني. سجّل لتخوض اختبار الإتقان وتكسب نقاط الخبرة وتفتح جميع الوحدات، مع مزيد من الأمثلة التفاعلية القابلة للتشغيل.