تخطّي إلى المحتوى
Kudos AI
Read in English
الشبكات العصبية

أبطأ اتّجاه هو الذي يحدّد الإيقاع

حجم الخطوة المسموح به يحدّده أشدّ الاتّجاهات انحدارًا، وعدد الخطوات اللازم يحدّده أكثرها استواءً، فتكون كلفة النزول الاشتقاقي نسبتهما. المواءمة نفسها بالمربّعات الصغرى، وحتى العشرة أرقام العشريّة نفسها، تحتاج 1742 خطوة في أساس، و147 في أساس مُعاد قياسه، وخطوة واحدة بالضبط في أساس متعامد متجانس، والزخم لا يسترجع إلّا الجذر التربيعي للنسبة.

قراءة 4 دقيقةKudos AI

المتطلبات المسبقة: ما الذي يجعل التدريب يتقارب حقًا

قصعة تربيعيّة ممدودة على أحد المحورين، ومسار الاشتقاق يتعرّج عبر الاتّجاه الضيّق بينما يزحف على المستوي، ثم النزول نفسه على قصعة مُعاد قياسها يبلغ القاع في جزء يسير من الخطوات.

لِنُوائم منحنًى تربيعيًّا لمئة نقطة بالنزول الاشتقاقي. ولا شيء غريب هنا: أعمدة مصفوفة التصميم هي 11 وtt وt2t^2 من أجل tt موزّعة بانتظام على [0,1][0, 1]، والخسارة خطأ تربيعي، والخطوة أفضل خطوة ثابتة لهذه المسألة، ويتوقّف التشغيل حين تصير الخسارة على بعد 10−610^{-6} من أدناها، نسبةً إلى موضع الانطلاق.

يستغرق ذلك 1742 خطوة.

والآن مركِز العمودين غير الثابتين وقِسهما. البيانات نفسها، والمواءمة نفسها، والأدنى نفسه. 147 خطوة.

والآن استبدل بالأعمدة الثلاثة أساسًا متعامدًا متجانسًا للفضاء نفسه، وهو ما يخرجه تحليل QR باستدعاء واحد. خطوة واحدة.

وتنتهي الثلاثة إلى الجواب نفسه. فمجاميع مربّعات البواقي متّفقة حتى عشر منازل عشريّة عند 0.19361963580.1936196358، والقيم المُوائَمة متّفقة في حدود 1.8×10−151.8 \times 10^{-15}، لأنّ الأسس الثلاثة تفرد الفضاء نفسه، والمربّعات الصغرى لا تبالي بأيّها تتلقّى. أمّا المُحسِّن فيبالي.

أ. من أين تأتي النسبة

في خسارة تربيعيّة هسيّتها HH، يحدّد كلَّ شيء قيمتان ذاتيّتان: الكبرى LL والصغرى mm.

فـLL يحدّ حجم الخطوة. خُذ خطوةً أكبر من 2/L2/L على امتداد المتّجه الذاتي الأشدّ انحدارًا فيتجاوز التكرار إلى موضع أسوأ ممّا بدأ منه؛ ويتباعد التشغيل.

وmm يحدّ التقدّم. فعلى امتداد المتّجه الذاتي الأكثر استواءً يكون الاشتقاق صغيرًا، فلا تنقلك خطوةٌ بالحجم المسموح به إلّا قليلًا.

أنت مُلزَم بخطوةٍ يحدّدها أشدّ الاتّجاهات انحدارًا، ثم عليك أن تقطع بها أكثرها استواءً. وبالخطوة الثابتة المثلى α=2/(L+m)\alpha = 2 / (L + m) ينقص الخطأ بعامل

κ−1κ+1,κ=Lm,\frac{\kappa - 1}{\kappa + 1}, \qquad \kappa = \frac{L}{m},

في كل خطوة، فيكون عدد الخطوات اللازم لدقّة معيّنة متناسبًا مع κ\kappa، أي عدد الشرط. ولا يظهر في ذلك شيء عن عمق القصعة. فقد تكون الخسارة هائلةً وسهلة، أو ضئيلةً وعسيرة.

وللتحقّق النظيف، خُذ تربيعيّةً ثنائيّة البعد قيمتاها الذاتيّتان 1 و100. تتنبّأ الصيغة بـ⌈log⁡10−6/log⁡(99/101)⌉=691\lceil \log 10^{-6} / \log(99/101) \rceil = 691 خطوةً لتقليص المسافة إلى الأمثل بعامل 10−610^{-6}. ويستغرق التشغيل 691. (وإن عددتَ على الخسارة خرجتَ بنصف ذلك، لأنّ الخسارة مربّع المسافة. والمعدّل يصف المسافة.)

ب. الأسس الثلاثة، مقيسة

عدد الشرط للتصاميم الثلاثة أعلاه، وكلفة كلٍّ منها:

الأساسκ\kappaالخطوات
1, t, t21,\ t,\ t^2504.541742
مركَّز ومَقيس60.81147
متعامد متجانس1.00001

والسطر الأوّل ليس تصميمًا شاذًّا. بل هو الطريقة البديهيّة لكتابة مواءمة تربيعيّة، على مجال مرتّب، بلا قيم شاذّة ولا خطّيّة مشتركة تُذكر. فالأعمدة 11 وtt وt2t^2 تشير ببساطة إلى اتّجاهات متقاربة على [0,1][0,1]: ثلاثتها موجبة ومتزايدة على معظم المدى، فتبتعد الهسيّة كثيرًا عن أن تكون مضاعفًا للمحايدة.

والسطر الأخير هو الحالة الحديّة الجديرة بالحفظ. فحين يكون κ=1\kappa = 1 تناسب الخطوة المسموح بها كلَّ الاتّجاهات دفعةً واحدة، ويبلغ النزول الاشتقاقي بـ α=1/L\alpha = 1/L أدنى التربيعيّة في خطوة واحدة. وكل التكرار في السطر الأوّل هو المُحسِّن يلتفّ حول اختيار إحداثيّات.

ج. ماذا يشتري الزخم وماذا لا يشتري

زخم الكرة الثقيلة يضيف التحديث السابق إلى الحالي. وعلى تربيعيّة، مضبوطًا على أفضل وجه، يكون معدّله المقاربي

κ−1κ+1,\frac{\sqrt{\kappa} - 1}{\sqrt{\kappa} + 1},

وهو ما يستبدل κ\sqrt{\kappa} بـκ\kappa في عدّ الخطوات. وعلى مسألة κ=100\kappa = 100 أعلاه يتنبّأ ذلك بـ69 خطوة مقابل 691 للنزول الاشتقاقي، ويقيس التشغيل 93 - أبطأ من الحدّ المقاربي لأنّ الحدّ يصف الذيل لا الطور العابر، لكنّه مع ذلك عامل 7.43 على المسألة نفسها وبقاعدة التوقّف نفسها.

يُفتح الشكل على عدد الحالة 23.841. اسحبه إلى 100 فيحتاج النزول الاشتقاقي البسيط 691 خطوة كما أعلاه، بينما يحتاج الزخم 90 خطوة من نقطة بداية الشكل مقابل 93 من النقطة المستعملة هنا: فعدد الخطوات يتوقّف على نقطة البداية، أمّا معدّلات التقارب فلا.

تفاعلي: ماذا يساوي الجذر التربيعي

كل طريقة بإعداداتها المثلى. والخطأ على محور لوغاريتمي.

11e-6
البسيط، خطوات حتى 1e-6
165
الزخم، خطوات
42
معدّل الزخم، المقارب
0.660021
معدّل الزخم، المقيس
0.677785

مسألة الدرس نفسها: 165 خطوة لستّ منازل مقابل 42، أي بمعامل 3.9 حيث تتنبّأ المعدّلات المقاربة بـ 4.9. والفجوة تستحقّ الإبقاء لا التمليس: فـ0.660021 نهايةٌ حدّية؛ أما المقيس بين الخطوتين 20 و60 فهو 0.677785، لأن ضبط بولياك يمنح كل اتجاه انحناء جذرًا مكرّرًا، والجذر المكرّر يخبو كـ t مضروبًا في المعدّل مرفوعًا إلى القوّة t. وهذا العامل يتلاشى ببطء، وهنا لا يجد وقتًا لذلك: تسبقه دقّة الآلة.

والجذر التربيعي هو المكسب كلّه، ويحسن الدقّة في معناه. فالزخم لا يصلح عدد الشرط؛ بل ينقل الكلفة من κ\kappa إلى κ\sqrt{\kappa}. وعلى κ=104\kappa = 10^4 هذا هو الفرق بين اليائس والبطيء، لا بين البطيء والسريع. وهو يُدخل كذلك وسيطًا فائقًا ثانيًا تتوقّف قيمته المثلى على κ\kappa، وأنت لا تعرفه.

أمّا إعادة القياس، حيثما أمكنت، فأفضل قطعًا: فهي تغيّر κ\kappa نفسه، وتكلّف مرورًا واحدًا على البيانات، ولا تحتاج ضبطًا.

د. لماذا نجد ذلك في كل مكان

ما إن تبحث عن النسبة بدل العمق حتى يكفّ كثير من الممارسات المعتادة عن أن يبدو فولكلورًا.

  • معيرة المدخلات عملُ تحسينٍ لعدد الشرط. فإعادة كتابة سمة من الكيلومترات إلى المليمترات تضرب عمودها في 10610^6 ومدخلها في X⊤XX^{\top}X في 101210^{12}، وذلك العامل يحطّ مباشرةً في κ\kappa.
  • الطرائق المتكيّفة مثل RMSProp وAdam تحفظ حجم خطوة لكل إحداثي، وهو مُهيّئ قطري: محاولةٌ لمساواة القيم الذاتيّة بثمن زهيد، بما يسع القطر أن يحمله من معلومات.
  • طبقات التسوية تُبقي التنشيطات على مقياس متقارب أثناء التدريب، فتمنع الهسيّة من الانزلاق إلى نسبة سيّئة في منتصف التشغيل.
  • الوصلات المتبقّية تقصّر الطريق الذي يقطعه الاشتقاق، فتمنع انتشار الانحناء عبر العمق من التراكم.

ولا يجعل أيٌّ من ذلك الخسارة أصغر. جميعها تجعل الخسارة نفسها أرخص في النزول، وهذا شيء آخر، وهو في ضوء الجدول أعلاه العامل الأكبر في الغالب.

المراجع والقراءات الإضافية

  • Stephen Boyd, Lieven Vandenberghe, Convex Optimization, Cambridge University Press, 2004المصدر ↗
  • Ian Goodfellow, Yoshua Bengio, Aaron Courville, Deep Learning, MIT Press (Adaptive Computation and Machine Learning), 2016المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 8 دقيقةالشبكات العصبية

ما الذي يجعل التدريب يتقارب حقًا

فرقٌ بنسبة اثنين في المئة في معدّل التعلّم يفصل تنفيذًا متقاربًا عن آخر يبعد خمس مراتب عشرية، وعددُ شرطٍ يتنبأ بمعدّل التقارب إلى ست منازل عشرية، وانحدارُ التدرّج العشوائي بخطوة ثابتة لا يتقارب أبدًا - بل يستقر في كرة ينمو نصف قطرها بجذر الخطوة. وكل رقم هنا حُسب على مسألة يُعرف أمثلها بالضبط.

التحسينالتعلّم العميقتعلّم الآلة
قراءة 3 دقيقةأسس الاحتمالات

أيّ توزيع خاطئ تريد؟

هدفٌ ثنائي المنوال، وغاوسيّة واحدة، واتّجاهان للتباعد نفسه. تصغير KL(P||Q) يمدّ الغاوسيّة على المنوالين بلا كتلة تُذكر حيث يقيم الهدف فعلًا؛ وتصغير KL(Q||P) يضعها على منوال واحد عند 0.6931 نات، وهي ln 2 حتى أربعة أرقام عشرية لا مصادفة. وكل مواءمة يحكم عليها المعيار الآخر بالكارثة: 2.0976 مقابل 15.2799.

تعلّم الآلةالرياضيات
قراءة 2 دقيقةأسس الاحتمالات

السمتان اللتان تبدوان ضجيجًا

متغيّرٌ يحدّد آخر بارتباط قدره 0.0000000000 بالضبط، وزوجُ سماتٍ كل معلومة متبادلة ثنائيّة بينهما وبين الهدف تساوي صفرًا بالضبط بينما يحدّدانه معًا تمامًا. والغربلة أحاديّة المتغيّر تطرح الاثنتين، والحالة الثانية هي المهمّة: فالسمات التي تحذفها تُحذف لأنّها مهمّة.

تعلّم الآلةالرياضيات
← العودة إلى كل المقالات