فهم الشبكة العصبية الالتفافية
الطبقة الموصولة بالكامل حين تُطبَّق على صورة تعامل كل بكسل كمدخل لا صلة له بغيره، فتطرح حقيقة أن البكسلات المتجاورة مترابطة وأن النمط يعني الشيء نفسه أينما ظهر. وهي كذلك باهظة إلى حدّ الإهلاك: فوصل صورة متواضعة بطبقة خفيّة متواضعة يستلزم ملايين الأوزان.
وتستبدل الطبقة الالتفافية بذلك مرشّحًا صغيرًا، 3×3 مثلًا، يُمرَّر على المدخل كله. وعند كل موضع يحسب مجموعًا موزونًا للرقعة المحلية، فينتج خريطة سمات تسجّل أين في الصورة وُجد نمط ذلك المرشّح. والأهم أن الأوزان نفسها تُستخدم عند كل موضع.
ويمنح تشارك الأوزان فائدتين معًا. فعدد المعاملات ينهار، إذ لمرشّح 3×3 تسعة أوزان مهما كان حجم الصورة، فتكلّف الطبقة بضعة آلاف من المعاملات بدل الملايين. ولأن المرشّح نفسه يُطبَّق في كل مكان، فالنمط المتعلَّم في جزء من الصورة يُكتشف تلقائيًا في غيره، بدل أن يُتعلَّم على حدة لكل موضع.
ثم يبني العمق هرمًا. فالطبقات الأولى، إذ لا ترى إلا رقعًا صغيرة، تتعلّم بنية محلية بسيطة كالحوافّ وانتقالات اللون. والطبقات اللاحقة تعمل على خرائط السمات التي أنتجتها سابقاتها، فتكون رؤيتها الفعلية للصورة الأصلية أوسع، وتجمع السمات البسيطة في أجزاء ثم في أشياء كاملة. ويلاحظ شوليه أن الشبكات الالتفافية والانتشار العكسي كانا مفهومين جيدًا بحلول 1990، وأن ما تغيّر بعد 2012 هو توافر البيانات والحوسبة لا الأفكار الأساسية.
مثال على الشبكة العصبية الالتفافية
مرشّح 3×3 بأوزان موجبة كبيرة في عمود وأوزان سالبة كبيرة في عمود آخر يستجيب بقوة حيثما تغيّر السطوع أفقيًا، وبضعف على المناطق المستوية. وبتمريره على الصورة ينتج خريطة للحوافّ الرأسية. ومثل هذه المرشّحات ليست مصمَّمة؛ بل تنبثق من التدريب.
وتأمّل حساب المعاملات على صورة ملوّنة 224×224. فطبقة موصولة بالكامل إلى 1,000 وحدة تحتاج 224 × 224 × 3 × 1,000 ≈ 150 مليون وزن. أما طبقة التفافية بـ 64 مرشّحًا حجم كلٍّ منها 3×3×3 فتحتاج 64 × 27 ≈ 1,728 وزنًا زائد الانحيازات، أي أقل بنحو خمس رتب عشرية.
وتُدرَج طبقات التجميع عادةً بالتناوب لخفض الدقة المكانية، ما يوسّع منطقة الصورة الأصلية التي تستجيب لها كل وحدة لاحقة ويضيف تسامحًا مع الإزاحات الصغيرة. والنمط العام للشبكة مقايضة تدريجية للتفصيل المكاني بالتجريد الدلالي.
الأسئلة الشائعة
لماذا الطبقات الالتفافية أفضل من الموصولة بالكامل للصور؟
لأنها تستثمر حقيقتين تتجاهلهما الطبقة الموصولة بالكامل: أن البنية ذات الصلة محلية، وأن النمط يعني الشيء نفسه أينما ظهر. وهذا يعطي معاملات أقل بكثير وتعميمًا أفضل بكثير من القدر نفسه من البيانات.
ماذا يفعل التجميع؟
يخفض معاينة خريطة السمات، عادةً بأخذ الأعظم على كل نافذة صغيرة. وهذا يقلّل الحوسبة، ويوسّع منطقة المدخل التي تراها الطبقات اللاحقة فعليًا، ويجعل التمثيل غير حسّاس نوعًا ما للإزاحات الصغيرة.
هل الشبكات الالتفافية للصور وحدها؟
لا. فالفكرة نفسها تنطبق حيثما كانت للبيانات بنية شبكية ذات محلية ذات معنى: فالالتفافات أحادية البعد تُستخدم للصوت والسلاسل الزمنية، وطُبِّقت المعماريات الالتفافية على النصوص، وإن كانت النماذج القائمة على الانتباه تهيمن هناك الآن.
الخلاصة
تدمج الشبكات الالتفافية المحليةَ وإعادةَ الاستعمال بالإزاحة في المعمارية مباشرةً، فيُتعلَّم النمط مرة ويُكتشف في كل مكان بجزء يسير من كلفة المعاملات. وتكديسها يعطي هرمًا متعلَّمًا من الحوافّ إلى الأشياء، ولهذا عرّفت الرؤية الحاسوبية طوال عقد.