فهم المحوّل
تعالج الشبكات التكرارية المتتالية خطوةً في كل مرة، وتعتمد كل خطوة على مخرج سابقتها. وهذا الاعتماد التسلسلي يمنع التوازي عبر المتتالية أثناء التدريب ويجعل التبعيات بعيدة المدى تعبر خطوات وسيطة كثيرة. وكان إسهام المحوّل إظهارَ أن الانتباه وحده، بلا تكرارية، كافٍ، فأزال المشكلتين معًا. ويسجّل راشكا أن المعمارية قُدّمت في ورقة 2017 «Attention Is All You Need» وطُوِّرت أصلًا للترجمة الآلية.
وطرح التكرارية يكلّف النموذج إحساسه بالترتيب، لأن الانتباه يعامل مدخله كمجموعة: فتبديل ترتيب الرموز يبدّل المخرجات بالمثل. ولذا يجب إضافة معلومات الموضع صراحةً، بإضافة متجه متوقف على الموضع إلى تضمين كل رمز قبل الطبقة الأولى. واستعمل التصميم الأصلي جيوبًا مثلثية ثابتة؛ وتضمينات الموضع المتعلَّمة أو الدورانية بدائل شائعة، لكن المتطلَّب نفسه لا مفرّ منه.
وتضمّ كل كتلة محوّل طبقتين فرعيتين بعملين متكاملين. فالانتباه الذاتي متعدد الرؤوس يخلط المعلومات عبر المواضع، فيقرّر ما ينبغي أن يقرأه كل رمز من بقية المتتالية. ثم تحوّل شبكة تغذية أمامية تُطبَّق على كل موضع كلَّ موضع باستقلال، بالأوزان نفسها في كل مكان. وتُغلَّف الطبقتان الفرعيتان بوصلات متبقّية وتسوية طبقية، وهذا ما يجعل تكديس عشرات منهما قابلًا للتدريب.
وتهيمن ثلاثة ترتيبات. فالنماذج المرمِّزة فقط مثل BERT ترى المدخل كله دفعةً واحدة وتناسب مهام الفهم كالتصنيف. والنماذج المفكِّكة فقط، أي عائلة GPT، تستخدم تقنيعًا سببيًا فلا يرى كل موضع إلا ما سبقه، وتُدرَّب على التنبؤ بالرمز التالي، ما يجعلها توليدية بطبعها. والنماذج المرمِّزة-المفكِّكة تحتفظ بالنصفين وتُستعمل حيث يجب تحويل متتالية مدخل إلى متتالية مخرج، كما في الترجمة. ونماذج اللغة الكبيرة الحديثة مفكِّكة فقط في أغلبها الساحق.
مثال على المحوّل
نموذج لغة مفكِّك فقط يضمّن كل رمز، ويضيف ترميزًا موضعيًا، ثم يمرّر المتتالية عبر كتل متطابقة كثيرة. وداخل كل كتلة يتيح الانتباه الذاتي المقنَّع لكل موضع أن يجمع سياقًا من المواضع السابقة، وتعالج الطبقة الفرعية للتغذية الأمامية كل موضع باستقلال.
وعند المخرج تنقل طبقة خطية أخيرة تمثيلَ كل موضع إلى درجة لكل رمز في المفردات، ويحوّل softmax هذه الدرجات إلى توزيع احتمالي على ما يأتي تاليًا. والتدريب يصغّر الإنتروبيا المتقاطعة مقابل الرمز التالي الفعلي، على كميات هائلة من النصوص.
والهيكل نفسه ينتقل إلى ما وراء اللغة. ويشير راشكا إلى محوّل الرؤية، الذي قُدّم في «An Image is Worth 16x16 Words» (2020)، وهو يقطّع الصورة إلى رقع ويعامل كل رقعة كرمز، مبيّنًا أن المعمارية ليست مقيّدة بالنص.
الأسئلة الشائعة
لماذا يلزم الترميز الموضعي؟
الانتباه الذاتي غير المقنَّع متكافئ التبديل: لا مفهوم للترتيب مضمَّن فيه، فتُمثَّل «عضّ الكلب الرجل» و«عضّ الرجل الكلب» تمثيلًا واحدًا. ولا بدّ من توفير معلومات الموضع صراحةً ليميّز النموذج بينهما (والقناع السببي يحمل شيئًا من الترتيب بنفسه، لكن في اتجاه واحد فحسب).
ماذا تسهم به الطبقة الفرعية للتغذية الأمامية؟
الانتباه ينقل المعلومات بين المواضع لكنه لا يطبّق تحويلًا جوهريًا داخل كل موضع. وشبكة التغذية الأمامية توفّر تلك الطاقة المعالِجة، مطبَّقةً بالتساوي وباستقلال عند كل موضع. فالطبقتان الفرعيتان تؤديان عملين مختلفين حقًا.
لماذا نماذج اللغة الحديثة مفكِّكة فقط؟
التنبؤ بالرمز التالي هدف واحد لا يتطلب بيانات موسومة، وينطبق على أي نص، ويتوسّع بنظافة. وعند حجم كافٍ ينتج نماذج قادرة عبر مهام كانت تحتاج معماريات منفصلة، فربح التصميم الأبسط بفضل قابليته للتوسّع.
الخلاصة
استبدل المحوّل بالتكرارية انتباهًا، فكسب تدريبًا متوازيًا ووصلات مباشرة بعيدة المدى مقابل حاجته إلى معلومات موضع صريحة. وصيغه المرمِّزة فقط والمفكِّكة فقط والمرمِّزة-المفكِّكة تقوم عليها اليوم نمذجةُ اللغة الحديثة كلها تقريبًا.