تخطّي إلى المحتوى
Kudos AI
Read in English
بناء نموذج لغة

التدريب المسبق والضبط الدقيق

كيف يحوّل التنبّؤ بالكلمة التالية نصاً غير موسوم إلى إشراف، ولماذا الإنتروبيا المتقاطعة ليست إلا سالب متوسط لوغاريتم الاحتمال، وماذا تقيس الحيرة فعلاً، ولماذا يظلّ نموذج يُكمل النص بطلاقة عاجزاً عن اتّباع تعليمة.

قراءة 6 دقيقةKudos AI

المتطلبات المسبقة: معمارية المحوّل

log V مشتقًّا على الشاشة بوصفه الخسارة التي يجب أن يُبلّغها نموذج لم يحسم أمره، ثم مُختبَرًا بقياس فعلي لنموذج غير مدرَّب يبعد عنه 0.03.

في نهاية معمارية المحوّل كان لدينا 124 مليون بارامتر مهيّأة عشوائياً ومرتّبة في الشكل الصحيح ولا تتنبّأ بشيء. والانتقال من هناك إلى نموذج يكتب نثراً سلساً، ثم إلى نموذج يفعل ما يُطلب منه، يستلزم مرحلتَي تدريب متمايزتين ببيانات وكلفة وغاية مختلفة.

تغطّي هذه المقالة كلتيهما، والقياسَ الذي يخبرك إن كانت الأولى تعمل.

أ. مشكلة الوسم، وكيف تذوب

يحتاج التعلّم الموجَّه إلى وسوم، والوسوم مكلفة. وراشكا صريح في أن هذا هو القيد المعتاد لنماذج تعلّم الآلة التقليدية والشبكات العميقة المدرَّبة وفق النموذج الموجَّه الاعتيادي - وأن مرحلة التدريب المسبق لنموذج اللغة الكبير تفلت منه تماماً.

والمفرّ هو التعلّم ذاتي الإشراف، حيث يولّد النموذج وسومه بنفسه من بيانات الدخل. وفي اللغة تكون الحيلة التنبّؤ بالكلمة التالية: استخدم الكلمة التالية في جملة أو وثيقة وسماً يُفترض بالنموذج التنبّؤ به. ويسمّي راشكا ذلك ضرباً من الوسم الذاتي، والنتيجة هي الجزء المهم - فلأن الوسوم تُنشأ أثناء العمل، تصير مجموعات نصية ضخمة غير موسومة صالحة بيانات تدريب.

وتكون المدوّنة عندئذ نصاً ببساطة: نصوص الإنترنت، والكتب، وويكيبيديا، والمقالات البحثية، بحجم تريليونات الكلمات.

الأمر اللافت أن هذا ينجح أصلاً. يلاحظ راشكا أنه مدهش حقاً أن تكتسب نماذج GPT ما تكتسبه من قدرات من مهمة بسيطة كالتنبّؤ بالكلمة التالية. فليس في الهدف ذكر للنحو ولا للوقائع ولا للاستدلال. لكن يتبيّن أنها نافعة أداتياً لتخمين ما يأتي تالياً، فتُتعلَّم أثراً جانبياً.

ويوفّر كل موضع إشارة تدريب دفعةً واحدة. فلأن الانتباه مُقنَع سببياً، يُنتج مرور أمامي واحد على متتالية بطول 1,024 تنبّؤاً عند المواضع الـ1,024 جميعاً، كلٌّ منها مُشرَف عليه بالوحدة التي تلت فعلاً.

ب. مفكِّك الترميز وحده

يسجّل راشكا تبسيطاً بنيوياً يستحق الذكر صراحةً: فمقارنةً بالمحوّل الأصلي، تكون معمارية GPT العامة بسيطة نسبياً - إذ هي في جوهرها جزء مفكِّك الترميز فقط، بلا مُرمِّز. فلا مكوّن منفصل لترميز متتالية مصدر، لأنه لا توجد متتالية مصدر. فالنموذج يقرأ بادئةً ويمدّها، وهذا كل ما يتطلّبه التنبّؤ بالكلمة التالية.

ج. تقييم تنبّؤ

يُخرج النموذج توزيعاً احتمالياً على المفردات كلها عند كل موضع. ونحتاج إلى رقم يقول ما جودة ذلك التوزيع.

والكمية الطبيعية هي الاحتمال الذي أسنده النموذج إلى الوحدة التي وقعت فعلاً. ويبني راشكا الخسارة من هذا بالضبط، على خطوات: خذ احتمال النموذج لكل وحدة هدف، ثم خذ اللوغاريتمات، ثم متوسّطها، ثم اعكس الإشارة. ويلاحظ أن الهدف ليس رفع متوسط لوغاريتم الاحتمال إلى 00 بل خفض سالبه إلى 00، وأن تلك القيمة المعكوسة هي ما يسمّيه التعلّم العميق خسارة الإنتروبيا المتقاطعة.

محلولةً على ثلاثة تنبّؤات. لنفترض أن النموذج أسند الاحتمالات 0.100.10 و0.600.60 و0.300.30 إلى الوحدات الثلاث التي ظهرت فعلاً.

ln⁡0.10=−2.3026,ln⁡0.60=−0.5108,ln⁡0.30=−1.2040.\ln 0.10 = -2.3026,\qquad \ln 0.60 = -0.5108,\qquad \ln 0.30 = -1.2040 .

ومتوسّطها

−2.3026−0.5108−1.20403=−1.3391,\frac{-2.3026 - 0.5108 - 1.2040}{3} = -1.3391 ,

فتكون خسارة الإنتروبيا المتقاطعة +1.3391+1.3391.

واللوغاريتمات هي ما يجعل هذا يتصرّف تصرّفاً صحيحاً. فاحتمال 0.0010.001 على الوحدة الحقيقية يسهم بـln⁡0.001=−6.9\ln 0.001 = -6.9، بينما يسهم 0.010.01 بـ−4.6-4.6 - فكون الخطأ عشرة أضعاف يكلّف عقوبة جمعية ثابتة، وتُعاقَب الأخطاء الواثقة بلا حدّ.

ويلاحظ راشكا أيضاً أن «الإنتروبيا المتقاطعة» و«سالب متوسط لوغاريتم الاحتمال» يُستعملان بالتبادل عملياً، وأن دالة cross_entropy في PyTorch تؤدّي هذه الخطوات كلها دفعةً واحدة.

Python

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

د. الحيرة، وفحص سلامة

الإنتروبيا المتقاطعة بوحدات لوغاريتمية يصعب استشعارها. أما الحيرة فهي أُسّها، exp⁡(cross entropy)\exp(\text{cross entropy})، ويصفها راشكا بأنها طريقة أيسر تفسيراً لفهم عدم يقين النموذج في التنبّؤ بالوحدة التالية - إذ تعني الحيرة الأدنى تنبّؤات أقرب إلى التوزيع الفعلي.

والتفسير: الحيرة تقريباً كم خياراً متساوي الترجيح يختار النموذج بينها فعلياً. فخسارتنا البالغة 1.33911.3391 تعطي e1.3391≈3.82e^{1.3391} \approx 3.82 - أي أن النموذج بقدر حيرة من يخمّن بانتظام بين أربعة احتمالات.

ويتيح هذا فحصاً حقيقياً لنموذج غير مدرَّب. فشبكة راشكا غير المدرَّبة تعطي خسارة 10.794010.7940. والنموذج الذي لم يتعلّم شيئاً ينبغي أن يكون قريباً من التوزيع المنتظم على المفردات، والتوزيع المنتظم على VV نتيجة إنتروبيته المتقاطعة ln⁡V\ln V بالضبط:

ln⁡50257=10.8249.\ln 50257 = 10.8249 .

والقيمة المقيسة 10.794010.7940 تقع أدنى بـ0.030.03، وأخذ الأُسّ يعطي حيرة نحو 48,70048{,}700 مقابل مفردات من 50,25750{,}257. فالنموذج غير المدرَّب، كما هو متوقّع، يخمّن بانتظام تقريباً بين كل وحدة يعرفها.

وهذا يمنحك أرضية للقياس عليها. فأي نموذج لغة يجب أن يتفوّق على ln⁡V\ln V، وإلا فهو لم يتعلّم شيئاً على الإطلاق - والفجوة بين خسارة النموذج وذلك السقف قياس مباشر لمقدار البنية التي استخلصها من النص.

تفاعلي: الأرضيّة، وكيف يُقرأ عدد إزاءها

الحيرة كنسبة من المفردات هي الصورة القابلة للنقل.

log V10.7940
الأرضيّة المنتظمة، log V
10.8249
الخيارات الفعّالة
48,726
نسبة المفردات
97.0%
ما يقوله ذلك
متردّد، كما ينبغي لنموذج جديد

النموذج المتردّد يوزّع الاحتمال بالتساوي ويُحاسَب على ذلك بـlog V = 10.8249. ونموذج الدرس غير المدرَّب يُبلغ عن 10.7940، أي 48,726 خيارًا فعّالًا مقابل مفردات قدرها 50,257، أي 96.95% منها ما زالت في اللعب. وهكذا يبدو «المتردّد حقًّا» عددًا، وهذه هي القراءة التي يحتاجها تحقّق الدرس: فـ«أدنى بكثير» و«أعلى بكثير» يصعب العمل بهما، أمّا النسبة فلا. وأنت الآن عند 10.7940 على مفردات قدرها 50,257، فتبقى 97.0% في اللعب، والقراءة إذًا أنّه متردّد. ونسبة أعلى قليلًا من الواحد ليست خللًا: فالإنتروبيا المتقاطعة لا حدّ أعلى لها، والنموذج الذي يخمّن عشوائيًّا دون انتظام تامّ يدفع ثمن هذا التفاوت - ونموذج الدرس غير المدرَّب نفسه يقرأ 1.18 على المحمّلين الكاملين. ولا يدلّ على خلل في الخسارة أو في الترميز إلّا نسبة أعلى بكثير من الواحد، ضعف المفردات أو عشرة أضعافها. والنسبة كذلك هي الصورة القابلة للنقل. فنصف المفردات في اللعب يُقرأ كما هو عند ألف رمز وعند خمسين ألفًا، حيث تختلف الخسارتان الخامّتان بنحو أربع ولا تعني أيٌّ منهما شيئًا وحدها.

هـ. ماذا ينتج التدريب المسبق، وماذا لا ينتج

الناتج نموذج أساس، وراشكا دقيق في وصف قدرته: يعلّم التدريب المسبق النموذج توليد كلمة في كل مرة، فيصير نموذج اللغة المدرَّب مسبقاً قادراً على إكمال النص - إتمام الجمل أو كتابة فقرات انطلاقاً من مقطع - إضافةً إلى قدرات التعلّم من أمثلة قليلة.

وهو دقيق بالقدر نفسه في وصف الحدّ. فنماذج اللغة المدرَّبة مسبقاً كثيراً ما تتعثّر أمام التعليمات المحدّدة، بأمثلة مثل «صحّح نحو هذا النص» أو «حوّل هذا النص إلى المبني للمجهول».

والسبب ينبع من الهدف. فقد تعلّم النموذج أي نص يتبع عادةً نصاً آخر. فبإعطائه «صحّح نحو هذا النص: …»، يكون التكملة المعقولة في الواقع تعليمةَ تمرين أخرى، أو قائمة مطالبات مماثلة - إذ يميل هذا النوع من النص إلى الظهور قرب أمثاله. وإنتاج الجملة المصحّحة تكملة من تكملات كثيرة، ولم يخصّها التدريب المسبق بشيء يجعلها المطلوبة.

و. الضبط الدقيق

يبدأ الضبط الدقيق من الأوزان المدرَّبة مسبقاً ويواصل التدريب على مجموعة بيانات موسومة لغرض محدّد. ويميّز راشكا نوعين:

  • الضبط الدقيق للتصنيف - تكييف النموذج لإسناد تسميات، ومثاله المحلول مصنِّف بريد مزعج. تُبقى كومة المحوّل ويُستبدَل رأس الخرج برأس بحجم عدد الفئات.
  • الضبط الدقيق بالتعليمات، ويسمّى أيضاً الضبط الدقيق الموجَّه بالتعليمات - تدريب على أزواج من التعليمات والاستجابات المرغوبة كي يتعلّم النموذج اتّباع التعليمات وتوليد الاستجابة المطلوبة. ويعدّه إحدى التقنيات الرئيسية وراء روبوتات المحادثة والمساعدين الشخصيين والأنظمة الحوارية.

والاقتصاديات هي بيت القصيد. فالتدريب المسبق يستهلك تريليونات الكلمات غير الموسومة؛ بينما يستخدم الضبط الدقيق بالتعليمات مجموعة موسومة ضئيلة نسبياً. فكل ما يعرفه النموذج تقريباً تعلّمه في المرحلة الأولى - أما الثانية فتعلّمه غالباً أي تكملاته المعقولة الكثيرة هي المطلوبة.

والتدرّج الكامل كما يعرضه راشكا:

raw unlabelled text  →  pretrained foundation model  →  fine-tuned model\text{raw unlabelled text} \;\rightarrow\; \text{pretrained foundation model} \;\rightarrow\; \text{fine-tuned model}

مع وصول إكمال النص والقدرة على التعلّم من أمثلة قليلة عند المرحلة الوسطى، والتصنيف أو التلخيص أو الترجمة أو سلوك المساعد عند الأخيرة.

الخلاصات الأساسية

  • يذيب التعلّم ذاتي الإشراف مشكلة الوسم: فالكلمة التالية هي الوسم، فيصير النص غير الموسوم إشرافاً وتصير تريليونات الكلمات صالحة للاستخدام.
  • GPT هو مفكِّك الترميز وحده - بلا مُرمِّز، إذ لا توجد متتالية مصدر لترميزها.
  • الإنتروبيا المتقاطعة هي سالب متوسط لوغاريتم احتمالات الوحدات الحقيقية؛ ومثالنا المحلول يعطي 1.33911.3391 من الاحتمالات 0.10,0.60,0.300.10, 0.60, 0.30.
  • الحيرة هي exp⁡(cross entropy)\exp(\text{cross entropy}) - أي تقريباً عدد الخيارات التي يختار النموذج بينها فعلياً.
  • يسجّل النموذج غير المدرَّب نحو ln⁡V\ln V: فقيمة راشكا 10.794010.7940 مقابل ln⁡50257=10.8249\ln 50257 = 10.8249، بحيرة قريبة من حجم المفردات. وتلك هي الأرضية التي يجب أن يتفوّق عليها أي نموذج حقيقي.
  • يعطي التدريب المسبق إكمال النص لا الطاعة؛ فالنماذج المدرَّبة مسبقاً تخفق روتينياً في تعليمات مثل «صحّح نحو هذا النص».
  • يوفّر الضبط الدقيق على مجموعة موسومة صغيرة ما لا يستطيعه التدريب المسبق - إما رأس تصنيف وإما سلوك اتّباع تعليمات.

ما التالي

يكتمل بهذا الطريق من المحارف الخام إلى نموذج يتّبع التعليمات: فقد حوّل التقطيع إلى وحدات والتضمينات النصَّ إلى تنسورات، وبنى الانتباه والانتباه الذاتي ومعمارية المحوّل النموذجَ، ودرّبته هذه المقالة. وللتقليد الآخر في الذكاء الآلي - الذي يبحث ويستدلّ بدل التنبّؤ بالوحدة التالية - انظر البحث التنافسي والمينيماكس.

المراجع والقراءات الإضافية

  • Sebastian Raschka, Build a Large Language Model (From Scratch), Manning, 2025· مكتبة مراجع Kudos AI

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 6 دقيقةبناء نموذج لغة

التقطيع إلى وحدات والتضمينات

كيف يصير النص أرقاماً يستطيع النموذج التدرّب عليها: بناء مفردات، ولماذا لا يحتاج ترميز أزواج البايتات إلى وحدة «مجهول» قط، وطبقة التضمين بوصفها استرجاعاً يمكن البرهان على أنه متجه أحادي مضروب في مصفوفة، ولماذا يجب إعادة حقن الموضع يدوياً.

الذكاء الاصطناعي التوليديمعالجة اللغات الطبيعيةالتعلّم العميق
قراءة 7 دقيقةبناء نموذج لغة

معمارية المحوّل

تركيب GPT من الانتباه: إسقاطات متعدّدة الرؤوس، وتسوية الطبقة محلولةً يدوياً، ولماذا تنقذ وصلات الاختصار التدرّج، وتوسّع شبكة التغذية الأمامية أربع مرات، وعدّ بارامترات يعيد إنتاج GPT-2 الصغير عند 124 مليوناً بالضبط.

الذكاء الاصطناعي التوليديالتعلّم العميقمعالجة اللغات الطبيعية
قراءة 6 دقيقةبناء نموذج لغة

الانتباه والانتباه الذاتي

الاستعلامات والمفاتيح والقيم مبنيةً من الأساس: لماذا وُجد الانتباه، وكيف يُحسب انتباه الجداء القياسي المقيس، ولماذا يُقسم على جذر البُعد، وكيف يعمل الإقناع السببي، مع حساب كل مصفوفة والتحقّق منها.

الذكاء الاصطناعي التوليديالتعلّم العميقمعالجة اللغات الطبيعية
← العودة إلى كل المقالات