محوّل بمفكّك ترميز فقط، مبني مكوّنًا تلو الآخر - المُرمِّز، التضمينات، الانتباه، الكتل، وحلقة التدريب المسبق - دون أي شيفرة نمذجة مستوردة من مكتبة.
Python (PyTorch)نشط
نموذج لغوي من طراز GPT مُنفَّذ بالكامل في PyTorch انطلاقًا من عمليات المُوتِّرات، ومكتوب بحيث يقابل كل سطر خطوةً مُشتقّة في المقالات. يبدأ بمُرمِّز الأزواج البايتية وجدول تضمينات، ثم يضيف الانتباه بالجداء القياسي المُقيَّس يليه الانتباه متعدّد الرؤوس، ويكدّس ذلك في كتل محوّل بتسوية قبليّة مع وصلات متبقّية، وينتهي بحلقة تدريب مسبق للتنبؤ بالرمز التالي على مُدوّنة صغيرة. المرجع الثابت هو أن النموذج غير المُدرَّب ينبغي أن يسجّل إنتروبيا تقاطعية قريبة من لوغاريتم حجم المفردات؛ ولا تُعدّ حلقة التدريب صالحة إلا حين تهبط الخسارة بوضوح تحت هذا الحدّ. أقنعة الانتباه وربط الأوزان وعدد المعاملات جميعها تُدقَّق مقابل إعداد GPT-2 المنشور بدل افتراضها. التنفيذ جارٍ ولم يُنشر بعد أي مستودع للمصدر.
أبرز النقاط
مُرمِّز الأزواج البايتية واستدعاء التضمينات، مع إثبات تكافئهما مع جداء مصفوفة أحادية التمثيل
الانتباه بالجداء القياسي المُقيَّس ثم متعدّد الرؤوس، مبنيّان من الاشتقاق لا من nn.MultiheadAttention
التقنيع السببي مُتحقَّق منه بالتأكد أن الرمز لا ينتبه أبدًا إلى موضع لاحق
عدد المعاملات يُعيد إنتاج إعداد GPT-2 بحجم 124 مليونًا بدقّة، كتلةً كتلة
حدّ الإنتروبيا التقاطعية log(المفردات) مستخدَمًا كاختبار اتساق للنموذج غير المُدرَّب
How text becomes numbers a model can train on: building a vocabulary, why byte pair encoding never needs an unknown token, the embedding layer as a lookup that is provably one-hot times a matrix, and why position has to be added back in by hand.
الذكاء الاصطناعي التوليديمعالجة اللغات الطبيعيةالتعلّم العميق
Queries, keys, and values built from the ground up: why attention exists, how scaled dot-product attention is computed, why it is divided by the square root of the dimension, and how causal masking works, with every matrix computed and checked.
الذكاء الاصطناعي التوليديالتعلّم العميقمعالجة اللغات الطبيعية
Assembling a GPT from attention: multi-head projections, layer normalization worked by hand, why shortcut connections rescue the gradient, the 4x feed-forward expansion, and a parameter count that reproduces GPT-2 small at 124 million exactly.
الذكاء الاصطناعي التوليديالتعلّم العميقمعالجة اللغات الطبيعية
How next-word prediction turns unlabelled text into supervision, why cross entropy is just negative average log probability, what perplexity really measures, and why a model that completes text fluently still cannot follow an instruction.