فهم التقطيع إلى رموز
لا يستطيع نموذج اللغة العمل على محارف خام ولا على كلمات مجرّدة؛ فهو يحتاج مفردات منتهية من رموز منفصلة مرتبطة بمعرّفات صحيحة تفهرس بعدها جدول تضمين. والتقطيع إلى رموز هو الخطوة التي تنفّذ هذا التقسيم، ولتصميمها عواقب تسري في المنظومة كلها.
والتقسيم عند المسافات إلى كلمات كاملة يفشل في اتجاهين. فالمفردات تصير هائلة وتبقى مع ذلك ناقصة، إذ تظهر بلا انقطاع كلمات جديدة وأسماء وأخطاء طباعية وصيغ صرفية؛ وأي كلمة غائبة عن المفردات يجب أن تُستبدل برمز «مجهول» فتُتلف المعلومات. أما التقسيم إلى محارف مفردة فيتجنّب ذلك لكنه ينتج متتاليات طويلة جدًا بمعنى ضئيل لكل رمز.
ويسلك ترميز أزواج البايتات الطريق الوسط. فانطلاقًا من المحارف المفردة يجد مرارًا الزوجَ المتجاور الأكثر تكرارًا من الرموز ويدمجه في رمز جديد، ويستمر حتى تبلغ المفردات حجمًا مستهدفًا. فتنتهي الكلمات الشائعة رموزًا مفردة، بينما تُفكَّك الكلمات النادرة إلى أجزاء ذات معنى. ويشير راشكا إلى أن نماذج GPT تستعمل هذا المخطط بعينه، وأنها بسببه لا تحتاج إلى رمز «كلمة مجهولة» البتة: فأي سلسلة قابلة للتمثيل، بالتراجع إلى قطع أصغر عند اللزوم.
ولهذا عواقب عملية تستحق الاستيعاب. فعدد الرموز يخالف عدد الكلمات، وبفارق كبير غالبًا، وبالرموز تُقاس نوافذ السياق والتسعير. كما أن المُقطِّعات المدرَّبة في معظمها على الإنجليزية تجزّئ اللغات الأخرى تجزئةً أشدّ، فقد تكلّف الجملة نفسها أضعاف الرموز في لغة قياسًا بأخرى. ولأن النموذج يرى رموزًا لا حروفًا، فإن المهام على مستوى الحرف كعدّ حروف كلمة عسيرة عليه فعلًا.
مثال على التقطيع إلى رموز
كلمة شائعة مثل «the» متكررة بما يكفي لتبقى رمزًا واحدًا. أما كلمة أندر مثل «tokenization» فقد تُقسَّم إلى قطع مثل «token» و«ization»، فيظل النموذج يرى الجذر المميَّز بدل رمز مجهول معتم.
وإجراء الدمج آلي. فعلى متن من المحارف، يُدمج الزوج الأكثر تواردًا معًا، ولنقل «t» يليها «h»، في «th». ثم يُعاد حساب التكرارات ويُدمج الزوج التالي الأكثر تكرارًا، وهكذا لعدد ثابت من عمليات الدمج. وقائمة الدمج المتعلَّمة هي المُقطِّع.
ولأن التراجع يكون إلى وحدات أصغر فأصغر، وأخيرًا إلى البايتات الخام، فلا يوجد مدخل غير قابل للتمثيل. فاسم علم لم يُرَ من قبل أو مصطلح تقني مستحدث يُرمَّز ببساطة في عدة قطع من أجزاء الكلمات بدل أن يُطلق إخفاق خروج عن المفردات.
الأسئلة الشائعة
لماذا لا نقطّع إلى كلمات فحسب؟
ستكون المفردات ضخمة وتبقى ناقصة، لأن اللغة تنتج كلمات جديدة على الدوام، ولانهارت كل كلمة غير مرئية سابقًا إلى رمز مجهول. أما التقطيع إلى أجزاء كلمات فيُبقي المفردات محدودة مع القدرة على ترميز أي شيء.
لماذا تتفاوت أعداد الرموز بين اللغات إلى هذا الحد؟
لأن قواعد الدمج تُتعلَّم من متن تدريب. فالمُقطِّع المبني أساسًا على الإنجليزية يتعلم عمليات دمج تضغط الإنجليزية بكفاءة، واللغات الضعيفة التمثيل في ذلك المتن تُقسَّم إلى قطع أكثر وأصغر، فترتفع كلفتها بالرموز للمحتوى نفسه.
لماذا تتعثر نماذج اللغة في عدّ حروف كلمة؟
لأنها لا ترى الحروف قط. فقد تصل الكلمة رمزًا أو رمزين من أجزاء الكلمات دون بنية محارف صريحة، فالأسئلة عن المحارف المفردة تسأل عن معلومات طرحها تمثيلُ مدخل النموذج في معظمها.
الخلاصة
يحوّل التقطيع النصَّ إلى المجموعة المحدودة من وحدات أجزاء الكلمات التي يستطيع النموذج استهلاكها. وترميز أزواج البايتات هو الطريقة القياسية، إذ يزيل مشكلة الخروج عن المفردات كليًا، وتظهر عواقبه في حدود السياق والتسعير والكلفة بين اللغات وفي عمى النموذج عن المحارف المفردة.