تخطّي إلى المحتوى
Kudos AI

مستكشف أوزان الانتباه

حرّر متجه الاستعلام وشاهد انتباه الجداء القياسي المُقيَّس وهو يتحوّل إلى أوزان سوفت‑ماكس ثم إلى مجموع موزون، مع درجة الحرارة والقسمة على √dₖ كمفتاحين يمكنك تبديلهما.

مجانيالذكاء الاصطناعي التوليديالتعلّم العميقمعالجة اللغات الطبيعية

مستكشف أوزان الانتباه

استعلام واحد ينتبه إلى أربعة أزواج مفتاح/قيمة.

أكبر وزن
29.7%
تشتّت الانتباه
0.990
الرمزq · k÷ √dₖالوزن
the0.400.2022.0%
cat1.000.5029.7%
sat0.920.4628.5%
down0.200.1019.9%

متجه الاستعلام

القسمة على √dₖ

المخرَج - المجموع الموزون لمتجهات القيمة

[0.220, 0.297, 0.285, 0.199]

الانتباه متوسط موزون، والسوفت‑ماكس هو ما يحدّد الأوزان. اخفض درجة الحرارة فيتركّز على رمز واحد، وارفعها فينتشر الانتباه بالتساوي. وتعطيل القسمة على √dₖ يباعد بين الدرجات الخام ويدفع السوفت‑ماكس نحو التشبّع، وهذا بالضبط سبب وجود هذا العامل.

يعمل بالكامل داخل متصفّحك. لا يُرفع أي شيء تُدخله ولا يُخزَّن.

الأفكار وراء هذه الأداة

قراءة 6 دقيقةبناء نموذج لغة

الانتباه والانتباه الذاتي

الاستعلامات والمفاتيح والقيم مبنيةً من الأساس: لماذا وُجد الانتباه، وكيف يُحسب انتباه الجداء القياسي المقيس، ولماذا يُقسم على جذر البُعد، وكيف يعمل الإقناع السببي، مع حساب كل مصفوفة والتحقّق منها.

الذكاء الاصطناعي التوليديالتعلّم العميقمعالجة اللغات الطبيعية
قراءة 7 دقيقةبناء نموذج لغة

معمارية المحوّل

تركيب GPT من الانتباه: إسقاطات متعدّدة الرؤوس، وتسوية الطبقة محلولةً يدوياً، ولماذا تنقذ وصلات الاختصار التدرّج، وتوسّع شبكة التغذية الأمامية أربع مرات، وعدّ بارامترات يعيد إنتاج GPT-2 الصغير عند 124 مليوناً بالضبط.

الذكاء الاصطناعي التوليديالتعلّم العميقمعالجة اللغات الطبيعية
قراءة 6 دقيقةبناء نموذج لغة

التقطيع إلى وحدات والتضمينات

كيف يصير النص أرقاماً يستطيع النموذج التدرّب عليها: بناء مفردات، ولماذا لا يحتاج ترميز أزواج البايتات إلى وحدة «مجهول» قط، وطبقة التضمين بوصفها استرجاعاً يمكن البرهان على أنه متجه أحادي مضروب في مصفوفة، ولماذا يجب إعادة حقن الموضع يدوياً.

الذكاء الاصطناعي التوليديمعالجة اللغات الطبيعيةالتعلّم العميق