Traitement du langage naturel
Rendre la langue calculable : représentation, modèles de séquences, attention, et les modèles de langue qui en ont découlé.
Parcours (1)
Encyclopédie (3)
Tokenisation
Le découpage du texte en unités discrètes sur lesquelles un modèle de langue opère réellement, typiquement des fragments de sous-mots plutôt que des mots entiers.
Auto-attention
Un mécanisme qui permet à chaque position d’une séquence de prêter attention à toutes les autres, chaque sortie étant une somme pondérée de valeurs dont les poids viennent de la similarité entre requêtes et clés.
Transformeur
Une architecture neuronale bâtie sur un empilement de couches d’auto-attention et de couches à propagation avant, qui a remplacé la récurrence comme standard de la modélisation de séquences.
Articles (3)
La tokenisation et les plongements
Comment le texte devient des nombres sur lesquels un modèle peut s’entraîner : construire un vocabulaire, pourquoi le codage par paires d’octets n’a jamais besoin d’un token inconnu, la couche de plongement comme une consultation qui est prouvablement un one-hot fois une matrice, et pourquoi la position doit être réinjectée à la main.
L’architecture du transformeur
Assembler un GPT à partir de l’attention : projections multi-têtes, normalisation de couche déroulée à la main, pourquoi les connexions de raccourci sauvent le gradient, l’expansion x4 du réseau à propagation avant, et un décompte de paramètres qui reproduit exactement les 124 millions de GPT-2 small.
L’attention et l’auto-attention
Requêtes, clés et valeurs construites depuis la base : pourquoi l’attention existe, comment se calcule l’attention par produit scalaire mis à l’échelle, pourquoi elle est divisée par la racine carrée de la dimension, et comment fonctionne le masquage causal, avec chaque matrice calculée et vérifiée.
Outils (1)
Jeux de données (1)
Recherche (4)
Neural Machine Translation of Rare Words with Subword Units
Adapte le codage par paires d’octets à la segmentation du texte, en construisant un vocabulaire sous-lexical par fusion répétée de la paire de symboles adjacents la plus fréquente, de sorte que les mots rares se décomposent en fragments connus.
Attention Is All You Need
Introduit le transformeur, une architecture bâtie entièrement sur des couches d’attention et de propagation avant, sans récurrence, développée à l’origine pour la traduction automatique.
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Préentraîne un encodeur transformeur à prédire des tokens masqués en utilisant le contexte des deux côtés, puis affine le même modèle sur des tâches en aval avec une petite tête spécifique.
Language Models are Few-Shot Learners
Décrit GPT-3 et montre qu’un modèle de langue décodeur seul suffisamment grand peut accomplir de nouvelles tâches à partir d’une poignée d’exemples fournis dans son invite, sans aucune mise à jour de gradient.