Aller au contenu
Kudos AI

Neural Machine Translation of Rare Words with Subword Units

Rico Sennrich, Barry Haddow, Alexandra Birch · 2015 · arXiv:1508.07909

Traitement du langage naturelApprentissage profondVoir la source ↗

Résumé

Adapte le codage par paires d’octets à la segmentation du texte, en construisant un vocabulaire sous-lexical par fusion répétée de la paire de symboles adjacents la plus fréquente, de sorte que les mots rares se décomposent en fragments connus.

Pourquoi c’est important

Il a supprimé le problème du hors-vocabulaire dans les modèles de séquence neuronaux. Raschka identifie cet article comme celui qui décrit le codage par paires d’octets utilisé pour la tokenisation, et le schéma qu’il introduit est celui que les modèles de la famille GPT emploient encore pour segmenter leur entrée.