Neural Machine Translation of Rare Words with Subword Units
Rico Sennrich, Barry Haddow, Alexandra Birch · 2015 · arXiv:1508.07909
Résumé
Adapte le codage par paires d’octets à la segmentation du texte, en construisant un vocabulaire sous-lexical par fusion répétée de la paire de symboles adjacents la plus fréquente, de sorte que les mots rares se décomposent en fragments connus.
Pourquoi c’est important
Il a supprimé le problème du hors-vocabulaire dans les modèles de séquence neuronaux. Raschka identifie cet article comme celui qui décrit le codage par paires d’octets utilisé pour la tokenisation, et le schéma qu’il introduit est celui que les modèles de la famille GPT emploient encore pour segmenter leur entrée.