Aller au contenu
Kudos AI

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Jacob Devlin et al. · 2018 · arXiv:1810.04805

Traitement du langage naturelApprentissage profondIA générativeVoir la source ↗

Résumé

Préentraîne un encodeur transformeur à prédire des tokens masqués en utilisant le contexte des deux côtés, puis affine le même modèle sur des tâches en aval avec une petite tête spécifique.

Pourquoi c’est important

Il a fait du préentraînement-puis-affinage la recette standard du traitement automatique des langues. Parce que le masquage permet au modèle de conditionner sur le contexte gauche et droit, les représentations apprises se sont révélées bien plus fortes pour les tâches de compréhension que le préentraînement de gauche à droite, et le flux en deux étapes est devenu la norme du domaine.