Aller au contenu
Kudos AI

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Alexey Dosovitskiy et al. · 2020 · arXiv:2010.11929

Vision par ordinateurApprentissage profondIA générativeVoir la source ↗

Résumé

Applique un transformeur standard directement aux images en découpant chaque image en imagettes de taille fixe et en traitant la suite d’imagettes comme des tokens, sans aucune convolution.

Pourquoi c’est important

Il a montré que le transformeur n’est pas propre au langage : avec assez de données, une architecture de séquence générale égale ou dépasse les réseaux convolutifs en classification d’images. Raschka le cite comme illustrant que les architectures transformeur ne se limitent pas aux entrées textuelles.