An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
Alexey Dosovitskiy et al. · 2020 · arXiv:2010.11929
Résumé
Applique un transformeur standard directement aux images en découpant chaque image en imagettes de taille fixe et en traitant la suite d’imagettes comme des tokens, sans aucune convolution.
Pourquoi c’est important
Il a montré que le transformeur n’est pas propre au langage : avec assez de données, une architecture de séquence générale égale ou dépasse les réseaux convolutifs en classification d’images. Raschka le cite comme illustrant que les architectures transformeur ne se limitent pas aux entrées textuelles.