Vision Transformer
Verificato
Significato di «Vision Transformer»
Trasformer per immagini (ViT). Architettura che divide l'immagine in patch di dimensione fissa, le proietta in embedding e le elabora come una sequenza tramite l'auto-attenzione, senza convoluzioni.
Fonti: ViT: patch embedding + self-attention, senza convoluzioni. Fonti: Dosovitskiy et al. "An Image is Worth 16x16 Words" (ICLR 2021, arXiv:2010.11929); Szeliski 2nd ed. verifica web 2026-08-03 · Verificato il 2026-08-03