Vision Transformer

Verificato

Significato di «Vision Transformer»

Trasformer per immagini (ViT). Architettura che divide l'immagine in patch di dimensione fissa, le proietta in embedding e le elabora come una sequenza tramite l'auto-attenzione, senza convoluzioni.

Fonti: ViT: patch embedding + self-attention, senza convoluzioni. Fonti: Dosovitskiy et al. "An Image is Worth 16x16 Words" (ICLR 2021, arXiv:2010.11929); Szeliski 2nd ed. verifica web 2026-08-03 · Verificato il 2026-08-03

Preferenze cookie

Gestisci i cookie usati su Glossario Italiano. Puoi modificare le preferenze in qualsiasi momento dal link "Gestisci preferenze" in fondo a ogni pagina.

  • Necessari
    Login, sicurezza (CSRF), preferenze cookie. Sempre attivi.
    Sempre on
  • Statistici
    Misurano in forma aggregata come viene usato il sito. Nessun profilo personale.
  • Marketing
    Cookie di reti pubblicitarie esterne, se attivati in futuro. Oggi GLS non usa script di terze parti e i nostri sponsor sono editoriali, non profilano.