Multi-Head Attention
Verificato
Significato di «Multi-Head Attention»
Componente dei Transformer che esegue in parallelo più meccanismi di attenzione (teste) su proiezioni diverse di query, chiavi e valori e ne concatena i risultati, permettendo al modello di cogliere relazioni differenti in sottospazi distinti.
Fonti: Attenzione parallela su più sottospazi proiettati. Fonti: Vaswani et al., 'Attention Is All You Need' (2017), sez. 3.2.2; documentazione PyTorch torch.nn.MultiheadAttention. Verifica web 2026-08-03. · Verificato il 2026-08-03