KV Cache
Verificato
Significato di «KV Cache»
Nei Transformer autoregressivi, memoria che conserva le chiavi e i valori dell'attenzione già calcolati per i token precedenti, così che a ogni nuovo passo la generazione non li ricalcoli, riducendo il costo per token e velocizzando l'inferenza.
Fonti: Cache di chiavi/valori dell'attenzione riusati durante il decoding autoregressivo. Fonti: Vaswani et al., 'Attention Is All You Need' (2017); documentazione Hugging Face Transformers (KV cache / use_cache). Verifica web 2026-08-03. · Verificato il 2026-08-03