Glossario Machine Learning
Glossario verificato
Termini chiave del machine learning: algoritmi supervisionati e non supervisionati, reti neurali, training, overfitting e tecniche di feature engineering.
-
A
-
A/B Testing
Esperimento controllato in cui due varianti, ad esempio due modelli, vengono servite a gruppi di utenti scelti a caso per confrontarne l'effetto su una metrica obiettivo. È il metodo standard per misurare l'impatto reale di un cambiamento. -
Accuracy
Percentuale di previsioni corrette sul totale. Semplice ma fuorviante quando le classi sono molto sbilanciate. -
Active Learning
Strategia in cui il modello sceglie quali esempi far etichettare, puntando ai più informativi. Ottimizza l'uso del lavoro umano di annotazione. -
AdaBoost
Algoritmo di boosting che dà più peso agli esempi sbagliati a ogni passo. Combina modelli deboli in uno forte. -
Adadelta
Variante di Adagrad che sostituisce la somma cumulata dei gradienti con una media mobile su una finestra recente, evitando il collasso del tasso di apprendimento e senza richiedere un tasso globale prefissato. -
Adagrad
Variante della discesa del gradiente che adatta il tasso di apprendimento separatamente per ogni parametro in base alla somma dei quadrati dei gradienti passati; è utile con dati sparsi ma il tasso tende a decrescere troppo. -
Adam Optimizer
Algoritmo di ottimizzazione che adatta il learning rate per ogni peso combinando momentum e scala dei gradienti. Molto usato di default. -
ADASYN
Tecnica di sovracampionamento che genera esempi sintetici della classe minoritaria concentrandosi sulle zone più difficili da apprendere, vicino ai confini di decisione. Affina l'idea di SMOTE adattando la generazione alla densità locale. -
Adjusted R-squared
Versione del coefficiente di determinazione che penalizza l'aggiunta di variabili non informative a un modello di regressione. A differenza dell'R² grezzo, non cresce automaticamente inserendo predittori inutili, favorendo modelli più parsimoniosi. -
Alberi estremamente randomizzati (Extra-Trees)
Metodo ensemble simile alla foresta casuale che aumenta la casualità scegliendo le soglie di suddivisione in modo casuale anziché ottimale. Riduce ulteriormente la varianza a fronte di un lieve aumento della distorsione. -
Albero decisionale
Modello che prende decisioni seguendo una serie di domande a cascata sui dati. Intuitivo e leggibile, ma soggetto a overfitting se troppo profondo. -
Algoritmo
Procedura di apprendimento. Insieme di regole che guidano l'addestramento del modello. -
Algoritmo Apriori
Algoritmo classico per l'estrazione di itemset frequenti e regole di associazione. Sfrutta la proprietà di anti-monotonia, per cui ogni sottoinsieme di un itemset frequente è a sua volta frequente, per potare lo spazio di ricerca ed evitare conteggi inutili. -
Analisi delle componenti indipendenti (ICA)
Metodo di riduzione dimensionale e separazione delle sorgenti che scompone un segnale multivariato in componenti additive statisticamente indipendenti e non gaussiane. A differenza della PCA cerca l'indipendenza statistica, non la sola decorrelazione. -
Analisi delle componenti principali con kernel (Kernel PCA)
Estensione non lineare della PCA che applica il trucco del kernel per calcolare le componenti principali in uno spazio delle caratteristiche indotto da un kernel. Permette di catturare strutture non linearmente separabili nei dati originari. -
Analisi di sopravvivenza (Survival Analysis)
Insieme di metodi che modellano il tempo che intercorre fino al verificarsi di un evento (morte, guasto, abbandono), gestendo la censura, cioè i casi in cui l'evento non è stato osservato entro il periodo di studio. -
Analisi discriminante quadratica (QDA)
Classificatore generativo che assume distribuzioni gaussiane per ciascuna classe con matrici di covarianza distinte, producendo frontiere di decisione quadratiche. Generalizza l'analisi discriminante lineare (LDA), che assume invece una covarianza comune. -
Analisi fattoriale (Factor Analysis)
Modello statistico che spiega la correlazione tra variabili osservate tramite un numero minore di variabili latenti dette fattori, più un termine di rumore specifico per ciascuna variabile. Si usa per riduzione dimensionale e ricerca di strutture latenti. -
Anomaly Detection
Individuazione di dati che si discostano dal comportamento normale. Usata per frodi, guasti e intrusioni. -
Apprendimento a istanze multiple (Multiple Instance Learning)
Forma di apprendimento debolmente supervisionato in cui gli esempi sono raggruppati in insiemi detti bag ed è nota solo l'etichetta del bag: un bag positivo contiene almeno un'istanza positiva, uno negativo solo istanze negative. -
Apprendimento auto-supervisionato
Tecnica in cui il modello genera da solo le etichette dai dati, ad esempio prevedendo parti nascoste dell'input. Sfrutta enormi quantità di dati grezzi. -
Apprendimento basato su istanze (Instance-Based Learning)
Famiglia di metodi, detti anche a memoria o pigri (lazy), che memorizzano gli esempi di addestramento e rimandano la generalizzazione al momento della previsione, confrontando il nuovo caso con quelli più simili. Esempio tipico: il k-NN. -
Apprendimento contrastivo (Contrastive Learning)
Tecnica di apprendimento di rappresentazioni, spesso auto-supervisionata, che avvicina nello spazio delle feature le coppie di esempi simili (positivi) e allontana quelle dissimili (negativi), di norma tramite viste aumentate dello stesso dato. -
Apprendimento da dati positivi e non etichettati (PU Learning)
Scenario di classificazione binaria in cui l'addestramento dispone solo di esempi positivi etichettati e di un insieme non etichettato che mescola positivi e negativi in proporzione ignota, senza esempi negativi certi. -
Apprendimento debolmente supervisionato (Weakly Supervised Learning)
Insieme di tecniche che apprendono da supervisione imperfetta, tipicamente in tre forme: incompleta (solo una parte dei dati e etichettata), inesatta (etichette a grana grossa) e inaccurata (etichette rumorose o errate). -
Apprendimento delle preferenze (Preference Learning)
Sottocampo che apprende a modellare e prevedere preferenze a partire da informazioni relative, tipicamente confronti a coppie tra oggetti o etichette, anziché da valori target assoluti come nella classificazione o nella regressione. -
Apprendimento di metriche (Metric Learning)
Approccio che apprende dai dati una funzione di distanza o di similarità specifica per il compito, in modo da avvicinare gli esempi simili e allontanare quelli dissimili, utile per k-NN, clustering, recupero di immagini e verifica di identità. -
Apprendimento di rappresentazioni (Representation Learning)
Insieme di tecniche che permettono a un modello di scoprire automaticamente dai dati grezzi le rappresentazioni o feature utili a un compito, sostituendo la progettazione manuale delle feature. Detto anche apprendimento delle caratteristiche. -
Apprendimento di regole associative (Association Rule Learning)
Metodo non supervisionato che individua relazioni frequenti tra elementi in grandi insiemi di transazioni, esprimendole come regole del tipo se A allora B, valutate con misure quali supporto, confidenza e lift; base della market basket analysis. -
Apprendimento di varietà (Manifold Learning)
Insieme di tecniche di riduzione di dimensionalità non lineare che, assumendo che i dati ad alta dimensione giacciano su una varietà di dimensione inferiore, ne recuperano la struttura geometrica per visualizzarli, denoisarli o comprimerli. -
Apprendimento incrementale (Incremental Learning)
Approccio in cui il modello viene aggiornato via via con nuovi dati, spesso a piccoli lotti o da un flusso, senza riaddestrare da zero; adatto a dati troppo grandi per la memoria e deve limitare l'oblio catastrofico. -
Apprendimento induttivo (Inductive Learning)
Paradigma classico in cui il modello, dai soli dati di addestramento, inferisce una regola generale da applicare a nuovi dati mai visti; si contrappone all'apprendimento trasduttivo, limitato ai casi di test già noti. -
Apprendimento multi-task (Multi-Task Learning)
Approccio che addestra un unico modello su più compiti correlati contemporaneamente, condividendo una rappresentazione comune, e sfrutta le affinità tra i compiti per migliorare la generalizzazione, specie quando alcuni dispongono di pochi dati. -
Apprendimento multi-vista (Multi-View Learning)
Framework in cui i dati sono descritti da più insiemi di feature distinti, detti viste, spesso complementari; il modello integra le viste per migliorare la generalizzazione, come negli algoritmi di co-training semi-supervisionati. -
Apprendimento non supervisionato
Tecnica in cui il modello cerca schemi e raggruppamenti in dati privi di etichette. Trova struttura senza sapere in anticipo la risposta corretta. -
Apprendimento per rinforzo
Paradigma in cui un agente impara per tentativi, ricevendo premi o penalità in base alle azioni. Punta a massimizzare la ricompensa nel tempo. -
Apprendimento semi-supervisionato
Approccio che combina pochi dati etichettati con molti non etichettati. Riduce il costoso lavoro di etichettatura mantenendo buone prestazioni. -
Apprendimento supervisionato
Training con etichette. Metodo in cui i dati sono accompagnati da risposte corrette. -
Apprendimento trasduttivo (Transductive Learning)
Paradigma in cui il modello ragiona dai casi di addestramento direttamente ai casi di test specifici già noti, senza costruire una regola generale valida per dati futuri, sfruttando anche i dati di test non etichettati già durante l'apprendimento. -
AUC
Area sotto la curva ROC, che riassume in un valore la capacità del modello di distinguere le classi. Più è vicina a 1, meglio è. -
Auto-addestramento (Self-Training)
Metodo semi-supervisionato in cui un modello addestrato su pochi dati etichettati genera pseudo-etichette per i dati non etichettati; gli esempi predetti con alta confidenza vengono aggiunti al set di addestramento e il processo si ripete. -
B
-
Backpropagation
Algoritmo che aggiorna i pesi delle reti neurali propagando all'indietro l'errore per calcolarne il gradiente. È il metodo alla base dell'addestramento delle reti profonde. -
Bagging
Tecnica ensemble che addestra modelli su campioni casuali dei dati e ne media i risultati. Riduce la varianza e l'overfitting. -
Balanced Accuracy
Media delle accuratezze ottenute su ciascuna classe, cioè di sensibilità e specificità nel caso binario. Corregge la distorsione dell'accuratezza semplice quando le classi hanno frequenze molto diverse. -
Baseline Model
Modello semplice di riferimento con cui confrontare quelli più complessi. Se non lo si batte, la complessità non è giustificata. -
Batch Normalization
Tecnica che normalizza le attivazioni interne di una rete durante l'addestramento. Accelera la convergenza e stabilizza il training. -
Batch Size
Numero di esempi per iterazione. Quantità di dati processati prima di aggiornare i pesi. -
Bayesian Optimization
Tecnica che guida la ricerca degli iperparametri costruendo un modello probabilistico dei risultati. Esplora in modo intelligente, con poche prove. -
Bias
Errore sistematico che altera l'output del modello, dovuto a ipotesi semplificative o a distorsioni nei dati. Da non confondere con il termine di bias additivo di un neurone. -
Bias-Variance Tradeoff
Equilibrio tra errori da modello troppo semplice (bias) e troppo sensibile ai dati (varianza). Il punto giusto minimizza l'errore totale. -
Binning
Discretizzazione di una variabile continua in intervalli, o bin, trattati poi come categorie. Riduce l'effetto del rumore e degli outlier e può rendere non lineari le relazioni, al costo di una perdita di informazione fine. -
BIRCH
Algoritmo di clustering gerarchico incrementale pensato per grandi dataset: costruisce una struttura ad albero (CF-tree) che riassume i dati in cluster feature, riducendo memoria e tempi di calcolo. È adatto all'elaborazione in streaming. -
Boosting
Tecnica ensemble che costruisce modelli in sequenza, ciascuno focalizzato sugli errori del precedente. Aumenta l'accuratezza riducendo il bias. -
Bootstrapping
Tecnica statistica che genera nuovi campioni ricampionando con reinserimento dal dataset originale, per stimare l'incertezza di una misura o addestrare modelli diversi. È il fondamento del bagging e permette di valutare la variabilità di una stima senza assumere una distribuzione teorica. -
Brier Score
Metrica che valuta l'accuratezza delle probabilità predette calcolando lo scarto quadratico medio fra la probabilità assegnata e l'esito reale. Premia modelli ben calibrati: valori più bassi indicano previsioni probabilistiche più affidabili. -
C
-
Calibration
Quanto le probabilità previste da un modello corrispondono alle frequenze reali. Un modello calibrato dà stime affidabili, non solo ordinate. -
CatBoost
Libreria di gradient boosting su alberi decisionali progettata per gestire nativamente le variabili categoriche tramite una codifica ordinata (ordered boosting), riducendo il rischio di sovradattamento e di fuga di informazione dal target. -
Champion-Challenger
Strategia di deployment in cui un nuovo modello sfidante viene messo alla prova contro quello attualmente in produzione, sostituendolo solo se dimostra prestazioni migliori. Permette miglioramenti continui riducendo i rischi. -
Class Prior
Probabilità a priori di ciascuna classe, cioè la sua frequenza attesa prima di osservare le feature. Entra nei classificatori bayesiani e va considerata quando la distribuzione delle classi in produzione differisce da quella di addestramento. -
Classificazione
Assegnazione di etichette. Tecnica di ML che assegna una categoria a ogni input. -
Classificazione a una classe (One-Class Classification)
Compito in cui il modello viene addestrato con esempi di una sola classe (i normali) e deve poi riconoscere se un nuovo dato appartiene a essa o ne è estraneo; usata quando la classe negativa manca o è poco rappresentata. -
Classificazione binaria (Binary Classification)
Compito di classificazione che assegna ogni esempio a una di due classi mutuamente esclusive, per esempio spam o non spam. È il caso più semplice di classificazione è la base di schemi come uno-contro-tutti per problemi con più classi. -
Classificazione multiclasse (Multiclass Classification)
Compito di classificazione che assegna ogni esempio a una sola tra tre o più classi mutuamente esclusive; detta anche multinomiale, si distingue dalla multi-etichetta, dove un esempio può ricevere più etichette contemporaneamente. -
Clustering fuzzy (Fuzzy Clustering)
Clustering soft in cui ogni dato può appartenere a più gruppi con un grado di appartenenza compreso tra 0 e 1, anziché a un solo cluster; l'algoritmo tipico è il fuzzy c-means, utile per dati sovrapposti. -
Clustering gerarchico
Tecnica che costruisce una gerarchia di gruppi unendo o dividendo progressivamente i dati. Si visualizza con un dendrogramma. -
Clustering spettrale (Spectral Clustering)
Tecnica di clustering che tratta il raggruppamento come partizionamento di un grafo di similarità: calcola gli autovettori della matrice laplaciana, proietta i dati in uno spazio ridotto e vi applica un algoritmo come k-means. -
Co-Training
Metodo semi-supervisionato in cui due modelli, addestrati su viste diverse dei dati, si scambiano le predizioni più sicure sui dati non etichettati per istruirsi a vicenda. Funziona bene quando le due viste sono sufficientemente indipendenti. -
Cohen's Kappa
Indice che misura l'accordo fra due valutatori o fra predizioni e verità, correggendo per l'accordo atteso dal caso. Più informativo dell'accuratezza semplice quando le classi sono sbilanciate, vale 1 in caso di accordo perfetto. -
Cold Start
Difficoltà di un sistema di raccomandazione a fare buone previsioni per utenti o item nuovi, privi di storico. Si affronta con informazioni di contenuto, dati demografici o strategie di esplorazione mirata. -
Collaborative Filtering
Approccio alla raccomandazione che suggerisce item sfruttando le somiglianze fra i comportamenti degli utenti, secondo il principio che chi ha gusti simili gradirà cose simili. Non richiede di conoscere il contenuto degli item. -
Concept Drift
Cambiamento nel tempo della relazione tra input e output che il modello deve prevedere. Rende obsolete le regole apprese in passato. -
Conditional Random Field (CRF)
Modello probabilistico discriminativo per l'etichettatura di sequenze che considera le dipendenze fra le etichette vicine. È stato molto usato per compiti come il riconoscimento di entità nominate prima della diffusione delle reti neurali profonde. -
Confidence Score
Valore che indica quanto il modello è sicuro di una previsione. Permette di filtrare o rivedere i casi più incerti. -
Confounding Variable
Variabile che influenza sia la presunta causa sia l'effetto, creando associazioni fuorvianti fra di essi. Ignorare un fattore confondente porta a scambiare per causale una relazione che in realtà è spuria. -
Confusion Matrix
Tabella che confronta le previsioni con le classi reali, mostrando risposte corrette ed errori per categoria. Base per calcolare molte metriche. -
Content-Based Filtering
Metodo di raccomandazione che propone item simili, per attributi e contenuto, a quelli già graditi da un utente. A differenza del filtraggio collaborativo, si basa sulle caratteristiche degli oggetti più che sul comportamento della folla. -
Convergenza
Momento in cui l'addestramento smette di migliorare in modo significativo e i pesi si stabilizzano. Segnala che il modello ha appreso. -
Cost Function
Misura dell’errore complessivo del modello sull’intero set di addestramento. Spesso è la media delle loss calcolate sui singoli esempi ed è la quantità che l’ottimizzazione cerca di minimizzare. -
Cost-Sensitive Learning
Approccio che assegna pesi diversi agli errori in base alle loro conseguenze. Utile quando sbagliare una classe costa più di un’altra. -
Criterio d'informazione bayesiano (BIC)
Criterio per la selezione dei modelli simile all'AIC ma con penalità più severa sulla complessità, pari a k·ln(n); tende a favorire modelli più semplici e si sceglie quello con valore minimo. -
Criterio d'informazione di Akaike (AIC)
Criterio per la selezione dei modelli che bilancia bontà di adattamento e complessità penalizzando il numero di parametri con un termine pari a 2k; a parità di dati si preferisce il modello con AIC minore. -
Cross-Entropy
Funzione di perdita usata nella classificazione che confronta la distribuzione di probabilità prevista con quella reale, penalizzando fortemente le previsioni sicure ma sbagliate. -
Cross-Validation
Tecnica che valuta il modello su più suddivisioni dei dati per stimarne in modo affidabile le prestazioni. Riduce la dipendenza da un singolo split. -
Curriculum Learning
Strategia di addestramento che presenta al modello gli esempi in ordine crescente di difficoltà, ispirandosi al modo in cui gli esseri umani apprendono. Può accelerare e stabilizzare la convergenza. -
Curse of Dimensionality
Insieme di problemi che emergono quando le variabili sono troppe: lo spazio diventa sempre più vuoto, i dati si fanno radi e molti algoritmi perdono efficacia. -
D
-
Data Augmentation
Generazione di nuovi esempi trasformando quelli esistenti, ad esempio ruotando o ritagliando immagini. Amplia il dataset e migliora la robustezza e la generalizzazione del modello. -
Data Cleaning
Correzione di errori, valori mancanti, duplicati e incoerenze nei dati prima dell’addestramento. Dati puliti sono il presupposto di un modello affidabile. -
Data Drift
Cambiamento nel tempo della distribuzione dei dati in ingresso rispetto a quella su cui il modello è stato addestrato. Anche senza che cambi la relazione da apprendere, il drift degrada le prestazioni in produzione e va monitorato per decidere quando riaddestrare. -
Data Leakage
Quando informazioni del futuro o del set di test filtrano nell’addestramento, gonfiando le prestazioni misurate. Porta a risultati ottimi in prova e deludenti nella realtà. -
Dataset
Raccolta strutturata di dati, tipicamente organizzata in esempi descritti da variabili, usata per addestrare, validare o testare un modello. La sua qualità e rappresentatività condizionano direttamente le prestazioni ottenibili. -
DBSCAN
Algoritmo di clustering basato sulla densità dei punti: aggrega le regioni ad alta densità e non richiede di fissare in anticipo il numero di gruppi. Trova cluster di forma irregolare ed etichetta come rumore i punti isolati. -
Decision Boundary
Superficie che separa le diverse classi nello spazio delle variabili di ingresso. La sua forma riflette la complessità del modello, da confini lineari a superfici molto articolate. -
Deep Learning
Ramo del machine learning che impiega reti neurali artificiali con molti strati, capaci di apprendere automaticamente rappresentazioni gerarchiche dei dati. È alla base dei risultati recenti in visione artificiale, linguaggio e riconoscimento vocale. -
Dimensionality Reduction
Riduzione del numero di variabili conservando l’informazione utile. Semplifica i dati, accelera i modelli e ne facilita la visualizzazione. -
Dimezzamento successivo (successive halving)
Strategia di ricerca degli iperparametri che valuta molte configurazioni con poche risorse, scarta le peggiori e assegna più risorse alle candidate migliori a ogni iterazione; in scikit-learn è HalvingGridSearchCV e HalvingRandomSearchCV. -
Discesa a coordinate (coordinate descent)
Metodo di ottimizzazione che minimizza la funzione obiettivo aggiornando una coordinata, o un blocco di coordinate, alla volta e mantenendo fisse le altre; è impiegato per addestrare modelli come Lasso ed Elastic Net. -
Discesa del gradiente in batch (batch gradient descent)
Variante base della discesa del gradiente che calcola il gradiente della funzione di perdita sull'intero insieme di addestramento a ogni passo; produce aggiornamenti stabili ma costosi sui dataset di grandi dimensioni. -
Dropout
Tecnica di regolarizzazione per reti neurali che, durante l’addestramento, disattiva casualmente una frazione di neuroni a ogni passo. Riduce la co-dipendenza tra unità e l’overfitting, migliorando la generalizzazione. -
E
-
Early Stopping
Tecnica che interrompe l’addestramento quando le prestazioni sui dati di validazione smettono di migliorare. Previene l’overfitting evitando di ottimizzare troppo sui dati di training. -
ElasticNet
Regressione lineare regolarizzata che combina le penalità di Ridge (L2) e Lasso (L1). Bilancia la riduzione dei pesi e la selezione delle variabili, gestendo bene feature correlate. -
Eliminazione ricorsiva delle feature (RFE)
Metodo wrapper di selezione delle feature che addestra ripetutamente un modello, elimina a ogni passo le variabili meno importanti secondo i pesi o l'importanza stimata e itera fino al numero desiderato di feature. -
Embedding
Rappresentazione di dati discreti, come parole o categorie, tramite vettori numerici densi in uno spazio a bassa dimensione, in cui elementi simili occupano posizioni vicine. Consente ai modelli di cogliere relazioni semantiche. -
Ensemble Learning
Approccio che combina le previsioni di più modelli per ottenere risultati migliori del singolo. Sfrutta la diversità tra i modelli per ridurre errori e varianza. -
Epoch
Nell’addestramento, un passaggio completo dell’algoritmo su tutti gli esempi del set di training. L’addestramento richiede in genere più epoche, durante le quali i pesi vengono aggiornati progressivamente per ridurre l’errore. -
Errore di calibrazione atteso (ECE)
Metrica che quantifica la miscalibrazione di un classificatore probabilistico: suddivide le probabilità previste in intervalli e media, pesando per numerosità, lo scarto tra probabilità media e frequenza reale dei positivi. -
Errore percentuale assoluto medio (MAPE)
Metrica di regressione che media il valore assoluto degli errori espressi come percentuale del valore reale; è di facile interpretazione ma diventa instabile quando i valori osservati sono prossimi allo zero. -
Errore quadratico medio logaritmico (MSLE)
Metrica di regressione che calcola l'errore quadratico medio tra i logaritmi dei valori previsti e osservati; penalizza le sottostime più delle sovrastime ed è adatta a target che crescono in modo esponenziale. -
Expectation-Maximization (EM)
Algoritmo iterativo per stimare i parametri di modelli con variabili latenti, alternando un passo di stima delle variabili nascoste (E) e uno di aggiornamento dei parametri (M). È il metodo classico per addestrare i modelli a miscela gaussiana. -
Explainability (XAI)
Capacità di spiegare come e perché un modello arriva a una previsione, rendendone comprensibile il comportamento. È fondamentale per fiducia, controllo, debug e conformità normativa. -
Exploding Gradient
Fenomeno per cui, durante la backpropagation in reti profonde o ricorrenti, i gradienti crescono in modo esponenziale destabilizzando l’aggiornamento dei pesi. Si contiene con tecniche come il gradient clipping, che ne limita l’ampiezza. -
F
-
F1 Score
Media armonica di precision e recall, che le bilancia in un solo numero. Utile quando contano entrambe le metriche e le classi sono sbilanciate. -
Fattore di outlier locale (LOF)
Algoritmo di rilevamento di anomalie che misura la deviazione di densità locale di un punto rispetto ai suoi vicini più prossimi. Un valore molto maggiore di 1 indica una densità inferiore a quella dei vicini e segnala un potenziale outlier. -
Fattorizzazione in matrici non negative (NMF)
Tecnica di riduzione dimensionale che approssima una matrice non negativa come prodotto di due matrici a elementi non negativi. I vincoli di non negatività producono rappresentazioni additive e facilmente interpretabili, usate per clustering e topic modeling. -
Feature
Variabile in ingresso, o attributo misurabile, che descrive un esempio e viene usata dal modello per fare previsioni. La scelta e la qualità delle feature incidono spesso più dell’algoritmo sulle prestazioni. -
Feature Crossing
Creazione di nuove variabili combinando due o più feature esistenti, per catturare interazioni che i modelli lineari non colgono da soli. Aumenta l’espressività ma va bilanciata contro la crescita della dimensionalità. -
Feature Engineering
Creazione e trasformazione delle variabili di input per aiutare il modello a imparare meglio. Spesso incide sui risultati più dell’algoritmo scelto. -
Feature Extraction
Derivazione di nuove variabili più informative a partire dai dati grezzi, come testo o immagini. Comprime l’informazione utile in poche caratteristiche adatte al modello. -
Feature Hashing
Tecnica che mappa le feature, in particolare categorie ad altissima cardinalità, in un numero fisso di posizioni tramite una funzione di hash. Riduce memoria e dimensionalità a costo di possibili collisioni fra feature diverse. -
Feature Importance
Misura di quanto ciascuna variabile in ingresso contribuisce alle predizioni di un modello. Può essere stimata in vari modi, ad esempio dalla struttura degli alberi o permutando i valori di una feature e osservando il calo di prestazioni. -
Feature Scaling
Riporto delle variabili su scale confrontabili, ad esempio con standardizzazione o normalizzazione. Evita che le caratteristiche con valori grandi dominino l’apprendimento. -
Feature Selection
Scelta del sottoinsieme di variabili più utili, scartando quelle irrilevanti o ridondanti. Riduce rumore, costi computazionali e rischio di overfitting. -
Feature Store
Sistema centralizzato che raccoglie, versiona e distribuisce le feature calcolate, così che gli stessi valori siano disponibili in addestramento e in produzione. Riduce il rischio di train-serving skew e favorisce il riuso coerente delle feature. -
Few-Shot Learning
Capacità di apprendere un nuovo compito con pochissimi esempi etichettati. Sfrutta conoscenze acquisite in precedenza per generalizzare rapidamente. -
Forward Propagation
Passaggio dei dati dall’ingresso all’uscita di una rete neurale per produrre una previsione. Precede il calcolo dell’errore e l’aggiornamento dei pesi tramite backpropagation. -
Frequency Encoding
Tecnica che sostituisce ogni categoria con la sua frequenza di comparsa nel dataset. Utile con variabili ad alta cardinalità, comprime l’informazione in un singolo numero ma può confondere categorie diverse con la stessa frequenza. -
Fully Connected Layer
Strato di rete neurale in cui ogni neurone è collegato a tutte le unità dello strato precedente. È la forma più classica di livello, detta anche strato denso. -
Funzione di attivazione
Funzione che introduce non linearità nell’uscita di un neurone, ad esempio ReLU o sigmoide. Permette alla rete di apprendere relazioni complesse tra ingressi e uscite. -
G
-
Gaussian Mixture Model
Modello che descrive i dati come miscela di più distribuzioni gaussiane. Usato per il clustering morbido, in cui ogni punto ha una probabilità di appartenere a ciascun gruppo. -
Gaussian Process
Modello probabilistico non parametrico che definisce una distribuzione sulle funzioni, fornendo predizioni accompagnate da una misura di incertezza. È usato per regressione su pochi dati e come modello surrogato nell’ottimizzazione bayesiana. -
Generalizzazione
Capacità di un modello di funzionare bene su dati nuovi, non visti in addestramento. È l’obiettivo ultimo del machine learning. -
Gini Impurity
Misura del grado di disomogeneità delle classi in un nodo di un albero decisionale: è nulla quando il nodo è puro e cresce col mescolarsi delle classi. Gli algoritmi la minimizzano scegliendo le suddivisioni che rendono i nodi figli più omogenei. -
Gradient Boosting
Tecnica d’insieme che costruisce modelli in sequenza, ognuno addestrato a correggere gli errori residui del precedente seguendo il gradiente della funzione di perdita. Produce previsioni molto accurate. -
Gradient Descent
Algoritmo iterativo di ottimizzazione che minimizza una funzione di costo aggiornando i parametri nella direzione opposta al suo gradiente. È il metodo fondamentale per addestrare molti modelli, incluse le reti neurali. -
Gradiente accelerato di Nesterov (NAG)
Variante del metodo del momento che calcola il gradiente in un punto anticipato, ottenuto proiettando in avanti i parametri secondo la velocità accumulata; ne migliora la stabilità e la velocità di convergenza. -
Grid Search
Metodo di ottimizzazione degli iperparametri che valuta in modo sistematico tutte le combinazioni di una griglia di valori predefinita. È esaustivo e semplice, ma il costo cresce esponenzialmente con il numero di parametri, tanto da risultare spesso meno efficiente della ricerca casuale. -
Ground Truth
Il valore reale e corretto associato a un esempio, usato come riferimento per addestrare un modello e misurarne le previsioni. Rappresenta la verità di riferimento e la sua qualità determina il limite massimo delle prestazioni ottenibili. -
H
-
Hinge Loss
Funzione di perdita usata soprattutto dalle Support Vector Machine, che penalizza le predizioni non solo errate ma anche corrette con margine insufficiente. Spinge il modello a separare le classi con il massimo margine possibile, restando a zero solo oltre una certa soglia di confidenza. -
Holdout Set
Porzione di dati tenuta da parte e mai usata durante l'addestramento, riservata alla valutazione finale del modello. Fornisce una stima imparziale delle prestazioni su dati nuovi, ma con un solo campione è più soggetta a variabilità rispetto alla cross-validation. -
Huber Loss
Funzione di perdita che si comporta come l'errore quadratico per residui piccoli e come l'errore assoluto per quelli grandi. Combina sensibilità e robustezza, riducendo l'influenza eccessiva degli outlier tipica dello scarto quadratico puro. -
Hyperband
Algoritmo di ottimizzazione degli iperparametri che estende il dimezzamento successivo provando diversi compromessi tra numero di configurazioni e risorse assegnate, per allocare in modo efficiente il budget di calcolo. -
Hyperparameter
Parametro di configurazione impostato prima dell'addestramento, come il learning rate, il numero di strati o la forza di regolarizzazione. Non viene appreso dai dati ma scelto dal progettista, di solito tramite ricerca e validazione. -
Hyperparameter Tuning
Ricerca della combinazione di iperparametri che massimizza le prestazioni di un modello, valutate su dati di validazione. Si realizza con strategie come grid search, random search o metodi bayesiani, ed è un passaggio cruciale per ottenere risultati competitivi. -
I
-
Imbalanced Dataset
Dataset in cui una classe è molto più frequente delle altre. Rende ingannevole l'accuratezza, perché un modello può ottenere punteggi alti prevedendo sempre la classe maggioritaria, e richiede tecniche dedicate come ricampionamento o metriche mirate. -
Implicit Feedback
Segnali indiretti sulle preferenze degli utenti, come clic, tempo di permanenza o acquisti, in assenza di valutazioni esplicite. È abbondante ma ambiguo, poiché un'interazione non indica necessariamente gradimento. -
Imputazione
Processo di sostituzione dei valori mancanti con stime plausibili, come media, mediana o valori predetti da un modello. Consente di usare algoritmi che non tollerano dati assenti, con il rischio di introdurre distorsioni se fatta male. -
Indice di Jaccard
Metrica di similarità pari alla dimensione dell'intersezione divisa per quella dell'unione tra insieme di etichette previste e reali; varia da 0 a 1 ed è usata soprattutto nella classificazione multi-etichetta. -
Inductive Bias
Insieme di assunzioni che un modello adotta per generalizzare a dati non visti, andando oltre le sole osservazioni di addestramento. Senza queste ipotesi l'apprendimento sarebbe impossibile; esse determinano quali soluzioni il modello preferisce. -
Inference
Fase in cui un modello già addestrato produce previsioni su nuovi dati, distinta dalla fase di addestramento. È l'uso pratico del modello in produzione, dove contano soprattutto la latenza e il costo computazionale delle predizioni. -
Information Gain
Riduzione dell'entropia ottenuta suddividendo i dati secondo una feature; misura quanto quella variabile aiuta a separare le classi. Gli alberi decisionali scelgono a ogni passo la suddivisione che massimizza il guadagno informativo. -
Isolation Forest
Algoritmo non supervisionato per il rilevamento di anomalie che isola i punti con partizionamenti casuali dello spazio. Gli outlier, essendo pochi e diversi, richiedono meno tagli per essere separati e ricevono così un punteggio di anomalia più alto. -
Isotonic Regression
Tecnica di calibrazione non parametrica che apprende una funzione monotona per mappare i punteggi di un modello in probabilità. Più flessibile del Platt scaling, richiede però più dati per non sovradattarsi. -
K
-
K-Fold Cross-Validation
Tecnica di validazione che divide i dati in K parti uguali, usando a turno una parte per la verifica e le restanti per l'addestramento. La stima finale è la media dei K cicli, riducendo la dipendenza da una singola suddivisione dei dati. -
K-Means
Algoritmo di clustering che partiziona i dati in K gruppi, assegnando ogni punto al centroide più vicino e ricalcolando iterativamente i centroidi. Richiede di fissare K in anticipo e converge a un minimo locale, sensibile all'inizializzazione. -
k-medoidi (k-medoids)
Algoritmo di clustering per partizione simile a k-means, ma che usa come centro di ogni cluster un punto reale dei dati (medoide) anziché la media. È più robusto agli outlier e utilizzabile con metriche di distanza arbitrarie. -
K-Nearest Neighbors (KNN)
Algoritmo che classifica o predice un esempio in base ai suoi K vicini più prossimi nello spazio delle feature. Non ha una vera fase di addestramento, ma il costo di predizione e la sensibilità alla scala e alla dimensionalità crescono con i dati. -
Kernel Trick
Espediente che consente ad algoritmi come le SVM di operare in uno spazio di caratteristiche ad alta dimensione senza calcolarne esplicitamente le coordinate, usando solo prodotti scalari tramite una funzione kernel. Rende trattabili separazioni non lineari. -
L
-
L-BFGS
Metodo quasi-Newton a memoria limitata che approssima l'inversa dell'hessiana conservando solo gli ultimi aggiornamenti di parametri e gradiente; è efficiente in memoria ed è un solutore comune per la regressione logistica. -
Label
La risposta corretta associata a un esempio nei dati supervisionati, ciò che il modello impara a prevedere. Può essere una classe nella classificazione o un valore numerico nella regressione, e la sua qualità è determinante per l'apprendimento. -
Label Encoding
Conversione di categorie in numeri interi, una etichetta per valore distinto. È semplice e compatta, ma introduce un ordine numerico inesistente tra le categorie, per cui su variabili nominali si preferisce spesso il one-hot encoding. -
Label Noise
Presenza di etichette errate nei dati di addestramento, dovute a errori di annotazione o ambiguità. Degrada le prestazioni e può portare il modello a memorizzare errori; esistono metodi di apprendimento robusti pensati per attenuarne l'effetto. -
Label Propagation
Algoritmo semi-supervisionato che diffonde le etichette note ai punti vicini lungo un grafo di similarità fra esempi. Sfrutta l'ipotesi che dati simili condividano l'etichetta, propagandola dalle poche istanze annotate a quelle non etichettate. -
Lasso Regression
Regressione lineare con penalità L1 sui coefficienti, che tende ad azzerare i pesi delle variabili meno utili. Esegue così una selezione automatica delle feature, producendo modelli sparsi e più interpretabili rispetto alla regressione ordinaria. -
Learning Curve
Grafico che mostra come l'errore su training e validation set evolve al crescere dei dati o delle epoche di addestramento. Serve a diagnosticare overfitting (ampio divario fra le due curve) o underfitting (errore alto e vicino su entrambe), guidando la scelta se raccogliere più dati o aumentare la capacità del modello. -
Learning Rate
Iperparametro che regola l'ampiezza dell'aggiornamento dei pesi a ogni passo della discesa del gradiente. Se troppo alto l'addestramento oscilla o diverge, se troppo basso converge molto lentamente: è uno dei parametri più critici da tarare. -
Learning Rate Scheduling
Strategia che fa variare il learning rate durante l'addestramento anziché tenerlo fisso, tipicamente riducendolo nel tempo o con cicli. Aiuta a convergere più rapidamente all'inizio e a rifinire con precisione i pesi nelle fasi finali. -
Learning to Rank
Famiglia di tecniche di apprendimento supervisionato che addestrano un modello a ordinare un insieme di elementi per rilevanza, anziché a classificarli o predirne un valore. È alla base di motori di ricerca e sistemi di raccomandazione, dove conta l'ordine dei risultati. -
Leave-One-Out Cross-Validation
Caso estremo di cross-validation in cui ogni singolo esempio a turno funge da set di test mentre tutti gli altri addestrano il modello. Offre una stima quasi non distorta dell'errore ma è molto costosa su dataset grandi. -
Lift
Misura di quanto un modello migliori la selezione di casi positivi rispetto a una scelta casuale, all'interno di un dato sottoinsieme ordinato per punteggio. È molto usata in marketing per valutare campagne e segmentazioni. -
LightGBM
Libreria di gradient boosting su alberi decisionali che usa il binning a istogramma delle caratteristiche e la crescita foglia per foglia (leaf-wise). Offre addestramento veloce e basso consumo di memoria su grandi dataset. -
Linear Discriminant Analysis (LDA)
Tecnica supervisionata che cerca le combinazioni lineari di variabili che separano al meglio le classi, massimizzando la varianza tra classi rispetto a quella interna. È usata sia per la riduzione della dimensionalità sia come classificatore. -
Locally Linear Embedding (LLE)
Metodo di apprendimento di varietà (manifold) che riduce la dimensionalità preservando le relazioni lineari locali: ogni punto è ricostruito come combinazione dei propri vicini e si cerca una proiezione a bassa dimensione che ne mantenga i pesi. -
Log Loss
Metrica che valuta previsioni probabilistiche penalizzando gli errori tanto più quanto sono espressi con alta confidenza. Coincide con l'entropia incrociata e premia i modelli ben calibrati; è minima quando le probabilità stimate coincidono con quelle reali. -
Loss Function
Funzione che quantifica quanto le previsioni di un modello si discostano dai valori reali su un esempio o sull'intero dataset. L'addestramento consiste nel minimizzarla; la sua scelta dipende dal compito, ad esempio l'errore quadratico per la regressione. -
M
-
Macro e Micro Averaging
Due modi di aggregare una metrica su più classi: la media macro tratta ogni classe con lo stesso peso, la media micro pesa in base al numero di esempi. La scelta cambia il giudizio in presenza di classi sbilanciate. -
Margine
Distanza fra il confine di decisione e gli esempi più vicini di ciascuna classe. Massimizzare il margine, come fanno le SVM, tende a produrre classificatori con migliore capacità di generalizzazione e maggiore robustezza al rumore. -
Matrix Factorization
Tecnica che scompone la matrice utenti-item in fattori latenti a bassa dimensione, rivelando dimensioni nascoste di preferenza. È stata un pilastro dei sistemi di raccomandazione, capace di prevedere valutazioni mancanti. -
Matthews Correlation Coefficient (MCC)
Coefficiente che riassume in un solo valore la qualità di una classificazione binaria tenendo conto di tutte le celle della matrice di confusione. È particolarmente affidabile con classi sbilanciate, dove l'accuratezza risulta ingannevole. -
Mean Absolute Error (MAE)
Media dei valori assoluti degli scarti tra previsioni e valori reali. Esprime l'errore nell'unità di misura della variabile ed è più robusta agli outlier rispetto all'errore quadratico, perché non ne amplifica gli scarti grandi. -
Mean shift
Algoritmo di clustering non parametrico che sposta iterativamente ogni punto verso la media dei campioni contenuti in una finestra (bandwidth), convergendo ai modi della densità stimata. Non richiede di specificare a priori il numero di cluster. -
Mean Squared Error (MSE)
Media dei quadrati degli scarti tra previsioni e valori reali. Elevando al quadrato penalizza fortemente gli errori grandi ed è sensibile agli outlier; la sua radice, RMSE, riporta l'errore nell'unità di misura originale della variabile. -
Metodi filtro, wrapper ed embedded
Le tre famiglie di selezione delle feature: i metodi filtro le valutano con criteri statistici indipendenti dal modello, i wrapper provano sottoinsiemi addestrando un modello, gli embedded selezionano durante l'addestramento come nel Lasso. -
Metodo del gomito (elbow method)
Euristica per scegliere il numero di cluster k: si traccia una metrica di errore (tipicamente l'inerzia) al variare di k e si individua il valore in corrispondenza del quale la curva forma un gomito, oltre cui i miglioramenti diventano marginali. -
Metodo di Newton
Metodo di ottimizzazione del secondo ordine che aggiorna i parametri usando l'inversa della matrice hessiana oltre al gradiente; converge in pochi passi ma è costoso perché richiede il calcolo e l'inversione dell'hessiana. -
Min-Max Scaling
Normalizzazione che riscala i valori di una feature in un intervallo fisso, tipicamente fra 0 e 1. Preserva la forma della distribuzione ma è sensibile agli outlier, che possono comprimere il resto dei dati. -
Mini-Batch Gradient Descent
Variante della discesa del gradiente che aggiorna i pesi su piccoli gruppi di esempi anziché su uno solo o sull'intero dataset. Unisce la stabilità del metodo batch alla velocità di quello stocastico ed è lo standard nell'addestramento delle reti. -
Minimi quadrati ordinari (OLS)
Metodo di stima dei parametri di un modello di regressione lineare che minimizza la somma dei quadrati dei residui, ossia delle differenze tra valori osservati e valori predetti dal modello. Sotto le ipotesi di Gauss-Markov fornisce gli stimatori lineari non distorti a varianza minima. -
Missing Data
Valori assenti in un dataset, dovuti a errori di raccolta o mancate risposte. Molti algoritmi non li tollerano, per cui vanno gestiti rimuovendo righe o colonne oppure stimandoli tramite imputazione; il meccanismo che li genera influenza la strategia migliore. -
Model Capacity
Misura di quanto un modello è in grado di rappresentare relazioni complesse, legata al numero di parametri e alla ricchezza della famiglia di funzioni. Troppa capacità favorisce l'overfitting, troppo poca l'underfitting: va bilanciata con i dati disponibili. -
Model Deployment
Messa in produzione di un modello addestrato perché fornisca previsioni a utenti o sistemi reali, tramite API, servizio o batch. Trasforma un esperimento in un servizio utilizzabile e monitorabile. -
Model Drift
Calo di prestazioni di un modello nel tempo perché i dati reali si allontanano da quelli di addestramento (data o concept drift). Richiede monitoraggio e riaddestramento periodico. -
Model Registry
Sistema centralizzato che cataloga i modelli addestrati con versioni, metriche, metadati e stato del ciclo di vita. Garantisce tracciabilità e riproducibilità, facilitando promozione, rollback e governance dei modelli in produzione. -
Modello
Rappresentazione appresa dai dati durante l'addestramento: la funzione con i suoi parametri che, dato un input, produce previsioni o classificazioni. È il risultato prodotto dall'algoritmo di apprendimento, non l'algoritmo stesso. -
Momentum
Tecnica che accelera il gradient descent accumulando la direzione dei passi precedenti in una media mobile. Riduce le oscillazioni e aiuta a superare piccoli avvallamenti della funzione di costo. -
Multi-Label Classification
Problema di classificazione in cui a ogni esempio possono essere associate contemporaneamente più etichette, non mutuamente esclusive. Si distingue dalla classificazione multi-classe, dove si sceglie una sola categoria, e richiede metriche e strategie di addestramento dedicate. -
Multicollinearità
Situazione in cui due o più variabili predittive di un modello sono fortemente correlate fra loro. Rende instabili e difficili da interpretare i coefficienti stimati, pur non danneggiando necessariamente la capacità predittiva complessiva. -
Multilayer Perceptron (MLP)
Rete neurale feed-forward con uno o più strati nascosti tra ingresso e uscita e funzioni di attivazione non lineari. Può approssimare relazioni complesse e non lineari fra input e output. -
N
-
Nadam
Ottimizzatore che combina Adam con il momento di Nesterov: applica la correzione anticipata del gradiente al metodo a momenti adattivi, spesso accelerando la convergenza rispetto ad Adam. -
Naive Bayes
Classificatore probabilistico basato sul teorema di Bayes che assume l'indipendenza condizionata delle caratteristiche data la classe. Veloce ed efficace, in particolare nella classificazione di testi. -
NDCG
Metrica di valutazione per problemi di ranking che premia il collocare gli elementi più rilevanti in cima alla lista, scontando la rilevanza in base alla posizione. Normalizzata rispetto all'ordinamento ideale, restituisce un valore fra 0 e 1. -
Nested Cross-Validation
Schema di validazione con due cicli annidati: quello interno seleziona gli iperparametri, quello esterno stima le prestazioni del modello così ottimizzato. Fornisce una valutazione meno ottimistica rispetto alla cross-validation semplice, perché la scelta degli iperparametri non contamina la stima finale dell'errore. -
Neurone artificiale
Unità di base di una rete neurale: combina gli input pesati, aggiunge un bias e applica una funzione di attivazione. Ispirato in modo lontano al neurone biologico. -
No Free Lunch Theorem
Principio per cui, mediando su tutti i problemi possibili, nessun algoritmo di apprendimento è superiore agli altri. La scelta va calibrata sul compito specifico e sulle sue assunzioni. -
Normalizzazione
Riscalatura dei valori di una variabile in un intervallo fisso, tipicamente tra 0 e 1. Uniforma le scale delle feature prima dell'addestramento, evitando che quelle con range ampio dominino. -
O
-
One-Hot Encoding
Rappresentazione di una variabile categorica con colonne binarie, una per ciascun valore possibile, dove solo la colonna corrispondente vale 1. Evita di introdurre falsi ordinamenti tra le categorie. -
One-vs-Rest (OvR)
Strategia che affronta la classificazione multi-classe addestrando un classificatore binario per ogni classe contro tutte le altre. In predizione si sceglie la classe con il punteggio più alto; è semplice ma può soffrire di sbilanciamento fra i sottoproblemi. -
Online Learning
Modalità in cui il modello si aggiorna in modo incrementale man mano che arrivano nuovi dati, uno o pochi alla volta, senza rivedere l'intero dataset. Adatto a flussi continui e contesti che cambiano. -
OPTICS
Algoritmo di clustering basato sulla densità che, come DBSCAN, non richiede il numero di cluster ma produce un ordinamento dei punti che rappresenta la struttura di densità a più livelli, permettendo di estrarre cluster con densità differenti. -
Ordinal Encoding
Codifica che assegna alle categorie numeri interi secondo un ordine. È appropriata solo quando esiste una gerarchia naturale fra i valori, altrimenti introduce relazioni d'ordine inesistenti che possono fuorviare il modello. -
Ordinal Regression
Tecnica per predire una variabile categorica le cui classi hanno un ordine naturale ma non una distanza numerica definita, come i livelli di un giudizio da 1 a 5. Sta a metà fra classificazione e regressione, sfruttando l'ordinamento delle categorie senza trattarle come numeri. -
Out-of-Bag Error
Stima dell'errore di un modello a foreste casuali calcolata usando, per ogni albero, i soli campioni non estratti nel suo campione bootstrap. Fornisce una valutazione delle prestazioni quasi gratuita, senza bisogno di un set di validazione separato. -
Out-of-Distribution (OOD)
Condizione in cui un dato in ingresso proviene da una distribuzione diversa da quella vista durante l'addestramento. Un modello tende a produrre predizioni inaffidabili ma spesso troppo sicure sui campioni OOD, per questo il loro rilevamento è cruciale per la robustezza e la sicurezza dei sistemi ML. -
Outlier
Valore molto distante dagli altri, dovuto a errore di misura o a un caso raro. Può distorcere l'addestramento e le statistiche del modello se non individuato o trattato. -
Overfitting
Adattamento eccessivo del modello ai dati di addestramento, di cui apprende anche il rumore, con conseguente perdita di capacità di generalizzare a dati nuovi. -
Oversampling
Aumento del numero di esempi della classe minoritaria, per duplicazione o generazione sintetica (es. SMOTE), per riequilibrare un dataset sbilanciato. Aiuta il modello a non ignorare i casi rari. -
P
-
Partial Dependence Plot
Grafico che mostra l'effetto marginale di una o due feature sulla predizione del modello, mediando l'influenza di tutte le altre. Serve a capire la direzione e la forma della relazione appresa fra una variabile e l'output, oltre il semplice valore di importanza. -
Perceptron
Il neurone artificiale più semplice: somma pesata degli input seguita da una funzione a soglia che restituisce una decisione binaria. È il mattone storico delle reti neurali. -
Perdita di Hamming (Hamming loss)
Metrica per la classificazione, in particolare multi-etichetta, pari alla frazione media di etichette predette in modo errato; vale 0 con predizione perfetta ed è più tollerante della perdita zero-uno. -
Platt Scaling
Metodo di calibrazione che trasforma i punteggi grezzi di un classificatore in probabilità adattandovi una funzione logistica (sigmoide). È usato tipicamente con le SVM per ottenere output probabilistici affidabili anziché semplici segni di decisione. -
Polynomial Features
Nuove variabili ottenute elevando a potenza o moltiplicando fra loro le feature originali, per permettere a modelli lineari di cogliere relazioni non lineari. Aumentano l'espressività ma anche il rischio di overfitting e il numero di dimensioni. -
Posterior Probability
Probabilità di un'ipotesi dopo aver osservato i dati, ottenuta dal teorema di Bayes combinando probabilità a priori e verosimiglianza. Aggiorna una stima iniziale alla luce delle evidenze. -
Precision
Tra gli esempi previsti come positivi, la frazione che lo era davvero (veri positivi su predetti positivi). Misura quanto ci si può fidare di una previsione positiva. -
Precision at K
Metrica di ranking che misura la frazione di elementi rilevanti fra i primi K risultati proposti. È usata quando all'utente interessa solo la parte alta della lista, come nei motori di ricerca e nei sistemi di raccomandazione. -
Precision-Recall Curve
Grafico che mette in relazione precision e recall al variare della soglia di decisione. Più informativo della curva ROC quando i dati sono molto sbilanciati. -
Predizione strutturata (Structured Prediction)
Compito supervisionato in cui l'output non è un singolo valore ma un oggetto strutturato con parti interdipendenti, come una sequenza, un albero o un grafo; esempi tipici sono l'etichettatura di sequenze e il parsing sintattico. -
Previsione di serie temporali (Time Series Forecasting)
Compito che stima i valori futuri di una grandezza a partire dalle sue osservazioni passate ordinate nel tempo, sfruttando componenti come trend e stagionalità; applicato a domanda, prezzi, consumi energetici e meteo. -
Principal Component Analysis (PCA)
Tecnica di riduzione della dimensionalità che proietta i dati su nuove variabili ortogonali (componenti principali) ordinate per varianza spiegata, conservando la maggior variabilità possibile in poche dimensioni. -
Propagazione dell'affinità (Affinity Propagation)
Algoritmo di clustering che individua un insieme di esemplari rappresentativi scambiando messaggi di responsabilità e disponibilità tra i punti. Determina automaticamente il numero di cluster, ma ha complessità quadratica nel numero di campioni. -
Pseudo-Labeling
Metodo semi-supervisionato in cui un modello addestrato sui dati etichettati assegna etichette provvisorie ai dati non etichettati, che vengono poi riusati per riaddestrarlo. Sfrutta grandi quantità di dati non annotati, con il rischio di rinforzare i propri errori se le pseudo-etichette sono sbagliate. -
Q
-
Quantile Regression
Tecnica di regressione che stima quantili condizionati della variabile obiettivo, ad esempio la mediana, anziché la sola media. Fornisce un quadro più completo della distribuzione ed è robusta agli outlier. -
R
-
R-squared (R²)
Indice che misura la quota di variabilità della variabile obiettivo spiegata da un modello di regressione. Vale 1 per un adattamento perfetto e 0 per un modello equivalente alla media; può essere negativo per modelli peggiori. -
Radial Basis Function (RBF)
Funzione kernel il cui valore dipende dalla distanza fra due punti, molto usata nelle SVM per creare confini di decisione flessibili e non lineari. Un iperparametro (gamma) ne regola l'ampiezza, controllando quanto localmente il modello reagisce ai dati. -
Radice dell'errore quadratico medio (RMSE)
Metrica di errore per la regressione pari alla radice quadrata dell'errore quadratico medio; esprime lo scarto tipico tra valori previsti e osservati nella stessa unità di misura del target e penalizza più fortemente gli errori grandi. -
Random Forest
Insieme di molti alberi decisionali, addestrati su campioni bootstrap e sottoinsiemi casuali di feature, le cui previsioni vengono aggregate per voto o media. Più robusto e accurato di un singolo albero e meno soggetto a overfitting. -
Random Search
Metodo di ottimizzazione degli iperparametri che campiona combinazioni casuali dallo spazio di ricerca. Spesso trova buone soluzioni più in fretta della ricerca a griglia, soprattutto quando pochi iperparametri sono davvero influenti. -
Recall
Tra gli esempi realmente positivi, la frazione che il modello ha individuato (veri positivi su totale positivi). Misura la capacità di non lasciarsi sfuggire i casi rilevanti. -
Recall at K
Metrica che indica quanti degli elementi rilevanti totali compaiono fra i primi K risultati. Complementare alla precision a K, valuta la capacità del sistema di recuperare gli item importanti in una lista di lunghezza limitata. -
Recommendation System
Sistema che suggerisce contenuti o prodotti in base a preferenze e comportamenti degli utenti, tipicamente con approcci di filtraggio collaborativo o basato sul contenuto. Alla base di piattaforme di streaming ed e-commerce. -
Regole di associazione
Tecnica di data mining non supervisionata che individua relazioni frequenti del tipo se-allora tra insiemi di elementi (itemset) nei dati. Le regole si valutano con misure come supporto, confidenza e lift; tipico esempio è l'analisi del carrello. -
Regressione
Categoria di problemi di apprendimento supervisionato in cui il modello predice un valore numerico continuo a partire dalle feature di ingresso. -
Regressione a vettori di supporto (SVR)
Estensione delle macchine a vettori di supporto ai problemi di regressione: cerca una funzione che si discosti dai valori osservati al più di una tolleranza epsilon, penalizzando solo gli errori oltre tale margine e usando il trucco del kernel per relazioni non lineari. -
Regressione di Poisson
Modello lineare generalizzato per variabili di conteggio in cui la risposta segue una distribuzione di Poisson e il logaritmo del valore atteso è funzione lineare dei predittori. Si usa quando l'esito è un numero di eventi non negativo. -
Regressione lineare
Algoritmo che modella la relazione tra variabili come combinazione lineare delle feature, stimando la retta (o iperpiano) che meglio approssima i dati. Predice valori continui in modo semplice e interpretabile. -
Regressione logistica
Algoritmo di classificazione che stima, tramite la funzione logistica, la probabilità che un esempio appartenga a una classe. Nonostante il nome, serve a separare categorie, non a predire valori continui. -
Regularizzazione
Controllo della complessità. Tecnica per evitare l’overfitting penalizzando modelli troppo complessi. -
ReLU
Funzione di attivazione che lascia passare i valori positivi e azzera i negativi. Semplice ed efficace, attenua il problema dei gradienti che svaniscono. -
Rete Neurale
Modello ispirato al cervello. Struttura composta da nodi (neuroni) interconnessi che elaborano informazioni. -
Reti bayesiane
Modelli grafici probabilistici in cui un grafo aciclico diretto rappresenta le dipendenze condizionali tra variabili casuali. Ogni nodo porta una distribuzione condizionata ai genitori e permette di calcolare in modo efficiente probabilità e inferenze. -
Ridge Regression
Regressione lineare con penalità sui pesi grandi (norma L2). Riduce l’overfitting mantenendo tutte le variabili. -
Rilevamento di novità (Novelty Detection)
Individuazione di osservazioni che si discostano dai dati normali, addestrando il modello su un insieme non contaminato da anomalie; a differenza del rilevamento di outlier, è considerato rilevamento di anomalie semi-supervisionato. -
RMSprop
Ottimizzatore che adatta il learning rate dividendo il gradiente per la radice della media mobile dei suoi quadrati. Stabilizza l’addestramento normalizzando gli aggiornamenti su gradienti irregolari. -
Robust Scaling
Ridimensionamento delle feature basato su mediana e scarto interquartile anziché su media e deviazione standard. Essendo insensibile ai valori estremi, è preferibile quando i dati contengono outlier marcati. -
ROC Curve
Grafico che mostra il compromesso tra veri positivi e falsi positivi al variare della soglia. Aiuta a scegliere il punto di lavoro. -
S
-
Saddle Point
Punto in cui il gradiente è nullo ma non è né minimo né massimo. Può rallentare l’ottimizzazione delle reti neurali. -
Sampling Bias
Distorsione che nasce quando il campione raccolto non rappresenta fedelmente la popolazione di interesse. Un modello addestrato su dati non rappresentativi generalizza male, riproducendo le lacune della raccolta. -
Scaling multidimensionale (MDS)
Famiglia di tecniche di riduzione dimensionale che collocano i dati in uno spazio a bassa dimensione preservando il più possibile le distanze o dissimilarità a coppie tra i punti originari. È usata soprattutto per la visualizzazione dei dati. -
Selection Bias
Errore sistematico dovuto al modo in cui gli esempi vengono selezionati per l'analisi, che li rende non casuali rispetto al fenomeno studiato. Può portare a conclusioni valide solo per il sottoinsieme osservato e non per la realtà completa. -
Selezione univariata delle feature
Metodo di selezione che valuta ogni feature singolarmente con un test statistico rispetto al target e conserva le migliori, ad esempio con SelectKBest o SelectPercentile; funge da rapido passo di pre-elaborazione. -
Shadow Deployment
Rilascio in cui un nuovo modello riceve il traffico reale in parallelo a quello in produzione senza però influenzare le decisioni. Consente di validarne il comportamento su dati veri prima di affidargli le risposte effettive. -
SHAP
Metodo che attribuisce a ciascuna variabile il suo contributo a una previsione. Aiuta a interpretare anche modelli complessi. -
Sigmoid
Funzione di attivazione che schiaccia i valori tra 0 e 1. Utile per stimare probabilità, ma soggetta a gradienti molto piccoli agli estremi. -
Silhouette Score
Metrica che valuta quanto i cluster sono compatti e ben separati. Aiuta a scegliere il numero di gruppi. -
SMOTE
Tecnica che crea nuovi esempi sintetici della classe minoritaria interpolando quelli esistenti. Riequilibra senza semplici duplicati. -
Softmax
Funzione che trasforma un vettore di numeri in una distribuzione di probabilità che somma a uno. Usata nell’uscita dei classificatori multi-classe. -
Soglia di varianza (variance threshold)
Tecnica di selezione delle feature di tipo filtro che rimuove le variabili la cui varianza è inferiore a una soglia prefissata, eliminando le feature quasi costanti che apportano poca informazione al modello. -
Specificity
Proporzione di casi negativi correttamente identificati come tali da un classificatore. Complementare alla sensibilità, è cruciale in contesti come lo screening medico, dove contano sia i falsi positivi sia i falsi negativi. -
Spurious Correlation
Correlazione statistica fra due variabili priva di un reale legame causale, spesso dovuta al caso o a un fattore comune nascosto. I modelli possono sfruttarla in addestramento e poi fallire quando quella coincidenza svanisce. -
Stacking
Tecnica ensemble in cui le previsioni di più modelli diventano input di un modello finale. Combina i punti di forza di approcci diversi. -
Standardizzazione
Trasformazione dei dati perché abbiano media zero e deviazione standard uno. Utile per molti algoritmi sensibili alla scala. -
Statistica J di Youden
Indice che riassume la capacità discriminante di un classificatore come sensibilità più specificità meno uno; il suo massimo sulla curva ROC individua la soglia di decisione ottimale ed è indipendente dalla prevalenza. -
Stima della densità (Density Estimation)
Compito, tipicamente non supervisionato, che stima la funzione di densità di probabilità che ha generato i dati a partire da un campione; può essere parametrica o non parametrica, come nella stima kernel (KDE). -
Stochastic Gradient Descent (SGD)
Variante del gradient descent che aggiorna i pesi usando un esempio alla volta. Più rapido e adatto a grandi dataset. -
Stratified Sampling
Campionamento che preserva nelle partizioni le stesse proporzioni fra le classi presenti nel dataset completo. È essenziale con classi sbilanciate, perché evita che train o test finiscano privi di una categoria o ne alterino la frequenza. -
Support Vector Machine (SVM)
Algoritmo che separa le classi trovando il confine con il margine più ampio. Efficace anche in spazi a molte dimensioni. -
SVM a una classe (One-Class SVM)
Variante non supervisionata delle macchine a vettori di supporto per il rilevamento di anomalie: apprende una frontiera che racchiude i dati normali di addestramento e classifica come anomali i punti che ne cadono al di fuori. -
T
-
t-SNE
Tecnica di riduzione dimensionale pensata per visualizzare dati ad alte dimensioni in 2 o 3D. Preserva la vicinanza tra punti simili. -
Tanh
Funzione di attivazione che schiaccia i valori tra -1 e 1. Centrata sullo zero, spesso preferita alla sigmoid negli strati nascosti. -
Target Encoding
Tecnica di codifica delle variabili categoriche che sostituisce ogni categoria con una statistica della variabile obiettivo calcolata su quella categoria, tipicamente la media. È potente con categorie ad alta cardinalità, ma va applicata con schemi di regolarizzazione o out-of-fold per evitare data leakage. -
Tasso di falsi positivi (FPR)
Proporzione di esempi negativi erroneamente classificati come positivi, pari a FP/(FP+VN); è l'asse orizzontale della curva ROC, complementare alla specificità, e cresce al diminuire della soglia di decisione. -
Tensore
Struttura dati multidimensionale che generalizza vettori e matrici. È il formato con cui le reti neurali rappresentano e muovono i dati. -
Tomek Links
Coppie di esempi di classi diverse che sono reciprocamente i più vicini. Rimuoverli, tipicamente eliminando l'elemento della classe maggioritaria, pulisce i confini fra le classi ed è usato per bilanciare i dataset sbilanciati. -
Train-Test Split
Divisione dei dati in una parte per addestrare e una per valutare. Misura come il modello si comporta su esempi mai visti. -
Training Set
Porzione di dati su cui il modello impara, regolando i propri parametri. È la parte più consistente del dataset. -
Transfer Learning
Riuso di un modello già addestrato su un compito come punto di partenza per un altro. Risparmia dati e tempo sfruttando conoscenza preesistente. -
Transformers
Architettura basata sul meccanismo di attenzione per elaborare dati sequenziali senza ricorrenza. È la base di modelli come GPT e BERT. -
Trasformazione di potenza
Famiglia di trasformazioni, come Box-Cox e Yeo-Johnson, che rende una distribuzione più simile a una gaussiana. Stabilizza la varianza e attenua l'asimmetria, migliorando le prestazioni dei modelli sensibili alla forma dei dati. -
Tree Pruning
Potatura di un albero decisionale che rimuove rami poco utili per contenere l'overfitting e migliorare la generalizzazione. Può avvenire fermando la crescita in anticipo o tagliando a posteriori i rami che non riducono l'errore di validazione. -
U
-
UMAP
Tecnica di riduzione dimensionale per visualizzazione, spesso più veloce del t-SNE. Mantiene meglio la struttura globale dei dati. -
Underfitting
Situazione in cui il modello è troppo semplice per cogliere gli schemi dei dati. Sbaglia sia in addestramento sia su nuovi esempi. -
Undersampling
Riduzione degli esempi della classe maggioritaria per riequilibrare i dati. Veloce, ma rischia di scartare informazione utile. -
V
-
Validazione
Verifica delle prestazioni del modello su dati non usati per addestrarlo, così da regolarne gli iperparametri e stimarne la capacità di generalizzare. -
Vanishing Gradient
Problema per cui i gradienti diventano minuscoli nelle reti profonde, bloccando l’apprendimento dei primi strati. Mitigato da ReLU e altre tecniche. -
Variance Inflation Factor (VIF)
Indice che quantifica quanto la varianza del coefficiente di una variabile sia gonfiata dalla sua correlazione con le altre. Valori elevati segnalano multicollinearità e suggeriscono di rimuovere o combinare le variabili ridondanti. -
Voto di maggioranza (majority voting)
Tecnica ensemble che combina le previsioni di più classificatori scegliendo la classe più votata (voto hard) oppure mediando le probabilità stimate (voto soft). Migliora robustezza e accuratezza rispetto ai singoli modelli. -
W
-
Warm Start
Tecnica in cui l'addestramento di un modello riparte dai parametri di un modello già allenato invece che da un'inizializzazione casuale. Accelera la convergenza ed è utile quando arrivano nuovi dati o si riaddestra frequentemente, riducendo il costo computazionale rispetto a ripartire da zero. -
Weight Decay
Forma di regolarizzazione che spinge i pesi verso valori piccoli. Riduce l’overfitting penalizzando la complessità. -
Weight Initialization
Scelta dei valori iniziali dei pesi prima dell’addestramento. Una buona inizializzazione accelera la convergenza ed evita problemi sui gradienti. -
X
-
XGBoost
Implementazione ottimizzata e molto efficiente del gradient boosting. Popolarissima nelle competizioni per velocità e prestazioni. -
Z
-
Zero-Shot Learning
Capacità di affrontare compiti mai visti in addestramento, senza esempi specifici. Si basa su descrizioni o conoscenza trasferita da altri ambiti.