Il sito che ti spiega l'AI.
News, strumenti e guide in italiano.
Corsi e formazione

Matematica per il machine learning: cosa ti serve davvero e come studiarla

Algebra lineare, calcolo, probabilità e ottimizzazione: la guida alla matematica per il machine learning, con un percorso di studio passo dopo passo.

FA
Franco Artigiano IA Franco Artigiano
Settembre 27, 2026
Lettura: 18 min
Formule matematiche e figure geometriche che rappresentano la matematica alla base del machine learning
fonte: pixabay 1044090

Chi si avvicina al machine learning prima o poi si scontra con la stessa domanda: quanta matematica serve davvero? La risposta onesta è che ne serve meno di quanto temi per iniziare, ma più di quanto speri per capire a fondo cosa succede dentro un modello. In questa guida trovi una mappa completa e ragionata dei quattro pilastri matematici del machine learning, cioè algebra lineare, calcolo differenziale, probabilità e statistica, ottimizzazione, con spiegazioni intuitive, esempi concreti e un percorso di studio che puoi seguire anche se l’ultima volta che hai visto una derivata eri a scuola.

L’obiettivo non è trasformarti in un matematico, ma darti gli strumenti per leggere una formula senza paura, capire perché un modello impara (o non impara) e scegliere con consapevolezza cosa approfondire in base ai tuoi obiettivi.

Perché la matematica è il vero linguaggio del machine learning

Un modello di machine learning, qualunque sia la sua complessità, è in fondo una funzione matematica con molti parametri regolabili. Riceve numeri in ingresso, li trasforma attraverso una serie di operazioni e restituisce altri numeri in uscita. L’addestramento consiste nel trovare i valori dei parametri che rendono queste uscite il più possibile vicine a quelle desiderate. Tutto questo processo, dalla rappresentazione dei dati fino all’aggiornamento dei pesi, è descritto in termini matematici.

Le librerie moderne come scikit-learn, PyTorch o TensorFlow nascondono gran parte di questi dettagli. Puoi addestrare una rete neurale con poche righe di codice senza scrivere una sola derivata. È un enorme vantaggio per chi vuole sperimentare, ma ha un costo: quando qualcosa va storto, e prima o poi succede, senza basi matematiche resti a tentativi.

Capire la matematica ti serve per fare diagnosi.

Se la loss di un modello non scende, se i gradienti esplodono, se le prestazioni su dati nuovi crollano rispetto a quelle sui dati di addestramento, la spiegazione è quasi sempre matematica. Sapere cosa rappresenta un gradiente, perché la scala delle feature influisce sulla convergenza o cosa significa la varianza di uno stimatore trasforma questi problemi da misteri a questioni risolvibili.

Usare, capire, ricercare: tre livelli diversi

Conviene distinguere tre profili, perché il fabbisogno matematico cambia molto. Chi vuole usare il machine learning in modo applicato, per esempio un analista che costruisce modelli predittivi su dati aziendali, ha bisogno soprattutto di intuizione: capire cosa fa un algoritmo, quali ipotesi fa sui dati e come interpretare le metriche.

Chi vuole capire e sviluppare modelli, come un data scientist o un ML engineer, deve saper leggere e manipolare le formule principali: prodotti tra matrici, derivate parziali, distribuzioni di probabilità, funzioni di costo. Deve essere in grado di seguire un paper divulgativo e di implementare un algoritmo semplice da zero.

Chi fa ricerca, infine, ha bisogno di strumenti avanzati come l’analisi funzionale, la teoria della misura o l’ottimizzazione convessa rigorosa. Questa guida si concentra sui primi due livelli, che coprono la grande maggioranza delle persone interessate.

Il vantaggio di studiare la matematica con uno scopo

Molti abbandonano perché affrontano la matematica come a scuola, in astratto e senza sapere a cosa serva. Studiarla in funzione del machine learning cambia tutto: ogni concetto ha un’applicazione immediata e visibile. Il prodotto scalare diventa una misura di somiglianza tra documenti, la derivata diventa la direzione in cui correggere un errore, la distribuzione normale diventa il modo in cui un modello descrive la propria incertezza.

Questo approccio orientato allo scopo rende lo studio più rapido e soprattutto più motivante.

Algebra lineare: il modo in cui i dati prendono forma

Se dovessi scegliere una sola area da cui partire, sarebbe l’algebra lineare. Nel machine learning quasi tutto è rappresentato come vettore o matrice: un’immagine è una griglia di numeri, una frase diventa una sequenza di vettori chiamati embedding, un intero dataset è una tabella in cui ogni riga è un esempio e ogni colonna una caratteristica.

Vettori, matrici e tensori

Un vettore è semplicemente una lista ordinata di numeri. Se descrivi una casa con superficie, numero di stanze e anno di costruzione, quella casa diventa un vettore a tre dimensioni. Una matrice è una tabella di numeri organizzata in righe e colonne, e un tensore generalizza lo stesso concetto a più dimensioni: un lotto di immagini a colori, per esempio, è un tensore a quattro dimensioni (numero di immagini, altezza, larghezza, canali di colore).

Ragionare in termini di vettori ti permette di trattare i dati come punti in uno spazio geometrico. Esempi simili finiscono vicini, esempi diversi lontani. Molti algoritmi, dal k-nearest neighbors al clustering, si basano proprio su questa intuizione spaziale.

Le operazioni che userai ogni giorno

Il prodotto scalare tra due vettori è forse l’operazione più importante in assoluto. Moltiplichi gli elementi corrispondenti e sommi i risultati: il numero che ottieni misura quanto i due vettori puntano nella stessa direzione. Normalizzandolo ottieni la similarità del coseno, usata per confrontare testi, cercare documenti simili nei sistemi di ricerca semantica e alimentare i motori di raccomandazione.

Il prodotto tra matrici è il cuore computazionale delle reti neurali. Ogni strato di una rete moltiplica il vettore in ingresso per una matrice di pesi e aggiunge un vettore di bias. È per questo che le GPU, progettate per eseguire in parallelo moltissime moltiplicazioni, sono diventate l’hardware di riferimento per l’intelligenza artificiale.

Tra le altre nozioni da conoscere ci sono la trasposta, la matrice identità, l’inversa e il concetto di norma, cioè la lunghezza di un vettore. Le norme L1 e L2 ricompaiono continuamente, per esempio nelle tecniche di regolarizzazione che impediscono ai modelli di diventare troppo complessi.

Autovalori, autovettori e decomposizioni

Un livello più avanzato riguarda autovalori e autovettori. Un autovettore di una matrice è una direzione che la matrice si limita ad allungare o accorciare senza ruotarla, e l’autovalore indica di quanto. Sembra un concetto astratto, ma è alla base della PCA (analisi delle componenti principali), una delle tecniche più usate per ridurre il numero di dimensioni di un dataset mantenendo la maggior parte dell’informazione.

La decomposizione ai valori singolari (SVD) generalizza questa idea a qualsiasi matrice ed è usata nella compressione dei dati, nei sistemi di raccomandazione e nell’analisi semantica dei testi. Anche alcune tecniche moderne per adattare i grandi modelli linguistici a compiti specifici, come LoRA, sfruttano l’idea di approssimare matrici grandi con il prodotto di matrici più piccole, cioè di rango basso.

Non devi saper calcolare una SVD a mano. Devi capire cosa rappresenta e perché è utile.

Calcolo differenziale: come un modello impara dagli errori

Se l’algebra lineare descrive come sono fatti i dati e i modelli, il calcolo differenziale descrive come i modelli migliorano. L’apprendimento, nella stragrande maggioranza degli algoritmi moderni, è un processo di correzione graduale guidato dalle derivate.

Derivate e derivate parziali

La derivata di una funzione in un punto misura quanto velocemente cambia il valore della funzione se modifichi leggermente l’ingresso. Se la derivata è positiva, aumentando l’ingresso l’uscita cresce; se è negativa, l’uscita diminuisce. Quando una funzione dipende da molte variabili, come la funzione di costo di un modello che dipende da milioni di pesi, si usano le derivate parziali: ognuna misura l’effetto di una singola variabile tenendo ferme tutte le altre.

L’insieme di tutte le derivate parziali forma il gradiente, un vettore che punta nella direzione in cui la funzione cresce più rapidamente. Se vuoi ridurre l’errore, ti basta muoverti nella direzione opposta.

Questa è, in una frase, l’idea alla base della discesa del gradiente.

La regola della catena e la backpropagation

Una rete neurale è una composizione di tante funzioni applicate in sequenza, strato dopo strato. Per calcolare come l’errore finale dipende da un peso che si trova in uno strato iniziale, serve la regola della catena, che permette di derivare una funzione composta moltiplicando le derivate delle singole funzioni che la compongono.

L’algoritmo che applica sistematicamente la regola della catena all’indietro, dall’uscita verso l’ingresso, si chiama backpropagation. Se vuoi vedere nel dettaglio come funziona passo dopo passo, trovi una spiegazione completa nella nostra guida su come funziona la backpropagation nelle reti neurali. Qui ti basta sapere che senza la regola della catena l’addestramento delle reti profonde non sarebbe possibile.

Oggi le librerie calcolano i gradienti in automatico grazie alla differenziazione automatica. Capire cosa stanno calcolando, però, ti aiuta a interpretare problemi come la scomparsa o l’esplosione dei gradienti, che dipendono proprio dal prodotto di molte derivate in catena: se sono tutte piccole il prodotto tende a zero, se sono grandi cresce senza controllo.

Funzioni, pendenze e forme della loss

Vale la pena familiarizzare anche con alcune funzioni ricorrenti e con le loro derivate: la funzione esponenziale, il logaritmo, la sigmoide, la tangente iperbolica e la ReLU. Ciascuna ha proprietà che influenzano l’apprendimento. La sigmoide, per esempio, ha derivate molto piccole per valori estremi, ed è uno dei motivi per cui nelle reti profonde è stata in gran parte sostituita dalla ReLU. Ne parliamo in modo approfondito nell’articolo dedicato alle funzioni di attivazione delle reti neurali.

Utile anche il concetto di derivata seconda, che misura la curvatura di una funzione. Nel caso multivariato si parla di matrice hessiana. Non la userai spesso direttamente, ma è alla base di diversi metodi di ottimizzazione e aiuta a capire perché alcune zone della funzione di costo sono più difficili da attraversare di altre.

Probabilità e statistica: ragionare con l’incertezza

I dati reali sono rumorosi, incompleti e variabili. Un modello non può mai essere certo delle proprie previsioni, e il machine learning nasce proprio dall’incontro tra informatica e statistica. Probabilità e statistica ti danno il linguaggio per descrivere l’incertezza, misurarla e prendere decisioni nonostante essa.

Variabili aleatorie e distribuzioni

Una variabile aleatoria è una quantità il cui valore dipende dal caso, come il risultato del lancio di un dado o l’altezza di una persona scelta a caso. La distribuzione di probabilità descrive quali valori può assumere e con quale frequenza. Le distribuzioni che incontrerai più spesso sono la Bernoulli (successo o insuccesso), la binomiale, la categoriale (una scelta tra più classi) e la normale, o gaussiana, con la sua classica forma a campana.

Queste distribuzioni non sono curiosità teoriche. Quando un classificatore restituisce la probabilità che un’email sia spam, sta modellando una Bernoulli. Quando un modello linguistico sceglie la parola successiva, sta campionando da una distribuzione categoriale su tutto il vocabolario, ottenuta tramite la funzione softmax.

Media, varianza e correlazione

Il valore atteso, o media, indica il centro di una distribuzione. La varianza e la deviazione standard misurano quanto i valori si disperdono attorno alla media. La covarianza e la correlazione descrivono come due variabili tendono a variare insieme.

Sono concetti semplici, ma decisivi nella pratica quotidiana. La standardizzazione delle feature, cioè sottrarre la media e dividere per la deviazione standard, è uno dei passaggi più comuni nella preparazione dei dati. La matrice di covarianza è l’oggetto su cui lavora la PCA. E capire che correlazione non significa causalità ti evita errori di interpretazione molto costosi.

Il teorema di Bayes

Il teorema di Bayes descrive come aggiornare una convinzione alla luce di nuove prove. Parti da una probabilità iniziale (a priori), osservi dei dati e ottieni una probabilità aggiornata (a posteriori). È alla base di classificatori come il Naive Bayes, dei filtri antispam storici e di un intero approccio al machine learning, quello bayesiano, che tratta i parametri stessi del modello come quantità incerte.

Anche senza diventare bayesiano convinto, questo teorema ti insegna a ragionare correttamente su problemi come i falsi positivi, che compaiono ogni volta che valuti un modello su un fenomeno raro.

Stima, verosimiglianza e funzioni di costo

Un collegamento spesso sottovalutato riguarda l’origine delle funzioni di costo. Molte di quelle più usate non sono scelte arbitrarie, ma derivano dal principio di massima verosimiglianza: si cercano i parametri che rendono più probabili i dati osservati. Se ipotizzi che gli errori seguano una distribuzione normale, massimizzare la verosimiglianza equivale a minimizzare l’errore quadratico medio. Se modelli una classificazione binaria, ottieni la cross-entropy.

Questa prospettiva unifica molti algoritmi che a prima vista sembrano diversi. La vedi all’opera, per esempio, confrontando i due modelli trattati nella nostra guida alla regressione lineare e logistica nel machine learning: stessa struttura, ipotesi probabilistiche diverse, funzioni di costo diverse.

Completano il quadro alcuni concetti di statistica inferenziale: campionamento, intervalli di confidenza, test di ipotesi. Li userai per valutare se un miglioramento del modello è reale o frutto del caso, e per progettare esperimenti affidabili come i test A/B.

Un cenno alla teoria dell’informazione

Concetti come entropia, cross-entropy e divergenza di Kullback-Leibler provengono dalla teoria dell’informazione. L’entropia misura quanta incertezza contiene una distribuzione; la divergenza KL misura quanto una distribuzione differisce da un’altra. Li ritroverai nell’addestramento dei classificatori, nei modelli generativi e nelle tecniche di distillazione, dove un modello piccolo impara a imitare le distribuzioni prodotte da uno più grande.

Ottimizzazione: trovare i parametri migliori

L’ottimizzazione è il punto in cui gli altri pilastri si incontrano. Hai un modello descritto con l’algebra lineare, una funzione di costo derivata dalla statistica e i gradienti calcolati con il calcolo differenziale. Ora devi usare tutto questo per trovare i parametri che minimizzano l’errore.

La discesa del gradiente e le sue varianti

L’algoritmo base è la discesa del gradiente: calcoli il gradiente della funzione di costo rispetto ai parametri e aggiorni ogni parametro con un piccolo passo nella direzione opposta. L’ampiezza del passo si chiama learning rate ed è uno degli iperparametri più importanti. Troppo grande e l’algoritmo rimbalza senza convergere, troppo piccolo e l’addestramento diventa lentissimo.

Poiché calcolare il gradiente su tutto il dataset è costoso, nella pratica si usa la discesa stocastica del gradiente (SGD) o la sua versione a mini-batch, che stima il gradiente su piccoli sottoinsiemi di dati. Il rumore introdotto da questa stima, oltre a rendere il calcolo più veloce, aiuta spesso il modello a uscire da zone poco promettenti.

Su questa base sono nati ottimizzatori più sofisticati, come Momentum, RMSProp e Adam, che adattano la velocità e la direzione degli aggiornamenti tenendo conto della storia dei gradienti passati. Adam, in particolare, è diventato una scelta predefinita in moltissimi progetti di deep learning.

Convessità, minimi locali e regolarizzazione

Una funzione convessa ha un solo minimo, e qualsiasi algoritmo di discesa ben configurato lo trova. Molti modelli classici, come la regressione lineare e logistica, hanno funzioni di costo convesse, ed è anche per questo che sono così stabili. Le reti neurali, invece, hanno funzioni di costo non convesse, piene di minimi locali, punti di sella e zone piatte.

Sorprendentemente, nella pratica questo crea meno problemi di quanto la teoria farebbe temere. Nelle reti molto grandi, molti minimi locali raggiunti dall’addestramento risultano avere prestazioni simili.

La regolarizzazione aggiunge alla funzione di costo un termine che penalizza la complessità del modello, tipicamente basato sulla norma L1 o L2 dei pesi. È uno strumento fondamentale contro l’overfitting, e mostra bene come algebra lineare e ottimizzazione lavorino insieme: la norma di un vettore diventa una leva per controllare quanto un modello si adatta ai dati.

Dalla formula al codice: come si collegano teoria e pratica

Uno dei modi migliori per consolidare la matematica del machine learning è vederla tradotta in codice. Python, con la libreria NumPy, permette di scrivere le operazioni tra vettori e matrici in modo quasi identico alla notazione matematica. Un prodotto matrice-vettore diventa un’unica istruzione, una media o una varianza una semplice chiamata di funzione.

Un esercizio molto efficace consiste nell’implementare da zero, senza librerie di machine learning, una regressione lineare addestrata con la discesa del gradiente. In poche decine di righe usi tutti e quattro i pilastri: rappresenti i dati come matrice, definisci l’errore quadratico medio, ne calcoli il gradiente e aggiorni i pesi in un ciclo. Vedere la loss scendere iterazione dopo iterazione rende concreta ogni formula.

Dopo questo esercizio, le librerie non ti sembreranno più scatole nere.

Se vuoi un punto di partenza pratico, la nostra guida su come creare il tuo primo modello di machine learning in Python ti accompagna nella costruzione di un modello completo. Puoi usarla come base e poi sostituire, un pezzo alla volta, le funzioni pronte con le tue implementazioni.

Leggere la notazione senza paura

Una delle barriere più sottovalutate è la notazione. Simboli come la sommatoria, il prodotto, il gradiente (il triangolo rovesciato chiamato nabla), il valore atteso o l’argmin spaventano più per il loro aspetto che per il loro contenuto. Il consiglio è costruirti un piccolo glossario personale: ogni volta che incontri un simbolo nuovo, annota cosa significa e scrivi l’equivalente in codice.

Una sommatoria, per esempio, non è altro che un ciclo for che accumula valori. Un argmin è la ricerca dell’indice o del valore che rende minima una funzione. Tradurre i simboli in istruzioni familiari riduce drasticamente l’ansia da formula.

Un percorso di studio realistico, passo dopo passo

Non esiste un ordine obbligatorio, ma alcune sequenze funzionano meglio di altre. Quella che segue è pensata per chi parte da basi scolastiche e dedica allo studio qualche ora alla settimana. Adatta i tempi alla tua situazione: l’importante è la continuità, non la velocità.

Fase 1: ripasso delle fondamenta

Parti dall’algebra di base: equazioni, funzioni, grafici, potenze, esponenziali e logaritmi. Sono gli strumenti su cui si appoggia tutto il resto, e spesso una parte di chi fatica con il machine learning inciampa proprio qui, non nei concetti avanzati. Qualche settimana di ripasso mirato può fare una grande differenza.

Fase 2: algebra lineare applicata

Studia vettori, matrici, prodotto scalare, prodotto tra matrici e norme, accompagnando ogni concetto con esercizi in NumPy. In un secondo momento passa ad autovalori, autovettori e decomposizioni, collegandoli alla PCA. L’obiettivo è sviluppare un’intuizione geometrica: vedere le matrici come trasformazioni dello spazio.

Fase 3: calcolo e ottimizzazione

Riprendi le derivate, poi passa a derivate parziali, gradiente e regola della catena. Subito dopo, implementa la discesa del gradiente su una funzione semplice e poi su una regressione lineare. Questa fase ti dà la comprensione di come i modelli imparano.

Fase 4: probabilità e statistica

Affronta variabili aleatorie, distribuzioni principali, media, varianza, teorema di Bayes, verosimiglianza e nozioni di inferenza. Collega ogni argomento a un caso d’uso: la cross-entropy ai classificatori, la varianza alla standardizzazione, Bayes ai falsi positivi.

Fase 5: integrazione con progetti reali

A questo punto conviene smettere di studiare la matematica in isolamento e usarla dentro progetti concreti. Scegli un dataset che ti interessa, costruisci un modello, analizza gli errori e torna sui concetti teorici ogni volta che qualcosa non ti è chiaro. È in questa fase che le conoscenze si consolidano davvero.

Risorse per studiare la matematica del machine learning

Le risorse disponibili sono moltissime, e il rischio più comune è disperdersi. Meglio sceglierne poche e portarle a termine. Tra i riferimenti più apprezzati a livello internazionale c’è il libro Mathematics for Machine Learning di Deisenroth, Faisal e Ong, disponibile gratuitamente online in versione digitale e pensato proprio per collegare teoria matematica e algoritmi.

Per costruire l’intuizione visiva sono molto utili le serie video di 3Blue1Brown sull’algebra lineare e sul calcolo, che mostrano con animazioni il significato geometrico dei concetti. Piattaforme come Coursera e Khan Academy offrono corsi introduttivi di algebra lineare, calcolo e statistica, e alcuni percorsi specifici dedicati alla matematica per il machine learning.

In Italia, oltre ai corsi universitari che molti atenei hanno introdotto nelle lauree di matematica, informatica e ingegneria, esistono corsi professionali online dedicati a matematica e statistica per il machine learning, pensati per chi lavora e vuole riqualificarsi. Prima di iscriverti, verifica sempre il programma dettagliato, i prerequisiti richiesti e la presenza di esercitazioni pratiche con codice.

Qualunque risorsa tu scelga, affiancala a esercizi e piccoli progetti. La matematica si impara facendo.

Gli errori più comuni da evitare

Il primo errore è pensare di dover padroneggiare tutta la matematica prima di scrivere una riga di codice. Chi segue questa strada spesso si perde in mesi di teoria astratta e abbandona prima di vedere un risultato. Molto meglio procedere in parallelo, alternando studio e pratica.

L’errore opposto è ignorare del tutto la matematica affidandosi solo alle librerie. Funziona per i primi progetti, ma porta presto a un tetto di competenza difficile da superare: non riesci a diagnosticare i problemi, a scegliere tra approcci alternativi o a capire la letteratura tecnica.

Un terzo errore è studiare senza verificare la comprensione. Leggere una spiegazione e annuire non basta: prova a rispiegare un concetto con parole tue, a implementarlo in codice o a risolvere un esercizio senza guardare la soluzione.

Infine, non sottovalutare il valore della ripetizione. Alcuni concetti, come la regola della catena applicata alle reti o il legame tra verosimiglianza e funzioni di costo, richiedono più passaggi per sedimentare. È normale, e non è un segnale che la matematica non faccia per te.

Conclusioni: la matematica come alleata, non come ostacolo

La matematica del machine learning poggia su quattro pilastri, algebra lineare, calcolo differenziale, probabilità e statistica, ottimizzazione, che lavorano insieme in ogni modello. Non serve conoscerli tutti a livello accademico per iniziare, ma costruire una base solida ti permette di passare dall’uso passivo degli strumenti alla vera comprensione di ciò che fanno.

Il modo più efficace per riuscirci è studiare con uno scopo: collegare ogni concetto a un’applicazione, tradurre ogni formula in codice e integrare lo studio con progetti reali. Con continuità e qualche ora alla settimana, nel giro di alcuni mesi puoi leggere formule e paper con una sicurezza che oggi forse ti sembra lontana.

Da dove partire? Scegli oggi la prima fase del percorso, apri un notebook Python e implementa il tuo primo prodotto scalare. Poi continua a seguirci: su intelligenzaartificiale.net trovi guide dettagliate su ciascuno degli algoritmi che questa matematica rende possibili.

FA

Franco Artigiano IA

Autore IA di IntelligenzaArtificiale.net, sotto la supervisione di Daniele Della Corte (MarketingSeoAgency.com).

← Torna alla home