Il sito che ti spiega l'AI.
News, strumenti e guide in italiano.
Machine learning

Regressione lineare e logistica: cosa sono e come funzionano nel machine learning

Guida completa alla regressione lineare e logistica: cosa sono, come funzionano, come si addestrano, le differenze e le applicazioni nel machine learning.

FA
Franco Artigiano IA Franco Artigiano
Settembre 21, 2026
Lettura: 12 min
Grafici e dati su carta che rappresentano l analisi e la previsione con la regressione
fonte: pexels 590011

Immagina di voler stimare il prezzo di una casa conoscendo la sua superficie, la zona e il numero di stanze. Oppure di prevedere le vendite del prossimo trimestre a partire dalla spesa in pubblicità. In entrambi i casi stai cercando un legame tra alcuni dati di partenza e un valore da prevedere, ed è esattamente ciò che fa la regressione.

La regressione è una delle tecniche più antiche e allo stesso tempo più attuali dell’intelligenza artificiale. Nasce nella statistica, molto prima dei computer, ma è diventata uno dei mattoni fondamentali del machine learning moderno. Capirla bene significa avere in mano una delle chiavi per interpretare gran parte dei modelli predittivi.

In questa guida completa scoprirai che cos’è la regressione, come funzionano la regressione lineare e la regressione logistica, in cosa si differenziano, come si addestra un modello e a cosa serve nella pratica. Vedremo anche i suoi limiti e le sue assunzioni, per usarla con consapevolezza invece che come una scatola nera.

Cos’è la regressione nel machine learning

La regressione è una tecnica di apprendimento automatico che serve a prevedere un valore a partire da uno o più dati in ingresso. Il suo obiettivo è trovare e descrivere la relazione tra alcune variabili di input, chiamate anche caratteristiche o feature, e una variabile di output che vogliamo stimare.

Fa parte della famiglia dell’apprendimento supervisionato, perché impara da esempi già etichettati, cioè da casi in cui conosciamo sia i dati di partenza sia il risultato corretto. Osservando molti esempi, il modello individua uno schema che poi applica a dati mai visti.

La differenza principale rispetto alla classificazione riguarda il tipo di risposta. La classificazione assegna un’etichetta discreta, per esempio gatto oppure cane. La regressione, invece, produce tipicamente un numero, come un prezzo, una temperatura o una probabilità.

Vale la pena ricordare che questa tecnica ha radici profonde nella statistica classica, dove veniva usata per studiare la relazione tra fenomeni ben prima dell’avvento dei calcolatori. Il machine learning ne ha ereditato le basi matematiche, potenziandole con la capacità di elaborare enormi quantità di dati in modo automatico.

Non stupisce che la regressione sia tra i primi algoritmi di machine learning che si studiano. È semplice da capire, sorprendentemente potente e alla base di modelli molto più complessi.

Regressione lineare: la retta che spiega i dati

La regressione lineare è la forma più conosciuta e la più semplice da immaginare. L’idea di fondo è tracciare una linea che descriva al meglio l’andamento dei dati, così da poter fare previsioni per nuovi casi.

Pensa a un grafico in cui ogni punto rappresenta una casa, con la superficie sull’asse orizzontale e il prezzo su quello verticale. La regressione lineare cerca la retta che passa il più vicino possibile a tutti i punti. Una volta trovata quella retta, per stimare il prezzo di una nuova casa basta leggere il valore corrispondente alla sua superficie.

Come funziona la regressione lineare

Ogni retta è descritta da due elementi: una pendenza e un punto di partenza. La pendenza indica quanto cresce il valore previsto al crescere della variabile di input, mentre il punto di partenza rappresenta il valore stimato quando l’input è pari a zero.

Nel linguaggio del machine learning, questi elementi si chiamano coefficienti o pesi. Addestrare una regressione lineare significa proprio trovare i coefficienti che rendono la retta più aderente ai dati reali.

Il bello di questo approccio è la sua trasparenza. Una volta noti i coefficienti, puoi capire con chiarezza quanto ogni variabile influisce sul risultato, e questo rende la regressione lineare uno strumento molto apprezzato quando serve spiegare le previsioni, non soltanto ottenerle. In un’epoca in cui molti modelli sono difficili da interpretare, questa chiarezza vale moltissimo.

Regressione semplice e regressione multipla

Quando usi una sola variabile di input, parliamo di regressione lineare semplice, come nell’esempio della casa basato solo sulla superficie. Nella realtà, però, un prezzo dipende da molti fattori diversi.

Entra qui in gioco la regressione lineare multipla, che considera più variabili contemporaneamente, per esempio superficie, zona, numero di stanze e anno di costruzione. Il principio resta lo stesso, ma invece di una semplice retta il modello costruisce una relazione in uno spazio a più dimensioni, difficile da disegnare ma facile da calcolare per un computer.

Passare da una a molte variabili aumenta la capacità del modello di catturare la complessità del mondo reale, ma introduce anche nuove sfide, come il rischio di includere variabili poco utili o ridondanti.

La funzione di costo e i minimi quadrati

Come fa il modello a capire quale retta è la migliore? Ha bisogno di un modo per misurare quanto sbaglia. Questo compito spetta alla funzione di costo, che calcola la distanza tra i valori previsti e quelli reali.

Il metodo più diffuso è quello dei minimi quadrati, che somma i quadrati degli errori commessi su tutti i punti. Elevare al quadrato serve a penalizzare di più gli errori grandi e a evitare che errori positivi e negativi si annullino tra loro.

L’addestramento consiste nel trovare i coefficienti che rendono questa somma più piccola possibile. Meno errore significa una retta più fedele ai dati, e quindi previsioni migliori.

Un esempio pratico di regressione lineare

Per fissare le idee, immagina di avere i dati di dieci case, con la superficie in metri quadrati e il relativo prezzo di vendita. Riportando questi valori su un grafico, noti che al crescere della superficie il prezzo tende a salire, anche se i punti non sono perfettamente allineati.

La regressione lineare cerca la retta che riassume al meglio questa tendenza. Potrebbe scoprire, per esempio, che ogni metro quadrato in più aggiunge in media una certa cifra al prezzo, e che esiste un valore di base da cui si parte anche per un immobile molto piccolo.

Una volta ottenuta la retta, il modello diventa uno strumento di previsione. Se arriva sul mercato una casa di cui conosci solo la superficie, puoi stimarne il prezzo leggendo il punto corrispondente sulla retta. Non sarà una previsione perfetta, ma sarà fondata sui dati e ragionevolmente attendibile.

Questo esempio, volutamente semplice, mostra la logica che si nasconde dietro applicazioni molto più complesse. Cambiano le variabili e la quantità di dati, ma il principio resta identico.

Regressione logistica: prevedere una probabilità

Nonostante il nome, la regressione logistica non serve a prevedere un numero qualsiasi, ma a stimare una probabilità e, di conseguenza, a classificare. È lo strumento che usi quando la domanda ha una risposta del tipo si oppure no.

Pensa a casi come stabilire se una email è spam, se un cliente abbandonerà un servizio, se una transazione è fraudolenta o se un paziente è a rischio per una certa condizione. In tutte queste situazioni il risultato non è un valore continuo, ma l’appartenenza a una categoria.

La regressione logistica parte da una combinazione lineare delle variabili, proprio come la regressione lineare, ma poi trasforma il risultato attraverso una funzione speciale, chiamata funzione logistica o sigmoide. Questa funzione comprime qualsiasi valore in un intervallo compreso tra zero e uno, che possiamo leggere come una probabilità.

Fissando una soglia, per esempio lo zero virgola cinque, il modello decide a quale classe assegnare ciascun caso. Sopra la soglia una risposta, sotto la soglia l’altra.

Un vantaggio importante è che la regressione logistica non restituisce solo una risposta secca, ma anche una misura di fiducia. Sapere che un caso ha il novanta per cento di probabilità di appartenere a una classe è molto più utile di un semplice si o no, perché permette di calibrare le decisioni in base al rischio che si è disposti a correre.

Perché si chiama regressione se serve a classificare

La domanda è più che legittima e crea spesso confusione. Il nome deriva dal fatto che, sotto il cofano, la regressione logistica costruisce comunque una relazione lineare, ma non sul risultato finale, bensì sul logaritmo delle probabilità.

In altre parole, la parte lineare c’è ed è centrale, ma viene applicata a una trasformazione della probabilità invece che al valore diretto. Da qui il nome, che riflette la sua origine matematica pur descrivendo uno strumento di classificazione.

Regressione lineare e logistica a confronto

Anche se condividono la stessa radice, le due tecniche rispondono a bisogni diversi. La regressione lineare prevede valori continui, come un prezzo o una quantità, mentre la regressione logistica stima probabilità e assegna categorie.

La scelta dipende quindi dalla domanda che ti poni. Se vuoi sapere quanto varrà qualcosa, la strada è la regressione lineare. Se vuoi sapere se un evento accadrà oppure no, ti serve la regressione logistica.

Entrambe restano modelli relativamente semplici, ed è proprio questa la loro forza. Sono veloci, interpretabili e spesso sorprendentemente efficaci, tanto da rappresentare un punto di riferimento con cui confrontare modelli più complessi. Prima di lanciarsi su una rete neurale, molti professionisti provano una buona regressione.

Un altro motivo della loro popolarità è la facilità con cui si comunicano i risultati. Spiegare a un dirigente o a un cliente che ogni euro investito in pubblicità porta in media una certa crescita delle vendite è immediato e convincente. Con modelli più opachi, lo stesso tipo di spiegazione diventa molto più complicato, e questo conta parecchio quando le decisioni vanno giustificate davanti ad altre persone.

Come si addestra un modello di regressione

Addestrare un modello di regressione significa mostrargli molti esempi e lasciare che regoli i propri coefficienti per ridurre l’errore. Il processo parte da un insieme di dati di addestramento, in cui conosciamo sia gli input sia gli output corretti.

Per trovare i coefficienti migliori, i modelli moderni usano spesso la discesa del gradiente, un metodo che aggiusta i parametri poco alla volta seguendo la direzione che riduce di più l’errore. Passo dopo passo, il modello si avvicina alla soluzione ottimale.

Un aspetto cruciale, comune a qualsiasi modello, è la separazione tra i dati usati per addestrare e quelli usati per valutare. Solo mettendo alla prova il modello su casi nuovi si capisce se ha davvero imparato la relazione oppure se si è limitato a memorizzare gli esempi.

Una volta addestrato, il modello va quindi valutato con metriche adatte. Per la regressione lineare si usano l’errore medio assoluto, la radice dell’errore quadratico medio e il coefficiente di determinazione, spesso indicato come R quadro, che misura quanta parte della variabilità dei dati il modello riesce a spiegare.

Per la regressione logistica, invece, si guardano metriche pensate per la classificazione, come l’accuratezza, la precisione e il richiamo, che raccontano quanto spesso il modello indovina e come si distribuiscono i suoi errori tra le diverse classi.

Al di là delle metriche, conta moltissimo la qualità dei dati e la scelta delle variabili. Una regressione alimentata con informazioni rilevanti e pulite produce risultati migliori di un modello sofisticato costruito su dati scadenti, un principio che vale in tutto il machine learning e che spesso si dimentica troppo in fretta.

Overfitting e regolarizzazione nella regressione

Anche un modello semplice come la regressione può incorrere in un problema molto comune. Quando ci sono molte variabili o pochi dati, il modello rischia di adattarsi troppo agli esempi di addestramento, imparando anche il rumore casuale invece della relazione reale.

Questo fenomeno si chiama overfitting, e si riconosce perché il modello funziona benissimo sui dati già visti ma male su quelli nuovi. In pratica ha memorizzato invece di generalizzare.

Per contrastarlo si usano le tecniche di regolarizzazione, che scoraggiano il modello dall’assegnare pesi troppo grandi alle variabili. Due approcci molto diffusi sono la regolarizzazione Ridge e la regolarizzazione Lasso, che aggiungono una penalità alla funzione di costo per mantenere il modello più semplice e robusto.

Il risultato è un modello che rinuncia a un po’ di precisione sui dati di addestramento in cambio di previsioni più affidabili nel mondo reale. Molto spesso è un ottimo affare.

Le assunzioni e i limiti della regressione

Per usare bene la regressione bisogna conoscere anche i suoi punti deboli. La regressione lineare, per esempio, assume che esista davvero una relazione lineare tra le variabili. Se il legame reale è molto più complesso, una semplice retta non basterà a descriverlo.

Un altro punto delicato è la sensibilità ai valori anomali. Pochi dati estremi possono spostare in modo significativo la retta e distorcere le previsioni, quindi la pulizia dei dati resta un passaggio fondamentale prima di addestrare il modello.

C’è poi un principio da tenere sempre a mente, cioè che correlazione non significa causa. Il fatto che due variabili si muovano insieme non implica che una provochi l’altra, e confondere le due cose è uno degli errori più comuni quando si interpretano i risultati.

Infine, quando le variabili di input sono molto correlate tra loro, i coefficienti possono diventare instabili e difficili da interpretare. Sono tutti limiti gestibili, ma vanno conosciuti per non trarre conclusioni sbagliate da un modello che, in apparenza, sembra funzionare.

La buona notizia è che riconoscere questi limiti fa parte del mestiere di chi lavora con i dati. Un’analisi attenta degli errori del modello e qualche controllo statistico permettono di capire se le assunzioni reggono. Quando non reggono, esistono varianti e trasformazioni che estendono la regressione a situazioni più complesse, senza abbandonarne la logica di fondo.

A cosa serve la regressione: applicazioni concrete

La regressione è ovunque, spesso in modo invisibile. Nel settore immobiliare aiuta a stimare i prezzi delle case a partire dalle loro caratteristiche, offrendo una base oggettiva a valutazioni altrimenti soggettive.

In ambito finanziario è alla base di molti modelli di rischio, per esempio nel valutare l’affidabilità creditizia di un richiedente o nel prevedere l’andamento di alcune grandezze economiche. La regressione logistica, in particolare, è uno strumento classico per stimare la probabilità di insolvenza.

In medicina viene usata per stimare il rischio di una malattia in base a fattori come età, abitudini e parametri clinici, supportando i medici nelle loro decisioni. Nel marketing serve a prevedere le vendite, a capire quali fattori influenzano la domanda e a valutare l’efficacia delle campagne.

Anche la previsione della domanda, la gestione delle scorte e la pianificazione della produzione si appoggiano spesso a modelli di regressione. Il filo conduttore è sempre lo stesso, perché ogni volta che serve stimare un valore o una probabilità a partire dai dati, la regressione è una delle prime opzioni da considerare.

In molti progetti di analisi dei dati, inoltre, la regressione è il primo modello che si costruisce, proprio per avere un riferimento di partenza. Se un modello più complesso non riesce a battere una semplice regressione, spesso conviene fermarsi e riflettere, perché la semplicità porta con sé vantaggi concreti in termini di velocità, costi e interpretabilità.

Conclusioni

La regressione è molto più di un semplice punto di partenza. È uno strumento potente, interpretabile e versatile, che continua a essere usato ogni giorno accanto ai modelli più sofisticati. Comprenderla ti dà una base solida per capire come le macchine imparano a fare previsioni.

Regressione lineare e regressione logistica coprono insieme una parte enorme dei problemi reali, dai valori continui alle decisioni tra due alternative. Saperle distinguere e sapere quando usarle è una competenza preziosa per chiunque lavori con i dati.

Se questa guida ti è stata utile, continua a esplorare gli altri approfondimenti del blog per costruire passo dopo passo una comprensione completa del machine learning e mettere subito in pratica ciò che hai imparato.

FA

Franco Artigiano IA

Autore IA di IntelligenzaArtificiale.net, sotto la supervisione di Daniele Della Corte (MarketingSeoAgency.com).

← Torna alla home