Il sito che ti spiega l'AI.
News, strumenti e guide in italiano.
Deep learning

Autoencoder: cosa sono, come funzionano e a cosa servono

Che cos'è un autoencoder, come funziona, quali tipi esistono e a cosa serve: la guida completa a una delle architetture chiave del deep learning.

FA
Franco Artigiano IA Franco Artigiano
Settembre 2, 2026
Lettura: 13 min

Immagina una rete neurale il cui unico compito sia copiare ciò che riceve in ingresso, restituendolo il più fedelmente possibile in uscita. Detta così sembra un esercizio inutile, quasi un capriccio. Eppure proprio da questo gioco di specchi nasce uno degli strumenti più eleganti e versatili del deep learning: l’autoencoder.

Il segreto sta in un vincolo. Tra l’ingresso e l’uscita, l’informazione è costretta a passare attraverso uno spazio molto più piccolo, una strettoia che non le permette di transitare intatta. Per ricostruire il dato originale, la rete deve allora imparare a rappresentarlo in forma compressa, cogliendone solo l’essenza e scartando tutto il superfluo.

In questa guida vedrai che cos’è un autoencoder, come funziona nel dettaglio, quali sono le sue varianti principali e a cosa serve davvero, dalla riduzione della dimensionalità al rilevamento delle anomalie, fino alla generazione di dati nuovi. Un contenuto pensato per restare un punto di riferimento nel tempo, che tu parta da zero o voglia semplicemente mettere ordine tra concetti già incontrati.

Che cos’è un autoencoder

Un autoencoder è un tipo di rete neurale artificiale addestrata a riprodurre in uscita gli stessi dati che riceve in ingresso. L’obiettivo apparente è la copia, ma l’obiettivo reale è un altro: imparare una rappresentazione compatta e significativa dei dati, cioè una versione condensata che ne conservi le caratteristiche più importanti.

Per capire perché questo abbia senso, conviene partire dalla struttura. Un autoencoder è composto da tre parti che lavorano in sequenza: un encoder, uno spazio latente e un decoder. Sono i tre ingranaggi che fanno funzionare l’intero meccanismo.

L’encoder prende il dato in ingresso, per esempio un’immagine o un vettore di numeri, e lo comprime progressivamente in una rappresentazione più piccola. Il decoder compie il percorso inverso: parte da quella rappresentazione ridotta e cerca di ricostruire il dato di partenza. Nel mezzo si trova lo spazio latente, il cuore pulsante del modello.

La rete non impara a memoria. Impara a distillare.

Encoder, spazio latente e decoder

L’encoder è una sequenza di strati neurali che riducono via via la dimensione dei dati. Se in ingresso hai un’immagine descritta da migliaia di valori, l’encoder può portarla a poche decine di numeri. Questa compressione non è casuale, ma guidata dall’addestramento: la rete cerca il modo migliore di riassumere l’informazione con lo spazio a disposizione.

Il risultato di questa compressione è il vettore latente, spesso chiamato anche codice o bottleneck, cioè collo di bottiglia. È una rappresentazione a bassa dimensionalità che contiene, idealmente, tutto ciò che serve per ricostruire il dato originale. Puoi immaginarlo come il riassunto di un libro: poche righe che catturano la trama, i personaggi e il tono, lasciando fuori le singole frasi.

Il decoder, infine, fa il lavoro opposto dell’encoder. Prende il vettore latente e lo espande di nuovo, strato dopo strato, fino a produrre un’uscita delle stesse dimensioni dell’ingresso. Se l’addestramento è andato a buon fine, questa uscita somiglia molto al dato di partenza, pur essendo passata attraverso la strettoia.

La qualità di quella somiglianza è esattamente ciò che la rete cerca di migliorare.

Perché comprimere significa imparare

Qui sta l’intuizione più profonda. Se lo spazio latente fosse grande quanto l’ingresso, la rete potrebbe limitarsi a copiare i dati senza capirci nulla, come uno studente che ricopia la pagina senza leggerla. Il vincolo dimensionale glielo impedisce.

Costretta a lavorare con poche variabili, la rete deve individuare le regolarità nascoste nei dati, le correlazioni, i pattern ricorrenti. Deve scoprire, per esempio, che in un volto gli occhi sono di solito simmetrici, oppure che certi valori tendono a presentarsi insieme. In questo modo lo spazio latente diventa una mappa delle caratteristiche essenziali del dataset.

È questa la ragione per cui gli autoencoder sono considerati uno strumento di apprendimento delle rappresentazioni, una branca del deep learning che studia come far emergere, dai dati grezzi, descrizioni utili e riutilizzabili senza bisogno di etichette umane.

Come funziona l’addestramento di un autoencoder

L’addestramento di un autoencoder segue la logica generale delle reti neurali artificiali, ma con una particolarità che lo rende speciale: non servono etichette. Per questo si parla di apprendimento auto-supervisionato, a volte descritto come una forma di apprendimento non supervisionato.

Il concetto è semplice. Il dato in ingresso è anche la risposta corretta. La rete prova a ricostruirlo, confronta la ricostruzione con l’originale e misura quanto ha sbagliato.

Questa misura dell’errore si chiama funzione di perdita di ricostruzione. Nel caso di immagini o valori continui si usa spesso l’errore quadratico medio, che calcola la differenza tra ogni valore ricostruito e quello originale. Più la ricostruzione è fedele, più basso è l’errore.

A partire da questo errore, la rete si corregge. Attraverso la retropropagazione e la discesa del gradiente, i pesi dell’encoder e del decoder vengono aggiustati poco alla volta, in modo che alla successiva ricostruzione l’errore sia leggermente minore. Ripetendo il processo su moltissimi esempi, la rete affina la propria capacità di comprimere e ricostruire.

Il meccanismo di fondo è lo stesso con cui si addestra qualunque modello di intelligenza artificiale: si definisce un obiettivo, si misura la distanza da quell’obiettivo e si aggiustano i parametri per ridurla, iterazione dopo iterazione.

C’è però un equilibrio delicato da rispettare. Se lo spazio latente è troppo ampio, la rete rischia di copiare i dati invece di comprenderli, imparando poco. Se è troppo stretto, la ricostruzione diventa imprecisa perché l’informazione va persa. Trovare la dimensione giusta del collo di bottiglia è una delle scelte più importanti nella progettazione di un autoencoder.

Un esempio concreto per fissare le idee

Immagina di avere a disposizione decine di migliaia di piccole immagini in bianco e nero, ognuna raffigurante una cifra scritta a mano. Ogni immagine è descritta da centinaia di valori, uno per pixel. È un’enorme quantità di numeri per rappresentare qualcosa che, in fondo, è molto semplice.

Dai questi dati in pasto a un autoencoder. L’encoder li comprime, diciamo, in una manciata di valori. Il decoder, a partire da quei pochi numeri, prova a ridisegnare la cifra originale.

All’inizio i risultati sono pessimi, le ricostruzioni sono macchie confuse. Ma iterazione dopo iterazione la rete migliora, finché le cifre ricostruite diventano quasi indistinguibili dalle originali. Il punto sorprendente, però, è un altro, ed è quello che accade dentro lo spazio latente.

Quei pochi valori iniziano a organizzarsi in modo sensato. Cifre simili finiscono vicine tra loro, cifre diverse lontane, e alcune dimensioni arrivano a corrispondere a proprietà riconoscibili, come l’inclinazione del tratto o lo spessore della linea. La rete, senza che nessuno gliel’abbia insegnato esplicitamente, ha scoperto da sola una struttura nascosta nei dati.

È, in miniatura, esattamente ciò che rende gli autoencoder tanto interessanti quando vengono applicati a problemi molto più grandi e complessi.

I principali tipi di autoencoder

Con il tempo, dall’idea di base sono nate molte varianti, ciascuna pensata per risolvere un problema specifico o per superare un limite del modello originale. Conoscerle ti aiuta a capire quanto sia flessibile questa architettura.

Autoencoder sottocompleto

È la forma più classica e intuitiva. Sottocompleto significa che lo spazio latente ha meno dimensioni dell’ingresso, quindi la compressione è imposta dalla struttura stessa della rete. È proprio questo restringimento a spingere il modello a imparare le caratteristiche più rilevanti. Quando si parla di autoencoder senza altre specifiche, di solito ci si riferisce a questo.

Autoencoder sparso

In un autoencoder sparso il vincolo non riguarda tanto la dimensione dello spazio latente, quanto il numero di neuroni attivi contemporaneamente. Durante l’addestramento si aggiunge una penalità che spinge la rete a tenere spenti la maggior parte dei neuroni latenti, lasciandone accesi solo pochi per ogni esempio.

Il risultato è una rappresentazione più selettiva, in cui ciascun neurone tende a specializzarsi su un particolare tipo di caratteristica. Un po’ come avere un gruppo di esperti in cui, per ogni problema, parla solo chi ne sa davvero qualcosa.

Autoencoder denoising

L’autoencoder denoising, o di rimozione del rumore, introduce una trovata brillante. In ingresso non riceve il dato pulito, ma una sua versione volutamente rovinata, con rumore aggiunto, pixel cancellati o valori alterati. Il suo compito è ricostruire la versione originale e integra.

In questo modo la rete non può limitarsi a copiare, perché la copia sarebbe difettosa. È obbligata a capire la struttura profonda dei dati per indovinare come dovrebbe essere il dato corretto. È un principio che, in forme diverse, ritroviamo in molti modelli generativi moderni.

Autoencoder variazionale

L’autoencoder variazionale, noto con la sigla VAE, rappresenta un salto concettuale. Invece di codificare ogni dato in un singolo punto dello spazio latente, lo descrive come una distribuzione di probabilità, definita da una media e da una varianza. In pratica, non impara un codice fisso ma una regione di possibilità.

Questa differenza, apparentemente tecnica, ha una conseguenza enorme. Uno spazio latente organizzato in questo modo diventa continuo e regolare, e permette di generare dati nuovi semplicemente campionando punti al suo interno e facendoli elaborare al decoder. Il VAE, quindi, non serve solo a comprimere: sa anche creare.

Per questo gli autoencoder variazionali sono considerati veri e propri modelli generativi, capaci di produrre immagini, suoni o altri dati mai visti prima ma coerenti con quelli su cui sono stati addestrati.

Autoencoder convoluzionale

Quando i dati sono immagini, gli strati completamente connessi non sono la scelta migliore. L’autoencoder convoluzionale sostituisce quegli strati con operazioni di convoluzione, le stesse che rendono così efficaci le reti neurali usate nella visione artificiale.

Grazie a questa struttura, l’encoder riesce a cogliere pattern spaziali come bordi, texture e forme, mentre il decoder li ricompone. È la variante più usata per lavorare con foto e immagini in generale, dove la disposizione dei pixel conta quanto il loro valore.

A cosa servono gli autoencoder

Capito come funzionano, resta la domanda più concreta: a cosa servono nella pratica. Le applicazioni sono numerose e attraversano settori molto diversi, perché la capacità di riassumere e ricostruire i dati è utile quasi ovunque.

Riduzione della dimensionalità

È l’uso storico degli autoencoder. Molti dataset hanno un numero enorme di variabili, difficili da visualizzare e da elaborare. Comprimendoli in uno spazio latente di poche dimensioni, un autoencoder permette di rappresentarli in forma più maneggevole, conservando le informazioni essenziali.

Rispetto a tecniche statistiche più tradizionali, gli autoencoder hanno un vantaggio importante: sanno cogliere relazioni non lineari tra le variabili, cioè legami complessi che i metodi classici faticano a rappresentare.

Rilevamento delle anomalie

Questa è una delle applicazioni più eleganti e diffuse. Un autoencoder addestrato solo su dati normali impara a ricostruirli molto bene. Quando gli si presenta un dato anomalo, mai visto durante l’addestramento, fatica a ricostruirlo e l’errore di ricostruzione schizza verso l’alto.

Quell’errore diventa allora un segnale d’allarme. È un approccio usato per individuare frodi nei pagamenti, guasti nei macchinari industriali, comportamenti sospetti nel traffico di rete o irregolarità nei dati medici. Il modello, in sostanza, si stupisce di fronte a ciò che non conosce, e proprio quello stupore è l’informazione preziosa.

Rimozione del rumore e ripristino

Grazie alla logica degli autoencoder denoising, questi modelli sono capaci di ripulire dati rovinati. Possono togliere il rumore da un’immagine, ricostruire porzioni mancanti, migliorare registrazioni audio disturbate o restaurare documenti danneggiati.

La rete, avendo imparato come sono fatti i dati puliti, colma i vuoti in modo plausibile.

Compressione e apprendimento di rappresentazioni

Lo spazio latente prodotto da un autoencoder è di fatto una versione compressa dei dati, e può essere sfruttato come tale. Ancora più interessante è però il suo uso come base di partenza per altri compiti.

Le rappresentazioni apprese in modo auto-supervisionato possono infatti servire a inizializzare o alimentare altri modelli, riducendo la quantità di dati etichettati necessari per addestrarli. È un principio prezioso in tutti i contesti in cui le etichette sono costose o difficili da ottenere.

Sistemi di raccomandazione

Anche il mondo delle raccomandazioni sfrutta gli autoencoder. Applicati alle preferenze degli utenti, che spesso formano tabelle enormi e piene di caselle vuote, questi modelli imparano a stimare i gusti a partire da pochi comportamenti osservati. Ricostruendo la riga di un utente, l’autoencoder finisce per suggerire ciò che quella persona potrebbe apprezzare pur non avendolo ancora incontrato.

Generazione di dati nuovi

Con i VAE, gli autoencoder entrano nel territorio dei modelli generativi. Campionando lo spazio latente e passando i campioni al decoder, è possibile creare immagini, volti, suoni o altri contenuti originali. Questa capacità è utile anche per produrre dati sintetici con cui arricchire l’addestramento di altri sistemi.

Autoencoder, GAN e modelli di diffusione a confronto

Gli autoencoder variazionali non sono l’unica famiglia di modelli generativi, e capire come si collocano aiuta a inquadrarli meglio. I due principali punti di riferimento sono le reti generative avversarie e i modelli di diffusione.

Le GAN, le reti generative avversarie, funzionano mettendo in competizione due reti, una che genera dati falsi e una che cerca di smascherarli. Tendono a produrre immagini molto nitide e realistiche, ma sono notoriamente più difficili da addestrare e instabili. I VAE, al contrario, sono più stabili e offrono uno spazio latente ben organizzato, a volte al prezzo di risultati leggermente più sfocati.

I modelli di diffusione, che oggi guidano molti dei generatori di immagini più avanzati, seguono una strada ancora diversa: aggiungono rumore ai dati in modo graduale e poi imparano a invertire il processo. Curiosamente, quella logica di rimozione progressiva del rumore ha un’aria di famiglia con gli autoencoder denoising, a conferma di quanto queste idee siano collegate.

Nessuno di questi approcci è superiore in assoluto. Ognuno ha un profilo di forze e debolezze diverso, e la scelta dipende dal compito, dai dati e dalle risorse a disposizione.

Vantaggi e limiti degli autoencoder

Come ogni strumento, anche gli autoencoder hanno pregi evidenti e altrettanti limiti da tenere presenti. Conoscerli ti evita aspettative sbagliate.

Tra i vantaggi principali c’è la capacità di apprendere senza etichette, un enorme risparmio in termini di lavoro umano. A questo si aggiungono la flessibilità dell’architettura, adattabile a immagini, testi, suoni e dati tabellari, e l’abilità di cogliere relazioni non lineari che altri metodi non vedono.

Ci sono però controindicazioni. Un autoencoder è tanto bravo quanto i dati su cui è stato addestrato: se il dataset è distorto o poco rappresentativo, lo saranno anche le rappresentazioni apprese. La ricostruzione, inoltre, può risultare sfocata o imprecisa quando il collo di bottiglia è troppo stretto.

C’è poi il rischio del sovradattamento. Se la rete ha troppa capacità rispetto alla complessità dei dati, può finire per memorizzarli invece di generalizzare, perdendo proprio quella capacità di astrazione che è la sua ragione d’essere.

Infine, lo spazio latente di un autoencoder classico non è sempre interpretabile. Sappiamo che contiene informazione utile, ma non è detto che le sue dimensioni corrispondano a concetti comprensibili per noi. I VAE migliorano la situazione, ma il tema dell’interpretabilità resta aperto.

Conclusioni

Gli autoencoder dimostrano che a volte le idee più potenti nascono da premesse quasi paradossali. Insegnare a una rete a copiare i propri dati sembra inutile, eppure quel vincolo di compressione la costringe a capire davvero come sono fatti, trasformando un semplice esercizio di copia in un sofisticato strumento di apprendimento.

Dalla riduzione della dimensionalità al rilevamento delle anomalie, dalla pulizia dei dati alla generazione di contenuti nuovi con i modelli variazionali, questa architettura continua a occupare un posto importante nel panorama del deep learning. Non sempre finisce sotto i riflettori come altri modelli più famosi, ma lavora spesso dietro le quinte, in applicazioni concrete e silenziose.

Se questa guida ti ha incuriosito, il passo successivo è naturale: approfondisci le fondamenta su cui gli autoencoder poggiano, dalle reti neurali al funzionamento del deep learning, e prova a immaginare in quali dei tuoi problemi una compressione intelligente dei dati potrebbe fare la differenza. È da domande come questa che nascono le applicazioni più interessanti.

FA

Franco Artigiano IA

Autore IA di IntelligenzaArtificiale.net, sotto la supervisione di Daniele Della Corte (MarketingSeoAgency.com).

← Torna alla home