Reti neurali ricorrenti (RNN): cosa sono, come funzionano e a cosa servono
Cosa sono le reti neurali ricorrenti (RNN), come funzionano, il ruolo di LSTM e GRU e perché restano utili per l'elaborazione delle sequenze.

Quando leggi una frase non interpreti ogni parola come se fosse isolata. Il significato di un termine dipende da quelli che lo precedono e, molto spesso, anche da quelli che lo seguono. Lo stesso vale per una melodia, per l’andamento di un titolo in Borsa o per il movimento di un corpo nello spazio: acquistano senso solo se li osservi come una sequenza, non come una collezione di istanti scollegati.
Le reti neurali più semplici, però, non ragionano così. Trattano ogni input come indipendente dagli altri e non conservano alcuna memoria di ciò che hanno elaborato un attimo prima.
Le reti neurali ricorrenti nascono esattamente per colmare questa lacuna. Sono una famiglia di modelli pensata per i dati sequenziali, capace di mantenere una memoria interna che si aggiorna passo dopo passo mentre la sequenza scorre. Per anni sono state la tecnologia dominante nella traduzione automatica, nel riconoscimento vocale e in gran parte dell’analisi del linguaggio.
In questa guida capirai cosa sono, come funzionano nel dettaglio e perché occupano un posto così importante nella storia recente dell’intelligenza artificiale. Vedrai le loro varianti più celebri, le reti LSTM e le GRU, il motivo per cui a un certo punto sono entrate in difficoltà e quale ruolo mantengono oggi, in un mondo che nel frattempo ha scoperto i Transformer.
Cosa sono le reti neurali ricorrenti
Una rete neurale ricorrente, spesso indicata con la sigla RNN dall’inglese recurrent neural network, è un tipo di rete neurale progettato per elaborare sequenze di dati di lunghezza variabile. La parola chiave è ricorrenza: al suo interno esiste un collegamento che riporta l’informazione da un passo al successivo, creando una sorta di ciclo che nelle reti tradizionali non esiste.
Per apprezzare la novità conviene partire dalle fondamenta. In una rete classica, come quelle descritte nella guida sulle reti neurali artificiali, l’informazione attraversa gli strati di neuroni in un’unica direzione, dall’ingresso verso l’uscita. Ogni esempio viene elaborato per conto suo e la rete non ha alcun modo di sapere cosa ha visto in precedenza.
Una RNN rompe questo schema. Oltre a ricevere l’input del momento, riceve anche un riassunto di tutto ciò che ha elaborato fino a quel punto e lo usa per decidere come rispondere. È come se la rete tenesse un appunto mentale che aggiorna a ogni parola, a ogni nota, a ogni misurazione.
Questo appunto ha un nome preciso.
Lo stato nascosto, la memoria della rete
Il cuore di una rete ricorrente è lo stato nascosto, in inglese hidden state. Si tratta di un vettore di numeri che rappresenta, in forma compressa, la storia della sequenza vista fino a quel momento. A ogni passo la rete combina il nuovo input con lo stato nascosto precedente e produce un nuovo stato nascosto, che porterà con sé al passo seguente.
Puoi immaginarlo come la memoria di lavoro di chi ascolta un racconto. Man mano che le frasi si susseguono, chi ascolta non ricorda ogni singola parola alla lettera, ma mantiene un’idea aggiornata di cosa sta succedendo e di quali informazioni contano davvero. Lo stato nascosto svolge lo stesso compito per la rete.
Questa memoria è ciò che permette a una RNN di catturare il contesto. Se stai analizzando la frase “il gatto che ho visto ieri era nero”, quando la rete arriva alla parola “nero” ha ancora traccia del fatto che il soggetto è un gatto, e non un altro oggetto.
Srotolare la rete nel tempo
Un modo comodo per visualizzare una RNN è quello di srotolarla, ovvero rappresentarla come una catena di copie della stessa rete, una per ogni passo della sequenza. Ognuna riceve un elemento in ingresso e passa lo stato nascosto alla copia successiva.
Qui si nasconde un dettaglio fondamentale: tutte queste copie condividono gli stessi parametri. Non esiste una rete diversa per la prima parola e una per la decima, ma un unico insieme di pesi applicato ripetutamente. Questa condivisione dei parametri è ciò che rende la rete capace di gestire sequenze di qualsiasi lunghezza senza moltiplicare a dismisura il numero di valori da apprendere.
La stessa proprietà spiega anche perché una RNN generalizza bene. Impara una regola valida per ogni posizione della sequenza, invece di memorizzarne una per ciascun punto.
Come funziona una RNN passo dopo passo
Vediamo il funzionamento su un esempio concreto, il completamento di una frase. Supponi di dare in pasto alla rete la sequenza di parole “il cielo è” e di volere una previsione sulla parola successiva.
Il processo si svolge in modo ordinato e ripetitivo:
- La rete riceve la prima parola, “il”, la trasforma in un vettore numerico e la combina con uno stato nascosto iniziale, di solito posto a zero. Ne ricava il primo stato nascosto.
- Riceve la seconda parola, “cielo”, e la combina con lo stato nascosto appena calcolato, ottenendone uno nuovo che ora riassume le prime due parole.
- Riceve la terza parola, “è”, ripete l’operazione e produce uno stato nascosto che rappresenta l’intera frase vista finora.
- A partire da quest’ultimo stato, un ultimo strato calcola la probabilità delle possibili parole successive, favorendo per esempio “azzurro” o “sereno”.
Il punto interessante è che la stessa identica operazione viene applicata a ogni passo. Cambia l’input, cambia lo stato nascosto in ingresso, ma la funzione che li elabora resta sempre quella.
Le reti ricorrenti appartengono a pieno titolo al deep learning, perché in pratica si impilano più strati ricorrenti uno sopra l’altro, in modo da costruire rappresentazioni via via più astratte della sequenza. Uno strato coglie le regolarità locali, quello sopra combina queste regolarità in strutture più ampie.
Esiste anche una variante molto usata, la rete ricorrente bidirezionale, che legge la sequenza in entrambe le direzioni, dall’inizio alla fine e viceversa. In questo modo ogni elemento viene interpretato tenendo conto sia di ciò che lo precede sia di ciò che lo segue, un vantaggio prezioso quando l’intera frase è già disponibile.
Come si collocano tra gli altri tipi di rete neurale
Per inquadrare bene le reti ricorrenti aiuta confrontarle con le altre grandi famiglie di reti neurali. Le reti cosiddette feedforward, le più elementari, fanno scorrere l’informazione in una sola direzione e trattano ogni input in modo isolato: sono perfette per dati statici come una singola immagine o una riga di una tabella, ma restano cieche di fronte all’ordine temporale.
Le reti convoluzionali, che forse conosci per il loro impiego nella visione artificiale, eccellono invece nel cogliere gli schemi locali nello spazio, come i bordi e le forme di una fotografia. La loro logica è la vicinanza spaziale, non la successione nel tempo.
Le reti ricorrenti occupano una casella diversa ancora. Il loro dominio è la dimensione temporale, la sequenza, il prima e il dopo.
Non a caso, in molti sistemi reali queste famiglie collaborano. Una rete convoluzionale può estrarre le caratteristiche da ogni fotogramma di un video e una rete ricorrente può poi metterle in ordine per riconoscere l’azione che si sta svolgendo. La prima si occupa dello spazio, la seconda del tempo.
Tenere a mente questa divisione dei compiti ti aiuta a scegliere lo strumento giusto. La domanda da porsi è semplice: nel mio problema conta l’ordine degli elementi? Se la risposta è sì, una rete ricorrente merita un posto tra i candidati.
L’addestramento e il problema del gradiente che svanisce
Come ogni rete neurale, anche una RNN impara aggiustando i propri pesi per ridurre gli errori. La tecnica usata è una versione della retropropagazione, adattata alla dimensione temporale e chiamata retropropagazione nel tempo, in inglese backpropagation through time.
In pratica la rete viene srotolata lungo tutta la sequenza, si misura di quanto la previsione finale si discosta dal risultato corretto e poi si propaga questo errore all’indietro, passo dopo passo, fino all’inizio. Ogni copia della rete contribuisce a correggere i pesi condivisi.
Qui nasce il problema storico delle reti ricorrenti. Quando la sequenza è lunga, l’errore deve attraversare moltissimi passaggi per tornare all’inizio, e a ogni passaggio viene moltiplicato per certi valori. Se questi valori sono piccoli, il segnale si riduce sempre di più fino quasi a sparire.
È il cosiddetto gradiente che svanisce, in inglese vanishing gradient. L’effetto pratico è che la rete fatica a collegare eventi lontani tra loro: ricorda bene ciò che è successo pochi passi prima, ma perde la traccia di quanto era comparso molto indietro nella sequenza.
Esiste anche il problema opposto, il gradiente che esplode, quando quei valori sono grandi e il segnale cresce a dismisura, rendendo l’addestramento instabile. Quest’ultimo si tiene sotto controllo con relativa facilità, per esempio limitando l’ampiezza dei gradienti, mentre il gradiente che svanisce è molto più insidioso.
Per anni questo limite ha reso le RNN semplici poco adatte a compiti che richiedono memoria a lungo termine. La soluzione è arrivata da un’architettura più sofisticata.
LSTM e GRU, le reti che imparano a ricordare
La risposta al gradiente che svanisce si chiama LSTM, sigla di long short-term memory, ovvero memoria a lungo e breve termine. Si tratta di un tipo particolare di rete ricorrente introdotto nel 1997 dai ricercatori Sepp Hochreiter e Jürgen Schmidhuber, pensato proprio per conservare le informazioni importanti attraverso sequenze molto lunghe.
L’idea di fondo è semplice e brillante. Invece di sovrascrivere completamente la propria memoria a ogni passo, la rete impara a decidere cosa conservare, cosa dimenticare e cosa aggiungere. Questa selezione avviene attraverso strutture chiamate gate, o cancelli.
Dentro una cella LSTM
Una cella LSTM introduce, accanto allo stato nascosto, un secondo canale di memoria chiamato stato della cella, in inglese cell state. È una specie di nastro trasportatore che scorre lungo tutta la sequenza e su cui le informazioni possono viaggiare quasi inalterate per molti passi.
A regolare questo flusso ci sono tre gate. Il gate di dimenticanza decide quali informazioni della memoria vecchia buttare via. Il gate di ingresso decide quali nuove informazioni scrivere. Il gate di uscita decide quanta parte della memoria trasformare nello stato nascosto da usare per la previsione del momento.
La cosa notevole è che questi cancelli non sono regole fisse scritte a mano. Sono anch’essi appresi durante l’addestramento, quindi la rete impara da sola quando ricordare un dettaglio a lungo e quando lasciarlo andare.
Grazie a questo meccanismo il segnale può attraversare molti passi senza svanire, e la rete diventa capace di collegare eventi distanti. È il motivo per cui le LSTM hanno dominato per quasi un decennio compiti come la traduzione e il riconoscimento vocale.
Le GRU, una variante più essenziale
Nel 2014 un gruppo di ricercatori guidato da Kyunghyun Cho ha proposto una versione semplificata di questa idea, la GRU, sigla di gated recurrent unit. L’obiettivo era mantenere i vantaggi delle LSTM riducendo la complessità.
Una GRU usa un numero minore di gate e fonde in un unico canale ciò che nelle LSTM erano lo stato della cella e lo stato nascosto. In sostanza combina il gate di dimenticanza e quello di ingresso in un solo meccanismo, e regola con pochi cancelli quanto aggiornare la memoria e quanta parte del passato lasciar filtrare.
Il risultato è una rete con meno parametri, spesso più rapida da addestrare, che in molti compiti raggiunge una qualità paragonabile a quella delle LSTM. Non esiste una vincitrice assoluta: a seconda dei dati e del problema può funzionare meglio l’una o l’altra, e nella pratica conviene provarle entrambe.
A cosa servono le reti neurali ricorrenti
La vera forza delle reti ricorrenti sta nella loro versatilità con tutto ciò che ha una struttura sequenziale. Ogni volta che l’ordine degli elementi porta significato, una RNN è una candidata naturale.
Il campo più celebre è quello del linguaggio. Per lungo tempo le RNN e le loro varianti sono state il motore dell’elaborazione del linguaggio naturale: modelli che completano le frasi, sistemi di traduzione automatica, classificatori del sentimento di un testo, generatori di didascalie per le immagini.
Un’applicazione emblematica è la traduzione con architettura codificatore e decodificatore. Una prima rete ricorrente legge la frase nella lingua di partenza e la comprime in una rappresentazione interna, una seconda rete la espande generando la frase tradotta, parola dopo parola.
Poi c’è il suono. Nel riconoscimento vocale, cioè la trasformazione del parlato in testo, la sequenza è il segnale audio che scorre nel tempo, e le reti ricorrenti si sono rivelate particolarmente adatte a seguirlo.
Le RNN sono molto usate anche per le serie storiche, ovvero sequenze di misurazioni ordinate nel tempo. Previsione della domanda di energia, andamento di grandezze industriali, dati provenienti da sensori: in tutti questi casi il valore futuro dipende da ciò che è accaduto in passato.
L’elenco continua con il riconoscimento della scrittura a mano, l’analisi di tracciati biomedici come l’elettrocardiogramma, la generazione di musica e di testo. Ovunque ci sia un prima e un dopo, la ricorrenza trova terreno fertile.
RNN e Transformer, cosa è cambiato con l’attenzione
Nonostante i successi, le reti ricorrenti hanno un limite strutturale difficile da superare. Elaborano la sequenza un elemento alla volta, in modo intrinsecamente sequenziale, e questo rende l’addestramento lento e poco adatto a sfruttare appieno l’hardware moderno, che eccelle quando può fare molti calcoli in parallelo.
La svolta è arrivata nel 2017 con l’articolo scientifico intitolato “Attention is all you need”, che ha introdotto l’architettura Transformer. Il suo ingrediente centrale è il meccanismo di attenzione, che permette al modello di mettere in relazione diretta ogni elemento della sequenza con tutti gli altri, senza doverli attraversare uno per uno.
Se vuoi approfondire questo passaggio, la guida su cosa sono i Transformer spiega nel dettaglio come funziona l’attenzione e perché ha cambiato le regole del gioco.
I Transformer risolvono in un colpo solo due problemi delle RNN. Da un lato elaborano l’intera sequenza in parallelo, accelerando enormemente l’addestramento. Dall’altro collegano con facilità elementi lontani, perché per l’attenzione la distanza tra due parole non è un ostacolo.
Per questo, nel giro di pochi anni, i Transformer hanno soppiantato le reti ricorrenti in quasi tutti i compiti legati al linguaggio, diventando la base dei grandi modelli che usiamo oggi.
Sarebbe però un errore considerare le RNN un capitolo chiuso. Restano competitive quando i dati arrivano come un flusso continuo da elaborare in tempo reale, quando le risorse di calcolo sono limitate, per esempio su un piccolo dispositivo, e in diversi problemi di serie storiche dove la loro leggerezza è un vantaggio concreto.
Vantaggi, limiti e quando conviene ancora usarle
Facciamo il punto in modo onesto. Il pregio più evidente delle reti ricorrenti è la capacità di gestire sequenze di lunghezza variabile mantenendo un numero contenuto di parametri, grazie alla condivisione dei pesi nel tempo. Sono inoltre naturali da applicare ai flussi che si sviluppano istante per istante.
Nella versione LSTM o GRU riescono a catturare dipendenze anche piuttosto lunghe, cosa impossibile per le reti ricorrenti più semplici. E per molti problemi di dimensioni ridotte offrono un ottimo compromesso tra qualità e costo computazionale.
I limiti sono altrettanto chiari. L’elaborazione sequenziale le rende lente da addestrare sui grandi volumi di dati. Anche con i gate, le dipendenze davvero molto lunghe restano una sfida. E sul linguaggio, oggi, i Transformer offrono in genere risultati migliori.
La regola pratica, allora, è questa: se lavori con testo e disponi di dati e potenza di calcolo abbondanti, l’architettura Transformer è quasi sempre la scelta di partenza. Se invece devi trattare un flusso in tempo reale, hai vincoli stretti di memoria o affronti serie storiche non troppo complesse, una LSTM o una GRU rimane una soluzione solida ed efficiente.
Capire le reti ricorrenti, in ogni caso, non è un esercizio di archeologia. Molte idee che le hanno rese celebri, dallo stato nascosto ai meccanismi di gating fino all’attenzione stessa, che nacque proprio come aggiunta alle RNN, sono parte del vocabolario di base dell’intelligenza artificiale moderna.
In sintesi
Le reti neurali ricorrenti hanno insegnato alle macchine a tenere il filo di una sequenza. Con l’idea dello stato nascosto hanno dato ai modelli una memoria, con le LSTM e le GRU hanno imparato a distinguere ciò che vale la pena ricordare da ciò che si può lasciar andare, e per anni hanno reso possibili traduzione automatica e riconoscimento vocale.
Oggi condividono la scena con i Transformer, che le hanno superate in molti ambiti ma ne hanno anche ereditato le intuizioni. Conoscerle significa capire da dove arriva gran parte di ciò che l’AI sa fare con il linguaggio e con il tempo.
Se questa guida ti ha incuriosito, il passo successivo è naturale: approfondisci le architetture che hai incontrato lungo il percorso, dalle reti neurali di base fino ai Transformer, e prova a riconoscere, negli strumenti che usi ogni giorno, quale idea di sequenza si nasconde sotto la superficie. È il modo migliore per trasformare la teoria in una comprensione che resta.