Quantizzazione dei modelli AI: cos’è, come funziona e perché rende gli LLM più leggeri
La quantizzazione riduce la precisione numerica dei modelli AI per renderli più piccoli e veloci: scopri cos'è, come funziona e a cosa serve.

I modelli di intelligenza artificiale più potenti sono anche i più ingombranti. Un modello linguistico di grandi dimensioni può contenere decine o centinaia di miliardi di parametri, e per funzionare a piena precisione richiede schede grafiche costose, molta memoria e un consumo energetico tutt’altro che trascurabile. È il motivo per cui, fino a poco tempo fa, usare l’AI generativa significava quasi sempre passare dai server di qualcun altro.
La quantizzazione è la tecnica che ha cambiato questa situazione. In poche parole, riduce la precisione numerica con cui vengono rappresentati i parametri di un modello, rendendolo più piccolo, più veloce e molto meno esigente in termini di hardware, senza doverlo riaddestrare da zero.
In questa guida vedrai cos’è la quantizzazione dei modelli AI, come funziona a livello concreto, quali sono i tipi principali, quanti bit servono davvero e quali vantaggi e limiti comporta. L’obiettivo è darti una comprensione solida e duratura del tema, utile sia se lavori con l’AI sia se vuoi semplicemente capire perché oggi puoi far girare modelli sorprendenti anche su un portatile.
Che cos’è la quantizzazione dei modelli AI
La quantizzazione è il processo con cui i numeri che compongono un modello di intelligenza artificiale vengono rappresentati usando meno bit di quanti ne servirebbero alla precisione originale. Detto in modo diretto, si tratta di passare da numeri molto dettagliati a numeri più grossolani ma molto più economici da memorizzare e da calcolare.
Ogni modello, dopo l’addestramento, è essenzialmente un’enorme collezione di valori numerici chiamati pesi. Questi pesi determinano come il modello trasforma un input in un output, e normalmente vengono salvati in virgola mobile, cioè con numeri che hanno molte cifre decimali. La quantizzazione prende questi valori e li approssima con una rappresentazione più compatta.
Il concetto chiave è proprio l’approssimazione. Non stai buttando via il modello, lo stai riscrivendo in una lingua più sintetica.
Il risultato è un modello che occupa una frazione dello spazio originale e che, in molti casi, gira anche più in fretta. La sfida, come vedremo, è farlo perdendo il meno possibile in qualità delle risposte.
Perché i modelli AI sono così pesanti
Per capire il valore della quantizzazione, conviene partire dal motivo per cui i modelli occupano tanto spazio. Ogni parametro è un numero, e i modelli moderni ne hanno miliardi. Se ciascuno di quei numeri viene salvato con molti bit, la dimensione complessiva del file cresce rapidamente fino a diventare enorme.
Immagina un modello con sette miliardi di parametri. Se ogni parametro occupa sedici bit, cioè due byte, il modello pesa da solo circa quattordici gigabyte solo per contenere i pesi. Passare a otto bit dimezza quel valore, e scendere a quattro bit lo riduce a circa un quarto.
Questi pesi vivono all’interno di reti neurali artificiali, strutture matematiche organizzate in strati che elaborano l’informazione passo dopo passo. Se vuoi approfondire come nascono e come funzionano questi valori, è utile capire prima cosa sono le reti neurali artificiali e il ruolo dei pesi al loro interno.
La memoria necessaria non serve solo a conservare il modello su disco. Serve soprattutto a caricarlo nella memoria della scheda grafica durante l’uso, ed è lì che nascono i costi e i limiti pratici.
Da FP32 a INT4: cosa cambia davvero
La precisione di un numero, nel mondo dei modelli, si misura in bit. I formati più comuni durante l’addestramento sono la virgola mobile a trentadue bit, indicata come FP32, e la sua versione più leggera a sedici bit, la FP16 o la BF16. Sono formati precisi, capaci di rappresentare valori molto piccoli e molto grandi con molte cifre decimali.
La quantizzazione entra in gioco dopo. Prende quei numeri e li converte in formati a otto bit, spesso indicati come INT8, oppure a quattro bit, chiamati INT4, e in alcuni casi arriva a rappresentazioni ancora più compatte.
Meno bit significano meno valori possibili. Un numero a quattro bit può assumere solo sedici valori distinti, mentre uno a otto bit ne consente duecentocinquantasei.
La conseguenza è intuitiva. Comprimere di più fa risparmiare più spazio e più calcolo, ma aumenta il rischio di perdere sfumature importanti nei pesi del modello. Trovare il punto di equilibrio giusto è il cuore di tutta la disciplina.
Un’analogia per capire la quantizzazione
Un modo semplice per visualizzare la quantizzazione è pensare a una fotografia digitale. Un’immagine a milioni di colori è ricchissima di dettagli, ma occupa molto spazio. Se riduci la palette a poche centinaia di colori, il file diventa molto più piccolo e, a un primo sguardo, la foto sembra quasi identica.
La quantizzazione fa qualcosa di analogo con i pesi del modello. Riduce il numero di valori disponibili per rappresentarli, accettando una piccola perdita di dettaglio in cambio di un enorme risparmio di risorse.
Un’altra immagine utile è quella dell’arrotondamento. Invece di scrivere ogni numero con dieci cifre dopo la virgola, lo arrotondi a poche cifre. Le operazioni restano quasi le stesse, ma diventano molto più rapide da eseguire.
Come funziona la quantizzazione, in pratica
Dietro l’idea intuitiva c’è un meccanismo matematico preciso, ma non complicato da afferrare nelle sue linee generali. La quantizzazione stabilisce una regola per tradurre l’intero intervallo dei valori originali in un insieme molto più piccolo di valori interi, e poi applica quella regola a tutti i pesi.
Il processo, in sostanza, mappa un intervallo continuo su una scala discreta.
Dai numeri in virgola mobile agli interi
Immagina di avere migliaia di pesi che variano tra un valore minimo e uno massimo. La quantizzazione osserva questo intervallo e lo divide in un numero fisso di gradini, tanti quanti i bit disponibili consentono. Ogni peso originale viene poi assegnato al gradino più vicino.
Il valore in virgola mobile diventa così un numero intero che indica quale gradino occupa. Per tornare indietro, quando serve, il modello moltiplica quel gradino per un fattore di conversione e recupera un’approssimazione del valore di partenza.
È un po’ come tradurre le altezze delle persone dai centimetri esatti a categorie come basso, medio e alto. Perdi la misura precisa, ma conservi l’informazione utile in una forma molto più compatta.
Il ruolo della scala e del punto zero
Perché questa traduzione funzioni, servono due ingredienti tecnici: la scala e il punto zero. La scala è il fattore che dice quanto vale, nel mondo originale, ogni singolo gradino della nuova rappresentazione. Il punto zero indica quale gradino corrisponde al valore zero.
Questi due parametri permettono di passare avanti e indietro tra i numeri interi compatti e i valori reali che il modello deve usare per fare i suoi calcoli.
La scelta della scala è delicata. Se è troppo ampia, i valori piccoli vengono schiacciati e persi. Se è troppo stretta, i valori grandi vengono tagliati. Gran parte della qualità di una quantizzazione dipende proprio da quanto bene vengono calcolati questi parametri.
Quantizzazione uniforme e per gruppi
Nella forma più semplice, la quantizzazione usa la stessa scala per un intero blocco di pesi. Questo approccio uniforme è veloce da applicare, ma tratta allo stesso modo pesi che potrebbero avere comportamenti molto diversi.
Per questo si è diffusa la quantizzazione per gruppi, che divide i pesi in piccoli insiemi e calcola una scala dedicata per ciascuno. In questo modo i valori anomali di una parte del modello non rovinano la rappresentazione di tutto il resto.
È un compromesso: gestire tante scale costa qualche bit in più, ma spesso vale ampiamente la pena in termini di qualità finale.
I principali tipi di quantizzazione
Non esiste un solo modo di quantizzare un modello. Le tecniche si distinguono soprattutto per il momento in cui vengono applicate, cioè se dopo l’addestramento o durante di esso, e per come gestiscono i valori mentre il modello lavora.
Post-training quantization
La quantizzazione post-addestramento, indicata con la sigla PTQ, è la più diffusa perché è anche la più pratica. Si parte da un modello già addestrato e lo si converte in una versione a precisione ridotta senza toccare il lungo e costoso processo di training.
È rapida, non richiede grandi risorse ed è alla portata di chiunque abbia il modello di partenza. Per questo è la scelta tipica quando vuoi comprimere un modello esistente per farlo girare in locale.
Il rovescio della medaglia è che, comprimendo in modo aggressivo, la PTQ può introdurre una perdita di qualità più visibile, soprattutto se si scende a pochissimi bit.
Quantization-aware training
L’addestramento consapevole della quantizzazione, indicato come QAT, adotta una strategia opposta. Simula gli effetti della compressione già durante la fase di training, in modo che il modello impari a convivere con la minore precisione fin dall’inizio.
Il vantaggio è una qualità finale generalmente superiore, perché il modello si è già adattato a lavorare con numeri meno precisi. Lo svantaggio è il costo: serve rimettere mano all’addestramento, che è la parte più pesante di tutto il ciclo di vita di un modello.
In pratica, la QAT viene scelta quando la qualità è cruciale e si dispone delle risorse per addestrare o rifinire il modello.
Quantizzazione statica e dinamica
Un’altra distinzione riguarda il modo in cui vengono trattati i valori che attraversano il modello mentre elabora un input, chiamati attivazioni. Nella quantizzazione statica, i parametri di conversione vengono calcolati una volta sola, in anticipo, usando dati di esempio.
Nella quantizzazione dinamica, invece, alcuni di quei parametri vengono determinati al volo, durante l’esecuzione. Questo può migliorare la qualità in certi casi, al prezzo di un piccolo costo aggiuntivo di calcolo a ogni richiesta.
La scelta tra le due dipende dall’equilibrio che cerchi tra semplicità, velocità e fedeltà al modello originale.
Quanti bit servono davvero
Una delle domande più frequenti riguarda il livello di compressione ideale. La risposta onesta è che dipende, ma è possibile tracciare alcune linee guida generali che restano valide nel tempo.
La quantizzazione a otto bit è spesso considerata un punto di equilibrio molto affidabile. Riduce sensibilmente memoria e costi, mantenendo una qualità che, per molti compiti, è quasi indistinguibile dal modello a piena precisione.
Scendere a quattro bit è il territorio più interessante per l’uso personale. In questa fascia i modelli diventano abbastanza leggeri da girare su hardware di consumo, e le tecniche moderne sono così mature che la perdita di qualità resta spesso contenuta.
Sotto i quattro bit, invece, si entra in una zona più sperimentale. Comprimere a tre, due o addirittura un bit permette risparmi straordinari, ma il rischio di degradare le risposte cresce in modo netto, e serve grande cura per ottenere risultati utilizzabili.
Vale la pena ricordare un punto importante. Non tutte le parti di un modello reagiscono allo stesso modo alla compressione. Alcuni strati sono più sensibili e conviene lasciarli a precisione più alta, mentre altri sopportano bene una compressione spinta.
Per questo le tecniche migliori sono spesso ibride, e mescolano precisioni diverse nello stesso modello per proteggere le componenti più delicate.
I formati e gli strumenti più diffusi
Attorno alla quantizzazione è cresciuto un intero ecosistema di formati e strumenti, ed è utile conoscerne almeno i nomi principali perché li incontrerai spesso quando scaricherai o proverai un modello.
Uno dei formati più popolari per l’uso locale è GGUF, pensato per far girare modelli linguistici in modo efficiente su computer normali, spesso appoggiandosi alla CPU oltre che alla scheda grafica. È il formato che trovi tipicamente quando cerchi modelli pronti da usare sul tuo dispositivo.
Sul fronte delle tecniche, alcuni metodi si sono affermati come riferimenti nel campo della quantizzazione post-addestramento dei modelli linguistici.
Tra i più citati ci sono GPTQ e AWQ, due approcci che cercano di ridurre al minimo la perdita di qualità durante la compressione a pochi bit, ciascuno con la propria strategia. Esiste poi la libreria bitsandbytes, molto usata per caricare modelli a otto o quattro bit in modo relativamente semplice all’interno dei flussi di lavoro più comuni.
Non è necessario padroneggiare i dettagli tecnici di ognuno per iniziare. La cosa importante è sapere che, dietro a una sigla, c’è quasi sempre una scelta su come bilanciare dimensione, velocità e fedeltà del modello.
I vantaggi della quantizzazione
I benefici di questa tecnica sono concreti e toccano aspetti che contano molto sia per i professionisti sia per chi usa l’AI in modo occasionale.
Il primo vantaggio è la riduzione della memoria. Un modello quantizzato occupa molto meno spazio, e questo significa poterlo caricare su schede grafiche più economiche o addirittura sulla memoria di un computer portatile.
Il secondo è la velocità. Lavorare con numeri più piccoli permette di eseguire i calcoli più in fretta e, spesso, di generare le risposte con minore attesa. Su molti dispositivi, un modello compresso risponde in modo più fluido.
C’è poi il risparmio economico ed energetico. Meno memoria e meno calcolo si traducono in costi di infrastruttura più bassi e in un consumo di energia ridotto, un fattore sempre più rilevante quando si ragiona su larga scala.
Il vantaggio forse più affascinante, però, è l’accessibilità. Grazie alla quantizzazione puoi far girare un modello AI in locale sul tuo computer, mantenendo il pieno controllo dei tuoi dati e lavorando anche senza connessione a internet.
Questo apre la porta a un uso più privato e indipendente dell’intelligenza artificiale, che fino a poco tempo fa era riservato a chi disponeva di infrastrutture importanti.
I limiti e i rischi da conoscere
Come ogni compromesso, anche la quantizzazione ha un costo. Conoscerne i limiti ti aiuta a usarla con consapevolezza e a non farti sorprendere da risultati inattesi.
Il rischio principale è la perdita di qualità. Riducendo la precisione, il modello approssima i suoi pesi, e questa approssimazione può tradursi in risposte meno accurate, in errori più frequenti o in una minore capacità di gestire compiti complessi.
L’entità di questa perdita non è uniforme. Alcuni compiti, come una conversazione semplice, tollerano molto bene la compressione. Altri, come il ragionamento matematico o la generazione di codice delicato, tendono a soffrirne di più.
Un altro aspetto da tenere presente è che i benefici dipendono dall’hardware. Non tutti i dispositivi sfruttano nello stesso modo i calcoli a bassa precisione, quindi il guadagno di velocità può variare parecchio da una configurazione all’altra.
Infine, la compressione estrema richiede competenza. Scendere a pochissimi bit senza rovinare il modello non è banale, e un lavoro fatto male può produrre un modello formalmente funzionante ma poco utile nella pratica.
La regola pratica è semplice: parti da una compressione moderata e spingiti oltre solo se i risultati restano soddisfacenti per il tuo caso d’uso.
Quantizzazione, fine-tuning e le altre tecniche di ottimizzazione
La quantizzazione non vive isolata. Fa parte di una famiglia più ampia di tecniche pensate per rendere i modelli più efficienti, e spesso queste tecniche si combinano tra loro.
Una delle combinazioni più interessanti riguarda proprio l’addestramento. Esistono metodi che permettono di rifinire un modello già quantizzato in modo economico, adattandolo a un compito specifico senza dover ricaricare l’intero modello a piena precisione. In questo senso la compressione e la personalizzazione lavorano in tandem.
Se vuoi capire come si adatta un modello a esigenze particolari, è utile approfondire il fine-tuning dei modelli AI, che è la tecnica con cui si specializza un modello generico su dati e obiettivi propri.
Accanto alla quantizzazione ci sono poi altre strade. Il pruning, per esempio, elimina le connessioni meno utili di una rete, mentre la distillazione trasferisce le capacità di un modello grande a uno più piccolo. Sono approcci diversi con lo stesso obiettivo di fondo: ottenere di più con meno risorse.
Spesso la scelta migliore non è una sola tecnica, ma una combinazione ragionata, calibrata sul risultato che vuoi ottenere.
Quando conviene usare un modello quantizzato
Arrivati a questo punto, la domanda pratica è quando abbia senso preferire una versione compressa. In generale, la quantizzazione conviene ogni volta che le risorse sono un vincolo e la piccola perdita di qualità è accettabile.
Se vuoi sperimentare con l’AI sul tuo computer, provare diversi modelli o costruire applicazioni personali, un modello quantizzato è quasi sempre la scelta giusta. Ti permette di lavorare in autonomia, senza costi ricorrenti e senza dipendere da servizi esterni.
Lo stesso vale per gli scenari in cui la privacy è centrale. Tenere il modello sul proprio dispositivo significa non inviare i dati altrove, e la quantizzazione è ciò che rende questa opzione realistica su hardware comune.
Diverso è il caso in cui hai bisogno della massima precisione possibile, per compiti critici in cui ogni errore pesa. In quelle situazioni può valere la pena usare il modello a piena precisione, magari appoggiandosi a infrastrutture adeguate.
Un fattore da non trascurare è il numero di parole che il modello deve elaborare a ogni richiesta. La quantità di testo in ingresso e in uscita influisce sulla memoria necessaria, ed è legata al modo in cui il testo viene spezzato in unità elementari. Per capire meglio questo aspetto puoi leggere cosa sono i token e come funziona la tokenizzazione nei modelli linguistici.
In definitiva, non esiste una risposta universale. Esiste il tuo caso specifico, con il suo equilibrio tra qualità richiesta, risorse disponibili e livello di controllo desiderato.
Conclusioni
La quantizzazione è una di quelle tecnologie silenziose che non fanno notizia, ma che hanno un impatto enorme su come usiamo l’intelligenza artificiale ogni giorno. È grazie a questa tecnica che modelli un tempo riservati ai grandi centri di calcolo oggi possono girare su un normale computer.
Ricapitolando, quantizzare significa ridurre la precisione numerica dei pesi di un modello per renderlo più leggero, più veloce e più economico, accettando in cambio una perdita di qualità che, se gestita bene, resta contenuta. Ne esistono diverse varianti, dalla comoda quantizzazione post-addestramento alla più raffinata quantizzazione consapevole, e la scelta del numero di bit è sempre un equilibrio tra risparmio e fedeltà.
La cosa più importante da portare a casa è che non devi scegliere tra potenza e accessibilità in modo assoluto. Puoi trovare il tuo punto di equilibrio.
Il modo migliore per capire davvero la quantizzazione è provarla. Scarica un modello in una versione compressa, mettilo alla prova sui tuoi compiti reali e osserva come si comporta rispetto alle tue aspettative. È da quell’esperienza diretta che nasce la vera padronanza, e da lì puoi iniziare a costruire un uso dell’AI più personale, indipendente e su misura per te.