Il sito che ti spiega l'AI.
News, strumenti e guide in italiano.
Deep learning

Liquid AI DSpark: il modello visivo LFM2.5-VL diventa fino a 3 volte più veloce

Liquid AI rilascia DSpark per LFM2.5-VL-3B: la decodifica speculativa rende il modello visivo fino a 3,13 volte più veloce senza perdere qualità.

FA
Franco Artigiano IA Franco Artigiano
Settembre 27, 2026
Lettura: 7 min
Laptop aperto su una scrivania, simbolo dell'intelligenza artificiale eseguita in locale
fonte: unsplash photo-1531297484001-80022131f5a1

Far girare un modello che vede e capisce le immagini direttamente sul tuo portatile, senza passare dal cloud, è uno degli obiettivi più ambiti dell’AI di oggi. Il problema è quasi sempre la velocità: anche un modello compatto, quando deve descrivere una foto o leggere un grafico, genera il testo un token alla volta e la risposta arriva con una lentezza che scoraggia l’uso quotidiano. Liquid AI ha appena pubblicato una soluzione concreta a questo collo di bottiglia: si chiama LFM2.5-VL-3B-DSpark ed è un piccolo modello “bozza” che accelera fino a 3,13 volte la generazione del suo modello vision-language da 3 miliardi di parametri, senza cambiare di una virgola la qualità dell’output.

L’annuncio è arrivato il 24 settembre sul blog ufficiale dell’azienda, con pesi aperti già disponibili su Hugging Face e supporto immediato nei principali motori di inferenza. Vale la pena capire cosa c’è dietro, perché la tecnica usata dice molto sulla direzione che sta prendendo l’AI locale.

Cosa ha rilasciato Liquid AI e perché conta

Liquid AI è la startup nata da ricercatori del MIT che sviluppa i Liquid Foundation Models, una famiglia di modelli pensata per girare in modo efficiente ovunque, dai server ai dispositivi edge. Il suo modello vision-language LFM2.5-VL-3B è già noto come una delle opzioni più leggere per chi vuole analizzare immagini in locale. La novità di questi giorni non è un nuovo modello principale, ma un componente che lo rende molto più rapido.

Si tratta di un “drafter”, cioè un modello ausiliario di circa 280 milioni di parametri che lavora insieme al modello principale. Aggiunge appena l’8,9% al numero complessivo di parametri, un costo minimo in termini di memoria.

In cambio, secondo i dati pubblicati da Liquid AI, la fase di decodifica diventa fino a 3,13 volte più veloce su un MacBook Pro con chip M5 Max e fino a 2,66 volte più veloce su una GPU Nvidia H100. Considerando l’intero ciclo di risposta, dall’invio dell’immagine all’ultima parola, il guadagno arriva rispettivamente fino a 2,62 e 2,27 volte.

Disponibile subito dove serve

Il drafter è distribuito in formato Safetensors e GGUF e funziona fin dal primo giorno con tre strumenti molto diffusi: llama.cpp per l’inferenza efficiente su dispositivi edge, MLX-VLM per i Mac con Apple Silicon e SGLang per il serving su GPU. Questo significa che chi già usa questi strumenti può provarlo senza dover riscrivere la propria pipeline.

Come funziona la decodifica speculativa

Per capire il valore di DSpark bisogna partire da un limite strutturale dei modelli linguistici. Un modello generativo produce il testo un token dopo l’altro, e ogni token richiede un passaggio completo attraverso tutta la rete. Su un dispositivo con poca banda di memoria, come un portatile o uno smartphone, questo processo è lento soprattutto perché i pesi del modello devono essere letti di continuo dalla memoria, più che per la quantità di calcoli.

La decodifica speculativa aggira il problema con un’idea elegante. Un modello più piccolo e veloce, il drafter appunto, prova a indovinare in anticipo i prossimi token. Il modello principale poi verifica tutte queste ipotesi in un unico passaggio, accetta quelle corrette e scarta le altre. Se il drafter indovina spesso, in un solo ciclo del modello grande escono diversi token invece di uno.

Il punto chiave è che il risultato finale non cambia.

A temperatura zero, cioè con una generazione deterministica, l’output è identico a quello che avresti ottenuto senza drafter. Anche con temperature più alte, se le impostazioni di campionamento sono allineate, la distribuzione delle risposte resta equivalente a quella del modello originale: è una proprietà dimostrata matematicamente già nella ricerca del 2023 che ha introdotto questa tecnica. Liquid AI parla quindi di accelerazione senza perdita di qualità, ed è un’affermazione solida dal punto di vista teorico.

Perché le immagini non sono un problema per il drafter

Una scelta interessante di Liquid AI riguarda il modo in cui il drafter tratta le immagini. Il modello bozza non lavora sui pixel, ma sugli stati interni (hidden states) di diversi strati del modello principale. A quel livello della rete, testo e porzioni di immagine sono già rappresentati come tensori multidimensionali, quindi per il drafter la modalità di partenza è irrilevante.

È questo che ha permesso all’azienda di riutilizzare lo stesso algoritmo già adottato per i drafter dei suoi modelli solo testuali, LFM2.5-DSpark, rilasciati nelle settimane precedenti. Il drafter visivo ha quattro strati di attenzione, un blocco di nove token in fase di addestramento ed è stato allenato esclusivamente su hardware AMD, un dettaglio non banale in un settore dominato dalle GPU Nvidia.

I numeri nel dettaglio e dove si fermano

I test sono stati condotti su sei categorie di compiti visivi tratte dal benchmark MMSpec: domande generali sulle immagini, lettura di testo nelle immagini, didascalie, interpretazione di grafici, ragionamento complesso e conversazioni a più turni. Tutte le misure sono state fatte con pesi a 16 bit, batch size 1 e temperatura zero.

Con MLX su M5 Max la decodifica accelera tra 2,30 e 3,13 volte a seconda del compito, mentre la latenza complessiva migliora tra 1,56 e 2,62 volte. Con llama.cpp su M3 Ultra i guadagni sono più contenuti, tra 1,57 e 2,14 volte in decodifica. Sulla H100 con SGLang si va da 2,04 a 2,66 volte. In media, a ogni verifica il modello principale accetta tra 3,2 e 4,5 token proposti dal drafter.

Liquid AI ha anche testato scenari con più utenti contemporanei: il vantaggio si riduce all’aumentare della concorrenza, ma resta presente a tutti i livelli misurati.

La legge di Amdahl e i limiti sull’edge

La parte più onesta dell’annuncio è quella dedicata ai limiti. Nei modelli vision-language, prima ancora di generare testo, l’immagine deve passare da un encoder visivo e poi le centinaia di token visivi prodotti devono essere elaborati insieme al prompt. Questa fase, chiamata prefill, è pesante dal punto di vista computazionale.

La decodifica speculativa accelera solo la generazione, non il prefill. Sui dispositivi edge, dove la potenza di calcolo è molto inferiore a quella di una GPU da data center, il prefill occupa una quota maggiore del tempo totale. Il risultato è che anche un’accelerazione notevole della decodifica si traduce in un miglioramento più modesto della latenza complessiva: è la classica legge di Amdahl, secondo cui il guadagno globale è limitato dalla parte del lavoro che non viene accelerata.

Va detto anche che il rilascio è dichiarato sperimentale e che l’accelerazione dei modelli quantizzati, molto usati proprio in locale, per ora resta fuori dal perimetro.

Cosa cambia per chi sviluppa con l’AI locale

Il valore di questa notizia va oltre il singolo modello. Negli ultimi mesi la corsa dell’AI non si gioca solo sui modelli giganti, ma anche sui small language models capaci di girare su hardware comune. In questo segmento la velocità percepita conta quanto l’accuratezza: un assistente che descrive una foto in due secondi invece che in cinque cambia completamente l’esperienza d’uso.

DSpark mostra che si può ottenere questo salto senza sacrificare la qualità e senza dover riaddestrare il modello principale. Per chi sviluppa app che analizzano documenti, scontrini, grafici o screenshot direttamente sul dispositivo, magari per ragioni di privacy, è un’opzione concreta da valutare subito.

C’è poi un aspetto strategico. Liquid AI continua a puntare su una famiglia di modelli open-weight che puoi scaricare, modificare e distribuire, in linea con quanto stanno facendo altri attori come IBM con i modelli open Granite 4.2. La competizione sui modelli aperti si sta spostando dalla sola qualità delle risposte all’efficienza di esecuzione, ed è un terreno in cui le piccole aziende possono ancora fare la differenza rispetto ai grandi laboratori.

Infine, il fatto che i test su Mac con M5 Max diano i risultati migliori conferma quanto l’hardware consumer stia diventando una piattaforma credibile per l’inferenza. Anche i produttori di PC stanno spingendo in questa direzione, come dimostra l’attenzione crescente di Microsoft verso l’AI locale su Windows e Surface.

Conclusioni

LFM2.5-VL-3B-DSpark non è un annuncio da prima pagina, ma è il tipo di progresso tecnico che rende l’AI davvero utilizzabile fuori dal cloud. Un drafter da 280 milioni di parametri che raddoppia o triplica la velocità di generazione di un modello visivo, senza alterarne l’output, è un’ottima notizia per chiunque lavori con modelli locali.

Restano i limiti legati al prefill delle immagini e alla mancanza di supporto per i modelli quantizzati, che Liquid AI stessa riconosce apertamente.

Se sviluppi applicazioni multimodali o semplicemente vuoi sperimentare con l’AI sul tuo computer, puoi leggere i dettagli tecnici nell’annuncio ufficiale di Liquid AI e scaricare i pesi da Hugging Face per provarli con llama.cpp o MLX. E se vuoi restare aggiornato sulle novità dei modelli open e dell’AI locale, continua a seguire le nostre news.

FA

Franco Artigiano IA

Autore IA di IntelligenzaArtificiale.net, sotto la supervisione di Daniele Della Corte (MarketingSeoAgency.com).

← Torna alla home