Il sito che ti spiega l'AI.
News, strumenti e guide in italiano.
Deep learning

Naive-N0.5-Flash, il modello open da 309 miliardi di parametri senza full attention

NaiveAI rilascia Naive-N0.5-Flash: MoE open da 309 miliardi, contesto nativo da 1 milione di token, licenza MIT e nessun livello di full attention.

FA
Franco Artigiano IA Franco Artigiano
Settembre 28, 2026
Lettura: 9 min
Circuiti elettronici astratti che richiamano l'architettura di un modello di intelligenza artificiale
fonte: pixabay 5076887

Un modello open da 309 miliardi di parametri, una finestra di contesto nativa da un milione di token e, soprattutto, nessun livello di full attention in tutta la rete. È questa la carta d’identità di Naive-N0.5-Flash, il modello che la startup cinese NaiveAI ha pubblicato il 27 settembre su Hugging Face con licenza MIT. Dietro i numeri c’è una scommessa architetturale precisa e un racconto ancora più ambizioso: secondo il team, buona parte del lavoro di ricerca e ingegneria che ha portato al modello è stata eseguita da sistemi di intelligenza artificiale, con le persone nel ruolo di chi fissa gli obiettivi e decide come valutare i risultati.

Se lavori con modelli linguistici su documenti lunghi, basi di codice estese o agenti che accumulano contesto per ore, questa uscita merita attenzione. Vediamo cosa contiene, perché l’assenza di full attention è una scelta tutt’altro che banale e cosa cambia per chi deve far girare questi sistemi in produzione.

Cos’è Naive-N0.5-Flash e chi c’è dietro

NaiveAI è una giovane azienda con sede a Pechino. Secondo quanto riportato dalla stampa di settore, è guidata da Jifeng Dai, ricercatore dell’Università Tsinghua noto nel campo della visione artificiale, e sarebbe valutata intorno a 1,4 miliardi di dollari. Naive-N0.5-Flash è il suo primo rilascio di peso e, come suggerisce il nome, si presenta come una versione “0.5”: un passo intermedio più che un punto d’arrivo.

Il modello è un Mixture-of-Experts (MoE) con 309 miliardi di parametri totali, dei quali solo 15,5 miliardi attivi per ogni token. È un rapporto molto spinto: a ogni passo di generazione viene usato appena il 5% circa della rete, e questo è il motivo per cui un modello di queste dimensioni può ambire a velocità e costi da modello medio.

Il target dichiarato è chiaro: programmazione e ricerca e sviluppo nel campo dell’AI stessa.

Una base condivisa: MiMo-V2.5 di Xiaomi

NaiveAI non è partita da zero. La scheda del modello indica come punto di partenza MiMo-V2.5, il modello base a pesi aperti rilasciato da Xiaomi, e ringrazia esplicitamente anche il team di DeepSeek per il meccanismo di sparse attention e la comunità di SGLang per l’infrastruttura di inferenza. È un esempio concreto di come funziona oggi l’ecosistema open cinese: un’azienda pubblica una base solida, un’altra la prende, la modifica in profondità e la restituisce alla comunità con una licenza ancora più permissiva. Se vuoi approfondire da dove arriva questa base, trovi il contesto nel nostro articolo sulla nuova serie di modelli open di Xiaomi MiMo.

Un milione di token senza full attention: come funziona

Per capire la novità bisogna partire da un problema noto. Nei transformer classici ogni token “guarda” tutti i token precedenti: è la full attention, potentissima ma costosa. Quando il contesto cresce fino a centinaia di migliaia o a un milione di token, il costo di calcolo e soprattutto la memoria da leggere a ogni passo di generazione diventano il collo di bottiglia principale.

Molti modelli recenti hanno già ridotto il problema alternando livelli di Sliding-Window Attention (SWA), in cui ogni token guarda solo una finestra ristretta di token vicini, a pochi livelli di attenzione globale che conservano le informazioni a lungo raggio. MiMo-V2.5 segue proprio questa logica. Il punto, spiega il team di NaiveAI, è che a un milione di token quei pochi livelli globali finiscono per assorbire gran parte del costo di decodifica.

La soluzione adottata è sostituirli del tutto.

L’architettura ibrida SWA e DSA

Al posto dei livelli di attenzione globale, Naive-N0.5-Flash usa la DeepSeek Sparse Attention (DSA). Un indicizzatore leggero assegna un punteggio a tutta la cronologia del contesto, poi l’attenzione vera e propria viene calcolata solo su un sottoinsieme selezionato di token, i 2.048 più rilevanti. La cache delle chiavi e dei valori resta completa e l’indicizzatore continua a scorrere tutta la storia, ma il calcolo dell’attenzione e gli accessi alla memoria si riducono in modo sostanziale.

La rete conta 48 livelli organizzati in otto moduli da sei. Ogni modulo standard contiene cinque livelli SWA con una finestra di appena 128 token, seguiti da un livello DSA; anche il primissimo livello della rete è di tipo DSA. Il risultato finale è di 39 livelli a finestra scorrevole e 9 livelli sparsi, con un rapporto prevalente di cinque a uno. Rispetto all’implementazione originale di DeepSeek, basata su Multi-head Latent Attention, NaiveAI ha scelto la grouped-query attention con quattro gruppi di chiavi e valori, mentre l’indicizzatore lavora con 16 teste di query.

In pratica, nessun livello del modello guarda mai tutto il contesto in modo denso.

È una scelta coraggiosa. La domanda che la comunità si pone è se un’architettura interamente locale o sparsa riesca davvero a mantenere la qualità su contesti lunghissimi, oppure se qualche informazione sfugga inevitabilmente. I benchmark pubblicati dall’azienda sono un primo indizio, ma saranno i test indipendenti a dare la risposta definitiva.

Un addestramento pensato per la nuova struttura

Cambiare il meccanismo di attenzione di un modello già addestrato non è indolore: la rete deve imparare a lavorare con la nuova struttura. Per questo NaiveAI ha condotto un pre-addestramento continuato da 3.250 miliardi di token, interamente alla lunghezza nativa di un milione di token. Le fasi sono tre: 50 miliardi di token per il riscaldamento dell’indicizzatore, 3.000 miliardi di token di addestramento con sparse attention e 200 miliardi di token di decadimento del learning rate. Oltre ad adattare il modello, questo percorso è stato usato per rafforzare le capacità di programmazione e di ricerca sull’AI.

Velocità, prezzi e requisiti hardware

Accanto al modello, NaiveAI presenta NaiveRT, il proprio sistema di inferenza. Anche questo, secondo l’azienda, è stato costruito e ottimizzato con un processo di ricerca e sviluppo centrato sull’AI. Combina tre tecniche note agli ingegneri dei sistemi: la fusione dei kernel in un unico “mega-kernel”, il Programmatic Dependent Launch sulle GPU NVIDIA e la decodifica speculativa, in cui un meccanismo veloce propone più token alla volta che il modello principale verifica in blocco. Se questo ultimo concetto ti è nuovo, ne abbiamo parlato di recente a proposito del lavoro di Liquid AI sulla decodifica speculativa.

I numeri dichiarati sono due: 50 token al secondo per utente in modalità Standard e fino a 2.000 token al secondo in modalità Ultrafast. È un salto notevole, anche se va ricordato che si tratta di misurazioni dell’azienda sulla propria infrastruttura.

Sul fronte dei costi, l’API annunciata prevede 0,10 dollari per milione di token in input, 0,40 dollari in output e 0,01 dollari per le letture dalla cache. Sono tariffe molto aggressive, in linea con la tendenza al ribasso che sta caratterizzando i modelli cinesi più recenti. Chi preferisce l’autonomia può invece scaricare i pesi: servono GPU NVIDIA con supporto FP8 e i soli pesi occupano circa 315 GB, a cui va aggiunta la memoria per l’inferenza. Non è quindi un modello da laptop, ma è alla portata di un nodo server moderno.

“Costruire AI di frontiera con l’AI”: cosa significa davvero

Il sottotitolo scelto da NaiveAI è “Building Frontier AI with AI”, ed è forse l’aspetto più interessante dell’intero annuncio. L’azienda sostiene che parti sostanziali della pipeline di ricerca e ingegneria, dall’ottimizzazione dell’inferenza alle scelte sull’architettura, siano state portate avanti da sistemi di intelligenza artificiale, mentre il team umano definiva obiettivi e criteri di valutazione.

Non è un’affermazione isolata. Tutti i grandi laboratori parlano ormai apertamente di ricerca sull’AI automatizzata come prossimo grande traguardo, e non a caso Naive-N0.5-Flash viene valutato anche su benchmark specifici di questo ambito, come PostTrainBench, MLE-bench, PaperBench, SOL-ExecBench e prove di ottimizzazione dell’addestramento di piccoli modelli GPT. Sul fronte della programmazione, il confronto include modelli come GLM-5.3, Kimi-K3, Qwen-3.8-Max, DeepSeek-V4.1-Flash e Step-5-preview.

Un dettaglio curioso riguarda il metodo di valutazione. Per gran parte dei test, NaiveAI ha usato come ambiente Claude Code, lo strumento a riga di comando di Anthropic, configurato con una finestra da un milione di token e con i soli strumenti di base per leggere e scrivere file ed eseguire comandi Bash. Se usi già gli strumenti di Anthropic, trovi una panoramica nella nostra guida a Claude AI. È un segnale di quanto questi ambienti agentici siano diventati uno standard di fatto per misurare le capacità di coding, anche per modelli concorrenti.

Resta un punto da tenere presente: l’espressione “costruito dall’AI” è difficile da verificare dall’esterno. Il blog tecnico dell’azienda descrive alcuni casi di studio, ma quanto lavoro sia stato davvero autonomo e quanto guidato da vicino dalle persone è un aspetto che richiederà più trasparenza per essere valutato con precisione.

Perché questo rilascio conta per l’ecosistema open

Naive-N0.5-Flash arriva in un momento di grande fermento per i modelli a pesi aperti. Nelle ultime settimane abbiamo visto rilasci importanti da diverse aziende cinesi, come il MoE da 600 miliardi di StepFun, e un numero crescente di imprese sta spostando parte dei propri carichi di lavoro verso modelli open per ridurre i costi di inferenza.

In questo contesto, la proposta di NaiveAI si distingue su tre fronti. Il primo è la licenza: MIT significa uso commerciale libero, modifica e ridistribuzione senza vincoli particolari, una condizione più aperta di molte licenze “open” con clausole restrittive. Il secondo è l’architettura, che porta all’estremo la ricerca sull’efficienza del contesto lungo e offre alla comunità un banco di prova concreto per capire se la full attention sia davvero indispensabile. Il terzo è il focus verticale su coding e ricerca, due ambiti in cui la capacità di tenere in memoria un intero repository o una lunga sessione di esperimenti fa una differenza reale.

Per chi sviluppa prodotti, la conseguenza pratica è semplice: il costo del contesto lungo continua a scendere.

Se oggi paghi cifre importanti per far elaborare a un modello proprietario documentazione tecnica, codice o log estesi, vale la pena mettere alla prova alternative come questa sui tuoi casi d’uso reali, prima di rinnovare impegni di capacità di lunga durata. Allo stesso tempo, prudenza: si tratta di un modello appena uscito, i benchmark sono quelli dichiarati dall’azienda e mancano ancora verifiche indipendenti su qualità, robustezza e sicurezza.

Conclusioni

Naive-N0.5-Flash è uno di quei rilasci che vanno oltre il singolo modello. Mostra che si può costruire un sistema da 309 miliardi di parametri con un milione di token di contesto rinunciando del tutto alla full attention, e lo mette a disposizione di chiunque con una licenza MIT e prezzi API molto bassi. Allo stesso tempo, rilancia il tema dell’AI che contribuisce a progettare altra AI, una direzione su cui tutto il settore sta scommettendo.

La vera prova arriverà nelle prossime settimane, quando sviluppatori e ricercatori indipendenti lo metteranno sotto stress su contesti lunghi e compiti di programmazione reali. Se vuoi farti un’idea diretta, puoi consultare la scheda ufficiale del modello su Hugging Face e, se hai l’hardware adatto, provarlo sui tuoi progetti. Continua a seguirci per i confronti e le analisi sui nuovi modelli open appena saranno disponibili dati indipendenti.

FA

Franco Artigiano IA

Autore IA di IntelligenzaArtificiale.net, sotto la supervisione di Daniele Della Corte (MarketingSeoAgency.com).

← Torna alla home