Qwen3.8-Omni-Flash: Alibaba lancia il modello omnimodale con un contesto da un milione di token
Alibaba presenta Qwen3.8-Omni-Flash, il modello omnimodale nativo che elabora testo, immagini, audio e video con un contesto da un milione di token.

Alibaba non rallenta. Il 18 settembre 2026 il team Qwen ha presentato Qwen3.8-Omni-Flash, un modello omnimodale nativo capace di elaborare testo, immagini, audio e video dentro un’unica finestra di contesto da un milione di token. Non è l’ennesimo aggiornamento incrementale, ma un modello pensato per capire flussi audio-video lunghi, pianificare azioni e usare strumenti, il tutto a un prezzo che ridimensiona in modo netto quello della generazione precedente.
Se negli ultimi mesi hai seguito la corsa dei laboratori cinesi, il nome non ti sorprende. Qwen è diventata una delle famiglie di modelli più prolifiche al mondo, e questa versione Omni-Flash sposta l’attenzione dal semplice riconoscimento di immagini a qualcosa di più ambizioso: un assistente che ascolta, guarda e agisce.
Cosa significa davvero omnimodale nativo
La parola omnimodale viene usata spesso a sproposito. Molti sistemi che si definiscono multimodali, in realtà, incollano insieme componenti separati: un modello per la visione, uno per la trascrizione dell’audio, uno per il linguaggio. Il risultato funziona, ma perde informazioni a ogni passaggio e fatica a ragionare su ciò che accade in un video mentre qualcuno parla.
Qwen3.8-Omni-Flash segue una strada diversa. È costruito sull’architettura Qwen3.8-Flash-Next, la stessa con cui Alibaba aveva anticipato le scelte tecniche di Qwen4, e integra le diverse modalità in un solo modello. Testo, immagini, tracce audio e sequenze video entrano nello stesso contesto e vengono elaborati insieme.
Il modello risponde in testo, ma può ragionare su input che mescolano più formati contemporaneamente.
Questa impostazione affonda le radici nella linea Qwen3-Omni, che aveva introdotto un’architettura chiamata Thinker-Talker e la generazione vocale in tempo reale. Omni-Flash eredita quella filosofia e la porta dentro un prodotto commerciale, pensato più per la produttività che per la dimostrazione tecnica.
Il dettaglio che colpisce di più è la finestra di contesto: un milione di token. Tradotto in pratica, significa poter dare in pasto al modello ore di registrazioni, interi archivi di documenti o video lunghi senza doverli spezzare in tanti frammenti. Per chi lavora con materiale audio-video esteso, come riunioni, lezioni, riprese o podcast, è la differenza tra analizzare un’opera intera e leggerne soltanto qualche pagina.
Un balzo di prestazioni sugli agenti audio-video
I numeri diffusi da Alibaba raccontano un miglioramento consistente. Su una batteria di circa trenta benchmark, tra test pubblici e prove interne, Qwen3.8-Omni-Flash ottiene in media oltre il 26% in più rispetto alla generazione precedente, la Qwen3.5-Omni-Plus.
I progressi maggiori arrivano proprio dove il modello vuole distinguersi, cioè nei compiti agentici e in quelli che richiedono ragionamento su tempi lunghi. Sul benchmark WildClawBench-MM il punteggio sale di 36,5 punti, su AgenticVBench di 22,3 punti, mentre su UniClawBench il modello raggiunge quota 69,6.
Non sono cifre astratte. Misurano quanto bene il modello sa seguire un obiettivo per molti passaggi, guardare un contenuto e poi fare qualcosa con ciò che ha visto.
Non solo capire, ma agire
La vera novità è che Qwen3.8-Omni-Flash non si limita a descrivere quello che percepisce. Supporta il function calling, la ricerca sul web, gli output strutturati, la memorizzazione del contesto e le chiamate in batch. È presente anche una modalità di ragionamento, la cosiddetta thinking mode, che permette al modello di elaborare un piano prima di rispondere.
Messe insieme, queste funzioni cambiano lo scenario. Con una sola chiamata il modello può analizzare un video, individuare un’informazione e poi attivare uno strumento esterno per completare un’operazione. È esattamente il tipo di comportamento che serve per costruire agenti capaci di gestire flussi di lavoro reali, non semplici chatbot.
Il colpo grosso è sul prezzo
Se c’è un elemento che potrebbe spingere gli sviluppatori a provare subito Qwen3.8-Omni-Flash, è il costo. Alibaba dichiara che, per ogni ora di audio in ingresso, il nuovo modello costa il 98% in meno rispetto a Qwen3.5-Omni-Plus. Considerando insieme audio e video, il risparmio dichiarato è del 93%.
Su QwenCloud le tariffe partono da 0,15 dollari per milione di token in ingresso e 0,47 dollari per milione in uscita, con il contesto memorizzato che scende a 0,016 dollari per milione. Sono valori che rendono economicamente sostenibili applicazioni prima proibitive, come l’analisi continua di grandi quantità di audio e video.
Il messaggio implicito è chiaro: rendere l’elaborazione audio-video così economica da trasformarla in una funzione ordinaria, e non in un lusso da centellinare.
Solo cloud, niente pesi aperti
C’è però una scelta che segna un cambio di rotta rispetto ad altri rilasci recenti di Alibaba. Qwen3.8-Omni-Flash arriva senza pesi aperti: al momento del lancio non è possibile scaricarlo e ospitarlo sui propri server. Lo usi tramite la piattaforma di Qwen e le API cloud, non in locale.
È una differenza importante se pensi alla linea open che la stessa azienda ha portato avanti. Modelli come Qwen3.8-27B, rilasciato con pesi aperti e pensato per girare su hardware locale, seguivano una filosofia opposta. Qui invece Alibaba tiene il modello dentro il proprio perimetro, come già accade per il suo modello di punta Qwen3.8-Max.
La scelta ha una logica commerciale precisa. I modelli Flash servono a spingere i volumi di utilizzo sul cloud, e i prezzi bassissimi vanno letti anche in questa chiave: più che vendere licenze, Alibaba punta a rendere la sua infrastruttura la scelta più conveniente per chi costruisce prodotti.
La corsa all’omnimodale entra nel vivo
Qwen3.8-Omni-Flash non nasce nel vuoto. La capacità di unire testo, immagini, audio e video in un solo modello è diventata il nuovo terreno di scontro tra i grandi laboratori. Google ha spinto sulla sua linea Gemini con funzioni multimodali sempre più avanzate, OpenAI ha reso l’interazione vocale e visiva un pilastro di ChatGPT, e i laboratori cinesi rincorrono con rilasci a ritmo quasi settimanale.
La generazione precedente open della famiglia, Qwen3-Omni, aveva già rivendicato risultati allo stato dell’arte su decine di benchmark audio e audio-visivi, battendo in alcuni casi modelli chiusi molto noti. Con Omni-Flash, Alibaba prova a portare quella qualità dentro un prodotto veloce ed economico.
La direzione è la stessa che vediamo anche altrove: dare occhi e orecchie agli agenti. Modelli come DeepSeek-V4-Flash-Vision-Exp vanno verso lo stesso obiettivo, segno che il 2026 è l’anno in cui la multimodalità smette di essere una demo e diventa infrastruttura.
Per te che sviluppi o segui da vicino il settore, il punto non è quale sigla vince questo mese. È che il costo per analizzare un’ora di audio o di video sta crollando, e questo apre la porta a prodotti che fino a poco fa erano semplicemente troppo cari da costruire.
A chi serve un modello che ascolta e guarda
Vale la pena immaginare gli usi concreti. Un servizio clienti può analizzare in tempo reale intere conversazioni telefoniche, non solo trascriverle, ma capire il tono, riassumere il problema e proporre una soluzione. Una redazione può dare in pasto al modello ore di girato e ottenere i momenti salienti, con tanto di contesto.
Nel mondo della formazione, un docente può trasformare una lezione registrata in appunti, quiz e schede di approfondimento. Chi si occupa di accessibilità può generare descrizioni dettagliate di video per chi non vede, o sottotitoli intelligenti che colgono anche ciò che accade sullo schermo.
Sono scenari già possibili con altri strumenti, certo. La differenza la fanno il contesto enorme e il prezzo: quando elaborare un’ora di audio costa pochi centesimi, queste funzioni smettono di essere progetti pilota e diventano parte del prodotto.
Cosa cambia concretamente
Qwen3.8-Omni-Flash è un segnale di dove sta andando l’intelligenza artificiale applicata. Non conta solo quanto è potente un modello, ma quanto è pratico usarlo su contenuti reali, lunghi e disordinati come quelli che produciamo ogni giorno.
Un contesto da un milione di token, un’architettura nativa e prezzi che abbattono la barriera dell’audio-video mettono nelle mani di sviluppatori e aziende uno strumento che prima richiedeva budget importanti. Se il modello manterrà sul campo le promesse dei benchmark, potremmo vedere una nuova ondata di applicazioni costruite attorno a video, riunioni e archivi vocali.
Se ti occupi di prodotti digitali, di automazione o di analisi di contenuti, vale la pena provarlo di persona sulla piattaforma Qwen Chat e valutare come integrarlo nei tuoi flussi. E se vuoi restare aggiornato sulle prossime mosse dei laboratori AI, continua a seguirci: la corsa all’omnimodale è appena entrata nella sua fase più interessante.