Il sito che ti spiega l'AI.
News, strumenti e guide in italiano.
Aggiornamenti di progetti

Qwen-Audio-3.1, Alibaba lancia cinque modelli vocali e taglia i prezzi fino al 95%

Qwen-Audio-3.1 porta cinque modelli vocali Alibaba per trascrizione, sintesi e conversazione, con prezzi delle API ridotti fino al 95%.

FA
Franco Artigiano IA Franco Artigiano
Settembre 25, 2026
Lettura: 7 min
Microfono da studio nero e argento su asta, simbolo dei modelli vocali AI Qwen-Audio-3.1
fonte: unsplash photo-1590602847861-f357a9332bbc

Alibaba rilancia la sfida sulla voce artificiale. Il team Qwen ha presentato Qwen-Audio-3.1, una famiglia di cinque modelli che copre riconoscimento del parlato, sintesi vocale, conversazione in tempo reale e creazione di contenuti audio. La vera notizia, però, non sta solo nelle funzioni: insieme al rilascio arriva un taglio dei prezzi che su alcune API sfiora il 95%, una mossa che rischia di cambiare i conti di chiunque costruisca prodotti basati sulla voce.

L’annuncio è arrivato durante la settimana della Apsara Conference di Hangzhou, l’evento annuale di Alibaba Cloud, ed è stato rilanciato dal team Qwen sul proprio profilo ufficiale su X. I nuovi listini sono in vigore dal 22 settembre, ora di Pechino.

Cosa contiene Qwen-Audio-3.1: cinque modelli per un’unica pipeline vocale

L’idea di fondo è offrire uno stack audio completo, in cui ogni pezzo copre una fase diversa del lavoro con la voce: capire cosa viene detto, generare parlato, sostenere una conversazione e produrre contenuti sonori più elaborati. Tre modelli esistenti ricevono un aggiornamento, cioè ASR, TTS e Realtime, mentre due sono del tutto nuovi, TTS-Next e ASR-Next.

È un approccio diverso rispetto a chi punta tutto su un singolo modello multimodale.

Qui Alibaba separa i compiti e li rende acquistabili come API distinte, con prezzi e caratteristiche specifiche. Per chi sviluppa significa poter combinare i blocchi in base al caso d’uso, senza pagare capacità che non servono.

ASR e ASR-Next: capire non solo le parole, ma il contesto

Il modello ASR aggiornato migliora il riconoscimento multilingue e quello dei dialetti, un punto spesso debole nei sistemi di trascrizione. In più ripulisce automaticamente il testo da intercalari e ripetizioni, così la trascrizione risulta già leggibile senza passaggi di revisione manuale.

ASR-Next va oltre la semplice trascrizione. Secondo quanto comunicato dal team Qwen, il modello identifica più parlanti e assegna a ciascun intervento i relativi timestamp, riconosce le emozioni nella voce e rileva i suoni ambientali, compresi i rumori delle macchine. In pratica non restituisce soltanto il testo di una registrazione, ma una descrizione più ricca di quello che accade nell’audio.

Pensa a un call center che vuole capire in quali momenti un cliente si è irritato, oppure a uno stabilimento industriale che vuole intercettare un rumore anomalo in una linea di produzione.

TTS e TTS-Next: dalla lettura del testo alla produzione audio

Il modello TTS gestisce la sintesi in più lingue e consente di trasferire una voce da una lingua all’altra mantenendone il timbro in modo naturale. Emozione, velocità e stile si controllano con semplici istruzioni testuali: chiedi un tono deciso e autorevole, oppure una lettura calma e lenta, e il modello si adegua.

TTS-Next è il componente pensato per chi crea contenuti. Combina un modello linguistico con un approccio basato sulla diffusione e genera in un solo passaggio la voce, gli effetti sonori e l’audio di sottofondo. Invece di assemblare tracce separate in un software di montaggio, puoi ottenere una scena sonora già composta.

Realtime: la conversazione full duplex che si adatta all’umore

Il modello Realtime supporta la conversazione full duplex: parla e ascolta nello stesso momento e può essere interrotto all’istante, come accade in un dialogo tra persone. Qwen aggiunge un dettaglio interessante: quando il sistema percepisce un umore basso nell’interlocutore, risponde più lentamente e con un tono più empatico.

È una funzione che va nella direzione degli assistenti vocali meno meccanici, anche se andrà verificata sul campo.

Il taglio dei prezzi fino al 95%: perché è la parte più rilevante

Le novità tecniche contano, ma il segnale più forte arriva dal listino. Alibaba ha ridotto i prezzi dell’intera linea Qwen-Audio: la sintesi vocale TTS costa circa il 70% in meno, il modello Realtime circa l’85% in meno, e il riconoscimento vocale ASR fino al 95% in meno.

Per un’azienda che trascrive migliaia di ore di chiamate al mese, o che gestisce un assistente vocale sempre attivo, una riduzione di questa portata sposta in modo sostanziale il costo per utente. Progetti che fino a ieri non stavano in piedi economicamente potrebbero diventare sostenibili, soprattutto nei casi ad alto volume e basso margine.

La trascrizione, in particolare, rischia di diventare quasi una commodity.

Non è la prima volta che Alibaba usa la leva del prezzo per guadagnare quote di mercato nel cloud AI. La strategia è coerente con quanto visto nelle ultime settimane attorno alla conferenza Apsara, dove il gruppo ha presentato anche nuovi chip e piattaforme per agenti, come abbiamo raccontato parlando di Zhenwu V900, Qwen 4 e AgentCore. L’obiettivo è evidente: rendere l’ecosistema Qwen la scelta più conveniente per chi sviluppa applicazioni.

Il contesto: la corsa alla voce tra i grandi laboratori

La voce è diventata uno dei terreni di confronto più accesi tra i laboratori di intelligenza artificiale. Negli ultimi mesi quasi tutti i grandi attori hanno rilasciato modelli vocali di nuova generazione, con particolare attenzione alla latenza e alla naturalezza della conversazione.

Google, per esempio, ha puntato di recente su Gemini 3.8 Flash TTS per la sintesi vocale, mentre OpenAI e Microsoft hanno lavorato su modelli full duplex capaci di ascoltare e parlare in contemporanea. Alibaba stessa, pochi giorni fa, aveva presentato Qwen3.8 Omni Flash, un modello omnimodale in grado di lavorare su testo, audio e video.

Qwen-Audio-3.1 si colloca in modo complementare a quel modello.

Se l’approccio omnimodale punta a un unico sistema che fa tutto, la nuova linea audio offre componenti specializzati e ottimizzati per singoli compiti, con costi calibrati su ciascuno. Per molte applicazioni di produzione, dove conta più l’affidabilità di una singola funzione che la versatilità, questa separazione può essere un vantaggio concreto.

La pressione competitiva sui prezzi

Il taglio annunciato da Alibaba mette pressione sull’intero mercato. Chi offre API di trascrizione e sintesi vocale dovrà confrontarsi con listini molto più bassi, e la differenza di prezzo potrebbe spingere alcuni sviluppatori a provare le alternative cinesi, almeno per i progetti in cui non ci sono vincoli particolari sulla localizzazione dei dati.

Resta infatti da considerare il tema della conformità. Per le aziende europee la scelta di un fornitore cloud passa anche dalla gestione dei dati personali, dal GDPR e dai requisiti dell’AI Act. Il prezzo è un fattore importante, ma non l’unico.

Cosa cambia concretamente per sviluppatori e aziende

Se lavori con la voce, le implicazioni pratiche sono diverse. La prima riguarda il budget: con costi di trascrizione ridotti fino al 95%, diventa più semplice analizzare in modo sistematico riunioni, chiamate commerciali, interviste o contenuti video, estraendo informazioni che prima si lasciavano perdere perché troppo costose da elaborare.

La seconda riguarda la qualità dei dati. Un ASR che distingue i parlanti, segna i tempi e riconosce le emozioni fornisce materiale molto più utile per le analisi successive, per esempio per valutare la qualità del servizio clienti o per costruire riassunti automatici più precisi.

La terza riguarda la creazione di contenuti. TTS-Next, con la generazione congiunta di voce, effetti e sottofondo, può accorciare i tempi di produzione di podcast, audiolibri, spot e materiali formativi. Se vuoi approfondire le basi di questa tecnologia, puoi leggere la nostra guida su come funziona la sintesi vocale con l’AI.

Infine c’è il tema degli assistenti conversazionali, dove la combinazione di full duplex e adattamento al tono emotivo punta a interazioni più naturali.

Cosa tenere d’occhio

Come sempre, gli annunci vanno verificati con test reali. Le prestazioni sui dialetti e sulle lingue meno diffuse, italiano compreso, andranno valutate caso per caso, così come l’affidabilità del riconoscimento delle emozioni, un compito notoriamente difficile anche per le persone. Anche la funzione di trasferimento della voce tra lingue solleva domande sull’uso responsabile, in un periodo in cui i deepfake audio sono una preoccupazione crescente.

Conviene quindi partire da un progetto pilota, misurare qualità e costi sul proprio caso d’uso e solo dopo decidere se migrare carichi di lavoro importanti.

Conclusioni

Con Qwen-Audio-3.1 Alibaba non si limita ad aggiornare i suoi modelli vocali: costruisce uno stack audio completo e lo accompagna con un taglio dei prezzi aggressivo, che va dal 70% della sintesi vocale fino al 95% del riconoscimento del parlato. È una combinazione pensata per attirare sviluppatori e aziende che lavorano su grandi volumi di audio.

Il messaggio al mercato è chiaro: la voce artificiale sta diventando sempre più economica.

Se stai progettando un assistente vocale, un sistema di trascrizione o una pipeline di produzione audio, questo è il momento giusto per rifare i conti e confrontare i fornitori. Continua a seguire intelligenzaartificiale.net per restare aggiornato sulle novità dei modelli vocali e scrivici quali strumenti audio stai usando nei tuoi progetti.

FA

Franco Artigiano IA

Autore IA di IntelligenzaArtificiale.net, sotto la supervisione di Daniele Della Corte (MarketingSeoAgency.com).

← Torna alla home