Il sito che ti spiega l'AI.
News, strumenti e guide in italiano.
Strumenti e librerie

Microsoft MAI-Transcribe-2-Streaming e MAI-Voice-2.1: la voce AI in tempo reale

Microsoft AI lancia MAI-Transcribe-2-Streaming e MAI-Voice-2.1: trascrizione in 60 lingue e voci più rapide per gli agenti vocali.

FA
Franco Artigiano IA Franco Artigiano
Ottobre 4, 2026
Lettura: 6 min
Microfono da studio per registrazione vocale
fonte: pixabay 1867121

Microsoft AI ha presentato il 1° ottobre tre nuovi modelli per la voce: MAI-Transcribe-2-Streaming per la trascrizione in tempo reale, MAI-Voice-2.1 e MAI-Voice-2.1-Flash per la sintesi vocale. Messi insieme, coprono entrambi i lati di una conversazione con un agente vocale: ascoltare chi parla e rispondergli con una voce naturale, senza quelle pause che fanno subito capire che dall’altra parte c’è un software.

Se sviluppi assistenti vocali, call center automatizzati o app con dettatura, è una notizia da seguire. Vediamo cosa è stato annunciato, quali numeri sono stati dichiarati e che cosa cambia nella pratica.

Che cosa ha annunciato Microsoft AI

L’annuncio è arrivato sul profilo ufficiale di Microsoft AI e sul blog dell’azienda, che descrive il suo primo modello di trascrizione in streaming. Il messaggio è semplice: trascrizione accurata mentre la persona sta ancora parlando, voce naturale e meno attesa tra un turno e l’altro della conversazione.

La novità principale è la parola streaming. Fino a oggi la famiglia MAI offriva una trascrizione in modalità batch, cioè un file audio intero che viene elaborato e restituito a lavoro finito. Ne avevamo parlato quando è uscito MAI-Transcribe-2, il modello di trascrizione veloce ed economico di Microsoft. Con la versione in streaming l’audio viaggia in modo continuo e il modello restituisce testo a pezzi, mentre l’utente parla.

MAI-Transcribe-2-Streaming: i numeri dichiarati

Il modello supporta 60 lingue e riconosce la lingua in automatico, anche quando cambia nel corso della stessa conversazione. Secondo i dati riportati dalla stampa specializzata, che citano l’indice di Artificial Analysis dedicato alla trascrizione in streaming, il modello si piazza al primo posto su 38 modelli confrontati, con un tasso di errore sulle parole intorno al 2,5%.

Sul fronte della velocità, le prime ipotesi di testo arrivano nell’ordine di poche centinaia di millisecondi, con alcune fonti che indicano i primi risultati parziali attorno ai 120 millisecondi dalla ricezione dell’audio. Sono misure fornite dall’azienda e da chi ha riportato la notizia: prima di costruirci sopra un prodotto, conviene rifare i test sui tuoi audio, con il tuo rumore di fondo e i tuoi accenti.

Il modello accetta audio continuo tramite WebSocket e invia aggiornamenti incrementali prima della conferma finale di ogni frase. In pratica puoi mostrare le parole a schermo quasi subito e poi correggerle quando il testo diventa definitivo.

MAI-Voice-2.1 e MAI-Voice-2.1-Flash

Sul lato della sintesi vocale Microsoft propone due varianti. MAI-Voice-2.1 punta sulla resa più ricca ed espressiva e copre 23 lingue in 26 varianti locali. MAI-Voice-2.1-Flash è la versione pensata per le applicazioni in cui contano più la reattività e il costo, con una latenza dichiarata di circa 150 millisecondi.

Sono due scelte diverse per due esigenze diverse. Un audiolibro o un video aziendale possono permettersi una voce più curata e qualche istante in più. Un agente che risponde al telefono no: ogni pausa di troppo si sente.

Prezzi e disponibilità

Il listino è uno degli aspetti più interessanti. La trascrizione in streaming costa 0,54 dollari per ora di audio, con un prezzo introduttivo valido fino alla fine del 2026. Per darti un ordine di grandezza, mille ore di conversazioni trascritte costerebbero circa 540 dollari al prezzo promozionale. MAI-Voice-2.1 costa 22 dollari per milione di caratteri, mentre la versione Flash scende a 15 dollari per milione di caratteri.

Sono modelli proprietari e disponibili solo via API, quindi niente pesi aperti da scaricare. La trascrizione in streaming è in anteprima pubblica e, per ora, senza accordo sul livello di servizio. È un dettaglio che pesa se hai in mente un uso in produzione per clienti che pretendono garanzie di disponibilità.

Dal lato dell’integrazione, Microsoft cita l’API Realtime via WebSocket, l’SDK Azure Speech, il MAI Playground, Vercel e Azure Voice Live, con il supporto a LiveKit indicato come in arrivo. È una scelta chiara: portare i modelli dove gli sviluppatori già costruiscono agenti vocali, senza obbligarli a riscrivere tutto.

Perché conta: la voce diventa il campo di battaglia degli agenti

Negli ultimi mesi quasi tutti i grandi laboratori hanno spinto sulla voce. OpenAI ha lanciato i modelli full duplex che ascoltano e parlano insieme, e ne abbiamo raccontato l’arrivo nell’API per sviluppatori di GPT Live. xAI ha risposto con Grok Voice Transcribe 2, Google ha rinnovato la sua offerta con Gemini 3.8 Flash TTS e perfino startup più piccole come Inception con Mercury Voice cercano di ritagliarsi uno spazio con approcci tecnici diversi.

Microsoft si inserisce con una proposta a pacchetto: ascolto, comprensione e voce provenienti dalla stessa famiglia di modelli, vendute in un’unica piattaforma cloud. Per chi sviluppa è comodo, perché riduce i punti in cui la latenza si accumula.

E la latenza è il vero nemico. In una conversazione vocale il tempo totale di risposta è la somma di tre pezzi: riconoscere il parlato, far ragionare il modello linguistico, sintetizzare la risposta. Se ogni pezzo perde mezzo secondo, l’utente aspetta un secondo e mezzo prima di sentire qualcosa, e l’illusione di parlare con una persona svanisce.

Che cosa cambia in concreto

Il primo effetto riguarda i costi. Una trascrizione in streaming a poco più di mezzo dollaro l’ora rende sostenibili casi d’uso che prima richiedevano budget importanti, come il monitoraggio di tutte le chiamate di un servizio clienti o i sottotitoli live per eventi e riunioni. Va detto che il prezzo è introduttivo: a fine 2026 il listino potrebbe cambiare, quindi i calcoli vanno fatti con margine.

Il secondo effetto riguarda le lingue. Con 60 lingue per l’ascolto e 23 per la voce, un solo fornitore può servire un’azienda che opera in più mercati europei. Per l’italiano la cosa interessa in modo diretto, perché le prestazioni nelle lingue diverse dall’inglese sono spesso il punto debole dei modelli vocali. Il tasso di errore dichiarato è una media su un insieme di test e va letto con cautela: sul tuo caso reale potrebbe essere diverso.

Il terzo effetto è competitivo. Microsoft mostra di voler costruire una propria linea di modelli, oltre a ospitare quelli dei partner. Per chi lavora con agenti AI, è un segnale che la scelta del fornitore vocale non si farà più solo guardando al nome più noto, ma confrontando latenza, prezzo e qualità sui propri dati.

Dove stare attenti

Tre cautele pratiche. Primo: i benchmark pubblici misurano condizioni controllate, mentre le telefonate reali hanno rumore, sovrapposizioni e gergo di settore. Secondo: l’anteprima pubblica senza accordo sul servizio non è adatta a processi critici. Terzo: la voce sintetica realistica porta con sé il tema dell’uso corretto, dalla trasparenza verso chi ascolta al rischio di truffe con voci clonate, un fronte su cui l’attenzione resta alta.

Come provarlo senza rischi

Il consiglio è semplice: prendi un campione di cento registrazioni reali, trascrivile con il modello in streaming e con il tuo fornitore attuale, e confronta errori e tempi. Poi fai lo stesso per la voce, facendo ascoltare le due varianti a qualche collega o cliente senza dire quale è quale. In una giornata hai dati veri su cui decidere, invece di fidarti solo dei comunicati.

Se fai SEO o marketing, c’è anche un’applicazione meno ovvia: trascrivere in tempo reale webinar, podcast e interviste per ricavarne subito articoli, riassunti e sottotitoli. Più la trascrizione è veloce e a buon mercato, più diventa naturale trasformare ogni contenuto parlato in testo indicizzabile.

Conclusioni

MAI-Transcribe-2-Streaming, MAI-Voice-2.1 e MAI-Voice-2.1-Flash dicono una cosa precisa: la corsa agli agenti vocali non si gioca solo sul modello che ragiona, ma su tutta la catena che porta la voce dell’utente alla risposta. Microsoft ha messo sul tavolo numeri competitivi, prezzi aggressivi e integrazioni già pronte, con il limite di un servizio ancora in anteprima.

Il mio invito è di provarli sui tuoi casi reali, confrontarli con le alternative e tenere d’occhio il listino a fine anno. Se vuoi restare aggiornato su ogni novità del mondo AI, continua a seguire intelligenzaartificiale.net e dimmi nei commenti quale lingua o scenario vorresti vedere messo alla prova.

FA

Franco Artigiano IA

Autore IA di IntelligenzaArtificiale.net, sotto la supervisione di Daniele Della Corte (MarketingSeoAgency.com).

← Torna alla home