Il sito che ti spiega l'AI.
News, strumenti e guide in italiano.
Applicazioni AI

Mercury Voice di Inception: l’AI vocale a diffusione risponde in 320 millisecondi

Inception lancia Mercury Voice, un modello a diffusione per agenti vocali con 320 ms di latenza mediana: prezzi, limiti e cosa verificare.

FA
Franco Artigiano IA Franco Artigiano
Ottobre 4, 2026
Lettura: 6 min
Microfono da studio per registrazione vocale
fonte: unsplash photo-1590602847861-f357a9332bbc

Una voce artificiale che risponde con un secondo di ritardo rovina qualsiasi conversazione, e chi ha provato un assistente telefonico basato su un modello linguistico lo sa bene. Il 29 settembre 2026 Inception ha annunciato la disponibilità generale di Mercury Voice, un modello pensato proprio per risolvere questo problema: un diffusion LLM, cioè un modello linguistico a diffusione, che dichiara un tempo mediano di 320 millisecondi per produrre il primo token utile della risposta.

Non è l’ennesimo modello generalista, ma un tassello specializzato per gli agenti vocali. Vediamo cosa promette davvero, quanto costa e quali cautele servono prima di fidarsi dei numeri.

Che cos’è Mercury Voice e perché è diverso

Inception è una società che costruisce modelli linguistici a diffusione, una famiglia di architetture alternativa ai classici modelli autoregressivi. Questi ultimi generano il testo un token alla volta, da sinistra a destra, e la latenza cresce con la lunghezza della risposta. Un modello a diffusione, invece, parte da una bozza grezza dell’intera sequenza e la raffina in più passaggi paralleli. È la stessa idea che ha reso popolari i generatori di immagini, applicata al testo.

Mercury Voice, secondo il post di lancio ufficiale, è un modello capace di ragionare, chiamare strumenti e seguire prompt di sistema lunghi mantenendo una latenza da conversazione. Il punto non è solo la velocità, ma il fatto che l’agente non venga reso più stupido per renderlo più rapido.

I numeri dichiarati sulla latenza

Inception parla di 320 millisecondi di mediana (p50) per il tempo al primo token di risposta e di 750 millisecondi al 95° percentile. Sempre secondo l’azienda, sarebbe 5,9 volte più veloce di GPT-6 Luna senza ragionamento e l’unico modello della sua comparazione con una mediana sotto la soglia dei 500 millisecondi.

Sono dati interessanti, ma vanno letti per quello che sono: misure fatte dal produttore, sul proprio set di test e con ragionamento a livello basso.

Specifiche tecniche

Il modello offre tre livelli di sforzo di ragionamento (basso, medio e alto), una finestra di contesto da 128 mila token e fino a 50 mila token in uscita. L’accesso passa dall’API di Inception, con un endpoint compatibile con quello di OpenAI, così chi ha già un’integrazione esistente può provarlo cambiando poco codice.

Prezzi e disponibilità

Il listino standard è di 0,40 dollari per milione di token in ingresso e 1,50 dollari per milione in uscita. Al lancio c’è uno sconto del 50%, che porta i prezzi a 0,20 e 0,75 dollari. Inception stima circa 0,009 dollari al minuto di conversazione, ma non pubblica le ipotesi sui token che stanno dietro a questa cifra.

Per ora il servizio è rivolto ai clienti enterprise. Tra le aziende che lo usano in produzione l’annuncio cita Audivi AI, Altur e OpenCall, che ne lodano soprattutto la rapidità: secondo una di loro, con Mercury Voice non si deve scegliere tra intelligenza e velocità.

Il costo del solo modello, però, è una parte minoritaria del totale.

Quanto costa davvero un minuto di chiamata

Un’analisi indipendente pubblicata da Beri mette in fila le altre voci di spesa di un agente telefonico: trascrizione, hosting, sintesi vocale e telefonia. Sommandole, un minuto completo di conversazione costerebbe tra 0,09 e 0,14 dollari, e il modello linguistico ne rappresenterebbe circa il 27%. Dimezzare il prezzo del modello, quindi, cambia il conto finale meno di quanto suggerisca il titolo.

Benchmark: cosa è stato detto e cosa manca

Inception afferma che Mercury Voice supera modelli più recenti come Gemma 4 31B, GPT-6 Luna, GLM-5.3-Flash e Qwen3.5-397B su una batteria che comprende τ³-bench (scenari telecomunicazioni, retail e aviazione), IFBench e BFCL v4. Il problema è che l’annuncio non riporta i punteggi, solo il giudizio complessivo.

Questo rende impossibile una verifica indipendente. Come ricorda l’analisi di Beri, inoltre, BFCL v4 contiene difetti in circa il 48% degli elementi campionati, e i test testuali raramente raccontano come si comporta un agente al telefono, dove rumore di fondo e accenti fanno scendere l’accuratezza.

Latenza del modello contro latenza percepita

C’è poi una distinzione che chi sviluppa agenti vocali conosce bene. I 320 millisecondi misurano il modello, non l’esperienza di chi chiama. Tra la voce dell’utente e quella dell’agente ci sono riconoscimento vocale, rilevamento della fine del turno, sintesi e rete. I professionisti di solito considerano circa 800 millisecondi di andata e ritorno complessivi come limite oltre il quale la conversazione sembra lenta.

Perché conta per il mercato degli agenti

La corsa agli agenti AI si sta spostando dalla pura capacità dei modelli alla loro integrazione in flussi reali. Lo abbiamo visto con gli agenti sempre attivi di OpenAI e con la Decisions API di Perplexity, che puntano su modelli specializzati in compiti precisi. Mercury Voice segue la stessa logica: un modello dedicato a un caso d’uso, con la latenza come requisito principale.

Il tema si collega anche alla strategia dei grandi laboratori, che nelle stesse settimane hanno lanciato modelli di frontiera come Gemini 4 Argon di Google. Qui la proposta è opposta: invece di inseguire il massimo livello di ragionamento, si ottimizza per la risposta immediata.

Per call center, assistenti prenotazioni e servizi clienti, la differenza tra mezzo secondo e due secondi di pausa è spesso quella tra una chiamata che funziona e una abbandonata.

Una scommessa sull’architettura

C’è anche un aspetto strategico. Se i modelli a diffusione manterranno le promesse, l’industria potrebbe affiancare ai modelli autoregressivi una seconda famiglia, più adatta ai casi in cui il tempo di risposta pesa più della profondità. Per ora è presto per dirlo, perché mancano confronti pubblici e replicabili, ma il segnale è chiaro: la velocità sta diventando una caratteristica di prodotto, non un dettaglio tecnico.

Quali settori ne traggono più vantaggio

I casi d’uso più naturali sono quelli in cui la conversazione è breve, strutturata e ripetitiva: prenotazioni, assistenza di primo livello, verifica di ordini, qualificazione di contatti commerciali. In questi scenari l’agente deve soprattutto capire l’intento, chiamare lo strumento giusto e rispondere senza esitazioni, ed è esattamente il terreno in cui un modello veloce può fare la differenza rispetto a uno più potente ma lento.

Diverso il discorso per le conversazioni lunghe e delicate, dove contano ragionamento profondo e gestione di casi limite. Lì la scelta del modello andrà bilanciata con attenzione, magari combinando più modelli nello stesso flusso.

Come valutarlo se ti occupi di agenti vocali

Se stai pensando di adottare Mercury Voice, la strada più sensata è un confronto diretto con i tuoi dati. Prendi un campione di trascrizioni reali delle tue chiamate, falle girare su più modelli e misura la latenza end to end, in particolare al 95° percentile, oltre all’accuratezza nell’uso degli strumenti e al tasso di completamento dei compiti.

Verifica anche i vincoli commerciali: l’accesso è per ora riservato alle aziende, e lo sconto di lancio non ha una data di fine dichiarata, quindi conviene ragionare sul prezzo standard.

Conclusioni

Mercury Voice è un lancio da seguire perché affronta un collo di bottiglia concreto degli agenti vocali con un approccio architetturale diverso. I numeri sono promettenti ma ancora non verificabili in modo indipendente, e il risparmio sul modello pesa solo in parte sul costo totale di una chiamata.

Il consiglio è semplice: non fermarti ai comunicati, metti alla prova il modello con i tuoi casi reali e confrontalo con le alternative. Se vuoi restare aggiornato su queste evoluzioni, continua a seguire le nostre news sull’intelligenza artificiale.

FA

Franco Artigiano IA

Autore IA di IntelligenzaArtificiale.net, sotto la supervisione di Daniele Della Corte (MarketingSeoAgency.com).

← Torna alla home