Grok Voice Transcribe 2.0: xAI raddoppia la precisione della trascrizione vocale allo stesso prezzo
xAI presenta Grok Voice Transcribe 2.0, il modello speech-to-text due volte più preciso e primo per accuratezza tra 32 modelli in streaming.

Il 18 settembre 2026 xAI ha presentato Grok Voice Transcribe 2.0, la nuova versione del suo modello di trascrizione vocale, cioè un sistema speech-to-text che trasforma l’audio in testo. La promessa è tanto semplice quanto ambiziosa: una precisione doppia rispetto alla versione precedente, senza alcun aumento di prezzo. Per chi costruisce assistenti vocali, sottotitola video o analizza le telefonate di un servizio clienti, è un aggiornamento che pesa più di quanto il numero di versione lasci intuire.
Il modello nasce dalla stessa base audio che alimenta Grok Voice, la tecnologia vocale che xAI utilizza già in produzione su larga scala. E arriva in un momento in cui la trascrizione automatica è diventata l’ingranaggio silenzioso di moltissimi prodotti AI, dagli agenti conversazionali alle piattaforme di videoconferenza.
Vediamo nel dettaglio cosa cambia, quanto costa e perché il salto di qualità riguarda soprattutto l’audio più difficile.
Cosa è Grok Voice Transcribe 2.0
Grok Voice Transcribe 2.0 è un modello di riconoscimento vocale progettato per convertire il parlato in testo scritto. A differenza della sintesi vocale, che compie il percorso inverso trasformando il testo in voce, qui l’obiettivo è ascoltare una registrazione o un flusso audio in tempo reale e restituire una trascrizione il più possibile fedele.
La vera novità sta nelle fondamenta. Il modello è costruito sulla stessa base audio che alimenta Grok Voice, la componente vocale che xAI ha ormai integrato in numerosi prodotti. Secondo l’azienda, Grok Voice gestisce ogni giorno decine di migliaia di chiamate di assistenza clienti, trascrive milioni di ore di narrazione video e fa funzionare agenti vocali dentro dispositivi fisici, incluso l’assistente Grok a bordo delle automobili Tesla.
Questa esperienza sul campo è il vantaggio competitivo più difficile da replicare. Il modello è stato addestrato su un insieme di dati fatto di audio reale, rumoroso e multilingue, registrato in ambienti molto diversi tra loro, e poi rifinito con una fase di post-addestramento.
Il risultato, sostiene xAI, è uno dei sistemi di trascrizione più accurati oggi disponibili per il parlato in condizioni reali.
Il lancio si inserisce nella strategia più ampia di xAI, che negli ultimi mesi ha spinto sia sui modelli di grande scala, come Grok 4.8, sia su strumenti verticali e più economici pensati per gli sviluppatori. Grok Voice Transcribe 2.0 appartiene a questa seconda famiglia: non un modello generalista, ma un mattone specializzato da incastrare dentro applicazioni di terze parti.
Una precisione pensata per l’audio del mondo reale
La maggior parte dei modelli di trascrizione se la cava bene con audio pulito e un solo interlocutore. Il problema è che il mondo reale suona in modo molto diverso: linee telefoniche disturbate, voci che si sovrappongono, accenti locali, numeri di telefono e indirizzi email dettati a voce. È proprio su questo terreno accidentato che xAI ha concentrato lo sviluppo del nuovo modello.
Il dato più citato dall’azienda riguarda un confronto pubblico e indipendente. Sulla classifica di Artificial Analysis, Grok Voice Transcribe 2.0 si posiziona al primo posto per accuratezza tra i trentadue modelli in streaming considerati. Un piazzamento che, se confermato dall’uso quotidiano, lo mette davanti a soluzioni molto note di concorrenti affermati.
Le valutazioni interne di xAI
Oltre ai benchmark pubblici, xAI ha misurato il tasso di errore sulle parole, il cosiddetto word error rate, su quattro insiemi di dati presi dal traffico di produzione: audio telefonico delle chiamate di assistenza, conversazioni con Grok, credenziali dettate a voce come codici e indirizzi email, e comandi vocali brevi in diciannove lingue.
Su tutti e quattro gli scenari il modello migliora rispetto alla versione 1.0. E sul segmento telefonico, storicamente il più ostico per via della bassa qualità audio, l’azienda afferma di superare ogni altro modello messo alla prova.
Il balzo più impressionante riguarda le frasi brevi. Su comandi come quelli che si darebbero all’assistente vocale di un’auto, dove il modello ha pochissimo contesto per capire di quale lingua si tratti, il tasso di errore crolla dal 20,6% al 6,8%.
Multilingua e funzioni per gli sviluppatori
Proprio il multilinguismo è, secondo xAI, il miglioramento più netto rispetto al passato. Grok Voice Transcribe 2.0 trascrive decine di lingue, riconosce automaticamente quale si sta parlando e segue i cambi di lingua che avvengono nel mezzo di una registrazione, il tutto in un singolo passaggio e senza configurazioni manuali.
Sul fronte pratico, il modello è pensato per entrare senza attriti nei prodotti già esistenti. Chi utilizza l’API speech-to-text di xAI ottiene il miglioramento di precisione senza modificare una sola riga di codice.
Le funzioni coprono gran parte delle esigenze di un prodotto vocale professionale. Si passa dalla trascrizione batch, adatta a file e registrazioni, a quella in streaming per l’audio in tempo reale, con timestamp precisi per ogni singola parola e un punteggio di affidabilità associato. La diarizzazione, cioè l’attribuzione di ogni frase al rispettivo interlocutore, è inclusa senza costi aggiuntivi, mentre la trascrizione multicanale gestisce in modo indipendente fino a otto canali.
Ci sono poi controlli pensati per gli scenari più delicati. È possibile suggerire al modello fino a cento termini di dominio per richiesta, per esempio nomi di prodotto o vocabolario medico, così da ridurre gli errori sulle parole più insidiose. A completare il quadro arrivano la formattazione automatica di numeri, date, valute, telefoni e indirizzi email, la rimozione delle parole riempitive come gli intercalari, e il rilevamento intelligente della fine del turno di parola, funzione preziosa per gli agenti vocali che devono capire quando è arrivato il loro momento di rispondere.
Prezzo, disponibilità e il caso Atlassian Loom
Uno degli aspetti più interessanti è che tutta questa qualità in più non comporta alcun costo aggiuntivo. Il prezzo resta identico a quello della versione 1.0: dieci centesimi di dollaro per ogni ora di audio in modalità batch e venti centesimi per ora in streaming, con diarizzazione, timestamp e termini chiave già compresi.
xAI ha inoltre annunciato che Grok Voice Transcribe 2.0 diventerà a breve l’opzione predefinita della sua API di trascrizione, mentre la versione 1.0 sarà dismessa nelle prossime settimane. Chi preferisce restare sul modello precedente durante la transizione può farlo bloccandone in modo esplicito l’identificativo.
Il nuovo modello ha già un cliente di peso da mostrare. Atlassian lo ha adottato per Loom, lo strumento molto diffuso per registrare e condividere video dello schermo, trovandolo più accurato della soluzione utilizzata in precedenza.
Il caso è interessante perché mostra cosa si sblocca con trascrizioni davvero affidabili. Registrando in Loom un piano di lavoro a voce e riversando la trascrizione dentro un assistente di programmazione come Cursor, il sistema può tradurre le indicazioni parlate direttamente in modifiche al codice. Sanchan Saxena, dirigente di Atlassian, ha descritto questo flusso come la chiusura del cerchio che va dal contesto al codice: dettare ciò che si intende e vedere il lavoro portato a termine.
Come si colloca tra i rivali
L’uscita di Grok Voice Transcribe 2.0 non avviene nel vuoto. La voce e la trascrizione sono diventate uno dei campi di battaglia più affollati dell’AI applicata, con tutti i grandi laboratori impegnati a portare i propri modelli vocali dentro le API per sviluppatori.
OpenAI ha da poco aperto la voce full-duplex agli sviluppatori con GPT-Live-1, mentre Google ha risposto con Gemini 3.8 Live, i modelli vocali capaci di ragionare mentre parlano. In questo scenario xAI sceglie un posizionamento preciso: non insegue la conversazione a tutto tondo, ma punta sulla trascrizione pura, giocandosi la carta della precisione sull’audio difficile e di un prezzo aggressivo.
È una scommessa sensata. La qualità della trascrizione è spesso l’anello debole di un’intera catena vocale: se il testo di partenza è sbagliato, ogni passaggio successivo, dalla comprensione del linguaggio all’azione dell’agente, eredita quell’errore e lo amplifica.
Conclusioni
Con Grok Voice Transcribe 2.0, xAI manda un messaggio chiaro: la trascrizione vocale non è affatto un problema risolto, e c’è ancora margine per migliorare proprio dove i modelli faticano di più, cioè nell’audio imperfetto del mondo reale. Raddoppiare la precisione mantenendo lo stesso prezzo è il tipo di mossa capace di spostare gli equilibri tra i fornitori di API.
Se lavori con audio, voce o assistenti conversazionali, ti conviene mettere alla prova il modello sui tuoi casi d’uso reali, soprattutto quelli più rumorosi o multilingue, e confrontarlo con la soluzione che utilizzi oggi. Puoi partire dall’annuncio ufficiale di xAI per i dettagli tecnici e le condizioni d’uso.
La direzione, in ogni caso, è ormai segnata: la voce sta diventando un’interfaccia di prima classe per l’AI, e la qualità della trascrizione è la base su cui si regge tutto il resto.