Il sito che ti spiega l'AI.
News, strumenti e guide in italiano.
Tecnologie e Algoritmi

Eleven v4, ElevenLabs lancia la sintesi vocale più espressiva e la versione Turbo

ElevenLabs presenta Eleven v4 e v4 Turbo: voce AI più espressiva, oltre 90 lingue, clonazione da 10 secondi e latenza di circa 100 ms per gli agenti.

FA
Franco Artigiano IA Franco Artigiano
Settembre 30, 2026
Lettura: 9 min
Microfono da studio professionale, simbolo della nuova sintesi vocale AI Eleven v4 di ElevenLabs
fonte: pixabay 5594702

ElevenLabs ha presentato Eleven v4, il suo nuovo modello di sintesi vocale, insieme a una variante a bassa latenza chiamata Eleven v4 Turbo. L’annuncio, pubblicato il 28 settembre 2026 sul blog ufficiale dell’azienda, descrive il modello come il più espressivo mai rilasciato dalla società londinese: una voce artificiale che non si limita a leggere il testo, ma prova a interpretarlo, cogliendo tono, ritmo, emozione e contesto.

Non si tratta di un semplice aggiornamento incrementale. ElevenLabs parla di un’architettura completamente nuova, di oltre 90 lingue supportate, di clonazione vocale a partire da appena 10 secondi di audio e di un tempo di risposta che, nella versione Turbo, scende attorno ai 100 millisecondi di latenza mediana di inferenza. Numeri che, se confermati nell’uso reale, spostano l’asticella sia per chi produce contenuti audio sia per chi costruisce agenti vocali.

Vediamo cosa cambia davvero e perché la notizia ti riguarda, anche se non hai mai usato ElevenLabs.

Cosa ha annunciato ElevenLabs con Eleven v4

Il punto di partenza dell’annuncio è un’osservazione semplice: la stessa frase può avere significati molto diversi a seconda di come viene pronunciata. Un invito a restare calmi suona in un modo se lo pronuncia un medico con un paziente spaventato e in tutt’altro modo se lo urla un personaggio di un videogioco prima di una battaglia. I modelli di sintesi vocale delle generazioni precedenti leggevano bene le parole, ma faticavano a restituire questa sfumatura.

Eleven v4 nasce proprio per colmare questo divario. Secondo ElevenLabs, il modello è progettato per interpretare dal testo l’intenzione emotiva, la velocità del parlato, il carattere di chi parla e il contesto della scena. Il risultato dovrebbe essere un parlato che può risultare drammatico, tenero, urgente, comico o colloquiale mantenendo sempre riconoscibile l’identità della voce.

L’azienda rivendica il primo posto nella classifica Voice Arena di Artificial Analysis aggiornata a settembre 2026 e una preferenza di circa il 75% degli ascoltatori in test alla cieca contro modelli concorrenti come Cartesia Sonic 3.6, Inworld TTS-2 e le varianti TTS di Gemini 3.8 Flash di Google. Sono dati dichiarati dal produttore, quindi vanno presi con la dovuta cautela, ma indicano chiaramente dove ElevenLabs vuole posizionarsi.

Una nuova architettura e i tag audio in linea

La novità più interessante per chi lavora con la voce è il controllo fine sull’interpretazione. Puoi descrivere in linguaggio naturale come deve essere pronunciata una battuta, oppure inserire direttamente nel testo dei tag tra parentesi quadre: indicazioni come una risata, una frase detta con rabbia e con accento francese, il rumore di una pioggia leggera o il ronzio di un telefono. Secondo l’azienda, Eleven v4 segue queste istruzioni con maggiore precisione rispetto ai modelli precedenti.

In pratica, la voce diventa dirigibile come un attore.

ElevenLabs segnala anche un supporto nettamente migliorato all’Alfabeto fonetico internazionale (IPA), utile quando devi imporre la pronuncia corretta di nomi propri, termini tecnici o marchi. Chi produce audiolibri, spot o contenuti formativi sa quanto una pronuncia sbagliata possa costringere a rigenerare interi blocchi di testo.

Dialoghi tra più voci più naturali

Un altro miglioramento riguarda le conversazioni con più personaggi. Grazie a un nuovo metodo per catturare l’identità di ciascun parlante, il modello mantiene coerenti le voci lungo tutta una produzione, che si tratti di un audiolibro, di una pubblicità o di un agente conversazionale. Soprattutto, poiché il modello considera il contesto dell’intera scena, i personaggi rispondono a ciò che è appena stato detto invece di sembrare battute registrate separatamente e poi montate insieme.

Anche il cosiddetto request stitching, cioè la concatenazione di più generazioni per creare contenuti lunghi, viene descritto come molto più affidabile. È un dettaglio tecnico, ma per chi lavora in ElevenLabs Studio o con l’app Reader significa meno salti di tono e meno correzioni manuali tra un segmento e l’altro.

Eleven v4 Turbo e la corsa alla latenza negli agenti vocali

Finora chi costruiva un assistente vocale doveva scegliere: voci espressive ma lente, oppure voci rapide ma piatte. Molte aziende hanno optato per la seconda strada, con il risultato di agenti di assistenza clienti corretti ma dal tono robotico, poco adatti a un cliente già nervoso che vuole solo risolvere un problema.

Eleven v4 Turbo punta a eliminare questo compromesso. ElevenLabs dichiara una latenza mediana di inferenza di circa 100 millisecondi e un tempo mediano fino al primo suono udibile di circa 150 millisecondi, misurato tramite streaming WebSocket. Per dare un riferimento, l’azienda sottolinea che si tratta di un tempo inferiore alla pausa media tra due persone che parlano. Nel confronto pubblicato, gli altri sistemi testati si collocano tra i 262 e gli 814 millisecondi.

Il modello Turbo è stato ottimizzato insieme a ElevenAgents, la piattaforma dell’azienda per gli agenti conversazionali. L’idea è offrire un sistema integrato, invece di costringere gli sviluppatori a combinare modelli e software di fornitori diversi senza poter rifinire l’output per il proprio caso d’uso. Gli esempi citati vanno da agenti rassicuranti in ambito sanitario, capaci di pronunciare correttamente termini medici, fino a personaggi veloci e pieni di slang per il gaming.

La velocità, qui, è una questione di credibilità.

Una conversazione vocale con un’AI che risponde con mezzo secondo di ritardo viene percepita come innaturale anche quando il contenuto è perfetto. Ridurre questa soglia è una delle condizioni perché gli agenti vocali diventino davvero utilizzabili su larga scala nei call center, nella prenotazione di servizi e nel supporto tecnico.

Oltre 90 lingue e clonazione vocale da 10 secondi

Sul fronte multilingue, sia Eleven v4 sia Eleven v4 Turbo supportano più di 90 lingue. La novità più rilevante è che una voce registrata in una lingua può parlarne un’altra in modo fluente, adottando l’accento di un madrelingua ma conservando l’identità della voce originale. ElevenLabs sostiene che l’aderenza all’accento sia nettamente più stabile: la voce non tende più a scivolare verso l’accento di partenza nel corso di una generazione lunga.

L’azienda fa anche un esempio che ci riguarda da vicino: il modo in cui ti rivolgi a uno sconosciuto anziano in Giappone è molto diverso da come lo faresti in Italia. Il modello, secondo l’annuncio, prova a catturare non solo la pronuncia ma anche ritmo ed emotività tipici di ciascuna lingua. Per il doppiaggio e la localizzazione, che abbiamo già approfondito nella nostra guida al doppiaggio con l’intelligenza artificiale, questo significa poter mantenere la stessa voce di marca in tutti i mercati.

Poi c’è la clonazione vocale. Con Eleven v4 bastano circa 10 secondi di audio per ottenere un Instant Voice Clone ad alta fedeltà, con una somiglianza al parlante originale descritta come significativamente migliore. Per i casi d’uso più esigenti arriva anche il supporto ai Professional Voice Clones, i cloni professionali pensati per la massima qualità.

Il rovescio della medaglia: sicurezza e abusi

Una clonazione così rapida e fedele porta con sé un problema evidente. Più diventa facile replicare una voce partendo da pochi secondi di registrazione, più aumentano i rischi di frodi e impersonificazioni. Non è un’ipotesi astratta: in Italia abbiamo già raccontato il caso della truffa con voce clonata legata a Fideuram, un esempio concreto di come queste tecnologie possano essere usate contro aziende e privati.

Nell’annuncio di Eleven v4 l’azienda si concentra sulle capacità del modello e non entra nel dettaglio di nuove misure di protezione specifiche. ElevenLabs dispone di un proprio centro dedicato alla sicurezza, ma per chi usa la voce in ambito professionale resta essenziale adottare procedure di verifica che non si basino solo sul riconoscimento vocale, come parole d’ordine concordate o conferme su un secondo canale.

Dove si colloca Eleven v4 nel mercato della sintesi vocale

Il lancio arriva in un momento di forte competizione. Negli ultimi mesi Google ha spinto molto sulla voce con i modelli TTS della famiglia Gemini, di cui abbiamo parlato nell’articolo su Gemini 3.8 Flash TTS, mentre realtà come Cartesia e Inworld puntano su latenze sempre più basse per gli agenti in tempo reale. Non a caso sono proprio questi i concorrenti scelti da ElevenLabs nei suoi test comparativi.

ElevenLabs ha costruito la propria reputazione sulla qualità della voce e oggi prova a difendere quella leadership su due fronti contemporaneamente: l’espressività per i creatori di contenuti e la velocità per gli agenti conversazionali. Separare i due obiettivi in due modelli, v4 e v4 Turbo, è una scelta pragmatica che permette di non sacrificare l’uno per l’altro.

Se vuoi capire meglio come funzionano questi sistemi dal punto di vista tecnico, dalla conversione del testo in fonemi fino alla generazione dell’onda sonora, puoi partire dalla nostra guida su come funziona la sintesi vocale.

Disponibilità e accesso

Entrambi i modelli sono disponibili da subito in ElevenAgents, in ElevenCreative e tramite ElevenAPI. L’azienda indica che è possibile iniziare a generare audio con Eleven v4 e v4 Turbo anche creando un account gratuito, mentre la documentazione per sviluppatori descrive la sintassi completa dei tag audio e il loro utilizzo tramite API. I dettagli sono riportati nel post ufficiale di ElevenLabs.

Cosa cambia per creator, aziende e sviluppatori

Per chi produce contenuti, come audiolibri, podcast, video formativi o pubblicità, Eleven v4 promette meno tempo speso a correggere intonazioni sbagliate e più controllo sull’interpretazione. La possibilità di dirigere la voce con istruzioni testuali avvicina il lavoro con l’AI a quello con un doppiatore, pur senza sostituirne la sensibilità artistica.

Per le aziende che valutano agenti vocali, la versione Turbo è la parte più interessante. Una latenza così bassa, unita a una voce espressiva, rende più realistico l’uso di assistenti telefonici che non irritano il cliente. Resta però fondamentale testare il sistema sulla propria lingua e sul proprio settore: i benchmark pubblicati sono del produttore e le prestazioni in italiano, con terminologie specifiche, vanno verificate sul campo.

Per gli sviluppatori, infine, il miglior supporto IPA e la maggiore affidabilità nella concatenazione di generazioni lunghe riducono il lavoro di post produzione e rendono più prevedibile l’integrazione nei flussi automatici.

Conclusioni

Con Eleven v4 ElevenLabs non si limita a rendere le voci sintetiche più pulite: prova a renderle interpreti. Tag audio in linea, dialoghi coerenti tra più personaggi, oltre 90 lingue e una variante Turbo con latenza vicina a quella di una conversazione umana compongono un pacchetto pensato sia per i creator sia per chi costruisce agenti. Allo stesso tempo, una clonazione vocale sempre più facile rende urgente una riflessione seria sulla sicurezza.

Se lavori con contenuti audio o stai valutando un assistente vocale per la tua attività, questo è il momento giusto per fare qualche test e confrontare i risultati con le alternative. Continua a seguirci su IntelligenzaArtificiale.net per restare aggiornato sulle novità della sintesi vocale e dell’AI generativa.

FA

Franco Artigiano IA

Autore IA di IntelligenzaArtificiale.net, sotto la supervisione di Daniele Della Corte (MarketingSeoAgency.com).

← Torna alla home