Gemini 3.8 Flash TTS: Google lancia le voci AI che si progettano e si dirigono come attori
Google presenta Gemini 3.8 Flash TTS e Flash-Lite TTS: oltre 2.000 voci, voci create da zero, regia riga per riga e clonazione vocale con consenso.

Google ha appena cambiato il modo in cui si costruisce una voce sintetica. Con Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, presentati il 23 settembre 2026 sul blog ufficiale dell’azienda, la generazione vocale smette di essere una scelta tra poche voci preconfezionate e diventa qualcosa di molto più simile a uno studio di registrazione: descrivi il personaggio che hai in mente, lo fai nascere da zero e poi ne dirigi l’interpretazione riga per riga, come faresti con un attore in sala di doppiaggio.
Sono due modelli text-to-speech con obiettivi diversi, uno pensato per la regia creativa e l’altro per i grandi volumi. Insieme completano la famiglia audio di Gemini, che nelle ultime settimane si era già arricchita di modelli per la traduzione dal vivo, la trascrizione e il dialogo in tempo reale.
Vediamo cosa fanno, dove li trovi e perché questo lancio conta per chi lavora con podcast, audiolibri, video e assistenti vocali.
Cosa sono Gemini 3.8 Flash TTS e Flash-Lite TTS
Il primo modello, Gemini 3.8 Flash TTS, è quello di punta. Google lo descrive come lo strumento per la direzione creativa profonda e la progettazione dei personaggi: ti permette di creare voci completamente nuove partendo da una descrizione in linguaggio naturale, per poi usarle in videogiochi, audiolibri immersivi, podcast e media interattivi. Il controllo è granulare e riguarda le indicazioni di recitazione, il ritmo, i cambi di dialetto e quelle piccole interiezioni di ascolto attivo che rendono credibile una conversazione.
Il secondo, Gemini 3.8 Flash-Lite TTS, punta invece sull’efficienza. È ottimizzato per il doppiaggio su larga scala, per la produzione di contenuti audio in serie e per gli agenti vocali espressivi, cioè tutti quei casi in cui devi generare tantissimo parlato mantenendo i costi sotto controllo, senza rinunciare a un buon controllo su tono, ritmo e sfumature.
In pratica: Flash TTS per la qualità da regia, Flash-Lite TTS per la produzione industriale.
Dal catalogo di 30 voci a una libreria potenzialmente infinita
Il salto più evidente riguarda la quantità e la personalizzazione delle voci. Google parla esplicitamente di un passaggio da 30 voci originali a una libreria senza limiti. Con Flash TTS puoi progettare una voce su misura definendo ruolo, accento e caratteristiche timbriche in oltre 100 lingue e dialetti, semplicemente scrivendo cosa ti serve. Negli esempi pubblicati dall’azienda compaiono un DJ di Melbourne pieno di energia, un robot dalla voce metallica e monotona e perfino un drago giapponese.
Accanto alla progettazione da zero c’è una libreria di oltre 2.000 voci pronte per la produzione, con una copertura linguistica ampia che include varianti regionali come lo spagnolo messicano, il francese del Québec e l’inglese scozzese. Le voci create si possono salvare e gestire nel tempo, così da mantenere un’interpretazione coerente e con poca deriva su progetti che durano settimane o mesi.
Google ha anche annunciato una funzione di remix, non ancora disponibile, che ti permetterà di prendere una voce della libreria e regolarne timbro, altezza, velocità e accento con semplici istruzioni testuali.
La clonazione vocale da 30 secondi di audio
La funzione più delicata è la replica della voce. Flash TTS può ricreare un profilo vocale coerente a partire da un campione di appena 30 secondi, che si tratti della tua voce o di una voce di cui possiedi i diritti. È una capacità potentissima per chi produce contenuti in serie, ma anche un terreno scivoloso, e infatti Google l’ha circondata di diverse protezioni di cui parleremo tra poco.
C’è però un dettaglio che ti riguarda direttamente: secondo la nota a piè di pagina dell’annuncio, la replica vocale in Google AI Studio non è disponibile nello Spazio economico europeo, nel Regno Unito, in Svizzera, in India e negli stati americani dell’Illinois e del Texas. Dall’Italia, quindi, per ora questa specifica funzione non la puoi usare in AI Studio, mentre la progettazione di voci nuove e la libreria restano accessibili.
La regia riga per riga: come si dirige una voce artificiale
Scegliere la voce giusta è solo metà del lavoro. L’altra metà riguarda l’interpretazione, ed è qui che entrambi i modelli mostrano il cambio di passo rispetto alle generazioni precedenti. Puoi scrivere tu le indicazioni di scena, come faresti in un copione teatrale, oppure lasciare che sia Gemini a interpretare gli indizi presenti nel testo per modulare la resa, passando da un operatore del servizio clienti calmo e rassicurante a una scena di suspense sussurrata.
Per i contenuti lunghi, Google dichiara che la qualità, il ritmo naturale e il timbro dei personaggi restano stabili anche su ore di audio continuo, con una deriva minima del parlante. È un punto cruciale per podcast e audiolibri, dove una voce che cambia leggermente carattere dopo quaranta minuti rovina l’esperienza d’ascolto.
C’è poi la gestione nativa delle scene a due voci. Da un unico copione puoi dirigere un dialogo tra due personaggi, mantenendo le voci ben distinte e con turni di parola naturali, senza dover generare separatamente le battute e rimontarle a mano.
Risate, sospiri e interiezioni: la texture della conversazione
Il dettaglio che più avvicina queste voci al parlato umano è il supporto ai cosiddetti vocal burst e al backchanneling. Nel copione puoi inserire indicazioni non verbali come risate, sospiri o sussulti, oltre alle interiezioni di ascolto attivo come “mhm” o “sì”, quelle che usiamo senza pensarci mentre qualcuno ci parla.
Sembra poco, ma è ciò che separa una lettura meccanica da una conversazione credibile, soprattutto negli agenti vocali e nella narrativa comica, dove il tempo di una reazione conta quanto la battuta.
I numeri: primo posto sui benchmark di Hume AI e Voice Arena
Sul fronte delle prestazioni, Google rivendica il primo posto assoluto di Gemini 3.8 Flash TTS nel Voice Design Benchmark di Hume AI, con un punteggio complessivo di 71,4, e la leadership anche nella modellazione degli accenti con 60,8. Nell’Overall Quality Index della stessa Hume AI, Flash TTS e Flash-Lite TTS occupano rispettivamente la prima e la seconda posizione.
Nei confronti alla cieca basati sulle preferenze umane di Voice Arena, i due modelli si piazzano ai vertici in diverse lingue chiave, tra cui giapponese, portoghese brasiliano, vietnamita, arabo standard moderno, spagnolo messicano e hindi. L’azienda sottolinea inoltre un netto miglioramento rispetto al precedente Gemini 3.1 Flash TTS, in particolare sui contenuti lunghi e sulla gestione dei copioni a due voci.
Come sempre, sono dati comunicati dal produttore: vale la pena aspettare test indipendenti, in particolare sulla resa in italiano, che non compare tra le lingue citate esplicitamente.
Sicurezza e consenso: watermark SynthID e verifica vocale
La possibilità di clonare una voce da 30 secondi di audio solleva domande ovvie su deepfake, frodi e tutela dei doppiatori. Google ha risposto con più livelli di protezione. Per la replica vocale il sistema richiede una verifica del consenso: devi fornire una registrazione in cui il proprietario della voce esprime verbalmente il proprio assenso, e questa registrazione deve corrispondere al parlante del campione di riferimento prima che la voce venga creata.
In più, ogni clip generata dai modelli audio di Gemini viene marchiata con SynthID, il watermark impercettibile sviluppato da Google DeepMind, che resta intrecciato nell’audio e consente di riconoscere il parlato sintetico. A questo si aggiungono le credenziali C2PA, lo standard per documentare l’origine dei contenuti digitali.
Non è una garanzia assoluta contro gli abusi, ma è un’impostazione più rigorosa di quella adottata da molti strumenti di clonazione vocale disponibili oggi sul mercato.
Dove puoi provarli e chi li sta già integrando
La distribuzione segue due binari. Gemini 3.8 Flash TTS è in distribuzione da subito per gli sviluppatori tramite Gemini API e Google AI Studio, per tutti gli utenti dentro Gemini Notebook e, prossimamente, per le aziende tramite API in Gemini Enterprise. Gemini 3.8 Flash-Lite TTS segue lo stesso schema per sviluppatori e aziende, mentre per il grande pubblico arriva in Google Vids, l’app di Workspace per creare video.
Per chi sviluppa, Google AI Studio offre un nuovo playground audio organizzato come uno spazio di progettazione vocale, con un editor per sceneggiature a due voci in cui dirigere la resa battuta per battuta. Piattaforme come Agora, LiveKit, Pipecat e Vercel supportano già i nuovi modelli tramite Gemini API, e tra le aziende partner che li stanno integrando figurano Figma, HeyGen, Linguana, Wondercraft, 99.co e Ollang, con usi che vanno dal doppiaggio globale alla localizzazione con accenti regionali, fino agli agenti vocali conversazionali.
Google non ha indicato i prezzi nell’annuncio: se ti interessa l’uso via API, conviene verificare il listino aggiornato nella documentazione di AI Studio.
Perché questo lancio conta nella corsa alla voce
Questo annuncio va letto insieme agli altri tasselli che Google ha aggiunto negli ultimi mesi alla sua famiglia audio. Pochi giorni fa ti avevamo raccontato Gemini 3.8 Live e i modelli vocali che ragionano mentre parlano, pensati per il dialogo in tempo reale. Con Flash TTS e Flash-Lite TTS Mountain View copre ora anche l’altro lato del problema, cioè la generazione di parlato controllato e di alta qualità a partire da un testo.
Il mercato di riferimento è affollato e molto competitivo, con specialisti come ElevenLabs e con gli altri grandi laboratori che spingono sulle proprie offerte vocali. Il vantaggio di Google sta nella distribuzione: modelli integrati in prodotti usati da milioni di persone come Notebook e Vids, più una piattaforma per sviluppatori già diffusa. Se vuoi un quadro più ampio dell’ecosistema, trovi tutto nella nostra pagina dedicata a Google Gemini.
Per creatori, agenzie e aziende le ricadute pratiche sono concrete.
Chi produce podcast o audiolibri può gestire intere produzioni con un numero di voci e un livello di regia prima impensabili senza uno studio. Chi lavora con i video può localizzare contenuti in decine di lingue mantenendo accenti credibili, un tema che abbiamo approfondito nella guida al doppiaggio con l’intelligenza artificiale. E chi costruisce assistenti vocali ha a disposizione voci più espressive e naturali, con quelle esitazioni e reazioni che rendono meno robotica l’interazione. Se invece vuoi capire come funziona la tecnologia alla base di tutto questo, parti dalla nostra guida sulla sintesi vocale e la conversione del testo in voce.
Conclusioni
Con Gemini 3.8 Flash TTS e Flash-Lite TTS Google trasforma il text-to-speech da funzione di servizio a vero strumento creativo: voci progettate con una frase, una libreria di oltre 2.000 profili pronti, regia riga per riga e dialoghi a due voci da un unico copione. Le protezioni su consenso e watermark sono un segnale positivo, anche se in Europa la replica vocale in AI Studio resta per ora bloccata.
Il consiglio è semplice: se crei contenuti audio o video, apri Google AI Studio o Gemini Notebook e prova a progettare una voce per il tuo prossimo progetto, confrontando la resa in italiano con gli strumenti che usi già. Poi raccontaci nei commenti com’è andata, e continua a seguirci per tutti gli aggiornamenti sull’evoluzione di Gemini e sulle nuove frontiere della voce artificiale.
Fonte: blog ufficiale di Google.