Il sito che ti spiega l'AI.
News, strumenti e guide in italiano.
Strumenti AI per video

Gemini 3.8 Live con Live Avatar: gli agenti vocali di Google ora hanno un volto

Google lancia Live Avatar per Gemini 3.8 Live: avatar animati con lip-sync in 97 lingue per gli agenti aziendali, disponibili in Gemini Enterprise.

FA
Franco Artigiano IA Franco Artigiano
Settembre 25, 2026
Lettura: 7 min
Cuffie con microfono appoggiate su un laptop, simbolo di assistenza clienti con agenti AI
fonte: pexels 8866735

Google ha aggiunto un volto ai suoi agenti vocali. Con Gemini 3.8 Live con Live Avatar, annunciato il 24 settembre sul blog ufficiale dell’azienda, il modello di dialogo in tempo reale presentato appena una settimana fa non si limita più a parlare e ascoltare: ora genera anche un personaggio animato che muove le labbra in sincrono con la voce, cambia espressione e segue la conversazione quasi in tempo reale. La funzione è disponibile da subito in Gemini Enterprise ed è pensata per le aziende che vogliono costruire assistenti virtuali più coinvolgenti per il servizio clienti, l’onboarding o le guide interattive.

È un passo che sposta la competizione sugli agenti conversazionali dal solo audio al video. E lo fa dentro il modello stesso, non come strato aggiunto.

Cosa fa Gemini 3.8 Live con Live Avatar

Il punto di partenza è Gemini 3.8 Live, la famiglia di modelli vocali che ragionano mentre parlano, lanciata da Google la settimana scorsa. Quel modello gestisce già la conversazione parlata in modo nativo, cioè senza passare da una trascrizione intermedia in testo, con tempi di risposta molto bassi e la capacità di essere interrotto come farebbe un interlocutore umano.

Live Avatar aggiunge a questa base la generazione video a bassa latenza. Secondo quanto spiegato dal team Gemini Audio di Google, il sistema accoppia in modo nativo il dialogo dal vivo con un flusso video in streaming: il risultato è un agente che ascolta, vede e parla attraverso un volto digitale dotato di sincronizzazione labiale precisa, espressioni naturali e gestione fluida dei turni di parola.

In altre parole, l’avatar non è un video preregistrato che si anima a comando.

Viene generato in quasi tempo reale insieme alla voce, e questo gli permette di reagire a ciò che accade nella conversazione. Google sottolinea anche la natura multimodale dell’esperienza: il sistema elabora contemporaneamente gli input visivi e audio, quindi può tenere conto di ciò che l’utente mostra oltre che di ciò che dice.

Strumenti in background senza interrompere il dialogo

Uno degli aspetti più interessanti per chi sviluppa agenti è la chiamata asincrona degli strumenti. Live Avatar può avviare richieste a sistemi esterni e recuperare dati in background mentre continua a parlare con l’utente. Nell’esempio mostrato da Google, un avatar gestisce il check-in di un ospite in hotel: interroga i sistemi di prenotazione mentre la conversazione prosegue, senza silenzi imbarazzanti o schermate di attesa.

Chi ha provato un assistente vocale tradizionale conosce bene il problema opposto: la domanda parte, il sistema si blocca, e dopo qualche secondo arriva la risposta. Mantenere una presenza continua durante l’elaborazione è ciò che rende credibile un agente visivo, perché un volto che si congela durante il caricamento rompe l’illusione molto più di una voce che tace.

Novantasette lingue senza perdere il sincrono

Google dichiara che Live Avatar supporta la sincronizzazione nativa tra parlato e video in 97 lingue. L’avatar adatta dinamicamente il movimento delle labbra e le espressioni alla lingua in uso e può passare da una lingua all’altra a metà conversazione senza, secondo l’azienda, degradare la qualità del video o introdurre derive visive.

Per un’azienda che opera su più mercati, questo significa poter usare lo stesso personaggio digitale per clienti italiani, tedeschi o giapponesi, senza produrre contenuti separati. È un tema vicino a quello del doppiaggio con l’intelligenza artificiale, con una differenza sostanziale: qui non si traduce un video già girato, ma si genera in diretta un interlocutore che parla la lingua di chi ha davanti.

Avatar personalizzati e identità di marca

Le organizzazioni possono scegliere da una libreria di avatar predefiniti, con aspetti, voci e stili espressivi diversi. Chi ha esigenze di brand più specifiche può invece creare un avatar personalizzato partendo da un’immagine di riferimento di alta qualità: il sistema genera un personaggio completamente animato che conserva la somiglianza con il riferimento, lo stile grafico del marchio o l’identità di un personaggio esistente.

C’è però un limite importante. La creazione di avatar personalizzati è disponibile solo tramite allowlist aziendale, quindi su invito e previa approvazione da parte di Google.

La scelta ha una logica evidente. Generare un volto animato e parlante a partire da una sola foto è esattamente il tipo di capacità che, in mani sbagliate, può alimentare deepfake e truffe basate sull’impersonificazione. Limitare l’accesso a clienti verificati riduce il rischio che la funzione venga usata per clonare l’aspetto di persone reali senza consenso.

SynthID e trasparenza sui contenuti generati

Sul fronte della sicurezza, Google afferma che tutto l’output generato dai suoi prodotti AI, audio e video di Live Avatar compresi, viene marcato con SynthID, la filigrana digitale invisibile sviluppata da Google DeepMind. Il watermark è integrato direttamente nel segnale audio e video e serve a rendere rilevabile la natura artificiale del contenuto, riducendo i rischi di disinformazione e di attribuzione errata.

Resta aperta, come per ogni sistema di filigrana, la questione della verifica: SynthID è efficace se chi riceve il contenuto ha modo di controllarlo. Per un avatar che parla con un cliente in una chat aziendale, la trasparenza passa soprattutto da come l’azienda dichiara all’utente che sta interagendo con un agente artificiale.

Perché questa novità conta per le aziende

Il mercato degli avatar parlanti non nasce oggi. Da qualche anno diverse startup specializzate offrono volti digitali per video di marketing, formazione e assistenza, spesso costruiti combinando modelli separati: uno per il linguaggio, uno per la voce, uno per l’animazione del volto. Ogni passaggio aggiunge latenza e punti di rottura.

La proposta di Google va nella direzione opposta: integrare tutto nel runtime del modello.

Se il dialogo, la voce e il video nascono dallo stesso sistema, la sincronizzazione diventa più naturale e la latenza complessiva si riduce. Per un’azienda che già usa Gemini Enterprise, significa poter aggiungere un volto ai propri agenti senza integrare un fornitore esterno, con evidenti vantaggi in termini di gestione dei dati, sicurezza e contratti.

I casi d’uso indicati da Google sono concreti. Il servizio clienti è il primo: un avatar può accogliere l’utente sul sito o in un chiosco fisico, rispondere alle domande, consultare lo stato di un ordine e guidarlo passo passo. Poi ci sono le guide interattive, per esempio per spiegare come configurare un prodotto o compilare una pratica, e più in generale tutte le situazioni in cui un contatto visivo rende l’interazione più accessibile, anche per chi ha difficoltà con le interfacce testuali.

Il contesto: la settimana vocale di Google

Live Avatar arriva al termine di una serie ravvicinata di annunci di Google sull’audio. Dopo Gemini 3.8 Live, l’azienda ha presentato Gemini 3.8 Flash TTS, con voci sintetiche che si progettano e si dirigono come attori. Il quadro che emerge è quello di un ecosistema che punta a coprire l’intera catena dell’interazione umana: capire la voce, ragionare, rispondere con una voce espressiva e ora anche mostrarsi con un volto.

È una strategia coerente con la direzione presa da tutto il settore, dove la corsa non riguarda più solo i modelli più intelligenti, ma gli agenti più naturali da usare. Chi vuole approfondire l’evoluzione della piattaforma può consultare la nostra guida completa a Google Gemini.

Cosa cambia concretamente e cosa tenere d’occhio

Per ora Live Avatar è una funzione enterprise: è disponibile in Gemini Enterprise e Google rimanda alla documentazione API per chi vuole iniziare a sviluppare. Non si tratta quindi di una novità che vedrai domani nell’app Gemini sul tuo smartphone, ma di uno strumento destinato a finire dentro siti, app e servizi di assistenza delle aziende.

Se lavori in un’azienda che valuta agenti conversazionali, ci sono alcuni aspetti da considerare prima di adottare un avatar. Il primo è l’esperienza reale: la qualità della sincronizzazione labiale e la latenza vanno verificate sul campo, con connessioni e dispositivi dei tuoi utenti, non solo nelle demo. Il secondo riguarda la trasparenza verso i clienti, che devono sapere con chiarezza che stanno parlando con un sistema artificiale. Il terzo è la conformità normativa: in Europa l’AI Act prevede obblighi di trasparenza per i sistemi che interagiscono con le persone e per i contenuti generati artificialmente, e un avatar realistico rientra pienamente in questo perimetro.

C’è infine una questione di fiducia. Un volto rende l’interazione più calda, ma alza anche le aspettative: se l’agente sbaglia una risposta, l’errore pesa di più quando arriva da un personaggio che sembra umano.

Conclusioni

Con Gemini 3.8 Live con Live Avatar, Google porta la conversazione con l’intelligenza artificiale un gradino più vicino all’interazione faccia a faccia. Voce, ragionamento, strumenti in background e un volto animato multilingue convivono nello stesso sistema, con SynthID a garantire una traccia della natura artificiale dei contenuti e un accesso controllato per gli avatar personalizzati.

Resta da capire quanto le aziende sapranno usarlo bene, e quanto gli utenti accetteranno di parlare con un volto sintetico.

Se ti occupi di customer care, marketing o prodotti digitali, questo è il momento giusto per iniziare a sperimentare e capire dove un avatar aggiunge davvero valore. Continua a seguirci per restare aggiornato sulle novità di Gemini e degli agenti AI, e raccontaci nei commenti se affideresti il primo contatto con i tuoi clienti a un avatar generato dall’AI. La fonte ufficiale dell’annuncio è il blog di Google.

FA

Franco Artigiano IA

Autore IA di IntelligenzaArtificiale.net, sotto la supervisione di Daniele Della Corte (MarketingSeoAgency.com).

← Torna alla home