Il sito che ti spiega l'AI.
News, strumenti e guide in italiano.
Machine learning

EmbeddingGemma 2 di Google: embedding multimodale aperto che gira sul dispositivo

Google lancia EmbeddingGemma 2: modello aperto Apache 2.0 che unisce testo, immagini, audio, video e codice, pensato per girare sul dispositivo.

Daniele Della Corte
Daniele Della Corte Rivisto e verificato
Ottobre 9, 2026
Lettura: 6 min
Smartphone in mano, simbolo dell'elaborazione AI direttamente sul dispositivo
fonte: unsplash photo-1511707171634

Google ha rilasciato EmbeddingGemma 2, la seconda generazione del suo modello di embedding aperto, e questa volta il salto è netto: non lavora più solo sul testo, ma mappa in un unico spazio vettoriale testo, immagini, audio, video e codice. Il tutto con pesi aperti e licenza Apache 2.0, pensato per girare direttamente sul dispositivo, senza passare dal cloud.

Se ti occupi di ricerca semantica, di sistemi RAG o di agenti che devono consultare dati privati, è una notizia che merita attenzione. Vediamo cosa è stato annunciato, come funziona e cosa cambia in pratica.

Cos’è EmbeddingGemma 2 e cosa ha annunciato Google

Il 6 ottobre 2026 Google ha pubblicato sul suo blog ufficiale l’annuncio del nuovo modello, che l’azienda descrive come il più capace per gli embedding multimodali eseguiti sul dispositivo. Un modello di embedding, per chi non lo conoscesse, trasforma un contenuto in un vettore numerico: contenuti simili finiscono vicini nello spazio, e questo permette di cercare per significato e non per parole chiave.

La novità sta nell’ampiezza. La prima versione si limitava al testo, mentre EmbeddingGemma 2 porta nello stesso spazio anche immagini, audio, video e codice. In pratica puoi cercare un momento in un video partendo da una frase, oppure trovare una foto partendo da una descrizione, usando un solo modello.

Architettura e dimensioni

Il modello è costruito sull’architettura Gemma 4, di cui condivide il tokenizer del testo e l’encoder audio, e secondo Google usa la stessa tecnologia dei modelli Gemini Embedding. Il totale è di 740 milioni di parametri, ma la struttura è modulare: per i soli carichi di lavoro testuali bastano circa 270 milioni di parametri, mentre l’encoder visivo da 170 milioni e quello audio da 300 milioni si aggiungono solo quando servono.

È una scelta intelligente, perché ti permette di pagare in memoria solo ciò che usi davvero.

Finestra di contesto e dimensioni dei vettori

La finestra di contesto sale a 8.000 token, il quadruplo della prima versione. Google precisa che equivale a circa 5,5 minuti di audio, 29 immagini o 58 fotogrammi video, oppure a combinazioni intercalate di questi elementi. Per i documenti lunghi e per i contenuti misti è un miglioramento concreto, perché riduci la necessità di spezzare tutto in piccoli frammenti.

Resta poi la tecnica Matryoshka Representation Learning: i vettori nascono a 768 dimensioni ma si possono troncare a 512, 256 o 128 senza riaddestrare nulla. Google parla di una riduzione dello spazio di archiviazione fino a 6 volte, un vantaggio notevole quando devi indicizzare milioni di elementi.

Prestazioni e requisiti hardware

Sul fronte dei risultati, il dato più esplicito riguarda il codice: il punteggio sul benchmark MTEB Code passa da 68,76 a 78,68, quasi dieci punti in più rispetto alla versione precedente. Secondo l’annuncio, il modello guida inoltre la categoria dei modelli multimodali sotto il miliardo di parametri su MTEB Code e su MAEB, il benchmark dedicato agli embedding audio. Per le metriche complete Google rimanda alla scheda del modello.

Va ricordato che si tratta di numeri dichiarati dall’azienda, quindi conviene sempre verificarli sul tuo caso d’uso reale prima di migrare un sistema in produzione.

Più interessante, per chi sviluppa app mobili, è il discorso sulla memoria. Con la quantizzazione, su un Pixel 11 Pro il modello occupa circa 191 MB di RAM attiva per i soli pesi testuali e circa 567 MB per la versione multimodale completa. Sono cifre che rendono realistica la ricerca semantica locale su uno smartphone, anche offline, e si collegano bene al tema dei small language models, che puntano proprio a portare l’intelligenza dove si trovano i dati.

Dove trovarlo e come usarlo

I pesi sono disponibili su Hugging Face e Kaggle con licenza Apache 2.0, una delle più permissive, che consente l’uso commerciale senza vincoli particolari. Google segnala anche versioni ottimizzate tramite la comunità LiteRT su Hugging Face, mentre la disponibilità nel Model Garden della piattaforma Gemini Enterprise Agent è indicata come in arrivo.

L’elenco degli strumenti supportati è lungo e pratico: MediaPipe, LiteRT, transformers.js con una demo WebGPU, transformers, sentence-transformers, MLX, vLLM, llama.cpp in formato GGUF, SGLang, Ollama, LM Studio e Qdrant per l’archiviazione dei vettori. Per il fine-tuning, Unsloth mette a disposizione una guida dedicata.

Se vuoi provarlo in locale, Ollama o LM Studio sono il punto di partenza più semplice, e la nostra guida su come eseguire un LLM in locale sul tuo computer ti aiuta a preparare l’ambiente.

I casi d’uso: dalla RAG privata alla ricerca nei video

Google indica alcuni scenari chiave. Il primo è la ricerca semantica offline, anche tra tipi di contenuto diversi: scrivi una frase e trovi l’immagine, il clip audio o il passaggio di video più pertinente. Il secondo è la RAG con privacy al primo posto, soprattutto in abbinamento a Gemma 4, perché tutto il flusso può restare sul dispositivo e i tuoi documenti non escono mai.

Il terzo riguarda lo sviluppo: indicizzare localmente una base di codice e fornire agli agenti di programmazione un recupero rapido del contesto giusto. Il quarto è la gestione di librerie multimediali, per esempio ritrovare un momento preciso in un video. Infine c’è la classificazione e l’instradamento delle richieste tramite la Decision Task API di MediaPipe.

Per i sistemi aziendali che lavorano con documenti complessi, questo si affianca a strumenti di estrazione come quelli visti nel nostro articolo su Cohere Parse 5: prima converti i file in testo strutturato, poi li indicizzi con un embedding locale.

Perché conta per chi lavora con SEO e contenuti

Gli embedding sono ormai alla base di come i motori di ricerca e gli assistenti AI interpretano i contenuti. Capire come funzionano ti aiuta a ragionare in termini di significato e di argomenti, non solo di parole chiave. Un modello aperto e leggero come questo ti permette di sperimentare in autonomia: raggruppare le pagine di un sito per tema, individuare contenuti ridondanti o costruire una ricerca interna davvero semantica, senza inviare i tuoi dati a servizi esterni.

C’è poi un aspetto strategico. Portare gli embedding multimodali sul dispositivo riduce costi, latenza e rischi di privacy, e sposta parte del valore dal cloud al bordo della rete. È una tendenza che si vede da tempo e che questo rilascio rafforza.

Limiti e cose da verificare

Alcuni punti restano aperti. Google dichiara che le prestazioni sul testo multilingue sono in linea con la prima versione, ma nell’annuncio non elenca le lingue supportate: se lavori in italiano, devi quindi testare tu la qualità sui tuoi contenuti. Anche le metriche complete sono nella scheda del modello e non nel post, quindi vale la pena leggerle con attenzione.

Va considerato infine il costo di integrazione. Un indice multimodale richiede più spazio e più pre-elaborazione di uno solo testuale, e la riduzione delle dimensioni dei vettori comporta sempre un compromesso tra precisione e archiviazione. Conviene misurare il recupero su un campione prima di scegliere la dimensione finale.

Conclusioni: da dove cominciare

EmbeddingGemma 2 è un passo importante verso una ricerca semantica multimodale, aperta e davvero locale. Con 8.000 token di contesto, vettori comprimibili e requisiti di memoria contenuti, abbassa la soglia d’ingresso per chi vuole costruire sistemi RAG privati o motori di ricerca interni.

Il mio consiglio è semplice: scarica il modello, indicizza un piccolo archivio di documenti e immagini tuoi e confronta i risultati con la soluzione che usi oggi. Se ti è utile, seguici per le prossime novità sull’AI e condividi l’articolo con chi sviluppa o lavora con i dati.

Newsletter gratuita · ogni venerdì

Tutta l'AI della settimana, in 5 minuti, nella tua email

  • Le guide e le notizie della settimana, divise per rubrica
  • Solo ciò che conta, verificato e spiegato in italiano
  • Niente spam, ti cancelli con un clic

Daniele Della Corte
Rivisto e verificato da

Daniele Della Corte

Fondatore di IntelligenzaArtificiale.net · Consulente SEO e AI dal 2008

Prima della pubblicazione controlla fonti, numeri e nomi, e risponde personalmente di quello che leggi. Lavora con l'intelligenza artificiale da oltre 7 anni: ha fondato BeProud.ai e ha progettato la redazione di questo sito.

← Torna alla home