HomeBody, il robot umanoide di Stanford guidato da GPT-6 Astra riordina una cucina mai vista
HomeBody di Stanford e Caltech collega GPT-6 Astra a un Unitree G1 senza livello VLA: il robot esplora, ricorda e riordina una cucina sconosciuta.

Un robot umanoide entra in una cucina che non ha mai visto, la esplora, se la ricorda e poi, su richiesta, la riordina da solo. È quello che mostra HomeBody, il sistema presentato da un gruppo di ricercatori della Stanford University e del Caltech, in cui un Unitree G1 viene guidato direttamente da GPT-6 Astra, il modello di punta di OpenAI.
La notizia non sta tanto nel robot che mette in ordine qualche sacchetto di caffè, quanto nel modo in cui ci arriva. HomeBody elimina uno strato che fino a oggi quasi tutti consideravano indispensabile nella robotica umanoide: il modello di controllo addestrato che traduce il ragionamento in movimenti.
Se ti interessa capire dove sta andando l’AI incarnata, cioè l’intelligenza artificiale che agisce nel mondo fisico, questo lavoro merita attenzione.
Cos’è HomeBody e cosa fa davvero
HomeBody è stato sviluppato presso la Movement Lab di Stanford da Gio Huh (Caltech), Cayden Gu, Takara E. Truong, C. Karen Liu e Guy Tevet. Il progetto, pubblicato a settembre 2026 con una pagina ufficiale e il codice disponibile su GitHub, parte da una domanda precisa: se i modelli visione-linguaggio di frontiera sono diventati così bravi a ragionare sullo spazio, serve ancora un livello intermedio addestrato tra il cervello e i muscoli del robot?
La risposta dei ricercatori è che, almeno in uno scenario domestico circoscritto, se ne può fare a meno.
Due compiti in una cucina sconosciuta
Le dimostrazioni pubblicate riguardano due attività. Nella prima, al robot viene chiesto di raccogliere tutti i sacchetti di caffè al centro della cucina e di buttare i cartoni di latte e succo d’arancia andati a male. Il G1 deve decidere cosa tenere e cosa eliminare, fare più viaggi, afferrare oggetti diversi e posarli nel punto giusto, tenendo traccia di ciò che ha già fatto mentre la sua visuale cambia a ogni passo.
Nella seconda, la richiesta è volutamente vaga: una persona dice di aver dimenticato la medicina e chiede al robot di prenderla, buttando anche il cartone scaduto. Il flacone non è visibile, perché si trova dentro un cassetto. HomeBody recupera dalla memoria l’osservazione salvata durante l’esplorazione, raggiunge il cassetto, lo apre con la mano destra, prende la medicina, la consegna e poi usa la mano sinistra per gettare il cartone.
Nessuno dei due compiti è stato addestrato specificamente per quella cucina.
Perché eliminare il livello VLA è una scelta importante
Per capire la portata della proposta bisogna guardare a come oggi si costruisce di solito l’autonomia di un umanoide. L’architettura più diffusa ha tre livelli. In cima c’è il cosiddetto System 2, un modello visione-linguaggio (VLM) che interpreta le immagini e le istruzioni. Al centro c’è il System 1, un modello VLA (vision-language-action) addestrato su grandi quantità di dimostrazioni per trasformare quelle intenzioni in comandi motori. Alla base c’è il System 0, il controllore che coordina fisicamente il corpo.
Il livello VLA è costoso: richiede dati raccolti con fatica, spesso in teleoperazione, e tende a generalizzare male fuori dagli ambienti in cui è stato addestrato. È anche il punto in cui molte startup della robotica stanno concentrando investimenti enormi.
HomeBody sostituisce questa catena con un’idea più modulare. Il VLM di frontiera non produce direttamente movimenti, ma sceglie tra una libreria di abilità già pronte e le richiama tramite chiamate strutturate, un po’ come un agente software che usa degli strumenti. Le abilità attuali sono cinque: navigare, afferrare, posare, aprire un cassetto e prendere un oggetto da un cassetto aperto.
Un modello intercambiabile
Un dettaglio che ti conviene tenere a mente è che il VLM, nel progetto, è descritto come sostituibile. In questa versione il modello registrato negli esperimenti è GPT Astra, ma l’architettura è pensata per accogliere altri modelli man mano che migliorano. Allo stesso modo la libreria di abilità è espandibile: si può collegare una policy appresa, un algoritmo classico o un altro controllore attraverso la stessa interfaccia, e il modello potrà combinarlo con le abilità esistenti.
In pratica il robot diventa una piattaforma su cui il “cervello” può essere aggiornato senza riaddestrare tutto da capo.
Come funziona: esplorare, ricostruire, agire
Il flusso di lavoro di HomeBody si articola in tre fasi. La prima è l’esplorazione. Al robot viene data un’istruzione semplice, del tipo “sei un robot da cucina, esplora lo spazio”, e il G1 si muove nell’ambiente scegliendo con Astra i punti di vista più utili. Durante il giro raccoglie video da un iPhone, immagini da una telecamera di profondità Intel RealSense D435i, scansioni LiDAR con SLAM, pose delle articolazioni e waypoint.
La seconda fase è il passaggio Real2Sim. Qui Astra viene usato come agente che costruisce un gemello digitale della stanza all’interno di Nvidia Isaac Sim, partendo proprio dai dati raccolti dal robot. Secondo i ricercatori, affidarsi al solo video registrato da una persona porta a stimare le dimensioni della stanza dall’aspetto, mentre la geometria misurata con lo SLAM permette una ricostruzione accurata anche sul piano metrico, fondamentale per camminare e raggiungere gli oggetti.
La terza fase è l’esecuzione del compito.
Quando riceve un’istruzione come “metti in ordine la cucina”, il modello decide ogni passo guardando la visuale corrente, la mappa, lo stato delle mani, le osservazioni ricordate e l’esito dell’azione precedente. Per afferrare un oggetto, per esempio, indica un punto nell’immagine e la mano da usare; il sistema segmenta l’oggetto, stima la profondità con un modello stereo, calcola la presa e pianifica il movimento del braccio controllando le collisioni. Per la navigazione, invece, il modello fornisce una destinazione in metri sulla mappa.
Errori e nuovi tentativi
Uno degli aspetti più interessanti è la gestione degli errori. Se una presa si chiude a vuoto, l’abilità può provare un’altra presa o riposizionarsi da sola, entro un numero limitato di tentativi. Se il problema persiste, restituisce il motivo del fallimento al modello, che può cambiare bersaglio, spostarsi o rivedere il piano. Nei video pubblicati si vede proprio il robot riprovare più volte a prendere un flacone di pillole dal cassetto.
È un approccio molto simile a quello degli agenti software: agire, osservare il risultato, correggere.
L’hardware è sorprendentemente leggero
Un altro dato che colpisce è la potenza di calcolo usata in locale. Le abilità, la percezione e la pianificazione dei movimenti girano su un singolo portatile Razer Blade con GPU RTX 4090. GPT Astra, invece, lavora da remoto: riceve le informazioni, decide e invia al laptop le richieste di abilità con i relativi obiettivi. Per l’equilibrio durante la manipolazione il team usa AMO, una policy preaddestrata per il controllo della parte inferiore del corpo che tiene conto dei movimenti delle braccia.
Questo significa che la parte più “intelligente” del sistema non vive sul robot, ma nel cloud.
È una scelta che semplifica molto la sperimentazione, perché basta una connessione di rete per sfruttare il modello di frontiera più recente, ma che apre anche domande su latenza, costi e affidabilità in un contesto reale come una casa.
I limiti dichiarati dai ricercatori
Il lavoro è onesto sui propri confini. La ricostruzione Real2Sim richiede tempo di preparazione e comporta costi di API. La durata dei compiti è limitata dalla portata del robot, dalle sue capacità di manipolazione e dalla resistenza dell’hardware, compreso il surriscaldamento dei servomotori delle dita durante le sessioni lunghe. La latenza di ragionamento di Astra introduce pause tra un’abilità e l’altra. Infine, lo stack locale richiede una GPU di fascia alta e l’aggiunta di modelli di percezione più pesanti potrebbe richiedere ancora più calcolo.
C’è poi un tema che va oltre il singolo progetto: la sicurezza. Mettere un modello generalista al comando diretto di un corpo fisico significa che eventuali errori di interpretazione non restano su uno schermo. Proprio in queste settimane OpenAI ha sospeso l’addestramento e l’uso con strumenti dei suoi modelli più capaci dopo alcuni incidenti con agenti autonomi, un contesto che rende ancora più delicato il passaggio dall’agente digitale a quello fisico.
Cosa cambia per la robotica domestica
HomeBody non è un prodotto e non promette un maggiordomo robotico domani. È però un segnale chiaro di una tendenza: i modelli di frontiera stanno diventando abbastanza bravi nel ragionamento spaziale da poter orchestrare direttamente un corpo, a patto di dargli memoria dello spazio e abilità affidabili. Lo avevamo già visto con i test sulle capacità di GPT-6 Astra, come nel benchmark di montaggio IKEA di Epoch AI, dove il modello si misurava con istruzioni visive complesse.
Se questo approccio regge anche fuori dal laboratorio, potrebbe cambiare l’economia del settore. Invece di raccogliere montagne di dimostrazioni per ogni nuova casa, i produttori potrebbero concentrarsi su un set di abilità motorie robuste e lasciare al modello generalista la pianificazione. Aziende che puntano sugli umanoidi per la casa, come quella dietro al robot umanoide domestico NEO di 1X, hanno tutto l’interesse a osservare con attenzione.
Anche il costo dell’hardware conta. Il G1 è uno dei robot umanoidi più accessibili sul mercato, e la crescita di Unitree, di cui abbiamo parlato raccontando la quotazione alla borsa di Shanghai, è legata proprio alla diffusione di piattaforme relativamente economiche usate da laboratori universitari di tutto il mondo.
Resta la questione del livello VLA: sparirà davvero? Probabilmente no, almeno non subito. Per movimenti fini, veloci o molto variabili un modello addestrato end to end può ancora avere vantaggi. Più realistico è immaginare sistemi ibridi, in cui il modello di frontiera decide e richiama abilità che possono essere a loro volta piccole policy apprese.
Conclusioni
HomeBody mostra che un modello visione-linguaggio di frontiera, dotato di memoria spaziale e di una libreria di abilità componibili, può guidare un umanoide in compiti domestici lunghi e poco specificati senza addestramento dedicato all’ambiente. Non è la fine del lavoro sui modelli VLA, ma è una prova concreta che la strada modulare, simile a quella degli agenti software, funziona anche nel mondo fisico.
Se lavori nel settore o semplicemente segui la robotica, ti conviene guardare i video e il codice pubblicati dai ricercatori: danno un’idea molto concreta di quanto siano vicini, e allo stesso tempo ancora lontani, i robot domestici autonomi. E se vuoi restare aggiornato su come i modelli di OpenAI escono dallo schermo e arrivano nel mondo reale, continua a seguirci e condividi l’articolo con chi si occupa di AI e automazione.