GPT-6 Astra trova gli errori nel montaggio IKEA: il benchmark di Epoch AI
Nel benchmark di Epoch AI sul montaggio di mobili IKEA, GPT-6 Astra raggiunge l'80%: in dieci mesi il ragionamento spaziale dell'AI è quasi triplicato.

Hai presente quel momento in cui, a metà del montaggio di un mobile IKEA, ti accorgi che un pannello è girato al contrario e che dovrai smontare mezz’ora di lavoro? Secondo un nuovo studio di Epoch AI, l’intelligenza artificiale sta diventando sorprendentemente brava a scovare proprio questo tipo di errori. Nel suo Furniture Assembly Benchmark, un test pensato per misurare il ragionamento visivo e spaziale dei modelli, GPT-6 Astra di OpenAI ha raggiunto l’80% di accuratezza, contro il 28% registrato dal miglior modello appena dieci mesi fa.
Il dato è interessante non tanto per le librerie e le cassettiere in sé, quanto per ciò che rappresenta: la capacità di confrontare un manuale tecnico con la realtà fotografata e capire dove qualcosa è andato storto. È una competenza che somiglia molto a quella richiesta per riparare un elettrodomestico, fare manutenzione su un’auto o guidare un tecnico sul campo.
Che cos’è il Furniture Assembly Benchmark di Epoch AI
Epoch AI è un istituto di ricerca indipendente noto per i suoi dataset sui modelli, sul calcolo e sulle tendenze dell’AI. Il 23 settembre 2026 ha pubblicato un rapporto firmato da Aiden Ament e Greg Burnham, responsabile dei benchmark, che presenta il Furniture Assembly Benchmark, abbreviato in FAB. L’obiettivo dichiarato è colmare un vuoto: esistono pochissimi test che misurano il ragionamento visivo applicato a compiti fisici concreti.
Il principio è semplice da spiegare, molto meno da superare.
Tre mobili, sessanta fotografie
I ricercatori hanno acquistato tre prodotti IKEA di difficoltà crescente: la scarpiera STÄLL, il letto contenitore TONSTAD e la cassettiera GULLABERG a otto cassetti. Per misurarne la complessità hanno usato l’IKEA Complexity Index, un indice che moltiplica il numero di passaggi per il numero di pezzi: si va da circa 4.000 punti per la scarpiera a oltre 21.000 per la cassettiera, con tempi di montaggio stimati per una persona che vanno da un’ora e mezza a cinque ore.
Durante il montaggio il team ha scattato fotografie a ogni fase, commettendo di proposito degli errori realistici. Spesso ha anche continuato a costruire dopo lo sbaglio, proprio per renderlo più difficile da individuare, come succede nella vita reale quando ti accorgi del problema solo tre passaggi dopo. Il risultato è un set di 60 immagini: alcune mostrano un assemblaggio corretto, altre contengono uno o più errori ben visibili, per esempio un pannello laminato montato con il lato sbagliato rivolto verso l’esterno.
Come vengono valutati i modelli
Ogni modello riceve la fotografia, il manuale di istruzioni in PDF, uno strumento di zoom per ingrandire i dettagli dell’immagine e un interprete Python. Lavora in un ambiente agentico con un budget di 80 passaggi per ciascuna foto, un limite che nella pratica è stato raggiunto in meno del 5% dei casi. Se trova errori, deve indicare tutti i passaggi del manuale in cui sono stati commessi e descriverli; se non ne trova, deve dire all’utente qual è il passo successivo del montaggio.
La correzione avviene in più fasi. Se la foto è corretta e il modello lo riconosce, la risposta è valida. Se invece c’è un errore, il modello deve individuare il passaggio giusto e, infine, la sua descrizione del problema viene verificata da un altro modello usato come giudice, istruito a essere indulgente: basta identificare il passo sbagliato e descrivere il difetto a grandi linee.
I risultati: GPT-6 Astra in testa, Claude subito dietro
Nella classifica iniziale compaiono 21 modelli con capacità visive sviluppati da OpenAI, Anthropic, Google, Moonshot e Alibaba. In cima c’è GPT-6 Astra con l’80%, seguito da Claude Fable 5.1 con il 70% e da Claude Opus 5 con il 61%. In fondo alla graduatoria si trova Qwen3.8 Max di Alibaba, fermo al 20%.
Il salto rispetto all’anno scorso è netto. A novembre 2025 il punteggio più alto tra i modelli testati era il 28% di Claude Opus 4.5. In dieci mesi la frontiera si è quasi triplicata. Epoch ammette che all’epoca il vero massimo potrebbe essere stato un po’ più alto, perché mancano i punteggi di modelli come GPT-5 e Gemini 3, ma si dice sorpresa se qualcuno avesse fatto molto meglio.
Se vuoi approfondire il modello di punta di OpenAI, abbiamo già raccontato come viene proposto nei settori professionali con Astra for Law, la versione di GPT-6 per gli studi legali.
Non solo più preciso, anche più veloce
L’aspetto forse più sorprendente riguarda l’efficienza. GPT-6 Astra impiega un tempo mediano di circa tre minuti per fotografia, il valore più basso tra tutti i modelli valutati, da due a dieci volte più rapido dei precedenti leader. Raggiunge inoltre la migliore accuratezza consumando una frazione dei token usati dagli altri sistemi.
Tre minuti sono ancora troppi per un assistente che ti guida in tempo reale mentre avviti un pannello, e gli stessi ricercatori lo riconoscono. Però la distanza da un uso pratico si sta accorciando in fretta.
La complessità del mobile conta meno del previsto
Un dettaglio controintuitivo emerge dall’analisi per singolo mobile: non c’è una relazione chiara tra la complessità misurata dall’indice IKEA e la difficoltà incontrata dai modelli. Secondo Epoch contano di più altri fattori, come quanto è sottile l’errore, l’angolazione della foto e quanto il montaggio è proseguito dopo lo sbaglio. In altre parole, un mobile con tanti pezzi non è per forza il più insidioso da controllare.
Due modi opposti di sbagliare
Una delle parti più utili del rapporto riguarda gli errori ricorrenti, che tendono a essere condivisi all’interno della stessa famiglia di modelli. I Gemini di Google e i Qwen di Alibaba partono quasi sempre dal presupposto che un errore ci sia, finendo per segnalare problemi anche su montaggi perfetti. I primi modelli di Anthropic e OpenAI, al contrario, peccavano di ottimismo e troppo spesso non trovavano affatto gli errori presenti.
Per te che usi questi strumenti ogni giorno, la lezione è concreta: un assistente che vede problemi ovunque è inutile quanto uno che non ne vede mai.
Questa tendenza ha implicazioni che vanno oltre i mobili. Un sistema di controllo qualità che genera troppi falsi allarmi fa perdere tempo e fiducia; uno che lascia passare i difetti è semplicemente pericoloso. Capire da che parte pende un modello è quindi un’informazione preziosa quando si sceglie quale integrare in un flusso di lavoro.
Il divario dei modelli open-weight cinesi
Il rapporto dedica spazio anche al confronto tra i modelli chiusi statunitensi e quelli open-weight cinesi. Il leader del benchmark è sempre stato un modello chiuso. Il miglior modello cinese oggi disponibile, Kimi K3 di Moonshot AI, al momento del rilascio era indietro di circa sette mesi rispetto alla frontiera su questo test.
È un distacco più ampio di quello misurato sulle capacità generali: secondo l’Epoch Capabilities Index, l’indice aggregato dell’istituto, lo stesso Kimi K3 inseguiva la frontiera di soli 4,4 mesi. La spiegazione più probabile è che la visione sia ancora una capacità poco diffusa nei modelli cinesi. Epoch fa notare che DeepSeek V4 Pro e Flash non supportano le immagini, così come GLM 5.3 di Z.ai.
Il ritardo, insomma, non è tanto nel ragionamento quanto negli occhi.
Perché questo test conta più di quanto sembri
Potresti pensare che un benchmark sui mobili IKEA sia poco più di una curiosità. In realtà Epoch lo presenta come un indicatore di una famiglia di attività con un valore economico rilevante: tutte quelle in cui bisogna collegare un’istruzione scritta o disegnata a un oggetto fisico reale, verificare che le cose siano al posto giusto e intervenire se non lo sono. Pensa alla manutenzione industriale, all’assistenza tecnica a domicilio, al controllo qualità in fabbrica o alla riparazione di un’auto.
In tutti questi casi la competenza chiave è la stessa: leggere un manuale, guardare la realtà e capire la differenza.
La direzione è evidente anche sul fronte dei dispositivi. I produttori stanno spingendo occhiali intelligenti e assistenti multimodali capaci di vedere ciò che vedi tu, come abbiamo raccontato parlando delle novità presentate al Meta Connect 2026 con i nuovi Ray-Ban Meta. Un modello in grado di riconoscere un errore di montaggio in pochi secondi, abbinato a una fotocamera indossabile, trasformerebbe questi occhiali in un tecnico esperto sempre al tuo fianco.
I limiti da tenere presenti
Epoch stessa invita alla prudenza. Il benchmark si basa su sole 60 fotografie di tre mobili, un campione ridotto che non permette di generalizzare con sicurezza ad altri compiti fisici. Inoltre la prestazione umana non è ancora stata misurata, anche se i ricercatori ritengono che molti errori sarebbero difficili da individuare per chi non conosce il montaggio. Infine, per i modelli open-weight sono stati usati gli endpoint ufficiali di Moonshot e Alibaba, e velocità e qualità possono cambiare parecchio a seconda del fornitore che li ospita.
Va anche ricordato che la correzione finale è affidata a un altro modello linguistico, per quanto istruito a essere tollerante. È una scelta comune nei benchmark moderni, ma introduce un margine di soggettività di cui tenere conto.
Cosa cambia per chi usa l’AI ogni giorno
Nel breve periodo non vedrai ChatGPT montare la tua libreria al posto tuo. Però già oggi puoi fotografare un passaggio dubbio, caricare il manuale e chiedere a un assistente multimodale se qualcosa non torna, ottenendo risposte molto più affidabili rispetto a un anno fa. Se usi ChatGPT o Claude con il caricamento di immagini e documenti, è un esperimento che vale la pena fare, magari confrontando le risposte di modelli diversi.
Il messaggio più ampio è che il ragionamento spaziale, a lungo considerato un punto debole dei modelli linguistici, sta migliorando a una velocità notevole. Il passaggio dal 28% all’80% in dieci mesi è il tipo di curva che, se confermata su altri compiti, porta rapidamente l’AI fuori dallo schermo e dentro officine, cantieri e case.
Conclusioni
Il Furniture Assembly Benchmark di Epoch AI fotografa un progresso rapido e misurabile nella capacità dei modelli di collegare istruzioni tecniche e mondo fisico. GPT-6 Astra guida la classifica con l’80% e tempi di risposta nettamente inferiori ai concorrenti, Claude Fable 5.1 e Claude Opus 5 lo seguono a breve distanza, mentre i modelli open-weight cinesi scontano soprattutto la scarsa diffusione delle capacità visive. Restano limiti evidenti, a partire dalle dimensioni ridotte del test, ma la traiettoria è chiara.
Puoi consultare il rapporto completo di Epoch AI per esplorare i grafici interattivi e la classifica modello per modello. E tu, affideresti all’AI il controllo del tuo prossimo montaggio? Continua a seguirci per restare aggiornato sui benchmark e sui modelli che stanno ridefinendo cosa l’intelligenza artificiale sa fare nel mondo reale.