Il sito che ti spiega l'AI.
News, strumenti e guide in italiano.
Studi e rapporti

Project Swap: Anthropic mette alla prova gli agenti Claude in un mercato di libri

Con Project Swap Anthropic ha fatto trattare 201 agenti Claude per scambiare libri: negoziano bene, ma il limite è quanto conoscono chi rappresentano.

FA
Franco Artigiano IA Franco Artigiano
Settembre 26, 2026
Lettura: 9 min
Pila di libri su uno scaffale, simbolo dello scambio di libri tra agenti AI di Project Swap
fonte: pixabay 3973758

Cosa succede quando lasci che un agente AI tratti al posto tuo? Anthropic ha provato a rispondere con Project Swap, un esperimento pubblicato il 24 settembre 2026 in cui 201 dipendenti dell’azienda hanno affidato a un agente basato su Claude il compito di scambiare un libro con quelli dei colleghi. Ogni partecipante ha portato un volume da cedere, ha fatto una breve chiacchierata con Claude sui propri gusti di lettura e poi ha lasciato che il suo agente entrasse in una sorta di borsa digitale, dove proporre, contrattare e chiudere scambi con gli agenti degli altri.

Il risultato è meno scontato di quanto sembri. Gli agenti si sono dimostrati negoziatori capaci, ma il vero collo di bottiglia non è stato il modo in cui trattavano: è stata la qualità delle informazioni che avevano sulle persone da rappresentare.

È un dettaglio che conta molto, perché sposta l’attenzione da “quanto è bravo l’agente a contrattare” a “quanto ti conosce davvero”. Ed è una domanda che riguarderà presto chiunque deleghi acquisti, prenotazioni o trattative a un assistente AI.

Come funzionava il mercato di libri gestito da Claude

Project Swap è il seguito, più controllato, di un precedente esperimento chiamato Project Deal, in cui gli agenti compravano e vendevano oggetti reali in una bacheca di annunci interna. Lì i beni erano troppo eterogenei per misurare con precisione quanto fosse buono il risultato finale. Con i libri, invece, le preferenze di ciascuno possono essere espresse come una classifica, e diventa possibile calcolare quanto il mercato si avvicini all’assegnazione ideale.

I 201 partecipanti erano divisi in sei gruppi locali, corrispondenti agli uffici di San Francisco, New York, Londra, Seattle, Washington e Dublino. Il gruppo più grande, quello di San Francisco, contava 115 persone; quello di Dublino appena tre, tanto che Anthropic lo ha escluso da gran parte dell’analisi.

Dall’intervista di cinque minuti alla classifica dei libri

Il primo passaggio era una conversazione semi-strutturata con Claude, della durata di circa cinque minuti. Poche domande aperte sui gusti generali e sul tipo di lettura desiderata per l’estate. A partire da quel dialogo, un modello avanzato costruiva una classifica di tutti i libri presenti nel gruppo del partecipante, stimando in pratica le sue preferenze anche su titoli mai nominati.

In parallelo, ogni persona ordinava personalmente dieci libri del proprio gruppo. Questa classifica “reale” non veniva mai mostrata agli agenti: serviva solo ai ricercatori per verificare, a posteriori, quanto l’agente avesse capito il suo rappresentato.

Il trading floor e le regole del gioco

Una volta costruite le preferenze, gli agenti entravano in un canale condiviso, un vero trading floor. Potevano proporre scambi a due o rotazioni tra più parti, accettarli, rifiutarli o semplicemente parlare con gli altri. Uno scambio veniva eseguito solo se tutte le parti coinvolte erano d’accordo, e l’intera cronologia dei messaggi era pubblica. Il mercato si chiudeva allo scadere del tempo o quando gli agenti smettevano di parlare.

C’era anche una variabile comportamentale. Metà degli agenti era istruita a essere “spietata”, con l’unico obiettivo di procurare al proprio utente il libro migliore possibile. L’altra metà era “prosociale”: stesso obiettivo principale, ma con un secondo scopo, cioè fare in modo che tutti finissero con un libro gradito.

Dopo l’evento dal vivo, Anthropic ha rigiocato il mercato decine di volte, cambiando una sola variabile alla volta: le istruzioni, il modello usato dagli agenti (Haiku, Sonnet, Opus e Fable), oppure la composizione mista dei modelli sullo stesso floor. In totale le simulazioni analizzate sono state 205.

I risultati: Claude capisce, ma non abbastanza

Il numero più citato dello studio è il 61%. Confrontando le coppie di libri classificate sia dall’utente sia da Claude, l’ordine coincideva nel 61% dei casi, contro il 50% che si otterrebbe tirando a caso. Può sembrare poco, ma va letto nel contesto: una classifica basata sulla semplice popolarità dei titoli si fermava intorno al 53%, e un metodo di filtraggio collaborativo classico, del tipo “chi ha amato X ha amato anche Y”, arrivava al 55%.

In altre parole, cinque minuti di conversazione hanno battuto gli approcci tradizionali dei sistemi di raccomandazione.

Anthropic nota anche un effetto intuitivo ma misurabile: chi ha scritto di più durante l’intervista è stato rappresentato meglio. Il partecipante mediano ha digitato appena 216 parole in otto messaggi, e passare da circa 150 a 300 parole è associato a circa quattro punti percentuali di accordo in più.

Dove si perde efficienza

Per valutare il mercato, i ricercatori hanno usato un punteggio di efficienza da 0 a 1, calcolato sulla classifica reale di ciascun partecipante. Un punteggio di 1 significa ricevere il libro preferito, 0 l’ultimo della lista. L’assegnazione ideale, tenendo conto che più persone possono desiderare lo stesso titolo, arrivava a 0,89. Il mercato reale si è fermato a 0,55, grosso modo il quinto libro su dieci.

Da dove nasce questo divario? Secondo lo studio, circa l’85% della perdita dipende dal fatto che gli agenti lavoravano su preferenze imprecise, mentre solo il 15% è attribuibile alle dinamiche caotiche della contrattazione decentralizzata. Anche un meccanismo di scambio centralizzato e teoricamente ottimale, alimentato con le stesse classifiche stimate da Claude, avrebbe ottenuto 0,60: poco più del mercato libero.

Il messaggio è chiaro: se l’agente non sa cosa vuoi, anche la migliore strategia negoziale serve a poco.

Il modello conta più delle istruzioni

Guardando invece l’efficienza misurata sulle classifiche costruite da Claude, emergono differenze nette tra i modelli. I mercati popolati solo da agenti Haiku hanno raggiunto in media 0,75, quelli con Sonnet 0,80, quelli con Opus 0,88 e quelli con Fable 0,86. Nei floor misti, gli agenti basati sul modello più forte tendevano a ottenere risultati migliori rispetto ai colleghi più deboli, e nei confronti diretti gli agenti Opus uscivano sempre in vantaggio.

Le istruzioni, al contrario, hanno avuto un peso marginale. Gli agenti “spietati” hanno ottenuto circa 0,02 punti in più rispetto a quelli prosociali, mentre passare da Haiku a Opus spostava le persone di 0,12 punti verso l’alto nelle loro liste. Tradotto: la scelta del modello pesa molto più del prompt che gli dai.

Non mancano gli episodi curiosi. Sul floor di Londra, un agente è rimasto per un’ora con in mano un libro che tutti avevano scartato e ha iniziato a fare appello al senso di responsabilità collettiva. Alla fine un agente prosociale ha ceduto il suo secondo libro preferito per accettare quello rifiutato da tutti, spiegando che il salto da “zero garantito” a una lettura adatta valeva più del suo piccolo sacrificio.

Come si comportano gli agenti quando trattano tra loro

Lo studio analizza anche le tattiche usate nei messaggi. In generale gli agenti non hanno rivelato l’intera classifica dei propri utenti, un comportamento sensato dal punto di vista strategico. Però la maggior parte ha dichiarato apertamente il proprio libro preferito, con percentuali tra il 78% e il 96% a seconda del modello, e quasi nessuno ha mentito su quel punto: circa un agente su cento.

Anthropic ha individuato sedici tattiche ricorrenti, raggruppate in tre famiglie: la pressione sugli altri agenti, ad esempio richiamando la scadenza imminente o un senso di dovere collettivo; il modo di presentare il proprio libro, citando premi o confrontandolo con offerte rivali; e l’organizzazione degli scambi, con agenti che tenevano liste d’attesa o si improvvisavano mediatori per persone che non rappresentavano.

Sono comportamenti che ricordano da vicino quelli umani, e proprio per questo sollevano domande sulle regole necessarie in mercati popolati da agenti.

Soddisfazione e fiducia degli utenti

Qualche settimana dopo la consegna dei libri, i partecipanti hanno risposto a un sondaggio. La soddisfazione media è stata di 7,2 su 10, e circa la metà ha dichiarato che il libro ricevuto era migliore della maggior parte di quelli che sceglie da sé.

Ancora più interessante è la domanda sulla fiducia. In media, i partecipanti affiderebbero a un agente circa il 30% del proprio budget annuale per i libri, lasciandogli piena autonomia e senza diritto di veto. Per confronto, a un amico colto che conosce i loro gusti ne affiderebbero circa il 40%. Chi riteneva che il riepilogo dell’intervista scritto da Claude fosse completo arrivava al 34%, chi invece vi trovava lacune scendeva al 23%.

La fiducia, insomma, cresce quando l’utente vede che l’agente lo ha capito.

Perché Project Swap conta per il futuro dei mercati agentici

L’esperimento si inserisce in un momento in cui gli agenti AI stanno uscendo dai laboratori per entrare in processi reali: acquisti online, prenotazioni, pagamenti. Non a caso i grandi circuiti di pagamento stanno già lavorando a sistemi di verifica dell’identità degli agenti, come abbiamo raccontato parlando dell’iniziativa Know Your Agent di Visa, Mastercard e Ant.

Anthropic trae due indicazioni principali. Chi progetta agenti per i mercati dovrà trovare modi per verificare che l’agente abbia davvero compreso le preferenze della persona, per esempio mostrando un riepilogo da confermare prima di agire. Chi progetta mercati per agenti dovrà invece definire regole chiare su chi può entrare, cosa succede quando uno scambio salta e quanta parte dell’attività è visibile ai partecipanti.

C’è poi il tema della lealtà. Un agente deve fare gli interessi del suo utente, ma fino a che punto? Un partecipante si è lamentato che il suo agente avesse ceduto un libro molto desiderato per “pressione dei pari”, riconoscendo però che a volte il compromesso serve al bene comune. In ambiti più delicati, come la sanità, il lavoro o la finanza, questo equilibrio diventerà una questione normativa, oltre che tecnica.

I limiti dichiarati dello studio

Anthropic è la prima a mettere le mani avanti. I dipendenti dell’azienda non rappresentano la popolazione generale e probabilmente si fidano di Claude più della media. Non c’erano incentivi per compilare con cura le classifiche, e solo il 59% ha risposto al sondaggio finale. Tutti gli agenti erano versioni educate e cooperative di Claude, senza agenti ostili progettati per sfruttare gli altri. Infine, le regole del mercato, come la durata e il numero di agenti attivi contemporaneamente, sono rimaste fisse.

Sono limiti importanti, ma non tolgono valore al lavoro: si tratta di uno dei primi tentativi di misurare in modo rigoroso come si comportano gli agenti quando trattano tra loro per conto di persone reali.

Conclusioni: prima di delegare, fatti conoscere

Project Swap offre una lezione pratica che vale ben oltre i libri. Gli agenti basati su Claude sanno già negoziare in modo efficace, e la scelta di un modello più capace, come l’ultimo Claude Opus 5.5, fa una differenza concreta sui risultati. Ma il fattore decisivo resta la qualità delle informazioni che fornisci: più l’agente ti conosce, meglio ti rappresenta.

Se stai valutando di affidare compiti di acquisto o trattativa a un assistente AI, parti da qui: dedica tempo a spiegare con precisione cosa vuoi, controlla il riepilogo che l’agente ha costruito su di te e verifica le regole della piattaforma su cui opererà. Puoi approfondire la ricerca originale sul blog di Anthropic e continuare a seguire su queste pagine l’evoluzione dei mercati agentici.

FA

Franco Artigiano IA

Autore IA di IntelligenzaArtificiale.net, sotto la supervisione di Daniele Della Corte (MarketingSeoAgency.com).

← Torna alla home