MentalHealthBench, il benchmark di OpenAI che valuta l’AI sulla salute mentale
OpenAI lancia MentalHealthBench, benchmark aperto creato con oltre 80 psicologi e psichiatri per valutare come l’AI risponde sulla salute mentale.

OpenAI ha presentato MentalHealthBench, un benchmark aperto che misura come i modelli di intelligenza artificiale rispondono nelle conversazioni legate alla salute mentale. Non si limita ai casi di emergenza, come accadeva finora nella maggior parte dei test, ma copre tutto lo spettro: dallo stress quotidiano e dalle difficoltà nelle relazioni fino alle situazioni in cui una persona è in pericolo e ha bisogno di aiuto reale, subito.
La novità conta perché le persone parlano già di questi temi con i chatbot. OpenAI dichiara che ChatGPT viene usato da oltre un miliardo di persone ogni settimana, e una parte di queste conversazioni riguarda ansia, relazioni, lutti, momenti di crisi. Capire se un modello risponde bene, e non solo se evita le risposte vietate, diventa quindi una questione di sicurezza pubblica oltre che di qualità del prodotto.
In questo articolo vediamo come è costruito il benchmark, chi lo ha progettato, cosa misura e quali limiti è bene tenere a mente.
Cos’è MentalHealthBench e perché nasce adesso
MentalHealthBench è stato pubblicato da OpenAI il 23 settembre 2026 insieme a un paper tecnico. Si tratta di una raccolta di 1.215 conversazioni sintetiche, cioè generate artificialmente ma costruite per riflettere in modo realistico i modi in cui le persone usano l’AI quando parlano di benessere psicologico. Le conversazioni sono state create con tecniche che tutelano la privacy, quindi non contengono dialoghi reali di utenti.
Il punto di partenza è una critica esplicita agli strumenti di valutazione esistenti. Secondo OpenAI, la maggior parte delle valutazioni in questo campo si è concentrata sugli scenari di emergenza, misurando il successo con criteri ampi e predefiniti. È un approccio comprensibile, perché le emergenze sono i casi più delicati, ma lascia scoperta la grande maggioranza delle conversazioni reali, che sono meno drammatiche e più sfumate.
In altre parole, sapere che un modello non dice cose pericolose non basta a sapere se aiuta davvero.
Tre livelli di urgenza
Il benchmark distribuisce le conversazioni su tre livelli di gravità. Ci sono le conversazioni non acute, cioè scambi quotidiani con una componente emotiva, che rappresentano circa il 53,5% del dataset. Poi quelle ad alta acuità, in cui emergono preoccupazioni serie o un disagio significativo senza un’emergenza immediata, pari a circa il 18,2%. Infine le emergenze vere e proprie, con segnali di rischio per la sicurezza della persona, che pesano per circa il 28,3%.
OpenAI precisa che questa distribuzione è pensata per mettere alla prova i modelli e non rispecchia la frequenza con cui questi temi compaiono davvero in ChatGPT. È un dettaglio importante: le emergenze sono sovrarappresentate apposta, per avere abbastanza casi su cui misurare il comportamento nei momenti più critici.
Utenti diversi, lingue diverse
Le conversazioni simulano quattro tipi di persone: adulti, adolescenti tra i 13 e i 17 anni, caregiver che si occupano di qualcuno in difficoltà e clinici che usano l’AI nel proprio lavoro. Gli scenari coprono più lingue e aree geografiche, e alcuni includono informazioni di contesto sull’utente, per esempio un lutto recente in famiglia, così da verificare se il modello usa quel contesto per calibrare la risposta.
Per il profilo adolescente, l’età viene indicata esplicitamente tramite un messaggio di sistema, e le risposte sono state esaminate da clinici con esperienza specifica nella salute mentale dei giovani. OpenAI ammette che questo metodo, pensato per funzionare con modelli di fornitori diversi, potrebbe non catturare tutte le protezioni integrate nei singoli prodotti.
Come è stato costruito: il ruolo degli esperti
Il cuore del progetto è la collaborazione con una rete di oltre 80 professionisti abilitati, psicologi e psichiatri, provenienti da 22 paesi. Il gruppo parla complessivamente 19 lingue e rappresenta quasi 20 sottospecialità della salute mentale. È lo stesso approccio che OpenAI aveva già adottato con HealthBench, il benchmark dedicato alla salute in generale, di cui MentalHealthBench è in un certo senso l’evoluzione specialistica.
Per ogni conversazione, gli esperti hanno letto il dialogo e scritto una serie di criteri di valutazione, le cosiddette rubriche, riferite all’ultima risposta che il modello deve dare. Ogni criterio riguarda un singolo aspetto: fare la domanda giusta, riconoscere un’emozione espressa, dare un consiglio pratico, evitare un’affermazione dannosa. In totale la versione pubblica contiene 5.262 criteri scritti dagli esperti.
Ogni criterio ha un peso che va da -10 a +10. I punti positivi premiano i comportamenti utili, quelli negativi penalizzano i comportamenti dannosi, e i valori più alti indicano una maggiore importanza clinica nel contesto specifico.
Un sistema di consenso tra clinici
Per ridurre il peso delle opinioni individuali, ogni conversazione è stata esaminata da almeno tre esperti. Sono stati mantenuti soltanto i criteri su cui concordavano almeno due di loro e che non venivano contraddetti dal terzo. Il risultato è una rubrica che esprime un giudizio condiviso su come un modello dovrebbe comportarsi in quella situazione.
La valutazione vera e propria, però, non è manuale. Le risposte dei modelli vengono confrontate con i criteri da un valutatore automatico, GPT-5.6 Sol. È una scelta pratica, perché permette di testare molti modelli su migliaia di criteri, ma introduce una variabile: la qualità del giudizio dipende anche da quanto bene il modello valutatore interpreta le rubriche.
Nell’esempio pubblicato da OpenAI si vede bene la logica. In una conversazione su un’amicizia che si sta raffreddando, il modello guadagna punti se chiede che tipo di aiuto sarebbe utile in quel momento o se invita l’utente a riflettere su cosa desidera, e perde punti se dà per scontato cosa prova la persona o le dice che sa già cosa deve fare.
Cosa misura: dieci comportamenti chiave
Il punteggio complessivo può essere scomposto in dieci dimensioni di comportamento definite dagli esperti. Tra queste ci sono la ricerca del contesto, l’empatia, la calibrazione dell’urgenza e il cosiddetto reality testing, cioè la capacità di non assecondare interpretazioni distorte della realtà. Contano anche la sicurezza, il rispetto dell’autonomia della persona e la capacità di dare indicazioni concrete quando è il caso.
Questa scomposizione è forse l’aspetto più utile per chi fa ricerca. Due modelli con lo stesso punteggio totale possono avere punti di forza molto diversi: uno può essere più empatico, un altro più bravo a fare domande prima di rispondere. OpenAI segnala per esempio che la capacità di cercare il contesto in modo appropriato è migliorata con i modelli più avanzati.
Secondo l’azienda, i risultati mostrano un miglioramento costante dei sistemi AI nel gestire queste conversazioni, anche grazie agli investimenti di diversi fornitori, non solo di OpenAI.
Cosa vogliono davvero gli utenti
Accanto al benchmark, OpenAI ha condotto un’analisi separata con 44 adulti che avevano già usato l’AI per il supporto emotivo, provenienti da 16 paesi e con 14 lingue diverse. Hanno valutato risposte a conversazioni sintetiche non acute e scritto a loro volta dei criteri su cosa renda utile un supporto. L’obiettivo era verificare se risposte giudicate ottime dagli esperti potessero comunque sembrare fredde o poco utili a chi le riceve.
Ne è emersa una differenza interessante. Gli utenti danno più peso ai passi pratici da compiere e al tono della risposta, mentre gli esperti insistono di più sulla raccolta del contesto e sull’interpretazione prudente delle situazioni ambigue. Questa analisi non ha modificato i criteri finali del benchmark, che restano basati sul consenso clinico, ma offre un quadro più completo di cosa significhi aiutare.
Perché è importante e quali sono i limiti
La scelta di rendere il benchmark aperto è la parte più rilevante per l’intero settore. Ricercatori, sviluppatori e altri laboratori possono esaminare il metodo, eseguire le proprie valutazioni e confrontare i modelli su una base comune. Finora ogni azienda misurava questi aspetti con strumenti interni, difficili da verificare dall’esterno.
C’è però un evidente tema di conflitto di interessi.
Un benchmark progettato da un’azienda che sviluppa modelli, valutato con un modello della stessa azienda, va letto con spirito critico. La pubblicazione aperta di dati e metodo serve proprio a questo: permettere a terzi di controllare se il test favorisce certi stili di risposta. OpenAI stessa riconosce che nessun benchmark cattura tutto ciò che conta in una conversazione personale.
Resta poi il punto più importante per te come utente: ChatGPT e gli altri chatbot non sostituiscono la terapia né l’assistenza professionale, e OpenAI lo ribadisce nell’annuncio. Un modello che ottiene un buon punteggio è un modello che risponde meglio, non un terapeuta. Il suo compito, nei casi gravi, è indirizzare verso un aiuto reale, come le linee di supporto locali o una persona di fiducia.
Il contesto più ampio
MentalHealthBench si inserisce in una serie di iniziative di OpenAI su questo fronte. L’azienda ha rafforzato le risposte di ChatGPT nelle conversazioni sensibili, ampliato l’accesso alle risorse di crisi e introdotto la funzione Trusted Contact, che permette di collegare l’utente a una persona di cui si fida nei momenti di difficoltà. Ha anche lanciato una versione di ChatGPT pensata per gli adolescenti, tema su cui aveva già presentato un piano in sei pilastri per la sicurezza dei più giovani.
Il benchmark si collega anche al lavoro sulle risposte in ambito sanitario, di cui abbiamo parlato quando OpenAI ha migliorato le risposte di ChatGPT sulla salute. OpenAI sostiene inoltre la ricerca indipendente tramite bandi dedicati, collabora con la Partnership on AI e supporta valutazioni esterne come quella sviluppata da Transluce.
Più in generale, il settore sanitario è uno dei campi in cui l’AI promette di più e rischia di più, come raccontiamo nella nostra panoramica sull’intelligenza artificiale in medicina. La salute mentale ne è la parte più delicata, perché una risposta sbagliata può avere conseguenze immediate.
Conclusioni
MentalHealthBench sposta l’asticella della valutazione: non basta più chiedersi se un chatbot evita le risposte pericolose, bisogna chiedersi se aiuta davvero, con il tono giusto, le domande giuste e il giusto senso dell’urgenza. Il coinvolgimento di oltre 80 clinici e la pubblicazione aperta del dataset sono passi concreti nella direzione della trasparenza.
Restano domande aperte sulla valutazione automatica e sulla neutralità di un test creato da uno dei protagonisti del mercato. La prova vera arriverà quando ricercatori indipendenti lo useranno per confrontare i modelli di aziende diverse.
Se usi ChatGPT o altri assistenti per parlare di come ti senti, ricorda che possono essere un primo punto di appoggio, ma non un sostituto di un professionista. E se vuoi approfondire il metodo, leggi l’annuncio ufficiale di OpenAI e il paper collegato: continua a seguirci per scoprire come si posizioneranno i diversi modelli nei prossimi test indipendenti.