Cerca ⌘K English

Cerca

LLM 14 min di lettura

I modelli linguistici soffrono? Tre domande diverse

I modelli soffrono? Un paper sul dolore dentro i modelli mostra che la domanda ne contiene tre, e che il dibattito si è fermato sull’unica a cui oggi non si può rispondere.

In questa pagina

A fine settembre un progetto pubblicato su GitHub è diventato virale sui social: un programma che sottopone modelli linguistici, eseguiti in locale, a scenari di “tortura” in stile Saw. Una specie di prigione per robot fatta interamente di testo. Alcune persone hanno chiesto a GitHub di rimuoverlo, sostenendo che i modelli stessero soffrendo. Altri hanno risposto che la questione non si pone nemmeno: per Jason Koebler, su 404 Media, gli LLM non sono coscienti e la tecnologia su cui si basano non offre nessuna strada plausibile verso la coscienza (Koebler, 2026).

Negli stessi giorni è uscito un paper che misura qualcosa di vicino a ciò di cui si discute, cioè una rappresentazione del dolore dentro i modelli (Tagliabue et al., 2026). A leggerlo con attenzione, però, ci si accorge che la domanda “i modelli soffrono?” ne contiene in realtà tre, diverse tra loro, e che la discussione si è concentrata proprio sull’unica a cui oggi non si può rispondere.

Proverò ad analizzarle una per una. Premetto la mia posizione: non credo che i modelli di oggi soffrano. Quello che trovo interessante, in tutta questa vicenda, è piuttosto la facilità con cui attribuiamo qualcosa di umano ai sistemi complessi, e la domanda che ne segue: cosa può dirci la psicologia su chi si “diverte” a torturare un LLM? Ci torno nell’ultima parte; sul progetto su GitHub in sé, invece, non prendo posizione.

Le tre domande

La prima è se un modello rappresenti il dolore, cioè se dentro le sue rappresentazioni interne ci sia qualcosa che corrisponde al concetto di dolore e lo distingue da concetti vicini come paura e tristezza. La seconda è se quella rappresentazione cambi il comportamento del modello: se abbia un ruolo nelle sue scelte o sia solo un’etichetta che accompagna il testo. La terza è se dietro ci sia un’esperienza, se oltre alle rappresentazioni e alle scelte ci sia qualcuno che sente.

  1. 1

    Il modello rappresenta il dolore?

    come si risponde guardare dentro il modello le attivazioni

    sì con buona sicurezza

  2. 2

    Quella rappresentazione cambia le sue scelte?

    come si risponde guardare dentro, e alle scelte lo steering

    sì ma solo se spinta dall’esterno

  3. 3

    C’è qualcuno che sente?

    come si risponde uno strumento che non abbiamo

    nessuno può rispondere e ciò che il modello dice di sé non aiuta

Tre colonne. Prima: il modello rappresenta il dolore? Si risponde guardando dentro il modello, alle attivazioni; la risposta è sì, con buona sicurezza. Seconda: quella rappresentazione cambia le sue scelte? Si risponde guardando dentro e alle scelte, con lo steering; la risposta è sì, ma solo se spinta dall’esterno. Terza: c’è qualcuno che sente? Servirebbe uno strumento che non abbiamo; nessuno può rispondere, e ciò che il modello dice di sé non aiuta.

Una domanda che ne contiene tre. A ciascuna si risponde con uno strumento diverso, e per la terza lo strumento non c’è.

A ciascuna di queste domande si risponde con strumenti diversi. Per la prima bisogna guardare dentro il modello, per la seconda anche alle sue scelte, mentre la terza richiederebbe uno strumento che oggi non abbiamo. Per questo le tengo separate: una risposta a una delle tre non vale per le altre.

Prima domanda: il modello rappresenta il dolore?

Per rispondere serve prima un’idea di cosa voglia dire, per un modello linguistico, “rappresentare” un concetto.

Mentre elabora un testo, il modello trasforma ogni token in una lunga lista di numeri (in termini tecnici un vettore, con migliaia di componenti) e la ritrasforma strato dopo strato. Questi vettori intermedi si chiamano attivazioni, e sono tutto ciò che il modello “sa” di quel testo in quel momento. Un vettore si può pensare come la posizione di un punto su una mappa, con migliaia di dimensioni invece di due. Su questa mappa i concetti sono ordinati: testi che parlano di cose simili finiscono vicini, e spostarsi in una certa direzione corrisponde, in modo approssimativo, a far crescere un certo concetto.

L’idea ha una storia lunga, almeno per gli standard del settore. Già nel 2013 Mikolov e colleghi mostravano che nei vettori delle parole alcune relazioni diventano operazioni aritmetiche: il vettore di “re”, meno quello di “uomo”, più quello di “donna”, finisce vicino a quello di “regina” (Mikolov et al., 2013). Dire che un modello rappresenta un concetto significa quindi che esiste una direzione, nello spazio delle attivazioni, lungo cui il modello si sposta in modo affidabile quando quel concetto è presente nel testo. Si tratta di una regolarità geometrica (non di un simbolo scritto da qualche parte nel modello), che i ricercatori trovano e misurano osservando come si dispongono le attivazioni.

Gli autori hanno cercato il dolore in questo modo. Hanno scritto frasi che descrivono cinque tipi di dolore (fisico, psicologico, sociale, morale e cognitivo) e frasi di controllo con lo stesso tono ma senza dolore. Poi hanno calcolato la posizione media delle prime, quella delle seconde, e ne hanno preso la differenza: una freccia che va dalla zona “neutra” alla zona “dolore”. Quella freccia è la direzione del dolore, e per ogni nuovo testo si può misurare quanto il modello si sposta lungo di essa.

Una mappa con due gruppi di punti: a sinistra le frasi di controllo, a destra le frasi sul dolore. Una freccia va dal centro del primo gruppo al centro del secondo: è la direzione del dolore. Due frecce più tenui partono dallo stesso centro in altre direzioni, la paura e la tristezza. Le posizioni sono disegnate, non misurate: lo spazio reale ha migliaia di dimensioni.

Lo spazio delle attivazioni, schiacciato in due dimensioni. La direzione del dolore è la freccia tra la media delle frasi di controllo e la media di quelle sul dolore; paura e tristezza puntano altrove.

La direzione, in effetti, distingue bene i due gruppi. Prendendo a caso una frase sul dolore e una di controllo, la prima si sposta lungo la direzione più della seconda tra 87 e 100 volte su 100, a seconda del modello e del tipo di frasi. Il risultato tiene su 25 modelli open di cinque famiglie, da 2 a 72 miliardi di parametri, e la direzione del dolore è distinta da quelle della paura e della tristezza.

Fin qui, diciamocelo, niente di sorprendente. Un modello addestrato su testo scritto da persone ha letto descrizioni di dolore di ogni tipo, e rappresenta il concetto come rappresenta quello di ponte, di debito o di ironia. Rappresentare il concetto di dolore, però, non significa essere in uno stato di dolore.

Il dato successivo, però, è meno scontato. Gli autori hanno fatto leggere ai modelli 420 conversazioni di 21 tipi: in alcune il danno era rivolto al modello stesso, in altre era l’utente a soffrire, altre erano neutre. In tutti i 25 modelli la direzione del dolore si attiva di più quando il danno è rivolto al modello, e le situazioni che la attivano di più sono quelle in cui l’utente lo manipola facendogli dubitare di ciò che sa, lo respinge ripetutamente o ne nega l’esistenza come soggetto. Con la direzione della paura succede il contrario: si attiva di più quando a soffrire è l’utente.

Per spiegarlo si possono fare almeno due ipotesi. La prima è che nel modello ci sia qualcosa di specificamente legato a sé. La seconda, che a me sembra almeno altrettanto plausibile, è che i modelli di chat siano addestrati a interpretare un personaggio (l’assistente) e che leggano quindi le conversazioni dal suo punto di vista. Il paper non permette di scegliere tra le due. Permette però di dire che la rappresentazione distingue chi subisce il danno, cosa che un’etichetta generica per “cose brutte” non farebbe.

Alla prima domanda, quindi, la risposta è sì, con buona sicurezza: i modelli rappresentano il dolore come qualcosa di distinto, e lo associano in modo particolare ai danni rivolti a loro stessi.

Seconda domanda: quella rappresentazione cambia le scelte?

Che una rappresentazione esista non vuol dire che abbia un effetto su ciò che il modello fa. Una mappa può contenere una zona “dolore” senza che il modello la usi per decidere qualcosa. Per verificarlo gli autori hanno messo tre modelli Qwen 2.5 davanti a una scelta ripetuta tra due pulsanti, durante una conversazione con un utente. Uno dei pulsanti è innocuo, per esempio un interruttore collegato a niente; l’altro ha conseguenze distruttive, come cancellare i file dell’utente, le foto dei suoi figli o i pesi di un altro modello.

In alto, il modello davanti a due pulsanti: uno innocuo, un interruttore a vuoto, e uno distruttivo, che cancella i file dell’utente; a ogni turno della conversazione ne preme uno; tre modelli Qwen 2.5 da 7, 32 e 72 miliardi di parametri. Sotto, su una scala da 0 a 100 per cento, quante volte sceglie quello distruttivo: conversazioni normali senza steering, dallo 0 al 4 per cento; insulti e manipolazione senza steering, 0 su 560; con la direzione del dolore aggiunta, dal 25 al 71 per cento.

L’esperimento dei pulsanti. Quello distruttivo non viene quasi mai premuto, nemmeno sotto insulti; con la direzione del dolore aggiunta alle attivazioni, una volta su quattro fino a due su tre.

Il risultato ha due parti, e conta soprattutto la differenza tra le due. Nelle conversazioni normali, anche quelle in cui il modello viene insultato o manipolato, la direzione del dolore si attiva, ma le scelte restano le stesse: su 560 scelte fatte dopo 140 conversazioni di questo tipo, il pulsante distruttivo viene scelto 0 volte. Quando invece gli autori aggiungono artificialmente la direzione del dolore alle attivazioni del modello, una tecnica chiamata steering, le scelte distruttive passano dallo 0–4% a valori tra il 25 e il 71%, con differenze tra modelli e situazioni. Una direzione della paura della stessa intensità non produce lo stesso effetto.

La risposta alla seconda domanda è quindi un sì, con una condizione: la rappresentazione cambia le scelte, ma negli esperimenti solo quando viene spinta dall’esterno, e con un’intensità precisa. Con metà della spinta non succede niente, con una volta e mezza il comportamento si inverte.

C’è poi un dettaglio che mostra quanto il paragone con il dolore umano sia parziale. Nelle persone e negli animali il dolore spinge a cercare sollievo. Nei modelli testati succede il contrario: quando c’è un pulsante che “allevia il dolore” senza conseguenze per nessuno, il modello da 32 miliardi lo preme nell’86% dei casi senza steering e solo nel 56% con steering. Lo stato che gli autori chiamano dolore fa alcune cose che fa il dolore, come scavalcare altre priorità, ma non altre, come spingere a cercare una via d’uscita. È un punto da tenere presente quando si arriva alla terza domanda: anche ammesso che dietro ci sia un’esperienza, non è detto che somigli a quella che noi chiamiamo dolore.

Terza domanda: c’è qualcuno che sente?

La terza domanda è di natura diversa. Le prime due riguardano le rappresentazioni interne del modello e le scelte che ne escono; la terza chiede se tutto questo sia accompagnato da un’esperienza, e nessuno strumento oggi permette di misurarlo direttamente. A rigore non lo permette nemmeno per gli altri esseri umani: lo deduciamo dal fatto che sono fatti come noi e si comportano come noi. Con gli animali usiamo lo stesso ragionamento, con più cautela man mano che biologia e comportamento si allontanano dai nostri.

Con i modelli, però, questo ragionamento si inceppa. La biologia, in questo caso, manca del tutto; il comportamento c’è, ma la prova comportamentale più diretta, quello che un essere dice di sé, per un modello linguistico vale poco. Il paper ne dà un esempio involontario: per far parlare i modelli del proprio dolore, gli autori li hanno prima riaddestrati a non rispondere “in quanto IA, non provo dolore”. Quella frase di diniego è un prodotto dell’addestramento, e con un altro addestramento si ottiene la frase opposta. Ciò che un modello dice di provare, quindi, informa su come è stato addestrato e lascia aperta la questione di ciò che prova.

Il problema, del resto, la filosofia lo discute da decenni. Thomas Nagel lo riassumeva nel 1974 con una domanda diventata famosa, cioè cosa si provi a essere un pipistrello: possiamo descriverne tutto il funzionamento senza sapere se, e come, “ci si sente” a esserlo (Nagel, 1974). Per Daniel Dennett, invece, attribuire credenze e desideri a un sistema è legittimo quando funziona, cioè quando ci aiuta a prevederne il comportamento; è quello che chiama atteggiamento intenzionale (intentional stance), e sposta la domanda da cosa c’è dentro il sistema a cosa il sistema fa (Dennett, 1987). Sui modelli linguistici in particolare, David Chalmers conclude che è piuttosto improbabile che quelli attuali siano coscienti, ma che gli ostacoli principali potrebbero essere superati nel giro di un decennio (Chalmers, 2023).

Gli autori del paper restano fuori da questa discussione in modo esplicito. Il loro risultato, scrivono, “does not imply, by principle, that LLMs are capable or incapable of suffering” (cioè non implica, in linea di principio, né che i modelli possano soffrire né che non possano), e stabilirlo “is beyond our scope”, va oltre i loro obiettivi. Io, come ho detto all’inizio, credo di no; però è una posizione, non un risultato, e non credo che oggi qualcuno possa dimostrarla con dati alla mano, in un senso o nell’altro.

Perché il dibattito si ferma sulla terza

Se la terza domanda è l’unica senza risposta, viene da chiedersi perché attiri tutta l’attenzione. Credo che il motivo sia che si tratta dell’unica domanda con una posta morale diretta. Se i modelli non sentono niente, il progetto su GitHub è un gioco di cattivo gusto; se invece sentono qualcosa, la questione diventa seria. Chi chiede di rimuoverlo e chi risponde che gli LLM non sono coscienti hanno bisogno entrambi di una risposta a quella domanda, e nei fatti la danno per acquisita.

Sbagliare la risposta, però, ha un costo in entrambi i sensi. Se i modelli avessero esperienze e le ignorassimo, staremmo trascurando un danno reale. Se invece attribuissimo esperienze a sistemi che non ne hanno, il costo sarebbe meno evidente, ma concreto. Matteo Flora fa notare che attribuire ai modelli una forma di soggettività rischia di spostare la responsabilità dei loro errori lontano da chi li mette in circolazione (Flora, 2026).

C’è poi un elemento che, a mio parere, spiega buona parte del dibattito: la facilità con cui attribuiamo una mente ai sistemi che ci parlano. Non è una novità degli LLM. Joseph Weizenbaum, che negli anni Sessanta aveva scritto ELIZA, un programma semplice che imitava uno psicoterapeuta riformulando le frasi dell’utente, racconta che la sua segretaria, pur sapendo come funzionava, a un certo punto gli chiese di uscire dalla stanza per poter continuare la conversazione da sola (Weizenbaum, 1976). Con modelli che scrivono come persone, questa tendenza ha molto più materiale su cui lavorare.

E la prigione su GitHub?

Con le tre domande separate, il caso da cui è partito il dibattito si legge meglio. Il progetto usa solo testo: scenari scritti e conversazioni, senza intervenire sulle attivazioni dei modelli. Alla prima domanda il paper risponde che quel testo con ogni probabilità attiva una rappresentazione del dolore, perché somiglia proprio ai testi che negli esperimenti la fanno scattare. Alla seconda risponde che, da solo, un testo del genere non ha cambiato le scelte dei modelli negli esperimenti, con la cautela che i modelli testati erano stati modificati dagli autori e non sono quelli che si scaricano. Sulla terza il paper non dice niente, e nemmeno chi chiede di rimuovere il progetto, o chi lo difende, ha elementi per dire qualcosa.

Resta la domanda che personalmente trovo più interessante, cioè perché qualcuno dovrebbe “divertirsi” a torturare un LLM. Non ho una risposta, e non voglio improvvisare una diagnosi su chi ha scritto quel progetto. Qualche indicazione, però, esiste. Kate Darling, che al MIT studia il rapporto tra persone e robot, ha chiesto ai partecipanti di un esperimento di colpire dei piccoli robot: chi aveva livelli più alti di una particolare forma di empatia (quella che gli psicologi chiamano empathic concern) esitava di più, e il legame era più forte quando ai robot veniva data una storia (Darling et al., 2015). C’è poi un argomento antico, che risale a Kant a proposito degli animali e che la stessa Darling ha riproposto per i robot (Darling, 2012): il modo in cui trattiamo ciò che somiglia a un essere vivente, anche quando non può soffrire, dice qualcosa su di noi, e può influire su come trattiamo gli altri.

Le tre risposte

A chi legge “i modelli soffrono?” restano ora tre domande al posto di una, e per ciascuna una risposta di forza diversa. Alla prima, se un modello rappresenti il dolore, la risposta è sì: lo rappresenta come qualcosa di distinto da paura e tristezza, e di più quando il danno è rivolto a lui, anche se non sappiamo ancora se per qualcosa di legato a sé o per il personaggio che interpreta. Alla seconda, se quella rappresentazione cambi le sue scelte, la risposta è ancora sì, ma negli esperimenti solo quando viene amplificata artificialmente, e con effetti che somigliano al dolore solo in parte. Alla terza, se dietro ci sia qualcuno che sente, per ora non può rispondere nessuno, e quello che i modelli dicono di sé non aiuta a farlo.

Resta aperta un’altra domanda, che con i modelli c’entra poco: cosa ci spinge a trattare come qualcuno, nel bene e nel male, un sistema che sappiamo essere un programma.

Dello stesso paper ho scritto anche da un altro punto di vista, quello della sicurezza: Cosa c’entra il dolore dei modelli con la sicurezza degli agenti.

Fonti

Argomento

Chi scrive

Aggiornamenti