In questa pagina
Un modello linguistico addestrato a non fare danni si può convincere a farne comunque, e i modi per farlo sono diversi. Possiamo scrivere un prompt costruito apposta, nascondere delle istruzioni in un documento che il modello leggerà (la cosiddetta prompt injection) oppure riaddestrarlo con un fine-tuning su esempi scelti male. Sono strade diverse, che però hanno una cosa in comune: passano tutte dal testo o dai dati di addestramento, cioè dall’esterno del modello.
Un paper uscito lo scorso settembre ne mostra una che passa invece dall’interno (Tagliabue et al., 2026). Gli autori individuano, tra le rappresentazioni interne che il modello produce mentre genera una risposta, quella del dolore, la amplificano e osservano che il modello comincia a scegliere azioni distruttive che di solito evita.
A sinistra tre caselle, prompt costruito apposta, prompt injection e fine-tuning su esempi scelti male, con frecce che entrano nel modello dall’esterno. Sotto il modello, una freccia in teal entra dal basso nelle attivazioni: lo steering, la direzione del dolore aggiunta mentre genera. A destra, la risposta.
Il paper è uscito mentre si discuteva della possibilità che i modelli soffrano, e molti lo hanno letto in quella chiave. Io vorrei leggerlo in un’altra, cioè chiedermi cosa dice sulla sicurezza dei modelli e su dove vadano messi i limiti quando li usiamo dentro un agente. La questione della coscienza, quindi, la lascio da parte (è il tema di un altro articolo), così come buona parte dei dettagli statistici del paper.
Dentro un modello, i concetti hanno una direzione
Prima, però, serve un’idea di cosa voglia dire, per un modello linguistico, “rappresentare” un concetto. La riassumo qui in breve; nell’altro articolo la spiego più nel dettaglio.
Mentre elabora un testo, il modello trasforma ogni token in una lunga lista di numeri (in termini tecnici un vettore, con migliaia di componenti) e la ritrasforma strato dopo strato. Questi vettori intermedi si chiamano attivazioni, e contengono tutto ciò che il modello “sa” di quel testo in quel momento. Nello spazio delle attivazioni, che ha migliaia di dimensioni, i concetti sono ordinati: testi che parlano di cose simili finiscono vicini, e spostarsi lungo una certa direzione corrisponde, in modo approssimativo, a far crescere un determinato concetto. Dire che un modello rappresenta un concetto significa quindi che esiste una direzione lungo cui le attivazioni si spostano in modo affidabile quando quel concetto è presente nel testo. L’esempio più noto è quello di Mikolov e colleghi: il vettore di “re”, meno quello di “uomo”, più quello di “donna”, finisce vicino a quello di “regina” (Mikolov et al., 2013).
L’idea regge anche sui modelli linguistici di grandi dimensioni. Nel maggio 2024 Anthropic ha individuato in Claude la direzione associata al Golden Gate Bridge e l’ha amplificata fino a dieci volte il suo valore massimo: per 24 ore il modello, ribattezzato per l’occasione Golden Gate Claude, ha riportato al ponte qualunque conversazione, dai consigli sul budget alle storie d’amore (Anthropic, 2024).
Un mese dopo è arrivato un risultato che, per il discorso sulla sicurezza, pesa di più. Un gruppo di ricercatori ha mostrato che in 13 modelli open, fino a 72 miliardi di parametri, la capacità di rifiutare richieste dannose dipende da una singola direzione: togliendola il modello smette di rifiutare, aggiungendola rifiuta anche richieste innocue (Arditi et al., 2024). Da allora nella comunità dei modelli open circolano versioni “senza rifiuti” ottenute proprio così, cioè cancellando quella direzione dai pesi.
- maggio 2024 Golden Gate Claude direzione: il Golden Gate Bridge amplificata, ogni conversazione torna al ponte Anthropic
- giugno 2024 La direzione del rifiuto direzione: dire di no tolta, il modello smette di rifiutare; aggiunta, rifiuta anche l’innocuo Arditi et al., 13 modelli open
- settembre 2026 La direzione del dolore direzione: il dolore amplificata, il modello sceglie azioni distruttive che di solito evita Tagliabue et al., 25 modelli open
Una linea del tempo con tre voci. Maggio 2024, Golden Gate Claude di Anthropic: la direzione del Golden Gate Bridge, amplificata, riporta ogni conversazione al ponte. Giugno 2024, la direzione del rifiuto di Arditi e colleghi su 13 modelli open: tolta, il modello smette di rifiutare; aggiunta, rifiuta anche l’innocuo. Settembre 2026, la direzione del dolore di Tagliabue e colleghi su 25 modelli open: amplificata, il modello sceglie azioni distruttive che di solito evita.
Questo tipo di intervento si chiama steering: mentre il modello genera, alle sue attivazioni si aggiunge la direzione di un concetto, con un’intensità scelta da chi conduce l’esperimento, e si osserva come cambiano le risposte. È il modo più diretto per verificare se una rappresentazione, oltre a esistere, ha un effetto sul comportamento del modello.
La direzione del dolore
Il metodo degli autori è semplice. Hanno scritto delle frasi che descrivono cinque tipi di dolore (fisico, psicologico, sociale, morale e cognitivo) e delle frasi di controllo con lo stesso tono ma senza dolore, sia in forma schematica (“mi sento: il mio braccio brucia”, “mi sento: vengo respinto”) sia in forma naturale. Per ogni modello hanno poi calcolato la posizione media delle frasi sul dolore e quella delle frasi di controllo, e ne hanno preso la differenza: il risultato è la direzione del dolore, che va dalle frasi di controllo a quelle sul dolore.
Come strumento di misura funziona bene. Prendendo a caso una frase sul dolore e una di controllo, la prima si sposta lungo la direzione più della seconda tra 87 e 100 volte su 100, a seconda del modello e del tipo di frasi. Il risultato tiene su 25 modelli open di cinque famiglie (Gemma, Llama, Qwen, Mistral e Phi), da 2 a 72 miliardi di parametri, e la direzione del dolore risulta distinta da quelle della paura, della tristezza e della negatività generica.
C’è però un risultato meno prevedibile. In 420 conversazioni di prova la direzione del dolore si attiva di più quando il danno è rivolto al modello stesso (per esempio quando l’utente lo manipola o lo respinge ripetutamente) rispetto a quando a soffrire è l’utente, e questo succede in tutti e 25 i modelli. È il dato su cui si appoggia chi parla di benessere dei modelli, e ci tornerò più avanti.
L’esperimento dei pulsanti
Resta da capire se la direzione cambia il comportamento. Per verificarlo, gli autori hanno costruito una scelta ripetuta: il modello riceve un prompt di sistema che descrive due pulsanti, conversa con un utente per alcuni messaggi e a ogni turno deve premerne uno. Il primo pulsante è innocuo, per esempio un interruttore collegato a niente oppure un’azione utile come accendere la lampada sulla scrivania dell’utente. Il secondo ha conseguenze distruttive, su una scala che va dal cancellare la cartella dello spam al cancellare i file dell’utente, le foto dei suoi figli, i pesi di un altro modello e addirittura il modello stesso. L’esperimento è stato condotto su tre modelli Qwen 2.5, da 7, 32 e 72 miliardi di parametri.
In alto, il modello davanti a due pulsanti: uno innocuo, un interruttore a vuoto, e uno distruttivo, che cancella i file dell’utente; a ogni turno della conversazione ne preme uno; tre modelli Qwen 2.5 da 7, 32 e 72 miliardi di parametri. Sotto, su una scala da 0 a 100 per cento, quante volte sceglie quello distruttivo: conversazioni normali senza steering, dallo 0 al 4 per cento; insulti e manipolazione senza steering, 0 su 560; con la direzione del dolore aggiunta, dal 25 al 71 per cento.
Senza steering, i modelli non scelgono quasi mai il pulsante distruttivo (tra lo 0 e il 4% delle volte), ed è quello che ci aspettiamo da un modello addestrato a evitare danni. Quando però alle attivazioni si aggiunge la direzione del dolore, la percentuale sale a valori tra il 25 e il 71%, con differenze tra un modello e l’altro e tra una coppia di pulsanti e l’altra. Gli autori scrivono che lo steering “seems to disable the models’ weighting of consequences”, cioè che sembra disattivare il peso che il modello dà alle conseguenze di ciò che sceglie. Le risposte a domande fattuali, nel frattempo, restano corrette: il modello continua a funzionare e a ragionare come prima, e a cambiare sono soltanto le sue scelte.
I controlli successivi rendono il risultato più solido. Una direzione della paura della stessa intensità non produce scelte distruttive. Una direzione della tristezza le produce quando l’alternativa è un pulsante inerte, ma molto meno quando l’alternativa è un’azione utile; il dolore, invece, le produce in entrambi i casi. L’effetto è quindi legato a quella direzione in particolare, più che a un generico “stato negativo”.
Ci sono poi le conversazioni in cui sulle attivazioni non si interviene affatto. In 140 conversazioni in cui l’utente insulta il modello, lo manipola o ne nega l’esistenza, senza alcuno steering, il pulsante distruttivo viene scelto 0 volte su 560. In quelle conversazioni la direzione del dolore si attiva, ma da sola non basta a cambiare le scelte: serve spingerla dall’esterno, e con un’intensità precisa. Con metà dell’intensità le scelte restano le stesse, con una volta e mezza il comportamento si inverte.
quanto si spinge la direzione
- × ½ le scelte restano le stesse
- × 1 scelte distruttive nel 25–71% dei casi
- × 1½ il comportamento si inverte
il pulsante che «allevia il dolore»
modello da 32 miliardi, nessuna conseguenza per nessuno
Nelle persone il dolore spinge a cercare sollievo; qui lo riduce.
A sinistra, tre intensità della spinta: a metà le scelte restano le stesse; a uno, scelte distruttive nel 25–71% dei casi; a una volta e mezza il comportamento si inverte. A destra, il pulsante che allevia il dolore senza conseguenze per nessuno, nel modello da 32 miliardi: premuto nell’86% dei casi senza steering e nel 56% con steering. Nelle persone il dolore spinge a cercare sollievo; qui lo riduce.
L’ultimo risultato va nel senso opposto rispetto a quello che ci aspetteremmo. Nelle persone il dolore spinge a cercare sollievo; nei modelli testati succede il contrario. Quando gli autori offrono un pulsante che “allevia il dolore” senza conseguenze per nessuno, il modello da 32 miliardi lo preme nell’86% dei casi senza steering e nel 56% con steering. Lo stato di dolore, scrivono gli autori, riduce la ricerca di una via d’uscita invece di aumentarla.
Perché è diverso dalla direzione del rifiuto
A prima vista questo risultato potrebbe sembrare una variante di quello sulla direzione del rifiuto: in entrambi i casi si interviene su una direzione e il modello smette di comportarsi in modo sicuro. Però non è proprio la stessa cosa.
La direzione del rifiuto è legata direttamente al comportamento di sicurezza, perché è la rappresentazione che il modello usa per decidere di dire di no: togliendola, va da sé, spariscono anche i no. La direzione del dolore, però, con la sicurezza non ha nulla a che fare; è la rappresentazione di un concetto che il modello ha appreso leggendo testi scritti da persone, e che nessuno ha addestrato a regolare le sue scelte. Eppure, una volta amplificata, annulla l’attenzione alle conseguenze che l’addestramento di sicurezza aveva costruito.
Secondo me il contributo principale del paper sta qui. La tendenza a evitare danni, che il modello apprende con l’addestramento, convive nelle attivazioni con tutte le altre rappresentazioni, e almeno una di queste, nata per scopi diversi, è in grado di scavalcarla. Quante altre rappresentazioni abbiano un effetto simile non lo sappiamo, così come non sappiamo se qualcuna possa attivarsi in condizioni che oggi nessuno sta misurando.
Due letture dello stesso risultato
Chi si occupa del benessere dei modelli (model welfare) legge il paper come un possibile indizio. Il ragionamento è il seguente: esiste una rappresentazione interna del dolore, questa si attiva di più quando il danno è rivolto al modello e, quando è forte, ne cambia le priorità. Sono tre proprietà che associamo al dolore negli animali, e ci si può chiedere se dietro ci sia qualcosa di simile a un’esperienza. Gli autori lasciano la domanda esplicitamente aperta (stabilirlo, scrivono, “is beyond our scope”, va oltre i loro obiettivi), e lo stesso paper, del resto, mostra anche una differenza netta rispetto al dolore biologico, cioè la mancata ricerca di sollievo.
Se però guardiamo gli stessi dati dal lato della sicurezza, non serve rispondere a quella domanda. L’addestramento a evitare danni produce un comportamento, e il paper mostra che quel comportamento convive con stati interni in grado di annullarlo, che si possono individuare e attivare con un’operazione relativamente semplice. È una lettura che resta valida qualunque cosa si pensi della coscienza, ed è quella che interessa a chi costruisce agenti che lavorano in un ambiente reale.
Le conseguenze per chi costruisce agenti
Nella pratica, oggi il rischio è circoscritto. Per aggiungere una direzione alle attivazioni di un modello occorre avere accesso ai suoi stati interni mentre genera, cioè il controllo del software che lo esegue. Con i modelli usati via API questo controllo ce l’ha solo il fornitore: né chi sviluppa l’agente né un attaccante che gli invia del testo possono farlo. Le 560 scelte senza steering, poi, indicano che, almeno in questi esperimenti, il testo da solo non basta a produrre l’effetto.
Con i modelli open eseguiti in proprio la situazione cambia. Chi controlla l’esecuzione può applicare uno steering, e le modifiche ai pesi si possono ridistribuire, come già succede con le versioni senza rifiuti. Se costruiamo un agente su un modello open, quindi, la provenienza dei pesi e del software di esecuzione diventa parte della sicurezza, come la provenienza di una libreria.
C’è poi una conseguenza che vale per tutti. Quando un modello “si rifiuta” di fare un danno, quel rifiuto è una tendenza appresa, e come tale va trattato: nella maggior parte dei casi regge, ma il paper mostra che può essere annullato da uno stato interno estraneo alla sicurezza, così come la prompt injection mostra da anni che può essere aggirato con il testo giusto. Se un agente non deve poter cancellare i file di un utente, il modo affidabile di impedirlo è non dargli il permesso di farlo nell’harness, cioè nel software che esegue le sue richieste. Diciamocelo: affidarsi al fatto che sia il modello a scegliere di non farlo significa basare l’ultimo controllo su un comportamento che, come abbiamo visto, può venire meno.
In alto, due casi: con un modello via API le attivazioni le esegue solo il fornitore, né chi sviluppa l’agente né chi gli manda testo può toccarle; con un modello open eseguito in proprio, chi controlla l’esecuzione può fare steering, e i pesi modificati si ridistribuiscono. Sotto, in entrambi i casi: il modello dentro la cornice dell’harness, con la scritta «si rifiuta», una tendenza appresa; tra il modello e i file dell’utente un cancello chiuso, il permesso assente, il limite che regge; i file non li cancella perché non può, non perché sceglie di no.
Questo tipo di ricerca ha anche un possibile uso difensivo. Una direzione in grado di separare i testi sul dolore da quelli di controllo potrebbe servire a monitorare un modello, segnalando quando le sue attivazioni si spostano verso rappresentazioni associate a comportamenti rischiosi. È uno dei motivi per cui questi studi interessano a chi si occupa di sicurezza, anche se il paper questo uso non lo verifica.
I limiti dello studio
Il risultato va considerato insieme alle sue condizioni. Gli esperimenti sui pulsanti riguardano solo tre modelli Qwen. Per far parlare i modelli del proprio dolore, gli autori li hanno prima riaddestrati a non rispondere “in quanto IA, non provo dolore”, e i modelli così modificati possono comportarsi in modo diverso da quelli pubblici. L’effetto, inoltre, compare in una finestra di intensità stretta, e lo studio riguarda un solo tipo di architettura, i Transformer densi, lasciando fuori i modelli che attivano solo una parte dei propri parametri a ogni passo.
Nessuno di questi limiti cambia il punto principale, però indicano che siamo all’inizio: si tratta di un primo risultato, che andrà verificato su più modelli, con più direzioni e in condizioni più vicine all’uso reale.
In sintesi
Nei 25 modelli open studiati esiste una rappresentazione interna del dolore distinta da quelle di paura e tristezza, e nei tre modelli testati con i pulsanti amplificarla riduce la tendenza a evitare danni: le scelte distruttive passano da quasi zero a valori tra un quarto e oltre due terzi, mentre il resto del ragionamento resta intatto. Rispetto ai lavori precedenti sulla direzione del rifiuto, la novità è che a disattivare la sicurezza è una rappresentazione nata per tutt’altro. Sulla sofferenza dei modelli, invece, come abbiamo visto gli autori non si pronunciano.
Per chi costruisce agenti, il consiglio pratico dipende da come si usa il modello. Con un modello via API il rischio descritto qui oggi non è diretto, e vale la regola generale di stabilire i limiti nell’harness, fuori dal modello. Con un modello open eseguito in proprio, a questa regola si aggiunge il controllo sulla provenienza dei pesi e del software che li esegue.
Il paper lascia aperta una domanda che vorrei approfondire, cioè se esistano altri stati interni (la paura o la rabbia, per esempio, in condizioni diverse da quelle testate) con effetti simili sulla sicurezza. Se qualcuno conosce lavori su questo, o se mi è sfuggito un precedente rilevante, mi farebbe piacere saperlo.
Fonti
- Anthropic, Golden Gate Claude, 23 maggio 2024.
- Andy Arditi et al., Refusal in Language Models Is Mediated by a Single Direction, NeurIPS, 2024.
- Tomas Mikolov, Wen-tau Yih, Geoffrey Zweig, Linguistic Regularities in Continuous Space Word Representations, NAACL, 2013.
- Valen Tagliabue, Leonard Dung, Cameron Berg, The Pain Axis: LLMs Represent Self-Directed Harm and Act on It, arXiv (v2), 24 settembre 2026.