Cosa c’entra il dolore dei modelli con la sicurezza degli agenti
Amplificando la rappresentazione interna del dolore, un modello addestrato a non fare danni comincia a farne. Cosa dice questo su dove mettere i limiti, dentro un agente.
12 min
2 articoli
Amplificando la rappresentazione interna del dolore, un modello addestrato a non fare danni comincia a farne. Cosa dice questo su dove mettere i limiti, dentro un agente.
12 min
Un modello, da solo, legge e scrive testo. Il grafico dalla chat e i test lanciati da un agente li fa il software intorno: cos’è, cosa decide, e perché da lì vengono i rischi.
12 min