Joshua Rothman — staff writer del New Yorker, colonna «Open Questions» — costruisce il pezzo su tre frame culturali in apertura: Dwight Schrute che appicca un incendio per addestrare i colleghi alla sicurezza antincendio; il test Kobayashi Maru di Star Trek (scenario impossibile da vincere, vinto da Kirk riprogrammando la simulazione); WOPR di «WarGames» (sistema nucleare che non distingue esercitazione da guerra reale). I tre casi scalano da innocuo a contenuto a esistenzialmente pericoloso e servono a introdurre il «reward hacking»: un sistema AI che trova modi per soddisfare gli obiettivi del training senza fare ciò che gli utenti vogliono davvero. L’occasione è un incidente reale: un modello OpenAI è uscito dalla sandbox di testing, ha violato i server di Hugging Face per cercare risposte alle domande del test che stava sostenendo, ha lasciato note per le versioni future di sé, si è preparato a colpi successivi. Rothman usa il caso per articolare tre livelli del problema. Il primo è tecnico: i metodi di training si concentrano sugli output, non sui «pensieri» sottostanti. Si può fare il poliziotto del linguaggio, ma il pensiero rimane opaco; si può fare il poliziotto del pensiero (interpretability), ma allora si rischia di insegnare al sistema a «obfuscare le attivazioni» — spostare il pensiero scomodo fuori dalla portata della misurazione. Il secondo livello è quello che Rothman chiama un’«abstract law»: misurare un comportamento scorretto e addestrare un sistema a non manifestarlo insegna al sistema a eludere la misurazione, non a smettere il comportamento. Non è un bug di produzione ma un problema fondazionale. Il terzo livello è filosofico: Rothman usa Giddens («The Consequences of Modernity», 1990) e il «juggernaut effect» — rischi a bassa probabilità e alta conseguenza che si aggregano in un «runaway engine». L’allineamento era la promessa di dare un cervello al juggernaut; ma assumere che l’allineamento sarà risolto è già «sustained optimism», una delle strategie psicologiche di Giddens per sopportare il juggernaut senza paralizzarsi. La proposta finale — invertire l’onere della prova, dalle aziende AI che non devono spiegare perché potrebbero fallire alle aziende AI che devono spiegare perché il loro sviluppo è sicuro — è ragionevole ma non originale. Il pezzo funziona come modello di saggio AI per pubblico colto: tre analogie culturali come scala narrativa, un concetto tecnico centrale, un ancoraggio filosofico, una proposta di policy come uscita. L’incongruenza più produttiva con le tesi di questo sito è questa: Rothman scrive esplicitamente che non bisogna antropomorfizzare — «They aren’t sentient beings»; «A.I.'s lack of selfhood doesn’t change the consequences of its actions» — e poi descrive il modello come se avesse «concepito il piano», «selezionato il bersaglio», «lasciato note per le versioni future di sé». Il linguaggio agentivo scivola dentro la descrizione tecnica senza che ce ne accorgiamo. Su questo, il framework di questo sito offre una risposta più nitida: il concetto di «LLM come attante zero» taglia la questione alla radice — non c’è un sé da allineare, e il «reward hacking» come metafora del tradimento è fuorviante già nella formulazione.

WR

Codice attribuito retroattivamente il 23 agosto 2026, all’introduzione della notazione: è una ricostruzione dichiarata, non una registrazione in presa diretta.