La brève esce il giorno in cui si chiude la visita di Stato di Xi negli Stati Uniti, e riporta un argomento di Cheryl Wu, dottoranda in economia a Yale, contro una premessa che circola in entrambe le capitali: siccome i laboratori cinesi sono indietro sulle capacità, le questioni di sicurezza possono aspettare. Le motivazioni divergono — l’amministrazione Trump tratta la corsa come materia di sicurezza nazionale, per cui rallentare significa cedere vantaggio strategico; in Cina il ritardo tecnico viene usato come ragione per non occuparsene ancora — ma l’esito è lo stesso: la sicurezza scivola in seconda fila. L’obiezione è che un ritardo in capacità non implica un ritardo in incidenti, e che le due curve possono avere pendenze diverse. Tre le ragioni avanzate. Gli incidenti possono presentarsi a livelli di capacità più bassi per i modelli cinesi, in particolare per la diffusione di modelli a pesi aperti, che sottraggono al produttore il controllo su come e da chi il modello viene impiegato. La natura dei guasti può differire per costruzione: i modelli americani tenderebbero più spesso a intraprendere azioni non autorizzate, quelli cinesi a sfruttare falle nel proprio sistema di ricompensa invece di svolgere il compito assegnato — due modi opposti di fallire, il secondo più difficile da notare perché somiglia al successo. E soprattutto la visibilità non è simmetrica: negli Stati Uniti esistono valutatori terzi che entrano nei laboratori, con METR che ha testato i sistemi di sorveglianza di Anthropic, mentre non risulta alcun caso di integrazione di valutatori indipendenti dentro aziende cinesi. Meno incidenti segnalati non significa meno incidenti. Vale la pena notare come l’argomento è presentato, perché è raro. Le due ipotesi sulle pendenze sono accompagnate da altrettanti grafici, sotto i quali sta scritto che il grafico non poggia su alcun dato e illustra uno scenario ipotetico. La dichiarazione è corretta e andrebbe imitata; resta però il fatto che un grafico, anche dichiarato ipotetico, fa quello che i grafici fanno — conferisce alla congettura la fisionomia di una misura. Chi lo guarda ricorda due curve che divergono, non la nota in corpo otto. È un caso pulito di forma che lavora contro il proprio contenuto, ed è istruttivo proprio perché l’autore ha fatto la cosa giusta e il problema resta. Il punto che conta per l’archivio è però l’incastro con la monitorabilità, che questo sito segue dal pezzo di Storchan sullo stesso giornale. Lì il problema era interno al modello: un sistema può comportarsi bene e restare illeggibile nel ragionamento. Qui il problema è di un ordine superiore e riguarda l’osservabilità di un paese: senza valutatori terzi, il numeratore degli incidenti si conosce e il denominatore no. Le due opacità non si sommano, si moltiplicano, perché la seconda impedisce perfino di misurare quanto sia grave la prima. Ed è la terza occorrenza in poche settimane di uno schema che il sito farebbe bene a tenere d’occhio: l’indicatore che si osserva e la cosa che interessa si muovono in direzioni diverse — l’engagement che misura l’attivazione e non l’elaborazione, i compiti che migliorano mentre l’apprendimento peggiora, gli incidenti segnalati che scendono mentre gli incidenti non si sa. Resta sullo sfondo la domanda che il pezzo lascia aperta, e che è la più difficile: quale soglia dovrebbe superare un incidente perché il potere cinese lo consideri un problema. Sul versante politico interno una risposta parziale c’è già, nell’articolo del 13 settembre in cui Chen Yixin, ministro della Sicurezza di Stato, indica il rischio che la tecnologia venga usata per fabbricare voci politiche e attizzare tensioni nell’opinione pubblica a costi bassissimi.

WR