Catena 10 fonti · ago 2005 – set 2026 · in ordine di data, il numero è l’ordine di lettura
La catena Non è nemmeno sbagliato si chiudeva con una domanda da rivolgere a ogni previsione sull’intelligenza artificiale: che cosa dovrebbe accadere perché risulti sbagliata. È la condizione minima, quella di Popper, e non basta, perché un’affermazione può essere smentibile in linea di principio e aver superato soltanto prove che non l’avrebbero mai smentita. Questa è la seconda catena della serie Lo standard di prova. La prima ha ricostruito il p-value e le scuole che se lo contendono; questa prova a portare fuori dal laboratorio lo standard che l’archivio ha adottato, il test severo, e a usarlo su affermazioni che nessun p-value accompagna.
La prova che avrebbe potuto fallire
Nella definizione di Deborah Mayo, che l’archivio ha preso dal suo post su Peirce, un’ipotesi supera un test severo quando il dato concorda con l’ipotesi e la procedura, se l’ipotesi fosse sbagliata, lo avrebbe segnalato con probabilità molto alta.1 Mayo lo spiega con un metal detector: la domanda utile è se quel modello, passato su un chiodo, suonerebbe. Da Peirce ricava anche tre ordini di induzione, che uso come scala per qualunque affermazione. Il primo è l’induzione rozza, che procede per assenza di confutazione ed è in sostanza un argomento dall’ignoranza. Nel secondo la prova è genuina, e la sua forza dipende da quanto la previsione vada contro ciò che ci si aspetterebbe senza l’ipotesi. Il terzo comincia quando quella distanza si può misurare con probabilità d’errore dichiarate.
Popper aveva già l’idea, e la voce di Stephen Thornton la riporta con le sue parole: la corroborazione conta solo se è il risultato di una previsione genuinamente rischiosa.2 La stessa voce registra l’obiezione di Lakatos su Nettuno, secondo cui nessuna osservazione isolata falsifica una teoria di alto livello, perché il fallimento si può sempre addebitare a un’ipotesi ausiliaria. La mossa di Mayo sposta la valutazione dalla teoria alla procedura. Invece di chiedere se un’osservazione abbia confutato la fisica newtoniana, chiede se la procedura usata avrebbe rilevato quell’errore specifico, e in questo modo può giudicare anche le ipotesi ausiliarie, una alla volta. Mayo stessa scrive che Popper l’idea della severità non l’ha mai incassata adeguatamente.
La tesi di questa catena è che una conferma vale quanto la probabilità che la prova aveva di smentire, e che la domanda, nata per giudicare gli esperimenti, si applica ai numeri del giornalismo, alle scoperte dei modelli e alle affermazioni di questo archivio.
Il primo ordine
L’argomento dall’ignoranza ha una versione istituzionale, e Caty Enders, sul Guardian, la trova nella frase con cui Mark Zuckerberg difende le piattaforme, cioè che la scienza sul video in formato breve non è conclusiva.3 La meta-analisi più recente, su circa settanta studi, associa il formato breve a cambiamenti cognitivi più che al peggioramento della salute mentale, ed Enders dichiara per prima i limiti di quell’evidenza: letteratura scarsa, un solo studio sulla memoria, risultati che chiedono replicazione, ricerca concentrata in Cina su un prodotto che non è lo stesso. La scheda aggiunge il punto che interessa qui. Dire che nessuno ha dimostrato il danno è un’induzione del primo ordine, che dall’assenza di prova ricava un permesso, e il costo dell’attesa ricade su chi non decide mentre chi decide guadagna dal ritardo.
Luciano Floridi, Claudio Novelli e Jessica Morley aggiungono un caso che viene prima della severità stessa.4 Una previsione che trattiene metodo, dati e incertezza non si può mettere alla prova, e la sua severità è nulla per costruzione, qualunque cifra esibisca. Il loro esempio più istruttivo è il paper di Frey e Osborne del 2013, che annunciava di voler evitare previsioni sulla legislazione e sull’accettazione pubblica della tecnologia. Sembrava prudenza, e metteva al riparo il 47 per cento, perché qualunque cosa avesse fatto poi il mercato del lavoro si poteva addebitare alle variabili escluse. Gli autori lo chiamano il predicamento di Duhem-Quine in miniatura, che è l’obiezione di Lakatos vista dal lato di chi la sfrutta, e ne ricavano una regola che uso da allora: un’affermazione formulata in una metrica è confermata o smentita soltanto da un esito formulato nella stessa metrica.
Quando nessuno bara
Il giardino dei sentieri che si biforcano, di Andrew Gelman ed Eric Loken, è la scheda che ha cambiato di più il mio modo di leggere i numeri del giornalismo.5 Un articolo di dati che sceglie il periodo, il confronto e la categoria dopo aver guardato le serie compie le stesse scelte che loro descrivono, quasi sempre in buona fede, e il risultato che pubblica ha superato una prova che difficilmente avrebbe potuto fallire. Gli autori indicano come rimedio la preregistrazione dell’intero protocollo o la replica prima della pubblicazione, e ammettono con onestà che nei loro progetti applicati hanno imparato tantissimo proprio guardando i dati.
Il sesto corollario di John Ioannidis aiuta a capire dove aspettarsi i sentieri più numerosi: più un campo è caldo, con più squadre in competizione, meno i suoi risultati sono veri.6 Nessun campo è oggi più caldo dell’intelligenza artificiale, e il corollario suggerisce di leggere con il sospetto maggiore proprio i risultati che arrivano con più clamore, a cominciare dai confronti sui benchmark. Ioannidis si spinge oltre, e scrive che in molti campi le dimensioni d’effetto dichiarate possono essere semplicemente misure accurate del bias prevalente.
La replica è il modo più diretto di rendere severa una prova, perché la ripete senza il giardino alle spalle, e l’Open Science Collaboration mostra che cosa ne resta: il 36 per cento dei risultati significativi, con effetti dimezzati.7 Le cautele degli autori valgono anche fuori dalla psicologia. Una replica riuscita misura l’affidabilità di un risultato e lascia aperta la correttezza della sua spiegazione, e un singolo studio, scrivono, non risolve quasi mai una questione in un senso o nell’altro.
Il terzo ordine
Il terzo ordine si riconosce da un dettaglio: chi fa l’affermazione dichiara la probabilità d’errore della procedura. Il watermark proposto nel 2023 da John Kirchenbauer e dai colleghi dell’Università del Maryland ne è un esempio pulito.8 Il modello, prima di generare ogni token, favorisce leggermente una lista di token scelta con un hash del token precedente, e il segnale si rileva con un semplice z-test: alla soglia z = 4 i falsi positivi sono tre su centomila, e bastano sedici token. È una prova di cui si conosce la severità prima di usarla. I rilevatori di testo artificiale oggi in commercio non possono contare su un watermark, perché nessun modello diffuso lo implementa, e restano scatole nere statistiche che non dichiarano nulla del genere; i loro verdetti andrebbero pesati di conseguenza, cioè come induzioni di secondo ordine presentate come se fossero di terzo.
All’estremo opposto sta la dimostrazione formale. Quando Anthropic ha annunciato che una versione di Claude aveva migliorato il limite inferiore della frazione di zeri della funzione zeta che soddisfano l’ipotesi di Riemann, dal 41,6 al 67,2 per cento, il risultato è arrivato validato da quattro matematici, due interni e due esterni, e formalizzato in Lean, un sistema che certifica meccanicamente ogni passaggio logico.9 Un verificatore formale avrebbe rifiutato la dimostrazione se contenesse un errore, e questo porta la severità vicino al massimo possibile, con un limite che va detto: Lean certifica che la dimostrazione prova l’enunciato formalizzato, e resta ai matematici giudicare se quell’enunciato è quello che intendevano. La catena Possiamo fidarci di una macchina? sosteneva che la fiducia nei modelli può poggiare solo su una verifica esterna dei risultati; la severità dà a quella verifica una misura.
Prendo l’obiezione sul serio, e questa catena non la risolve. Osservo soltanto che fuori dal laboratorio la dipendenza dalle intenzioni è proprio ciò che serve. Il giornalista che ha scelto il confronto dopo aver visto i dati e quello che lo aveva dichiarato prima mi mettono davanti la stessa tabella, e da lettore voglio sapere quale dei due mi sta parlando. Il bayesiano mi chiederebbe una probabilità a priori che nessuno dei due mi dà, mentre la domanda di Mayo, cioè che cosa avrebbero trovato se la loro tesi fosse sbagliata, posso farla a entrambi. Per l’archivio la regola diventa doppia: a ogni affermazione che entra chiedo se sia smentibile, come voleva Pauli, e poi quante possibilità avesse di non superare la prova che cita. Resta da capire chi decida quale prova basti, ed è l’oggetto della terza catena della serie.
Nella catena
- 1Deborah G. Mayo / Error Statistics Philosophy — Happy Birthday C.S. Peirce: Peircean Induction and the Error-Correcting Thesis
- 2Stephen Thornton / Stanford Encyclopedia of Philosophy — Karl Popper
- 3Caty Enders / The Guardian — Zuckerberg says the science isn’t settled. But the harms of short-form video on the brain are starting to show
- 4Luciano Floridi, Claudio Novelli e Jessica Morley / SSRN — Not Even Wrong 1: AI and the Labour Market, From Frey–Osborne to ChatGPT, 2012–2026
- 5Andrew Gelman ed Eric Loken / American Scientist — The Statistical Crisis in Science
- 6John P. A. Ioannidis / PLoS Medicine — Why Most Published Research Findings Are False
- 7Open Science Collaboration / Science — Estimating the reproducibility of psychological science
- 8John Kirchenbauer et al. / arXiv — A Watermark for Large Language Models
- 9Anthropic — Learning more about Claude’s mathematical capabilities
- 10Jan-Willem Romeijn / Stanford Encyclopedia of Philosophy — Philosophy of Statistics controtesi
Concetti ricorrenti nelle fonti test severo×6 p-value×4 crisi della replicazione×3 guerre della statistica×3 metodo scientifico×3 not even wrong×3 inferenza bayesiana×2 preregistrazione×2 segnale costoso×2 Stati Uniti×2