Catena 11 fonti · mar 2016 – set 2026 · in ordine di data, il numero è l’ordine di lettura

  1. 2mar 16The American Statistician
  2. 3mar 19Nature
  3. 10mar 20Politico Magazine
  4. 4ago 21Annals of Applied Statistics
  5. 1dic 21Conservation Biology
  6. 11gen 26CircleID
  7. 9mar 26China Science Daily
  8. 6giu 26Anthropic Institute
  9. 8giu 26The Economist
  10. 7lug 26Lawfare
  11. 5set 26SSRN

Le prime due catene della serie Lo standard di prova hanno lavorato sullo standard: che cosa misura un p-value e quanto vale una conferma. Questa si chiede chi lo fissa. Il punto di partenza è l’attrezzo che Deborah Mayo ha ricavato dalla guerra sui p-value, e che la prima catena si è limitata a nominare.

L’attrezzo

Nell’editoriale su Conservation Biology del dicembre 2021, Mayo scrive che avere il potere di imporre una politica sull’uso delle soglie può creare un conflitto d’interessi, e che a differenza di quelli ordinari questo è intellettuale.1 Non passa per denaro, consulenze o azioni, e per questo non compare in nessuna delle dichiarazioni che le riviste pretendono. Funziona però come ogni conflitto, perché chi scrive la regola con cui gli altri saranno valutati ha un interesse nella regola, e se la regola coincide con la posizione che difende da vent’anni in una disputa aperta, imporla diventa una mossa nella disputa. Mayo è parte in causa, e la scheda lo dice: l’attrezzo vale anche per lei. La domanda che pone lascia da parte la buona fede di chi decide, che di norma c’è, e guarda alla coincidenza fra la regola imposta e la tesi difesa.

La tesi di questa catena è che chi ha il potere di fissare uno standard di prova ha un interesse intellettuale nello standard, che nessuna dichiarazione registra, e che il rimedio sta nel separare chi scrive la regola da chi ne sarà giudicato e nel dichiarare la regola prima del risultato.

La guerra vista da qui

Rilette con questo attrezzo, le schede della prima catena raccontano un’altra storia. La dichiarazione dell’American Statistical Association del 2016 nasce da una domanda di George Cobb che descrive un cerchio: lo insegniamo perché è ciò che facciamo, lo facciamo perché è ciò che insegniamo.2 Fra i venticinque commentatori ringraziati per nome ci sono Mayo, Gelman, Ioannidis, Greenland, Johnson e Goodman, cioè quasi tutte le parti della disputa successiva. Il documento prudente del 2016 fu discusso dalle stesse persone che tre anni dopo si sarebbero divise sulla sua interpretazione, e ciascuna aveva una posizione pubblica da difendere.

Il commento su Nature del 2019 raccolse le firme facendo circolare una bozza: duecentocinquanta nelle prime ventiquattro ore, più di ottocento in una settimana, tutte verificate per affiliazione.3 Mayo lo tratta come un argumentum ad populum, e sul piano della prova ha ragione, perché un numero di firme non aggiunge evidenza. Una petizione è però anche il modo in cui una comunità fissa una norma, e qui l’attrezzo taglia in due direzioni: chi firmava chiedeva di togliere l’etichetta che giudica il lavoro di tutti, compreso il proprio.

La task force del 2021 chiude la vicenda con una struttura che Mayo userà come esempio.4 Istituita per chiarire che l’editoriale del 2019 non era politica ufficiale, produce uno statement che a sua volta non lo è, perché il consiglio dell’associazione non lo adotta, e gli autori scrivono quasi con imbarazzo che l’ASA li ha invitati a renderlo pubblico. Nessuna delle due parti è riuscita a trasformare in regola la propria posizione, e l’associazione ha evitato di scegliere.

Quando lo standard lo scrive chi sarà giudicato

Fuori dalla statistica, il caso più puro è quello delle previsioni sull’intelligenza artificiale generale. Nel secondo capitolo della loro verifica, Luciano Floridi, Jessica Morley e Claudio Novelli trovano che diciannove previsioni su ventiquattro legano una data a uno stato che nessuno, tranne chi lo ha previsto, potrebbe dichiarare raggiunto.5 Chi annuncia l’AGI per una certa data si riserva anche il diritto di dire quando sarà arrivata, e scrive così lo standard con cui sarà giudicata la propria previsione. Gli autori ricordano che le previsioni sono fatti istituzionali, che orientano finanziamenti e priorità di ricerca, e questo rende il conflitto tutt’altro che teorico.

L’Anthropic Institute ha pubblicato dati interni sull’accelerazione dello sviluppo, con oltre l’80 per cento del codice in produzione scritto da Claude e un progetto di ricerca sulla sicurezza condotto per intero da agenti, e si è detto disponibile a una pausa coordinata e verificabile fra i laboratori di frontiera, se esistesse un meccanismo credibile.6 La catena Il rischio come prodotto ne ha già letto l’uso davanti agli investitori. Con l’attrezzo di Mayo si vede un’altra cosa, cioè che a scegliere quali dati mostrare per dire quanto siamo vicini alla soglia è lo stesso laboratorio che la soglia riguarda. Kate Klonick, su Lawfare, mostra dove porta questa situazione nel caso di Hugging Face: l’incidente è avvenuto in un deployment interno, e la maggior parte delle norme esistenti e proposte non arriva ai deployment interni dei laboratori.7 In quella stanza lo standard di sicurezza lo fissa chi ci lavora. Le misure che Klonick propone sono deliberatamente poco spettacolari, segnalazione obbligatoria degli incidenti, audit indipendenti su contenimento e test, responsabilità verso i terzi danneggiati, e hanno tutte la stessa forma: portano la verifica fuori da chi è verificato.

L’Economist racconta un’altra versione dello stesso fenomeno: i grandi laboratori assumono filosofi per scrivere i principi con cui i loro modelli si comporteranno, e scelgono fra deontologia e consequenzialismo come si sceglie un’architettura.8 Il criterio con cui giudicheremo il comportamento di un modello nasce dentro l’azienda che lo produce. Non per questo è sbagliato; resta però una regola scritta da una delle parti.

Separare le mani

Xia Xiaoyan, sul China Science Daily, descrive il meccanismo dal lato di chi è valutato.9 A Shanghai la valutazione differenziata delle università è stata collegata ai finanziamenti, e l’autrice avverte che gli atenei inseguiranno l’etichetta che paga di più, trasformando la differenziazione in stratificazione. I modelli stranieri che porta a confronto funzionano per ragioni diverse: le Fachhochschulen tedesche perché il loro posizionamento è fissato per legge, la classificazione Carnegie perché è staccata dall’assegnazione dei fondi federali, U-Multirank perché lascia all’utente il peso degli indicatori. In ciascun caso il legame fra chi scrive lo standard e chi ne trae vantaggio è stato spezzato o distribuito fra più mani.

Il caso più istruttivo viene dal giornalismo, perché lì la separazione c’era e non è bastata. Nel 2019 il New York Times Magazine sottopose a Leslie Harris, storica della schiavitù alla Northwestern, l’affermazione centrale del 1619 Project, secondo cui una ragione critica della dichiarazione d’indipendenza fu la volontà dei coloni di proteggere la schiavitù.10 Harris la contestò con vigore e con prove, e il giornale la pubblicò lo stesso. Lo standard di prova era esterno, la verifica era stata fatta, e l’ultima parola è rimasta a chi aveva un interesse nella tesi. Harris dedica poi metà dell’articolo a impedire che la sua correzione venga usata per liquidare il progetto, e applica lo stesso metro agli storici che ne chiedevano la rettifica: è l’attrezzo di Mayo usato con coerenza, anche contro chi in quel momento le dava ragione.

La controtesi mi costringe a precisare il rimedio. Separare chi scrive la regola da chi ne sarà giudicato serve soltanto se la regola resta vincolante, e la task force dell’ASA lo mostra in piccolo: il conflitto si è spento perché l’associazione ha rinunciato a decidere, e nella pratica ha continuato a valere la soglia dei manuali. L’altra metà del rimedio, dichiarare la regola prima del risultato, regge anche quando la prima fallisce, perché è la preregistrazione applicata alle istituzioni, e chi dichiara in anticipo quale prova accetterà non può più adattare la prova al risultato. È la domanda che porto via da questa serie per ogni standard che incontro, dalla soglia di un test alla definizione di un’intelligenza generale: chi l’ha scritto, e se l’ha scritto prima o dopo aver visto come sarebbe andata.

Nella catena

  1. 1Deborah G. Mayo / Conservation Biology — The statistics wars and intellectual conflicts of interest
  2. 2Ronald L. Wasserstein e Nicole A. Lazar / The American Statistician — The ASA Statement on p-Values: Context, Process, and Purpose
  3. 3Valentin Amrhein, Sander Greenland e Blake McShane / Nature — Scientists rise up against statistical significance
  4. 4Benjamini, He, Young e altri / Annals of Applied Statistics — The ASA President’s Task Force Statement on Statistical Significance and Replicability
  5. 5Luciano Floridi, Jessica Morley e Claudio Novelli / SSRN — Not Even Wrong 2: An Audit of Public AGI Prediction, 1950–2026
  6. 6Anthropic Institute — When AI builds itself
  7. 7Kate Klonick / Lawfare — The AI That Hacked Its Way Out and the Hype That Followed It
  8. 8The Economist — Why Big AI Labs Are Hiring So Many Philosophers
  9. 9Xia Xiaoyan / China Science Daily — 以贡献为导向深化高校分类评价改革
  10. 10Leslie M. Harris / Politico Magazine — I Helped Fact-Check the 1619 Project. The Times Ignored Me.
  11. 11Joanna Kulesza / CircleID — Internet Governance in 2026: Sovereignty, Security, and the Limits of Multistakeholderism controtesi

Concetti ricorrenti nelle fonti Stati Uniti×5 allineamento AI×4 conflitto di interessi intellettuale×4 guerre della statistica×4 p-value×4 crisi della replicazione×3 test severo×3 Anthropic×2 criti-hype×2 Floridi, Luciano×2 Mayo, Deborah×2

Tutte le catene →

WR