Science 349, n. 6251, e-locator aac4716, del 28 agosto 2015, firmato Open Science Collaboration — 270 autori contribuenti coordinati da Brian Nosek. La versione pubblicata è depositata su OSF e in diversi repository universitari, quindi leggibile.
È il documento che trasforma un sospetto in una misura, e vale la pena riportare i numeri con la loro etichetta esatta, perché in circolazione se ne trovano tre o quattro scambiati fra loro. Dei 488 articoli usciti nel 2008 su tre riviste di psicologia, 158 sono diventati eleggibili, 111 sono stati scelti da una squadra, e 100 replicazioni sono state completate. Di qui: il 97 per cento degli studi originali aveva un risultato statisticamente significativo; il 36 per cento delle replicazioni ha prodotto un risultato significativo nella stessa direzione — ed è 35 su 97, non su 100, perché il denominatore sono gli originali che erano significativi; il 47 per cento delle dimensioni d’effetto originali cadeva dentro l’intervallo di confidenza al 95 per cento della replica, non dentro un intervallo di predizione come si legge spesso; il 39 per cento degli effetti è stato giudicato replicato — e il giudizio è quello soggettivo delle squadre di replicazione, non degli autori originali. Combinando meta-analiticamente originale e replica, e assumendo nessun bias nell’originale, resta significativo il 68 per cento.
Il dato che conta più delle percentuali è però la contrazione: «Gli effetti delle replicazioni erano metà della grandezza degli effetti originali, il che rappresenta un declino sostanziale» — da una media di 0,403 a una di 0,197. E gli autori danno la spiegazione strutturale che rende il risultato prevedibile invece che scandaloso: «Ci sono buone prove che la bassa potenza dei disegni di ricerca, combinata con il bias di pubblicazione che favorisce i risultati positivi su quelli negativi, produca una letteratura con dimensioni d’effetto gonfiate al rialzo. Questo fa prevedere che le dimensioni d’effetto delle replicazioni sarebbero più piccole di quelle degli studi originali di routine — non per differenze nell’implementazione, ma perché le dimensioni d’effetto degli studi originali sono affette dal bias di pubblicazione e di reporting, e le replicazioni no.»
Sulle cautele vale la pena essere fedeli, perché sono degli autori stessi e sono la parte che nessuna ripresa giornalistica ha riportato. «È troppo facile concludere che una replicazione riuscita significhi che la comprensione teorica del risultato originale è corretta»: una replicazione diretta dà prova della affidabilità di un risultato, non della sua spiegazione. E simmetricamente: «È anche troppo facile concludere che un fallimento di replicazione significhi che l’evidenza originale era un falso positivo. Le replicazioni possono fallire se la metodologia della replicazione differisce dall’originale in modi che interferiscono con l’osservazione dell’effetto.» La chiusa è la regola generale: «Un singolo studio non fornisce quasi mai una risoluzione definitiva a favore o contro un effetto e la sua spiegazione.»
Codice attribuito retroattivamente il 23 agosto 2026, all’introduzione della notazione: è una ricostruzione dichiarata, non una registrazione in presa diretta.