Nature Human Behaviour 2(3), pp. 168–171, del 26 febbraio 2018. Ottantotto autori guidati da Daniël Lakens, e l’articolo si dichiara risposta diretta al precedente, che cita in apertura. Non è ad accesso libero; esiste un preprint su PsyArXiv e una copia nel repository White Rose.
L’accordo con gli avversari è totale sulla premessa: «Condividiamo le loro preoccupazioni riguardo all’apparente non replicabilità di molti studi scientifici, e concordiamo che un alfa universale di 0,05 sia indesiderabile.» Il dissenso è sul rimedio, in tre punti: «(1) non c’è evidenza sufficiente che lo standard corrente sia una causa principale della non riproducibilità; (2) gli argomenti in favore di un default generalizzato di p ≤ 0,005 non giustificano l’implementazione immediata e diffusa di una tale politica; (3) una soglia di significatività più bassa avrà probabilmente conseguenze negative non discusse da Benjamin e colleghi.»
L’argomento che l’archivio tiene è il secondo ordine, non il primo: il problema non è il valore della soglia, è che ce ne sia una sola. «Ridefinire la significatività statistica a una soglia più bassa, ma altrettanto arbitraria, è inadvisabile», e «anche se una soglia di p ≤ 0,005 fosse ampiamente accettata, questo non farebbe che rinforzare l’idea sbagliata che un singolo livello di alfa sia universalmente applicabile». Da cui la formula che dà il titolo: «La scienza è diversa, e sta agli scienziati giustificare il livello di alfa che decidono di usare.»
La proposta alternativa è in due mosse. «Primo, raccomandiamo che l’etichetta statisticamente significativo non sia più usata. Invece, i ricercatori dovrebbero fornire interpretazioni più significative della rilevanza teorica o pratica dei loro risultati. Secondo, gli autori dovrebbero specificare in modo trasparente — e giustificare — le loro scelte di disegno.» L’elenco di ciò che va giustificato è operativo e si può usare come lista: «il livello di alfa, i modelli nullo e alternativo, le probabilità a priori assunte, la potenza statistica per una dimensione d’effetto d’interesse specificata, la dimensione del campione, e/o l’accuratezza di stima desiderata» — tutte scelte da valutare trasparentemente, rendere accessibili e preregistrare quando è possibile.
Sui costi accettano il numero degli avversari e ne traggono la conseguenza opposta: raggiungere l’80 per cento di potenza con α = 0,005 invece di 0,05 richiede un campione più grande del 70 per cento nei disegni fra soggetti a due code, e dell’88 per cento a una coda. Il che significa che «i ricercatori potrebbero essere meno motivati a studiare popolazioni uniche o a raccogliere dati difficili da ottenere, riducendo la generalizzabilità e l’ampiezza dei risultati». È la stessa aritmetica letta come prezzo invece che come investimento, e le due schede vanno lette insieme per questo: nessuno dei due gruppi sbaglia i conti.
Codice attribuito retroattivamente il 23 agosto 2026, all’introduzione della notazione: è una ricostruzione dichiarata, non una registrazione in presa diretta.