American Scientist 102, n. 6, novembre–dicembre 2014, pp. 460–465, di Andrew Gelman ed Eric Loken, con il sottotitolo che porta la formula: «L’analisi dipendente dai dati — un giardino dei sentieri che si biforcano — spiega perché molti confronti statisticamente significativi non tengono.» Il PDF della versione pubblicata è liberamente disponibile sul sito di Gelman alla Columbia. Esiste anche un working paper precedente del 14 novembre 2013, non pubblicato, con il titolo lungo che dice tutto: The garden of forking paths: Why multiple comparisons can be a problem, even when there is no fishing expedition or p-hacking and the research hypothesis was posited ahead of time.
La distinzione che rende l’articolo importante, e che quasi tutti sbagliano, è che questo non è p-hacking. Il p-hacking e la pesca nei dati presuppongono che il ricercatore esegua molte analisi e riporti quella significativa. La tesi di Gelman e Loken è che il p-value pubblicato è invalidato anche quando ne viene eseguita una sola, perché ciò che conta non è quante analisi siano state fatte, ma quante avrebbero potuto essere fatte con dati diversi. Testualmente: «anche in contesti in cui una singola analisi è stata condotta sui dati dati, la questione dei confronti multipli emerge perché scelte diverse sul combinare variabili, sull’inclusione ed esclusione dei casi, sulle trasformazioni delle variabili, sui test di interazione in assenza di effetti principali, e molti altri passaggi dell’analisi, sarebbero potuti benissimo avvenire con dati diversi». In quel caso «i ricercatori devono eseguire un solo test, ma quel test è condizionato ai dati; dunque ha lo stesso effetto che se avessero deliberatamente pescato quei risultati».
Ne segue la frase che l’archivio userà altrove, perché rovescia la presunzione morale di tutta la discussione sull’integrità della ricerca: «Il fatto stesso che gli scienziati generalmente non barino, generalmente non vadano a pesca di significatività statistica, li rende vulnerabili al trarre conclusioni forti quando incontrano uno schema abbastanza robusto da superare la soglia di p < 0,05.» Non serve alcuna disonestà. Serve soltanto che le decisioni su esclusioni, codifiche, trasformazioni e interazioni siano state prese dopo aver visto i dati — e questo è il modo normale, ragionevole e onesto in cui si analizza un dataset. Da qui la metafora: «In questo giardino dei sentieri che si biforcano, qualunque strada si prenda sembra predeterminata, ma è perché le scelte sono state fatte implicitamente.»
Dove sta il problema vero lo dicono senza consolazioni: «La sfida difficile sta altrove: dato un particolare insieme di dati, può sembrare interamente appropriato guardare i dati e costruire regole ragionevoli di esclusione, codifica e analisi che portano alla significatività statistica.» La soluzione che indicano è la preregistrazione dell’intero protocollo, oppure la replica prima della pubblicazione — con un’ammissione che va riportata perché è onesta e li mette in difficoltà: «Per la maggior parte dei nostri progetti di ricerca questa strategia sembra difficilmente possibile: nei nostri molti progetti applicati abbiamo imparato tantissimo guardando i dati.»
Codice attribuito retroattivamente il 23 agosto 2026, all’introduzione della notazione: è una ricostruzione dichiarata, non una registrazione in presa diretta.