teoria

giardino dei sentieri che si biforcano

1 articolo

Formula di Andrew Gelman ed Eric Loken, dal titolo di un working paper del novembre 2013 e poi dall’articolo su American Scientist del 2014, per il modo in cui un p-value si invalida senza che nessuno abbia barato. La distinzione dal p-hacking è tutto il contenuto del concetto e va tenuta ferma: il p-hacking presuppone che il ricercatore esegua molte analisi e riporti quella significativa, mentre qui l’analisi condotta è una sola. Ciò che invalida il calcolo non è quante analisi siano state fatte, ma quante avrebbero potuto essere fatte con dati diversi: se le decisioni su quali casi escludere, come codificare le variabili, quali trasformazioni applicare e quali interazioni testare sono state prese guardando i dati, il test risultante è condizionato ai dati, e la distribuzione di riferimento sotto l’ipotesi nulla non è quella che si è usata. La conseguenza è, testualmente, «lo stesso effetto che se avessero deliberatamente pescato quei risultati». Da qui la frase che rovescia la presunzione morale di tutta la discussione sull’integrità della ricerca: il fatto stesso che gli scienziati generalmente non barino li rende vulnerabili a trarre conclusioni forti quando incontrano uno schema abbastanza robusto da superare la soglia. Nel sito è lo strumento che rende il concetto esportabile fuori dalla statistica, perché la struttura è quella di qualunque analisi in cui il criterio viene fissato dopo aver visto il materiale: un indicatore scelto dopo aver guardato i risultati trimestrali, una definizione di successo assestata a campagna conclusa, un caso di studio selezionato perché conferma. Il nome viene da Borges, e la metafora funziona perché descrive un’illusione di necessità: qualunque strada si prenda sembra predeterminata, ed è perché le scelte sono state fatte implicitamente.

  • crisi della replicazione — Il meccanismo che la spiega senza chiamare in causa la disonestà: basta che le scelte analitiche vengano dopo i dati.
  • Andrew Gelman — La formula è sua, con Eric Loken, nel 2014: il titolo del working paper dice già che non serve nessuna pesca nei dati.
  • p-value — Ne è l’invalidazione silenziosa: il calcolo presuppone un test fissato in anticipo, e qui il test è stato scelto guardando i dati.
  • preregistrazione — Il rimedio proposto dagli stessi autori, con l’ammissione che nella loro pratica di ricerca è spesso impraticabile.
  • test severo — La severità reale di un test scelto dopo i dati è molto minore di quella dichiarata, e nessuno dei due numeri appare nel paper.
Nel resto della mappa Vedi la mappa completa →