teoria

p-value

1 articolo

Il numero più frainteso della scienza contemporanea, e la voce esiste per questo. Definizione: il p-value è la probabilità, supposta vera l’ipotesi nulla, di osservare un risultato almeno tanto estremo quanto quello osservato. Introdotto nell’uso corrente da Ronald Fisher nel 1925, insieme alla soglia del 5% che proponeva come comoda e non come regola. Tre elementi di quella definizione fanno tutto il danno, e conviene smontarli uno per uno.

Primo, supposta vera l’ipotesi nulla. L’ipotesi sta nella condizione, non nella conclusione: il p-value non dice quanto è probabile che l’ipotesi nulla sia vera, e non può dirlo, perché è la probabilità dei dati dato H e non di H dati i dati. Confondere le due è la fallacia del condizionale trasposto, e si vede meglio con un esempio brutto: la probabilità che qualcuno sia morto, dato che è stato impiccato, è altissima; quella che sia stato impiccato, dato che è morto, è minima. Secondo, almeno tanto estremo: il calcolo include dati che non si sono osservati, perché somma una coda della distribuzione campionaria. È esattamente la proprietà che un bayesiano considera illegittima, perché viola il principio di verosimiglianza, ed esattamente quella che la statistica dell’errore considera indispensabile, perché è ciò che rende la probabilità d’errore una probabilità di qualcosa. Terzo, un risultato: che cosa conti come risultato dipende dal test che si è specificato, dunque il p-value dipende dal piano di campionamento e dalla regola d’arresto — ed è per questo che dichiarare l’ipotesi prima di guardare i dati non è una formalità.

Che cosa non è, in una lista che l’American Statistical Association ha dovuto pubblicare nel 2016 perché gli errori erano sistematici. Non è la probabilità che l’ipotesi nulla sia vera. Non è la probabilità che il risultato sia dovuto al caso. Non è la probabilità di replicare il risultato, e 1 meno p non lo è nemmeno. Non è una misura della dimensione o dell’importanza di un effetto: con un campione abbastanza grande un effetto irrilevante produce un p minuscolo, e con un campione piccolo un effetto grosso non lo produce. E soprattutto, un risultato non significativo non è una prova che l’effetto non ci sia — assenza di prova non è prova d’assenza, ed è l’errore con le conseguenze pratiche più gravi, perché chiude questioni aperte.

Il ruolo nella disputa è asimmetrico e va tenuto presente per leggere qualunque polemica in materia. Per la statistica dell’errore il p-value non è affatto una misura di evidenza: è uno strumento che dice quanto male la procedura si sarebbe comportata, e un p piccolo isolato non vale niente — Fisher stesso insisteva che serve un metodo affidabile per generarli, non un episodio. Per la tradizione bayesiana è invece un numero che risponde alla domanda sbagliata e viene letto come se rispondesse a quella giusta; l’obiezione ha anche una forma tecnica precisa, il paradosso di Lindley, per cui con dati abbastanza numerosi un risultato significativo al 5% può corrispondere a un’evidenza bayesiana forte in favore dell’ipotesi nulla. Le due cornici non divergono solo per accento: possono divergere di segno. A questo si aggiunge l’argomento che nel 2005 John Ioannidis rende celebre, ed è bayesiano nella struttura anche quando chi lo cita non lo sa: se in un campo le ipotesi plausibili sono poche e quelle testate molte, e se si pubblica solo ciò che risulta significativo, la maggior parte dei risultati significativi è falsa pur essendo ogni singolo p-value calcolato correttamente.

Uso pratico, che è la ragione per cui la voce sta in questo archivio e non in un manuale. Davanti a un p < 0,05 le domande sono quattro, in ordine: quale era l’ipotesi nulla, e se è stata dichiarata prima dei dati; quanti confronti sono stati esaminati per arrivare a quello riportato; quanto è grande l’effetto, con il suo intervallo, perché il p non lo dice; e se un risultato non significativo sia stato presentato come prova che non ci sia nulla. Una precisazione sull’alternativa che si propone più spesso: sostituire i p-value con gli intervalli di confidenza non aggira nessuna di queste obiezioni, perché un intervallo al 95% è l’insieme dei valori che non verrebbero rifiutati al 5% — è la stessa macchina scritta in un altro modo, e va bene per altre ragioni, non perché sfugga alla disputa.

  • guerre della statistica — È l’oggetto materiale della disputa: quasi tutto il conflitto si combatte su come debba essere letto questo numero.
  • inferenza bayesiana — L’obiezione di fondo: risponde a una domanda che nessuno ha posto, e viene letto come se rispondesse a quella posteriore.
  • segnale costoso — Una cifra a tre decimali sotto la soglia è un segnale quasi gratuito da produrre, e viene letta come se fosse costata.
  • statistica dell’errore — Qui non è una misura di evidenza ma il ponte fra i dati e la probabilità d’errore della procedura che li ha prodotti.
  • test severo — Un p piccolo da solo non dice nulla: dice qualcosa se la procedura che l’ha prodotto avrebbe potuto produrne uno grande.
Nel resto della mappa Vedi la mappa completa →