Clicca in qualsiasi punto o premi ESC per chiudere il video

n. 1 - 2025

Riflessioni di statistica: quanto è valido il concetto che p<0,05 rappresenti una significatività statistica?

Cosa indica il valore di p?

Il valore di p utilizzato quale strumento di lettura dei test statistici. Il termine valore di p (p-value) sta ad indicare il valore di probabilità, cioè la probabilità che quanto stiamo sostenendo sia corretto con un piccolo margine di errore. Quando confrontiamo due trattamenti (trattamento A e trattamento B o comunque due procedure), partiamo implicitamente dalla cosiddetta “ipotesi nulla” – non ci sono differenze tra i due trattamenti. L’“ipotesi alternativa” (ovvero, ci sono differenze tra i due trattamenti) può essere accettata se si rigetta l’“ipotesi nulla”.

La significatività statistica misura quanto è probabile che la differenza osservata tra i due trattamenti sia reale. Non vi può mai essere certezza assoluta perché c’è sempre un margine di errore che deve essere predeterminato.

Convenzionalmente, viene utilizzato come limite per considerare la significatività statistica, p<0,05 (margine di errore del 5%). Ciò significa che ci sono meno di 5 probabilità su 100 di affermare che il trattamento A sia più efficace del trattamento B quando invece non lo sia.

Se il valore di p è superiore alla soglia fissata (appunto la classica soglia del 5%, ossia 0,05), allora significa che non vi è differenza statistica tra due trattamenti messi a confronto (confermata l’ipotesi nulla), mentre se, al contrario, il valore di p è inferiore a 0,05 (p < 0,05), allora c’è differenza statisticamente significativa tra i due tipi di terapia (rigettata l’ipotesi nulla). 

Perché p<0,05 è considerata una significatività statistica?

Il cut-off di 0,05 è stato scelto convenzionalmente. Infatti, il valore di 0,05 nasceva nel 1926 quando Fischer scriveva – È conveniente tracciare una linea più o meno al livello della quale noi possiamo dire: “O c’è qualcosa nel trattamento, o si è verificata una coincidenza di quelle che non si verificano più di una volta ogni 20”.

Ma 30 anni dopo lo stesso Fischer scriveva: “Nessuno […] ha un valore fisso di significatività rispetto al quale rifiuta una ipotesi in ogni circostanza”.

Limiti del valore fisso 0,05: l’errore del vinco/perdo.

Purtroppo, la soglia “significativa” del valore di p è stata ed è considerata una barriera fissa:

  • Se è sotto 0,05, vinci
  • Se è sopra 0,05, perdi

Questa interpretazione è errata, sia dal punto di vista statistico che da un punto di vista clinico, ma si trova ancora riportata in editoriali di prestigiose riviste.

Due scenari riportati come esempio possono illustrare il motivo per cui una soglia del valore p non funziona nell’indicare una situazione vinco/perdo. Come mostrato nella figura 1, nello studio A che ha incluso n=87 partecipanti, il valore di p è 0,062 (rischio relativo 2,5; 95% CI 0,99-6,50) che perciò non raggiungere la soglia di p < 0,05 per la significatività statistica. Se vengono tuttavia aggiunti solo due partecipanti (n=89) come nello studio B e se il partecipante aggiunto esposto ha un evento, mentre l’altro partecipante non esposto non ha un evento, il valore di p è 0,037 (rischio relativo 2,7; 95% CI 1,1-7,0) perciò la differenza è statisticamente significativa. La differenza tra i due studi è veramente modesta e i rischi relativi sono simili, dimostrando che entrambi gli studi suggeriscono un’associazione simile tra esposizione ed evento. Perciò il risultato della p viene influenzato dall’adeguatezza del disegno dello studio e dalla qualità dei dati (1).

Figura 1

Studio A (pazienti = 87)

  Eventi totale
    Sì  No
Esposizione 13 (30%) 31 (70%) 44
No 5 (12%) 38 (88%) 43
totale 18 69 87

Studio B (pazienti = 89)

  Eventi totale
    Sì  No
Esposizione 14 (31%) 31 (69%) 45
No 5 (11%) 39 (89%) 44
totale 19 70 89

Quali parametri utilizzare?

Perciò, possiamo concludere dicendo che:

1) il valore di p non è una misura della veridicità della ipotesi in studio;

2) conclusioni scientifiche o decisioni politiche non devono essere basate sul solo valore di p al di sopra o al di sotto di una specifica soglia;

3) il valore di p non misura l’ampiezza di un effetto o l’importanza di un risultato; ed infine

4) al di fuori del contesto, un valore di p non è una buona misura di evidenza (2).

L’applicazione automatica di un test di ipotesi dicotomizzato, basato su un livello prestabilito di significatività statistica, dovrebbe essere sostituita da un processo più complesso, che utilizzi le stime di effetto (in termini relativi per esempio il rischio relativo, l’odds ratio o l’hazard ratio; in termini assoluti per esempio il rischio assoluto e l’NNT – il numero di pazienti da trattare per evitare un evento), e che evidenzi l’incertezza dell’effetto (intervallo di confidenza) ed, infine, gli stessi valori di p (3).

In tal modo clinici e statistici potrebbero utilizzare le proprie “capacità inferenziali” per assegnare un valore scientifico ed una significatività al risultato.

Per una corretta interpretazione di questo concetto, si riporta come esempio lo studio ELAN (Early versus Later Anticoagulation for Stroke with Atrial Fibrillation), un trial randomizzato e controllato che ha arruolato 2.013 pazienti con recente ictus ischemico e fibrillazione atriale. I pazienti sono stati randomizzati in rapporto 1:1 ad un inizio precoce della terapia anticoagulante a seconda delle dimensioni dell’infarto cerebrale, vale a dire entro 48 ore dopo un ictus minore o moderato e il giorno 6-7 dopo un ictus maggiore, rispettivamente, o ad un inizio successivo, cioè il giorno 3-4 per l’ictus minore, il giorno 6-7 per quello moderato o il giorno 12-14 dopo un ictus grave. L’endpoint primario, definito come un composito di ictus ischemico, embolia sistemica, sanguinamento extracranico maggiore, emorragia intracranica sintomatica o morte vascolare entro 30 giorni dalla randomizzazione, è stato osservato in 29 (2,9%) dei pazienti nel trattamento precoce e in 41 (4,1%) pazienti nel gruppo di trattamento successivo, traducendosi in una differenza di rischio di -1,18 punti percentuali con un CI 95% da -2,84 a 0,47. Due pazienti in ciascun gruppo hanno subito un’emorragia intracranica sintomatica. La probabilità di una recidiva di ictus ischemico entro 30 giorni era quasi dimezzata nei pazienti con la somministrazione precoce degli anticoagulanti (Odds Ratio -OR- 0,57; 95% 0,29 a 1,07). Nel complesso, lo studio non ha trovato prove che l’avvio di un anticoagulante diretto prima di quanto attualmente suggerito dalle linee guida nei pazienti con ictus ischemico acuto e fibrillazione atriale, sulla base di una semplice valutazione visiva dell’imaging cerebrale, aumenti il ​​rischio di complicanze emorragiche. Al contrario, è stata riscontrata una riduzione clinicamente importante del rischio per l’endpoint composito e, in particolare, di eventi ischemici ricorrenti a 30 giorni dalla randomizzazione. A 90 giorni il rischio dell’outcome primario è stato più basso nel gruppo che ha iniziato precocemente la terapia con anticoagulante diretto rispetto al gruppo che ha iniziato il trattamento più tardivamente (OR 0,65; 95% CI 0,42 a 0,99). Lo studio ELAN è stato uno studio fondamentale che ha fornito ulteriori prove del fatto che l’inizio precoce degli anticoagulanti diretti dopo un ictus ischemico acuto è probabilmente sicuro e contribuisce a una riduzione degli eventi ischemici ricorrenti precoci senza determinare un incremento del rischio di emorragie intracraniche, rischio che è risultato veramente basso durante tutto il follow-up dello studio (4). Il disegno dello studio non incorporava un test statistico formale per la superiorità o la non inferiorità ma aveva piuttosto un approccio descrittivo basato sulla indicazione dei limiti di confidenza dell’effetto, non basando il proprio risultato sul mero valore della p. I clinici nel prendere una decisione sulla ripresa della terapia anticoagulante potranno basarsi sul dato che indica come il rischio dell’endpoint combinato a 30 giorni vada da una riduzione del 2,8% ad un aumento dello 0,5%.

Conclusioni

Il messaggio da portare a casa è che un valore di p da solo non fornisce informazioni complete riguardo un risultato analitico. Il valore di p dovrebbe perciò essere sostituito da un processo che utilizzi le stime di effetto e che evidenzi l’incertezza dell’effetto stesso.

Bibliografia

  1. Concato J, Hartigan JA. P values: from suggestion to superstition. J Investig Med 2016; 64:1166-1171.
  2. Wasserstein RL, Lazar NA. The ASA’s statement on p-values: context, process, and purpose. American Statistician 2016; 70:129-133.
  3. Kyriacou DI. The enduring evolution of the p-value. JAMA 2016; 315:1113-1115.
  4. Fischer U, Koga M, Strbian D, et al; ELAN Investigators. Early versus Later Anticoagulation for Stroke with Atrial Fibrillation. N Engl J Med 2023; 388:2411-2421.
Tags:
Maurizio Paciaroni
[email protected]


Contattaci

    Per commenti o suggerimenti su questo articolo compila il form

    Accetto i termini della Privacy Policy