Vai al contenuto principale
P-Value, Errori e Interpretazione Corretta - immagine ufficiale della lezione su GinnyTech, creata da AD

P-value, errori e interpretazione corretta

Che cosa misura davvero il p-value e come leggerlo insieme a effect size, intervalli, power e decisione business.

AD
Creato daAndrii Dyshkantiuk
Lezione 178 / 236Livello: IntermedioDurata: 18 minPrerequisiti: 1

Cosa imparerai

  • Calcolare la statistica test z = (p̂_T - p̂_C) / SE e ricavare il p-value sotto ipotesi nulla
  • Leggere il p-value insieme a effect size, intervallo di confidenza e potenza
  • Distinguere significatività statistica da rilevanza economica prima del rollout

P-value, errori e interpretazione corretta

Anche questa lezione appartiene al binario ml-tabellare: il p-value è un numero, ma il suo valore dipende da ciò che gli metti accanto, e qui impariamo a leggerlo come si deve.

Che cosa misura davvero

Il p-value misura quanto i dati sono sorprendenti se l’ipotesi nulla fosse vera, non la probabilità che la variante sia davvero migliore.

La procedura in cinque passi

  1. Formula ipotesi nulla e alternativa prima di guardare i dati.
  2. Fissa la soglia di errore di primo tipo in base al costo di un falso positivo.
  3. Calcola la statistica test come distanza standardizzata tra dato osservato e ipotesi nulla, ad esempio z=(p^T−p^C)/SEz = (\hat{p}_T - \hat{p}_C) / SE.
  4. Ricava il p-value come probabilità di uno scostamento almeno così estremo sotto ipotesi nulla.
  5. Leggi il risultato insieme a dimensione dell’effetto, intervallo di confidenza e potenza, mai da solo.

Il problema reale

Un p-value basso può far sembrare una decisione più certa di quanto sia. Succede soprattutto quando effect size, potenza e qualità del disegno restano fuori dalla discussione. Il p-value non è la probabilità che la variante sia migliore.

Non misura l’importanza economica e non sostituisce un decision memo. Va usato come componente dell’evidenza, insieme a dimensione dell’effetto, intervallo, potenza e rischio di errore. Solo così collega domanda, dato, baseline e decisione.

Il problema non è conoscere il p-value in astratto. Il problema è decidere con dati incompleti, metriche ambigue e vincoli tecnici che rendono fragile la lettura. Il rischio opposto esiste: fermarsi presto, con pochi campioni, e perdere un’opportunità reale.

Il modello di lavoro

La sequenza seguente evita di trasformare una nozione tecnica in rituale vuoto. Ogni passaggio deve chiarire il costo di una decisione sbagliata. Ogni passaggio deve dire quale errore stai controllando.

Parti dalla decisione: che cosa cambia se capiamo meglio il p-value? Poi individua il segnale, il dato osservabile che riduce l’incertezza, e la baseline rispetto a cui interpretarlo. Dichiara i vincoli che possono falsare la lettura e chiudi con l’azione: quale passo operativo segue. Se un passaggio non ha risposta, il numero che mostri non è ancora evidenza.

La formalizzazione

Formalizzare rende visibili le assunzioni. Così uno stakeholder discute il criterio decisionale invece di accettare il risultato per autorità. Senza questo passaggio, il numero più preciso vince per default.

Serve definire l’unità di analisi, la variabile osservata, la baseline, la soglia decisionale e il rischio residuo. Se due esperti leggono la stessa definizione e guardano lo stesso materiale, devono arrivare a conclusioni comparabili sugli stessi trade-off. Senza definizioni stabili, la stessa metrica sostiene conclusioni opposte.

Leggere un caso senza farsi ingannare

Un team usa il p-value per decidere se cambiare pipeline, metrica, investimento o dashboard. La domanda utile non è la definizione corretta. La domanda utile è quale scelta diventa meno rischiosa con un’analisi fatta bene.

Un valore basso senza effetto rilevante non giustifica il rollout. Un valore alto con potenza bassa non dimostra assenza di effetto. Serve sempre il contesto: effetto, intervallo e guardrail.

Pensa alle situazioni tipiche. Se il dato migliora ma la baseline è debole, il segnale potrebbe essere reale o dipendere dal campione: rafforza il confronto prima di scalare. Se la metrica cambia in un solo segmento, l’effetto medio nasconde eterogeneità: separa coorti o casi d’uso. Se il costo operativo aumenta, valuta il beneficio sul margine e applica una soglia economica esplicita. Se il sistema produce numeri incoerenti, la fiducia nel dato è parte della decisione: correggi ownership e controlli.

Le aree da tenere sotto controllo

La lezione mantiene un punto pratico: usa il p-value per collegare domanda, dato, baseline e decisione. Non usarlo come timbro finale.

Tieni sotto controllo cinque aree. La domanda: quale scelta deve cambiare dopo l’analisi. Il dato: quale evento, tabella o metrica rende osservabile il problema. La qualità: quale errore di raccolta, modellazione o interpretazione può alterare il risultato. La baseline: quale confronto impedisce una lettura isolata. L’azione: quale raccomandazione diventa più difendibile.

L’errore tipico da evitare

L’errore tipico è usare il p-value come etichetta invece che come criterio di scelta. Il team mostra un numero senza dire quale decisione cambia. Non dichiara quale baseline lo rende interpretabile né quale rischio resta aperto. Il dato sembra preciso ma non guida l’azione.

L’errore gemello è leggere un valore basso come probabilità che l’ipotesi sia vera. Il p-value misura solo incompatibilità tra dati e ipotesi nulla. Confondere le due letture gonfia la certezza.

Verdetto: nessun p-value decide da solo; la decisione richiede effetto, intervallo, potenza e soglia economica scritta prima.

Il caso ASA: la dichiarazione del 2016

Nel 2016 l’American Statistical Association pubblicò la sua prima dichiarazione ufficiale sui p-value, firmata da Wasserstein e Lazar, proprio per arginare gli abusi accumulati in decenni di letteratura. Il messaggio centrale è che il p-value non misura la probabilità che l’ipotesi sia vera né l’importanza di un effetto, e che nessuna soglia trasforma da sola un risultato in una scoperta. La dichiarazione chiede di accompagnare ogni test con effect size, intervalli e disegno trasparente. Il caso resta il riferimento operativo: quando un team discute solo la soglia superata e mai la grandezza dell’effetto, sta ripetendo l’errore che l’ASA ha denunciato.

Domande per verificare la lezione

  1. Che cosa misura esattamente un p-value e che cosa non misura?
  2. Perché un effetto minuscolo può risultare significativo con campioni enormi?
  3. Quale informazione aggiunge l’intervallo di confidenza rispetto al solo p-value?
  4. Quando un risultato non significativo merita comunque un seguito?
Serve una mano concreta?

Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.

Prenota una call