
Foundations of statistical significance
Null and alternative hypotheses, sampling distribution, test statistic, and p-value. From Ronald Fisher's tea lesson (1925) to numerical A/A testing, including limitations of frequentist testing and operational validation templates.
What you will learn
- Definire ipotesi nulla e alternativa e calcolare la statistica test sotto H₀
- Interpretare la distribuzione campionaria e l'errore standard di una differenza tra proporzioni
- Calibrare il sistema con un test A/A e verificare la checklist di validità del test
Foundations of statistical significance
Questa lezione viaggia sul binario ml-tabellare: ogni concetto si appoggia a una regola, a una tabella o a un numero da controllare, e alla fine saprai riconoscere quando un risultato è davvero affidabile.
Che cosa significa, in una frase
La significatività statistica misura se una differenza osservata è troppo grande per essere spiegata dal caso sotto l’ipotesi nulla.
La procedura in cinque passi
- Definisci ipotesi nulla e alternativa prima di osservare i dati.
- Fissa la soglia di errore di primo tipo in base al costo di un falso positivo.
- Calcola la statistica test come distanza standardizzata tra dato osservato e ipotesi nulla.
- Ricava il
p-valuecome probabilità di uno scostamento almeno così estremo sotto ipotesi nulla. - Rifiuta l’ipotesi nulla solo se il
p-valueè sotto la soglia, poi leggi effetto e intervallo prima di decidere.
Il problema prima del calcolo
Un esperimento mostra una differenza tra variante A e variante B. Il team deve capire se osserva un segnale affidabile oppure una variazione compatibile con il caso. I fondamenti introducono il linguaggio minimo per ragionare su rumore, ipotesi nulla, errore e decisione.
La significatività non decide da sola. Separa rumore, evidenza e impatto pratico. Trattala come strumento per migliorare una decisione concreta, con assunzioni esplicite e controlli minimi.
Decidere con esperimenti robusti significa non abusare di p-value, peeking o letture casuali del rumore. Se alla fine non sai dire quale decisione cambia, quale dato osservi e quale errore vuoi evitare, la lezione non è ancora diventata competenza applicata.
Null hypothesis and alternative hypothesis
Ogni test parte da due affermazioni in competizione.
Null hypothesis (H₀): it is the status quothe statement that there is no effect, difference, or relationship. It is the hypothesis the test tries to falsify. Examples:
- La media del gruppo trattamento è uguale alla media del gruppo controllo:
- La conversione non cambia:
- Il coefficiente di regressione è zero:
Alternative hypothesis (H₁ or Ha): it is what we want to prove, the presence of an effect. Examples:
- (bilaterale)
- (unilaterale, direzionale)
La scelta tra test unilaterale e bilaterale cambia la potenza. Con un’aspettativa direzionale chiara, il test unilaterale offre più potenza. Se l’effetto può anche peggiorare la metrica, serve il test bilaterale. Per prudenza, la maggior parte dei test A/B in produzione usa test bilaterali.
The operational rule is simple: H₀ è l’ipotesi da rigettare; H₁ è l’ipotesi da supportare. Il test non dimostra H₁. Valuta se i dati sono incompatibili con H₀ al punto da giustificarne il rifiuto.
The sampling distribution
Il concetto più difficile e più importante è la sampling distribution.
Se potessi ripetere lo stesso esperimento infinite volte, calcoleresti ogni volta una statistica diversa. Un esempio è la differenza tra medie. La distribuzione di tutte queste statistiche, al variare dei campioni, è la distribuzione campionaria.
Here is the key property: under H₀, we know the shape of this distribution. Per una media campionaria, il Teorema del Limite Centrale ci dice che la distribuzione campionaria è approssimativamente normale con media pari alla media della popolazione e deviazione standard pari all’errore standard (\sigma / \sqrt{n}).
For a difference between two proportions (as in an A/B test), under H₀ the sampling distribution of the difference is normal with mean 0 and standard deviation given by:
SE = \sqrt{p(1-p)\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}
where è la proporzione pooled sotto H₀.
La distribuzione campionaria è il ponte tra osservazione ed attesa. L’osservazione è un singolo numero, come la differenza nel tuo esperimento. L’attesa è ciò che prevede H₀. Se la differenza cade nelle code estreme, dove la probabilità è bassa, hai evidenza contro H₀.
Il test d’ipotesi in sintesi
Ecco la sequenza operativa da usare in ogni test di significatività.
| Step | Action | Example (A/B test) |
|---|---|---|
| 1 | Define H₀ and H₁ | H₀: ; H₁: |
| 2 | Choose α (significance level) | α = 0.05 (Type I error acceptable at 5%) |
| 3 | Calculate test statistic | z = \frac{\hat{p}_T - \hat{p}_C}{SE} |
| 4 | Calculate p-value | Probability of observing a z at least this extreme under H₀ |
| 5 | Compare p-value with α | If p < α, reject H₀; otherwise, do not reject H₀ |
I passi 3 e 4 sono tecnici, ma il ragionamento resta uno solo. Misuri la distanza tra dati e ipotesi nulla e chiedi quanto è raro questo scostamento se H₀ fosse vera.
Concrete example: numerical A/A test
Un test A/A assegna a entrambi i gruppi esattamente lo stesso trattamento. Non esiste differenza reale: H₀ è vera per costruzione.
Perché fare un test A/A? Per calibrare il sistema. Se il test funziona bene, dovresti osservare un risultato significativo in una proporzione α dei casi. Con α pari a 0,05, circa un test A/A su 20 mostra un falso positivo per puro caso.
Prendi un prodotto con conversione base del 10%. Assegni 10.000 utenti a ciascuno di due gruppi identici (A e A). Entrambi vedono la stessa esperienza. Calcoli differenza e p-value, poi ripeti l’esperimento 1.000 volte.
| Iteration | Conv. Group A | Conv. Group A’ | Difference | p-value | Significant? |
|---|---|---|---|---|---|
| 1 | 10,12% | 9,88% | +0,24% | 0,57 | No |
| 2 | 9,95% | 10,05% | -0,10% | 0,81 | No |
| 3 | 10,45% | 9,55% | +0,90% | 0,04 | Yes (false positive) |
| 4 | 10,01% | 9,99% | +0,02% | 0,96 | No |
| 5 | 9,80% | 10,20% | -0,40% | 0,35 | No |
| … | … | … | … | … | … |
| 1.000 | 10,03% | 9,97% | +0,06% | 0,89 | No |
Result: su 1.000 test A/A, 52 hanno dato p < 0,05, una proporzione del 5,2%, coerente con α = 0,05.
This simulation teaches three things.
- The system works: the false positive rate is close to the nominal level α.
- False positives are inevitable: anche con un test calibrato, circa un esperimento su 20 produce un risultato significativo per puro caso.
- Interpretation is contextual: se vedi p = 0,04 in un test reale, non sai se è un effetto vero oppure uno dei circa 5% di falsi positivi attesi. Servono repliche, potenza adeguata e validazione esterna.
What to do if the A/A test yields too many false positives
Se il sistema produce significatività molto più spesso di α nei test A/A (ad esempio 15% invece di 5%), esiste un problema strutturale. Le cause possibili:
- Defective randomization system: the division between groups is not balanced on confounding variables.
- Non-independent metric: the primary metric has autocorrelation or depends on shared events (e.g., a user in both groups due to tracking error).
- Peeking: you look at the result before the sample is complete and decide to stop when you see a low p. This inflates the Type I error rate dramatically (up to 20-30%).
- Post-hoc segmentation: you look for significance in subgroups (by device, by country) until you find something “significant.”
Un test A/A regolare è la migliore calibrazione disponibile. Senza test A/A, non sai se il sistema di misura è affidabile.
Limits of frequentist testing
Il framework della significatività è potente ma ha tre limiti strutturali. Ogni analista deve conoscerli prima di decidere.
Limit 1: The p-value does not tell how likely H₁ is
The p-value answers: “If H₀ were true, what is the probability of observing data at least this extreme?”
It does not answer: “What is the probability that H₁ is true?” o “What is the probability that H₀ is false?”
Questa confusione è pervasiva. In un sondaggio del 2019 condotto su 1.500 ricercatori (Nature, 2019), il 58% interpretava erroneamente p < 0,05 come “c’è meno del 5% di probabilità che i risultati siano dovuti al caso”, che è la definizione sbagliata. Il p-value è condizionato a H₀, non a H₁.
Limit 2: Dependence on sample size
Con campioni enormi, qualsiasi effetto diventa significativo, anche se irrilevante. Con campioni piccoli, anche effetti importanti possono restare non significativi.
Esempio: su 10 milioni di utenti, una differenza di conversione dello 0,01% produrrà quasi certamente p < 0,001. L’effetto è reale, ma vale il rollout? Probabilmente no, se il costo d’implementazione supera il beneficio.
Al contrario, un aumento del 15% della conversione su 200 utenti per gruppo potrebbe dare p = 0,12. Il risultato è non significativo per α = 0,05, ma merita attenzione se estendi il test.
Il testing frequentista non incorpora la practical relevance. Per questo ogni test richiede effect size e intervallo di confidenza accanto al p-value.
Limit 3: The multiple comparisons problem
Ogni test ha una probabilità α di falso positivo. Se esegui K test indipendenti, la probabilità di at least one a false positive rises to:
P(\text{almeno 1 falso positivo}) = 1 - (1 - \alpha)^K
Con α = 0,05 e K = 20 test, la probabilità di vedere almeno un risultato significativo spurio è circa il 64%. Con K = 100, sfiora il 99,4%.
Nel lavoro reale questo accade in tre modi.
- Simultaneous multiple tests: analizzi 10 metriche e trovi una “vincitrice”. È un effetto reale oppure un falso positivo?
- Post-hoc segmentation: suddividi per dispositivo, browser e paese finché un segmento diventa significativo.
- Sequential peeking: guardi il risultato ogni giorno e decidi di fermarti quando vedi
p < 0,05. Questo equivale a eseguire decine di test sullo stesso dato.
Esistono correzioni (Bonferroni, Holm, Benjamini-Hochberg) ma non risolvono la radice del problema. La significatività è una misura di evidenza, non un certificato di verità.
La checklist di validità del test
Prima di dichiarare un risultato significativo, verifica questi sette punti. Se anche uno solo fallisce, il test non è affidabile.
| # | Question | What to check | Outcome |
|---|---|---|---|
| 1 | Valid randomization? | Is the division between groups random and balanced on known variables (device, traffic source)? | ✅ / ❌ |
| 2 | Independence of observations? | Is each unit assigned to only one group? Is there no spillover between groups? | ✅ / ❌ |
| 3 | α defined ex-ante? | Was the significance level chosen before looking at the data? | ✅ / ❌ |
| 4 | Sample size determined ex-ante? | Was the sample size (or duration) fixed before the experiment? | ✅ / ❌ |
| 5 | Motivated two-tailed or one-tailed test? | Is the choice justified by the business question, not by the result? | ✅ / ❌ |
| 6 | Effect size reported? | Does the result include the effect size and its confidence interval? | ✅ / ❌ |
| 7 | Stable guardrails? | Have secondary metrics (revenue, bounce rate, errors) not significantly worsened? | ✅ / ❌ |
If you answer ❌ to one or more points, the test is invalid or the conclusions need to be reviewed.
Threshold interpretation
La significatività a p < 0,05 è lo standard più comune, ma non è universale. Ecco come scegliere α in base al contesto decisionale.
| Context | Recommended α | Ratio |
|---|---|---|
| Exploration / idea generation | 0,10 | Low false positive cost, better to explore |
| Standard A/B test (UX, marketing) | 0,05 | Accepted standard; balances false positives and false negatives |
| Critical product launch (checkout, payments) | 0,01 | Very high false positive cost (revenue loss, churn) |
| Clinical / regulatory test | 0.001 or less | People's lives depend on the decision |
Warning: lowering α reduces false positives but increases false negatives (failing to detect a real effect). The choice of α is a trade-off, not an absolute truth.
Il caso Fisher: il tè con latte
Nel 1925 Ronald Fisher pubblica Statistical Methods for Research Workers, il libro che cristallizza l’approccio moderno alla verifica delle ipotesi, ma il meccanismo logico nasce dal celebre esperimento del tè con latte. Una signora sosteneva di distinguere se il latte fosse stato versato prima o dopo il tè: Fisher prepara otto tazze, quattro per tipo, le presenta in ordine casuale e le chiede di classificarle tutte. Sotto l’ipotesi nulla di nessuna capacità discriminante, indovinarle tutte e otto ha probabilità pari a 1 su 70, circa 0,014. Fisher rifiuta l’ipotesi nulla sotto quella soglia e introduce così il meccanismo ancora in uso: ipotesi scettica di default, misura di evidenza contro di essa, soglia decisionale. La formalizzazione rigida arriva dopo, con Neyman e Pearson e la distinzione tra errore di primo e secondo tipo.
Verdetto: la significatività non decide da sola: scegli α in base al costo del falso positivo, rifiuta H₀ solo se il p-value è sotto soglia e leggi sempre effetto e intervallo accanto al p-value, perché la significatività è una misura di evidenza, non un certificato di verità.
Domande per verificare la lezione
- Che cosa afferma l’ipotesi nulla in un test
A/Bsulle conversioni? - Perché un test
A/Aben calibrato produce comunque circa un falso positivo ogni venti lanci? - Che cosa devi controllare prima di fidarti di un risultato con
p-valuesotto soglia? - Quando un effetto statisticamente significativo non merita il
rollout?
Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.
Related Path
Lessons to read together
Questi collegamenti portano la lezione dentro il resto del corso: basi da riprendere, passaggi successivi e connessioni tematiche tra moduli.