Go to main content
Peeking, Multiple Testing, and Experiment Governance - official lesson image on GinnyTech, created by AD

Peeking, multiple testing and sequential testing

Peeking, multiple testing e sequential testing: durata minima e regola di lettura fissate prima del lancio, correzione della soglia con α/K e stop deciso solo dalla regola scritta.

AD
Created byAndrii Dyshkantiuk
Lesson 180 / 236Level: AdvancedDuration: 18 minPrerequisites: 1

What you will learn

  • Fissare durata minima, metrica primaria e regola di lettura prima del lancio
  • Correggere la soglia con α/K o controllare il tasso di false scoperte su più metriche
  • Fermare o proseguire il test solo in base alla regola scritta prima

Peeking, multiple testing and sequential testing

Questa lezione sta sul binario ml-tabellare: peeking e multiple testing si governano con regole scritte prima, e qui impariamo a scriverle.

L’idea in una frase

Guardare i risultati prima della fine pianificata e fermarsi al primo segnale gonfia la probabilità di scambiare rumore per effetto reale.

La procedura in cinque passi

  1. Fissa prima del lancio durata minima, metrica primaria e regola di lettura dei risultati intermedi.
  2. Dichiara quante ipotesi testerai, perché il rischio di falsi positivi cresce con 1−(1−α)K1 - (1 - \alpha)^K al crescere di KK.
  3. Se devi osservare i dati in corso, usa soglie corrette per letture ripetute invece della soglia standard.
  4. Quando testi più metriche o segmenti, correggi la soglia con α/K\alpha / K oppure controlla il tasso di false scoperte.
  5. Ferma o prosegui il test solo in base alla regola scritta prima, mai in base al valore osservato.

Quando la fretta corrompe l’evidenza

Il problema non è conoscere peeking e sequential testing in astratto. Il problema arriva con dati incompleti, metriche ambigue e vincoli tecnici che rendono fragile la lettura. Tre abitudini trasformano un esperimento in selezione opportunistica.

Guardare il risultato ogni mattina, fermare l’esperimento quando il numero conviene e provare dieci metriche finché una diventa significativa: ogni abitudine gonfia la probabilità di scambiare rumore per segnale. La pressione di business spinge ad agire subito, ma lo stop precoce compra falsi positivi.

Il modello: dalla decisione all’azione

Conviene leggere il tema come un ponte tra contesto, misura e azione. Un modello robusto separa quattro blocchi: la decisione da supportare, i segnali osservabili, il meccanismo che collega segnali e decisione e i guardrail che limitano gli errori di lettura.

Questa separazione obbliga a scrivere prima quando guardi i dati, quante ipotesi testi e quale criterio usi per fermare o continuare. Senza regole previa, scegli il momento più conveniente e lo racconti come prova.

Parti dalla decisione: che cosa cambia se capiamo meglio peeking e sequential testing? Poi individua il segnale osservabile, la baseline di confronto, i vincoli che possono falsare la lettura e l’azione che segue. Ogni blocco deve avere una risposta scritta prima del lancio.

Formalizzare la relazione tra decisione, evidenza e rischio

Formalizzare rende visibili le assunzioni. Così uno stakeholder discute il criterio decisionale invece di accettare il risultato per autorità. La padronanza sta nel definire le regole mentre la pressione spinge ad agire.

Serve definire l’unità di analisi, la variabile osservata, la baseline, la soglia decisionale e il rischio residuo. Ogni elemento ha un controllo minimo: una definizione stabile e tracciabile, un criterio scritto prima della lettura, una verifica di sensibilità.

Un caso: l’esperimento che cambia idea ogni giorno

Un esperimento sembra vincere al giorno 3, perde significatività al giorno 5 e torna positivo al giorno 8. Senza regole di lettura predefinite, il team sceglie il giorno più conveniente e lo presenta come prova. È l’esempio più chiaro del perché peeking richiede disciplina.

La stessa logica vale con numeri ambigui. Se il dato migliora ma la baseline è debole, rafforza il confronto prima di scalare. Se la metrica cambia in un solo segmento, separa le coorti invece di leggere la media.

L’errore tipico

L’errore più comune è trattare peeking e sequential testing come dettagli da sistemare alla fine. Sono regole di governance che decidono quanto puoi fidarti di un risultato. La pressione per agire subito non le rende opzionali.

Definisci prima quando guardi i dati, quante ipotesi testi e quale criterio usi per fermare, continuare o correggere. Senza questa dichiarazione, ogni lettura intermedia consuma credibilità statistica.

Verdetto: orizzonte fisso e regola di stop scritta prima battono sempre lo stop al primo segnale, perché chi si ferma sulla significatività osservata compra falsi positivi.

Il caso Open Science Collaboration 2015

Nel 2015 la Open Science Collaboration pubblicò su Science il tentativo di replicare 100 studi di psicologia: solo 36 su 100 produssero di nuovo un risultato significativo. Tra le cause indicate c’erano proprio flessibilità di analisi, confronti multipli e letture opportunistiche dei dati, cioè peeking e multiple testing fuori controllo. Il caso mostra che il problema non è teorico: senza regole di lettura predefinite, interi filoni di letteratura accumulano risultati che non reggono alla replica. La lezione operativa è la stessa dentro un team di prodotto: ogni lettura intermedia non pianificata e ogni metrica aggiunta a posteriori consumano credibilità statistica.

Domande per verificare la lezione

  1. Perché fermarsi al primo giorno con segnale gonfia il tasso di falsi positivi?
  2. Che cosa cambia nel rischio di errore se testi dieci metriche senza correzione?
  3. Quando è legittimo osservare i dati prima della fine pianificata?
  4. Quale regola di stop avresti scritto prima di lanciare il test?
Serve una mano concreta?

Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.

Book a call