
Bayesian A/B, switchback test, and geo-test
Quando la randomizzazione per utente non è possibile: switchback test per interferenza temporale, geo-test per interventi locali e modello bayesiano per decidere in fretta con poco traffico.
What you will learn
- Scegliere tra switchback, geo-test e modello bayesiano in base al vincolo di randomizzazione
- Fissare unità sperimentale, finestre temporali e baseline condivisa prima di leggere i dati
- Dichiarare lo spillover atteso e la metrica da proteggere in ogni disegno
Bayesian A/B, switchback test, and geo-test
Questa lezione viaggia sul binario ml-tabellare: quando l’unità di randomizzazione cambia, cambia anche la riga del disegno, e qui impariamo a scegliere quella giusta.
L’idea in una frase
Quando non puoi randomizzare per utente, il disegno deve cambiare forma senza ridurre il rigore della domanda causale.
La procedura in cinque passi
- Verifica se la
randomizzazioneper utente è possibile senza interferenza tra gruppi. - Se l’interferenza è temporale, alterna trattamento e controllo in finestre temporali predefinite.
- Se l’intervento agisce per area, randomizza aree geografiche comparabili con un periodo di
baselinecondiviso. - Se devi decidere in fretta con poco traffico, aggiorna le probabilità con un modello
bayesianoinvece di attendere la soglia frequentista. - Dichiara comunque unità sperimentale, finestre,
spilloveratteso e metrica da proteggere.
Quando l’A/B classico non basta
Non tutti gli esperimenti ammettono la randomizzazione per utente. Prezzi, delivery, marketplace, città e periodi temporali creano interferenza tra gruppi. I disegni bayesiano, switchback e geo-test rispondono a vincoli diversi.
Il punto non è collezionare definizioni. Il punto è scegliere il disegno che rende la decisione meno fragile dato il vincolo reale. Con l’unità sbagliata, anche un calcolo corretto misura l’effetto sbagliato.
Il fallimento tipico è forzare un A/B per utente dove non regge. Il risultato sembra pulito ma incorpora spillover e confronti non credibili. I costi sono immediati: letture non confrontabili e responsabilità che si spostano quando il risultato delude.
Come scegliere il disegno
Un modello robusto separa quattro blocchi: la decisione da supportare, i segnali osservabili, il meccanismo che collega segnali e decisione e i guardrail che limitano gli errori di lettura. La domanda corretta non è solo cosa misuri.
Devi anche dichiarare quale ipotesi assumi, quale rischio introduci e quale output ti aspetti alla fine. Così la scelta del disegno resta discutibile prima dei dati, non dopo.
Parti dalla decisione: che cosa cambia se scegliamo meglio il disegno? Poi individua il segnale osservabile, la baseline di confronto, i vincoli che possono falsare la lettura e l’azione che segue. Ogni blocco deve avere una risposta scritta prima del lancio.
Gli elementi da formalizzare
La formalizzazione evita due errori opposti: trattare tutto come opinione oppure ridurre tutto a una checklist cieca. Il criterio resta semplice. Se due esperti leggono la stessa definizione e guardano lo stesso materiale, devono arrivare a conclusioni comparabili sugli stessi trade-off.
Serve definire la decisione supportata, gli input, il meccanismo con cui il team passa da osservazioni a interpretazione, i guardrail e l’output atteso. A questi si aggiungono due controlli minimi: una soglia decisionale scritta prima dell’analisi e un rischio residuo dichiarato anche dopo la conclusione.
Un caso applicato
Un marketplace non può randomizzare utenti perché rider, ristoranti e città interferiscono tra loro. Il caso richiede di scegliere tra switchback e geo-test. La scelta dipende da dove nasce l’interferenza: nel tempo oppure nello spazio.
In entrambi i casi dichiara unità sperimentale, finestre temporali, rischio di spillover e metrica di marketplace da proteggere. Senza questa dichiarazione, la media nasconde eterogeneità e il test risponde alla domanda sbagliata.
Prima chiediti quale decisione stai cercando di migliorare, poi quali definizioni e segmentazioni contano davvero, dove il modello può ingannare e, solo alla fine, cosa fare adesso e perché.
L’errore tipico
L’errore più frequente è scambiare familiarità con comprensione. I concetti più citati richiedono più rigore proprio perché muovono più decisioni e più risorse. Il secondo errore è scegliere il disegno più sofisticato per abitudine.
Scegli invece il disegno meno fragile per il vincolo reale che hai davanti. La sofisticazione non compensa un’unità sperimentale sbagliata.
Verdetto: switchback per interferenza temporale, geo-test per interventi locali, bayesiano per decidere in fretta con poco traffico; mai il metodo più sofisticato per abitudine.
Il caso eBay 2013
Nel 2013 eBay sospese la pubblicità a pagamento sui motori di ricerca in alcune aree geografiche e la mantenne attiva in altre, trattando le aree come unità sperimentali. L’analisi di Blake, Nosko e Tadelis, pubblicata nel 2015, mostrò che l’effetto sulle vendite era molto più piccolo di quanto i report interni basati su correlazione suggerissero. Senza geo-test, l’azienda attribuiva alla pubblicità vendite che sarebbero arrivate comunque. Il caso resta il riferimento per gli interventi che non si possono randomizzare per utente: quando il vincolo lo impone, si randomizza per area con baseline condivisa e si accetta l’incertezza residua dichiarandola.
Domande per verificare la lezione
- Quando un
A/Bper utente smette di essere il disegno giusto? - Che cosa distingue uno
switchbacktest da ungeo-test? - Perché devi fissare le finestre temporali prima di leggere i dati?
- Quale
spilloverinvalida ungeo-teste come lo controlli?
Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.
Related Path
Lessons to read together
Questi collegamenti portano la lezione dentro il resto del corso: basi da riprendere, passaggi successivi e connessioni tematiche tra moduli.