
Data epistemology: what you can really know
The limits of knowledge obtainable from data and how to distinguish what you know from what you think you know.
What you will learn
- Ricostruire la storia di costruzione di un dato risalendo dalla metrica alla fonte
- Verificare copertura e selezione confrontando il campione con la popolazione bersaglio
- Dichiarare per iscritto cosa il dato non può dire prima di usarlo per decidere
Data epistemology: what you can really know
Sul binario tabellare passiamo le giornate a guardare tabelle e dashboard, e lì i numeri sembrano oggettivi: arrivano da log, sensori, pipeline e modelli di pulizia. Per questo li trattiamo come se fossero la realtà stessa. Ogni dato invece nasce da scelte: come lo abbiamo raccolto, come lo abbiamo definito e quali trasformazioni gli abbiamo applicato. L’epistemologia dei dati tratta il dato per quello che è, cioè un’evidenza costruita e non una finestra trasparente sul mondo.
Non è un attacco alla professione. È il suo fondamento: chi sa che il dato è costruito sa anche dove cercare le crepe. Chi lo dimentica, scopre le crepe solo quando la dashboard ha già preso una decisione al suo posto.
La tesi fondamentale
Ogni dato nasce da scelte di raccolta, definizione e trasformazione, quindi una dashboard mostra un’evidenza condizionata e mai la realtà senza filtri. Leggere quel dato senza conoscerne le condizioni è una forma di autoinganno.
La procedura di ricostruzione
- Risali dalla metrica alla fonte e nomina ogni trasformazione intermedia.
- Leggi definizioni, filtri e criteri di inclusione che hanno creato il dataset.
- Verifica copertura e selezione confrontando il campione con la popolazione bersaglio.
- Replica il risultato con un taglio indipendente di dati o di periodo.
- Dichiara per iscritto cosa il dato non può dire prima di usarlo per decidere.
Il dato è costruito
Ogni scelta lungo la pipeline lascia una traccia. La tabella dice dove cercarla, perché il problema non è avere scelte ma non saperle riconoscere.
| Scelta | Question to ask | Traccia da lasciare |
|---|---|---|
| Raccolta | Chi resta fuori dal campione? | Copertura e criteri di inclusione |
| Definition | Cosa conta come evento? | Dizionario metriche con esempi limite |
| Trasformazione | Quali filtri e join creano la tabella? | Query versionata e riproducibile |
| Selezione | Quale periodo e quale popolazione? | Finestra temporale e popolazione bersaglio |
Verdetto: un numero senza storia della sua costruzione non è evidenza ma voce di corridoio con una dashboard intorno.
Evidenza, interpretazione, decisione
Un comitato legge una crescita di retention come prova che la nuova iniziativa ha funzionato. Chi applica l’epistemologia dei dati separa osservazione, spiegazione, assunzione e decisione, perché ogni piano sbagliato in modo diverso.
| Evidence | Prudent interpretation | Resulting decision |
|---|---|---|
| Positive signal but not isolated | The phenomenon exists, but the cause is uncertain | Cercare baseline o holdout |
| Segment with different response | The average effect hides heterogeneity | Analyze cohorts or subgroups |
| Increasing operating cost | The result should be evaluated on margin | Apply economic thresholds |
La regola è semplice: una misura serve solo se riduce l’incertezza su una decisione specifica.
L’errore che svuota tutto
L’errore più comune è trattare l’epistemologia dei dati come una definizione da mandare a memoria invece che come un protocollo decisionale: metriche senza baseline, grafici senza ipotesi e raccomandazioni senza costo dell’errore. Il controllo che lo smaschera è una domanda sola: se questo risultato fosse falso, quale decisione sbaglierei.
Essential references
- Stevens, S. S. (1946). On the Theory of Scales of Measurement. Science.
- Squire, P. (1988). Why the 1936 Literary Digest Poll Failed. Public Opinion Quarterly.
- Hume, D. (1748). An Enquiry Concerning Human Understanding.
Due milioni di voti, un campione sbagliato
Nel 1936 il Literary Digest raccolse oltre due milioni di schede e pronosticò la vittoria di Landon su Roosevelt alle presidenziali americane. Roosevelt vinse invece 46 stati su 48 e la rivista non si riprese mai dallo smacco. L’errore non era nella quantità ma nella costruzione: schede spedite ad abbonati ed elenchi telefonici selezionavano un’America più ricca e più repubblicana. Gallup, con un campione molto più piccolo ma costruito per quote rappresentative, azzeccò il risultato. È la lezione epistemologica in forma pura: milioni di righe distorte sanno meno di poche migliaia ben scelte.
Domande di verifica sull’evidenza
- Da quale fonte nasce il dato e quali trasformazioni ha subito?
- Chi resta fuori dal campione e come distorce la lettura?
- Quale taglio indipendente conferma il risultato?
- Cosa dichiari che questo dato non può dire?
Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.
Related Path
Lessons to read together
Questi collegamenti portano la lezione dentro il resto del corso: basi da riprendere, passaggi successivi e connessioni tematiche tra moduli.