Go to main content
Data Epistemology - official lesson image on GinnyTech, created by AD

Data epistemology: what you can really know

The limits of knowledge obtainable from data and how to distinguish what you know from what you think you know.

AD
Created byAndrii Dyshkantiuk
Lesson 206 / 236Level: AdvancedDuration: 18 minPrerequisites: 1

What you will learn

  • Ricostruire la storia di costruzione di un dato risalendo dalla metrica alla fonte
  • Verificare copertura e selezione confrontando il campione con la popolazione bersaglio
  • Dichiarare per iscritto cosa il dato non può dire prima di usarlo per decidere

Data epistemology: what you can really know

Sul binario tabellare passiamo le giornate a guardare tabelle e dashboard, e lì i numeri sembrano oggettivi: arrivano da log, sensori, pipeline e modelli di pulizia. Per questo li trattiamo come se fossero la realtà stessa. Ogni dato invece nasce da scelte: come lo abbiamo raccolto, come lo abbiamo definito e quali trasformazioni gli abbiamo applicato. L’epistemologia dei dati tratta il dato per quello che è, cioè un’evidenza costruita e non una finestra trasparente sul mondo.

Non è un attacco alla professione. È il suo fondamento: chi sa che il dato è costruito sa anche dove cercare le crepe. Chi lo dimentica, scopre le crepe solo quando la dashboard ha già preso una decisione al suo posto.

La tesi fondamentale

Ogni dato nasce da scelte di raccolta, definizione e trasformazione, quindi una dashboard mostra un’evidenza condizionata e mai la realtà senza filtri. Leggere quel dato senza conoscerne le condizioni è una forma di autoinganno.

La procedura di ricostruzione

  1. Risali dalla metrica alla fonte e nomina ogni trasformazione intermedia.
  2. Leggi definizioni, filtri e criteri di inclusione che hanno creato il dataset.
  3. Verifica copertura e selezione confrontando il campione con la popolazione bersaglio.
  4. Replica il risultato con un taglio indipendente di dati o di periodo.
  5. Dichiara per iscritto cosa il dato non può dire prima di usarlo per decidere.

Il dato è costruito

Ogni scelta lungo la pipeline lascia una traccia. La tabella dice dove cercarla, perché il problema non è avere scelte ma non saperle riconoscere.

SceltaQuestion to askTraccia da lasciare
RaccoltaChi resta fuori dal campione?Copertura e criteri di inclusione
DefinitionCosa conta come evento?Dizionario metriche con esempi limite
TrasformazioneQuali filtri e join creano la tabella?Query versionata e riproducibile
SelezioneQuale periodo e quale popolazione?Finestra temporale e popolazione bersaglio

Verdetto: un numero senza storia della sua costruzione non è evidenza ma voce di corridoio con una dashboard intorno.

Evidenza, interpretazione, decisione

Un comitato legge una crescita di retention come prova che la nuova iniziativa ha funzionato. Chi applica l’epistemologia dei dati separa osservazione, spiegazione, assunzione e decisione, perché ogni piano sbagliato in modo diverso.

EvidencePrudent interpretationResulting decision
Positive signal but not isolatedThe phenomenon exists, but the cause is uncertainCercare baseline o holdout
Segment with different responseThe average effect hides heterogeneityAnalyze cohorts or subgroups
Increasing operating costThe result should be evaluated on marginApply economic thresholds

La regola è semplice: una misura serve solo se riduce l’incertezza su una decisione specifica.

L’errore che svuota tutto

L’errore più comune è trattare l’epistemologia dei dati come una definizione da mandare a memoria invece che come un protocollo decisionale: metriche senza baseline, grafici senza ipotesi e raccomandazioni senza costo dell’errore. Il controllo che lo smaschera è una domanda sola: se questo risultato fosse falso, quale decisione sbaglierei.

Essential references

  • Stevens, S. S. (1946). On the Theory of Scales of Measurement. Science.
  • Squire, P. (1988). Why the 1936 Literary Digest Poll Failed. Public Opinion Quarterly.
  • Hume, D. (1748). An Enquiry Concerning Human Understanding.

Due milioni di voti, un campione sbagliato

Nel 1936 il Literary Digest raccolse oltre due milioni di schede e pronosticò la vittoria di Landon su Roosevelt alle presidenziali americane. Roosevelt vinse invece 46 stati su 48 e la rivista non si riprese mai dallo smacco. L’errore non era nella quantità ma nella costruzione: schede spedite ad abbonati ed elenchi telefonici selezionavano un’America più ricca e più repubblicana. Gallup, con un campione molto più piccolo ma costruito per quote rappresentative, azzeccò il risultato. È la lezione epistemologica in forma pura: milioni di righe distorte sanno meno di poche migliaia ben scelte.

Domande di verifica sull’evidenza

  1. Da quale fonte nasce il dato e quali trasformazioni ha subito?
  2. Chi resta fuori dal campione e come distorce la lettura?
  3. Quale taglio indipendente conferma il risultato?
  4. Cosa dichiari che questo dato non può dire?
Serve una mano concreta?

Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.

Book a call