Vai al contenuto principale
Epistemologia dei dati - immagine ufficiale della lezione su GinnyTech, creata da AD

Epistemologia dei dati: cosa puoi davvero sapere

I limiti della conoscenza ottenibile dai dati e come distinguere ciò che sai da ciò che credi di sapere.

AD
Creato daAndrii Dyshkantiuk
Lezione 206 / 236Livello: AvanzatoDurata: 18 minPrerequisiti: 1

Cosa imparerai

  • Ricostruire la storia di costruzione di un dato risalendo dalla metrica alla fonte
  • Verificare copertura e selezione confrontando il campione con la popolazione bersaglio
  • Dichiarare per iscritto cosa il dato non può dire prima di usarlo per decidere

Epistemologia dei dati: cosa puoi davvero sapere

Sul binario tabellare passiamo le giornate a guardare tabelle e dashboard, e lì i numeri sembrano oggettivi: arrivano da log, sensori, pipeline e modelli di pulizia. Per questo li trattiamo come se fossero la realtà stessa. Ogni dato invece nasce da scelte: come lo abbiamo raccolto, come lo abbiamo definito e quali trasformazioni gli abbiamo applicato. L’epistemologia dei dati tratta il dato per quello che è, cioè un’evidenza costruita e non una finestra trasparente sul mondo.

Non è un attacco alla professione. È il suo fondamento: chi sa che il dato è costruito sa anche dove cercare le crepe. Chi lo dimentica, scopre le crepe solo quando la dashboard ha già preso una decisione al suo posto.

La tesi fondamentale

Ogni dato nasce da scelte di raccolta, definizione e trasformazione, quindi una dashboard mostra un’evidenza condizionata e mai la realtà senza filtri. Leggere quel dato senza conoscerne le condizioni è una forma di autoinganno.

La procedura di ricostruzione

  1. Risali dalla metrica alla fonte e nomina ogni trasformazione intermedia.
  2. Leggi definizioni, filtri e criteri di inclusione che hanno creato il dataset.
  3. Verifica copertura e selezione confrontando il campione con la popolazione bersaglio.
  4. Replica il risultato con un taglio indipendente di dati o di periodo.
  5. Dichiara per iscritto cosa il dato non può dire prima di usarlo per decidere.

Il dato è costruito

Ogni scelta lungo la pipeline lascia una traccia. La tabella dice dove cercarla, perché il problema non è avere scelte ma non saperle riconoscere.

SceltaDomanda da fareTraccia da lasciare
RaccoltaChi resta fuori dal campione?Copertura e criteri di inclusione
DefinizioneCosa conta come evento?Dizionario metriche con esempi limite
TrasformazioneQuali filtri e join creano la tabella?Query versionata e riproducibile
SelezioneQuale periodo e quale popolazione?Finestra temporale e popolazione bersaglio

Verdetto: un numero senza storia della sua costruzione non è evidenza ma voce di corridoio con una dashboard intorno.

Evidenza, interpretazione, decisione

Un comitato legge una crescita di retention come prova che la nuova iniziativa ha funzionato. Chi applica l’epistemologia dei dati separa osservazione, spiegazione, assunzione e decisione, perché ogni piano sbagliato in modo diverso.

EvidenzaInterpretazione prudenteDecisione conseguente
Segnale positivo ma non isolatoIl fenomeno esiste, ma la causa è incertaCercare baseline o holdout
Segmento con risposta diversaL’effetto medio nasconde eterogeneitàAnalizzare coorti o sottogruppi
Costo operativo crescenteIl risultato va valutato sul margineApplicare soglie economiche

La regola è semplice: una misura serve solo se riduce l’incertezza su una decisione specifica.

L’errore che svuota tutto

L’errore più comune è trattare l’epistemologia dei dati come una definizione da mandare a memoria invece che come un protocollo decisionale: metriche senza baseline, grafici senza ipotesi e raccomandazioni senza costo dell’errore. Il controllo che lo smaschera è una domanda sola: se questo risultato fosse falso, quale decisione sbaglierei.

Riferimenti essenziali

  • Stevens, S. S. (1946). On the Theory of Scales of Measurement. Science.
  • Squire, P. (1988). Why the 1936 Literary Digest Poll Failed. Public Opinion Quarterly.
  • Hume, D. (1748). An Enquiry Concerning Human Understanding.

Due milioni di voti, un campione sbagliato

Nel 1936 il Literary Digest raccolse oltre due milioni di schede e pronosticò la vittoria di Landon su Roosevelt alle presidenziali americane. Roosevelt vinse invece 46 stati su 48 e la rivista non si riprese mai dallo smacco. L’errore non era nella quantità ma nella costruzione: schede spedite ad abbonati ed elenchi telefonici selezionavano un’America più ricca e più repubblicana. Gallup, con un campione molto più piccolo ma costruito per quote rappresentative, azzeccò il risultato. È la lezione epistemologica in forma pura: milioni di righe distorte sanno meno di poche migliaia ben scelte.

Domande di verifica sull’evidenza

  1. Da quale fonte nasce il dato e quali trasformazioni ha subito?
  2. Chi resta fuori dal campione e come distorce la lettura?
  3. Quale taglio indipendente conferma il risultato?
  4. Cosa dichiari che questo dato non può dire?
Serve una mano concreta?

Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.

Prenota una call