
Catalogo dati e governance su S3
Costruire un catalogo dati centralizzato con AWS Glue e gestire accesso, audit e lineage.
Cosa imparerai
- Registrare le tabelle nel Glue Catalog con schema, formato e posizione
- Definire permessi a livello di colonna e riga con Lake Formation
- Tracciare il lineage dalla sorgente alla dashboard per risalire ai numeri sospetti
Collegamenti
Catalogo dati e governance su S3
Questa lezione del binario ml-tabellare cambia prospettiva: finora abbiamo costruito il lake, ora impariamo a governarlo. Un lake senza catalogo diventa in fretta una lista di percorsi S3 che capiscono in pochi. Governare quei dati non vuol dire bloccare tutto: vuol dire sapere cosa esiste, chi lo possiede, chi può leggerlo e con quali limiti. Conta meno la definizione e più la decisione che cambia quando un dataset diventa scopribile, descritto, classificato e affidabile.
La governance in una frase
La governance del lake rende ogni tabella scopribile, classificata e leggibile solo dai ruoli autorizzati, con proprietario e percorso dei dati sempre tracciati. È il livello che separa un archivio da una risorsa aziendale.
Il percorso di implementazione, in sei passi
- Registra ogni tabella nel
Glue Catalogcon schema, formato e posizione unici. - Classifica le colonne con dati personali e assegna un proprietario a ogni dataset.
- Definisci in
Lake Formationchi vede quali tabelle, colonne e righe per ruolo. - Verifica con un ruolo di prova che il marketing veda aggregati e la finanza veda transazioni senza dati personali esposti.
- Traccia il percorso dalla sorgente alla dashboard e risali la catena al primo numero sospetto.
- Riesamina permessi, classificazioni e proprietari a ogni nuovo dataset prima di pubblicarlo.
Glue Data Catalog: il punto unico dei metadati
Glue registra i metadati delle tabelle: nomi colonne, tipi, partizioni, formato, posizione S3. Ogni tabella diventa interrogabile da Athena, Redshift Spectrum, EMR e Glue ETL. Senza Glue dovresti definire lo schema in ogni tool separatamente. Con Glue lo definisci una volta e tutti i tool lo vedono.
Il crawler è il processo automatico che scansiona S3, inferisce lo schema e crea o aggiorna le definizioni delle tabelle. Funziona bene con dati semi-strutturati che cambiano schema nel tempo.
Lake Formation: dal permesso binario al controllo granulare
Senza Lake Formation il controllo accessi su S3 è binario: accesso al bucket sì o no. Con Lake Formation puoi definire chi vede quali colonne, chi vede quali righe tramite filtri e chi vede quali tabelle o database.
Un esempio rende l’idea: l’analyst marketing vede la tabella customers ma senza le colonne PII come email e telefono, e solo i clienti EU. Verdetto: permessi binari sul bucket per i casi semplici, Lake Formation con sicurezza a colonna e riga appena entrano dati personali nel lake.
Data lineage: sapere da dove arrivano i numeri
Sapere da dove vengono i dati serve a fidarsi del risultato e a fare debug. Glue, Athena e strumenti come DataHub o OpenLineage tracciano in automatico il percorso da S3 alla tabella Glue alla query Athena alla dashboard. Quando una dashboard mostra numeri sbagliati, risali il lineage fino alla sorgente invece di tirare a indovinare.
Riferimenti:
- AWS. (2024). “AWS Glue Developer Guide.” docs.aws.amazon.com/glue.
- AWS. (2024). “AWS Lake Formation.” aws.amazon.com/lake-formation/.
Gli errori che fanno fallire la governance
Il primo errore è registrare tabelle nel catalogo senza proprietario né classificazione, così nessuno sa chi autorizza l’accesso ai dati personali. Il secondo è restare su permessi binari a livello di bucket quando il lake contiene PII, perché un solo ruolo troppo ampio espone colonne che dovrebbero restare nascoste. Il terzo è trascurare il lineage: quando una dashboard mostra numeri sospetti, il team ricostruisce il percorso a mano invece di risalire la catena in minuti.
Come si è costruito il mercato: Glue 2017, Lake Formation 2019
AWS presenta Glue nel 2017 come catalogo e servizio di integrazione che registra schema e posizione delle tabelle una sola volta per tutti i motori. Nel 2019 aggiunge Lake Formation per portare permessi a livello di colonna e riga sopra lo stesso catalogo. La sequenza mostra la direzione del settore: prima un unico punto di verità sui metadati, poi controlli granulari senza duplicare i dati. Un lake senza questi due strati resta una lista di percorsi S3 che capiscono in pochi.
Domande finali di verifica
- Quale metadato del
Glue Catalogrende una tabella interrogabile daAthenasenza ridefinire lo schema? - Quando la sicurezza a livello di colonna protegge meglio del permesso binario sul
bucket? - Quale filtro di riga applica la regola che limita il marketing ai soli clienti europei?
- Quale passaggio del
lineagesegui per primo quando una dashboard mostra numeri sospetti?
Bloccato su questo argomento o vuoi applicarlo al tuo caso? Prenota una call di 15 minuti con un analista esperto.
Percorso collegato
Lezioni da leggere insieme
Questi collegamenti portano la lezione dentro il resto del corso: basi da riprendere, passaggi successivi e connessioni tematiche tra moduli.