Amazon DEA-C01: Catalogazione dei dati e gestione dei metadati — Guida allo studio

Fa parte della Amazon Data Engineer Associate DEA-C01 — Guida allo studio. Esercitati con risposte verificate nel centro esami Amazon, oppure fai test cronometrati su ExamRoll.io.

Questo dominio copre il livello di metadati che rende i dati individuabili, interrogabili e governabili su una piattaforma dati AWS. Una catalogazione e una gestione dei metadati efficaci riducono gli ostacoli per l’analisi e garantiscono che i consumatori a valle possano trovare schemi, partizioni, policy di accesso e lineage. I servizi AWS in quest’area — Glue Data Catalog, Glue Schema Registry, Lake Formation, l’integrazione con Athena e DataBrew — forniscono strumenti complementari per l’individuazione, l’evoluzione dello schema, la governance e il profiling. Comprendere come questi servizi interagiscono, i dettagli della loro configurazione e le tipiche modalità di fallimento è essenziale per l’affidabilità operativa e la sicurezza.

Struttura e operazioni di AWS Glue Data Catalog

Il Glue Data Catalog è il repository di metadati centralizzato e regionale per database, tabelle, partizioni, connessioni e classificatori definiti dall’utente. Le primitive principali sono:

undefined

).

undefined

). È possibile crearla/aggiornarla tramite console, API di Glue o CloudFormation; es.,

undefined

.

undefined

) o aggiunte esplicitamente (

undefined

).

Pattern operativi:

Criteri decisionali:

Individuazione ed evoluzione dello schema

Lo Schema Registry e gli schemi di Glue supportano Avro, JSON e Protobuf per lo streaming e per contratti producer/consumer di lunga durata. Funzionalità chiave:

undefined

).

Pattern pratici di configurazione ed evoluzione:

Criteri decisionali:

Data lineage e governance con Lake Formation

Lake Formation si basa sul Glue Data Catalog per fornire controllo degli accessi a grana fine, auditing e controlli di lineage. Funzionalità principali:

undefined

.

Pattern di configurazione:

Criteri decisionali:

Integrazione tra Athena e il catalogo Glue

Athena si basa sul Glue Data Catalog per i metadati. Punti di integrazione comuni e controlli operativi:

Complemento con Glue DataBrew:

Criteri decisionali:

Errori Comuni e Criteri Decisionali

Problema Pratico: Scenario d’Uso

Acme Retail riceve file di vendita orari su S3 con partizioni per data/ora e gli analisti interrogano i dati in Athena; dopo il caricamento, gli utenti riscontrano errori nelle query e risultati non aggiornati perché le partizioni non sono visibili nel Glue Data Catalog.

  1. Implementare una notifica di evento S3 PUT per invocare una funzione Lambda che chiami aws glue batch-create-partition per registrare immediatamente la nuova partizione.
  2. Per dati più vecchi o per backfill, pianificare una query Athena che esegua MSCK REPAIR TABLE db.sales_hourly; o eseguire un aws glue batch-create-partition mirato per intervalli noti.
  3. Se le partizioni seguono una convenzione di denominazione rigorosa per data/ora, abilitare la proiezione delle partizioni sulla tabella Glue (impostare projection.enabled=true e definire le proprietà per anno/mese/giorno/ora) per eliminare i costi di aggiornamento del catalogo.
  4. Aggiungere LF-Tags per la sensibilità dei dati alla tabella e concedere agli analisti i permessi di Lake Formation in modo che le query Athena siano consentite e governate.
  5. Usare Glue DataBrew per profilare i nuovi file orari in un ambiente di staging per individuare deviazioni dello schema (schema drift); se vengono trovate modifiche allo schema, registrare nuove versioni dello schema nel Glue Schema Registry e validare la compatibilità prima del rollout in produzione.

Logica: la registrazione automatica delle partizioni o la proiezione rimuove il ritardo dei metadati che causa il fallimento delle query Athena; abbinare questo alla governance di Lake Formation assicura un accesso sicuro, e la profilazione guidata da DataBrew rileva precocemente lo schema drift, mentre il Glue Schema Registry protegge i consumer di streaming e batch da modifiche di schema incompatibili.


Archiviazione dei dati e architettura del Lake · Tutti i domini · Trasformazione ed elaborazione dei dati

Esercitati su queste domande → · Pratica cronometrata su ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Supera l'esame →

Sfoglia Amazon →

Related guides

Accesso tutto incluso

Un abbonamento. Ogni esame.

Ogni piano sblocca la ricerca illimitata di risposte, test pratici, spiegazioni AI e la libreria completa di risorse — in oltre 20 lingue.

Mensile
24.87
Just €0.83/day
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

Miglior valore
12 mesi
179.87
Just €0.49/daySave 40%
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

✓ Piano gratuito incluso · ✓ Annulla in qualsiasi momento · ✓ Tutti i piani sbloccano il prodotto completo