Amazon DEA-C01: Archiviazione dei dati e architettura del Lake — Guida allo studio

Fa parte della Amazon Data Engineer Associate DEA-C01 — Guida allo studio. Esercitati con risposte verificate nel centro esami Amazon, oppure fai test cronometrati su ExamRoll.io.

Questo dominio tratta di come i servizi di storage e i motori di database AWS supportino l’ingestion di dati su larga scala, l’archiviazione durevole, le prestazioni delle query e la governance sicura nelle moderne piattaforme dati. I data engineer devono bilanciare costi, latenza di accesso, durabilità e controllo granulare degli accessi durante l’integrazione di servizi come S3, Lake Formation, Redshift e DynamoDB nelle pipeline. Comprendere i compromessi tra le classi di storage, l’automazione del ciclo di vita, lo storage gestito rispetto a quello locale e i pattern di partizionamento previene sorprese in termini di prestazioni e costi in produzione.

Classi di storage e policy del ciclo di vita di Amazon S3

S3 offre diverse classi di storage e controlli del ciclo di vita per ottimizzare i costi e i pattern di accesso. È possibile configurare la classe di storage al momento del caricamento (dalla console o tramite CLI:

undefined

) o utilizzare le regole del ciclo di vita del bucket (

undefined

). Intelligent-Tiering sposta automaticamente gli oggetti tra i livelli di accesso frequente e infrequente e prevede una piccola tariffa di monitoraggio; è consigliabile abilitarlo per pattern di accesso sconosciuti o variabili. Utilizzare le regole del ciclo di vita per trasferire gli oggetti a GLACIER o DEEP_ARCHIVE per la conservazione a lungo termine e per far scadere/eliminare le versioni precedenti.

Criteri decisionali e compromessi:

Note operative:

undefined

) e l’object lock (

undefined

) per l’immutabilità; l’abilitazione di MFA Delete richiede operazioni CLI speciali e l’account del proprietario del bucket con MFA.

Progettazione di un data lake con S3 e Lake Formation

Progettare un data lake con S3 come object store centrale e Lake Formation per il controllo degli accessi centralizzato e la catalogazione. Registrare le location S3 come risorse di Lake Formation, impostare un AWS Glue Data Catalog e utilizzare le concessioni (grant) di Lake Formation per database/tabelle (

undefined

). Lake Formation può applicare controlli granulari: a livello di colonna, a livello di riga (con espressioni di filtro) e mascheramento a livello di cella utilizzando LF-tag e filtri dati applicati alle query di Glue/Athena.

Pattern chiave di configurazione e governance:

Punti decisionali:

Architettura e storage di Amazon Redshift

Redshift separa il calcolo (compute) e lo storage gestito sui nodi RA3 rispetto ai nodi DS2 supportati da SSD locali. I nodi RA3 utilizzano Redshift Managed Storage (RMS), in cui i dati risiedono su Amazon S3 gestito dal cluster; scegliere RA3 per uno storage scalabile con prestazioni di query costanti e la possibilità di pagare separatamente per il calcolo. I nodi DS2 archiviano i dati su dischi locali dell’istanza, il che richiede un attento dimensionamento e ridimensionamento man mano che i dati crescono.

Dettagli di configurazione e operativi:

undefined

.

undefined

) è referenziato nel comando COPY come credenziali ‘aws_iam_role=arn:…’.

Confronto (RA3 vs DS2):

DynamoDB e selezione di database purpose-built

Scegliere DynamoDB per carichi di lavoro chiave-valore e a documenti su larga scala che richiedono una latenza nell’ordine dei millisecondi a singola cifra. La progettazione della tabella dipende dalla selezione della chiave di partizione (e della chiave di ordinamento opzionale): utilizzare chiavi ad alta cardinalità e ben distribuite per evitare partizioni calde (hot partition). Per chiavi sequenziali o basate su timestamp, implementare un prefisso casuale (sharding) o usare UUID per distribuire le scritture. Utilizzare la capacità on-demand per evitare il provisioning, ma considerare la capacità con provisioning e autoscaling per carichi di lavoro prevedibili e per sfruttare la capacità adattiva sulle partizioni calde.

Note pratiche di configurazione:

Criteri decisionali per la selezione del motore:

Errori Comuni e Criteri Decisionali

Problema Pratico: Scenario d’Uso

Acme Media deve archiviare 50 TB di video grezzi in ingresso, fornire agli analisti accesso in query ai metadati trasformati e applicare un accesso a livello di riga e colonna per diverse unità di business, minimizzando al contempo i costi di archiviazione.

  1. Ingestire i video grezzi in S3 usando il multipart upload, taggare gli oggetti per data di ingestione e dataset, utilizzare Intelligent-Tiering per i pattern di accesso inizialmente sconosciuti.
  2. Configurare regole di ciclo di vita per trasferire i media su GLACIER o DEEP_ARCHIVE dopo un periodo di conservazione configurabile (assicurare un allineamento di 30+ giorni per Standard-IA, se viene preso in considerazione).
  3. Registrare le location S3 in Lake Formation, creare crawler Glue per popolare il Data Catalog e concedere permessi a livello di riga e colonna basati su tag di Lake Formation alle unità di business.
  4. Archiviare i metadati curati in Redshift RA3 per l’analisi; associare un ruolo IAM al cluster per il comando COPY da S3 e utilizzare le operazioni VACUUM/ANALYZE durante le finestre di manutenzione.
  5. Utilizzare DynamoDB con chiavi UUID sottoposte ad hash per una tabella di lookup ad alto throughput dei manifest dei video e abilitare la capacità on-demand per assorbire i picchi di traffico.

Motivazione: Questo approccio isola i costi di archiviazione a freddo (cold storage) con le classi Glacier, utilizza Intelligent-Tiering per pattern sconosciuti, applica Lake Formation per un controllo degli accessi sicuro e granulare su tutti i motori di analisi, e seleziona RA3 per uno storage analitico scalabile, mentre DynamoDB gestisce le ricerche operative a bassa latenza.


Ingestione e raccolta dei dati · Tutti i domini · Catalogazione dei dati e gestione dei metadati

Esercitati su queste domande → · Pratica cronometrata su ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Supera l'esame →

Sfoglia Amazon →

Related guides

Accesso tutto incluso

Un abbonamento. Ogni esame.

Ogni piano sblocca la ricerca illimitata di risposte, test pratici, spiegazioni AI e la libreria completa di risorse — in oltre 20 lingue.

Mensile
24.87
Just €0.83/day
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

Miglior valore
12 mesi
179.87
Just €0.49/daySave 40%
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

✓ Piano gratuito incluso · ✓ Annulla in qualsiasi momento · ✓ Tutti i piani sbloccano il prodotto completo