Un'azienda vuole eseguire analisi di machine learning (ML) su dati in un data lake S3. Ha due esigenze di trasformazione: (1) eseguire trasformazioni giornaliere pianificate su 300 GB di dati in vari formati che arrivano a un'ora prestabilita e (2) eseguire una trasformazione una tantum su terabyte di dati archiviati nel lake. I DAG di Amazon MWAA orchestreranno i workflow. Quali due attività dovrebbero essere pianificate dai DAG per soddisfare queste esigenze nel modo più conveniente? (Scegliere due.)
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Per i dati in arrivo giornalieri, utilizzare gli AWS Glue crawlers per scansionare e identificare lo schema., Per i dati giornalieri e archiviati, utilizzare Amazon EMR per eseguire le trasformazioni dei dati..
Perché questa è la risposta
Gli AWS Glue crawlers sono ideali per i dati in arrivo giornalieri perché scansionano automaticamente i dati in S3, deducono lo schema e lo registrano nell'AWS Glue Data Catalog. Questo è fondamentale per i dati che arrivano in vari formati e a un'ora prestabilita, consentendo ad altri servizi di interrogare i dati in modo efficiente. Amazon EMR è la scelta più conveniente per trasformazioni su larga scala (terabyte di dati archiviati e 300 GB giornalieri) grazie alla sua scalabilità e al supporto per framework come Spark, Hive e Presto, che sono efficienti per l'elaborazione ETL complessa. Amazon Athena non è adatto per identificare lo schema, ma per interrogare i dati. Amazon Redshift è un data warehouse, non uno strumento di trasformazione per data lake. Amazon SageMaker è per ML, non per trasformazioni ETL generiche.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta