Uno scienziato dei dati deve esplorare circa 500 GB di dati storici di inventario archiviati come file CSV in un data lake Amazon S3. Vuole usare SQL per l'esplorazione e l'azienda vuole minimizzare i costi e l'overhead operativo. Quale approccio soddisfa questi requisiti con la minima gestione operativa?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Usare AWS Glue per eseguire la scansione del bucket S3 e popolare l'AWS Glue Data Catalog, quindi interrogare i dati con Amazon Athena..
Perché questa è la risposta
L'approccio che utilizza AWS Glue e Amazon Athena è il più adatto per minimizzare i costi e l'overhead operativo. AWS Glue è un servizio serverless di estrazione, trasformazione e caricamento (ETL) che può scansionare i dati in S3, inferire lo schema e popolare l'AWS Glue Data Catalog. Amazon Athena è un servizio di query interattivo serverless che consente di analizzare i dati direttamente in S3 utilizzando SQL standard. Entrambi i servizi sono serverless, eliminando la necessità di gestire server e pagando solo per le query eseguite o per il tempo di esecuzione di Glue. Le altre opzioni comportano una maggiore gestione operativa o costi più elevati: Provisionare un cluster Amazon EMR richiede la gestione del cluster e delle sue risorse. Provisionare un cluster Amazon Redshift, sia per ingerire i dati che per creare tabelle esterne, comporta costi di provisioning e gestione del cluster, anche quando non viene utilizzato attivamente.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta