Un'azienda riceve quotidianamente un file .xls di circa 2 GB in S3 contenente dati dei clienti. Un ingegnere dei dati concatena le colonne del nome e del cognome e deve contare il numero di clienti distinti nel file. Quale approccio richiede il minor sforzo operativo?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare AWS Glue DataBrew per creare una "ricetta" che usa la funzione di aggregazione COUNT_DISTINCT per calcolare il numero di clienti distinti..
Perché questa è la risposta
L'opzione corretta è usare AWS Glue DataBrew. DataBrew è uno strumento visuale di preparazione dei dati che permette di pulire, normalizzare e trasformare i dati senza scrivere codice. Per un file Excel di 2 GB, la creazione di una "ricetta" con la funzione COUNTDISTINCT per i clienti distinti è un approccio a basso sforzo operativo, poiché DataBrew gestisce l'infrastruttura sottostante. Le altre opzioni richiedono maggiore sforzo operativo: Un job Apache Spark (sia su AWS Glue che su EMR Serverless) richiede la scrittura di codice Spark, configurazione e gestione del job. L'uso di AWS Glue Crawler e Amazon Athena richiede la creazione del crawler, l'attesa della catalogazione e poi la scrittura di query SQL, che è più manuale rispetto a DataBrew per questa specifica operazione.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta