Un ingegnere dei dati deve caricare file .csv strutturati (15 colonne) in un data lake Amazon S3. Gli analisti eseguono query Amazon Athena che in genere fanno riferimento solo a una o due colonne e raramente scansionano l'intero file. Qual è l'approccio più conveniente?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Creare un job AWS Glue di estrazione, trasformazione e caricamento (ETL) per leggere dalla sorgente di dati strutturati .csv. Configurare il job per scrivere i dati nel data lake in formato Apache Parquet..
Perché questa è la risposta
L'opzione corretta è scrivere i dati in formato Apache Parquet. Parquet è un formato di file colonnare ottimizzato per l'analisi e le query efficienti, specialmente quando gli analisti interrogano solo un sottoinsieme di colonne. Questo riduce la quantità di dati scansionati da Amazon Athena, portando a costi inferiori e prestazioni migliori. I file CSV (prima opzione) sono basati su righe e richiedono la scansione dell'intero file anche per poche colonne, aumentando i costi. JSON (seconda opzione) è anch'esso basato su righe e non offre i vantaggi di Parquet per le query selettive. Apache Avro (terza opzione) è un formato basato su righe, anch'esso meno efficiente di Parquet per le query che coinvolgono solo alcune colonne.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta