Un'azienda ha aumentato notevolmente il volume di file CSV archiviati in un bucket Amazon S3. Gli script e le query di trasformazione dei dati sono diventati molto più lenti. Un ingegnere ML deve implementare una soluzione che ottimizzi i dati per le prestazioni delle query con il MINOR overhead operativo. Quale opzione soddisfa questo requisito?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Configurare un job ETL (extract, transform, and load) di AWS Glue per convertire i file .csv nel formato Apache Parquet..
Perché questa è la risposta
La conversione dei file CSV in formato Apache Parquet tramite un job AWS Glue ETL è la soluzione più efficace. Parquet è un formato di archiviazione colonnare ottimizzato per le query analitiche, che riduce significativamente la quantità di dati da leggere e migliora le prestazioni delle query. AWS Glue è un servizio serverless, minimizzando l'overhead operativo. Suddividere i file CSV in oggetti più piccoli (opzione 1) potrebbe non risolvere il problema di efficienza delle query, poiché il formato rimane lo stesso. Eliminare colonne di tipo stringa (opzione 2) non è una soluzione generale per l'ottimizzazione delle query e potrebbe comportare la perdita di dati preziosi. L'utilizzo di un cluster Amazon EMR (opzione 4) è una soluzione potente, ma introduce un overhead operativo maggiore rispetto a un job AWS Glue serverless.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta