È necessario interrogare un set di dati in Amazon S3 utilizzando Amazon Athena. Il set di dati contiene oltre 800.000 record CSV; ogni record ha 200 colonne e una dimensione di circa 1,5 MB, ma la maggior parte delle query accede solo a 5-10 colonne. Quale conversione di formato ridurrà al minimo il tempo di esecuzione delle query?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Convertire il set di dati nel formato colonnare Apache Parquet..
Perché questa è la risposta
La conversione in Apache Parquet è la soluzione migliore perché è un formato di archiviazione colonnare. Questo significa che Athena può leggere solo le colonne richieste dalla query, riducendo drasticamente la quantità di dati scansionati e, di conseguenza, il tempo di esecuzione e i costi. Inoltre, Parquet supporta la compressione e l'encoding efficienti. Il formato JSON è orientato alle righe, quindi Athena dovrebbe leggere l'intera riga anche se servono solo poche colonne. La compressione GZIP sui file CSV ridurrebbe lo spazio di archiviazione e il trasferimento di rete, ma Athena dovrebbe comunque decomprimere e scansionare tutte le colonne di ogni riga. Il formato XML è inefficiente per l'analisi di grandi volumi di dati e non offre vantaggi in termini di prestazioni rispetto al CSV per questo caso d'uso.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta