Un'azienda ha 10-15 TB di file .csv non compressi in Amazon S3 e prevede di eseguire una valutazione una tantum utilizzando Amazon Athena. L'azienda desidera trasformare i dati per ridurre i tempi di query e abbassare i costi di archiviazione. Quale formato di file e scelta di compressione soddisfano al meglio questi requisiti per le query Athena?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Formato Apache Parquet compresso con Snappy.
Perché questa è la risposta
Apache Parquet è un formato di archiviazione colonnare ottimizzato per query analitiche, come quelle eseguite da Athena. La compressione Snappy è un codec bilanciato tra velocità di compressione/decompressione e rapporto di compressione, ideale per ridurre i tempi di query e i costi di archiviazione in S3. I file .csv compressi con zip non sono efficienti per le query analitiche a causa della loro natura basata su righe e della compressione a livello di file. JSON è un formato basato su testo, meno efficiente per l'analisi rispetto ai formati colonnari. Avro è un formato basato su righe, quindi meno performante di Parquet per le query analitiche, e LZO, sebbene veloce, potrebbe non offrire il miglior rapporto di compressione rispetto a Snappy per questo specifico caso d'uso.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta