Per velocizzare le query di Amazon Athena, un ingegnere dei dati scopre che tutti i file di input sono .csv non compressi e che la maggior parte delle query seleziona una singola colonna. Quale modifica migliorerà MAGGIORMENTE le prestazioni delle query di Athena?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Cambiare il formato dei dati da .csv ad Apache Parquet. Applicare la compressione Snappy..
Perché questa è la risposta
La risposta corretta è "Cambiare il formato dei dati da .csv ad Apache Parquet. Applicare la compressione Snappy." Spiegazione: Athena beneficia enormemente di formati di dati colonnari come Apache Parquet. Poiché la maggior parte delle query seleziona una singola colonna, Parquet consente ad Athena di leggere solo i dati rilevanti, riducendo significativamente la quantità di dati scansionati e quindi migliorando le prestazioni e riducendo i costi. La compressione Snappy è un codec di compressione veloce e bilanciato, ideale per Parquet, che riduce ulteriormente le dimensioni dei file senza imporre un carico eccessivo sulla CPU. Le altre opzioni sono meno efficaci: Convertire in JSON non è ottimale perché JSON è un formato basato su righe, non colonnare, e quindi non offre i vantaggi di Parquet per query su singole colonne. Applicare Snappy ai file CSV esistenti migliora la compressione ma non risolve il problema fondamentale della scansione di intere righe per accedere a una singola colonna. Comprimere i file CSV con gzip è efficace per ridurre le dimensioni, ma gzip è un algoritmo più lento di Snappy e, come per Snappy sui CSV, non sfrutta i vantaggi dei formati colonnari.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta