Firma posiada 10–15 TB nieskompresowanych plików .csv w Amazon S3 i planuje jednorazową ewaluację danych za pomocą Amazon Athena. Firma chce przekształcić dane, aby skrócić czas zapytań i obniżyć koszty przechowywania. Jaki format pliku i wybór kompresji najlepiej spełnia te wymagania dla zapytań Athena?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Apache Parquet skompresowany za pomocą Snappy.
Dlaczego to jest odpowiedź
Apache Parquet skompresowany za pomocą Snappy jest najlepszym wyborem. Parquet to format kolumnowy, co oznacza, że Athena może odczytywać tylko potrzebne kolumny, znacznie redukując ilość skanowanych danych i przyspieszając zapytania. Kompresja Snappy jest zoptymalizowana pod kątem szybkości dekompresji, co dodatkowo poprawia wydajność zapytań. Dodatkowo, formaty kolumnowe takie jak Parquet oferują lepsze współczynniki kompresji niż formaty wierszowe, co obniża koszty przechowywania. Pozostałe opcje są mniej optymalne: .csv skompresowany za pomocą zip: CSV to format wierszowy, więc Athena musi skanować całe wiersze, nawet jeśli potrzebna jest tylko jedna kolumna. Zip nie jest tak wydajny jak Snappy dla zapytań analitycznych. JSON skompresowany za pomocą bzip2: JSON to również format wierszowy, a bzip2 ma wolniejszą dekompresję niż Snappy, co spowolni zapytania. Apache Avro skompresowany za pomocą LZO: Avro jest formatem wierszowym, co czyni go mniej efektywnym niż Parquet dla zapytań kolumnowych. LZO jest szybsze niż bzip2, ale nadal nie oferuje zalet formatu kolumnowego.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana