Aby przyspieszyć zapytania Amazon Athena, inżynier danych stwierdza, że wszystkie pliki wejściowe to nieskompresowane pliki .csv i że większość zapytań wybiera pojedynczą kolumnę. Która zmiana NAJBARDZIEJ poprawi wydajność zapytań Athena?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Zmiana formatu danych z .csv na Apache Parquet. Zastosowanie kompresji Snappy..
Dlaczego to jest odpowiedź
Zmiana formatu danych na Apache Parquet z kompresją Snappy jest najlepszym rozwiązaniem. Parquet to kolumnowy format danych, który jest znacznie bardziej efektywny dla zapytań Athena, zwłaszcza gdy wybierana jest tylko jedna kolumna, ponieważ Athena musi odczytać tylko niezbędne kolumny. Kompresja Snappy dodatkowo zmniejsza rozmiar danych, co przyspiesza ich odczyt i zmniejsza koszty. Konwersja do JSON nie jest optymalna, ponieważ JSON jest formatem wierszowym, a nie kolumnowym, co nie poprawi wydajności odczytu pojedynczej kolumny. Sama kompresja Snappy na plikach CSV poprawi tylko szybkość odczytu, ale nie rozwiąże problemu formatu wierszowego. Kompresja Gzip jest dobra, ale Parquet z kompresją Snappy oferuje dodatkowe korzyści dzięki formatowi kolumnowemu.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana