Inżynier danych musi załadować ustrukturyzowane pliki .csv (15 kolumn) do jeziora danych Amazon S3. Analitycy uruchamiają zapytania Amazon Athena, które zazwyczaj odwołują się tylko do jednej lub dwóch kolumn i rzadko skanują cały plik. Które podejście jest najbardziej opłacalne?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Utwórz zadanie AWS Glue do ekstrakcji, transformacji i ładowania (ETL), aby odczytać dane ze strukturalnego źródła danych .csv. Skonfiguruj zadanie tak, aby zapisywało dane do jeziora danych w formacie Apache Parquet..
Dlaczego to jest odpowiedź
Najbardziej opłacalnym podejściem jest użycie zadania AWS Glue ETL do przekształcenia danych z formatu CSV na Apache Parquet. Parquet to format kolumnowy, który jest znacznie bardziej efektywny kosztowo i wydajny dla zapytań Athena, zwłaszcza gdy analitycy odwołują się tylko do podzbioru kolumn. Athena skanuje tylko potrzebne kolumny, zmniejszając ilość skanowanych danych i koszty. Importowanie danych jako .csv (opcja A) nie przyniesie korzyści z formatu kolumnowego. Format JSON (opcja B) jest formatem wierszowym, co jest mniej efektywne niż Parquet dla zapytań kolumnowych. Apache Avro (opcja C) to również format wierszowy, choć oferuje schemat, nie zapewnia optymalizacji kosztów i wydajności formatu kolumnowego, takiego jak Parquet, dla tego scenariusza.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana