Inżynier ML musi zbudować potok, który używa Amazon Athena do dwóch rodzajów zadań: transformacji wsadowych na dużą skalę i trenowania modeli oraz zapytań o niskim opóźnieniu w czasie zbliżonym do rzeczywistego dla wnioskowania i analizy. Który format pliku zapewni NAJNIŻSZE opóźnienie zarówno dla przetwarzania wsadowego, jak i w czasie zbliżonym do rzeczywistego?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Apache Parquet.
Dlaczego to jest odpowiedź
Apache Parquet to format kolumnowy, który jest wysoce zoptymalizowany pod kątem zapytań analitycznych i przetwarzania wsadowego, oferując lepszą wydajność i niższe koszty w porównaniu do formatów wierszowych. Dzięki kompresji i kodowaniu kolumnowemu, Parquet minimalizuje ilość danych do odczytania, co przekłada się na niższe opóźnienia zarówno w przypadku dużych transformacji wsadowych, jak i zapytań o niskim opóźnieniu. CSV to format wierszowy, który nie jest zoptymalizowany pod kątem zapytań analitycznych, co prowadzi do wyższych opóźnień. Zagnieżdżony JSON i zdeserializowany JSON są również formatami wierszowymi i tekstowymi, co skutkuje większymi rozmiarami plików i wolniejszym przetwarzaniem w porównaniu do Parquet.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana