Firma znacznie zwiększyła wolumen plików CSV przechowywanych w zasobniku Amazon S3. Skrypty transformacji danych i zapytania stały się znacznie wolniejsze. Inżynier ML musi wdrożyć rozwiązanie, które zoptymalizuje dane pod kątem wydajności zapytań przy NAJMNIEJSZYM narzucie operacyjnym. Która opcja spełnia to wymaganie?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Skonfiguruj zadanie AWS Glue extract, transform, and load (ETL), aby przekonwertować pliki .csv do formatu Apache Parquet..
Dlaczego to jest odpowiedź
Poprawna odpowiedź to przekształcenie plików CSV do formatu Apache Parquet za pomocą zadania AWS Glue ETL. Parquet to kolumnowy format przechowywania danych, który jest znacznie bardziej wydajny dla zapytań analitycznych niż format wierszowy, taki jak CSV. Przechowuje dane w sposób skompresowany i zoptymalizowany pod kątem odczytu tylko wymaganych kolumn, co drastycznie skraca czas zapytań i zmniejsza koszty. AWS Glue to usługa bezserwerowa, co minimalizuje narzut operacyjny, ponieważ nie trzeba zarządzać żadnymi serwerami. Inne opcje są mniej optymalne: Dzielenie plików CSV na mniejsze obiekty może pomóc w równoległym przetwarzaniu, ale nie rozwiązuje problemu nieefektywnego formatu danych. Usuwanie kolumn typu string nie jest uniwersalnym rozwiązaniem optymalizacji wydajności i może prowadzić do utraty danych. Konfiguracja klastra Amazon EMR wymaga zarządzania infrastrukturą, co zwiększa narzut operacyjny w porównaniu do bezserwerowego AWS Glue.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana