Inżynier ML będzie używał Amazon SageMaker Canvas do trenowania modelu na złożonych danych przechowywanych w Amazon S3. Który format pliku zminimalizuje czas wstępnego przetwarzania tych danych?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Pliki Apache Parquet.
Dlaczego to jest odpowiedź
Pliki Apache Parquet są optymalne dla złożonych danych w Amazon S3, ponieważ są to kolumnowe formaty danych, które umożliwiają efektywne przechowywanie i przetwarzanie. Dzięki temu SageMaker Canvas może odczytywać tylko niezbędne kolumny, co znacząco przyspiesza wstępne przetwarzanie i zmniejsza zużycie zasobów. Kompresja i partycjonowanie w Parquet dodatkowo poprawiają wydajność. Pliki CSV i JSON, nawet skompresowane, są formatami wierszowymi, co oznacza, że do przetworzenia części danych często trzeba odczytać cały plik, co jest mniej efektywne dla dużych, złożonych zbiorów danych. JSONL jest lepszy niż zwykły JSON, ale nadal jest formatem wierszowym.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana