Otrzymujesz plik Apache Parquet o rozmiarze 50 MB dla modelu wykrywania oszustw, który zawiera kilka skorelowanych, niepotrzebnych kolumn. Jaki jest sposób wymagający najmniejszego wysiłku, aby usunąć te kolumny z pliku?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Utwórz przepływ danych w SageMaker Data Wrangler i dodaj krok transformacji, aby usunąć niepotrzebne kolumny..
Dlaczego to jest odpowiedź
Najmniejszy wysiłek wymaga utworzenia przepływu danych w SageMaker Data Wrangler i dodania kroku transformacji w celu usunięcia niepotrzebnych kolumn. Data Wrangler to narzędzie bezkodowe lub z minimalnym kodem, które wizualnie ułatwia czyszczenie i przygotowywanie danych, co czyni je idealnym do tego zadania. Pobieranie pliku lokalnie i używanie niestandardowego skryptu wymaga ręcznej pracy i konfiguracji środowiska. Zadanie Apache Spark na Amazon EMR jest potężne, ale zbyt skomplikowane i kosztowne dla pliku o rozmiarze 50 MB. Uruchomienie zadania przetwarzania SageMaker za pomocą SageMaker Python SDK wymaga napisania kodu, co jest bardziej pracochłonne niż użycie Data Wrangler.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana