Masz tabelaryczny zbiór danych ze 150 skorelowanymi cechami, które mają różne zakresy numeryczne, i musisz zredukować wymiarowość z minimalnym wpływem na wydajność modelu przed trenowaniem modelu regresji. Które podejście do wstępnego przetwarzania spełnia ten cel?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Otwórz dane w SageMaker Data Wrangler, przeskaluj cechy za pomocą Min-Max scaler, a następnie zastosuj wbudowany algorytm PCA SageMaker do przeskalowanych danych..
Dlaczego to jest odpowiedź
Poprawna odpowiedź to przeskalowanie cech za pomocą Min-Max scaler, a następnie zastosowanie PCA. PCA jest wrażliwe na skalę danych, dlatego przeskalowanie przed jego zastosowaniem jest kluczowe, aby cechy o większych zakresach nie dominowały w obliczeniach. Min-Max scaler jest odpowiedni, ponieważ normalizuje cechy do wspólnego zakresu (np. 0-1), co jest korzystne dla PCA. SageMaker Data Wrangler ułatwia te kroki. Bezpośrednie zastosowanie PCA do surowych danych (opcja 1) jest nieprawidłowe ze względu na wrażliwość PCA na skalę. Usuwanie cech na podstawie korelacji (opcje 3 i 4) przed PCA nie jest optymalne, ponieważ PCA samo w sobie radzi sobie z korelacjami, a usunięcie cech może prowadzić do utraty informacji. Standard Scaler (opcja 3) jest alternatywą, ale Min-Max jest często preferowany, gdy chcesz ograniczyć cechy do określonego zakresu.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana