Analityk danych użyje SageMaker k-means do segmentacji klientów i musi wybrać optymalną liczbę klastrów (k). Które podejście wizualizacyjne najbardziej wiarygodnie zidentyfikuje najlepsze k?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Uruchom k-means dla zakresu k, oblicz sumę kwadratów błędów (SSE) dla każdego k i wykreśl SSE w funkcji k. Wybierz k w punkcie łokciowym, gdzie krzywa zaczyna maleć liniowo..
Dlaczego to jest odpowiedź
Prawidłowa odpowiedź to uruchomienie k-means dla zakresu k, obliczenie sumy kwadratów błędów (SSE) dla każdego k i wykreślenie SSE w funkcji k. Wybór k w punkcie łokciowym, gdzie krzywa zaczyna maleć liniowo, jest standardową metodą identyfikacji optymalnej liczby klastrów. Punkt łokciowy wskazuje, że dodawanie kolejnych klastrów nie przynosi już znaczącej redukcji wariancji wewnątrz klastrów. Pozostałe opcje są mniej wiarygodne: Wizualizacja klastrów na podstawie dwóch pierwszych komponentów PCA może być myląca, ponieważ te komponenty mogą nie reprezentować całej istotnej wariancji danych. Wykres wyjaśnionej wariancji w funkcji komponentów PCA służy do wyboru liczby komponentów PCA, a nie liczby klastrów k. Wykresy t-SNE są przydatne do wizualizacji danych wysokowymiarowych, ale ich interpretacja w celu wyboru k jest subiektywna i zależna od parametru perplexity, co czyni ją mniej obiektywną niż metoda łokciowa.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana