DetectEye obsługuje model wykrywania oszustw z 0,3% klasą pozytywną i planuje trenować model XGBoost na SageMaker. Chcą rozwiązać problem poważnej nierównowagi klas, zachowując jak najwięcej sygnału i unikając wzmacniania szumu etykiet. Które DWA rozwiązania są najbardziej odpowiednie do wypróbowania w pierwszej kolejności w tym kontekście produkcyjnym?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Zastosuj SMOTE (syntetyczne nadpróbkowanie mniejszości) na zbiorze treningowym podczas wstępnego przetwarzania w zadaniu SageMaker Processing (implementując imbalanced-learn), aby zwiększyć liczbę przykładów klasy mniejszościowej przed treningiem, jednocześnie walidując jakość syntetycznych próbek., Ustaw scale_pos_weight XGBoost (lub użyj class_weight w innych algorytmach) w zadaniu treningowym SageMaker, aby zwiększyć wagę przykładów pozytywnych w funkcji celu bez zmiany rozkładu zbioru danych..
Dlaczego to jest odpowiedź
Prawidłowe odpowiedzi to zastosowanie SMOTE i ustawienie scaleposweight. SMOTE (Synthetic Minority Over-sampling Technique) jest skuteczną metodą radzenia sobie z niezrównoważonymi klasami, ponieważ generuje syntetyczne próbki klasy mniejszościowej, zwiększając jej reprezentację bez utraty informacji z klasy większościowej. Walidacja jakości syntetycznych próbek jest kluczowa, aby uniknąć wzmocnienia szumu. Ustawienie scaleposweight w XGBoost (lub classweight w innych algorytmach) to kolejna sprawdzona technika. Zwiększa ona wagę błędów dla klasy pozytywnej podczas treningu, co skłania model do większej uwagi na rzadką klasę, nie zmieniając fizycznie rozkładu danych. Losowe niedopróbkowanie klasy większościowej jest niewskazane, ponieważ odrzucanie 99% danych większościowych prowadzi do znacznej utraty informacji, co negatywnie wpływa na zdolność modelu do generalizacji. Użycie Athena do generowania syntetycznych danych w czasie zapytania jest niepraktyczne i nieefektywne dla złożonych algorytmów takich jak SMOTE. Wyłączenie wczesnego zatrzymywania i zwiększenie szybkości uczenia na niezbalansowanych danych może prowadzić do przetrenowania i niestabilności modelu, zamiast rozwiązywać problem nierównowagi klas.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana