select TWO: DetectEye exploite un modèle de fraude avec 0,3 % de classe positive et prévoit d'entraîner un modèle XGBoost sur SageMaker. L'entreprise souhaite remédier au grave déséquilibre des classes tout en préservant autant de signal que possible et en évitant l'amplification du bruit des étiquettes. Quelles sont les DEUX interventions les plus appropriées à essayer en premier dans ce contexte de production ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Appliquer SMOTE (suréchantillonnage synthétique de la minorité) sur l'ensemble d'entraînement pendant le prétraitement dans un SageMaker Processing job (en implémentant imbalanced-learn) pour augmenter les exemples de la classe minoritaire avant l'entraînement, tout en validant la qualité des échantillons synthétiques., Définir le paramètre scale_pos_weight de XGBoost (ou utiliser class_weight dans d'autres algorithmes) dans le SageMaker training job pour pondérer les exemples positifs dans l'objectif sans modifier la distribution du jeu de données..
Pourquoi c'est la réponse
SMOTE est une technique de suréchantillonnage qui génère des échantillons synthétiques de la classe minoritaire, aidant à équilibrer le jeu de données sans simplement dupliquer des exemples existants, ce qui préserve le signal et évite l'amplification du bruit des étiquettes. L'intégration via un SageMaker Processing job est une pratique courante pour le prétraitement. Le paramètre scaleposweight de XGBoost (ou classweight pour d'autres modèles) est conçu pour gérer le déséquilibre des classes en attribuant un poids plus élevé aux exemples de la classe minoritaire pendant l'entraînement, ce qui permet au modèle de prêter plus d'attention à ces exemples sans modifier la distribution physique des données. Le sous-échantillonnage aléatoire de la classe majoritaire est souvent trop agressif et peut entraîner une perte significative d'informations précieuses. L'utilisation d'Athena pour la génération synthétique au moment de la requête n'est pas une approche standard ou efficace pour SMOTE. Désactiver l'arrêt anticipé et augmenter le taux d'apprentissage sur des données brutes déséquilibrées ne résoudra pas le problème fondamental du déséquilibre des classes et pourrait même aggraver le surapprentissage ou la convergence.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise