Ein Data Scientist hat ein XGBoost-Modell trainiert, um betrügerische Finanztransaktionen zu kennzeichnen. Der Trainingsdatensatz ist stark unausgewogen (100.000 nicht-betrügerische vs. 1.000 betrügerische Transaktionen). Bei der Validierung zeigt das Modell eine Genauigkeit von 99,1 %, aber zu viele falsch negative Ergebnisse (betrügerische Transaktionen, die als nicht-betrügerisch vorhergesagt werden). Welche zwei Maßnahmen sollte der Data Scientist ergreifen, um falsch negative Ergebnisse zu reduzieren?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: XGBoost's scale_pos_weight erhöhen, um positiven (Betrugs-)Beispielen mehr Gewicht zu verleihen., XGBoost's eval_metric ändern, um die Fläche unter der ROC-Kurve (AUC) zu optimieren..
Warum dies die Antwort ist
Der Datensatz ist stark unausgewogen, und das Modell hat zu viele falsch negative Ergebnisse. 1. XGBoost's scaleposweight erhöhen, um positiven (Betrugs-)Beispielen mehr Gewicht zu verleihen: Bei unausgewogenen Datensätzen kann das Erhöhen von scaleposweight (Verhältnis von negativen zu positiven Instanzen) dazu führen, dass das Modell die Minderheitsklasse (betrügerische Transaktionen) stärker gewichtet. Dies hilft, falsch negative Ergebnisse zu reduzieren, da das Modell empfindlicher auf Betrug reagiert. 2. XGBoost's evalmetric ändern, um die Fläche unter der ROC-Kurve (AUC) zu optimieren: Die Genauigkeit (Accuracy) ist bei unausgewogenen Datensätzen irreführend. Eine hohe Genauigkeit kann erreicht werden, indem einfach die Mehrheitsklasse vorhergesagt wird. AUC ist eine bessere Metrik für unausgewogene Datensätze, da sie die Fähigkeit des Modells bewertet, positive und negative Klassen zu unterscheiden, unabhängig vom Schwellenwert. Die Optimierung von AUC hilft, ein besseres Gleichgewicht zwischen falsch positiven und falsch negativen Ergebnissen zu finden. Das Erhöhen von maxdepth könnte zu Overfitting führen, während das Verringern zu Underfitting führen könnte, aber das Hauptproblem hier ist die Klassenungleichheit und die Metrikwahl. Die Optimierung von RMSE ist für Regressionsprobleme gedacht, nicht für Klassifizierungsprobleme wie dieses.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich