Een data scientist heeft een XGBoost-model getraind om frauduleuze financiële transacties te markeren. De trainingsset is zeer onevenwichtig (100.000 niet-frauduleuze versus 1.000 frauduleuze). Bij validatie toont het model een nauwkeurigheid van 99,1%, maar te veel false negatives (frauduleuze transacties voorspeld als niet-frauduleus). Welke twee acties moet de data scientist ondernemen om false negatives te verminderen?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Verhoog XGBoost's scale_pos_weight om meer gewicht te geven aan positieve (fraude) voorbeelden., Wijzig XGBoost's eval_metric om Area Under the ROC Curve (AUC) te optimaliseren..
Waarom dit het antwoord is
De dataset is sterk onevenwichtig, wat betekent dat nauwkeurigheid (accuracy) een misleidende meting is. Een model dat altijd "niet-frauduleus" voorspelt, zou al 99% nauwkeurig zijn, maar zou alle frauduleuze transacties missen (veel false negatives). Het verhogen van scaleposweight in XGBoost is cruciaal. Dit parameter geeft meer gewicht aan de zeldzame positieve klasse (fraude), waardoor het model gevoeliger wordt voor het correct classificeren van frauduleuze transacties en zo false negatives vermindert. Het optimaliseren van evalmetric voor AUC (Area Under the ROC Curve) is ook effectief. AUC is robuuster voor onevenwichtige datasets dan nauwkeurigheid en richt zich op het onderscheidend vermogen van het model tussen klassen, wat helpt bij het verminderen van false negatives. RMSE is voor regressieproblemen, niet voor classificatie. Het aanpassen van maxdepth zonder verdere analyse van bias/variantie is speculatief en niet direct gericht op het onevenwichtige probleem.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig