Een data scientist bouwt een binaire ziekteclassificatie uit een willekeurige steekproef van 400 patiënten, waarbij de prevalentie van de ziekte ongeveer 3% is. Welke cross-validatiestrategie is het meest geschikt om het model te evalueren?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gestratificeerde k-fold cross-validatie met k = 5..
Waarom dit het antwoord is
Gestratificeerde k-fold cross-validatie is het meest geschikt omdat de dataset een onevenwichtige klassebalans heeft (3% prevalentie). Deze methode zorgt ervoor dat elke fold een vergelijkbare verhouding van de klassen behoudt als de originele dataset. Dit is cruciaal voor het nauwkeurig evalueren van modellen op zeldzame klassen. Standaard k-fold cross-validatie zou kunnen leiden tot folds met geen of zeer weinig positieve gevallen, wat de modeltraining en -evaluatie onbetrouwbaar maakt. Een 80/20 train/validatie split, zelfs gestratificeerd, is minder robuust dan k-fold cross-validatie, omdat het model slechts één keer wordt geëvalueerd op één specifieke splitsing van de data, wat de variantie van de prestatieschatting kan vergroten. Het herhalen van standaard k-fold cross-validatie helpt niet voldoende bij het probleem van de onevenwichtige klassenverdeling in elke fold.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig