Een bedrijf bouwt een classifier om de maandelijkse verkoopprestaties (1-5) van de afgelopen 20 jaar te beoordelen. De dataset bevat maand, verkoopregio, regionale totale verkoop en aantal winkels. Twee maanden per jaar vertonen consequent hoge totale verkoop (seizoenspieken). Na one-hot encoding van categorische features en training is de modelnauwkeurigheid op de validatieset slechter dan verwacht. Welke stap zal de validatienauwkeurigheid het meest waarschijnlijk verbeteren?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik een gestratificeerde train/validatie-split die de distributies voor maand en verkoopregio behoudt..
Waarom dit het antwoord is
De dataset bevat seizoenspieken en categorische features zoals maand en verkoopregio. Een gestratificeerde train/validatie-split zorgt ervoor dat de verhoudingen van deze belangrijke features (maand, verkoopregio) in zowel de trainings- als de validatieset behouden blijven. Dit voorkomt dat de validatieset een scheve representatie van de data krijgt, wat de modelprestaties op onzichtbare data beter voorspelbaar maakt en de validatienauwkeurigheid verbetert. Het verwijderen van uitschieters kan nuttig zijn, maar is minder waarschijnlijk de primaire oorzaak van slechte validatienauwkeurigheid in dit scenario, en kan leiden tot verlies van waardevolle informatie. Normalisatie van 'totale verkoop' is een goede praktijk, maar zal de validatienauwkeurigheid niet zo significant verbeteren als een correcte data-splitsing, vooral niet bij scheve verdelingen door seizoensinvloeden.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig