Een data scientist analyseert werkgelegenheidsgegevens met ongeveer 10 miljoen rijen en 10 features. De inkomens- en leeftijdsdistributies zijn beide rechtsscheef. Welke featuretransformaties zouden helpen om scheefheid te corrigeren? (Selecteer twee.)
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Numerieke waarden binnnen, Een logaritmische transformatie toepassen.
Waarom dit het antwoord is
Numerieke waarden binnnen (binning) is correct omdat het helpt bij het omgaan met scheve distributies door continue numerieke gegevens te groeperen in discrete intervallen of 'bakken'. Dit kan de impact van uitschieters verminderen en de distributie symmetrischer maken, wat gunstig is voor veel machine learning-modellen. Een logaritmische transformatie toepassen is ook correct. Logaritmische transformaties (zoals log, log10, log1p) zijn zeer effectief in het verminderen van rechtsscheefheid in positieve gegevens, zoals inkomens- en leeftijdsdistributies. Ze comprimeren de hogere waarden en spreiden de lagere waarden, waardoor de distributie normaler wordt. Cross-validation is een techniek voor model-evaluatie en heeft geen invloed op feature-scheefheid. Een polynomiale transformatie van hoge graad toepassen kan de complexiteit verhogen en overfitten veroorzaken, en is niet primair gericht op het corrigeren van scheefheid. One-hot encoding is voor categorische variabelen en niet voor het corrigeren van scheefheid in numerieke distributies.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig