Een gesaneerde dataset heeft features waarvan de schalen ordes van grootte verschillen. Welke reeks stappen moet u volgen vóór het modelleren om de voorspellingsnauwkeurigheid in productie te maximaliseren?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Splits de dataset in trainings-, validatie- en testsets, schaal vervolgens de trainingsset opnieuw en pas dezelfde schaalparameters toe op de validatie- en testsets..
Waarom dit het antwoord is
De correcte aanpak is om eerst de dataset te splitsen in trainings-, validatie- en testsets. Vervolgens schaalt u de trainingsset en past u dezelfde schaalparameters toe op de validatie- en testsets. Dit voorkomt data-lekkage van de validatie- en testsets naar de trainingsset, wat de modelprestaties kunstmatig zou kunnen verbeteren. Willekeurige sampling (optie 1) is geen vervanging voor schaling en is niet de meest optimale eerste stap. Het schalen van de gehele dataset vóór het splitsen (optie 3) leidt tot data-lekkage, omdat informatie over de verdeling van de validatie- en testsets onbedoeld in de trainingsset terechtkomt. Het onafhankelijk schalen van elke set (optie 4) is ook incorrect, omdat dit inconsistenties introduceert en de validatie- en testsets niet langer representatief zijn voor de geschaalde trainingsdata, wat de evaluatie van het model onbetrouwbaar maakt.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig