Een ML-engineer bouwt een model om huizen- en appartementprijzen te voorspellen met behulp van drie features: vierkante meters, prijs en bouwjaar. De dataset (10.000 rijen) bevat extreme waarden: één zeer grote villa en één extreem klein appartement. Welke voorverwerkingsaanpak moet worden gebruikt om ervoor te zorgen dat het model nauwkeurige voorspellingen doet voor typische eigendommen?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Verwijder de uitschieters en pas een logtransformatie toe op de feature Square Meters..
Waarom dit het antwoord is
De correcte aanpak is om uitschieters te verwijderen en een logtransformatie toe te passen op 'vierkante meters'. Uitschieters, zoals een extreem grote villa of een zeer klein appartement, kunnen de modeltraining vertekenen en de prestaties op typische data verminderen. Het verwijderen ervan helpt het model om zich te concentreren op de meer representatieve gegevens. Een logtransformatie is nuttig wanneer gegevens scheef verdeeld zijn, wat vaak het geval is bij oppervlaktematen. Het comprimeert de grotere waarden en spreidt de kleinere waarden, waardoor de verdeling symmetrischer wordt en het model beter kan leren van de variatie. Normalisatie (optie 2) schaalt waarden, maar pakt de invloed van uitschieters niet aan. One-hot encoding (opties 3 en 4) is bedoeld voor categorische features, niet voor numerieke features zoals 'vierkante meters'. Het behouden van uitschieters (opties 2 en 4) is ongeschikt omdat ze de modeltraining negatief beïnvloeden.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig