Je hebt een tabulaire dataset met 10.000 rijen en 1.020 features. Er zijn geen ontbrekende waarden, weinig duplicaten en ongeveer 200 feature-paren met een correlatie van > 0,9. De gemiddelden van de features lijken op de medianen. Welke feature-engineering-aanpak moet je toepassen bij het trainen van een model in SageMaker?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Verminder de dimensionaliteit door Principal Component Analysis (PCA) toe te passen..
Waarom dit het antwoord is
De dataset heeft een groot aantal features (1020) en veel sterk gecorreleerde feature-paren ( 0,9). Dit duidt op redundantie en hoge dimensionaliteit, wat kan leiden tot overfitting en langere trainingstijden. PCA is een effectieve techniek voor dimensionaliteitsreductie die deze gecorreleerde features omzet in een kleinere set van ongecorreleerde componenten, terwijl de meeste variantie behouden blijft. Dit verbetert de modelprestaties en efficiëntie. Het verwijderen van features met lage correlatiescores is niet optimaal, omdat deze nog steeds waardevolle informatie kunnen bevatten. Anomaliedetectie is geen feature-engineering-techniek voor dit probleem. Het samenvoegen van sterk gecorreleerde features is een handmatige en minder systematische aanpak dan PCA.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig