Een engineer gebruikt SageMaker Data Wrangler en ontdekt een tekstuele categorische feature met duizenden licht verschillende waarden, veroorzaakt door spelfouten. Welke coderingsmethode moet worden gebruikt, zodat de verwerkte feature kan worden gebruikt voor classificatie?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik similarity encoding om nauw verwante categorieën te groeperen en weer te geven..
Waarom dit het antwoord is
Similarity encoding is de meest geschikte methode omdat het speciaal is ontworpen om om te gaan met categorische features met een groot aantal vergelijkbare, maar niet identieke waarden, zoals spelfouten. Het groepeert en codeert deze nauw verwante waarden, waardoor de dimensionaliteit wordt verminderd en de feature bruikbaar wordt voor classificatiemodellen. Ordinale codering is ongeschikt omdat er geen inherente volgorde is tussen de spelfouten. One-hot encoding zou leiden tot een extreem hoge dimensionaliteit (duizenden kolommen), wat inefficiënt is en kan leiden tot het 'curse of dimensionality'. Target encoding is ook minder geschikt, omdat het de categorieën codeert op basis van de relatie met de target variabele, wat niet direct het probleem van spelfouten oplost.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig