Je hebt een dataset met leverancierslocaties, vastgelegd als tweeletterige landcodes (bijvoorbeeld NZ voor Nieuw-Zeeland). Je moet deze codes omzetten naar numerieke variabelen voor modeltraining, waarbij je (1) informatieverlies vermijdt en (2) de toename in dimensionaliteit minimaliseert. Welke transformatie voldoet aan deze vereisten?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Converteer de tweeletterige landcodes naar numerieke features met behulp van similarity encoding..
Waarom dit het antwoord is
Similarity encoding is de beste keuze omdat het categorische variabelen omzet in numerieke representaties op basis van hun onderlinge gelijkenis, wat informatieverlies minimaliseert en de dimensionaliteit beheersbaar houdt. Dit is vooral nuttig bij een groot aantal categorieën, zoals landcodes, waarbij elke code een unieke betekenis heeft. Het toevoegen van de volledige landnaam is geen numerieke transformatie. Het toewijzen aan continentnamen vermindert de dimensionaliteit, maar leidt tot aanzienlijk informatieverlies, omdat veel unieke landkenmerken verloren gaan. One-hot encoding creëert voor elke unieke landcode een nieuwe binaire kolom, wat bij veel landen leidt tot een zeer hoge dimensionaliteit en een sparse dataset, wat modeltraining kan bemoeilijken.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig