Een ML-engineer traint een logistisch regressiemodel om abonnementsverloop te voorspellen. De dataset bevat twee categorische string-features: location (3 verschillende categorieën) en job_seniority_level (meer dan 10 verschillende categorieën). Hoe moeten deze features worden voorbewerkt voor het model?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik one-hot encoding voor location. Gebruik ordinale codering voor job_seniority_level..
Waarom dit het antwoord is
One-hot encoding is geschikt voor de 'location'-feature omdat deze een klein aantal (3) nominale categorieën heeft. Dit voorkomt dat het model een onterechte ordinale relatie tussen locaties aanneemt. Ordinale codering is de beste keuze voor 'jobsenioritylevel' omdat er een inherente volgorde of rangorde is in de senioriteitsniveaus (bijv. junior < medior < senior). Dit stelt het model in staat om deze volgorde te leren. Tokenisatie is meer voor tekstverwerking. Binning en standaard schaling zijn niet geschikt voor categorische string-features; standaard schaling is voor numerieke features.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig