Ein ML-Ingenieur trainiert ein logistisches Regressionsmodell, um die Abwanderung von Abonnenten vorherzusagen. Der Datensatz enthält zwei kategoriale String-Features: location (3 verschiedene Kategorien) und job_seniority_level (mehr als 10 verschiedene Kategorien). Wie sollten diese Features für das Modell vorverarbeitet werden?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: One-Hot-Encoding für location verwenden. Ordinal-Encoding für job_seniority_level verwenden..
Warum dies die Antwort ist
Die korrekte Antwort ist, One-Hot-Encoding für location und Ordinal-Encoding für jobsenioritylevel zu verwenden. location ist ein kategoriales Feature mit 3 verschiedenen Kategorien. Da es keine inhärente Reihenfolge zwischen den Standorten gibt, ist One-Hot-Encoding die geeignete Methode, um diese nominalen Kategorien in ein numerisches Format umzuwandeln, ohne eine künstliche Ordnung zu implizieren. jobsenioritylevel hat mehr als 10 verschiedene Kategorien, die typischerweise eine natürliche Reihenfolge oder Hierarchie aufweisen (z.B. Junior, Mid-Level, Senior). Ordinal-Encoding ist hier passend, da es diese Reihenfolge beibehält und das Modell davon profitieren kann. One-Hot-Encoding wäre bei über 10 Kategorien ineffizient und würde zu einer sehr hohen Dimensionalität führen. Die anderen Optionen sind weniger geeignet: Tokenisierung ist eher für Textdaten gedacht. Binnierung (Binning) wird verwendet, um kontinuierliche Daten in diskrete Intervalle zu gruppieren, nicht für kategoriale String-Features. Standard-Skalierung wird für numerische Features angewendet, um deren Werte zu normalisieren, nicht für kategoriale String-Features.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich