Ein Ingenieur findet mit SageMaker Data Wrangler ein kategoriales Text-Feature mit Tausenden von leicht unterschiedlichen Werten, die durch Rechtschreibfehler verursacht wurden. Welche Kodierungsmethode sollte verwendet werden, damit das verarbeitete Feature für die Klassifizierung genutzt werden kann?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verwenden Sie Ähnlichkeitskodierung, um ähnlich geschriebene Kategorien zu gruppieren und darzustellen..
Warum dies die Antwort ist
Ähnlichkeitskodierung ist die beste Methode, da sie darauf ausgelegt ist, ähnliche, aber nicht identische kategoriale Werte zu gruppieren, was bei Rechtschreibfehlern entscheidend ist. Dies reduziert die hohe Kardinalität und ermöglicht es dem Modell, Muster zu erkennen, die sonst durch die vielen leicht unterschiedlichen Werte verborgen wären. Ordinale Kodierung ist ungeeignet, da sie eine Reihenfolge zwischen Kategorien impliziert, die hier nicht existiert. One-Hot-Kodierung würde bei Tausenden von einzigartigen Werten zu einer extrem breiten und spärlichen Feature-Matrix führen, was die Modellleistung beeinträchtigt. Zielkodierung ist nicht primär für die Behebung von Rechtschreibfehlern gedacht, sondern um Kategorien basierend auf der Zielvariablen zu kodieren, was hier nicht das Hauptproblem löst.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich