Ein bereinigter Datensatz enthält Merkmale, deren Skalen sich um Größenordnungen unterscheiden. Um die Vorhersagegenauigkeit in der Produktion zu maximieren, welche Abfolge von Schritten sollten Sie vor der Modellierung befolgen?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Teilen Sie den Datensatz in Trainings-, Validierungs- und Testsätze auf, skalieren Sie dann den Trainingssatz neu und wenden Sie dieselben Skalierungsparameter auf die Validierungs- und Testsätze an..
Warum dies die Antwort ist
Die Aufteilung des Datensatzes vor der Skalierung ist entscheidend, um Datenlecks zu vermeiden. Wenn Sie den gesamten Datensatz vor der Aufteilung skalieren, fließen Informationen aus den Validierungs- und Testsätzen in die Skalierungsparameter ein, die auf den Trainingssatz angewendet werden, was zu einer unrealistisch guten Leistung während des Trainings führen kann. Die Skalierung des Trainingssatzes und die Anwendung derselben Parameter auf die Validierungs- und Testsätze simuliert, wie das Modell neue, ungesehene Daten in der Produktion verarbeiten würde. Zufälliges Sampling ist nicht die primäre Lösung für Skalierungsprobleme. Die unabhängige Skalierung jedes Satzes würde ebenfalls zu Datenlecks führen, da die Skalierungsparameter für jeden Satz separat berechnet würden, anstatt die aus dem Trainingssatz gelernten zu verwenden.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich