Mithilfe von SageMaker Clarify entdeckte ein ML-Spezialist, dass die Trainingsdaten merklich weniger Beispiele für Kunden im Alter von 40–55 Jahren enthalten als für andere Altersgruppen. Welche Art von Pretraining-Datenverzerrung stellt diese Beobachtung dar?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Class imbalance (CI).
Warum dies die Antwort ist
Die Beobachtung, dass die Trainingsdaten deutlich weniger Beispiele für Kunden in der Altersgruppe von 40–55 Jahren enthalten als für andere Altersgruppen, ist ein klassisches Beispiel für Klassenungleichgewicht (Class Imbalance). Dies tritt auf, wenn eine oder mehrere Klassen in einem Datensatz im Vergleich zu anderen Klassen unterrepräsentiert sind. Difference in proportions of labels (DPL) misst die Ungleichheit der Label-Verteilung zwischen verschiedenen Gruppen, nicht die absolute Anzahl der Beispiele einer Gruppe. Conditional demographic disparity (CDD) bewertet die Fairness eines Modells basierend auf der Vorhersagegenauigkeit oder anderen Metriken über verschiedene demografische Gruppen hinweg, was nach dem Training relevant ist. Der Kolmogorov–Smirnov (KS) test ist ein statistischer Test zur Messung der Ähnlichkeit von Verteilungen, aber keine Art von Datenverzerrung selbst.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich