Sie erhalten eine 50 MB große Apache Parquet-Datei für ein Betrugserkennungsmodell, die mehrere korrelierte, unnötige Spalten enthält. Was ist der einfachste Weg, diese Spalten aus der Datei zu entfernen?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Erstellen Sie einen Datenfluss in SageMaker Data Wrangler und fügen Sie einen Transformationsschritt hinzu, um die nicht benötigten Spalten zu löschen..
Warum dies die Antwort ist
SageMaker Data Wrangler bietet eine visuelle Schnittstelle zur Datenaufbereitung. Sie können einen Datenfluss erstellen und einen Transformationsschritt hinzufügen, um unnötige Spalten einfach zu löschen, ohne Code schreiben zu müssen. Dies ist der einfachste Weg, da er für die Datenvorverarbeitung optimiert ist. Das Herunterladen der Datei und die Verwendung eines Python-Skripts ist umständlicher und nicht skalierbar. Ein Apache Spark-Job auf Amazon EMR ist für größere Datensätze oder komplexere Transformationen gedacht und für diese Aufgabe überdimensioniert. Ein SageMaker-Verarbeitungsjob erfordert das Schreiben von Code und ist weniger intuitiv als Data Wrangler für einfache Spaltenentfernungen.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich