Ein ML-Ingenieur wird Amazon SageMaker Canvas verwenden, um ein Modell mit komplex strukturierten Daten zu trainieren, die in Amazon S3 gespeichert sind. Welches Dateiformat minimiert die Vorverarbeitungszeit für diese Daten?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Apache Parquet-Dateien.
Warum dies die Antwort ist
Apache Parquet ist ein spaltenorientiertes Dateiformat, das für die effiziente Speicherung und Abfrage großer Datensätze optimiert ist. Für SageMaker Canvas und ähnliche ML-Workloads minimiert es die Vorverarbeitungszeit, da es nur die für das Training relevanten Spalten laden muss. Dies reduziert die I/O-Vorgänge und den Speicherverbrauch erheblich. CSV-Dateien (auch komprimiert) sind zeilenorientiert, was bedeutet, dass das System die gesamte Zeile lesen muss, selbst wenn nur wenige Spalten benötigt werden. Dies erhöht die Vorverarbeitungszeit. JSON-Objekte, insbesondere gzip-komprimiert oder im JSONL-Format, sind ebenfalls zeilenorientiert und können aufgrund ihrer Textnatur und der Notwendigkeit des Parsens weniger effizient sein als Parquet für analytische oder ML-Workloads mit komplexen strukturierten Daten.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich