Ein ML-Ingenieur muss eine Pipeline erstellen, die Amazon Athena für zwei Workloads verwendet: groß angelegte Batch-Transformationen und Modelltraining sowie nahezu echtzeitnahe Abfragen mit geringer Latenz für Inferenz und Analysen. Welches Dateiformat erzeugt die NIEDRIGSTE Latenz sowohl für die Batch- als auch für die nahezu echtzeitnahe Verarbeitung?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Apache Parquet.
Warum dies die Antwort ist
Apache Parquet ist ein spaltenorientiertes Dateiformat, das für die analytische Abfrage großer Datensätze optimiert ist. Es bietet eine effiziente Komprimierung und Codierung, was zu einer geringeren Datengröße und schnelleren Abfragen führt. Dies ist vorteilhaft für Batch-Transformationen und Modelltraining, da weniger Daten gelesen werden müssen. Gleichzeitig ermöglicht die spaltenorientierte Speicherung Athena, nur die benötigten Spalten zu lesen, was die Abfragelatenz für Near-Realtime-Anwendungsfälle wie Inferenz und Analysen erheblich reduziert. CSV ist ein zeilenorientiertes Format ohne Schema, das ineffizient für analytische Abfragen ist, da alle Daten gelesen werden müssen. Nested JSON und Deserialized JSON sind ebenfalls zeilenorientiert und erfordern oft eine aufwendigere Verarbeitung und höhere Latenz beim Parsen, insbesondere bei großen Datensätzen und komplexen Strukturen.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich