Ein Dateningenieur muss einmalig Apache Parquet-Objekte in einem S3-Bucket lesen und dabei nur eine einzige Spalte extrahieren. Welche Option erreicht dies mit minimalem Betriebsaufwand?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verwenden Sie S3 Select, um eine SQL SELECT-Anweisung zu schreiben, um die erforderliche Spalte aus den S3-Objekten abzurufen..
Warum dies die Antwort ist
S3 Select ermöglicht es Ihnen, SQL-Abfragen direkt auf Daten in S3-Objekten auszuführen, ohne das gesamte Objekt herunterladen zu müssen. Dies ist die effizienteste Methode, um eine einzelne Spalte aus Parquet-Dateien zu extrahieren, da es den Datenübertragungsaufwand minimiert und keinen zusätzlichen Server oder Dienst zur Verarbeitung benötigt. Die Verwendung einer Lambda-Funktion mit Pandas würde bedeuten, dass die gesamte Parquet-Datei in den Lambda-Speicher geladen wird, was bei großen Dateien ineffizient und teuer sein kann. AWS Glue DataBrew ist ein Datenaufbereitungstool, das für komplexere Transformationen gedacht ist und für eine einfache Spaltenextraktion überdimensioniert wäre. Die Kombination aus AWS Glue Crawler und Amazon Athena ist zwar eine gute Option für wiederkehrende Abfragen auf strukturierten Daten, erfordert aber die Einrichtung eines Crawlers und die Erstellung eines Schemas in Athena, was für eine einmalige Extraktion einen höheren Betriebsaufwand darstellt als S3 Select.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich