Ein ML-Ingenieur muss Tausende vorhandener CSV-Dateien sowie neue CSV-Uploads verarbeiten, die in einem zentralen S3-Bucket gespeichert sind. Alle CSVs haben das gleiche Spaltenlayout und enthalten eine Transaktionsdatumsspalte, die abgefragt werden muss. Welche Lösung liefert dies mit dem geringsten Betriebsaufwand?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Führen Sie eine Amazon Athena CREATE TABLE AS SELECT (CTAS) aus, um eine Tabelle (partitioniert oder gefiltert nach Transaktionsdatum) über die S3-Daten zu erstellen, und fragen Sie dann diese Tabelle ab..
Warum dies die Antwort ist
Die Amazon Athena CTAS-Lösung ist die effizienteste Option. Athena ermöglicht das direkte Abfragen von Daten in S3 mit SQL, ohne dass eine Infrastruktur verwaltet werden muss. Durch das Erstellen einer partitionierten Tabelle nach Transaktionsdatum kann Athena die Abfrageleistung erheblich verbessern und die Kosten senken, da nur die relevanten Daten gescannt werden. CTAS erstellt eine neue Tabelle basierend auf den Abfrageergebnissen, was eine optimierte Datenstruktur für zukünftige Abfragen ermöglicht. Die Option mit S3 Object Lambda ist komplexer und weniger effizient für Ad-hoc-Abfragen großer Datensätze. Die AWS Glue-Lösung ist für ETL-Aufgaben geeignet, aber für einfache Abfragen mit geringstem Betriebsaufwand überdimensioniert. Kinesis Data Firehose ist für das Streaming von Daten konzipiert, nicht für das Abfragen vorhandener statischer Dateien, und würde hier unnötigen Aufwand verursachen.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich