Sie haben IoT-Bodensensordaten in einer 10 GB großen Amazon DynamoDB-Tabelle und Wetterereignisdaten als 5 GB große JSON-Dateien in Amazon S3. Sie möchten diesen kombinierten Datensatz vorbereiten, um ein Amazon SageMaker-Modell mit dem geringsten Verwaltungsaufwand zu trainieren. Welcher Ansatz erreicht die erforderliche Transformation am besten?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Führen Sie AWS Glue Crawler aus, um die Daten zu katalogisieren. Erstellen Sie einen AWS Glue ETL-Job, der die DynamoDB- und S3-Datensätze zusammenführt und die zusammengeführte Ausgabe als CSV-Dateien in Amazon S3 schreibt..
Warum dies die Antwort ist
Dieser Ansatz ist optimal, da AWS Glue Crawler automatisch Schemata für die DynamoDB- und S3-Daten erkennt und im Glue Data Catalog speichert, was den Verwaltungsaufwand reduziert. Ein AWS Glue ETL-Job kann dann diese Daten effizient zusammenführen und die Ausgabe direkt in S3 als CSV-Dateien schreiben, was ein gängiges Format für die SageMaker-Modellschulung ist. Die Option mit Amazon EMR erfordert mehr Verwaltungsaufwand für den Cluster. Die Option mit Amazon Redshift ist unnötig, da die Daten nur für die Modellschulung vorbereitet und nicht für analytische Abfragen in einem Data Warehouse gespeichert werden müssen. Die Option mit DynamoDB Streams und Lambda ist für das Anhängen neuer Daten an bestehende Dateien in S3 ungeeignet und würde keine Zusammenführung der historischen Daten ermöglichen.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich