Ein Data Scientist muss etwa 500 GB historischer Bestandsdaten, die als CSV-Dateien in einem Amazon S3 Data Lake gespeichert sind, untersuchen. Er möchte SQL für die Untersuchung verwenden, und das Unternehmen möchte Kosten und operativen Aufwand minimieren. Welcher Ansatz erfüllt diese Anforderungen mit dem geringsten Betriebsmanagement?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: AWS Glue verwenden, um den S3-Bucket zu crawlen und den AWS Glue Data Catalog zu füllen, dann die Daten mit Amazon Athena abfragen..
Warum dies die Antwort ist
Die Verwendung von AWS Glue zum Crawlen des S3-Buckets und das Abfragen der Daten mit Amazon Athena ist die kostengünstigste und betrieblich am wenigsten aufwendige Lösung. Athena ist ein serverloser Abfragedienst, der es ermöglicht, Daten direkt in S3 mit Standard-SQL abzufragen, ohne Infrastruktur bereitstellen oder verwalten zu müssen. AWS Glue Data Catalog dient als zentrales Metadaten-Repository. Das Bereitstellen eines Amazon EMR-Clusters oder Amazon Redshift-Clusters würde zusätzliche Kosten und erheblichen Betriebsaufwand für die Cluster-Verwaltung verursachen, was den Anforderungen an minimale Kosten und operativen Aufwand widerspricht. Obwohl Redshift externe Tabellen unterstützt, ist die Bereitstellung des Clusters selbst mit Management-Kosten verbunden.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich