Sie müssen eine explorative Datenanalyse (EDA) für einen Petabyte-großen Datensatz durchführen, ohne die Cluster-Infrastruktur verwalten zu müssen, nur für die ausgeführten Abfragen zu bezahlen und die Analyse in Python aus einem Jupyter-Notebook heraus zu schreiben. Welche Lösung erfüllt diese Anforderungen?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Führen Sie Apache Spark aus Amazon Athena heraus aus..
Warum dies die Antwort ist
Die korrekte Antwort ist, Apache Spark aus Amazon Athena heraus auszuführen. Amazon Athena ist ein interaktiver Abfragedienst, der es Ihnen ermöglicht, Petabyte an Daten direkt in Amazon S3 mit Standard-SQL zu analysieren, ohne Server verwalten zu müssen. Die Integration von Spark mit Athena ermöglicht es, komplexe Datenanalysen und EDA in Python (über Jupyter Notebooks in SageMaker Studio) auf großen Datensätzen durchzuführen, wobei Sie nur für die ausgeführten Abfragen bezahlen. Apache Spark aus Amazon SageMaker heraus auszuführen (ohne Athena) würde die Verwaltung einer Spark-Umgebung erfordern, was den Anforderungen widerspricht. Apache Spark auf einem selbst bereitgestellten Amazon EMR-Cluster zu betreiben, würde die Verwaltung der Cluster-Infrastruktur erfordern. Die Integration von Apache Spark mit Amazon Redshift ist zwar möglich, aber Redshift ist ein Data Warehouse und nicht primär für die explorative Analyse von Petabyte-großen Rohdaten in S3 konzipiert, ohne die zugrunde liegende Infrastruktur zu verwalten.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich