Ein Unternehmen erstellt eine Analyseplattform mit Amazon S3 als Data Lake und Amazon Redshift als Data Warehouse. Das Unternehmen beabsichtigt, Amazon Redshift Spectrum zu verwenden, um S3-Daten abzufragen. Welche Aktionen führen zur SCHNELLSTEN Abfrageleistung? (Wählen Sie zwei aus.)
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verwenden Sie ein spaltenbasiertes Speicherdateiformat., Partitionieren Sie die Daten basierend auf den häufigsten Abfrageprädikaten..
Warum dies die Antwort ist
Die Verwendung eines spaltenbasierten Speicherdateiformats wie Parquet oder ORC ist vorteilhaft, da Redshift Spectrum nur die benötigten Spalten liest, was die Datenmenge reduziert und die Abfrageleistung verbessert. Die Partitionierung der Daten basierend auf häufig verwendeten Abfrageprädikaten (z. B. Datum oder Region) ermöglicht es Redshift Spectrum, nur die relevanten Partitionen zu scannen, anstatt den gesamten Datensatz, was die Abfragezeit erheblich verkürzt. Das Komprimieren von Dateien auf 1 GB bis 5 GB ist zwar gut, aber gzip ist zeilenbasiert und nicht so effizient wie spaltenbasierte Formate. Das Aufteilen von Daten in sehr kleine Dateien (unter 10 KB) erhöht den Overhead und verlangsamt Abfragen. Nicht teilbare Dateiformate sind ungünstig, da Redshift Spectrum die parallele Verarbeitung nicht optimal nutzen kann.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich